class sklea. ansemble. GradientBoostingRegressor (* , loss = 'squared_error' , Leaing_rate = 0. 1 , n_estimators = 100 , subsample = 1. 0 , criterion = 'friedman_mse' , min_samples_split = 2 , min_samples_, min_samples_, 0, min_samples_, 0. th = 3، min_impurity_decrease = 0. 0، init =هیچ، حالت_تصادفی = هیچ، max_features = هیچ، آلفا = 0. 9، پرمخاطب = 0، max_leaf_nodes = هیچ، warm_start = نادرست، validation_fraction = 0. 1، n_iter_no_change = هیچ، 0. p0_1 = هیچ، ¶
تقویت گرادیان برای رگرسیون.
این برآوردگر یک مدل افزودنی را به صورت مرحله ای رو به جلو می سازد. بهینه سازی توابع تلفات قابل تمایز دلخواه را امکان پذیر می کند. در هر مرحله یک درخت رگرسیون بر روی گرادیان منفی تابع ضرر داده شده متناسب است.
sklea.ensemble.HistGradientBoostingRegressor is a much faster variant of this algorithm for intermediate datasets ( n_samples>= 10_000).
در راهنمای کاربر بیشتر بخوانید.
عملکرد از دست دادن بهینه سازی شود."squared_error" به مربع خطای رگرسیون اشاره دارد.'absolute_error' به خطای مطلق رگرسیون اشاره دارد و یک تابع زیان قوی است."huber" ترکیبی از این دو است.«چک» اجازه رگرسیون چندک را می دهد (از آلفا برای مشخص کردن چندک استفاده کنید).
Leaing_rate float, default=0. 1
نرخ یادگیری سهم هر درخت را با Lea_rate کاهش می دهد. بین نرخ_آموزش و n_ تخمین گر تعادل وجود دارد. مقادیر باید در محدوده [0. 0، inf) باشد.
n_estimators int، پیش فرض=100
تعداد مراحل تقویتی برای انجام. افزایش گرادیان نسبتاً قوی است تا بیش از حد مناسب باشد، بنابراین تعداد زیاد معمولاً عملکرد بهتری را به همراه دارد. مقادیر باید در محدوده [1, inf) باشد.
زیر نمونه شناور، پیش فرض = 1. 0
کسری از نمونه هایی که برای برازش دانش آموزان پایه استفاده می شود. اگر کوچکتر از 1. 0 باشد، این منجر به افزایش گرادیان تصادفی می شود. نمونه فرعی با پارامتر n_estimators تعامل دارد. انتخاب نمونه فرعی<1.0 leads to a reduction of variance and an increase in bias. Values must be in the range (0.0, 1.0] .
معیار، پیش فرض='friedman_mse'
عملکرد اندازه گیری کیفیت یک تقسیم. معیارهای پشتیبانی شده عبارتند از "friedman_mse" برای میانگین مربعات خطا با نمره بهبود توسط فریدمن، "squared_error" برای میانگین مربعات خطا. مقدار پیش فرض «friedman_mse» معمولاً بهترین است زیرا در برخی موارد می تواند تقریب بهتری ارائه دهد.
جدید در نسخه 0. 18.
min_samples_split int یا float، پیش فرض=2
حداقل تعداد نمونه مورد نیاز برای تقسیم یک گره داخلی:
در نسخه 0. 18 تغییر یافته است: مقادیر شناور اضافه شده برای کسری.
min_samples_leaf int یا float ، پیش فرض = 1
حداقل تعداد نمونه های مورد نیاز در یک گره برگ است. یک نقطه تقسیم در هر عمق فقط در صورتی در نظر گرفته می شود که حداقل نمونه های آموزش min_samples_leaf در هر یک از شاخه های چپ و راست را ترک کند. این ممکن است تأثیر صاف کردن مدل ، به ویژه در رگرسیون داشته باشد.
در نسخه 0. 18 تغییر یافته است: مقادیر شناور اضافه شده برای کسری.
min_weight_fraction_leaf float ، پیش فرض = 0. 0
حداقل کسر وزنی از مجموع کل وزن ها (از تمام نمونه های ورودی) مورد نیاز در یک گره برگ است. نمونه ها در صورت عدم ارائه نمونه_ وزن ، دارای وزن برابر هستند. مقادیر باید در محدوده باشند [0. 0 ، 0. 5].
max_depth int یا هیچ یک ، پیش فرض = 3
حداکثر عمق برآوردگرهای رگرسیون فردی. حداکثر عمق تعداد گره های موجود در درخت را محدود می کند. این پارامتر را برای بهترین عملکرد تنظیم کنید. بهترین مقدار به تعامل متغیرهای ورودی بستگی دارد. اگر هیچ کدام ، گره ها تا زمانی که تمام برگها خالص نباشند یا تا زمانی که تمام برگها حاوی نمونه های min_samples_split باشند ، گسترش می یابند. اگر int ، مقادیر باید در محدوده باشد [1 ، Inf).
min_impurany_decrease float ، پیش فرض = 0. 0
اگر این تقسیم باعث کاهش ناخالصی بیشتر از یا مساوی با این مقدار شود ، یک گره تقسیم می شود. مقادیر باید در محدوده باشند [0. 0 ، Inf).
معادله کاهش ناخالصی وزنی به شرح زیر است:
N_T / N * (ناحانی - n_t_r / N_T * امنیت راست_ - n_t_l / N_T * Left_IMPURITY)
در جایی که n تعداد کل نمونه ها است ، N_T تعداد نمونه ها در گره فعلی است ، N_T_L تعداد نمونه های کودک چپ است و N_T_R تعداد نمونه های کودک سمت راست است.
در صورت تصویب نمونه_ وزن ، n ، n_t ، n_t_r و n_t_l همه به مبلغ وزنی مراجعه می کنند.
جدید در نسخه 0. 19.
برآوردگر اولیه یا "صفر" ، پیش فرض = هیچ
یک شیء برآوردگر که برای محاسبه پیش بینی های اولیه استفاده می شود. INIT باید تناسب و پیش بینی را ارائه دهد. اگر "صفر" باشد ، پیش بینی های اولیه اولیه روی صفر تنظیم می شود. به طور پیش فرض از یک ساختگی استفاده می شود ، یا میانگین ارزش هدف (برای از دست دادن = "squared_error") یا یک مقدار برای سایر تلفات.
Random_state int ، نمونه تصادفی یا هیچ کدام ، پیش فرض = هیچ
دانه تصادفی داده شده به هر برآوردگر درخت را در هر تکرار تقویت کننده کنترل می کند. علاوه بر این ، این کنترل تصادفی از ویژگی ها را در هر تقسیم کنترل می کند (برای جزئیات بیشتر به یادداشت ها مراجعه کنید). همچنین اگر N_ITER_NO_CHANGE هیچکدام نباشد ، تقسیم تصادفی داده های آموزش را کنترل می کند تا یک مجموعه اعتبار سنجی را بدست آورید. برای خروجی قابل تکرار در چندین تماس با عملکرد ، یک INT را عبور دهید. به واژه نامه مراجعه کنید.
max_features ، int یا float ، پیش فرض = هیچ
تعداد ویژگی هایی که باید هنگام جستجوی بهترین تقسیم در نظر بگیرید:
توجه: جستجوی تقسیم تا حداقل یک پارتیشن معتبر از نمونه های گره متوقف نمی شود ، حتی اگر نیاز به بازرسی مؤثر بیش از ویژگی های MAX_FEATURES داشته باشد.
شناور آلفا ، پیش فرض = 0. 9
آلفا کیک از عملکرد از دست دادن هوبر و عملکرد از دست دادن کمی. فقط در صورت از دست دادن = 'huber' یا از دست دادن = 'Quantile'. مقادیر باید در محدوده باشد (0. 0 ، 1. 0).
int int ، پیش فرض = 0
خروجی Verbose را فعال کنید. اگر 1 باشد ، یک بار پیشرفت و عملکرد را چاپ می کند (هرچه بیشتر درختان فرکانس پایین تر باشد). اگر بیشتر از 1 باشد ، پیشرفت و عملکرد را برای هر درخت چاپ می کند. مقادیر باید در محدوده باشند [0 ، Inf).
max_leaf_nodes int ، پیش فرض = هیچ
درختان را با max_leaf_nodes به بهترین شکل ممکن پرورش دهید. بهترین گره ها به عنوان کاهش نسبی در ناخالصی تعریف می شوند. مقادیر باید در محدوده باشند [2 ، Inf). اگر هیچ کدام ، تعداد نامحدود گره های برگ.
BOOL WARM_START ، پیش فرض = نادرست
هنگامی که روی True تنظیم شده اید ، از راه حل تماس قبلی استفاده کنید تا متناسب باشد و برآوردگرهای بیشتری را به گروه اضافه کنید ، در غیر این صورت ، فقط راه حل قبلی را پاک کنید. واژه نامه را ببینید.
اعتبار سنجی_فراح شناور ، پیش فرض = 0. 1
نسبت داده های آموزشی به عنوان اعتبار سنجی برای توقف زودرس تنظیم شده است. مقادیر باید در محدوده باشد (0. 0 ، 1. 0). فقط در صورتی که n_iter_no_change روی یک عدد صحیح تنظیم شده باشد ، استفاده می شود.
جدید در نسخه 0. 20.
n_iter_no_change int ، پیش فرض = هیچ
N_ITER_NO_CHANGE برای تصمیم گیری در مورد استفاده از توقف زود هنگام برای خاتمه آموزش در هنگام بهبود نمره اعتبار سنجی استفاده می شود. به طور پیش فرض برای غیرفعال کردن توقف زود هنگام به هیچ وجه تنظیم نشده است. اگر روی یک عدد تنظیم شود ، اندازه اعتبار سنجی داده های آموزش را به عنوان اعتبار سنجی اختصاص می دهد و آموزش را خاتمه می دهد وقتی که نمره اعتبارسنجی در تمام شماره های قبلی N_ITER_NO_CHANGE در حال بهبود نیست. مقادیر باید در محدوده باشند [1 ، Inf).
جدید در نسخه 0. 20.
float tol ، پیش فرض = 1e-4
تحمل برای توقف زودرس. هنگامی که ضرر حداقل برای تکرارهای N_ITER_NO_CHANGE (اگر روی یک شماره تنظیم شود) بهبود نمی یابد ، آموزش متوقف می شود. مقادیر باید در محدوده باشند [0. 0 ، Inf).
جدید در نسخه 0. 20.
شناور غیر منفی CCP_ALPHA ، پیش فرض = 0. 0
پارامتر پیچیدگی مورد استفاده برای حداقل هرس هزینه و انعطاف پذیری. زیر درخت با بزرگترین پیچیدگی هزینه که کوچکتر از CCP_ALPHA است انتخاب می شود. به طور پیش فرض ، هیچ گونه هرس انجام نمی شود. مقادیر باید در محدوده باشند [0. 0 ، Inf). برای جزئیات بیشتر هرس کمپانی هزینه را ببینید.
جدید در نسخه 0. 22.
ویژگی ها: ویژگی های_یمورس_ ndarray از شکل (n_features ،)
واردات ویژگی های مبتنی بر ناخالصی.
OOB_IMPROVEMENT_ NDARRAY از شکل (n_estimators ،)
بهبود ضرر (= انحراف) در نمونه های خارج از کیسه نسبت به تکرار قبلی. OOB_IMProvement_ [0] بهبود از دست دادن مرحله اول نسبت به برآوردگر اولیه است. فقط در صورت نمونه در دسترس است<1.0
train_score_ ndarray از شکل (n_estimators ،)
نمره I-Th Train_Score_ [i] انحراف (= از دست دادن) مدل در تکرار I در نمونه در کیف است. اگر subsample == 1 این انحراف در داده های آموزش است.
ضرر از دست دادن
شیء ضرر بتن.
از نسخه 1. 1 کاهش یافته است: Attribute Loss_ در نسخه 1. 1 کاهش یافته و در 1. 3 حذف می شود.
برآوردگر init_
برآوردگر پیش بینی های اولیه را ارائه می دهد. از طریق آرگومان اولیه یا ضرر تنظیم کنید. init_estimator.
برآوردگرها_ ndarray از تصمیم گیری در مورد شکل (n_estimators ، 1)
مجموعه زیر تخمین های فرعی.
n_estimators_ int
تعداد برآوردگرها که توسط توقف زود هنگام انتخاب شده است (اگر N_ITER_NO_CHANGE مشخص شده است). در غیر این صورت روی n_estimators تنظیم شده است.
n_features_in_ int
تعداد ویژگی های دیده شده در هنگام تناسب.
جدید در نسخه 0. 24.
feature_names_in_ ndarray از شکل (n_features_in_ ،)
نام ویژگی های دیده شده در هنگام تناسب. فقط زمانی تعریف می شود که X دارای نام های ویژگی است که همه رشته ها هستند.
جدید در نسخه 1. 0.
max_features_ int
مقدار استنباط شده max_features.
درخت طبقه بندی شیب مبتنی بر هیستوگرام.
رگرر درخت تصمیم.
یک رگرننده جنگل تصادفی.
این ویژگی ها همیشه در هر تقسیم به طور تصادفی مجاز هستند. بنابراین ، بهترین تقسیم یافته ممکن است حتی با همان داده های آموزشی و max_features = n_features متفاوت باشد ، اگر بهبود معیار برای چندین شکاف ذکر شده در هنگام جستجوی بهترین تقسیم یکسان باشد. برای به دست آوردن یک رفتار قطعی در حین اتصالات ، تصادفی_ستات باید ثابت شود.
J. Friedman ، تقریب عملکرد حریص: یک دستگاه تقویت شیب ، سالنامه های آمار ، جلد. 29 ، شماره 5 ، 2001.
T. Hastie ، R. Tibshirani و J. Friedman. عناصر یادگیری آماری ed. 2 ، اسپرینگر ، 2009.
>>> از جانب sklea. datasets وارد كردن make_regression >>> از جانب sklea. ensemble وارد كردن شیب دار >>> از جانب sklea. model_selection وارد كردن train_test_split >>> X, y = make_regression(state تصادفی=0) >>> x_train, x_test, y_train, y_test آزمون = train_test_split( . X, y, state تصادفی=0) >>> مجدداً = شیب دار(state تصادفی=0) >>> مجدداً.مناسب(x_train, y_train) GradientBoostingRegressor (Random_state = 0) >>> مجدداً.پیش بینی(x_test[1:2]) آرایه ([-61.]) >>> مجدداً.نمره(x_test, y_test آزمون) 0. 4.
درختان موجود در گروه را به X بمالید ، شاخص های برگ برگشتی را برگردانید.
متناسب (x ، y [، sample_weight ، مانیتور])
متناسب با مدل تقویت شیب.
پارامترهایی را برای این برآوردگر دریافت کنید.
پیش بینی هدف رگرسیون برای X.
امتیاز (x ، y [، sample_weight])
ضریب تعیین پیش بینی را برگردانید.
پارامترهای این برآوردگر را تنظیم کنید.
هدف رگرسیون را در هر مرحله برای X پیش بینی کنید.
درختان موجود در گروه را به X بمالید ، شاخص های برگ برگشتی را برگردانید.
جدید در نسخه 0. 17.
پارامترها: x از شکل (n_samples ، n_features)
نمونه های ورودیدر داخل ، dtype آن به dtype = np. float32 تبدیل می شود. اگر یک ماتریس پراکنده ارائه شود ، به یک CSR_MATRIX پراکنده تبدیل می شود.
بازگشت: x_leaves شکل مانند شکل (n_samples ، n_estimators)
برای هر DataPoint X در x و برای هر درخت در گروه ، شاخص برگ x را در هر برآوردگر به پایان می رساند.
برآوردگر برای رشد گروه استفاده می شود.
واردات ویژگی های مبتنی بر ناخالصی.
هرچه ویژگی بالاتر باشد. اهمیت یک ویژگی به عنوان کاهش کل (عادی) معیار ارائه شده توسط آن ویژگی محاسبه می شود. همچنین به عنوان اهمیت جینی نیز شناخته می شود.
هشدار: واردات ویژگی های مبتنی بر ناخالصی می تواند برای ویژگی های کاردینال بالا (بسیاری از مقادیر منحصر به فرد) گمراه کننده باشد. به Sklea. Inspection. PermUTION_IMPORTANCE به عنوان یک گزینه جایگزین مراجعه کنید.
بازگشت: feature_importances_ ndarray از شکل (n_features ،)
مقادیر این مبلغ آرایه به 1 ، مگر اینکه همه درختان درختان تک گره ای باشند که فقط از گره ریشه تشکیل شده اند ، در این صورت آرایه ای از صفرها خواهد بود.
متناسب با مدل تقویت شیب.
پارامترها: x از شکل (n_samples ، n_features)
نمونه های ورودیدر داخل ، آن را به dtype = np. float32 تبدیل می کند و اگر یک ماتریس پراکنده به یک csr_matrix پراکنده ارائه شود.
y شکل آرایه مانند شکل (n_samples ،)
مقادیر هدف (رشته ها یا عدد صحیح در طبقه بندی ، اعداد واقعی در رگرسیون) برای طبقه بندی ، برچسب ها باید با کلاس ها مطابقت داشته باشند.
Sample_weight Array مانند شکل (n_samples) ، پیش فرض = هیچ
وزن نمونه. اگر هیچ کدام ، نمونه ها به همان اندازه وزن دارند. شکاف هایی که گره های کودک را با صفر خالص یا وزن منفی ایجاد می کنند ، هنگام جستجوی شکاف در هر گره ، نادیده گرفته می شوند. در مورد طبقه بندی ، شکاف ها نیز نادیده گرفته می شوند اگر منجر به هر کلاس واحد شود که وزن منفی در هر دو گره کودک داشته باشد.
نظارت بر تماس ، پیش فرض = هیچ
مانیتور پس از هر تکرار با تکرار فعلی ، مرجع برآوردگر و متغیرهای محلی _FIT_STAGES به عنوان آرگومان های کلمه کلیدی قابل تماس (I ، خود ، افراد محلی ()) خوانده می شود. در صورت بازگشت قابل تماس ، روش اتصالات متوقف شده است. این مانیتور می تواند برای موارد مختلفی از جمله محاسبه تخمین های نگهدارنده ، توقف زود هنگام ، مدل درون نگر و عکس فوری استفاده شود.
بازگشت: خود شیء
پارامترهایی را برای این برآوردگر دریافت کنید.
پارامترها: بول عمیق ، پیش فرض = درست است
در صورت صحت ، پارامترهای این برآوردگر و حاوی زیربناهای حاوی برآوردگر را برمی گرداند.
بازگشت: پارامترها دیکته
نام پارامترها به مقادیر آنها نقشه برداری شده است.
پیش بینی هدف رگرسیون برای X.
پارامترها: x از شکل (n_samples ، n_features)
نمونه های ورودیدر داخل ، آن را به dtype = np. float32 تبدیل می کند و اگر یک ماتریس پراکنده به یک csr_matrix پراکنده ارائه شود.
بازگشت: y ndarray از شکل (n_samples ،)
مقادیر پیش بینی شده
ضریب تعیین پیش بینی را برگردانید.
ضریب تعیین (r^2 ) به عنوان ((1 - frac) ) تعریف شده است ، جایی که (u ) جمع باقیمانده مربع ها ((y_true - y_pred) ** 2) . sum () و (v ) مجموع مربع ها ((y_true - y_true. mean ()) ** 2) . sum () است. بهترین نمره ممکن 1. 0 است و می تواند منفی باشد (زیرا مدل می تواند به طور خودسرانه بدتر باشد). یک مدل ثابت که همیشه مقدار مورد انتظار Y را پیش بینی می کند ، با توجه به ویژگی های ورودی ، نمره (R^2 ) 0. 0 را بدست می آورد.
پارامترها: X شکل شکل (N_Samples ، n_features)
نمونه های آزمایشبرای برخی از برآوردگرها این ممکن است یک ماتریس هسته پیش ساخته یا لیستی از اشیاء عمومی به جای آن با شکل (n_samples ، n_samples_fitted) باشد ، جایی که n_samples_fitted تعداد نمونه های مورد استفاده در اتصالات برای برآوردگر است.
y آرایه مانند شکل (n_samples ،) یا (n_samples ، n_outputs)
مقادیر واقعی برای x.
Sample_weight Array مانند شکل (n_samples) ، پیش فرض = هیچ
بازگشت: نمره شناور
(r^2 ) از self. predict (x) W. R. T. y
نمره (r^2 ) هنگام فراخوانی نمره در یک رگرسیون از MultiOutput = 'unioford_avenal' از نسخه 0. 23 استفاده می شود تا با مقدار پیش فرض R2_Score سازگار باشد. این بر روش نمره همه رگرسیونرهای چند منظوره (به جز MultioutPutregressor) تأثیر می گذارد.
پارامترهای این برآوردگر را تنظیم کنید.
این روش بر روی برآوردگرهای ساده و همچنین روی اشیاء تو در تو کار می کند (مانند خط لوله). دومی پارامترهای فرم __ را دارد تا بتوانید هر مؤلفه یک شیء تو در تو را به روز کنید.
پارامترها: ** پارامترها
بازده: نمونه برآوردگر خود
هدف رگرسیون را در هر مرحله برای X پیش بینی کنید.
این روش اجازه می دهد تا بعد از هر مرحله ، نظارت (یعنی تعیین خطا در مجموعه آزمایش).
پارامترها: x از شکل (n_samples ، n_features)
نمونه های ورودیدر داخل ، آن را به dtype = np. float32 تبدیل می کند و اگر یک ماتریس پراکنده به یک csr_matrix پراکنده ارائه شود.
بازده: ژنراتور y ndarray از شکل (n_samples ،)
مقدار پیش بینی شده از نمونه های ورودی.
پلتفرم های تجاری...
برچسب :
نویسنده : مریم کاویانی
بازدید : <-PostHit->