Regression

مكتمل

نصيحة

راجع علامة التبويب النص والصور لمزيد من التفاصيل!

يتم تدريب نماذج الانحدار على التنبؤ بقيم التسمية الرقمية استنادا إلى بيانات التدريب التي تتضمن كل من الميزات والتسميات المعروفة. تتضمن عملية تدريب نموذج الانحدار (أو في الواقع ، أي نموذج تعلم آلي خاضع للإشراف) تكرارات متعددة تستخدم فيها خوارزمية مناسبة (عادة مع بعض الإعدادات ذات المعلمات) لتدريب نموذج وتقييم الأداء التنبؤي للنموذج وتحسين النموذج عن طريق تكرار عملية التدريب باستخدام خوارزميات ومعلمات مختلفة حتى تحقق مستوى مقبولا من الدقة التنبؤية.

رسم تخطيطي يوضح عملية تدريب تقييم نموذج خاضع للإشراف.

يوضح الرسم البياني أربعة عناصر رئيسية لعملية التدريب لنماذج التعلم الآلي الخاضعة للإشراف:

  1. قم بتقسيم بيانات التدريب (عشوائيا) لإنشاء مجموعة بيانات لتدريب النموذج مع منع مجموعة فرعية من البيانات التي ستستخدمها للتحقق من صحة النموذج المدرب.
  2. استخدم خوارزمية لملاءمة بيانات التدريب مع نموذج. في حالة نموذج الانحدار ، استخدم خوارزمية انحدار مثل الانحدار الخطي.
  3. استخدم بيانات التحقق من الصحة التي احتفظت بها لاختبار النموذج عن طريق التنبؤ بالتسميات للميزات.
  4. قارن التسميات الفعلية المعروفة في مجموعة بيانات التحقق من الصحة بالتسميات التي تنبأ بها النموذج. ثم قم بتجميع الاختلافات بين قيم التسمية المتوقعةوالفعلية لحساب مقياس يشير إلى مدى دقة النموذج المتوقع لبيانات التحقق.

بعد كل تدريب والتحقق من صحة التكرار وتقييمه ، يمكنك تكرار العملية باستخدام خوارزميات ومعلمات مختلفة حتى يتم تحقيق مقياس تقييم مقبول.

مثال - الانحدار

دعنا نستكشف الانحدار بمثال مبسط سنقوم فيه بتدريب نموذج على التنبؤ بتسمية رقمية (y) بناء على قيمة ميزة واحدة (x). تتضمن معظم السيناريوهات الحقيقية قيم ميزات متعددة ، مما يضيف بعض التعقيد. لكن المبدأ هو نفسه.

على سبيل المثال ، دعنا نلتزم بسيناريو مبيعات الآيس كريم الذي ناقشناه سابقا. بالنسبة لميزتنا ، سنأخذ في الاعتبار درجة الحرارة (لنفترض أن القيمة هي درجة الحرارة القصوى في يوم معين) ، والملصق الذي نريد تدريب نموذج للتنبؤ به هو عدد الآيس كريم الذي تم بيعه في ذلك اليوم. سنبدأ ببعض البيانات التاريخية التي تتضمن سجلات درجات الحرارة اليومية (x) ومبيعات الآيس كريم (y):

رسم تخطيطي لمقياس حرارة. رسم تخطيطي للآيس كريم.
درجة الحرارة (x) مبيعات الآيس كريم (ذ)
51 1
52 0
67 14
65 14
70 23
69 20
72 23
75 26
73 22
81 30
78 26
83 36

تدريب نموذج الانحدار

سنبدأ بتقسيم البيانات واستخدام مجموعة فرعية منها لتدريب نموذج. فيما يلي مجموعة بيانات التدريب:

درجة الحرارة (x) مبيعات الآيس كريم (ذ)
51 1
65 14
69 20
72 23
75 26
81 30

للحصول على نظرة ثاقبة لكيفية ارتباط هذين القيمين x و y ببعضهما البعض ، يمكننا رسمهما كإحداثيات على طول محورين ، مثل هذا:

رسم تخطيطي لمخطط مبعثر يوضح x و y.

نحن الآن جاهزون لتطبيق خوارزمية على بيانات التدريب الخاصة بنا وملاءمتها مع دالة تطبق عملية على x لحساب y. إحدى هذه الخوارزميات هي الانحدار الخطي ، والذي يعمل عن طريق اشتقاق دالة تنتج خطا مستقيما من خلال تقاطعات قيم x و y مع تقليل متوسط المسافة بين الخط والنقاط المرسومة ، مثل هذا:

رسم تخطيطي لمخطط المبعثر مع إضافة خط انحدار.

الخط هو تمثيل مرئي للدالة التي يصف فيها ميل الخط كيفية حساب قيمة y لقيمة معينة من x. يعترض الخط المحور x عند 50 ، لذلك عندما يكون x 50 ، y يساوي 0. كما ترون من علامات المحور في المخطط ، ينحدر الخط بحيث تؤدي كل زيادة قدرها 5 على طول المحور x إلى زيادة قدرها 5 لأعلى المحور y ؛ لذلك عندما يكون x 55 ، y هو 5 ؛ عندما يكون x هو 60 ، فإن y يساوي 10 ، وهكذا. لحساب قيمة y لقيمة معينة من x ، تطرح الدالة ببساطة 50. بمعنى آخر ، يمكن التعبير عن الوظيفة على النحو التالي:

f (x) = x-50

يمكنك استخدام هذه الوظيفة للتنبؤ بعدد الآيس كريم المباع في اليوم مع أي درجة حرارة معينة. على سبيل المثال ، لنفترض أن توقعات الطقس تخبرنا أنه غدا ستكون 77 درجة. يمكننا تطبيق نموذجنا لحساب 77-50 والتنبؤ بأننا سنبيع 27 آيس كريم غدا.

ولكن ما مدى دقة نموذجنا؟

تقييم نموذج الانحدار

للتحقق من صحة النموذج وتقييم مدى تنبؤه ، قمنا بتعليق بعض البيانات التي نعرف قيمة التسمية (y) لها. إليك البيانات التي احتجزناها:

درجة الحرارة (x) مبيعات الآيس كريم (ذ)
52 0
67 14
70 23
73 22
78 26
83 36

يمكننا استخدام النموذج للتنبؤ بالتسمية لكل ملاحظة في مجموعة البيانات هذه بناء على قيمة الميزة (x). ثم قارن التسمية المتوقعة (ŷ) بقيمة التسمية الفعلية المعروفة (y).

يؤدي استخدام النموذج الذي دربناه سابقا ، والذي يلخص الدالة f (x) = x-50 ، إلى التنبؤات التالية:

درجة الحرارة (x) المبيعات الفعلية (سنة) المبيعات المتوقعة (ŷ)
52 0 2
67 14 17
70 23 20
73 22 23
78 26 28
83 36 33

يمكننا رسم كل من التسميات المتوقعةوالفعلية مقابل قيم الميزات مثل هذا:

رسم تخطيطي لمخطط مبعثر يوضح القيم المتوقعة والفعلية.

يتم حساب التسميات المتوقعة بواسطة النموذج بحيث تكون على خط الوظيفة ، ولكن هناك بعض التباين بين قيم ŷ المحسوبة بواسطة الدالة وقيم y الفعلية من مجموعة بيانات التحقق من الصحة ؛ والذي يشار إليه على المؤامرة كخط بين قيم ŷ و y يوضح مدى بعد التنبؤ عن القيمة الفعلية.

مقاييس تقييم الانحدار

استنادا إلى الاختلافات بين القيم المتوقعة والفعلية، يمكنك حساب بعض المقاييس الشائعة التي يتم استخدامها لتقييم نموذج الانحدار.

متوسط الخطأ المطلق (MAE)

يشير التباين في هذا المثال إلى عدد الآيس كريم الذي كان كل تنبؤ خاطئا. لا يهم ما إذا كان التوقع أعلى أو أقل من القيمة الفعلية (على سبيل المثال، يشير كل من -3 و+3 إلى تباين 3). يعرف هذا المقياس بالخطأ المطلق لكل تنبؤ، ويمكن تلخيصه لمجموعة التحقق من الصحة بأكملها كمتوسط الخطأ المطلق (MAE).

في مثال الآيس كريم ، متوسط (متوسط) الأخطاء المطلقة (2 و 3 و 3 و 1 و 2 و 3) هو 2.33.

متوسط خطأ تربيعي (MSE)

يأخذ مقياس متوسط الخطأ المطلق جميع التناقضات بين التسميات المتوقعة والفعلية في الاعتبار على قدم المساواة. ومع ذلك ، قد يكون من المرغوب فيه أن يكون لديك نموذج خاطئ باستمرار بمقدار صغير من النموذج الذي يرتكب أخطاء أقل ولكن أكبر. طريقة واحدة لإنتاج مقياس "يضخم" الأخطاء الأكبر عن طريق تربيع الأخطاء الفردية وحساب متوسط القيم التربيعية. يعرف هذا المقياس باسم متوسط الخطأ التربيعي (MSE).

في مثال الآيس كريم الخاص بنا ، متوسط القيم المطلقة التربيعية (وهي 4 و 9 و 9 و 1 و 4 و 9) هو 6.

خطأ تربيعي متوسط الجذر (RMSE)

يساعد متوسط الخطأ التربيعي في أخذ حجم الأخطاء في الاعتبار ، ولكن نظرا لأنه يربيع قيم الخطأ ، لم يعد المقياس الناتج يمثل الكمية التي تم قياسها بواسطة التسمية. بمعنى آخر ، يمكننا القول أن MSE لنموذجنا هو 6 ، لكن هذا لا يقيس دقته من حيث عدد الآيس كريم الذي تم التنبؤ به بشكل خاطئ. 6 هي مجرد درجة رقمية تشير إلى مستوى الخطأ في تنبؤات التحقق من الصحة.

إذا أردنا قياس الخطأ من حيث عدد الآيس كريم ، فنحن بحاجة إلى حساب الجذر التربيعي ل MSE. والذي ينتج مقياسا يسمى ، مما لا يثير الدهشة ، خطأ جذر متوسط تربيع. في هذه الحالة √6 ، وهو 2.45 (الآيس كريم).

معامل التحديد (R2)

تقارن جميع المقاييس حتى الآن التناقض بين القيم المتوقعة والفعلية من أجل تقييم النموذج. ومع ذلك ، في الواقع ، هناك بعض التباين العشوائي الطبيعي في المبيعات اليومية للآيس كريم التي يأخذها النموذج في الاعتبار. في نموذج الانحدار الخطي ، تتناسب خوارزمية التدريب مع خط مستقيم يقلل من متوسط التباين بين الوظيفة وقيم التسمية المعروفة. معامل التحديد (يشار إليه بشكل أكثر شيوعا باسم R2 أو R-Squared) هو مقياس يقيس نسبة التباين في نتائج التحقق من الصحة التي يمكن تفسيرها بواسطة النموذج ، على عكس بعض الجوانب الشاذة لبيانات التحقق من الصحة (على سبيل المثال ، يوم به عدد غير عادي للغاية من مبيعات الآيس كريم بسبب مهرجان محلي).

يعد حساب R2 أكثر تعقيدا من المقاييس السابقة. يقارن مجموع الفروق التربيعية بين التسميات المتوقعة والفعلية بمجموع الاختلافات التربيعية بين قيم التسمية الفعلية ومتوسط قيم التسمية الفعلية ، على النحو التالي:

R2 = 1- ∑(y-ŷ)2 ÷ ∑(y-ȳ)2

لا تقلق كثيرا إذا كان ذلك يبدو معقدا. يمكن لمعظم أدوات التعلم الآلي حساب المقياس نيابة عنك. النقطة المهمة هي أن النتيجة هي قيمة بين 0 و 1 تصف نسبة التباين التي يشرحها النموذج. بعبارات بسيطة ، كلما اقتربت هذه القيمة من 1 ، كان النموذج أفضل ملاءمة لبيانات التحقق. في حالة نموذج انحدار الآيس كريم ، فإن R2 المحسوب من بيانات التحقق هو 0.95.

التدريب التكراري

تستخدم المقاييس الموضحة أعلاه بشكل شائع لتقييم نموذج الانحدار. في معظم سيناريوهات العالم الحقيقي ، سيستخدم عالم البيانات عملية تكرارية لتدريب نموذج وتقييمه بشكل متكرر ، مع تخويض:

  • اختيار الميزات وإعدادها (اختيار الميزات التي سيتم تضمينها في النموذج ، والحسابات المطبقة عليها للمساعدة في ضمان ملاءمة أفضل).
  • اختيار الخوارزمية (استكشفنا الانحدار الخطي في المثال السابق ، ولكن هناك العديد من خوارزميات الانحدار الأخرى)
  • معلمات الخوارزمية (الإعدادات الرقمية للتحكم في سلوك الخوارزمية ، تسمى بشكل أكثر دقة المعلمات الفائقة لتمييزها عن معلمات x و y ).

بعد التكرارات المتعددة، يتم تحديد النموذج الذي ينتج عنه أفضل مقياس تقييم مقبول للسيناريو المحدد.