الشبكات العصبية الالتفافية

مكتمل

تلميح

راجع علامة التبويب النص والصور لمزيد من التفاصيل!

تعد القدرة على استخدام عوامل التصفية لتطبيق التأثيرات على الصور مفيدة في مهام معالجة الصور، مثل تنفيذ برنامج تحرير الصور. ومع ذلك، غالبا ما يكون الهدف من رؤية الكمبيوتر هو استخراج المعنى، أو على الأقل رؤى قابلة للتنفيذ، من الصور؛ الذي يتطلب إنشاء نماذج التعلم الآلي التي يتم تدريبها على التعرف على الميزات استنادا إلى كميات كبيرة من الصور الموجودة.

تلميح

تفترض هذه الوحدة أنك على دراية بالمبادئ الأساسية للتعلم الآلي، وأن لديك معرفة مفاهيمية بالتعلم العميق مع الشبكات العصبية. إذا كنت جديدا على التعلم الآلي، ففكر في إكمال الوحدة النمطية مقدمة لمفاهيم التعلم الآلي على Microsoft Learn.

واحدة من أكثر بنى نموذج التعلم الآلي شيوعا لرؤية الكمبيوتر هي الشبكة العصبية الالتفافية (CNN)، وهو نوع من بنية التعلم العميق. تستخدم شبكات CNN عوامل التصفية لاستخراج خرائط الميزات الرقمية من الصور، ثم تغذية قيم الميزات في نموذج تعلم عميق لإنشاء توقع تسمية. على سبيل المثال، في سيناريو تصنيف الصور، تمثل التسمية الموضوع الرئيسي للصورة (بمعنى آخر، ما هي هذه الصورة؟). يمكنك تدريب نموذج CNN مع صور من أنواع مختلفة من الفاكهة (مثل التفاح والموز والبرتقال) بحيث تكون التسمية المتوقعة هي نوع الفاكهة في صورة معينة.

أثناء عملية التدريب ل CNN، يتم تعريف نواة التصفية في البداية باستخدام قيم الوزن التي تم إنشاؤها عشوائيا. بعد ذلك، مع تقدم عملية التدريب، يتم تقييم تنبؤات النماذج مقابل قيم التسمية المعروفة، ويتم تعديل أوزان التصفية لتحسين الدقة. في النهاية، يستخدم نموذج تصنيف صور الفاكهة المدربة أوزان التصفية التي تستخرج أفضل الميزات التي تساعد في تحديد أنواع مختلفة من الفاكهة.

يوضح الرسم التخطيطي التالي كيفية عمل CNN لنموذج تصنيف الصور:

رسم تخطيطي لشبكة عصبية التفافية.

  1. يتم تغذية الصور ذات التسميات المعروفة (على سبيل المثال، 0: تفاحة أو 1: موزة أو 2: برتقالي) في الشبكة لتدريب النموذج.
  2. يتم استخدام طبقة واحدة أو أكثر من عوامل التصفية لاستخراج الميزات من كل صورة حيث يتم تغذيتها من خلال الشبكة. تبدأ نواة التصفية بأوزان معينة عشوائيا وتنشئ صفائف من القيم الرقمية تسمى خرائط الميزات. قد تقوم الطبقات الإضافية "بتجميع" أو "تقليص" خرائط المعالم لإنشاء مصفوفات أصغر تؤكد على الميزات المرئية الرئيسية المستخرجة بواسطة عوامل التصفية.
  3. يتم تبسيط خرائط الميزات في صفيف أحادي الأبعاد من قيم الميزات.
  4. يتم تغذية قيم الميزة في شبكة عصبية متصلة بالكامل.
  5. تستخدم طبقة الإخراج للشبكة العصبية softmax أو دالة مشابهة لإنتاج نتيجة تحتوي على قيمة احتمالية لكل فئة ممكنة، على سبيل المثال [0.2، 0.5، 0.3].

أثناء التدريب، تتم مقارنة احتمالات الإخراج بتسمية الفئة الفعلية - على سبيل المثال، يجب أن تحتوي صورة الموز (الفئة 1) على القيمة [0.0، 1.0، 0.0]. يتم استخدام الفرق بين درجات الفئة المتوقعة والفعلية لحساب الخسارة في النموذج، ويتم تعديل الأوزان في الشبكة العصبية المتصلة بالكامل ونواة التصفية في طبقات استخراج الميزة لتقليل الخسارة.

تتكرر عملية التدريب على فترات متعددة حتى يتم تعلم مجموعة مثالية من الأوزان. بعد ذلك، يتم حفظ الأوزان ويمكن استخدام النموذج للتنبؤ بالتسميات للصور الجديدة التي تكون التسمية غير معروفة لها.

إشعار

تتضمن بنيات CNN عادة طبقات تصفية التفافية متعددة وطبقات إضافية لتقليل حجم خرائط الميزات، وتقييد القيم المستخرجة، وبخلاف ذلك، معالجة قيم الميزة. تم حذف هذه الطبقات في هذا المثال المبسط للتركيز على المفهوم الرئيسي، وهو أن عوامل التصفية تستخدم لاستخراج الميزات الرقمية من الصور، والتي يتم استخدامها بعد ذلك في شبكة عصبية للتنبؤ بتسميات الصور.