إشعار
يتطلب الوصول إلى هذه الصفحة تخويلاً. يمكنك محاولة تسجيل الدخول أو تغيير الدلائل.
يتطلب الوصول إلى هذه الصفحة تخويلاً. يمكنك محاولة تغيير الدلائل.
ينطبق على:
Azure Data Factory
Azure Synapse Analytics
تلميح
Data Factory في Microsoft Fabric هو الجيل القادم من Azure Data Factory، مع بنية أبسط، وذكاء اصطناعي مدمج، وميزات جديدة. إذا كنت جديدا في تكامل البيانات، ابدأ مع Fabric Data Factory. يمكن لأعباء عمل ADF الحالية الترقية إلى Fabric للوصول إلى قدرات جديدة في علوم البيانات، والتحليلات اللحظية، والتقارير.
إذا كنت جديدا على Azure Data Factory، راجع مقدمة في Azure Data Factory.
في هذا الدرس، ستستخدم واجهة مستخدم Data Factory (UI) لإنشاء خط أنابيب ينسخ ويحول البيانات من مصدر Azure Data Lake Storage Gen2 إلى Data Lake Storage Gen2 مصرف (كلاهما يسمح بالوصول إلى شبكات محددة فقط) باستخدام تدفق البيانات في نظام Data Factory Managed Virtual Network. يمكنك توسيع نمط التكوين في هذا البرنامج التعليمي عند تحويل البيانات باستخدام تعيين تدفق البيانات.
في هذا البرنامج التعليمي، يمكنك القيام بالخطوات التالية:
- إنشاء data factory.
- إنشاء مسار مع نشاط تدفق البيانات.
- إنشاء تعيين تدفق البيانات مع أربعة تحويلات.
- اختبار تشغيل التدفقات.
- مراقبة نشاط تدفق البيانات.
المتطلبات الأساسية
- Azure اشتراك. إذا لم يكن لديك اشتراك Azure، أنشئ حساب Azure مجاني قبل أن تبدأ.
- Azure حساب التخزين. تستخدم Data Lake Storage كمخازن بيانات source و sink مخازن بيانات. إذا لم يكن لديك حساب تخزين، راجع إنشاء حساب تخزين Azure لخطوات إنشاء واحد. تأكد من أن حساب التخزين يسمح بالوصول فقط من الشبكات المحددة.
الملف الذي سنحوله في هذا الدرس هو moviesDB.csv، ويمكن العثور عليه في موقع المحتوى GitHub هذا. لاسترجاع الملف من GitHub، انسخ المحتوى إلى محرر نصوص من اختيارك لحفظه محليا كملف .csv. لرفع الملف إلى حساب التخزين الخاص بك، راجع رفع الكتل مع بوابة Azure. سوف تشير الأمثلة إلى حاوية تسمى sample-data.
إنشاء مصدرًا للبيانات
في هذه الخطوة، يمكنك إنشاء مصنع بيانات وفتح واجهة المستخدم "مصنع البيانات" لإنشاء مسار في مصنع البيانات.
افتح Microsoft Edge أو Google Chrome. حاليا، فقط متصفحات الويب Microsoft Edge وGoogle Chrome تدعم واجهة مصنع البيانات.
في القائمة اليسرى، حدد Create a resource>>
في صفحة New data factory، أدخِل ADFTutorialDataFactory في خانة Name.
يجب أن يكون اسم مصنع البيانات مميزًا وعامًا. إذا تلقيت رسالة خطأ بشأن قيمة الاسم، فأدخل اسمًا مختلفًا لمصنع البيانات (على سبيل المثال، yournameADFTutorialDataFactory). للحصول على قواعد التسمية للبيانات الاصطناعية على Data Factory، راجع قواعد تسمية Data Factory.
اختر Azure subscription الذي تريد إنشاء مصنع البيانات فيه.
بالنسبة إلى مجموعة الموارد، نفِّذ إحدى الخطوات التالية:
- حدد Use existing واختر مجموعة موارد موجودة من القائمة المنسدلة.
- حدد Create new وأدخل اسم مجموعة الموارد.
للتعرف على مجموعات الموارد، راجع Use Resource groups لإدارة موارد Azure الخاصة بك.
ضمن Version، حدد V2.
ضمن الموقع، حدد موقعا لمصنع البيانات. لن تُظِّهر القائمة المنسدلة إلا المواقع المعتمدة فقط. مخازن البيانات (مثل تخزين Azure و قاعدة بيانات Azure SQL) والحسابات (مثل Azure HDInsight) المستخدمة في مصنع البيانات يمكن أن تكون في مناطق أخرى.
حدد إنشاء.
بعد الانتهاء من الإنشاء، سترى الإعلام في مركز الإعلامات. حدد Go to resource للانتقال إلى صفحة Data Factory .
اختر Open Azure Data Factory Studio لتشغيل واجهة Data Factory في تبويب منفصل.
إنشاء Azure IR في Data Factory Managed Virtual Network
في هذه الخطوة، تنشئ Azure IR وتفعل Data Factory Managed Virtual Network.
في بوابة Data Factory، اذهب إلى Manage، واختر New لإنشاء Azure IR جديد.
في صفحة إعداد وقت تشغيل التكامل، اختر وقت تشغيل التكامل الذي تريد إنشاؤه استنادا إلى الإمكانات المطلوبة. في هذا الدرس، اختر Azure، استضافة ذاتية ثم اضغط على Continue.
اختر Azure ثم انقر على Continue لإنشاء وقت تشغيل تكامل Azure.
ضمن تكوين الشبكة الظاهرية (معاينة)، حدد تمكين.
حدد إنشاء.
إنشاء مسار بنشاط تدفق البيانات
في هذه الخطوة، ستقوم بإنشاء تدفق يحتوي على نشاط سير عمل البيانات.
في الصفحة الرئيسية ل Azure Data Factory، اختر Orchestrate.
في جزء خصائص المسار، أدخِل TransformMovies لاسم المسار.
في جزء Activities، وسّع Move and Transform. اسحب نشاط Data Flow من اللوحة إلى لوحة خط الأنابيب.
في نافذة
إضافة data flow ، اخترإنشاء data flow ثم اخترMapping Data Flow . عند الانتهاء، حدد OK.
قم بتسمية تدفق البيانات TransformMovies في جزء الخصائص.
في الشريط العلوي من لوحة خط الأنابيب، قم بتمرير شريط Data Flow debug إلى الوضع. يسمح وضع التصحيح بالاختبار التفاعلي لمنطق التحويل مقابل نظام مجموعة Spark مباشرة. تستغرق مجموعات Data Flow من 5 إلى 7 دقائق للتسخين، وينصح المستخدمون بتفعيل تصحيح الأخطاء أولا إذا كانوا يخططون لتطوير Data Flow. لمزيد من المعلومات، راجع وضع التصحيح.
إنشاء منطق التحويل في لوحة تدفق البيانات
بعد إنشاء تدفق البيانات، سيتم تحويلك تلقائياً إلى لوحة تدفق البيانات. في هذه الخطوة، ستبني تدفق بيانات يأخذ ملف moviesDB.csv في Data Lake Storage ويجمع متوسط تقييم الكوميديات من 1910 إلى 2000. بعد ذلك ستعيد كتابة هذا الملف إلى Data Lake Storage.
إضافة تحويل المصدر
في هذه الخطوة، تقوم بإعداد Data Lake Storage Gen2 كمصدر.
في لوحة تدفق البيانات، أضف مصدراً عن طريق تحديد المربع "إضافة مصدر".
سمِّ مصدرك MoviesDB. حدد "جديد" لإنشاء مجموعة بيانات مصدر جديدة.
اختر Azure Data Lake Storage Gen2، ثم اختر Continue.
حدد DelimitedText، ثم حدّد "متابعة".
سمِّ مجموعة البيانات MoviesDB. من القائمة المنسدلة للخدمة المرتبطة، حدد جديد.
في شاشة إنشاء الخدمة المرتبطة، قم بسم الخدمة المرتبطة Data Lake Storage Gen2 ADLSGen2 وحدد طريقة المصادقة الخاصة بك. ثم أدخل بيانات اعتماد الاتصال. في هذا البرنامج التعليمي، نحن نستخدم مفتاح الحساب للاتصال بحساب التخزين الخاص بنا.
تأكد من تمكين التأليف التفاعلي. قد يستغرق الأمر دقيقة حتى التمكين.
حدد اختبار الاتصال. الفشل حتمي لأن حساب التخزين لا يتيح الوصول إليه دون إنشاء نقطة نهاية خاصة والموافقة عليها. يجب أن تشاهد رابط إنشاء نقطة نهاية خاصة يمكنك اتباعها لإنشاء نقطة نهاية خاصة مدارة في رسالة الخطأ. البديل هو الانتقال مباشرة إلى علامة تبويب "الإدارة" واتباع الإرشادات الواردة في هذا القسم لإنشاء نقطة نهاية خاصة مدارة.
احتفظ بمربع الحوار مفتوحًا، وانتقل إلى حساب التخزين.
اتبع الإرشادات الواردة في هذا القسم للموافقة على الارتباط الخاص.
العودة إلى مربع الحوار. حدد اختبار الاتصال مرة أخرى، وحدد إنشاء لنشر الخدمة المرتبطة.
على شاشة إنشاء مجموعة البيانات، أدخل مكان الملف ضمن حقل "مسار الملف". في هذا البرنامج التعليمي، يقع ملف moviesDB.csv في حاوية عينة البيانات. حدد خانة الاختيار الصف الأول كعنوان، لأن الملف يحتوي على عناوين. حدد من اتصال/تخزين لاستيراد مخطط العنوان مباشرة من الملف داخل موقع التخزين. عند الانتهاء، حدد OK.
إذا بدأ تشغيل كتلة تتبع الأخطاء، انتقل إلى علامة التبويب "معاينة البيانات" من تحويل المصدر وحدد "تحديث" للحصول على لقطة من البيانات. يمكنك استخدام معاينة البيانات للتحقق من تكوين التحويل بشكل صحيح.
إنشاء نقطة نهاية خاصة مدارة
إذا لم تستخدم الارتباط التشعبي عند اختبار الاتصال السابق، اتبع المسار. الآن تحتاج إلى إنشاء نقطة نهاية خاصة مدارة، وتوصيلها بالخدمة المرتبطة التي أنشأتها.
انتقل إلى علامة التبويب إدارة .
إشعار
قد لا تتوفر علامة التبويب إدارة لكافة مثيلات Data Factory. إذا لم تتمكن من رؤيته، يمكنك الوصول إلى نقاط النهاية الخاصة عن طريق تحديد >Private Endpoint.
انتقل إلى قسم نقاط النهاية الخاصة المدارة .
حدد + New ضمن نقاط النهاية الخاصة المدارة.
اختر بلاطة Azure Data Lake Storage Gen2 من القائمة، واختر Continue.
أدخل اسم حساب التخزين الذي قمت بإنشائه.
حدد إنشاء.
بعد بضع ثوانٍ، يجب أن تجد أن الارتباط الخاص الذي تم إنشاؤه يحتاج إلى الموافقة عليه.
حدد نقطة النهاية الخاصة التي قمت بإنشائها. يمكنك مشاهدة الارتباط التشعبي الذي سيقودك إلى الموافقة على نقطة النهاية الخاصة على مستوى حساب التخزين.
الموافقة على الارتباط الخاص في حساب تخزين
في حساب التخزين، انتقل إلى اتصالات نقطة النهاية الخاصة ضمن قسم الإعدادات .
حدد خانة الاختيار لنقطة النهاية الخاصة التي أنشأتها، ثم حدد "موافقة".
أضف وصفا، وحدد نعم.
ارجع إلى قسم نقاط النهاية الخاصة المدارة في علامة التبويب إدارة في Data Factory.
بعد حوالي دقيقة، يجب أن ترى الموافقة تظهر لنقطة النهاية الخاصة بك.
إضافة تحويل عامل التصفية
بجوار عقدة المصدر على لوحة تدفق البيانات، حدد رمز الجمع لإضافة تحويل جديد. أول تحويل تضيفه هو "عامل تصفية".
تسمية عامل التصفية تحويل FilterYears. حدد مربع التعبير بجوار "تفعيل عامل التصفية" لفتح منشئ التعبير. هنا عليك تحديد شرط التصفية.
يتيح لك منشئ تعبير تدفق البيانات إنشاء تعبيرات بشكل تفاعلي لاستخدامها في تحويلات مختلفة. يمكن أن تتضمن التعبيرات دالات مضمنة وأعمدة من مخطط الإدخال ومعلمات معرفة من قبل المستخدم. لمزيد من المعلومات حول كيفية إنشاء التعبيرات، راجع منشئ تعبير تدفق البيانات.
في هذا البرنامج التعليمي، ترغب في تصفية الأفلام الكوميدية التي صدرت بين عامي 1910 و2000. لأن السنة حالياً عبارة عن سلسلة، تحتاج إلى تحويلها إلى عدد صحيح باستخدام
toInteger()الدالة. استخدم عاملي التشغيل الأكبر من أو يساوي (>=) وأقل من أو يساوي (<=) للمقارنة بقيم السنة الحرفية 1910 و2000. توحيد هذه التعبيرات مع عامل التشغيل و(&&). التعبير يخرج على النحو التالي:toInteger(year) >= 1910 && toInteger(year) <= 2000للعثور على الأفلام الكوميدية، يمكنك استخدام
rlike()الدالة للعثور على نمط "الكوميديا" في أنواع الأعمدة. توحيدrlikeالتعبير مع مقارنة السنة للحصول على:toInteger(year) >= 1910 && toInteger(year) <= 2000 && rlike(genres, 'Comedy')إذا كان لديك كتلة تصحيح نشطة، يمكنك التحقق من المنطق عن طريق تحديد "تحديث" لرؤية إخراج التعبير مقارنة بالإدخالات المستخدمة. هناك أكثر من إجابة صحيحة حول كيفية تحقيق هذا المنطق باستخدام لغة التعبير تدفق البيانات.
حدد "حفظ وإنهاء" بعد الانتهاء من التعبير.
إحضار "معاينة البيانات" للتحقق من أن عامل التصفية يعمل بشكل صحيح.
إضافة التحويل التجميعي
التحويل التالي الذي ستقوم بإضافته هو تحويل "تجميعي" ضمن "معدل المخطط".
بتسمية التحويل التجميعي AggregateComedyRating. في علامة التبويب تجميع حسب، حدد السنة من المربع المنسدل لتجميع التجميعات حسب السنة التي صدر فيها الفيلم.
انتقل إلى علامة التبويب تجميعات. في مربع النص الأيمن، ثم تسمية العمود التجميعي AverageComedyRating. حدد مربع التعبير الصحيح لإدخال التعبير التجميعي عبر منشئ التعبير.
للحصول على متوسط "تصنيف"العمود، استخدم الدالة
avg()التجميعية. لأن "التصنيف" هو سلسلةavg()ويقبل الإدخال الرقمي، يجب علينا تحويل القيمة إلى رقم عن طريقtoInteger()الدالة. يبدو هذا التعبير مثل:avg(toInteger(Rating))حدد "حفظ وإنهاء" بعد الانتهاء.
انتقل إلى علامة التبويب "معاينة البيانات" لعرض إخراج التحويل. لاحظ وجود عمودين فقط هناك، السنة وAverageComedyRating.
إضافة تحويل المتلقي
أضف تحويل "متلقٍ" ضمن قسم "الوجهة".
سَمِّ المتلقي Sink. حدد "جديد" لإنشاء مجموعة بيانات الملتقي.
في صفحة New dataset، اختر Azure Data Lake Storage Gen2 ثم اختر Continue.
حدد صفحة تحديد "الصيغة"، ثم حدّد DelimitedText ومن ثم حدد "متابعة".
تسمية مجموعة بيانات المتلقي MoviesSink. بالنسبة للخدمة المرتبطة، اختر نفس الخدمة المرتبطة ADLSGen2 التي أنشأتها لتحويل المصدر. أدخل مجلد إخراج لكتابة البيانات إليه. في هذا البرنامج التعليمي، نكتب إلى مجلد إخراج في حاوية عينة البيانات. لا يحتاج المجلد إلى الوجود مسبقاً ويمكن إنشاؤه ديناميكياً. حدد خانة الاختيار الصف الأول كعنوان، وحدد دونلمخطط الاستيراد. حدد موافق.
الآن انتهيت من بناء تدفق البيانات. أنت مستعد لتشغيله في مسارك.
تشغيل تدفق البيانات ومراقبته
يمكنك تتبع أخطاء المسار قبل نشره. في هذه الخطوة، يشغّل تتبع أخطاء مسار تدفق البيانات. بينما لا تكتب معاينة البيانات أي بيانات، سيؤدي تتبع الأخطاء إلى كتابة البيانات في وجهة المتلقي.
انتقل إلى لوحة المسار. حدد "تتبع الأخطاء" لتشغيل تتبع الأخطاء.
يستخدم مسار تعديل الأخطاء في مسار أنشطة تدفق البيانات كتلة التصحيح النشط ولكن لا يزال يستغرق دقيقة واحدة على الأقل للتهيئة. يمكنك تتبع التقدم عبر علامة التبويب "الإخراج". بعد نجاح التشغيل، حدد رمز النظارات الطبية للحصول على تفاصيل التشغيل.
في صفحة التفاصيل، يمكنك مشاهدة عدد الصفوف والوقت الذي تستغرقه كل خطوة تحويل.
حدد تحويلاً للحصول على معلومات مفصلة حول أعمدة البيانات وتقسيمها.
إذا كنت اتبعت هذا البرنامج التعليمي بشكل صحيح، يجب أن تكون قد كتبت 83 صفاً وعمودين في مجلد المتلقي الخاص بك. يمكنك التحقق من صحة البيانات عن طريق التحقق من تخزين الكائن الثنائي كبير الحجم.
الملخص
في هذا الدرس، استخدمت واجهة مصنع البيانات لإنشاء خط أنابيب ينسخ ويحول البيانات من مصدر Data Lake Storage Gen2 إلى Data Lake Storage Gen2 (كلاهما يسمح بالوصول إلى شبكات محددة فقط) باستخدام تعيين تدفق البيانات في Data Factory Managed Virtual Network.