إشعار
يتطلب الوصول إلى هذه الصفحة تخويلاً. يمكنك محاولة تسجيل الدخول أو تغيير الدلائل.
يتطلب الوصول إلى هذه الصفحة تخويلاً. يمكنك محاولة تغيير الدلائل.
ينطبق على:
Azure Data Factory
Azure Synapse Analytics
تلميح
Data Factory في Microsoft Fabric هو الجيل القادم من Azure Data Factory، مع بنية أبسط، وذكاء اصطناعي مدمج، وميزات جديدة. إذا كنت جديدا في تكامل البيانات، ابدأ مع Fabric Data Factory. يمكن لأعباء عمل ADF الحالية الترقية إلى Fabric للوصول إلى قدرات جديدة في علوم البيانات، والتحليلات اللحظية، والتقارير.
استخدم نشاط Data Flow لتحويل ونقل البيانات عبر تدفقات البيانات الخريطية. إذا كنت جديدا على تدفقات البيانات، راجع Mapping Data Flow نظرة عامة
إنشاء نشاط Data Flow مع واجهة المستخدم
لاستخدام نشاط Data Flow في خط الأنابيب، أكمل الخطوات التالية:
ابحث عن Data Flow في صفحة الأنشطة، واسحب نشاط Data Flow إلى لوحة خط الأنابيب.
اختر نشاط Data Flow الجديد على اللوحة إذا لم يكن محددا بالفعل، واختر تبويب Settings لتعديل تفاصيله.
يتم استخدام مفتاح Checkpoint لتعيين نقطة التفتيش عند استخدام تدفق البيانات لتسجيل البيانات المتغيرة. يمكنك الكتابة فوقه. تستخدم أنشطة تدفق البيانات قيمة Guid كمفتاح نقطة تحقق بدلا من "اسم المسار + اسم النشاط" بحيث يمكنه دائما تعقب حالة التقاط بيانات التغيير للعميل حتى هناك أي إجراءات إعادة تسمية. يستخدم جميع نشاط تدفق البيانات الحالي مفتاح النمط القديم للتوافق مع الإصدارات السابقة. يظهر خيار مفتاح نقطة التحقق بعد نشر نشاط تدفق بيانات جديد مع تغيير مورد تدفق البيانات الذي تم تمكين تسجيل البيانات به على النحو التالي.
حدد تدفق بيانات موجوداً أو أنشئ تدفقاً جديداً باستخدام الزر "New". حدد الخيارات الأخرى كما هو مطلوب لإكمال التكوين الخاص بك.
بناء الجملة
{
"name": "MyDataFlowActivity",
"type": "ExecuteDataFlow",
"typeProperties": {
"dataflow": {
"referenceName": "MyDataFlow",
"type": "DataFlowReference"
},
"compute": {
"coreCount": 8,
"computeType": "General"
},
"traceLevel": "Fine",
"runConcurrently": true,
"continueOnError": true,
"staging": {
"linkedService": {
"referenceName": "MyStagingLinkedService",
"type": "LinkedServiceReference"
},
"folderPath": "my-container/my-folder"
},
"integrationRuntime": {
"referenceName": "MyDataFlowIntegrationRuntime",
"type": "IntegrationRuntimeReference"
}
}
خصائص النوع
| الخاصية | الوصف | القيم المسموح بها | المطلوب |
|---|---|---|---|
| تدفّق البيانات | الإشارة إلى Data Flow قيد التنفيذ | DataFlowReference | نعم |
| التكامُل وقت التشغيل | بيئة الحوسبة التي تعمل عليها تدفقات البيانات. إذا لم يتم تحديده، يتم استخدام وقت تشغيل تكامل Azure التلقائي. | مرجع وقت التكامل | لا |
| compute.coreCount | عدد الذاكرات الأساسية المُستخدمة في مقطع تخزين spark. يمكن تحديده فقط إذا تم استخدام وقت تشغيل Azure Integration للحل التلقائي | 8، 16، 32، 48، 80، 144، 272 | لا |
| compute.computeType | نوع الحوسبة المستخدمة في مقطع تخزين spark. يمكن تحديده فقط إذا تم استخدام وقت تشغيل Azure Integration للحل التلقائي | "عام" | لا |
| staging.linkedService | إذا كنت تستخدم مصدر أو حوض Azure Synapse Analytics، حدد حساب التخزين المستخدم لمرحلة PolyBase. إذا كان تخزين Azure الخاص بك مهيئا بنقطة نهاية خدمة VNet، يجب عليك استخدام المصادقة المدارة للهوية مع تفعيل "السماح بخدمة Microsoft موثوقة" على حساب التخزين، راجع تأثير استخدام نقاط نهاية خدمة VNet مع Azure storage. تعلم أيضا الإعدادات المطلوبة ل Azure Blob و Azure Data Lake Storage Gen2 على التوالي. |
LinkedServiceReference | فقط إذا كان تدفق البيانات يقرأ أو يكتب إلى Azure Synapse Analytics |
| staging.folderPath | إذا كنت تستخدم مصدر أو حوض Azure Synapse Analytics، فإن مسار المجلد في حساب تخزين blob المستخدم لمرحلة PolyBase | السلسلة | فقط إذا كان تدفق البيانات يقرأ أو يكتب إلى Azure Synapse Analytics |
| مستوى التتبع | عيّن مستوى تسجيل تنفيذ نشاط تدفق البيانات | جيد، رديء، لا شيء | لا |
حساب تدفّق البيانات بالحجم الديناميكي في وقت التشغيل
يمكن تعيين خصائص الحساب الأساسي ونوع الحساب بشكل حيوي لضبط حجم بيانات المصدر الواردة في وقت التشغيل. استخدم أنشطة البنية الأساسية لبرنامج ربط العمليات التجارية مثل البحث أو الحصول على بيانات التعريف للعثور على حجم بيانات مجموعة بيانات المصدر. ثم استخدم إضافة المحتوى الديناميكي في خصائص نشاط Data Flow. يمكنك اختيار أحجام الحوسبة الصغيرة أو المتوسطة أو الكبيرة. اختياريًا، اختر "مخصص" وقم بتكوين أنواع الحوسبة وعدد الذاكرات الأساسية يدويًا.
فيما يلي فيديو تعليمي موجز يشرح هذه التقنية
وقت تشغيل تكامل Data Flow
اختر أي Integration Runtime تستخدمه لتنفيذ نشاط Data Flow الخاص بك. بشكل افتراضي، تستخدم الخدمة وقت تشغيل Azure Integration التلقائي مع أربعة أنوية عاملة. يحتوي وقت تشغيل التكامل هذا على نوع حساب للأغراض العامة ويتم تشغيله في نفس المنطقة مثل مثيل الخدمة الخاص بك. بالنسبة لخطوط الأنابيب التشغيلية، ينصح بشدة بإنشاء فترات تشغيل Azure Integration الخاصة بك التي تحدد مناطق محددة، ونوع الحوسبة، وعدد النواة، وTTL لتنفيذ نشاط تدفق البيانات الخاص بك.
يعتبر الحد الأدنى لنوع الحوسبة للأغراض العامة مع تكوين 8 + 8 (إجمالي 16 مركزاً v-core) و10 دقائق من وقت الحياة (TTL) هو الحد الأدنى للتوصية لمعظم أحمال العمل الإنتاجية. من خلال ضبط TTL صغير، يمكن ل Azure IR الحفاظ على عنقود دافئ لا يستهلك عدة دقائق من وقت البدء في العنقود البارد. لمزيد من المعلومات، راجع Azure وقت تشغيل التكامل.
هام
اختيار Integration Runtime في نشاط Data Flow ينطبق فقط على <التنفيذات المفعلة> لخط الأنابيب الخاص بك. تصحيح البنية الأساسية لبرنامج ربط العمليات التجارية الخاصة بك من خلال تدفقات البيانات يعمل على مقطع التخزين المحدد في جلسة عمل تصحيح الأخطاء.
قاعدة متعددة
إذا كنت تستخدم Azure Synapse Analytics كمصدر أو مصدر، يجب عليك اختيار موقع الترتيب لتحميل دفعة PolyBase الخاص بك. يسمح PolyBase بتحميل الدفعة بكميات كبيرة بدلاً من تحميل البيانات صفًا بصف. يقلل PolyBase بشكل كبير من وقت التحميل إلى Azure Synapse Analytics.
مفتاح نقطة التحقق
عند استخدام خيار التقاط التغيير لمصادر تدفق البيانات، يحتفظ ADF بنقطة التحقق ويديرها لك تلقائيا. مفتاح نقطة التحقق الافتراضي هو تجزئة لاسم تدفق البيانات واسم مسار التدفق. إذا كنت تستخدم نمطا ديناميكيا للجداول أو المجلدات المصدر، فقد ترغب في تجاوز هذه التجزئة وتعيين قيمة مفتاح نقطة التحقق الخاصة بك هنا.
مستوى التسجيل
إذا كنت لا تتطلب كل تنفيذ البنية الأساسية لبرنامج ربط العمليات التجارية لأنشطة تدفق البيانات لتسجيل جميع سجلات بيانات تتبع الاستخدام المطولة بالكامل، يمكنك اختياريا تعيين مستوى التسجيل إلى "أساسي" أو "بلا". عند تنفيذ تدفقات البيانات في وضع "مطول" (افتراضي)، فأنت تطلب من الخدمة تسجيل النشاط بالكامل على كل مستوى قسم فردي أثناء تحويل البيانات. قد تكون هذه عملية مكلفة، لذا فإن التمكين المطول فقط عند استكشاف الأخطاء وإصلاحها يمكن أن يحسّن من تدفق البيانات الكلي وأداء البنية الأساسية لبرنامج ربط العمليات التجارية. يقوم الوضع "الأساسي" بتسجيل مدد التحويل فقط بينما يوفر "بلا" ملخصا للمدد فقط.
خصائص المتلقّي
تسمح لك ميزة التجميع في تدفقات البيانات بتعيين ترتيب تنفيذ المتلقيات بالإضافة إلى تجميع المتلقيات معا باستخدام نفس رقم المجموعة. للمساعدة في إدارة المجموعات، يمكنك أن تطلب من الخدمة تشغيل المتلقيات في نفس المجموعة، للتشغيل بالتوازي. يمكنك أيضًا تعيين مجموعة المتلقيات للمتابعة حتى بعد مواجهة أحد المتلقيات لخطأ.
السلوك الافتراضي لمخازن تدفق البيانات هو تنفيذ كل مصدر بالتسلسل، بطريقة تسلسلية، وفشل تدفق البيانات عند مواجهة خطأ في المخزن. بالإضافة إلى ذلك، يتم تعيين جميع المتلقيات بشكل افتراضي إلى نفس المجموعة ما لم تدخل في خصائص تدفق البيانات وتعيين أولويات مختلفة للمتلقيات.
الصفّ الأول فقط
يتوفر هذا الخيار فقط لتدفق البيانات التي تحتوي على مصادر ذاكرة التخزين المؤقت المُمكّن «الإخراج إلى النشاط». يقتصر الإخراج من تدفق البيانات الذي يتم حقنه مباشرة في البنية الأساسية لبرنامج ربط العمليات التجارية الخاصة بك إلى 2MB. يساعدك إعداد «الصف الأول فقط» على الحد من إخراج البيانات من تدفق البيانات عند حقن إخراج نشاط تدفق البيانات مباشرة إلى البنية الأساسية لبرنامج ربط العمليات التجارية الخاصة بك.
تعيين مَعلمات تدفق البيانات
مجموعات البيانات ذات المَعلمات
إذا كان تدفق البيانات يستخدم مجموعات بيانات ذات معلمات، فقم بتعيين قيم المعلمات في علامة التبويب «الإعدادات».
تدفقات البيانات مُحددة المَعلمات
إذا كان تدفق البيانات الخاص بك معلمات، فقم بتعيين القيم الحيوية لمعلمات تدفق البيانات في علامة التبويب «المَعلمات» يمكنك استخدام لغة تعبير البنية الأساسية لبرنامج ربط العمليات التجارية أو لغة تعبير تدفق البيانات لتعيين قيم المعلمات الديناميكية أو الحرفية. لمزيد من المعلومات، راجع Data Flow Parameters.
خصائص الحساب ذا المَعلمات.
يمكنك تحديد عدد النواة أو نوع الحساب إذا استخدمت وقت تشغيل Azure Integration التلقائي وتحديد القيم ل compute.coreCount و compute.computeType.
تصحيح أخطاء في خط الأنابيب لنشاط Data Flow
لتنفيذ خط معالجة تصحيح مع نشاط Data Flow، يجب عليك تفعيل وضع التصحيح data flow عبر شريط تمرير Data Flow Debug في الشريط العلوي. يتيح لك وضع التصحيح تشغيل تدفق البيانات مقابل مقطع التخزين Spark النشط. لمزيد من المعلومات، راجع وضع التصحيح.
يعمل خط أنابيب التصحيح على عنقود التصحيح النشط، وليس على بيئة وقت تشغيل التكامل المحددة في إعدادات نشاط Data Flow. يمكنك اختيار بيئة حساب التصحيح عند بِدء تشغيل وضع التصحيح.
مراقبة نشاط Data Flow
يتمتع نشاط Data Flow بتجربة مراقبة خاصة حيث يمكنك عرض معلومات التقسيم، وقت المرحلة، ومعلومات نسب البيانات. افتح جزء المراقبة عبر أيقونة «eyeglasses» ضمن «الإجراءات». لمزيد من المعلومات، راجع مراقبة تدفق البيانات .
يؤدي نشاط استخدام Data Flow إلى نشاط لاحق
يُخرج نشاط تدفق البيانات مقاييس تتعلق بعدد الصفوف المكتوبة على كل متلقٍ أو مصدر مقروءة من كل مصدر بيانات. يتم إرجاع نتيجة البحث في القسم outputمن نتيجة تشغيل النشاط. تكون المقاييس التي تم إرجاعها في شكل json أدناه.
{
"runStatus": {
"metrics": {
"<your sink name1>": {
"rowsWritten": <number of rows written>,
"sinkProcessingTime": <sink processing time in ms>,
"sources": {
"<your source name1>": {
"rowsRead": <number of rows read>
},
"<your source name2>": {
"rowsRead": <number of rows read>
},
...
}
},
"<your sink name2>": {
...
},
...
}
}
}
على سبيل المثال، للوصول إلى عدد الصفوف المكتوبة إلى المتلقي 1 في نشاط يُسمى «dataflowActivity»، استخدم @activity('dataflowActivity').output.runStatus.metrics.sink1.rowsWritten.
للحصول على عدد الصفوف التي تمت قراءتها من مصدر يسمى «مصدر 1» الذي تم استخدامه في هذا المتلقي، استخدم @activity('dataflowActivity').output.runStatus.metrics.sink1.sources.source1.rowsRead.
إشعار
إذا كان المتلقي يحتوي على صفر صفوف مكتوبة، فلن يظهر في المقاييس. يمكن التحقق من الوجود باستخدام contains الدالة. على سبيل المثال، contains(activity('dataflowActivity').output.runStatus.metrics, 'sink1') يتحقق من كتابة أي صفوف إلى sink1.
المحتوى ذو الصلة
راجع أنشطة تدفق عناصر التحكم الأخرى المدعومة: