الاتصال بجداول نموذج البيانات العامة في Azure Data Lake Storage

إشعار

أصبح Azure Active Directory الآن معرف Microsoft Entra. معرفة المزيد

أدخل البيانات إلى Dynamics 365 Customer Insights - Data باستخدام حساب Azure Data Lake Storage الخاص بك الذي يتضمن جداول نموذج البيانات الشائع . يمكن أن يكون استيعاب البيانات كاملا أو تزايديا.

المتطلبات الأساسية

  • يجب أن يكون لدى حساب Azure Data Lake Storage ميزة مساحة الاسم الهرمي ممكّنة. يجب تخزين البيانات بتنسيق مجلد هرمي يحدد المجلد الجذر ويحتوي على مجلدات فرعية لكل جدول. يمكن أن تحتوي المجلدات الفرعية على بيانات كاملة أو مجلدات بيانات تزايدية.

  • للمصادقة مَع كيان خدمة Microsoft Entra، يجب تكوينه فِي المستأجر الخاص بك. لمزيد من المعلومات، راجع الاتصال بحساب Azure Data Lake Storage باستخدام أساس خدمة Microsoft Entra.

  • للاتصال بالتخزين المحمي بواسطة جدران الحماية، قم بإعداد Azure Private Links.

  • إذا كان مستودع البيانات الخاص بك يحتوي حاليا على أي اتصالات ارتباط خاصة به، يجب أن تتصل Customer Insights - البيانات أيضا باستخدام ارتباط خاص، بغض النظر عن إعداد الوصول إلى الشبكة.

  • يجب أن يكون Azure Data Lake Storage الذي تريد توصيل البيانات منه واستيعابها في نفس منطقة Azure مثل بيئة Dynamics 365 Customer Insights ويجب أن تكون الاشتراكات في نفس المستأجر. الاتصالات بمجلد نموذج البيانات الشائع مِن مستودع البيانات فِي منطقة Azure مختلفة غير مدعومة. لمعرفة منطقة Azure للبيئة، انتقل إلى Settings>System>About في Customer Insights - البيانات.

  • قد يتم تخزين البيانات المخزنة في الخدمات عبر الإنترنت في موقع مختلف عن موقع معالجة البيانات أو تخزينها. من خلال استيراد البيانات المخزنة في الخدمات عبر الإنترنت أو الاتصال بها، فأنت توافق على إمكانية نقل البيانات. تعرف على المزيد في مركز توثيق Microsoft.

  • يجب أن يكون مدير خدمة البيانات - Customer Insights في أحد الأدوار التالية للوصول إلى حساب التخزين. لمزيد من المعلومات، راجع منح أذونات لمدير الخدمة للوصول إلى حساب التخزين.

    • قارئ بيانات تخزين Blob
    • مالك بيانات مخزن البيانات الثنائية الكبيرة
    • المساهم في بيانات مخزن البيانات الثنائية الكبيرة
  • عند الاتصال بتخزين Azure باستخدام خيار اشتراك Azure ، يحتاج المستخدم الذي يقوم بإعداد اتصال مصدر البيانات إلى أذونات Storage Blob Data Contributor على حساب التخزين على الأقل.

  • عند الاتصال بتخزين Azure باستخدام خيار مورد Azure ، يحتاج المستخدم الذي يقوم بإعداد اتصال مصدر البيانات على الأقل إلى إذن إجراء Microsoft.Storage/storageAccounts/read على حساب التخزين. دور Azure المضمن الذي يتضمن هذا الإجراء هو دور القارئ. للحد من الوصول إلى الإجراء الضروري فقط، قم بإنشاء دور Azure مخصص يتضمن هذا الإجراء فقط.

  • للحصول على الأداء الأمثل، يجب أن يكون حجم القسم 1 غيغابايت أو أقل ويجب ألا يتجاوز عدد ملفات القسم في مجلد 1000.

  • يجب أن تتبع البيانات الموجودة في Data Lake Storage معيار نموذج البيانات العامة لتخزين بياناتك وأن تحتوي على بيان نموذج البيانات العامة لتمثيل مخطط ملفات البيانات (*.csv أو *.parquet). يجب أن يوفر البيان تفاصيل الجداول مثل أعمدة الجدول وأنواع البيانات وموقع ملف البيانات ونوع الملف. لمزيد من المعلومات، راجع بيان نموذج البيانات العامة. إذا لم يكن البيان موجودا، يمكن للمستخدمين المسؤولين الذين لديهم مالك بيانات Storage Blob أو وصول Storage Blob Data Contributor تحديد المخطط عند استيعاب البيانات.

    إشعار

    إذا كان أي من الحقول في ملفات .parquet يحتوي على نوع بيانات Int96، فقد لا يتم عرض البيانات على صفحة الجداول . نوصي باستخدام أنواع البيانات القياسية، مثل تنسيق الطابع الزمني Unix (الذي يمثل الوقت كعدد الثواني منذ 1 يناير 1970، في منتصف الليل بالتوقيت العالمي المتفق عليه).

Limitations

  • Customer Insights - لا تدعم البيانات الأعمدة من النوع العشري بدقة أكبر من 16.

الاتصال ب Azure Data Lake Storage

يجب أن تستخدم أسماء اتصالات البيانات ومسارات البيانات مثل المجلدات داخل الحاوية وأسماء الجداول الأسماء التي تبدأ بحرف. يمكن أن تحتوي الأسماء فقط على أحرف وأرقام وتسطير أسفل السطر (_). الأحرف الخاصة غير مدعومة.

  1. انتقل إلىمصادر بيانات>.

  2. حدد إضافة مصدر بيانات.

  3. حدد جداول نموذج البيانات المشتركة ل Azure Data Lake. مربع الحوار لإدخال تفاصيل الاتصال ل Azure Data Lake مع جداول نموذج البيانات العامة.

  4. أدخل اسم مصدر بياناتووصفا اختياريا. يُشار إلى هذا الاسم في العمليات اللاحقة، ولا يمكن تغييره بعد إنشاء مصدر البيانات.

  5. اختر أحد الخيارات التالية لتوصيل التخزين باستخدامه. لمزيد من المعلومات، راجع الاتصال بحساب Azure Data Lake Storage باستخدام أساس خدمة Microsoft Entra.

    • مورد Azure: أدخل معرف المورد.
    • اشتراك Azure: حدد الاشتراك ثم مجموعة المواردوحساب التخزين.

    إشعار

    تحتاج إلى أحد الأدوار التالية للحاوية لإنشاء مصدر البيانات:

    • دور قارئ بيانات تخزين البيانات الثنائية الكبيرة يكفي لقراءة البيانات مِن حساب التخزين واستيعاب البيانات مِن Customer Insights - البيانات.
    • دور مساهم بيانات مخزن البيانات الثنائية الكبيرة أو المالك مطلوب إذا أردت تحرير ملفات البيانات مباشرةً فِي Customer Insights - البيانات.

    يؤدي تعيين هذا الدور على حساب التخزين إلى منح الدور نفسه على جميع حاوياته.

  6. اختر اسم الحاوية التي تحتوي على البيانات والمخطط (model.json أو ملف manifest.json) لاستيراد البيانات منها.

    إشعار

    لا يظهر أي ملف model.json أو manifest.json مقترن بمصدر بيانات آخر في البيئة في القائمة. ومع ذلك، يمكن استخدام نفس model.json أو ملف manifest.json لمصادر البيانات في بيئات متعددة.

  7. اختياريا، إذا كنت تريد استيعاب البيانات من حساب تخزين من خلال Azure Private Link، فحدد Enable Private Link. لمزيد من المعلومات، انتقل إلى الارتباطات الخاصة.

  8. لإنشاء مخطط جديد، انتقل إلى إنشاء ملف مخطط جديد.

  9. لاستخدام مخطط موجود، انتقل إلى المجلد الذي يحتوي على ملف model.json أو manifest.cdm.json. يمكنك البحث داخل دليل للعثور على الملف.

  10. حدد ملف json وحدد التالي. يتم عرض قائمة بالجداول المتوفرة. مربع حوار لقائمة جداول لتحديدها

  11. حدد الجداول التي تريد تضمينها. مربع حوار يعرض

    تلميح

    لتحرير جدول في واجهة تحرير JSON، حدد الجدول ثم تحرير ملف المخطط. قم بإجراء تغييرات وحدد حفظ.

  12. بالنسبة للجداول المحددة التي تتطلب استيعابا تزايديا، يتم عرض مطلوب ضمن التحديث التزايدي. لكل من هذه الجداول، راجع تكوين تحديث تزايدي لمصادر بيانات Azure Data Lake.

  13. بالنسبة للجداول المحددة حيث لم يتم تعريف مفتاح أساسي، يتم عرض مطلوب ضمن المفتاح الأساسي. لكل جدول من هذه الجداول:

    1. حدد مطلوب. يتم عرض لوحة تحرير الجدول .
    2. اختر المفتاح الأساسي. المفتاح الأساسي هو سمة فريدة من نوعها للجدول. لكي تكون السمة مفتاحا أساسيا صالحا، يجب ألا تتضمن قيما مكررة أو قيما مفقودة أو قيما خالية. يتم دعم سمات نوع بيانات السلسلة والعدد الصحيح و GUID كمفاتيح أساسية.
    3. يمكنك اختياريًا تغيير نمط التقسيم.
    4. حدد إغلاق لحفظ اللوحة وإغلاقها.
  14. حدد عدد الأعمدة لكل جدول مضمن. يتم عرض صفحة إدارة السمات . مربع الحوار لتحديد تنميط البيانات.

    1. إنشاء أعمدة جديدة أو تحريرها أو حذفها. يمكنك تغيير الاسم أو تنسيق البيانات أو إضافة نوع دلالي.
    2. لتمكين التحليلات والقدرات الأخرى، حدد جمع معلومات البيانات للجدول بأكمله أو لأعمدة معينة. بشكل افتراضي، لا يتم تمكين أي جدول ل جمع معلومات البيانات.
    3. حدِّد تم.
  15. حدد حفظ. تفتح صفحة مصادر البيانات التي تعرض مصدر البيانات الجديد في حالة التحديث .

    تلميح

    اختر حالة لفتح لوحة تفاصيل التقدم ، حيث يمكنك عرض تقدم المهمة أو اختيار إلغاء المهمة لإيقاف المهمة.

قد يستغرق تحميل البيانات وقتا. بعد التحديث الناجح، يمكن مراجعة البيانات التي تم استيعابها من صفحة الجداول .

إنشاء ملف مخطط جديد

  1. حدد Create schema file.

  2. أدخل اسما للملف وحدد حفظ.

  3. حدد جدول جديد. يتم عرض لوحة جدول جديد .

  4. أدخل اسم الجدول واختر موقع ملفات البيانات.

    • ملفات .csv أو .parquet متعددة: استعرض وصولا إلى المجلد الجذر، وحدد نوع النمط، وأدخل التعبير.
    • ملفات .csv مفردة أو .parquet: استعرض للوصول إلى ملف .csv أو .parquet وحدده.

    مربع الحوار لإنشاء جدول جديد مع تمييز موقع ملفات البيانات.

  5. حدد حفظ.

    مربع الحوار لتعريف السمات أو إنشاؤها تلقائيا.

  6. حدد تعريف السمات لإضافة السمات يدويا، أو حدد إنشاءها تلقائيا. لتعريف السمات، أدخل اسما، وحدد تنسيق البيانات والنوع الدلالي الاختياري. للسمات التي تم إنشاؤها تلقائيا:

    1. بعد إنشاء السمات تلقائيا، حدد Review attributes. يتم عرض صفحة إدارة السمات .

    2. تأكد من صحة تنسيق البيانات لكل سمة.

    3. لتمكين التحليلات والقدرات الأخرى، حدد جمع معلومات البيانات للجدول بأكمله أو لأعمدة معينة. بشكل افتراضي، لا يتم تمكين أي جدول ل جمع معلومات البيانات.

      مربع الحوار لتحديد تنميط البيانات.

    4. حدِّد تم. يتم عرض صفحة تحديد الجداول .

  7. تابع إضافة الجداول والأعمدة، إن أمكن.

  8. بعد إضافة جميع الجداول، حدد تضمين لتضمين الجداول في استيعاب مصدر البيانات.

    مربع حوار يعرض

  9. بالنسبة للجداول المحددة التي تتطلب استيعابا تزايديا، يتم عرض مطلوب ضمن التحديث التزايدي. لكل من هذه الجداول، راجع تكوين تحديث تزايدي لمصادر بيانات Azure Data Lake.

  10. بالنسبة للجداول المحددة حيث لم يتم تعريف مفتاح أساسي، يتم عرض مطلوب ضمن المفتاح الأساسي. لكل جدول من هذه الجداول:

    1. حدد مطلوب. يتم عرض لوحة تحرير الجدول .
    2. اختر المفتاح الأساسي. المفتاح الأساسي هو سمة فريدة من نوعها للجدول. لكي تكون السمة مفتاحا أساسيا صالحا، يجب ألا تتضمن قيما مكررة أو قيما مفقودة أو قيما خالية. يتم دعم سمات نوع بيانات السلسلة والعدد الصحيح و GUID كمفاتيح أساسية.
    3. يمكنك اختياريًا تغيير نمط التقسيم.
    4. حدد إغلاق لحفظ اللوحة وإغلاقها.
  11. حدد حفظ. تفتح صفحة مصادر البيانات التي تعرض مصدر البيانات الجديد في حالة التحديث .

قد يستغرق تحميل البيانات وقتا. بعد التحديث الناجح، يمكن مراجعة البيانات التي تم استيعابها من صفحة جداول البيانات>.

تحرير مصدر بيانات Azure Data Lake Storage

يمكنك تحديث خيار الاتصال بحساب التخزين باستخدام . لمزيد من المعلومات، راجع الاتصال بحساب Azure Data Lake Storage باستخدام أساس خدمة Microsoft Entra. للاتصال بحاوية مختلفة عن حساب التخزين الخاص بك، أو تغيير اسم الحساب، قم بإنشاء اتصال مصدر بيانات جديد.

  1. انتقل إلىمصادر بيانات>. بجوار مصدر البيانات الذي تريد تحديثه، حدد تحرير.

  2. تغيير أي من المعلومات التالية:

    • Description

    • قم بتوصيل التخزين الخاص بك باستخدام معلومات الاتصال. لا يمكنك تغيير معلومات الحاوية عند تحديث الاتصال.

      إشعار

      يجب تعيين أحد الأدوار التالية إلى حساب التخزين أو الحاوية:

      • قارئ بيانات تخزين Blob
      • مالك بيانات مخزن البيانات الثنائية الكبيرة
      • المساهم في بيانات مخزن البيانات الثنائية الكبيرة
    • قم بتمكين Private Link إذا كنت تريد استيعاب البيانات من حساب تخزين من خلال Azure Private Link. لمزيد من المعلومات، انتقل إلى الارتباطات الخاصة.

  3. حدد التالي.

  4. تغيير أي من المعلومات التالية:

    • انتقل إلى ملف model.json أو manifest.json مختلف مع مجموعة مختلفة من الجداول من الحاوية.

    • لإضافة المزيد من الجداول لاستيعابها، حدد جدول جديد.

    • لإزالة أي جداول محددة بالفعل إذا لم تكن هناك تبعيات، حدد الجدول وحذف.

      مهم

      إذا كانت هناك تبعيات على ملف model.json أو manifest.json الموجود ومجموعة الجداول، فسترى رسالة خطأ ولا يمكنك تحديد ملف model.json أو manifest.json مختلف. قم بإزالة هذه التبعيات قبل تغيير ملف model.json أو manifest.json أو إنشاء مصدر بيانات جديد باستخدام ملف model.json أو manifest.json الذي تريد استخدامه لتجنب إزالة التبعيات.

    • لتغيير موقع ملف البيانات أو المفتاح الأساسي، حدد تحرير.

    • لتغيير بيانات الاستيعاب التزايدي، راجع تكوين تحديث تزايدي لمصادر بيانات Azure Data Lake.

    • قم بتغيير اسم الجدول فقط لمطابقة اسم الجدول في ملف .json.

      إشعار

      احتفظ دائما باسم الجدول بنفس اسم الجدول في ملف model.json أو manifest.json بعد الاستيعاب. Customer Insights - تتحقق البيانات من صحة جميع أسماء الجداول باستخدام model.json أو manifest.json أثناء كل تحديث للنظام. إذا تغير اسم الجدول، يحدث خطأ لأن Customer Insights - لا يمكن للبيانات العثور على اسم الجدول الجديد في ملف .json. إذا تم تغيير اسم جدول تم إدخاله عن طريق الخطأ، فقم بتحرير اسم الجدول لمطابقة الاسم في ملف .json.

  5. حدد الأعمدة لإضافتها أو تغييرها، أو لتمكين جمع معلومات البيانات. ثم حدد تم.

  6. حدد حفظ لتطبيق التغييرات والعودة إلى صفحة مصادر البيانات .

تحديث مصدر بيانات عند تغيير المخطط

إذا تم تغيير مخطط البيانات المصدر بعد إنشاء اتصال مصدر البيانات، يظهر خطأ في عدم تطابق المخطط أو عدم تطابق البيانات يطلب منك تحديث اتصال مصدر البيانات. يظهر الخطأ "تم تغيير الأعمدة في البيانات المصدر" في تفاصيل المهمة. تتضمن تغييرات المخطط تحديثات للأعمدة وأسماء الأعمدة وأنواع بيانات الأعمدة.

  1. انتقل إلىمصادر بيانات>. حدد تحرير بجوار مصدر البيانات الذي يحتوي على الأخطاء. ثم حدد التالي.

  2. حدد الجدول الذي يحتوي على أخطاء.

    لقطة شاشة لصفحة إدارة السمات تعرض رسالة إنشاء السمات تلقائيا.

  3. حدد إنشاء السمات تلقائيا والتأكيد.

  4. بعد اكتمال إنشاء السمة، حدد تم.

  5. حدد تضمين في الجدول ثم حدد حفظ لتطبيق التغييرات والعودة إلى صفحة مصادر البيانات .

منع أجزاء الأقسام فِي إدخال البيانات إلى بحيرة البيانات

من الممكن أن تنشئ استراتيجية تقسيم مستودع البيانات مئات الآلاف من الأقسام الصغيرة، مثل قسم جديد لكل كيان كل ساعة. لتجنب تجزئة القسم، اتبع أفضل الممارسات التالية:

  • تجنب التقسيم الزائد: يجب أن يستند التقسيم إلى أعمدة ذات علاقة أساسية منخفضة مثل التاريخ أو المنطقة، بدلا من الحقول ذات العلاقة الأساسية العالية مثل معرف الكيان أو الساعة.
  • استهداف أحجام الملفات المثلى: لتقليل النفقات العامة لفتح وإغلاق العديد من الملفات الصغيرة وتحسين أداء القراءة، قم بالهدف إلى تقسيم الملفات بين 16 ميغابايت و1 غيغابايت.
  • استخدم Delta Lake، الذي يوفر ميزات التحسين التلقائي: يدعم Delta Lake الحوسبة التلقائية ويحسن ميزات الكتابة التي تدير أحجام الملفات وتخطيط القسم تلقائيا. في Databricks Runtime 11.3 وما فوق، يقوم Delta Lake بضبط أحجام الملفات والأقسام تلقائيا في الخلفية.
  • إعادة تقييم استراتيجية التقسيم بشكل دوري: مع تطور حجم البيانات وأنماط الوصول، يجب أن تتطور استراتيجية التقسيم الخاصة بك. استخدم أدوات مثل إحصاءات تخطي البيانات وتحليل الاستعلامات لتوجيه التعديلات.

يمكن أن يسبب مئات الآلاف من الأقسام الصغيرة الأعراض التالية:

  • تدهور الأداء أثناء استيعاب البيانات وتنفيذ الاستعلام.
  • زيادة حمل بيانات التعريف وزمن الانتقال.
  • ارتفاع التكاليف التشغيلية بسبب عدم كفاءة التخزين واستخدام الحوسبة.
  • أخطاء عندما يتجاوز عدد الأقسام قيود الخدمة.
  • أخطاء نفاد الذاكرة عندما يحاول النظام إنشاء رسم بياني لكل قسم.