Gunakan Kode Genie dengan AI Runtime

Important

Fitur ini ada di Pratinjau Umum.

Genie Code membantu Anda mengembangkan dan memecahkan masalah beban kerja deep learning di notebook yang terhubung ke AI Runtime. Perangkat ini dapat menghasilkan kode pelatihan terdistribusi, menyelesaikan masalah lingkungan dan ketergantungan, serta menyelidiki kegagalan beban kerja GPU.

Genie Code membuat dan menjalankan beban kerja pelatihan CNN terdistribusi di delapan GPU H100 dalam notebook AI Runtime.

Requirements

Untuk menggunakan Genie Code dengan AI Runtime:

Get started

  1. Buka sebuah notebook Azure Databricks.

  2. Hubungkan notebook ke AI Runtime. Lihat Hubungkan ke AI Runtime.

  3. Buka panel Kode Genie.

  4. Jelaskan beban kerja yang ingin Anda kembangkan atau masalah yang ingin Anda selesaikan.

  5. Tinjau rencana yang diusulkan, perubahan kode, dan tindakan sebelum menyetujuinya.

    Important

    Genie Code bisa membuat kesalahan. Tinjau kode yang dihasilkan, perubahan lingkungan, dan tindakan lain yang diusulkan sebelum menjalankannya. Beberapa diagnosis memerlukan log tambahan atau konteks beban kerja.

Apa yang dapat dibantu oleh Genie Code?

Mengembangkan beban kerja pelatihan terdistribusi

Genie Code dapat menghasilkan atau memperbarui kode pelatihan untuk AI Runtime. Aplikasi ini dapat membantu Anda memilih strategi terdistribusi PyTorch yang sesuai, menggunakan @distributed API dari serverless_gpu paket, dan menerapkan pola AI Runtime untuk pemuatan data, checkpointing, dan pelacakan MLflow. Untuk detail API dan contoh, lihat Pelatihan terdistribusi di notebook.

Menyelesaikan masalah lingkungan dan ketergantungan

Genie Code dapat memeriksa lingkungan saat ini, membedakan kegagalan kompatibilitas paket dari perubahan kode atau API, dan merekomendasikan perbaikan yang ditargetkan. Ini juga dapat membantu Anda memilih antara lingkungan Databricks AI dan Standard berdasarkan ketergantungan beban kerja Anda. Untuk informasi tentang lingkungan yang tersedia, lihat Atur lingkungan Anda.

Debug beban kerja GPU dan terdistribusi

Genie Code dapat menggunakan output notebook dan log yang tersedia untuk menyelidiki kegagalan pelatihan terdistribusi, kesalahan komunikasi, macet pelatihan, dan masalah memori GPU. Ini dapat membantu mengidentifikasi kegagalan asli dan membedakannya dari kesalahan selanjutnya pada peringkat lain. Untuk informasi tentang melihat log pelatihan terdistribusi, lihat Pelacakan dan observabilitas eksperimen.

Contoh arahan

Mengembangkan beban kerja pelatihan terdistribusi

  • "Perbarui notebook ini untuk menjalankan pelatihan terdistribusi pada semua delapan GPU H100 di AI Runtime."
  • "Tinjau buku catatan pelatihan terdistribusi ini dan perbaiki penggunaan serverless_gpu serta MLflow-nya."
  • "Sesuaikan beban kerja pelatihan ini untuk AI Runtime dan jelaskan perubahan pentingnya."

Menyelesaikan masalah lingkungan dan ketergantungan

  • "Notebook ini berhenti berfungsi setelah saya memasang paket baru. Periksa lingkungan dan tentukan apakah masalahnya adalah masalah ketergantungan atau perubahan API kode."
  • "Haruskah beban kerja ini menggunakan Databricks AI atau lingkungan Standard? Tinjau ketergantungannya dan rekomendasikan lingkungan sebelum mengubah apa pun."
  • "Diagnosa kesalahan kompatibilitas paket ini dan rekomendasikan perubahan terkecil yang sesuai."

Debug beban kerja GPU dan terdistribusi

  • "Analisis kegagalan latihan terdistribusi ini menggunakan output yang tersedia dari setiap peringkat dan identifikasi akar penyebabnya."
  • Mengapa beban kerja terdistribusi ini macet? Gunakan output notebook untuk merekomendasikan langkah debugging berikutnya."
  • "Selidiki kegagalan memori GPU ini dan rekomendasikan langkah berikutnya yang berbasis bukti."

Sumber daya tambahan