Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Monitoruj potoki Lakeflow w interfejsie użytkownika Azure Databricks, aby śledzić postęp aktualizacji, otrzymywać alerty o zdarzeniach potoku i wyświetlać metryki źródła strumieniowego. Te wbudowane funkcje obsługują takie zadania jak:
- Monitorowanie postępu i stanu aktualizacji pipeline'u. Zobacz Szczegóły potoku dostępne na stronie monitorowania.
- Alerty dotyczące zdarzeń przepływu, takich jak powodzenie lub niepowodzenie aktualizacji przepływu. Zobacz Dodaj powiadomienia e-mail dotyczące wydarzeń w potoku.
- Wyświetlanie metryk dla źródeł przesyłania strumieniowego, takich jak Apache Kafka i Auto Loader (publiczna wersja zapoznawcza). Zobacz Metryki przesyłania.
Dodaj powiadomienia e-mail dotyczące zdarzeń potoku
Możesz skonfigurować co najmniej jeden adres e-mail, aby otrzymywać powiadomienia, gdy wystąpią następujące czynności:
- Aktualizacja potoku zostanie ukończona pomyślnie.
- Aktualizacja potoku danych kończy się niepowodzeniem, albo z błędem, który można ponowić, albo z błędem niepozwalającym na ponowienie. Wybierz tę opcję, aby otrzymywać powiadomienie o wszystkich niepowodzeniach ciągu.
- Aktualizacja pipeline kończy się niepowodzeniem z nieretrywalnym (krytycznym) błędem. Wybierz tę opcję, aby otrzymywać powiadomienie tylko wtedy, gdy wystąpi błąd niemożliwy do ponowienia próby.
- Pojedynczy przepływ danych kończy się niepowodzeniem.
Aby skonfigurować powiadomienia e-mail, edytuj ustawienia potoku. Zobacz Powiadomienia.
Uwaga / Notatka
Utwórz niestandardowe odpowiedzi na zdarzenia, w tym powiadomienia lub obsługę niestandardową, przy użyciu hooków zdarzeń w języku Python.
Wyświetlanie potoków w interfejsie użytkownika
Wyszukaj potok, korzystając z dostępnej w opcji Zadania i potoki na pasku bocznym obszaru roboczego. Otwiera to stronę Zadania i potoki, na której możesz wyświetlić informacje o każdym zadaniu i potoku, do którego masz dostęp. Kliknij nazwę potoku, aby otworzyć stronę monitorowania potoku. Aby edytować zadanie lub potok, kliknij
Menu i wybierz pozycję Edytuj.
Uwaga / Notatka
Zadania i różne typy potoków mają różne edytory. Opcja Edytuj otwiera prawidłowy edytor dla wybranego obiektu.
Użyj listy Zadań i potoków
Aby wyświetlić listę potoków, do których masz dostęp, kliknij Zadania i potoki na pasku bocznym. Zakładka Zadania i przepływy pracy zawiera informacje o wszystkich dostępnych zadaniach i przepływach pracy, takich jak twórca, wyzwalacz (jeśli istnieje) oraz wynik z ostatnich pięciu uruchomień.
Kliknięcie nazwy potoku lub zadania spowoduje przejście do strony monitorowania tego potoku lub zadania. Aby edytować potok lub zadanie, kliknij , a następnie wybierz pozycję Edytuj.
Aby zmienić kolumny wyświetlane na liście, kliknij i wybierz lub usuń zaznaczenie kolumn. Aby na przykład dodać
Pipeline Type jako kolumnę, wybierz tę kolumnę do wyświetlania.
Zadania można filtrować na liście Zadania i potoki , jak pokazano na poniższym zrzucie ekranu.
-
Wyszukiwanie tekstu: wyszukiwanie słów kluczowych jest obsługiwane w polach Nazwa i Identyfikator . Aby wyszukać tag utworzony przy użyciu klucza i wartości, możesz wyszukiwać według klucza, wartości lub zarówno klucza, jak i wartości. Na przykład w przypadku tagu z kluczem
departmenti wartościąfinance, można wyszukaćdepartmentlubfinanceby znaleźć pasujące zadania. Aby wyszukać według klucza i wartości, wprowadź klucz i wartość rozdzieloną dwukropkiem (na przykładdepartment:finance). - Typ: filtruj według zadań, potoków lub wszystkich. Jeśli wybierzesz pozycję Potoki , możesz również filtrować według typu potoku, który obejmuje potoki ETL i Ingestion.
- Właściciel: pokaż tylko zadania, których jesteś właścicielem.
- Ulubione: pokaż zadania oznaczone jako ulubione.
- Tagi: użyj tagów. Aby wyszukać według tagu, możesz użyć menu rozwijanego tagów, aby filtrować maksymalnie pięć tagów w tym samym czasie lub bezpośrednio użyć wyszukiwania słów kluczowych.
-
Uruchom jako: filtruj według maksymalnie dwóch
run aswartości.
Aby uruchomić zadanie lub potok, kliknij . Aby zatrzymać zadanie lub potok, kliknij przycisk
. Aby uzyskać dostęp do innych akcji, kliknij
Możesz na przykład edytować lub usunąć zadanie lub pipeline, albo uzyskać dostęp do ustawień pipeline z tego menu.
Szczegóły potoku dostępne na stronie monitorowania
Uwaga / Notatka
Podgląd ujednoliconej listy przebiegów dodaje przebiegi potoku do listy uruchomień zadań. Szczegółowe informacje o zmianach po włączeniu tej wersji zapoznawczej oraz o tym, jak ją włączyć, znajdziesz w artykule Zmiany w wersji zapoznawczej ujednoliconej listy uruchomień.
Kliknięcie nazwy potoku na stronie Zadania i potoki spowoduje wyświetlenie strony monitorowania dla tego potoku. W tym miejscu możesz uruchomić przebieg potoku i wyświetlić poprzednie szczegóły przebiegu.
Graf potoku, nazywany również skierowanym grafem acyklicznym (DAG), pojawia się, gdy tylko aktualizacja potoku zostanie pomyślnie rozpoczęta. Strzałki reprezentują zależności między zestawami danych w przepływie danych. Domyślnie na stronie monitorowania potoku jest wyświetlana najnowsza aktualizacja tabeli, ale możesz wybrać starsze aktualizacje z menu rozwijanego.
W okienku po prawej stronie przedstawiono szczegóły potoku u góry, w tym identyfikator potoku, koszt obliczeniowy, wydanie produktu i kanał. Szczegóły dotyczące aktualizacji są wyświetlane poniżej szczegółów potoku. Aby uzyskać dostęp do kodu źródłowego potoku, kliknij pozycję Edytuj potok w górnej części strony. Aby przejść do kodu określonej tabeli, umieść kursor nad tabelą na wykresie potoku i kliknij Przejdź do kodu.
Aby zobaczyć tabelaryczny widok zestawów danych, kliknij zakładkę Lista. Widok Lista pozwala na zobaczenie wszystkich zestawów danych w twoim potoku, przedstawionych jako wiersze w tabeli, i jest przydatny, gdy twój wykres potoku jest zbyt duży, aby zobaczyć go w widoku Graficznym. Zestawy danych wyświetlane w tabeli można kontrolować przy użyciu wielu filtrów, takich jak nazwa zestawu danych, typ i stan. Aby wrócić do grafu potoku, kliknij Graph.
Użytkownik Uruchom jako jest właścicielem potoku, a aktualizacje potoku uruchamiane są z uprawnieniami tego użytkownika. Aby zmienić użytkownika run as, kliknij Uprawnienia i zmień właściciela potoku.
Uwaga / Notatka
Zachowanie uruchamiania aktualizacji: aktualizacje wyzwalane zgodnie z harmonogramem, interfejsem API potoków lub potokami ciągłymi używają automatycznego zachowania ponawiania i ponownego uruchamiania. Aktualizacje wyzwalane z poziomu interfejsu użytkownika monitorowania lub edytora potoków wykorzystują szybki start z ukierunkowaniem na działanie debugowania. Aby nadpisać działanie dla konkretnego uruchomienia, użyj opcji Uruchom teraz z innymi ustawieniami z menu rozwijanego. Aby uzyskać więcej informacji, zobacz Aktualizowanie zachowania przebiegu.
Dziennik zdarzeń: Gdy podczas aktualizacji potoku wystąpią błędy, zostaną one wyświetlone w dolnym panelu wraz z przyciskiem Wyświetl dzienniki, umożliwiającym dostęp do dziennika zdarzeń dla tego uruchomienia. Dziennik zdarzeń jest również dostępny, wybierając Wyświetl dziennik zdarzeń ze szczegółów przebiegu w okienku po prawej stronie. Podczas uruchamiania aktualizacji w edytorze Lakeflow Pipelines przejdź do panelu Problemy u dołu edytora, a następnie kliknij Wyświetl dzienniki lub przycisk Otwórz w dziennikach obok dowolnego błędu. Aby uzyskać więcej informacji, zobacz Edytor potoków Lakeflow i Ustawienia potoku dla dziennika zdarzeń.
Zmiany w podglądzie ujednoliconej listy przebiegów
Jeśli masz włączoną wersję zapoznawczą ujednoliconej listy przebiegów, możesz zobaczyć aktualizacje przebiegów potoku na stronie Zadania i potoki.
Ważne
Ujednolicona lista przebiegów jest dostępna w publicznej wersji zapoznawczej. Obszary robocze są domyślnie włączone do wersji zapoznawczej.
Aby wyłączyć ujednoliconą listę uruchomień, administrator obszaru roboczego musi zrezygnować z udziału w wersji zapoznawczej. Aby uzyskać szczegółowe informacje na temat dołączenia do wersji zapoznawczej lub rezygnacji z niej, zobacz Zarządzanie wersjami zapoznawczymi na poziomie konta.
Aby uzyskać dostęp do ujednoliconej listy przebiegów, wybierz Kartę Przebiegi z paska bocznego obszaru roboczego lub kliknij
Zadania i Procesy, a następnie wybierz kartę Przebiegi.
Karta pokazuje listę ostatnich uruchomień z ostatnich 60 dni. Wykres przedstawiający powodzenie i niepowodzenie przebiegów w ciągu ostatnich 48 godzin jest wyświetlany jako pierwszy, w następujących przypadkach:
- Filtrowane są tylko zadania lub potoki.
- Jesteś administratorem lub możesz filtrować tylko po przebiegach
Run as: Me - Wyświetlenie przebiegów na grafie może potrwać do godziny.
Listę i wykres można filtrować, wykonując następujące czynności:
- Nazwa zadania lub potoku danych.
- Wszystkie, zadania lub potoki.
- Typ potoku (ETL, Ingestion, MV/ST lub synchronizacja tabel bazy danych).
- Uruchom jako użytkownik.
- Czas rozpoczęcia operacji (w ciągu ostatnich 48 godzin).
- Status działania.
- Kod błędu dla przebiegów, które zakończyły się niepowodzeniem.
Oprócz powyższych możesz wyświetlić następujące kolumny na liście:
- Godzina zakończenia
- Identyfikator uruchomienia
- Czy przebieg został uruchomiony ręcznie, czy zgodnie z harmonogramem.
- Uruchom Czas trwania.
- Parametry uruchomienia.
Aby zmienić kolumny wyświetlane na liście przebiegów, kliknij i wybierz lub odznacz kolumny.
Kliknięcie Godzina rozpoczęcia, Godzina zakończenia lub Nazwa przebiegu potoku przeniesie cię do strony monitorowania potoku.
Gdy pipeline jest aktywnie uruchomiony, możesz zatrzymać przebieg, klikając W dowolnym momencie możesz również kliknąć
w wierszu uruchomienia, a następnie wybierz Edytuj potok, aby wyświetlić potok w edytorze.
Wyświetlanie szczegółów zestawu danych
Kliknięcie zestawu danych na grafie potoku lub na liście zestawów danych powoduje wyświetlenie informacji o tym zestawie danych w dolnym panelu. Prawy panel nadal wyświetla szczegóły potoku i aktualizacji.
- Schemat: wybierz tabelę na karcie Tabele w dolnym okienku, a następnie wybierz pozycję Kolumny.
- Metryki jakości danych: można wyświetlać w dolnym okienku po wybraniu tabeli.
-
Kod źródłowy: Aby przejść do kodu konkretnej tabeli, najedź kursorem na tabelę na wykresie potoku i kliknij przycisk
Przejdź do kodu.
- Historia zapytań: wybierz pozycję Wydajność w dolnym okienku.
-
Komentarze do tabeli: Komentarze do tabeli nie są dostępne na stronie szczegółów potoku. Aby wyświetlić komentarze do tabeli, otwórz tabelę w Eksploratorze wykazu. Aby przejść bezpośrednio do tabeli, umieść kursor nad nim na wykresie potoku, kliknij
, a następnie kliknij
Wyświetl w wykazie. Aby uzyskać dostęp do Eksploratora wykazu z listy tabel w dolnym okienku, kliknij
Wyświetlanie historii aktualizacji
Aby wyświetlić historię i stan aktualizacji potoku, kliknij menu rozwijane "Historia aktualizacji" na górnym pasku.
Wybierz aktualizację w menu rozwijanym, aby wyświetlić wykres, szczegóły i zdarzenia aktualizacji. Aby powrócić do najnowszej aktualizacji, kliknij pozycję Pokaż najnowszą aktualizację.
Uwaga / Notatka
Rurociągi zachowują 60 dni wcześniejszych aktualizacji. Aktualizacje starsze niż okno przechowywania nie są już wyświetlane w tym miejscu, ale pozostają w dzienniku zdarzeń.
Debugowanie nieudanej aktualizacji potoku
Gdy aktualizacja się nie powiedzie, zacznij od panelu Problemy w edytorze potoków Lakeflow lub dolnego panelu strony monitorowania. Nieudane aktualizacje są tam oznaczane jako błędy i mają przycisk Pokaż logi, który od razu przenosi do odpowiednich wpisów w dzienniku zdarzeń, więc rzadko trzeba ręcznie przeszukiwać surowe logi.
Stamtąd przeanalizuj awarię:
- Zidentyfikuj, co zawiodło. W widoku Graph nieudane tabele i przepływy są podświetlane bezpośrednio w DAG-u. Wybierz jedną z nich, aby wyświetlić komunikat o błędzie, i sprawdź, czy błąd ogranicza się do jednej tabeli, czy też objął także zależne od niej tabele.
- Sprawdź dziennik zdarzeń, aby uzyskać pełne informacje o błędzie. Interfejs może skracać komunikaty. Kolumny
erroridetailsdziennika zdarzeń zawierają pełny ślad stosu oraz ustrukturyzowany kontekst. Zobacz Wykonywanie zapytań w dzienniku zdarzeń. - Powtarzaj tylko to, co się nie udało. Użyj opcji Odśwież nieudane tabele, aby ponowić próbę odświeżenia tylko nieudanych tabel oraz wszystkich elementów od nich zależnych, zamiast ponownie przetwarzać tabele, które zostały już pomyślnie przetworzone. Zobacz Rozpocznij aktualizację potoku dla nieudanych tabel.
- Zweryfikowaj przed pełną aktualizacją. Jeśli awaria wygląda na problem z kodem lub konfiguracją, a nie z danymi, najpierw uruchom Validate . Ponownie sprawdza wykres pipeline i kod źródłowy bez materializacji danych, dzięki czemu otrzymujesz szybki sygnał, czy naprawa rozwiązuje błąd, zanim poświęcisz czas obliczeniowy. Zobacz Sprawdź potok pod kątem błędów bez czekania na aktualizację tabel.
- Uwzględnij mechanizm ponawiania. Aktualizacje wywoływane ręcznie z poziomu edytora wyłączają automatyczne ponowienia, dzięki czemu błędy są widoczne od razu, natomiast aktualizacje wywoływane przez harmonogram lub interfejs API automatycznie ponawiają próby po błędach możliwych do odzyskania. Alert o błędzie na środowisku produkcyjnym może zniknąć po ponowieniu próby, podczas gdy ten sam błąd nie zniknie w trakcie interaktywnego programowania. Zobacz Zachowanie przebiegu aktualizacji.
Uwaga / Notatka
Jeśli przyczyna niepowodzenia dotyczy konkretnie nieprawidłowego lub niekompatybilnego punktu kontrolnego przesyłania strumieniowego (co często zdarza się po zmianie operacji stanowej, takiej jak dropDuplicates() lub agregacja, albo po zmianie źródła), samo ponowienie próby nie rozwiąże problemu. Odzyskanie wymaga ponownego przetworzenia danych — albo pełnego odświeżenia, albo selektywnego resetu punktu kontrolnego, który wznawia przetwarzanie od wybranej pozycji i zachowuje istniejące dane w tabeli. Ponieważ reset powoduje ponowne przetworzenie danych źródłowych, operacje zapisu w systemach podrzędnych muszą być idempotentne. Zobacz Odzyskiwanie potoku po awarii punktu kontrolnego przesyłania strumieniowego.
Wyświetlanie metryk przesyłania strumieniowego
Ważne
Obserwowalność przesyłu strumieniowego dla potoków jest dostępna w publicznej wersji zapoznawczej.
Można wyświetlać metryki przesyłania strumieniowego ze źródeł danych obsługiwanych przez Spark Structured Streaming, takich jak Apache Kafka, Amazon Kinesis, Auto Loader i Delta tables, w ramach każdego przepływu przesyłania strumieniowego w potoku. Metryki są wyświetlane jako wykresy w prawym panelu interfejsu użytkownika potoku i obejmują sekundy zaległości, bajty zaległości, rekordy zaległości oraz pliki zaległości. Wykresy wyświetlają maksymalną wartość zagregowaną przez minutę, a podpowiedź wyświetla maksymalne wartości po najechaniu na wykres. Dane są ograniczone do ostatnich 48 godzin od bieżącego czasu.
Tabele w potoku, dla których są dostępne metryki strumieniowe, wyświetlają ikonę
podczas wyświetlania grafu potoku w widoku Graph interfejsu użytkownika. Aby wyświetlić metryki przesyłania strumieniowego, kliknij
, aby wyświetlić wykres metryki przesyłania strumieniowego na karcie Przepływy w okienku po prawej stronie. Filtr można również zastosować, aby wyświetlić tylko tabele z metrykami przesyłania strumieniowego, klikając pozycję Lista, a następnie klikając pozycję Ma metryki przesyłania strumieniowego.
Każde źródło przesyłania strumieniowego obsługuje tylko określone metryki. Metryki nieobsługiwane przez źródło przesyłania strumieniowego nie są dostępne do wyświetlenia w interfejsie użytkownika. W poniższej tabeli przedstawiono metryki dostępne dla obsługiwanych źródeł przesyłania strumieniowego:
| przesłać źródło | bajty zaległości | elementy zaległe | sekundy zaległości | Pliki zaległe |
|---|---|---|---|---|
| Kafka | ✓ | ✓ | ||
| Kinesis | ✓ | ✓ | ||
| Delta | ✓ | ✓ | ||
| Automatyczny ładownik | ✓ | ✓ | ||
| Google Pub/Sub (usługa przesyłania wiadomości) | ✓ | ✓ |