Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Uwaga
Wyszukiwanie AI platformy Azure jest dostępna za pośrednictwem portalu Azure, interfejsów API REST i Azure SDKs. Jest także podstawą Foundry IQ — zarządzanej warstwy wiedzy, która przekształca treści przedsiębiorstwa w bazy wiedzy wielokrotnego użytku z uwzględnieniem uprawnień dla agentów w portalu Microsoft Foundry.
Wyszukiwanie AI platformy Azure oferuje dwa modele cenowe, które obsługują pojemność inaczej:
Dedykowane: Zaplanuj pojemność, określając liczbę replik i partycji oraz wybierając warstwę usługi.
- Wstępnie aprowizuj przepustowość bezpośrednio za pomocą replik i partycji.
- Oszacuj wymaganą przestrzeń dyskową (partycje) i wymaganą przepustowość (repliki).
- Wybierz warstwę usługi, aby aprowizować wymaganą pojemność na podstawie oczekiwanego szczytowego zapotrzebowania.
- Po skonfigurowaniu pojemności z góry płacisz stawkę godzinową mierzoną według jednostek wyszukiwania (SU), niezależnie od użycia.
Bezserwerowy (wersja zapoznawcza): usługa automatycznie zarządza pojemnością na podstawie limitów użycia i usług. Nie musisz wcześniej przydzielać zasobów. Zamiast tego zoptymalizuj wydajność obciążenia, aby zarządzać kosztami.
- Wydajność skaluje się automatycznie wraz z zapotrzebowaniem (w okresach bezczynności może spaść do zera).
- Opłaty są naliczane na podstawie faktycznego zużycia mierzonego w jednostkach obliczeniowych (CU) i pamięci masowej.
- Zamiast infrastruktury planowanie koncentruje się na tych sterownikach kosztów: wzorce zapytań, rozmiar indeksu i wzrost oraz wzorce pozyskiwania danych. Zobacz Optymalizowanie kosztów dla modelu bezserwerowego.
| Wymiar | Dedykowana | Serverless |
|---|---|---|
| Model pojemności | Udostępnione (repliki × partycje) | Oparte na zużyciu |
| Scaling | Instrukcja | Automatycznie |
| Kontrola użytkownika | Jawne (konfigurowanie replik i partycji) | Pośrednio (zależy od charakterystyki obciążenia) |
| Fakturowanie | Stała stawka godzinowa za jednostki wyszukiwania (SU) | Płatności zależne od zużycia za jednostki obliczeniowe (CUs) i pamięć masową |
| Koszt bezczynności | Zawsze naliczane (minimalna przydzielona pojemność) | Skaluje się do zera w stanie bezczynności |
| Fokus optymalizacji | Ustalanie rozmiaru infrastruktury | Wydajność obciążenia |
| Najlepsze dla | Przewidywalne, stałe obciążenia | Zmienne, skokowe lub wielodostępne obciążenia, w tym scenariusze oparte na agentach |
| Podejście do planowania pojemności | Rozmiar i skalowanie infrastruktury (repliki i partycje) | Optymalizowanie wydajności obciążeń i wzorców użycia |
| Wpływ nieefektywności | Opóźnienie i ciśnienie skalowania | Bezpośredni wzrost kosztów |
Important
Warstwa bezserwerowa dewelopera jest obecnie dostępna w wersji zapoznawczej. Ta wersja zapoznawcza jest udostępniana bez umowy dotyczącej poziomu usług i nie jest zalecana w przypadku obciążeń produkcyjnych. Niektóre funkcje mogą nie być obsługiwane lub mogą mieć ograniczone możliwości. Aby uzyskać więcej informacji, zobacz Warunki dodatkowe korzystania z testowych wersji Microsoft Azure.
Rozliczenia dla warstwy Serverless Developer nie są jeszcze dostępne w fazie zapoznawczej. Szacowane koszty użycia są dostępne w portalu Azure i telemetrii, ale to użycie nie będzie wyświetlane na rachunku za Azure w tym okresie początkowym. Microsoft powiadomi z co najmniej 30-dniowym wyprzedzeniem przed rozpoczęciem naliczania opłat. Odroczenie rozliczeń w tej wersji zapoznawczej jest tymczasowe. Plan Serverless Developer jest płatny i będziesz odpowiadać za wszelkie opłaty naliczone po rozpoczęciu rozliczania.
Warstwa bezserwerowa dewelopera nie obsługuje migracji do lub z innych warstw cenowych, a niektóre funkcje dostępne w innych warstwach nie są obsługiwane w publicznej wersji zapoznawczej. Limity usług, obsługiwane funkcje i szczegóły cennika mogą ulec zmianie przed ogólną dostępnością.
Wersja zapoznawcza jest obecnie dostępna tylko w zachodnio-środkowych stanach USA, Szwajcarii Północnej i Japonii Wschodniej.
Aby dowiedzieć się więcej, zobacz instrukcje:
- Planowanie kosztów i zarządzanie nimi
- Wybieranie modelu cenowego i warstwy usług
- Optymalizowanie kosztów za pomocą modelu cen bezserwerowego
Planowanie pojemności dedykowanego modelu
W modelu dedykowanym udostępniasz zasoby przy użyciu jednostek wyszukiwania (SU):
- Jednostka wyszukiwania (SU) = repliki × partycje
- Replika: Kopie wyszukiwarki. Zapewnia przepływność zapytań i wysoką dostępność.
- Partycja: jednostki pamięci masowej. Zapewnia przepływność magazynowania i indeksowania.
Każda usługa zaczyna od 1 repliki × 1 partycji (1 jednostka SU). Repliki i partycje można dodawać lub usuwać niezależnie, aby uwzględnić zmienne obciążenia. Dodanie pojemności zwiększa koszt uruchamiania usługi wyszukiwania.
| Pojęcie | Definicja |
|---|---|
| Jednostka wyszukiwania | Pojedynczy przyrost całkowitej dostępnej pojemności. Do uruchomienia usługi jest wymagana co najmniej jedna jednostka wyszukiwania. W zależności od warstwy cenowej maksymalna wartość waha się od jednej do 36 jednostek. Liczba jednostek wyszukiwania jest równa liczbie replik pomnożonych przez liczbę partycji: R × P = SU. Każda usługa rozpoczyna się od jednej repliki i jednej partycji, która zużywa jedną jednostkę: 1 × 1 = 1. Dodanie drugiej repliki zużywa dwie jednostki: 2 × 1 = 2. Jednostka wyszukiwania jest również jednostką rozliczeniową dla usługi wyszukiwania. |
| Replika | Wystąpienia usługi wyszukiwania używane głównie do równoważenia obciążenia operacji zapytań. Każda replika hostuje jedną kopię indeksu. Jeśli przydzielasz trzy repliki, masz trzy kopie indeksu dostępne na potrzeby obsługi żądań zapytań. |
| Partycja | Pamięć fizyczna i operacje we/wy dla odczytu/zapisu (na przykład podczas odbudowywania lub odświeżania indeksu). Każda partycja ma fragment całkowitego indeksu. Jeśli przydzielisz trzy partycje, twój indeks zostanie podzielony na trzy części. |
Przejrzyj tabelę partycji i replik, aby znaleźć możliwe kombinacje, które pozostają poniżej limitu 36 jednostek.
Cechy fizyczne replik i partycji, takie jak szybkość przetwarzania i operacje we/wy dysku, różnią się w zależności od warstwy usługi. W standardowej usłudze wyszukiwania repliki i partycje są szybsze i większe niż w przypadku usługi bazowej.
Kiedy dodać pojemność dla modelu dedykowanego
Rozważ dodanie replik lub partycji, gdy:
- Zwiększa się opóźnienie wykonywania zapytań lub kryteria umowy SLA nie są spełnione.
- Częstotliwość występowania błędów HTTP 503 (usługa niedostępna) zwiększa się.
- Częstotliwość błędów HTTP 429 (zbyt wiele żądań) wzrasta, co wskazuje na ograniczanie żądań.
- Duże woluminy zapytań są oczekiwane.
- Zadania indeksowania działają wolno lub nie nadążają.
- Przepustowość magazynu danych lub indeksowania jest niewystarczająca.
Wskazówki dotyczące skalowania:
- Dodaj repliki , aby zwiększyć przepływność i dostępność zapytań.
- Dodaj partycje , aby zwiększyć wydajność magazynu i indeksowania.
- Obciążenia o dużej liczbie zapytań zwykle wymagają większej liczby replik.
- Duże indeksy mogą wymagać dodatkowych replik w celu zachowania wydajności.
Important
Operacje skalowania mogą zająć trochę czasu i zwiększyć koszty. Zawsze weryfikuj zmiany przy użyciu testów wydajnościowych i oszacowań cen.
Wybrana warstwa usługi określa rozmiar partycji i szybkość. Każda warstwa jest zoptymalizowana pod kątem zestawu cech pasujących do różnych scenariuszy. Jeśli wybierzesz warstwę wyższej klasy, może być potrzebna mniejsza liczba partycji niż w przypadku korzystania z warstwy S1. Jednym z pytań, na które należy odpowiedzieć za pomocą samodzielnego testowania, jest to, czy większa i droższa partycja daje lepszą wydajność niż dwie tańsze partycje w usłudze aprowizowanej w niższej warstwie.
Pojedyncza usługa musi mieć wystarczające zasoby do obsługi wszystkich obciążeń (indeksowania i zapytań). Żadne obciążenie nie jest uruchamiane w tle. Indeksowanie można zaplanować w czasie, gdy żądania zapytań są naturalnie rzadziej spotykane, ale usługa nie określa priorytetu jednego zadania na innym. Ponadto pewna ilość nadmiarowości łagodzi wydajność zapytań, gdy wewnętrznie aktualizowane są usługi lub węzły.
Ogólnie rzecz biorąc, aplikacje wyszukiwania zwykle potrzebują większej liczby replik niż partycji, zwłaszcza gdy operacje usług są skierowane na obciążenia zapytań. Każda replika jest kopią indeksu, więc usługa może równoważyć obciążenie żądań względem wielu kopii. Wyszukiwanie AI platformy Azure zarządza wszystkimi równoważeniami obciążenia i replikacją indeksu. W dowolnym momencie możesz zmienić liczbę replik przydzielonych dla usługi. W standardowej usłudze wyszukiwania można przydzielić maksymalnie 12 replik, a w podstawowej usłudze wyszukiwania 3 repliki. Alokację repliki można utworzyć z portalu Azure lub jednej z opcji programowych.
Dodatkowe partycje są przydatne w przypadku intensywnych obciążeń indeksowania. Dodatkowe partycje rozkładają operacje odczytu i zapisu w większej liczbie zasobów obliczeniowych.
Na koniec wykonywanie zapytań o większe indeksy trwa dłużej. W związku z tym może się okazać, że każdy kolejny wzrost liczby partycji wymaga mniejszego, ale proporcjonalnego zwiększenia liczby replik. Złożoność zapytań oraz ich wolumin wpływają na to, jak szybko następuje wykonanie zapytań.
Aby uzyskać informacje o limitach usług i prawidłowych zakresach skalowania, zobacz:
Uwaga
Dodanie większej liczby replik lub partycji zwiększa koszt działania usługi i może wprowadzać niewielkie różnice w sposobie porządkowenia wyników. Pamiętaj, aby sprawdzić kalkulator cen, aby zrozumieć implikacje dotyczące rozliczeń dodawania kolejnych węzłów. Tabela kombinacji partycji i replik może pomóc w porównaniu liczby jednostek wyszukiwania wymaganej dla określonej konfiguracji. Aby uzyskać więcej informacji na temat wpływu dodatkowych replik na przetwarzanie zapytań, zobacz Porządkowanie wyników.
Jak zarządzać pojemnością i dostosowywać je
Zmiana pojemności nie jest natychmiastowa. W zależności od ilości danych i typu operacji skalowanie może potrwać od kilku minut do kilku godzin.
Podczas skalowania usługi wyszukiwania można wybrać spośród następujących narzędzi i metod:
Uwaga
Jeśli usługa wyszukiwania została utworzona przed kwietniem lub majem 2024 r., może kwalifikować się do jednorazowego uaktualnienia do nowszej infrastruktury z większymi rozmiarami partycji bez dodatkowych kosztów. Ta aktualizacja może zwiększyć dostępną przestrzeń dyskową na każdą partycję i zmniejszyć liczbę partycji wymaganych przez dane obciążenie robocze. Aby uzyskać więcej informacji, zobacz Uaktualnianie usługi wyszukiwania.
Aby zwiększyć lub zmniejszyć pojemność usługi, dostępne są dwie opcje:
Dodawanie lub usuwanie partycji i replik
Przejdź do usługi wyszukiwania w portalu Azure.
W okienku po lewej stronie wybierz Ustawienia>Skala.
Poniższy zrzut ekranu przedstawia aprowizowaną usługę Standard z jedną repliką i partycją. Formuła u dołu wskazuje liczbę używanych jednostek wyszukiwania (1). Jeśli cena jednostkowa wynosiła 100 USD (a nie rzeczywista cena), miesięczny koszt działania tej usługi wyniesie średnio 100 USD.
Użyj suwaka, aby zwiększyć lub zmniejszyć liczbę partycji, a następnie wybierz pozycję Zapisz.
W tym przykładzie dodano drugą replikę i partycję. Zwróć uwagę na liczbę jednostek wyszukiwania, teraz wynosi cztery, ponieważ formuła rozliczeniowa to liczba replik pomnożona przez liczbę partycji (2 x 2). Podwojenie pojemności ponad dwukrotnie zwiększa koszt działania usługi. Jeśli koszt jednostki wyszukiwania wynosił 100 USD, nowy miesięczny rachunek będzie teraz wynosić 400 USD.
W przypadku bieżących kosztów jednostkowych każdej warstwy odwiedź stronę cennika.
Sprawdź powiadomienia, aby potwierdzić, że operacja została uruchomiona.
Wykonanie tej operacji może potrwać kilka godzin. Występuje w tle, więc usługa wyszukiwania pozostaje w pełni operacyjna i dostępna dla operacji odczytu i zapisu.
Nie można anulować operacji ani monitorować jej postępu. Jednak następujący komunikat jest wyświetlany, gdy zmiany są w toku.
Zmienianie warstwy cenowej
Uwaga
Portal Azure i Services — update (interfejs API REST) obsługują zmiany między warstwami Podstawowa i Standardowa (S1, S2 i S3). Możesz uaktualnić lub obniżyć warstwy, jeśli bieżąca konfiguracja usługi nie przekracza limitów warstwy docelowej. Region nie może również mieć ograniczeń pojemności w warstwie docelowej.
Poziom cenowy określa maksymalną pojemność pamięci masowej usługi wyszukiwania w dedykowanym modelu cenowym. Jeśli potrzebujesz większej lub mniejszej pojemności, możesz przełączyć się na inną warstwę cenową, która odpowiada potrzebom magazynu. (Dotyczy to tylko warstw dedykowanego modelu cenowego. Nie można zmienić warstwy dewelopera modelu bezserwerowego po wybraniu).
Oprócz pojemności warstwy cenowe określają limity indeksów, indeksatorów i innych obiektów wyszukiwania. Przed kontynuowaniem porównaj limity usługi dla bieżącego poziomu i pożądanego poziomu. Ogólnie rzecz biorąc, przełączenie do wyższej warstwy zwiększa limit magazynu i limit wektora, zwiększa przepływność żądań i zmniejsza opóźnienie, podczas gdy przełączanie do niższej warstwy ma odwrotny efekt.
Przejście do wyższej warstwy cenowej zwiększa również koszt uruchamiania usługi wyszukiwania. Aby uzyskać więcej informacji, zobacz stronę z cennikiem.
Aby zmienić warstwę cenową:
Przejdź do usługi wyszukiwania w portalu Azure.
W okienku po lewej stronie wybierz Ustawienia>Skala.
Na bieżącym poziomie wybierz Zmień poziom cenowy.
Na stronie Wybieranie warstwy cenowej wybierz inną warstwę z listy.
Można przełączać się między warstwami Podstawowa, S1, S2 i S3, ale nie można przełączyć się na lub z warstwy Bezpłatna, S3HD, L1 lub L2. Te poziomy nie są wybierane i są wyświetlane jako wygaszone.
Aby rozpocząć operację skalowania, wybierz pozycję Zapisz.
Wykonanie tej operacji może potrwać kilka godzin. Występuje w tle, więc usługa wyszukiwania pozostaje w pełni operacyjna i dostępna dla operacji odczytu i zapisu.
Nie można anulować operacji ani monitorować jej postępu. Jednak następujący komunikat jest wyświetlany, gdy zmiany są w toku.
Sposób obsługi żądań skalowania dla modelu dedykowanego
Gdy usługa wyszukiwania odbiera żądanie skalowania, to:
- Sprawdza, czy żądanie jest prawidłowe.
- Rozpoczyna tworzenie kopii zapasowych danych i informacji systemowych.
- Sprawdza, czy usługa jest już w stanie udostępniania (aktualnie dodaje lub usuwa repliki czy partycje).
- Rozpoczyna konfigurowanie.
Skalowanie usługi może potrwać od kilku minut do kilku godzin, w zależności od rozmiaru usługi i zakresu żądania. Czas trwania kopii zapasowej różni się również w zależności od ilości danych i liczby partycji i replik.
Poprzednie kroki nie następują całkowicie jeden po drugim. Na przykład, system rozpoczyna konfigurowanie, gdy można to bezpiecznie zrobić, co może się zdarzyć, gdy kopia zapasowa się kończy.
Błędy podczas skalowania
W poniższej tabeli wymieniono przyczyny i rozwiązania błędów, które mogą wystąpić podczas operacji skalowania.
| Komunikat o błędzie | Przyczyna | Rozwiązanie |
|---|---|---|
| "Operacje aktualizacji usługi nie są obecnie dozwolone, ponieważ przetwarzamy poprzednie żądanie". | Trwa inna operacja skalowania. | Sprawdź stronę |
| Nie można skalować usługi wyszukiwania servicename. Błąd: Liczba obiektówActualCount przekracza dozwolony limit: MaximumCount". | Bieżąca konfiguracja usługi przekracza limity docelowej warstwy cenowej. | Sprawdź, czy sposób wykorzystania magazynu, użycie wektorów, indeksy, indeksatory i inne obiekty mieszczą się w granicach usługi niższego poziomu. Na przykład warstwa Podstawowa obsługuje maksymalnie 15 indeksów, więc nie można przełączyć się z warstwy S1 na Podstawowa, jeśli masz 16 indeksów. Dostosuj zasoby przed ponowną próbą. |
1 Kopie zapasowe nie mają statusu, ponieważ są to operacje wewnętrzne, które raczej nie zakłócą procesu skalowania.
2 Jeśli usługa wyszukiwania wydaje się być zatrzymana w stanie aprowizacji, sprawdź, czy osierocone indeksy są nieużywane, z zerowym wolumenem zapytań i bez aktualizacji indeksów. Indeks bezużyteczny może blokować zmiany pojemności usługi. W szczególności poszukaj indeksów zaszyfrowanych za pomocą klucza cmK , których klucze nie są już prawidłowe. Usuń indeks lub przywróć klucze, aby przywrócić indeks do trybu online i odblokować operację skalowania.
Kombinacje partycji i replik
Poniższy wykres dotyczy poziomu Standardowego i wyższych. Przedstawia wszystkie możliwe kombinacje partycji i replik, które podlegają maksymalnej liczbie 36 jednostek wyszukiwania na usługę.
| 1 partycja | 2 partycje | 3 partycje | 4 partycje | 6 partycji | 12 partycji | |
|---|---|---|---|---|---|---|
| 1 replika | 1 SU | 2 SU | 3 SU | 4 SU | 6 SU | 12 SU |
| 2 repliki | 2 SU | 4 SU | 6 SU | 8 SU | 12 SU | 24 SU |
| 3 repliki | 3 SU | 6 SU | 9 SU | 12 SU | 18 SU | 36 SU |
| 4 repliki | 4 SU | 8 SU | 12 SU | 16 SU | 24 SU | Nie dotyczy |
| 5 replik | 5 SU | 10 SU | 15 jednostek | 20 SU | 30 SU | Nie dotyczy |
| 6 kopii | 6 SU | 12 SU | 18 SU | 24 SU | 36 SU | Nie dotyczy |
| 12 replik | 12 SU | 24 SU | 36 SU | Nie dotyczy | Nie dotyczy | Nie dotyczy |
Podstawowe usługi wyszukiwania mają niższe liczby jednostek wyszukiwania.
W usługach wyszukiwania utworzonych przed 3 kwietnia 2024 r. Podstawowe usługi mogą mieć dokładnie jedną partycję i maksymalnie trzy repliki, co daje maksymalny limit trzech jednostek usługowych. Jedynym regulowanym zasobem są repliki. Możesz jednak zwiększyć liczbę partycji, uaktualniając usługę.
W przypadku usług wyszukiwania utworzonych po 3 kwietnia 2024 r. w obsługiwanych regionach usługi podstawowe mogą mieć maksymalnie trzy partycje i trzy repliki. Maksymalny limit SU wynosi dziewięć, aby zapewnić pełen zestaw partycji i replik.
W przypadku usług wyszukiwania w dowolnej warstwie rozliczanej, niezależnie od daty utworzenia, potrzebujesz co najmniej dwóch replik, aby zapewnić wysoką dostępność zapytań.
Aby uzyskać informacje o stawkach rozliczeniowych za warstwę i walutę, zobacz stronę z cennikiem Wyszukiwanie AI platformy Azure.
Szacowanie pojemności przy użyciu dedykowanej warstwy modelu cenowego
Twoje zapotrzebowanie na przestrzeń dyskową zależy od rozmiaru indeksów, które planujesz utworzyć. Nie ma żadnych solidnych heurystyki ani ogólnych wytycznych, które pomagają oszacować. Jedynym sposobem określenia rozmiaru indeksu jest utworzenie go. Jego rozmiar zależy od tokenizacji i osadzania oraz tego, czy włączasz sugestory, filtrowanie i sortowanie, czy też można korzystać z kompresji wektorów.
Oszacuj pojemność w płatnej warstwie Podstawowa lub wyższej. Warstwa Bezpłatna działa na zasobach fizycznych współużytkowanych przez wielu klientów i podlega czynnikom poza Twoją kontrolą. Tylko dedykowane zasoby rozliczanej usługi wyszukiwania mogą pomieścić większe czasy próbkowania i przetwarzania w celu uzyskania bardziej realistycznych szacunków ilości indeksu, rozmiaru i woluminów zapytań podczas opracowywania.
Przejrzyj limity usług w każdej warstwie , aby określić, czy niższe warstwy mogą obsługiwać wymaganą liczbę indeksów. Zastanów się, czy potrzebujesz wielu kopii indeksu do aktywnego programowania, testowania i produkcji.
Usługa wyszukiwania podlega limitom obiektów (maksymalna liczba indeksów, indeksatorów, zestawów umiejętności itd.) i limitach magazynu. Niezależnie od tego, który limit zostanie osiągnięty jako pierwszy, jest obowiązującą granicą.
Utwórz usługę na płatnej warstwie. Warstwy są zoptymalizowane pod kątem specyficznych obciążeń. Na przykład warstwa zoptymalizowana dla magazynowania ma limit 10 indeksów, ponieważ jest przeznaczona do wspierania niewielkiej liczby dużych indeksów.
Zacznij od niskiego poziomu w warstwie Podstawowa lub S1, jeśli nie masz pewności co do przewidywanego obciążenia.
Rozpocznij od wysokiego poziomu, przy S2 lub nawet S3, jeśli testowanie obejmuje indeksowanie na dużą skalę i obciążenia zapytań.
Zacznij od opcji zoptymalizowanej do przechowywania na poziomie L1 lub L2, jeśli indeksujesz dużą ilość danych i obciążenie zapytań jest stosunkowo niskie, jak w przypadku wewnętrznej aplikacji biznesowej.
Skompiluj początkowy indeks , aby określić, jak dane źródłowe przekładają się na indeks. Jest to jedyny sposób oszacowania rozmiaru indeksu. Atrybuty definicji pól mają wpływ na wymagania dotyczące magazynu fizycznego:
W przypadku wyszukiwania słów kluczowych oznaczanie pól jako możliwych do filtrowania i sortowania zwiększa rozmiar indeksu.
W przypadku wyszukiwania wektorowego można ustawić parametry w celu zmniejszenia rozmiaru wektora.
Monitorowanie magazynu, limitów usługi, woluminu zapytań i opóźnienia w portalu Azure. Portal Azure wyświetla liczbę zapytań na sekundę, zapytania z ograniczoną przepustowością i opóźnienie wyszukiwania. Te wartości mogą pomóc Ci ocenić, czy wybrany poziom jest odpowiedni.
Dodaj repliki pod kątem wysokiej dostępności lub aby ograniczyć niską wydajność zapytań.
Nie ma żadnych wytycznych dotyczących liczby replik potrzebnych do obsługi obciążeń zapytań. Wydajność zapytań zależy od złożoności zapytania i konkurencyjnych obciążeń. Chociaż dodawanie replik wyraźnie skutkuje lepszą wydajnością, wynik nie jest ściśle liniowy: dodanie trzech replik nie gwarantuje potrójnej przepływności. Aby uzyskać wskazówki dotyczące szacowania QPS dla rozwiązania, zobacz Analizowanie zapytań dotyczących wydajności i monitorowania.
W przypadku odwróconego indeksu rozmiar i złożoność są określane przez zawartość, a niekoniecznie przez ilość danych, które są do niego wprowadzane. Duże źródło danych o wysokiej nadmiarowości może spowodować mniejszy indeks niż mniejszy zestaw danych zawierający wysoce zmienną zawartość. Dlatego rzadko można wywnioskować rozmiar indeksu na podstawie rozmiaru oryginalnego zestawu danych.
Wymagania dotyczące magazynu można zawyżać, jeśli uwzględniasz dane, które nigdy nie są wyszukiwane. Najlepiej, aby dokumenty zawierały tylko dane potrzebne do wyszukiwania.
Zagadnienia dotyczące umowy dotyczącej poziomu usług
Umowy dotyczące poziomu usług (SLA) nie obejmują warstwy Bezpłatna i funkcji w wersji zapoznawczej. W przypadku wszystkich rozliczanych poziomów, umowy SLA wchodzą w życie po zapewnieniu wystarczającej redundancji dla usługi.
Co najmniej dwie repliki spełniają SLA dotyczące zapytań (odczyt).
Trzy lub więcej replik spełnia wymagania SLA dotyczące zapytań i indeksowania (odczyt-zapis).
Liczba partycji nie wpływa na umowy o poziomie usług (SLA).
Optymalizowanie kosztów modelu bezserwerowego
W modelu cen bezserwerowym:
- Usługa automatycznie zarządza pojemnością.
- Nie trzeba konfigurować replik, partycji ani jednostek wyszukiwania.
- Obliczenia są skalowane dynamicznie w oparciu o obciążenie (zapotrzebowanie na zapytania i indeksowanie) i mogą być skalowane do zera w przypadku bezczynności.
Aby dowiedzieć się więcej na temat ograniczeń modelu bezserwerowego, zobacz Limity usług.
Rozliczenia są oparte na dwóch wymiarach:
- Użycie zasobów obliczeniowych (CU): Opłata jest naliczana na podstawie operacji zapytań i indeksowania.
- Pamięć indeksowana: Naliczana opłata za każdy GB miesięcznie.
Ponieważ rozliczenia są oparte na użyciu, koszt jest bezpośrednio związany z użyciem:
- Złożone zapytania zużywają więcej zasobów obliczeniowych.
- Nieefektywny projekt schematu zwiększa zarówno indeksowanie, jak i koszty zapytań.
- Słabe wzorce zapytań z dużymi lub często aktualizowanymi indeksami zwiększają użycie magazynu i zasobów obliczeniowych.
Optymalizowanie wydajności obciążeń
Ponieważ nieefektywność jest wyświetlana jako koszt w modelu bezserwerowym, płacisz więcej za tę samą pracę, jeśli nie ćwiczysz projektowania obsługującego obciążenia. Najlepszym sposobem kontrolowania wydatków bezserwerowych jest efektywne projektowanie indeksów i zapytań od samego początku.
Aby zaprojektować obciążenia pod kątem wydajności w przypadku korzystania z modelu cen bezserwerowego, rozważ:
Projekt indeksu
- Uwzględnij tylko pola używane w zapytaniach.
- Zmniejsz wymiary wektorów tam, gdzie to możliwe.
- Unikaj niepotrzebnych atrybutów służących do filtrowania, sortowania lub fasetowania.
Wzorce zapytań
- Użyj polecenia
$select, aby ograniczyć zwracane pola. - Zastosuj filtry wcześnie, aby zmniejszyć liczbę zestawów wyników.
- Unikaj głębokiej paginacji (
$skip). - Preferuj zapytania docelowe w przypadku szerokich zapytań pełnotekstowych.
- Ostrożnie używaj wyszukiwania hybrydowego ze względu na wyższy koszt obliczeniowy.
Monitoring
- Monitoruj zużycie jednostek obliczeniowych (CU), aby identyfikować kosztowne zapytania.
- Śledzenie wzrostu magazynu i usuwanie nieużywanych danych.
W przypadku bezserwerowych zwiększanie wydajności (szybsze, bardziej ukierunkowane zapytania) zwykle zmniejsza koszty.
Aby dowiedzieć się więcej, zobacz Optymalizacja kosztów przy użyciu bezserwerowego modelu cenowego w Wyszukiwanie AI platformy Azure.
Zagadnienia dotyczące pojemności regionalnej
Pojemność i dostępność mogą się różnić w zależności od obsługiwanego regionu. Niektóre regiony mogą mieć ograniczenia dotyczące aprowizowania nowych usług lub skalowania istniejących.
Uwaga
W publicznej wersji zapoznawczej model cen bezserwerowy jest dostępny tylko w ograniczonym zestawie regionów. Zobacz powiadomienie o wersji zapoznawczej na początku tego artykułu.
Jeśli preferowany region Wyszukiwanie AI platformy Azure jest niedostępny z powodu ograniczeń pojemności, zobacz Jak obsługiwać ograniczenia pojemności regionalnej w Wyszukiwanie AI platformy Azure.