Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Note
Wyszukiwanie AI platformy Azure jest dostępna za pośrednictwem portalu Azure, interfejsów API REST i Azure SDKs. Jest także podstawą Foundry IQ — zarządzanej warstwy wiedzy, która przekształca treści przedsiębiorstwa w bazy wiedzy wielokrotnego użytku z uwzględnieniem uprawnień dla agentów w portalu Microsoft Foundry.
Wyszukiwanie AI platformy Azure jest dostępny w dwóch modelach cenowych:
Dedykowane: aprowizowana pojemność z stałymi cenami. Wybierasz warstwę usługi, a opłata jest naliczana co godzinę na podstawie jednostek wyszukiwania (SU). Najlepsze dla stałych, przewidywalnych obciążeń o wysokim wykorzystaniu.
Serverless (wersja zapoznawcza): cennik oparty na zużyciu, naliczany na podstawie jednostek obliczeniowych na godzinę (CU/hr) oraz za GB/miesiąc w przypadku indeksowanego magazynowania. Najlepsze do rzadkich, skokowych lub bardzo zmiennych obciążeń.
W tym artykule wyjaśniono, jak rozliczenia działają w ramach każdego modelu i zawierają wskazówki dotyczące szacowania kosztów, minimalizowania i monitorowania.
Omówienie modelu cen
Wyszukiwanie AI platformy Azure ma dwa podstawowe modele cenowe: Dedykowane i Bezserwerowe. Oba modele wiążą się z oddzielnymi opłatami za funkcje premium, takie jak ranking semantyczny, wyszukiwanie agentowe i wzbogacanie za pomocą AI.
Wyszukiwanie AI platformy Azure opłaty są jednym ze składników ogólnego rachunku Azure. Opłaty są naliczane za wszystkie usługi i zasoby Azure używane w ramach subskrypcji, w tym usługi poza Wyszukiwanie AI platformy Azure.
W przypadku usług dedykowanych użyj kalkulatora cen Azure aby oszacować koszty na podstawie planowanej capacity i funkcji. Arkusz planowania pojemności może pomóc w modelowaniu oczekiwanego rozmiaru indeksu, przepustowości indeksowania i kosztów indeksowania.
W miarę rozwoju obciążenia wyszukiwania postępuj zgodnie z tymi wskazówkami, aby zminimalizować koszty zarówno podczas wdrażania, jak i operacji. Możesz również użyć wbudowanych metryk do monitorowania żądań zapytań i usługi Cost Management w celu tworzenia budżetów, alertów i eksportów danych.
Dedykowany model cen
Podczas tworzenia lub korzystania z dedykowanej usługi wyszukiwania płacisz za minimalną wymaganą kombinację replik i partycji (R × P) według proporcjonalnej stawki godzinowej dla wybranego poziomu usługi. Każda kombinacja replik i partycji reprezentuje jednostkę pojemności dedykowanej.
Aby uzyskać więcej informacji na temat dostępnych warstw usług, zobacz Wybieranie modelu cenowego i warstwy usług.
W miarę zwiększania lub zmniejszania liczby replik lub partycji łączna liczba jednostek wyszukiwania zmienia się, a koszty odpowiednio się zmieniają. Aby uzyskać więcej informacji i przykładów, zobacz Stawki rozliczeniowe.
Model cen bezserwerowych (wersja zapoznawcza)
Ważna
Warstwa bezserwerowa dewelopera jest obecnie dostępna w wersji zapoznawczej. Ta wersja zapoznawcza jest udostępniana bez umowy dotyczącej poziomu usług i nie jest zalecana w przypadku obciążeń produkcyjnych. Niektóre funkcje mogą nie być obsługiwane lub mogą mieć ograniczone możliwości. Aby uzyskać więcej informacji, zobacz Warunki dodatkowe korzystania z testowych wersji Microsoft Azure.
Rozliczenia dla warstwy Serverless Developer nie są jeszcze dostępne w fazie zapoznawczej. Szacowane koszty użycia są dostępne w portalu Azure i telemetrii, ale to użycie nie będzie wyświetlane na rachunku za Azure w tym okresie początkowym. Microsoft powiadomi z co najmniej 30-dniowym wyprzedzeniem przed rozpoczęciem naliczania opłat. Odroczenie rozliczeń w tej wersji zapoznawczej jest tymczasowe. Plan Serverless Developer jest płatny i będziesz odpowiadać za wszelkie opłaty naliczone po rozpoczęciu rozliczania.
Warstwa bezserwerowa dewelopera nie obsługuje migracji do lub z innych warstw cenowych, a niektóre funkcje dostępne w innych warstwach nie są obsługiwane w publicznej wersji zapoznawczej. Limity usług, obsługiwane funkcje i szczegóły cennika mogą ulec zmianie przed ogólną dostępnością.
Wersja zapoznawcza jest obecnie dostępna tylko w zachodnio-środkowych stanach USA, Szwajcarii Północnej i Japonii Wschodniej.
Model cenowy Serverless rozlicza opłaty na podstawie wykorzystania, bez wstępnie aprowizowanych ani bezczynnych zasobów. Płacisz tylko za zasoby obliczeniowe używane przez operacje i magazyn używany przez indeksy.
W przeciwieństwie do modelu dedykowanego nie konfigurujesz replik ani partycji. Usługa automatycznie zarządza pojemnością na podstawie zapotrzebowania na obciążenia i limitów usług.
Rozliczenia bezserwerowe mają dwa niezależne wymiary:
Obliczenia (jednostki obliczeniowe, CU):
Użycie zasobów obliczeniowych jest mierzone w jednostkach obliczeniowych na godzinę (jednostki CU/godz.). Koszt obliczeniowy jest spowodowany czynnikami, takimi jak złożoność zapytania, rozmiar indeksu, ilość danych i typ operacji (zapytania, indeksowanie lub wzbogacanie).Pamięć indeksowana:
Opłata za pamięć masową jest naliczana za każdy GB miesięcznie na podstawie rozmiaru Twoich indeksów na dysku. Ten rozmiar obejmuje indeksowaną zawartość i pomocnicze struktury danych używane do pobierania.
Jak są naliczane opłaty za funkcje w warstwie Premium
Funkcje Premium generują opłaty oprócz opłat za zasoby obliczeniowe i magazyn dla usługi wyszukiwania, niezależnie od tego, czy korzystasz z modelu cen dedykowanego, czy bezserwerowego.
W poniższej tabeli wymieniono funkcje w warstwie Premium i ich jednostki rozliczeniowe. Wszystkie te funkcje są opcjonalne, więc jeśli ich nie używasz, nie zostaną naliczone żadne opłaty.
| Feature | Jednostka rozliczeniowa |
|---|---|
| Wyodrębnianie obrazów (wzbogacanie sztucznej inteligencji) 1 | Na 1000 obrazów. Zobacz stronę z cennikiem. |
| Funkcja wyszukiwania jednostek niestandardowych (wzbogacanie AI) | Na 1000 rekordów tekstowych. Zobacz stronę cennika |
| Wbudowane lub niestandardowe umiejętności (wzbogacanie sztucznej inteligencji) 2 | Liczba transakcji. Rozliczane według stawki dostawcy modelu: Microsoft Foundry lub modeli bądź zasobów hostowanych na platformie Azure. |
| Vectorizers2 | Liczba operacji wektoryzacji. Rozliczane według stawki dostawcy modelu: Usługa Azure Vision w narzędziach Foundry Tools, Azure OpenAI lub Foundry. |
| Ranga semantyczna | Liczba zapytań queryType=semantic. Rozliczane według progresywnej stawki. Zobacz stronę z cennikiem. |
| Przywoływanie agentowe | Liczba tokenów rozumowania agentów oraz liczba tokenów używanych w planowaniu zapytań i formułowaniu odpowiedzi. Zobacz stronę z cennikiem. |
| Udostępniony link prywatny | Rozliczana za przepustowość , o ile istnieje współużytkowany link prywatny i jest używany. |
1 Odnosi się do obrazów wyekstrahowanych z pliku w potoku indeksatora. Wyodrębnianie tekstu jest darmowe. Wyodrębnianie obrazów jest rozliczane po włączeniu parametru indexAction lub przy wywołaniu funkcji wyodrębniania dokumentów.
2 Opłaty za modele Azure OpenAI i modele Foundry pojawiają się na Twoim rachunku za te usługi.
Jak inaczej naliczane są opłaty
W zależności od konfiguracji i użycia mogą obowiązywać następujące opłaty:
Ruch danych może wiązać się z kosztami sieci. Zobacz cennik przepustowości.
Kilka funkcji premium, takich jak magazyny wiedzy, sesje debugowania1 i pamięci podręczne wzbogacania, opiera się na usłudze Azure Storage i powoduje naliczanie opłat za magazynowanie. Opłaty za te funkcje są wyświetlane na rachunku za usługę Azure Storage.
Klucze zarządzane przez klienta, które zapewniają podwójne szyfrowanie poufnej zawartości, wymagają rozliczanej usługi Azure Key Vault.
Zestaw umiejętności może obejmować rozliczane wbudowane umiejętności, niepodlegające rozliczeniu wbudowane umiejętności użytkowe i umiejętności niestandardowe. Niefakturowalne umiejętności narzędziowe obejmują Warunkowe, Kształtowanie, Scalanie tekstu i Podział tekstu. Nie mają wymogu posiadania klucza API ani limitu do 20 dokumentów.
Niestandardowa umiejętność to funkcjonalność, którą udostępniasz. Umiejętności niestandardowe są rozliczane tylko wtedy, gdy korzystają z innych usług płatnych. Nie mają wymogu posiadania klucza API ani limitu do 20 dokumentów.
1 Sesje debugowania są dostępne tylko w usługach dedykowanego modelu cenowego.
Note
W przypadku usług dedykowanych nie są naliczane opłaty za zapytanie. Jednak limity usług mają zastosowanie do każdej warstwy cenowej. W trybie bezserwerowym zapytania zużywają CU/hr w zależności od złożoności i rozmiaru indeksu.
Szacowanie i planowanie kosztów dla modelu cen dedykowanego
Aby oszacować koszty modelu cen dedykowanego, użyj kalkulatora cen Azure aby oszacować koszty bazowe dla Wyszukiwanie AI platformy Azure. Szacowane koszty i porównania warstw można również znaleźć na stronie Wybieranie warstwy cenowej podczas tworzenia usługi.
Na potrzeby początkowego testowania dedykowanego modelu cenowego utwórz arkusz planowania pojemności. Arkusz pomaga zrozumieć stosunek indeksu do źródła oraz wpływ funkcji wzbogacania lub wektorów zarówno na pojemność, jak i koszt.
Aby utworzyć arkusz planowania pojemności:
Zaindeksuj niewielką próbkę (od 1 do 5%) danych. Uwzględnij dowolne umiejętności OCR, wzbogacanie lub osadzanie, których planujesz użyć.
Zmierzyć rozmiar indeksu, przepustowość indeksowania i koszty indeksowania.
Ekstrapoluj wyniki, aby oszacować wymagania dotyczące pełnej skali danych.
Szacowanie i planowanie kosztów dla modelu cen bezserwerowego
Aby oszacować koszty w środowisku Serverless i nimi zarządzać, monitoruj zarówno zużycie mocy obliczeniowej, jak i rozmiar indeksu, oraz optymalizuj zapytania i projekt schematu danych, aby zmniejszyć zużycie zasobów.
Najpierw zaindeksuj reprezentatywną próbkę, a następnie uruchom typowe zapytania i zmierz zużycie CU za pomocą x-ms-request-charge. Gdy masz już średnie zużycie, oszacuj koszty na podstawie tej średniej. Aby uzyskać wskazówki dotyczące monitorowania użycia zasobów obliczeniowych, zobacz Optymalizowanie kosztów za pomocą modelu cen bezserwerowego.
Minimalizowanie kosztów modelu cen dedykowanego
Aby zminimalizować koszty modelu cen dedykowanego, użyj następujących strategii:
Wdrażanie i konfiguracja
Utwórz usługę wyszukiwania w regionie z większą ilością miejsca na partycję.
Utwórz wszystkie powiązane zasoby platformy Azure w tym samym regionie (lub jak najwięcej regionów), aby zminimalizować lub wyeliminować opłaty za przepustowość.
Wybierz najjaśniejszą warstwę usługi , która spełnia Twoje potrzeby. Basic i S1 oferują pełny dostęp do nowoczesnego interfejsu API przy najniższej stawce godzinowej za SU. * W przypadku obciążeń ze zmiennym ruchem lub nagłymi skokami ruchu model cenowy Serverless może być bardziej opłacalny kosztowo niż stale aprowizowana usługa w warstwie Basic lub S1.
Użyj usługi Azure Web Apps dla aplikacji front-end, aby utrzymać żądania i odpowiedzi w obrębie centrum danych.
Scaling
Dodaj partycje tylko wtedy, gdy rozmiar indeksu lub przepustowość przetwarzania danych tego wymaga.
Dodaj repliki tylko wtedy, gdy liczba zapytań na sekundę wzrasta, gdy złożone zapytania spowalniają działanie usługi, lub gdy wymagana jest wysoka dostępność.
Zwiększ skalę dla operacji intensywnie korzystających z zasobów, takich jak indeksowanie, a następnie zmniejsz skalę dla regularnych obciążeń zapytań.
Pisanie kodu w celu zautomatyzowania skalowania pod kątem przewidywalnych wzorców obciążeń.
Pamiętaj, że pojemność i ceny nie są liniowe. Podwojenie pojemności zwiększa koszty więcej niż dwukrotnie na tym samym poziomie. Aby uzyskać lepszą wydajność w podobnej cenie, rozważ przejście na wyższy pakiet.
Indeksowanie i wzbogacanie
Indeksowanie przyrostowe umożliwia przetwarzanie tylko nowych lub zmienionych danych.
Buforowanie wzbogacania i magazyn wiedzy umożliwiają ponowne użycie wcześniej wzbogaconej zawartości. Chociaż buforowanie wiąże się z opłatą za magazyn, obniża skumulowany koszt wzbogacania sztucznej inteligencji.
Zachowaj kompaktowe ładunki wektorów. Dla wyszukiwania wektorowego sprawdź najlepsze praktyki dotyczące kompresji wektorów.
Minimalizowanie kosztów modelu cen bezserwerowego
Aby zminimalizować koszty modelu cen dedykowanego, użyj następujących strategii:
- Monitoruj telemetrię CU/hr, aby identyfikować kosztowne zapytania.
- Użyj najprostszego typu zapytania spełniającego wymagania dotyczące istotności.
- Usuń nieużywane indeksy, aby zmniejszyć koszty magazynowania.
Dowiedz się więcej: Optymalizowanie kosztów za pomocą modelu cen bezserwerowego.
Monitorowanie kosztów
Na poziomie usługi można monitorować wbudowane metryki dla zapytań na sekundę (QPS), opóźnienie wyszukiwania, ograniczone zapytania i rozmiar indeksu.
Sposób korzystania z tych metryk zależy od modelu cen:
Dedykowany model cen:
Użyj metryk QPS, opóźnienia i ograniczania przepustowości, aby określić, kiedy należy dodawać lub usuwać repliki lub partycje. Skalowanie pojemności bezpośrednio wpływa zarówno na wydajność, jak i koszty, dlatego monitorowanie tych sygnałów pomaga zoptymalizować jednostki wyszukiwania.Model cen bezserwerowy:
Użyj tych metryk, aby zrozumieć wzorce obciążeń i zidentyfikować czynniki kosztów. Ponieważ pojemność bezserwerowa jest zarządzana automatycznie, nie można ich skalować, dodając repliki ani partycje. Zamiast tego skoncentruj się na monitorowaniu zużycia zasobów obliczeniowych i optymalizacji użycia.
W przypadku bezserwerowych można monitorować użycie zasobów obliczeniowych na żądanie przy użyciu nagłówka odpowiedzi x-ms-request-charge i analizować wzorce zapytań przy użyciu dzienników Azure Monitor. Śledzenie zużycia CU w podziale na typ zapytania lub obciążenie pomaga zidentyfikować możliwości obniżenia kosztów dzięki optymalizacji zapytań, projektowaniu schematu lub rozkładaniu obciążeń.
Na poziomie subskrypcji lub grupy zasobów usługa Cost Management udostępnia narzędzia do śledzenia, analizowania i kontrolowania kosztów. Użyj usługi Cost Management, aby:
Utwórz budżety , które definiują i śledzą postęp w odniesieniu do limitów wydatków. Aby uzyskać bardziej szczegółowe monitorowanie, dostosuj budżety przy użyciu filtrów dla określonych zasobów lub usług Azure. Filtry pomagają zapewnić, że śledzenie kosztów jest zgodne z określonymi obciążeniami lub wdrożeniami.
Utwórz alerty , które automatycznie powiadamiają uczestników projektu o anomaliach wydatków lub nadmiernych kosztach ryzyka. Alerty są oparte na wydatkach w porównaniu z progami budżetu i kosztów oraz mają zastosowanie na poziomie subskrypcji lub grupy zasobów.
Eksportuj dane dotyczące kosztów do konta magazynu w celu bardziej szczegółowej analizy. Na przykład zespoły finansowe mogą analizować wyeksportowane dane przy użyciu Excel lub Power BI. Eksportowanie danych kosztów zgodnie z harmonogramem jest zalecaną metodą pobierania zestawów danych kosztów.
Często zadawane pytania
Czy mogę tymczasowo zamknąć usługę wyszukiwania, aby zaoszczędzić na kosztach?
Wyszukiwanie działa jako nieprzerwana usługa. Dedykowane zasoby są zawsze operacyjne i przydzielane do wyłącznego użytku przez cały okres istnienia usługi.
Aby całkowicie zatrzymać rozliczenia w modelu dedykowanym, musisz usunąć usługę. Usuwanie usługi jest trwałe, a także usuwa skojarzone z nią dane.
W modelu cen bezserwerowym nie są naliczane opłaty za zasoby obliczeniowe w przypadku bezczynności. Płacisz tylko za indeksowany magazyn, gdy usługa nie przetwarza żądań.
Czy mogę zmienić model cen lub stawkę rozliczeniową (warstwę) istniejącej usługi wyszukiwania?
Po wybraniu modelu cen dedykowanego lub bezserwerowego nie można przekonwertować usług wyszukiwania sztucznej inteligencji między nimi.
W przypadku wybrania modelu cen dedykowanego istniejące usługi mogą przełączać się między warstwami Podstawowa i Standardowa (S1, S2 i S3). Bieżąca konfiguracja usługi nie może przekroczyć limitów warstwy docelowej, a region nie może mieć ograniczeń pojemności w warstwie docelowej. Aby uzyskać więcej informacji, zobacz Zmienianie warstwy cenowej.