Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Uwaga
Wyszukiwanie AI platformy Azure jest dostępna za pośrednictwem portalu Azure, interfejsów API REST i Azure SDKs. Jest także podstawą Foundry IQ — zarządzanej warstwy wiedzy, która przekształca treści przedsiębiorstwa w bazy wiedzy wielokrotnego użytku z uwzględnieniem uprawnień dla agentów w portalu Microsoft Foundry.
Podczas tworzenia usługi wyszukiwania należy wybrać model cenowy i warstwę usług. Wyszukiwanie AI platformy Azure oferuje dwa modele cenowe, z których każda jest odpowiednia do różnych wzorców obciążeń, ze skojarzonymi warstwami usług, które określają pojemność i funkcje:
| Model ustalania cen | Najlepsze dla | Jak są naliczane opłaty |
|---|---|---|
| Dedykowana | Stałe, przewidywalne, wysokie wykorzystanie obciążeń | Stała pojemność przy użyciu jednostek wyszukiwania (SU); stawka godzinowa zależna od wyboru warstwy usługi |
| Bezserwerowy (wersja zapoznawcza) | Sporadyczne, skokowe lub bardzo zmienne obciążenia | Rozliczane na podstawie użycia: mierzone za pomocą jednostek obliczeniowych (CUs) i indeksowanej pamięci masowej (GB/miesiąc) |
Uwaga
Jednostki wyszukiwania (SU) w modelu dedykowanym i jednostki obliczeniowe (CU) w modelu bezserwerowym to nie to samo i nie mogą być używane zamiennie. Nie używaj kalkulatorów cen opartych na jednostkach SU ani szacunków dla obciążeń bezserwerowych.
Oba modele udostępniają te same podstawowe funkcje wyszukiwania (z kilkoma drobnymi wyjątkami dla wersji zapoznawczej Serverless, wymienionymi poniżej). Podstawowa różnica dotyczy modelu cenowego i sposobu skalowania, a nie możliwości.
Wybranie dedykowanego modelu cenowego wymaga oszacowania potrzeb związanych z obciążeniem, a następnie wybrania warstwy usługi z odpowiednią wstępnie aprowizowaną pojemnością.
Wybranie modelu cen bezserwerowego nie wymaga wybrania wstępnie aprowizowanej warstwy usługi, ale korzysta z cen opartych na użyciu, więc optymalizacja wydajności będzie bezpośrednio wpływać na koszty.
Bezserwerowy (wersja zapoznawcza)
Ważna
Warstwa bezserwerowa dewelopera jest obecnie dostępna w wersji zapoznawczej. Ta wersja zapoznawcza jest udostępniana bez umowy dotyczącej poziomu usług i nie jest zalecana w przypadku obciążeń produkcyjnych. Niektóre funkcje mogą nie być obsługiwane lub mogą mieć ograniczone możliwości. Aby uzyskać więcej informacji, zobacz Warunki dodatkowe korzystania z testowych wersji Microsoft Azure.
Rozliczenia dla warstwy Serverless Developer nie są jeszcze dostępne w fazie zapoznawczej. Szacowane koszty użycia są dostępne w portalu Azure i telemetrii, ale to użycie nie będzie wyświetlane na rachunku za Azure w tym okresie początkowym. Microsoft powiadomi z co najmniej 30-dniowym wyprzedzeniem przed rozpoczęciem naliczania opłat. Odroczenie rozliczeń w tej wersji zapoznawczej jest tymczasowe. Plan Serverless Developer jest płatny i będziesz odpowiadać za wszelkie opłaty naliczone po rozpoczęciu rozliczania.
Warstwa bezserwerowa dewelopera nie obsługuje migracji do lub z innych warstw cenowych, a niektóre funkcje dostępne w innych warstwach nie są obsługiwane w publicznej wersji zapoznawczej. Limity usług, obsługiwane funkcje i szczegóły cennika mogą ulec zmianie przed ogólną dostępnością.
Wersja zapoznawcza jest obecnie dostępna tylko w zachodnio-środkowych stanach USA, Szwajcarii Północnej i Japonii Wschodniej.
Model cenowy Serverless to oferta rozliczana na podstawie zużycia, która automatycznie skaluje zasoby obliczeniowe i pamięć masową w zależności od obciążenia. Eliminuje to konieczność aprowizacji pojemności z góry, co pozwala płacić tylko za używane zasoby.
W modelu bezserwerowym nie konfigurujesz replik, partycji ani jednostek wyszukiwania. Zamiast tego usługa dynamicznie zarządza pojemnością w odpowiedzi na wolumin zapytań, aktywność indeksowania i złożoność obciążenia.
Rozliczenia są oparte na dwóch podstawowych wymiarach:
- Użycie mocy obliczeniowej: mierzone w jednostkach obliczeniowych na godzinę (CU/h) i rozliczane na podstawie wykonanej pracy (zapytania, indeksowanie i inne operacje).
- Indeksowany magazyn: opłata za GB miesięcznie na podstawie rozmiaru indeksów.
Ten model jest przeznaczony do obsługi obciążeń o zmiennym zapotrzebowaniu, w tym ruchu skokowego i aplikacji wielodzierżawnych. Obsługuje on te same podstawowe funkcje wyszukiwania i interfejsy API co usługi dedykowane, dzięki czemu można tworzyć i uruchamiać aplikacje wyszukiwania bez ponownego pisania kodu.
Warstwa Developer w modelu Serverless jest obecnie dostępna w publicznej wersji zapoznawczej i nie obsługuje obecnie następujących funkcji:
- Aliasy indeksów: nieobsługiwane
- Sesje debugowania: nieobsługiwane
- Sieć prywatna dla indeksatorów: nieobsługiwane
- Źródło wiedzy o pliku (wersja zapoznawcza): nieobsługiwane
- Udostępnione zasoby Private Link: brak planowanej obsługi modelu bezserwerowego
- Umowa dotycząca poziomu usług (SLA): niedostępna w publicznej wersji zapoznawczej
Dostępne regiony dla modelu cen bezserwerowego w wersji zapoznawczej obejmują:
- Zachodnio-środkowe stany USA
- Szwajcaria Północna
- Japonia Wschodnia
Aby dowiedzieć się więcej, zobacz limity usługi Service w Wyszukiwanie AI platformy Azure.
Aby uzyskać dodatkowe opcje wdrożenia Serverless na dużą skalę, skontaktuj się z firmą Microsoft za pomocą formularza rejestracji do prywatnej wersji zapoznawczej Serverless usługi Wyszukiwanie AI platformy Azure.
Dedykowana
Dedykowany model cenowy to oferta oparta na przydzielonej pojemności, która zapewnia przewidywalną wydajność i koszty poprzez przypisanie stałej infrastruktury do Twojego obciążenia roboczego. Możesz skonfigurować pojemność z góry, umożliwiając usłudze obsługę spójnych żądań indeksowania i zapytań z gwarantowanymi zasobami.
W przypadku warstw dedykowanych jawnie konfigurujesz repliki, partycje i jednostki wyszukiwania (SU). Repliki zapewniają przepływność zapytań i wysoką dostępność, podczas gdy partycje definiują pojemność magazynu i indeksowania. Razem określają one łączną pojemność i charakterystykę wydajności usługi wyszukiwania.
Rozliczenia są oparte na:
- Poziom usługi: Wstępnie wybrana przydzielona pojemność.
- Jednostki wyszukiwania (SU): jednostka rozliczeniowa dla usług dedykowanych obliczana jako repliki × partycji. Opłaty są naliczane według stałej stawki godzinowej na podstawie liczby jednostek wyszukiwania i wybranej warstwy usługi.
Ten model jest przeznaczony dla obciążeń ze stałym, przewidywalnym zapotrzebowaniem, w którym ważne jest spójne działanie, małe opóźnienia i kontrolowane skalowanie.
W modelu cen dedykowanej wybrana warstwa usługi określa:
- Maksymalna liczba indeksów i innych obiektów dozwolonych w usłudze.
- Rozmiar i szybkość partycji (magazyn fizyczny).
- Rozliczana stawka jako koszt stały miesięczny, ale także koszt przyrostowy w przypadku dodawania pojemności.
- Charakterystykę obciążenia. Niektóre warstwy są zoptymalizowane pod kątem określonych obciążeń.
W niektórych przypadkach warstwa określa również dostępność funkcji Premium.
Opisy warstw
Najczęściej używane warstwy rozliczane to:
Basic nadaje się do obsługi obciążeń produkcyjnych i może spełniać wymagania SLA przy maksymalnie trzech replikach.
Warstwa Standardowa (S1, S2, S3) jest warstwą domyślną. Obsługuje ona skalowanie partycji i replik, umożliwiając większe obciążenia i lepszą wydajność.
Niektóre warstwy są przeznaczone dla niektórych typów pracy:
Standard 3 High Density (S3 HD) jest trybem hostingu S3 zoptymalizowanym pod kątem środowisk wielodzierżawnych. Usługa S3 HD ma takie same opłaty za jednostkę co S3, ale obsługuje dużą liczbę mniejszych indeksów i używa sprzętu zoptymalizowanego pod kątem szybkich odczytów plików i scenariuszy magazynowania o wysokiej gęstości.
Warstwy zoptymalizowane pod kątem magazynu (L1, L2) zapewniają niższy koszt magazynowania na TB i są przeznaczone dla dużych, rzadziej aktualizowanych indeksów. Te warstwy zwykle mają większe opóźnienie zapytań.
Dostępna jest również bezpłatna, ograniczona warstwa usługi wyszukiwania:
- Bezpłatnie tworzy ograniczoną usługę wyszukiwania dla małych projektów, takich jak samouczki i programowanie. Zasoby są współdzielone między dzierżawami, a skalowanie nie jest obsługiwane. Niektóre funkcje w warstwie Premium są niedostępne, a usługa może zostać usunięta po okresach braku aktywności. Możesz mieć tylko jedną bezpłatną usługę wyszukiwania na subskrypcję platformy Azure.
Stawki rozliczeniowe są wyświetlane w portalu Azure podczas tworzenia nowej usługi wyszukiwania sztucznej inteligencji na stronie Wybierz warstwę cenową.
Możesz sprawdzić stronę z cennikiem, aby zobaczyć stawki regionalne.
Zapoznaj się z tematem Planowanie kosztów i zarządzanie kosztami , aby dowiedzieć się więcej na temat modelu cen dedykowanego i sposobu jego porównywania z modelem bezserwerowym.
Sprawdź limity usługi Service w Wyszukiwanie AI platformy Azure lub limity dotyczące magazynu, obciążeń i liczby obiektów według warstwy.
Jak wybrać warstwę
W portalu Azure warstwy usług są określone w Wybierz warstwę cenową strony podczas tworzenia usługi.
W programie PowerShell lub interfejsie wiersza polecenia platformy Azure warstwa jest określana za pomocą parametru -Sku .
Dostępność regionów według warstwy
Lista regionów zawiera lokalizacje, w których jest oferowana usługa Wyszukiwanie AI platformy Azure. Niektóre regiony mogą mieć ograniczenia pojemności dla niektórych warstw, co uniemożliwia tworzenie nowych usług wyszukiwania w tych warstwach. Lista używa przypisów dolnych do wskazywania ograniczonych regionów i warstw.
Podczas tworzenia usługi wyszukiwania w portalu Azure, kombinacje regionu i warstwy, które są niedostępne, są automatycznie wykluczane.
Dostępność funkcji według warstwy
Większość funkcji jest dostępna we wszystkich warstwach. W niektórych przypadkach dostępność funkcji zależy od wybranej warstwy:
| Funkcja | Zagadnienia dotyczące warstw |
|---|---|
| Indeksatory | Indeksatory są dostępne w usłudze S3 HD z dziennym limitem wykonań dla indeksatorów oraz innymi ograniczeniami. Indeksatory mają więcej ograniczeń w warstwie Bezpłatna. |
parametr konfiguracji indeksatora executionEnvironment |
Możliwość przypinania całego przetwarzania indeksatora tylko do klastrów wyszukiwania przydzielonych do usługi wyszukiwania wymaga S2 i nowszych. |
| Wzbogacanie sztucznej inteligencji | Działa w warstwie Bezpłatna, ale nie jest zalecana w przypadku dużych obciążeń. |
| Tożsamości zarządzane lub zaufane na potrzeby dostępu wychodzącego (indeksatora) | Niedostępne w warstwie Bezpłatna. |
| Klucze szyfrowania zarządzane przez klienta | Niedostępne w warstwie Bezpłatna. |
| Dostęp do zapory ip | Niedostępne w warstwie Bezpłatna. |
| Prywatny punkt końcowy (integracja z usługą Azure Private Link) | W przypadku połączeń przychodzących do usługi wyszukiwania nie są dostępne w warstwie Bezpłatnej. W przypadku połączeń wychodzących przez indeksatory do innych zasobów platformy Azure, nie są one dostępne na warstwie Bezpłatnej ani S3 HD. W przypadku indeksatorów korzystających z zestawów umiejętności, które nie są dostępne w wersjach Bezpłatna, Podstawowa, S1 lub S3 HD. |
| Strefy dostępności | Niedostępne w warstwie Bezpłatna. |
| Ranga semantyczna | Działa w warstwie Bezpłatna, ale nie jest zalecana w przypadku dużych obciążeń. |
Funkcje intensywnie korzystające z zasobów mogą nie działać prawidłowo, chyba że zapewnisz jej wystarczającą pojemność. Na przykład wzbogacanie AI ma długotrwałe umiejętności, które mogą przekroczyć limit czasu usługi darmowej, chyba że zestaw danych jest mały.
Górne limity
Warstwy określają maksymalną przestrzeń magazynową usługi, a także maksymalną liczbę indeksów, indeksatorów, źródeł danych, zestawów umiejętności i map synonimów, które można utworzyć. Aby uzyskać pełny podział wszystkich limitów, zobacz Limity usług w usłudze Wyszukiwanie AI platformy Azure.
Rozmiar partycji i szybkość
Cennik warstwowy zawiera szczegółowe informacje o magazynie na partycję, które wahają się od 15 GB dla warstwy Podstawowej do 2 TB dla warstw zoptymalizowanych pod kątem magazynowania (L2). Inne cechy sprzętu, takie jak szybkość operacji, opóźnienia i szybkość transferu, nie są publikowane, ale warstwy przeznaczone dla określonych architektur rozwiązań są oparte na sprzęcie, który ma funkcje do obsługi tych scenariuszy. Aby uzyskać więcej informacji na temat partycji, zobacz Szacowanie pojemności i niezawodność oraz zarządzanie nią w usłudze Wyszukiwanie AI platformy Azure.
Uwaga
Partycje o większej pojemności stały się dostępne w wybranych regionach w kwietniu 2024 r. Druga fala partycji o wyższej pojemności została wydana w maju 2024 r. Jeśli masz starszą usługę wyszukiwania, możesz uaktualnić usługę , aby korzystać z większej pojemności przy użyciu tej samej stawki rozliczeniowej.
Stawki rozliczeniowe
Warstwy mają różne stawki rozliczeniowe, z wyższymi stawkami dla warstw, które działają na droższym sprzęcie lub oferują droższe funkcje. Stawka opłat za poziomy znajduje się na stronach cennika Azure dla usługi Wyszukiwanie AI platformy Azure.
Po utworzeniu usługi stawka rozliczeniowa staje się zarówno stałym kosztem uruchamiania usługi przez całą dobę, jak i kosztem przyrostowym , jeśli zdecydujesz się dodać więcej pojemności.
W modelu dedykowanym rozliczanie opiera się na jednostkach wyszukiwania (SU), które łączą partycje (pamięć masowa) i repliki (wydajność obsługi zapytań).
- Usługa rozpoczyna się od jednej partycji i jednej repliki (jednej jednostki SU)
- Dodawanie partycji lub replik zwiększa koszty liniowo wraz z liczbą jednostek SU
Na przykład dodanie replik w celu zwiększenia dostępności lub przepływności zwiększa proporcjonalnie koszt miesięczny.
Aby uzyskać więcej informacji, zobacz Planowanie kosztów i zarządzanie nimi.
Przykład stawki rozliczeniowej
Poniższy przykład stanowi ilustrację. Załóżmy hipotetyczną stawkę rozliczeniową w wysokości 100 USD miesięcznie. Jeśli zachowasz usługę wyszukiwania w początkowych zasobach jednej partycji i jednej repliki, wtedy możesz spodziewać się zapłaty 100 USD na koniec miesiąca. Jeśli jednak dodasz dwie dodatkowe repliki, aby uzyskać wysoką dostępność, koszty miesięczne wzrosną do 300 USD (100 USD za pierwszą parę repliki-partycji, a następnie 200 USD za dwie repliki).
Zmiany poziomów
Uwaga
Istniejące usługi wyszukiwania mogą przełączać się między warstwami Podstawowa i Standardowa (S1, S2 i S3). Bieżąca konfiguracja usługi nie może przekroczyć limitów warstwy docelowej, a region nie może mieć ograniczeń pojemności w warstwie docelowej. Aby uzyskać więcej informacji, zobacz Zmienianie warstwy cenowej.
Aby przełączyć się na inny poziom niż te wymienione wcześniej:
- Utwórz usługę wyszukiwania w nowej warstwie.
- Wdróż zawartość wyszukiwania w nowej usłudze. Postępuj zgodnie z tą listą kontrolną , aby upewnić się, że masz całą zawartość.
- Usuń starą usługę, gdy masz pewność, że nie jest już potrzebna.
W przypadku dużych indeksów, których nie chcesz ponownie kompilować od podstaw, użyj jednej z następujących przykładów kopii zapasowej i przywracania:
- Przykład tworzenia kopii zapasowej i przywracania (C#)
- Przykład tworzenia kopii zapasowej i przywracania (Python)
- Przykład tworzenia kopii zapasowej i przywracania dla bardzo dużych indeksów (Python)
Następne kroki
Najlepszym sposobem wyboru planu cenowego jest rozpoczęcie od najtańszego planu, a następnie pozwolenie, aby doświadczenie i testowanie kierowały decyzją o utrzymaniu usługi lub przejściu na wyższy plan.
W przypadku następnych kroków zalecamy utworzenie usługi wyszukiwania w warstwie, która może pomieścić proponowany poziom testowania, a następnie przejrzeć następujące wskazówki dotyczące szacowania kosztów i pojemności: