Limity usług w usłudze Wyszukiwanie AI platformy Azure

Uwaga

Wyszukiwanie AI platformy Azure jest dostępna za pośrednictwem portalu Azure, interfejsów API REST i Azure SDKs. Jest także podstawą Foundry IQ — zarządzanej warstwy wiedzy, która przekształca treści przedsiębiorstwa w bazy wiedzy wielokrotnego użytku z uwzględnieniem uprawnień dla agentów w portalu Microsoft Foundry.

Maksymalne limity magazynu, obciążeń i ilości indeksów i innych obiektów zależą od modelu cen usługi Wyszukiwanie AI platformy Azure.

Wyszukiwanie AI platformy Azure obsługuje dwa modele cenowe, z których każda ma skojarzone warstwy usług. Wybrana warstwa ma wpływ na limity usług opisane w tych wskazówkach.

  • Dedykowane: stałe ceny mierzone przez jednostki wyszukiwania (SU). Opcje warstw usługi obejmują: Podstawowa, Standardowa (S1-S3, w tym S3 HD), zoptymalizowana pod kątem magazynowania (L1-L2) oraz warstwa bezpłatna z ograniczonymi możliwościami usługi wyszukiwania.
  • Serverless (wersja zapoznawcza): cennik oparty na zużyciu, naliczany na podstawie jednostek obliczeniowych na godzinę (CU/hr) oraz za GB/miesiąc w przypadku indeksowanego magazynowania. Bieżąca warstwa w wersji zapoznawczej to: Serverless Developer. Limity wynikają z limitów dla poszczególnych indeksów, liczby obiektów przypadających na usługę oraz sposobu ograniczania przepustowości w trybie Serverless.

Ważne

Warstwa bezserwerowa dewelopera jest obecnie dostępna w wersji zapoznawczej. Ta wersja zapoznawcza jest udostępniana bez umowy dotyczącej poziomu usług i nie jest zalecana w przypadku obciążeń produkcyjnych. Niektóre funkcje mogą nie być obsługiwane lub mogą mieć ograniczone możliwości. Aby uzyskać więcej informacji, zobacz Warunki dodatkowe korzystania z testowych wersji Microsoft Azure.

Rozliczenia dla warstwy Serverless Developer nie są jeszcze dostępne w fazie zapoznawczej. Szacowane koszty użycia są dostępne w portalu Azure i telemetrii, ale to użycie nie będzie wyświetlane na rachunku za Azure w tym okresie początkowym. Microsoft powiadomi z co najmniej 30-dniowym wyprzedzeniem przed rozpoczęciem naliczania opłat. Odroczenie rozliczeń w tej wersji zapoznawczej jest tymczasowe. Plan Serverless Developer jest płatny i będziesz odpowiadać za wszelkie opłaty naliczone po rozpoczęciu rozliczania.

Warstwa bezserwerowa dewelopera nie obsługuje migracji do lub z innych warstw cenowych, a niektóre funkcje dostępne w innych warstwach nie są obsługiwane w publicznej wersji zapoznawczej. Limity usług, obsługiwane funkcje i szczegóły cennika mogą ulec zmianie przed ogólną dostępnością.

Wersja zapoznawcza jest obecnie dostępna tylko w zachodnio-środkowych stanach USA, Szwajcarii Północnej i Japonii Wschodniej.

Aby dowiedzieć się więcej, zobacz Wybieranie modelu cenowego i warstwy usług.

Limity subskrypcji

Możesz utworzyć wiele rozliczanych usług wyszukiwania (Podstawowe i wyższe), do maksymalnej liczby usług dozwolonej na każdym poziomie, w każdym regionie. Można na przykład utworzyć maksymalnie 16 usług w warstwie Podstawowa i kolejne 16 usług w warstwie S1 w ramach tej samej subskrypcji i regionu. Następnie możesz utworzyć dodatkowe 16 podstawowych usług w innym regionie dla łącznie 32 usług Podstawowych w ramach tej samej subskrypcji. Aby uzyskać więcej informacji na temat warstw usług, zobacz Wybieranie modelu cenowego i warstwy usług.

Maksymalne limity usług można podnieść według żądania. Jeśli potrzebujesz większej liczby usług w ramach tej samej subskrypcji, zgłoś wniosek o pomoc techniczną.

Zasób Bezpłatna 1 Basic S1 S2 S3 S3 (wysoka gęstość) L1 L2 Deweloper bezserwerowy
Maksymalna liczba usług na region 1 16 16 8 6 6 6 6 5
Maksymalna liczba jednostek wyszukiwania (SU)2 Nie dotyczy 3 SU 36 SU 36 SU 36 SU 36 SU 36 SU 36 SU Nie dotyczy

1 Możesz mieć jedną bezpłatną usługę wyszukiwania na subskrypcję platformy Azure. Warstwa Bezpłatna jest oparta na infrastrukturze udostępnionej innym klientom. Ponieważ sprzęt nie jest dedykowany, skalowanie w górę nie jest obsługiwane, a magazyn jest ograniczony do 50 MB. Bezpłatna usługa wyszukiwania może zostać usunięta po dłuższym okresie braku aktywności, aby zwolnić miejsce na więcej usług.

2 Jednostki wyszukiwania (SU) to jednostki rozliczeniowe przydzielone jako replikalub partycja. Potrzebujesz obu tych elementów. Aby dowiedzieć się więcej na temat kombinacji SU, zobacz Szacowanie oraz zarządzanie pojemnością usługi wyszukiwania.

Limity usługi

W modelu cenowym Dedicated zaplanuj pojemność, mnożąc liczbę replik przez liczbę partycji (jednostki wyszukiwania).

Zasób Bezpłatna Basic S1 S2 S3 S3 (wysoka gęstość) L1 L2 Deweloper bezserwerowy
Partycje Nie dotyczy 3 1 12 12 12 3 12 12 Nie dotyczy
Repliki Nie dotyczy 3 12 12 12 12 12 12 Nie dotyczy

1 Warstwa Podstawowa obsługuje trzy partycje i trzy repliki, łącznie dziewięć jednostek wyszukiwania (SU) w nowych usługach wyszukiwania utworzonych po 3 kwietnia 2024 r. Starsze usługi w warstwie Basic są ograniczone do jednej partycji i trzech replik.

Usługa wyszukiwania podlega maksymalnemu limitowi magazynu (pomnożonemu przez liczbę partycji) lub limitowi maksymalnej liczby indeksów lub indeksatorów, w zależności od tego, co nastąpi wcześniej.

Umowy dotyczące poziomu usług (SLA) mają zastosowanie do rozliczanych usług, które mają co najmniej dwie repliki dla obciążeń zapytań lub co najmniej trzy repliki dla obciążeń zapytań i indeksowania. Liczba partycji nie jest uwzględniana w ramach SLA. Aby uzyskać więcej informacji, zobacz Niezawodność w usłudze Wyszukiwanie AI platformy Azure.

Bezpłatne usługi nie mają stałych partycji ani replik i udostępniają zasoby innym subskrybentom.

Rozmiar partycji (GB)

Limity magazynu dla usługi różnią się w zależności od dwóch czynników: daty utworzenia usługi i regionu. Większość obsługiwanych regionów oferuje wyższe limity dla nowszych usług.

W tej tabeli przedstawiono postęp zwiększania limitu miejsca na dysku w GB w czasie. Od kwietnia 2024 r. partycje o większej pojemności zostały udostępnione w regionach wymienionych w przypisach. Jeśli masz starszą usługę w obsługiwanym regionie, sprawdź, czy możesz uaktualnić usługę , aby uzyskać wyższe limity magazynu.

Data utworzenia usługi Basic S1 S2 S3/HD L1 L2 Deweloper bezserwerowy
Przed 3 kwietnia 2024 r. 2 25 100 200 1,024 2048 Nie dotyczy
3 kwietnia 2024 r. do 17 maja 2024 r. 15 160 512 1,024 1,024 2048 Nie dotyczy
Po 17 maja 2024 r. 15 160 512 1,024 2,048 4,096 Nie dotyczy
Po 10 lutego 2025 3 15 160 512 1,024 2048 4,096 Nie dotyczy

1 Pamięć masowa o większej pojemności dla warstw Basic, S1, S2 i S3 w tych regionach. Ameryki: Brazylia Południowa, Kanada Środkowa, Kanada Wschodnia, Wschodnie stany USA, Wschodnie stany USA 2, Środkowe stany USA, Północno-środkowe stany USA, Południowo-środkowe stany USA, Zachodnie stany USA, Zachodnie stany USA 2, Zachodnie stany USA 3, Zachodnio-środkowe stany USA. Europa: Francja Środkowa. Włochy Północne, Europa Północna, Norwegia Wschodnia, Polska Środkowa, Szwajcaria Północna, Szwecja Środkowa, Zjednoczone Królestwo Południowe, Zachodnie Zjednoczone Królestwo. Bliski Wschód: Północ ZEA. Afryka: Republika Południowej Afryki Północnej. Azja i Pacyfik: Australia Wschodnia, Australia Południowo-Wschodnia, Indie Środkowe, Jio Indie Zachodnie, Azja Wschodnia, Azja Południowo-Wschodnia, Japonia Wschodnia, Japonia Zachodnia, Korea Środkowa, Korea Południowa.

2 Magazyn o wyższej pojemności dla L1 i L2. Więcej regionów zapewnia większą pojemność w każdej warstwie rozliczanej. Ameryka: Wschodnie stany USA 2 EUAP. Europa: Niemcy Północne, Niemcy Zachodnio-Środkowe, Szwajcaria Zachodnia. Azure Government: Texas, Arizona, Virginia. Afryka: Północna część Republiki Południowej Afryki​. Azja i Pacyfik: Chiny Północne 3, Chiny Wschodnie 3.

3 Magazyn o zwiększonej pojemności jest dostępny w Europie Zachodniej.

Ważne

Obecnie wyższe limity magazynu nie są dostępne w następujących regionach, które podlegają limitom przed 3 kwietnia.

  • Izrael Środkowy
  • Katar Środkowy
  • Hiszpania Środkowa
  • Indie Południowe

Limity indeksów

Zasób Bezpłatna Podstawowa 1 S1 S2 S3 S3 (wysoka gęstość) L1 L2 Deweloper bezserwerowy
Maksymalna liczba indeksów 3 5 lub 15 50 200 200 1000 na partycję lub 3000 na usługę 10 10 30
Maksymalna liczba prostych pól na indeks 2 1000 100 1000 1000 1000 1000 1000 1000 1000
Maksymalne wymiary na pole wektora 4096 4096 4096 4096 4096 4096 4096 4096 4096
Maksymalna liczba złożonych kolekcji na indeks 40 40 40 40 40 40 40 40 40
Maksymalna liczba elementów we wszystkich złożonych kolekcjach na dokument 3 3000 3000 3000 3000 3000 3000 3000 3000 3000
Maksymalna głębokość pól złożonych 10 10 10 10 10 10 10 10 10
Maksymalna liczba sugestorów na indeks 1 1 1 1 1 1 1 1 1
Maksymalna liczba profilów oceniania na indeks 100 100 100 100 100 100 100 100 100
Maksymalna liczba konfiguracji semantycznych na indeks 100 100 100 100 100 100 100 100 100
Maksymalna liczba funkcji na profil 8 8 8 8 8 8 8 8 8
Maksymalny rozmiar indeksu 4 Nie dotyczy Nie dotyczy Nie dotyczy 1,88 TB 2,34 TB 100 GB Nie dotyczy Nie dotyczy 1 GB

1 Podstawowe usługi utworzone przed grudniem 2017 r. mają niższe limity (5 zamiast 15) dla indeksów. Warstwa Podstawowa to jedyna warstwa z niższym limitem 100 pól na indeks.

2 Górny limit pól obejmuje zarówno pola pierwszego poziomu, jak i zagnieżdżone podpola w złożonej kolekcji. Jeśli na przykład indeks zawiera 15 pól i ma dwie złożone kolekcje z pięcioma polami podrzędnymi, liczba pól indeksu wynosi 25. Indeksy z bardzo dużą kolekcją pól mogą być powolne. Ogranicz pola i atrybuty tylko do tych, których potrzebujesz, i uruchom indeksowanie i test zapytań, aby upewnić się, że wydajność jest akceptowalna.

3 Istnieje górny limit dla elementów, ponieważ duża ich liczba znacznie zwiększa magazyn wymagany dla indeksu. Element kolekcji złożonej jest definiowany jako element członkowski tej kolekcji. Załóżmy na przykład, że dokument związany z hotelem zawierający złożoną kolekcję pokoi. Każdy pokój w kolekcji Rooms jest traktowany jako element. Podczas indeksowania aparat indeksowania może bezpiecznie przetworzyć maksymalnie 3000 elementów w całym dokumencie. Ten limit został wprowadzony w api-version=2019-05-06 systemie i dotyczy tylko złożonych kolekcji, a nie kolekcji ciągów lub złożonych pól.

4 W przypadku większości poziomów maksymalny rozmiar indeksu to całkowita dostępna przestrzeń magazynowa w usłudze wyszukiwania. W przypadku usług S2, S3 i S3 HD z wieloma partycjami, a tym samym więcej miejsca do magazynowania, maksymalny rozmiar pojedynczego indeksu znajduje się w tabeli. Dotyczy usług wyszukiwania utworzonych po 3 kwietnia 2024 r. Indeksy usług skonfigurowanych za pomocą modelu bezserwerowego (wersja zapoznawcza) mają ustawiony maksymalny rozmiar podany w tabeli.

W przypadku aprowizacji usługi w klastrze o większej mocy możesz znaleźć pewne różnice w limitach maksymalnych. Limity w tym miejscu reprezentują wspólny mianownik. Indeksy utworzone zgodnie z powyższymi specyfikacjami są przenośne w równoważnych warstwach usług w dowolnym regionie.

Limity dokumentów

Każdy indeks obsługuje maksymalnie następującą liczbę dokumentów:

  • 24 miliardy w warstwie Podstawowa, S1, S2 i S3
  • 2 miliardy na S3 HD
  • 288 miliardów na L1
  • 576 miliardów na L2

Każdy dokument może mieć rozmiar maksymalnie 16 megabajtów. Limit rozmiaru dokumentu dotyczy faktycznie rozmiaru ładunku żądania interfejsu API indeksowania, który wynosi 16 megabajtów. Ten ładunek może być pojedynczym dokumentem lub partią dokumentów. W przypadku partii z jednym dokumentem maksymalny rozmiar dokumentu wynosi 16 MB w formacie JSON.

Limit rozmiaru dokumentu dotyczy indeksowania w trybie wypychania , który przekazuje dokumenty do usługi wyszukiwania. Jeśli używasz indeksatora do indeksowania w trybie ściągania, pliki źródłowe mogą mieć dowolny rozmiar pliku, z zastrzeżeniem limitów indeksatora. W przypadku indeksatora obiektów blob limity rozmiaru plików są większe dla wyższych warstw. Na przykład limit S1 wynosi 128 megabajtów, limit S2 wynosi 256 megabajtów itd.

Podczas szacowania rozmiaru dokumentu pamiętaj, aby indeksować tylko pola, które dodają wartość do scenariuszy wyszukiwania. Wyklucz pola źródłowe, które nie mają celu w zapytaniach, które mają być uruchamiane.

Limity rozmiaru indeksu wektorowego

Podczas indeksowania dokumentów z polami wektorowymi usługa Wyszukiwanie AI platformy Azure konstruuje wewnętrzne indeksy wektorów przy użyciu dostarczonych parametrów algorytmu.

Rozmiar tych indeksów wektorów jest ograniczony przez:

  • Pamięć zarezerwowana dla wyszukiwania wektorowego dla warstwy Twojej usługi (lub SKU) w modelu cenowym Dedykowanym.
  • Limity przechowywania na indeks w modelu cenowym Serverless.

Aby uzyskać wskazówki dotyczące zarządzania i maksymalizacji magazynu wektorów, zobacz Rozmiar indeksu wektora i pozostawanie w granicach.

Limity wektorów różnią się w zależności od:

Wyższe limity wektorów od kwietnia 2024 r. istnieją w nowych usługach wyszukiwania w regionach zapewniających dodatkową pojemność, która jest w większości z nich. Jeśli masz starszą usługę w obsługiwanym regionie, sprawdź, czy możesz uaktualnić usługę do wyższych limitów wektorów.

W modelu cen bezserwerowym limity wektorów są definiowane na indeks, a nie na partycję.

  • Maksymalny rozmiar indeksu wektorowego na indeks (bezserwerowy): 300 MB
    • Ten rozmiar stanowi około 30% całkowitej przestrzeni magazynowej indeksu, co jest zgodne ze współczynnikiem wektorów do pamięci masowej stosowanym w dedykowanych warstwach usługi.
    • Ten rozmiar jest sztywnym limitem dla indeksu. Próby przekroczenia tego limitu podczas indeksowania kończą się niepowodzeniem.

W tej tabeli przedstawiono postęp zwiększenia limitu przydziału wektorów w GB w czasie. Limit przydziału jest na partycję, więc w przypadku skalowania nowej usługi w warstwie Standardowa (S1) do 6 partycji łączny limit przydziału wektorów jest 35 pomnożony przez 6.

Data utworzenia usługi Basic S1 S2 S3/HD L1 L2
Przed 1 lipca 2023 r.1 0,5 1 6 12 12 36
1 lipca 2023 r. do 3 kwietnia 2024 r. 1 3 12 36 12 36
3 kwietnia 2024 r. do 17 maja 2024 r. 5 35 150 300 12 36
Po 17 maja 2024r. 4 5 35 150 300 150 300

1 Początkowe limity wektorów podczas wczesnej wersji zapoznawczej.

2 Limity wektorów w późniejszym okresie obowiązywania wersji zapoznawczej. Trzy regiony nie miały wyższych limitów: Niemcy Zachodnio-środkowe, Indie Zachodnie, Katar Środkowy.

3 Wyższe limity przydziału wektorów na podstawie większych partycji dla obsługiwanych warstw i regionów.

4 Wyższe limity przydziału wektorów dla większej liczby warstw i regionów na podstawie aktualizacji rozmiaru partycji.

Usługa wymusza limit rozmiaru indeksu wektorowego:

  • Dedykowany: Na każdą partycję w usłudze wyszukiwania
  • Bezserwerowe: Na indeks

Ten limit przydziału jest ścisłym ograniczeniem, aby zapewnić prawidłowe działanie usługi. Dalsze próby indeksowania po przekroczeniu limitu powodują niepowodzenie. Możesz wznowić indeksowanie po zwolnieniu dostępnego limitu w następujący sposób:

  • Usuwanie dokumentów wektorowych
  • Zmniejszanie rozmiaru lub wymiarowości wektorów
  • (Tylko dedykowane) Skalowanie partycji w poziomie

Ważne

Wyższe limity wektorów są powiązane z większymi rozmiarami partycji. Obecnie wyższe limity wektorów nie są dostępne w następujących regionach, które podlegają limitom z lipca do kwietnia.

  • Izrael Środkowy
  • Katar Środkowy
  • Hiszpania Środkowa
  • Indie Południowe

Limity indeksatora

Maksymalny czas wykonywania ma na celu zapewnienie równowagi i stabilności całej usługi, ale większe zestawy danych mogą wymagać czasu indeksowania dłuższego niż dozwolony czas maksymalny. Jeśli zadanie indeksowania nie może zostać ukończone w maksymalnym dozwolonym czasie, spróbuj uruchomić je zgodnie z harmonogramem. Program harmonogramowania śledzi stan indeksowania. Jeśli zaplanowane zadanie indeksowania zostanie przerwane z jakiegokolwiek powodu, indeksator może kontynuować w miejscu, w którym zostało przerwane przy następnym zaplanowanym wykonaniu.

Uwaga

W modelu cen bezserwerowym zachowanie indeksatora różni się od usług dedykowanych. Pojemność nie jest definiowana przez repliki ani partycje. Zamiast tego limity obiektów na usługę, limity pojemności magazynowej dla indeksu oraz dławienie na poziomie usługi określają limity indeksowania. W związku z tym niektóre limity, takie jak maksymalny czas wykonywania, nie są stałymi wartościami.

Zasób Bezpłatna 1 Podstawowa 2 S1 S2 S3 S3 HD 3 L1 L2 Deweloper bezserwerowy
Maksymalna liczba indeksatorów 3 5 lub 15 50 200 200 Nie dotyczy 10 10 30
Maksymalna liczba źródeł danych 3 5 lub 15 50 200 200 Nie dotyczy 10 10 30 na usługę
Maksymalnie 4 zestawy umiejętności 4 3 5 lub 15 50 200 200 Nie dotyczy 10 10 30
Maksymalne obciążenie indeksowania na wywołanie 10 000 dokumentów Ograniczone jedynie liczbą dokumentów maksymalną w systemie Ograniczone jedynie liczbą dokumentów maksymalną w systemie Ograniczone jedynie liczbą dokumentów maksymalną w systemie Ograniczone jedynie liczbą dokumentów maksymalną w systemie Nie dotyczy Brak ograniczeń Brak ograniczeń Ograniczone jedynie liczbą dokumentów maksymalną w systemie
Podstawowy harmonogram 5 minut 5 minut 5 minut 5 minut 5 minut 5 minut 5 minut 5 minut 5 minut
Maksymalny czas działania 5 1-3 lub 3-10 minut 2 lub 24 godziny 2 lub 24 godziny 2 lub 24 godziny 2 lub 24 godziny Nie dotyczy 2 lub 24 godziny 2 lub 24 godziny 2 godziny
Indeksator blobów 7: maksymalny rozmiar bloba, MB 16 16 128 256 256 Nie dotyczy 256 256 256
Indeksator obiektów blob: maksymalna liczba znaków zawartości wyodrębnionej z obiektu blob 68 256,000 512 000 4 mil 8 mil 16 mil Nie dotyczy 4 mil 4 mil 16 mil

1 Bezpłatne usługi mają maksymalny czas wykonywania indeksatora wynoszący 3 minuty dla źródeł obiektów blob i 1 minutę dla wszystkich innych źródeł danych. Wywołanie indeksatora jest co 180 sekund. W przypadku indeksowania sztucznej inteligencji, który wywołuje narzędzia Foundry Tools, bezpłatne usługi są ograniczone do 20 bezpłatnych transakcji na indeksator dziennie, gdzie transakcja jest zdefiniowana jako dokument, który pomyślnie przechodzi przez potok wzbogacania. (Porada: Możesz zresetować indeksator, aby zresetować jego liczbę).

2 Podstawowe usługi utworzone przed grudniem 2017 r. mają niższe limity (5 zamiast 15) dla indeksatorów, źródeł danych i zestawów umiejętności.

3 Obsługa indeksatora S3 HD jest dostępna w wersji zapoznawczej, wymaga interfejsu API REST w wersji 2025-11-01-preview lub nowszej i podlega dziennemu limitowi na poziomie usługi wynoszącemu sześć godzin łącznego czasu działania indeksatora współdzielonego przez wszystkie indeksatory. Indeksatory S3 HD działają tylko w środowisku wykonywania wielodostępnym i nie obsługują udostępnionych zasobów łącza prywatnego. W wersji zapoznawczej obsługa indeksatora S3 HD najlepiej nadaje się do niewielkich obciążeń (przy rozmiarze indeksu około 1 GB) bez zestawów umiejętności lub z minimalną liczbą zestawów umiejętności. Aby uzyskać więcej informacji, zobacz Uruchamianie indeksatora w środowisku Serverless i S3 HD.

4 Maksymalnie 30 umiejętności na zestaw umiejętności.

5 Jeśli chodzi o maksymalny czas trwania 2 lub 24 godzin dla indeksatorów: 2-godzinny maksymalny jest najbardziej typowy i jest to, co należy zaplanować. Odwołuje się on do indeksatorów uruchamianych w środowisku publicznym, które odciąża przetwarzanie intensywnie korzystające z obliczeń i pozostawia więcej zasobów dla zapytań. Limit 24-godzinny ma zastosowanie w przypadku skonfigurowania indeksatora do działania w środowisku prywatnym przy użyciu tylko infrastruktury przydzielonej do usługi wyszukiwania. Niektóre starsze indeksatory nie są w stanie działać w środowisku publicznym, a indeksatory zawsze mają 24-godzinny zakres przetwarzania. Jeśli masz nieplanowane indeksatory, które działają w sposób ciągły przez 24 godziny, możesz założyć, że nie można migrować tych indeksatorów do nowszej infrastruktury. Ogólnie rzecz biorąc, dla zadań indeksowania, które nie mogą zakończyć się w ciągu dwóch godzin, należy ustawić dla indeksatora harmonogram na 5 minut, aby mógł szybko kontynuować od miejsca, gdzie zakończył. W warstwie Bezpłatna maksymalny czas wykonywania wynoszący 3–10 minut jest przeznaczony dla indeksatorów z zestawami umiejętności.

6 Maksymalna liczba znaków jest oparta na jednostkach kodu Unicode, w szczególności UTF-16.

7 W przypadku korzystania z delimitedText trybu analizowania plików CSV stosowany jest limit rozmiaru buforu 10 MB na wiersz pliku.

8 W przypadku korzystania z delimitedText trybu analizowania plików CSV nie ma zastosowania limit "maksymalny rozmiar wyodrębnionej zawartości".

Indeksatory mogą uzyskiwać dostęp do innych zasobów platformy Azure za pośrednictwem prywatnych punktów końcowych zarządzanych za pośrednictwem udostępnionego interfejsu API zasobu łącza prywatnego. W tej sekcji opisano limity skojarzone z tą funkcją.

Uwaga

Warstwa cenowa Bezserwerowa dla deweloperów nie obsługuje udostępnionych linków prywatnych ani obwodu zabezpieczeń sieci (NSP) do źródeł danych. Obsługiwane są prywatne punkty końcowe i reguły zapory IP na potrzeby połączenia prywatnego z usługą w warstwie Serverless Developer.

Zasób Bezpłatna Basic S1 S2 S3 S3 (wysoka gęstość) L1 L2 Deweloper bezserwerowy
Obsługa indeksatora prywatnego punktu końcowego Nie. Tak Tak Tak Tak Nie. Tak Tak Nie.
Obsługa prywatnego punktu końcowego dla indeksatorów z zestawem umiejętności 1 Nie. Nie. Tak Tak Tak Nie. Tak Tak Nie.
Obsługa prywatnego punktu końcowego dla zestawów umiejętności z umiejętnościami osadzania 2 Nie. Tak Tak Tak Tak Nie. Tak Tak Nie.
Maksymalna liczba prywatnych punktów końcowych Nie dotyczy 10 lub 30 100 400 400 Nie dotyczy 20 20 Nie dotyczy
Maksymalna liczba unikatowych typów zasobów 3 Nie dotyczy 4 7 15 15 Nie dotyczy 4 4 Nie dotyczy

1 Wzbogacanie sztucznej inteligencji i analiza obrazów są intensywnie obciążające obliczenia i zużywają nieproporcjonalne ilości dostępnej mocy obliczeniowej. Z tego powodu połączenia prywatne są wyłączone w niższych warstwach, aby zapewnić wydajność i stabilność samej usługi wyszukiwania. W przypadku usług podstawowych prywatne połączenia z zasobem Microsoft Foundry nie są obsługiwane w celu zachowania stabilności usługi. W przypadku warstwy S1 upewnij się, że usługa została utworzona z wyższymi limitami po 3 kwietnia 2024 r. Indeksatory z więcej niż 2 funkcjami osadzania Azure OpenAI lub osadzania wielomodalnego Azure Vision nie mogą być uruchamiane w środowisku prywatnym, i połączenia prywatne nie są dostępne.

2 Prywatne połączenia z modelem osadzania są obsługiwane w wysokowydajnych usługach wyszukiwania kategorii Podstawowa i S1, utworzonych po 3 kwietnia 2024 r., z wyższymi limitami dla przechowywania danych i przetwarzania obliczeniowego.

3 Liczba różnych typów zasobów jest obliczana jako liczba unikatowych groupId wartości używanych we wszystkich udostępnionych zasobach łącza prywatnego dla danej usługi wyszukiwania, niezależnie od stanu zasobu.

Limity synonimów

Maksymalna liczba map synonimów różni się w zależności od warstwy. Każda reguła może mieć maksymalnie 20 rozszerzeń, gdzie rozszerzenie jest równoważnym terminem. Na przykład dla słowa „kot” powiązanie z „kitty”, „kotowaty” i „felis” (rodzaj kotów) stanowi trzy rozszerzenia.

Zasób Bezpłatna Basic S1 S2 S3 S3 (wysoka gęstość) L1 L2 Deweloper bezserwerowy
Maksymalna liczba map synonimów 3 3 5 10 20 20 10 10 20 na usługę
Maksymalna liczba reguł na mapę pięć tysięcy 20000 20000 20000 20000 20000 20000 20000 20000

Limity aliasów indeksu

Maksymalna liczba aliasów indeksu zależy od daty utworzenia warstwy i usługi. W przypadku wszystkich warstw, jeśli usługa została utworzona po październiku 2022 r., maksymalna liczba aliasów jest dwukrotnie większa niż maksymalna liczba dozwolonych indeksów. Jeśli usługa została utworzona przed październikiem 2022 r., limit jest dozwoloną liczbą indeksów.

Uwaga

Warstwa dewelopera modelu bezserwerowego nie obsługuje aliasów indeksów.

Data utworzenia usługi Bezpłatna Basic S1 S2 S3 S3 (wysoka gęstość) L1 L2 Deweloper bezserwerowy
Przed październikiem 2022 r. 3 5 lub 15 1 50 200 200 1000 na partycję lub 3000 na usługę 10 10 Nie dotyczy
Po październiku 2022 r. 6 30 100 400 400 2000 na partycję lub 6000 na usługę 20 20 Nie dotyczy

1 Podstawowe usługi utworzone przed grudniem 2017 r. mają niższe limity (5 zamiast 15) dla indeksów.

Limity pobierania danych agenta

Baza wiedzy określa co najmniej jedno źródło wiedzy i wysiłek wnioskowania przy pobieraniu, który kontroluje poziom przetwarzania dużego modelu językowego (LLM) na potrzeby agentycznego pobierania. Limity różnią się w zależności od warstwy cenowej, wersji interfejsu API i poziomu nakładu pracy rozumowania.

Zasób Bezpłatna Basic S1 S2 S3 S3 (wysoka gęstość) L1 L2 Deweloper bezserwerowy
Maksymalna liczba źródeł wiedzy na usługę 3 5 lub 15 1 50 200 200 0 10 10 30
Maksymalna liczba baz wiedzy na usługę 3 5 lub 15 1 50 200 200 0 10 10 30
Maksymalna liczba źródeł wiedzy na bazę wiedzy (minimal) 2 3 5 lub 10 1 10 10 10 0 10 10 10
Maksymalna liczba źródeł wiedzy na bazę wiedzy (low) 3 3 3 3 3 0 3 3 3
Maksymalna liczba źródeł wiedzy na bazę wiedzy (medium) 3 5 5 5 5 0 5 5 5

1 Podstawowe usługi utworzone przed 3 kwietnia 2024 r. mają niższe limity (5) dotyczące źródeł wiedzy i baz wiedzy.

Źródła wiedzy dla każdej bazy wiedzy

Limity dla poszczególnych źródeł wiedzy zależą od wersji interfejsu API używanej do tworzenia lub aktualizowania bazy wiedzy. W 2026-05-01-preview wszystkie działania związane z wnioskowaniem podczas pobierania podlegają tym samym ograniczeniom źródeł wiedzy. Wcześniejsze zapoznawcze wersje interfejsu API mają niższe limity dla poziomów wysiłku wnioskowania low i medium.

wersja API Wysiłek analizy pozyskiwania danych Bezpłatna Basic S1 S2 S3 S3 (wysoka gęstość) L1 L2
2026-05-01-preview minimal, low, medium 3 5 lub 10 1 10 10 10 0 10 10
2026-05-01-preview, 2025-08-01-preview minimal 2 3 5 lub 10 1 10 10 10 0 10 10
2026-05-01-preview, 2025-08-01-preview low 3 3 3 3 3 0 3 3
2026-05-01-preview, 2025-08-01-preview medium 3 5 5 5 5 0 5 5

2 We wcześniejszych wersjach zapoznawczych interfejsu API tryb wnioskowania minimal obsługuje więcej źródeł wiedzy niż low lub medium, ponieważ pomija planowanie zapytań oparte na modelu LLM.

Limity danych (wzbogacanie sztucznej inteligencji)

Limity danych mają zastosowanie do potoku wzbogacania sztucznej inteligencji, który wykonuje wywołania usługi Azure Language in Foundry Tools na potrzeby rozpoznawania jednostek, łączenia jednostek, wyodrębniania kluczowych fraz, analizy tonacji, wykrywania języka i wykrywania informacji osobistych.

Maksymalny rozmiar rekordu wynosi 50 000 znaków, licząc według String.Length. Jeśli musisz podzielić dane przed wysłaniem ich do analizatora tonacji, użyj funkcji Dzielenie tekstu.

Te limity dotyczą modeli cen dedykowanych i bezserwerowych.

Limity przepustowości

Limity ograniczania przepustowości pomagają zapewnić stabilność usługi, kontrolując szybkość żądań interfejsu API.

W modelu cen dedykowanym ograniczanie jest oparte na jednostkach wyszukiwania (repliki × partycjach).

W modelu cen bezserwerowym ograniczanie przepustowości nie jest oparte na jednostkach wyszukiwania. Zamiast tego limity operacji na poziomie usługi i ogólne zachowanie zużycia zarządzają przepływnością. Limity użycia i usługi zarządzają pojemnością, a nie konfiguracją replik i partycji.

Operation Dedykowane (na jednostkę wyszukiwania) Bezserwerowo (dla usługi lub dla indeksu)
Wyświetl listę indeksów (GET /indexes) 3 żądania/sec/SU 3 żądania na sekundę
Pobieranie indeksu (GET /indexes/{index}) 10 żądań na sekundę/SU 10 żądań na sekundę
Tworzenie indeksu (POST /indexes) 12 żądań/min/SU 12 żądań/min
Tworzenie lub aktualizowanie indeksu (PUT /indexes/{index}) 6 żądań na sekundę/SU 6 żądań na sekundę
Usuń indeks (DELETE /indexes/{index}) 12 żądań/min/SU 12 żądań/min
Statystyki usługi (GET /servicestats) 4 żądania/sek./SU 4 żądania na sekundę
Kwerendy wyszukiwania (POST /indexes/{index}/docs/search) Różni się w zależności od liczby jednostek SU i złożoności zapytań 50 zapytań/s (łączne ograniczenie przepustowości odczytu dla indeksu)
Indeksowanie dokumentów (POST /indexes/{index}/docs/index) Różni się w zależności od liczby jednostek SU i obciążenia indeksowania 5 żądań na sekundę na indeks
Sugerowanie (POST /indexes/{index}/docs/suggest) Różni się w zależności od liczby jednostek SU Nie zdefiniowano jawnie
Autouzupełnianie (POST /indexes/{index}/docs/autocomplete) Różni się w zależności od liczby jednostek SU Nie zdefiniowano jawnie

Limity ograniczania klasyfikacji semantycznej

Punktator semantyczny używa systemu kolejkowania do zarządzania współbieżnymi żądaniami. Ten system umożliwia usługom wyszukiwania uzyskanie największej liczby zapytań na sekundę. Po osiągnięciu limitu współbieżnych żądań system umieszcza dodatkowe żądania w kolejce. Jeśli kolejka jest pełna, system odrzuca dalsze żądania i należy je ponowić.

Łączna liczba zapytań rankingowania semantycznego na sekundę zależy od następujących czynników:

  • Poziom usługi wyszukiwania. Zarówno pojemność kolejki, jak i limity żądań współbieżnych różnią się w zależności od warstwy.
  • Liczba jednostek wyszukiwania w usłudze wyszukiwania. Najprostszym sposobem zwiększenia maksymalnej liczby współbieżnych zapytań przez semantyczny rangator jest dodanie kolejnych jednostek wyszukiwania do usługi.
  • Łączna dostępna pojemność klasyfikatora semantycznego w regionie.
  • Czas potrzebny na obsługę zapytania przy użyciu klasyfikatora semantycznego. Czas ten różni się w zależności od obciążenia usługi wyszukiwania.

W poniższej tabeli opisano limity ograniczania klasyfikacji semantycznej według warstwy, z uwzględnieniem dostępnej pojemności w regionie. Możesz skontaktować się z pomocą techniczną firmy Microsoft, aby poprosić o zwiększenie limitu.

Zasób Basic S1 S2 S3 S3 (wysoka gęstość) L1 L2 Deweloper bezserwerowy
Maksymalna liczba współbieżnych żądań (na jednostkę wyszukiwania) 2 3 4 4 4 4 4 4 (na usługę)
Maksymalny rozmiar kolejki żądań (na jednostkę wyszukiwania) 4 6 8 8 8 8 8 8 (na usługę)

Limity żądań interfejsu API

Istnieją limity zapytań, ponieważ niezwiązane zapytania mogą zdestabilizować usługę wyszukiwania. Zazwyczaj takie zapytania są tworzone programowo. Jeśli aplikacja generuje zapytania wyszukiwania programowo, zaprojektuj je tak, aby nie generowała zapytań o niezwiązany rozmiar.

Limity ładunków istnieją z podobnych powodów, zapewniając stabilność usługi wyszukiwania. Limit dotyczy całego żądania, włącznie ze wszystkimi jego składnikami. Na przykład, jeśli żądanie łączy kilka dokumentów lub poleceń, całe żądanie musi mieścić się w obsługiwanym limicie.

Jeśli musisz przekroczyć obsługiwany limit, przetestuj obciążenie , aby wiedzieć, czego oczekiwać.

Z wyjątkiem przypadków, w których zaznaczono, następujące żądania interfejsu API dotyczą wszystkich programowalnych interfejsów, w tym zestawów SDK platformy Azure.

Ogólne:

  • Obsługiwany maksymalny limit ładunku to 16 MB na potrzeby indeksowania i wysyłania zapytań za pośrednictwem interfejsu API REST i zestawów SDK.
  • Maksymalna długość adresu URL 8 KB (dotyczy tylko interfejsów API REST).

API indeksowania

  • Obsługiwane maksymalnie 1000 dokumentów na partię przekazywania indeksu, scalania lub usuwania.
  • Każde żądanie obsługuje od 1 do 32 000 akcji indeksowania.

Interfejsy API zapytań:

  • Maksymalnie 10 pól w zapytaniu wektorowym
  • Maksymalnie 32 pola w klauzuli $orderby.
  • Maksymalnie 100 000 znaków w klauzuli wyszukiwania.
  • Maksymalna liczba klauzul w wyszukiwaniu wynosi 3000.
  • Maksymalne limity dla zapytań z użyciem wildcard i wyrażeń regularnych, zgodnie z ograniczeniami wymuszanymi przez Lucene. Limituje liczbę wzorców, odmian lub dopasowań do 1000 wystąpień. Ten limit jest obowiązujący, aby uniknąć przeciążenia silnika.

Wyszukiwane terminy:

  • Obsługiwany maksymalny rozmiar terminu wyszukiwania to 32 766 bajtów (32 KB minus 2 bajty) zakodowanego tekstu UTF-8. Dotyczy wyszukiwania słów kluczowych i właściwości tekstowej wyszukiwania wektorowego.
  • Obsługiwany maksymalny rozmiar terminu wyszukiwania to 1000 znaków dla wyszukiwania prefiksów i wyszukiwania wyrażeń regularnych.

Limity odpowiedzi interfejsu API

  • Każda strona wyników wyszukiwania zwraca maksymalnie 1000 dokumentów.
  • Każde żądanie sugerowanego interfejsu API zwraca maksymalnie 100 sugestii.

Aparat wyszukiwania zwraca domyślnie 50 wyników, ale można zastąpić ten parametr do maksymalnego limitu.

Limity kluczy interfejsu API

Użyj kluczy interfejsu API do uwierzytelniania usługi. Istnieją dwa typy kluczy interfejsu API. Klucze administratora określone w nagłówku żądania zapewniają pełny dostęp do odczytu i zapisu w usłudze. Klucze zapytań określone w adresie URL są tylko do odczytu i zwykle dystrybuowane do aplikacji klienckich.

  • Każda usługa obsługuje maksymalnie dwa klucze administratora.
  • Każda usługa obsługuje maksymalnie 50 kluczy zapytań.