Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Nota
O Pesquisa de IA do Azure está disponível através do portal Azure, APIs REST e SDKs do Azure. Também sustenta o Foundry IQ, a camada de conhecimento gerida que transforma conteúdos empresariais em bases de conhecimento reutilizáveis e conscientes de permissões para agentes no portal Microsoft Foundry.
Os limites máximos de armazenamento, cargas de trabalho e quantidades de índices e outros objetos dependem do modelo de preços do seu serviço Pesquisa de IA do Azure.
O Pesquisa de IA do Azure suporta dois modelos de preços, cada um com níveis de serviço associados. O nível que escolher afeta os limites de serviço descritos nesta orientação.
- Dedicado: Preço fixo medido por Unidades de Pesquisa (SUs). As opções de nível de serviço incluem: Básico, Padrão (S1-S3, incluindo S3 HD), Otimizado para Armazenamento (L1-L2) e um Nível Gratuito com capacidades limitadas de serviço de pesquisa.
- Serverless (Pré-visualização): Preços com base no consumo, medidos em Unidades de Computação por hora (CU/hr) e por GB/mês para o armazenamento indexado. O nível de pré-visualização atual é: Serverless Developer. Os limites são definidos por limites máximos por índice, número de objetos por serviço e comportamento de limitação do Serverless.
Importante
O nível Serverless Developer está atualmente em pré-visualização. Esta pré-visualização é fornecida sem um acordo de nível de serviço e não é recomendada para cargas de trabalho em produção. Certas funcionalidades podem não ser suportadas ou podem ter capacidades limitadas. Para mais informações, consulte Termos Suplementares de Utilização para Microsoft Azure Previews.
A faturação para o escalão Serverless Developer tem início em 13 de setembro de 2026. As taxas de utilização a partir dessa data aparecem na sua fatura Azure. Não é cobrado pelo uso antes de 13 de setembro de 2026. O Serverless Developer é um nível pago assim que a faturação começa.
A camada Serverless Developer não suporta migração para ou de outras categorias de preços e algumas funcionalidades disponíveis noutros níveis não são suportadas durante a Pré-visualização Pública. Os limites de serviço, funcionalidades suportadas e detalhes de preços podem mudar antes da disponibilidade geral.
Durante a pré-visualização, o modelo de preços Serverless é suportado apenas em regiões específicas.
Para saber mais, consulte Escolha um modelo de preços e um nível de serviço.
Diagnosticar falhas de quotas, capacidade ou limites
As falhas de quota e da capacidade resultam de controlos distintos. Use o erro da operação concluída para encontrar qual se aplica.
Se uma operação de criar, escalar ou atualizar ainda estiver a decorrer, espere que o estado de provisionamento se torne Succeeded ou Failed. Uma operação em curso não é prova de um problema de quotas ou capacidade. Se uma operação de escala falhar, veja Erros durante a escalabilidade.
| Failure | Causa provável | Primeira ação |
|---|---|---|
| Criação de serviços bloqueada numa subscrição e numa região | Quota de subscrição | No serviço Quotas , verifica o limite para o teu nível e região, depois solicita mais serviços. |
| A criação, o dimensionamento ou a atualização falham apesar de haver quota disponível | Restrição regional de capacidade | Consulta as notas de rodapé no suporte regional para níveis restritos, depois escolhe outra região. |
| Pedido de réplica, partição, camada ou objeto rejeitado | Limite de serviço ou índice | Compare a sua configuração e as contagens de objetos com limites de serviço e limites de índice. |
| O serviço de pesquisa devolve respostas de limitação sob carga | Throttling | Reduza a taxa de pedidos ou adicione unidades de pesquisa. Ver Limites de estrangulamento. |
| A indexação falha perto de um limite de armazenamento ou vetor | Armazenamento ou quota vetorial | Compare storageSize com o armazenamento de partições para disco e vectorIndexSize com os limites de tamanho do índice vetorial para memória. |
| O indexador, a competência ou o vectorizador devolve um erro 429 de outro serviço | Azure OpenAI ou outra quota de serviços | Siga as orientações de quota para o serviço que emitiu o erro, como o Azure OpenAI. |
A quota de subscrição disponível não garante capacidade regional, e pedir mais quotas não resolve uma limitação de capacidade. Se a falha persistir, abra um pedido de suporte do Azure que inclua a subscrição, região, nível, configuração solicitada, texto de erro completo, hora UTC e qualquer correlação ou ID de operação.
Limites da subscrição
Você pode criar vários serviços de pesquisa faturáveis (básicos e superiores), até o número máximo de serviços permitidos em cada camada, por região. Por exemplo, pode criar até 16 serviços no nível Básico e outros 16 serviços no nível S1 dentro da mesma subscrição e região. Pode então criar mais 16 serviços Básicos noutra região, totalizando um total combinado de 32 serviços Básicos sob a mesma subscrição. Para mais informações sobre os níveis de serviço, consulte Escolha um modelo de preços e um escalão de serviço.
Pode aumentar os limites máximos de serviço mediante pedido. Se você precisar de mais serviços dentro da mesma assinatura, registre uma solicitação de suporte.
| Recurso | Grátis 1 | Básico | S1 | S2 | S3 | S3 HD | L1 | L2 | Desenvolvedor Serverless |
|---|---|---|---|---|---|---|---|---|---|
| Máximo de serviços por região | 1 | 16 | 16 | 8 | 6 | 6 | 6 | 6 | 5 |
| Máximo de unidades de pesquisa (SU)2 | N/A | 3 Sistema Único | 36 SU | 36 SU | 36 SU | 36 SU | 36 SU | 36 SU | N/A |
1 Você pode ter um serviço de pesquisa gratuito por assinatura do Azure. O nível gratuito é baseado na infraestrutura compartilhada com outros clientes. Como o hardware não é dedicado, a expansão não é suportada e o armazenamento é limitado a 50 MB. Um serviço de pesquisa gratuito pode ser excluído após longos períodos de inatividade para abrir espaço para mais serviços.
2 As unidades de pesquisa (SU) são unidades de faturação, alocadas como uma réplica ou uma partição. Você precisa de ambos. Para saber mais sobre combinações de SU, consulte Estimar e gerenciar a capacidade de um serviço de pesquisa.
Limites de serviço
No modelo de preços dedicados, planeia-se a capacidade multiplicando réplicas por partições (unidades de pesquisa).
| Recurso | Gratuito | Básico | S1 | S2 | S3 | S3 HD | L1 | L2 | Desenvolvedor Serverless |
|---|---|---|---|---|---|---|---|---|---|
| Partições | N/A | 3 1 | 12 | 12 | 12 | 3 | 12 | 12 | N/A |
| Réplicas | N/A | 3 | 12 | 12 | 12 | 12 | 12 | 12 | N/A |
1 O nível Básico suporta três partições e três réplicas, totalizando nove unidades de pesquisa (SU) em novos serviços de pesquisa criados após 3 de abril de 2024. Os serviços Basic mais antigos estão limitados a uma partição e três réplicas.
Um serviço de pesquisa está sujeito a um limite máximo de armazenamento (tamanho da partição multiplicado pelo número de partições) ou a um limite rígido para o número máximo de índices ou indexadores, o que ocorrer primeiro.
Os contratos de nível de serviço (SLAs) aplicam-se a serviços faturáveis que tenham duas ou mais réplicas para cargas de trabalho de consulta ou três ou mais réplicas para cargas de trabalho de consulta e indexação. O número de partições não é uma consideração de SLA. Para obter mais informações, consulte Confiabilidade na Pesquisa de IA do Azure.
Os serviços gratuitos não têm partições ou réplicas fixas e partilham recursos com outros subscritores.
Armazenamento de partições (GB)
Os limites de armazenamento por serviço variam com base em dois fatores: data de criação do serviço e região. A maioria das regiões suportadas oferece limites mais elevados para serviços mais recentes.
Esta tabela mostra a progressão dos aumentos da quota de armazenamento em GB ao longo do tempo. A partir de abril de 2024, partições de maior capacidade entraram em funcionamento nas regiões listadas nas notas de rodapé. Se tiver um serviço mais antigo numa região suportada, verifique se pode atualizar o seu serviço para obter limites de armazenamento mais elevados.
| Data de criação do serviço | Básico | S1 | S2 | S3/HD | L1 | L2 | Desenvolvedor Serverless |
|---|---|---|---|---|---|---|---|
| Antes de 3 de abril de 2024 | 2 | 25 | 100 | 200 | 1,024 | 2048 | N/A |
| 3 de abril de 2024 a 17 de maio de 2024 1 | 15 | 160 | 512 | 1,024 | 1,024 | 2048 | N/A |
| Depois de 17 de maio de 2024 2 | 15 | 160 | 512 | 1,024 | 2,048 | 4,096 | N/A |
| Depois de 10 de fevereiro de 2025 3 | 15 | 160 | 512 | 1,024 | 2048 | 4,096 | N/A |
1 Armazenamento de maior capacidade para Basic, S1, S2 e S3 nestas regiões. Américas: Brasil Sul, Canadá Central, Canadá Este, Leste dos EUA, Leste dos EUA 2, Centro dos EUA, Norte Central dos EUA, Sul Central dos EUA, Oeste dos EUA, Oeste dos EUA 2, Oeste dos EUA 3, Oeste Central dos EUA. Europa: França Central. Itália Norte, Norte da Europa, Noruega Este, Polónia Central, Suíça Norte, Suécia Central, Reino Unido Sul, Reino Unido Oeste. Médio Oriente: Norte dos Emirados Árabes Unidos. África: África do Sul Norte. Ásia-Pacífico: Austrália Leste, Austrália Sudeste, Índia Central, Jio Índia Oeste, Leste Asiático, Sudeste Asiático, Japão Leste, Japão Oeste, Coreia Central, Coreia Sul.
2 Armazenamento de maior capacidade para L1 e L2. Mais regiões oferecem maior capacidade em todos os níveis faturáveis. Américas: Leste dos EUA 2 EUAP. Europa: Alemanha Norte, Alemanha Centro-Oeste, Suíça Oeste. Azure Government: Texas, Arizona, Virgínia. África: África do Sul Norte. Ásia-Pacífico: China Norte 3, China Leste 3.
3 Armazenamento de maior capacidade está disponível na Europa Ocidental.
Importante
Atualmente, limites de armazenamento mais altos não estão disponíveis nas seguintes regiões, que estão sujeitas aos limites anteriores a 3 de abril.
- Israel Central
- Catar Central
- Espanha Central
- Sul da Índia
Limites de índice
| Recurso | Gratuito | Básico 1 | S1 | S2 | S3 | S3 HD | L1 | L2 | Desenvolvedor Serverless |
|---|---|---|---|---|---|---|---|---|---|
| Índices máximos | 3 | 5 ou 15 | 50 | 200 | 200 | 1000 por partição ou 3000 por serviço | 10 | 10 | 30 |
| Máximo de campos simples por índice 2 | 1000 | 100 | 1000 | 1000 | 1000 | 1000 | 1000 | 1000 | 1000 |
| Dimensões máximas por campo vetorial | 4096 | 4096 | 4096 | 4096 | 4096 | 4096 | 4096 | 4096 | 4096 |
| Máximo de coleções complexas por índice | 40 | 40 | 40 | 40 | 40 | 40 | 40 | 40 | 40 |
| Máximo de elementos em todas as coleções complexas por documento 3 | 3000 | 3000 | 3000 | 3000 | 3000 | 3000 | 3000 | 3000 | 3000 |
| Profundidade máxima de campos complexos | 10 | 10 | 10 | 10 | 10 | 10 | 10 | 10 | 10 |
| Sugestores máximos por índice | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 | 1 |
| Perfis máximos de pontuação por índice | 100 | 100 | 100 | 100 | 100 | 100 | 100 | 100 | 100 |
| Configurações semânticas máximas por índice | 100 | 100 | 100 | 100 | 100 | 100 | 100 | 100 | 100 |
| Máximo de funções por perfil | 8 | 8 | 8 | 8 | 8 | 8 | 8 | 8 | 8 |
| Tamanho máximo do índice 4 | N/A | N/A | N/A | 1,88 TB | 2,34 TB | 100 GB | N/A | N/A | 1 GB |
1 Os serviços básicos criados antes de dezembro de 2017 têm limites mais baixos (5 em vez de 15) nos índices. A camada básica é a única camada com um limite inferior de 100 campos por índice.
2 O limite máximo de campos inclui campos de nível principal e subcampos aninhados numa coleção complexa. Por exemplo, se um índice contiver 15 campos e tiver duas coleções complexas com cinco subcampos cada, a contagem de campos do índice será 25. Os índices com uma coleção de campos muito grande podem ser lentos. Limite campos e atributos apenas àqueles de que você precisa e execute indexação e teste de consulta para garantir que o desempenho seja aceitável.
3 Existe um limite superior para elementos porque ter um grande número deles aumenta significativamente o armazenamento necessário para o seu índice. Um elemento de uma coleção complexa é definido como um membro dessa coleção. Por exemplo, considere um documento de hotel com uma coleção complexa de Rooms. Cada sala da coleção Rooms é considerada um elemento. Durante a indexação, o mecanismo de indexação pode processar com segurança um máximo de 3.000 elementos no documento como um todo.
Este limite foi introduzido em api-version=2019-05-06 e aplica-se apenas a coleções complexas, e não a coleções de cadeias ou campos complexos.
4 Para a maioria dos níveis, o tamanho máximo do índice é o armazenamento total disponível no serviço de pesquisa. Para serviços S2, S3 e S3 HD com várias partições e, portanto, mais armazenamento, o tamanho máximo de um único índice é fornecido na tabela. Aplica-se a serviços de pesquisa criados após 3 de abril de 2024. Índices para serviços configurados com o modelo Serverless (Pré-visualização) têm um tamanho máximo definido indicado na tabela.
Você pode encontrar alguma variação nos limites máximos se o serviço for provisionado em um cluster mais poderoso. Os limites aqui representam o denominador comum. Os índices criados de acordo com as especificações acima são portáteis em níveis de serviço equivalentes em qualquer região.
Limites de documentos
Cada índice suporta até o seguinte número de documentos:
- 24 mil milhões em Basic, S1, S2 e S3
- 2 mil milhões no S3 HD
- 288 mil milhões em L1
- 576 mil milhões em L2
Cada documento pode ter até aproximadamente 16 MB de tamanho. O limite de tamanho do documento aplica-se, na verdade, ao tamanho da carga útil do pedido de API de indexação, que é de 16 MB. Essa carga útil pode ser um único documento ou um lote de documentos. Para um lote com um único documento, o tamanho máximo do documento é de 16 MB de JSON.
O limite de tamanho do documento aplica-se à indexação em modo push que carrega documentos para um serviço de pesquisa. Se você estiver usando um indexador para indexação em modo pull, seus arquivos de origem podem ser de qualquer tamanho de arquivo, sujeitos aos limites do indexador. Para o indexador de blob, os limites de tamanho de arquivo são maiores para camadas mais altas. Por exemplo, o limite S1 é 128 MB, e o limite S2 é 256 MB.
Ao estimar o tamanho do documento, lembre-se de indexar apenas os campos que acrescentam valor aos seus cenários de pesquisa. Exclua campos de origem que não tenham propósito nas consultas que pretende executar.
Limites de tamanho do índice vetorial
Quando você indexa documentos com campos vetoriais, o Pesquisa de IA do Azure constrói índices vetoriais internos usando os parâmetros de algoritmo fornecidos.
O tamanho destes índices vetoriais é limitado por:
- A memória reservada para pesquisa vetorial para o nível (ou
SKU) do seu serviço no modelo de preços dedicados. - Limites de armazenamento por índice no modelo de preços Serverless.
Para obter orientações sobre como gerenciar e maximizar o armazenamento vetorial, consulte Tamanho do índice vetorial e permanecer abaixo dos limites.
Os limites vetoriais variam por:
Limites vetoriais mais altos a partir de abril de 2024 existem em novos serviços de busca em regiões que fornecem a capacidade extra, que é a maioria deles. Se você tiver um serviço mais antigo em uma região compatível, verifique se é possível atualizar seu serviço para os limites vetoriais mais altos.
No modelo de preços Serverless, os limites vetoriais são definidos por índice em vez de por partição.
-
Tamanho máximo do índice vetorial por índice (Serverless): 300 MB
- Este tamanho representa aproximadamente 30% do armazenamento total do índice, consistente com a relação vetor-armazenamento usada nos níveis de serviço dedicados.
- Este tamanho é um limite rígido por índice. As tentativas de ultrapassar este limite durante a indexação falham.
Esta tabela mostra a progressão dos aumentos de cota vetorial em GB ao longo do tempo. A cota é por partição, portanto, se você dimensionar um novo serviço Standard (S1) para 6 partições, a cota vetorial total será 35 multiplicada por 6.
| Data de criação do serviço | Básico | S1 | S2 | S3/HD | L1 | L2 |
|---|---|---|---|---|---|---|
| Antes de 1 de julho de 20231 | 0,5 | 1 | 6 | 12 | 12 | 36 |
| 1 de julho de 2023 a 3 de abril de 20242 | 1 | 3 | 12 | 36 | 12 | 36 |
| 3 de abril de 2024 a 17 de maio de 20243 | 5 | 35 | 150 | 300 | 12 | 36 |
| Depois de 17 de maio de 20244 | 5 | 35 | 150 | 300 | 150 | 300 |
1 Limites vetoriais iniciais durante a pré-visualização.
2 Limites vetoriais durante o período de pré-visualização final. Três regiões não tinham os limites mais altos: Alemanha Centro-Oeste, Índia Ocidental, Qatar Central.
3 Quota vetorial mais elevada com base nas partições maiores para as camadas e regiões suportadas.
4 Cota vetorial aumentada para mais níveis e regiões com base nas atualizações do tamanho da partição.
O serviço impõe uma quota de tamanho do índice vetorial:
- Dedicado: Por partição no seu serviço de pesquisa
- Sem servidor: Por índice
Esta quota é um limite rígido para garantir que o seu serviço se mantém saudável. Tentativas adicionais de indexação após o limite ser ultrapassado resultam em falha. Pode retomar a indexação assim que libertar a quota disponível através de:
- Eliminação de documentos vetoriais
- Redução do tamanho ou dimensionalidade do vetor
- (Apenas dedicado) Escalonamento das partições
Importante
Limites vetoriais mais altos estão vinculados a tamanhos de partição maiores. Atualmente, limites vetoriais mais altos não estão disponíveis nas seguintes regiões, que estão sujeitas aos limites de julho a abril.
- Israel Central
- Catar Central
- Espanha Central
- Sul da Índia
Limites do indexador
Os tempos de execução máximos existem para proporcionar equilíbrio e estabilidade ao serviço como um todo, mas conjuntos de dados maiores podem precisar de mais tempo de indexação do que o máximo permite. Se um trabalho de indexação não puder ser concluído dentro do tempo máximo permitido, tente executá-lo em um cronograma. O agendador acompanha o status da indexação. Se um trabalho de indexação agendado for interrompido por qualquer motivo, o indexador poderá continuar de onde parou pela última vez na próxima execução agendada.
Nota
No modelo de preços Serverless, o comportamento dos indexadores difere dos serviços dedicados. A capacidade não é definida por réplicas ou partições. Em vez disso, limites por objeto por serviço, limites de armazenamento por índice e limitação ao nível de serviço regulam os limites de indexação. O tempo máximo de execução por execução do indexador Serverless Developer é de duas horas.
Limites do objeto de indexação e da capacidade de processamento
| Recurso | Grátis 1 | Básico 2 | S1 | S2 | S3 | S3 HD 3 | L1 | L2 | Desenvolvedor Serverless |
|---|---|---|---|---|---|---|---|---|---|
| Indexadores máximos | 3 | 5 ou 15 | 50 | 200 | 200 | N/A | 10 | 10 | 30 |
| Máximo de fontes de dados | 3 | 5 ou 15 | 50 | 200 | 200 | N/A | 10 | 10 | 30 por serviço |
| Máximo de 4 conjuntos de competências | 3 | 5 ou 15 | 50 | 200 | 200 | N/A | 10 | 10 | 30 |
| Carga máxima de indexação por invocação | 10.000 documentos | Limitado apenas pelo número máximo de documentos | Limitado apenas pelo número máximo de documentos | Limitado apenas pelo número máximo de documentos | Limitado apenas pelo número máximo de documentos | N/A | Sem limite | Sem limite | Limitado apenas pelo número máximo de documentos |
| Horário mínimo | 5 minutos | 5 minutos | 5 minutos | 5 minutos | 5 minutos | 5 minutos | 5 minutos | 5 minutos | 5 minutos |
| Tempo máximo de execução por indexador 5 | 1-3 ou 3-10 minutos | 2 ou 24 horas | 2 ou 24 horas | 2 ou 24 horas | 2 ou 24 horas | 2 horas | 2 ou 24 horas | 2 ou 24 horas | 2 horas |
| Tempo de execução acumulado do indexador por serviço 6 | N/A | N/A | N/A | N/A | N/A | 24 horas | N/A | N/A | 24 horas |
1 Os serviços gratuitos têm um tempo máximo de execução do indexador de 3 minutos para fontes de blob e 1 minuto para todas as outras fontes de dados. A invocação do indexador é feita uma vez a cada 180 segundos. Para a indexação de IA que chama Foundry Tools, os serviços gratuitos estão limitados a 20 transações gratuitas por indexador por dia, onde uma transação é definida como um documento que passa com sucesso pelo pipeline de enriquecimento. (Dica: Pode reiniciar um indexador para redefinir a contagem.)
2 Os serviços básicos criados antes de dezembro de 2017 têm limites mais baixos (5 em vez de 15) para indexadores, fontes de dados e conjuntos de competências.
O suporte para o indexador S3 HD 3 está em pré-visualização e requer a versão 2025-11-01-preview da API REST ou posterior. Os indexadores HD S3 funcionam apenas no ambiente de execução multitenant e não suportam recursos privados partilhados. Durante a pré-visualização, o suporte ao indexador S3 HD é mais adequado para cargas de trabalho pequenas (aproximadamente 1 GB de índice) com competências nulas ou mínimas. Para orientações agregadas sobre comportamento, monitorização e planeamento, veja Execução do Indexador em Serverless e S3 HD.
4 Máximo de 30 competências por conjunto de competências.
5 Em relação à duração máxima de 2 ou 24 horas para indexadores: um máximo de 2 horas é o mais comum e é o que deves planear. Refere-se a indexadores que funcionam no ambiente público, o que descarrega processamento computacionalmente intensivo e deixa mais recursos para consultas. O limite de 24 horas se aplica se você configurar o indexador para ser executado em um ambiente privado usando apenas a infraestrutura alocada ao seu serviço de pesquisa. Alguns indexadores mais antigos são incapazes de funcionar em ambientes públicos, e esses indexadores têm sempre um intervalo de processamento de 24 horas. Se você tiver indexadores não agendados que são executados continuamente por 24 horas, pode presumir que esses indexadores não puderam ser migrados para a infraestrutura mais recente. Como regra geral, para trabalhos de indexação que não conseguem terminar em duas horas, coloque o indexador num cronograma de 5 minutos para que ele possa rapidamente retomar de onde ficou. No nível Gratuito, o tempo máximo de execução de 3 a 10 minutos destina-se a indexadores com competências específicas.
6 Nos serviços S3 HD e Serverless, todos os indexadores partilham 24 horas de tempo de execução acumulado por serviço em cada janela UTC de 24 horas. Para orientações sobre comportamento de quotas, monitorização e planeamento, veja Execução do Indexador em Serverless e S3 HD.
Limites de ficheiros fonte para indexadores do tipo blobs
O processamento de ficheiros ocorre em etapas, e cada etapa tem os seus próprios limites:
- Um conector de fonte de dados descarrega um item de origem, sujeito a limites específicos de cada fonte.
- O Pesquisa de IA do Azure extrai o conteúdo do item, sujeito ao tamanho máximo do ficheiro-fonte e aos limites de caracteres extraídos na tabela seguinte.
- Opcionalmente, um conjunto de competências envia esse conteúdo para serviços posteriores, onde o limite de entrada de uma competência individual pode ser menor do que o que o indexador extrai.
Os limites máximos do tamanho do ficheiro de origem e dos caracteres extraídos na tabela seguinte aplicam-se aos indexadores do Armazenamento de Blobs do Azure, ADLS Gen2, SharePoint no Microsoft 365, OneLake e Ficheiros do Azure. Para os limites por competência, consulte o artigo de referência para cada competência do seu conjunto de competências.
| Recurso | Gratuito | Básico | S1 | S2 | S3 | S3 HD | L1 | L2 | Desenvolvedor Serverless |
|---|---|---|---|---|---|---|---|---|---|
| Tamanho máximo do ficheiro fonte, MB 24 | 16 | 16 | 128 | 256 | 256 | N/A | 256 | 256 | 256 |
| Caracteres máximos extraídos de um ficheiro fonte 134 | 256,000 | 512.000 | 4 mil | 8 mil | 16 mil | N/A | 4 mil | 4 mil | 16 mil |
1 O número máximo de caracteres baseia-se em unidades de código Unicode, especificamente UTF-16.
2 Ao usar delimitedText o modo de análise para ficheiros CSV, aplica-se um limite de tamanho de buffer de 10MB por linha de ficheiro.
3 Ao usar delimitedText o modo de análise para ficheiros CSV, o limite de "tamanho máximo de conteúdo extraído" não se aplica.
4 indexadores do tipo Blob incluem o Armazenamento de Blobs do Azure indexer (blob indexer), ADLS Gen2 indexer, SharePoint in Microsoft 365 indexer, OneLake indexer e Ficheiros do Azure indexer. A fonte de conhecimento de ficheiros de upload direto não usa um indexador e tem limites separados.
Limites de recursos de links privados compartilhados
Os indexadores podem aceder a outros recursos do Azure sobre pontos finais privados geridos através da API de recurso de ligação privada partilhada. Esta seção descreve os limites associados a esse recurso.
Nota
O escalão Developer do modelo de preços Serverless não suporta ligações privadas partilhadas nem perímetro de segurança de rede (NSP) para fontes de dados. São suportados Endpoints Privados e regras de firewall IP para uma ligação privada a um serviço de nível Serverless Developer.
| Recurso | Gratuito | Básico | S1 | S2 | S3 | S3 HD | L1 | L2 | Desenvolvedor Serverless |
|---|---|---|---|---|---|---|---|---|---|
| Suporte ao indexador de ponto de extremidade privado | Não | Sim | Sim | Sim | Sim | Não | Sim | Sim | Não |
| Suporte de ponto final privado para indexadores com um conjunto de aptidões 1 | Não | Não | Sim | Sim | Sim | Não | Sim | Sim | Não |
| Suporte de endpoint privado para conjuntos de habilidades com uma habilidade de incorporação 2 | Não | Sim | Sim | Sim | Sim | Não | Sim | Sim | Não |
| Máximo de pontos finais privados | N/A | 10 ou 30 | 100 | 400 | 400 | N/A | 20 | 20 | N/A |
| Máximo de tipos de recursos distintos 3 | N/A | 4 | 7 | 15 | 15 | N/A | 4 | 4 | N/A |
1 O enriquecimento da IA e a análise de imagens são computacionalmente intensivos e consomem quantidades desproporcionadas de poder de processamento disponível. Por esse motivo, as conexões privadas são desativadas em níveis mais baixos para garantir o desempenho e a estabilidade do próprio serviço de pesquisa. Nos serviços Básicos, as ligações privadas a um recurso Microsoft Foundry não são suportadas para preservar a estabilidade do serviço. Para a camada S1, verifique se o serviço foi criado com limites mais altos após 3 de abril de 2024. Indexadores com mais de 2 capacidades de Azure OpenAI Embedding ou embeddings multimodais de Azure Vision estão impedidos de funcionar em ambiente privado, e não estão disponíveis ligações privadas.
2 As conexões privadas com um modelo de incorporação são suportadas nos serviços de pesquisa de alta capacidade Basic e S1 criados após 3 de abril de 2024, com os limites mais altos para armazenamento e processamento computacional.
3 O número de tipos de recursos distintos é calculado como o número de valores únicos groupId utilizados em todos os recursos de ligação privada partilhada para um determinado serviço de pesquisa, independentemente do estado do recurso.
Limites de sinónimos
O número máximo de mapas sinónimos varia consoante o nível. Cada regra pode ter até 20 expansões, onde uma expansão é um termo equivalente. Por exemplo, dado "gato", a associação com "gatinho", "felino" e "felis" (o género taxonómico dos gatos) corresponde a três expansões.
| Recurso | Gratuito | Básico | S1 | S2 | S3 | S3 HD | L1 | L2 | Desenvolvedor Serverless |
|---|---|---|---|---|---|---|---|---|---|
| Mapas de sinónimos máximos | 3 | 3 | 5 | 10 | 20 | 20 | 10 | 10 | 20 por serviço |
| Número máximo de regras por mapa | 5 000 | 20 000 | 20 000 | 20 000 | 20 000 | 20 000 | 20 000 | 20 000 | 20 000 |
Limites de alias de índice
O número máximo de pseudónimos de índice varia consoante o nível e a data de criação do serviço. Em todos os níveis, se o serviço foi criado após outubro de 2022, o número máximo de pseudónimos é o dobro do número máximo de índices permitidos. Se o serviço foi criado antes de outubro de 2022, o limite é o número de índices permitidos.
Nota
O nível Serverless Model Developer não suporta aliases de índice.
| Data de criação do serviço | Gratuito | Básico | S1 | S2 | S3 | S3 HD | L1 | L2 | Desenvolvedor Serverless |
|---|---|---|---|---|---|---|---|---|---|
| Antes de outubro de 2022 | 3 | 5 ou 15 1 | 50 | 200 | 200 | 1000 por partição ou 3000 por serviço | 10 | 10 | N/A |
| Depois de outubro de 2022 | 6 | 30 | 100 | 400 | 400 | 2000 por partição ou 6000 por serviço | 20 | 20 | N/A |
1 Os serviços básicos criados antes de dezembro de 2017 têm limites mais baixos (5 em vez de 15) nos índices.
Limites de recuperação agentica
Uma base de conhecimento especifica uma ou mais fontes de conhecimento e um esforço de raciocínio de recuperação que controla o nível de processamento de grandes modelos de linguagem (LLM) para recuperação agentiva. Os limites variam consoante o nível de preço, a versão da API e o nível de esforço de raciocínio.
| Recurso | Gratuito | Básico | S1 | S2 | S3 | S3 HD | L1 | L2 | Desenvolvedor Serverless |
|---|---|---|---|---|---|---|---|---|---|
| Fontes máximas de conhecimento por serviço | 3 | 5 ou 15 1 | 50 | 200 | 200 | 0 | 10 | 10 | 30 |
| Bases de conhecimento máximas por serviço | 3 | 5 ou 15 1 | 50 | 200 | 200 | 0 | 10 | 10 | 30 |
| Fontes máximas de conhecimento por base de conhecimento | 3 | 5 ou 10 1 | 10 | 10 | 10 | 0 | 10 | 10 | 10 |
1 Os serviços básicos criados antes de 3 de abril de 2024 têm limites inferiores (5) para fontes de conhecimento e bases de conhecimento.
Seleção da fonte de conhecimento durante a recuperação
Uma base de conhecimento pode conter até ao limite máximo específico do escalão apresentado acima, independentemente da versão da API ou do esforço de raciocínio aplicado à recuperação. A versão da API e o esforço de raciocínio afetam, em vez disso, quantas fontes de conhecimento podem ser selecionadas durante a recuperação.
| Versão da API | Esforço de raciocínio para recuperação de informações | Gratuito | Básico | S1 | S2 | S3 | S3 HD | L1 | L2 |
|---|---|---|---|---|---|---|---|---|---|
2026-05-01-preview e mais tarde |
minimal, low, medium |
3 | 5 ou 10 1 | 10 | 10 | 10 | 0 | 10 | 10 |
2026-04-01, 2025-11-01-preview |
minimal
2 |
3 | 5 ou 10 1 | 10 | 10 | 10 | 0 | 10 | 10 |
2025-11-01-preview |
low |
3 | 3 | 3 | 3 | 3 | 0 | 3 | 3 |
2025-11-01-preview |
medium |
3 | 5 | 5 | 5 | 5 | 0 | 5 | 5 |
O 2025-08-01-preview utiliza o contrato legado do agente de conhecimento e não suporta retrievalReasoningEffort.
2 O minimal esforço de raciocínio utiliza todas as fontes de conhecimento da base de conhecimento porque contorna o planeamento de consultas baseado em LLM.
Obter o tempo de execução da solicitação
O maxRuntimeInSeconds limite é o mesmo em todos os níveis suportados.
| Mínimo | Default | Máximo |
|---|---|---|
| 10 segundos | 90 segundos | 600 segundos (10 minutos) |
O valor máximo aplica-se apenas ao pedido retrieve do Pesquisa de IA do Azure. Para exemplos de configuração, consulte Substituir o esforço de raciocínio predefinido e definir limites de solicitações.
Limites de dados (enriquecimento de IA)
Os limites de dados aplicam-se a um pipeline de enriquecimento por IA que utiliza o Azure Language no Foundry Tools. A entrada máxima é de 50.000 caracteres, medida por String.Length, para as competências de Reconhecimento de Entidades, Ligação de Entidades, Extração de Frases-Chave, Deteção de Linguagem e Deteção de PII. A habilidade Sentimento tem um máximo de 5.000 caracteres.
Usa a habilidade Text Split quando precisares de dividir texto maior antes do processamento a jusante.
Estes limites aplicam-se tanto aos modelos de preços Dedicated como Serverless.
Limites de limitação
Os limites de limitação ajudam a garantir a estabilidade do serviço ao controlar a taxa dos pedidos de API.
No modelo de preços dedicados, a limitação baseia-se em unidades de pesquisa (réplicas × partições).
No modelo de preços Serverless, a limitação não se baseia em unidades de pesquisa. Em vez disso, os limites operacionais ao nível do serviço e o comportamento global de consumo determinam a taxa de transferência. Os limites de utilização e de serviço gerem a capacidade, não a configuração das réplicas e das partições.
| Funcionamento | Dedicado (por unidade de pesquisa) | Serverless (por serviço ou por índice) |
|---|---|---|
| Índices de listas (GET /indexes) | 3 pedidos/sec/SU | 3 pedidos/segundo |
| Obter índice (GET /indexes/{index}) | 10 pedidos/sec/SU | 10 pedidos/segundo |
| Criar índice (POST /indexes) | 12 pedidos/minuto/SU | 12 pedidos/min |
| Criar ou atualizar índice (PUT /indexes/{index}) | 6 pedidos/sec/SU | 6 pedidos/seg |
| Eliminar índice (DELETE /indexes/{index}) | 12 pedidos/minuto/SU | 12 pedidos/min |
| Estatísticas de serviço (GET /servicestats) | 4 pedidos/sec/SU | 4 pedidos/seg |
| Consultas de pesquisa (POST /indexes/{index}/docs/search) | Varia consoante a contagem de SU e a complexidade da consulta | 50 consultas por segundo (limite agregado de leituras por índice) |
| Documentos de índice (POST /indexes/{index}/docs/index) | Varia consoante a contagem de SU e a carga de trabalho de indexação | 5 pedidos/seg por índice |
| Sugerir (POST /indexes/{index}/docs/suggest) | Varia consoante o número de SUs | Não explicitamente definido |
| Preenchimento automático (POST /indexes/{index}/docs/autocomplete) | Varia consoante o número de SUs | Não explicitamente definido |
Limites de restrição semântica do algoritmo de classificação
O classificador semântico usa um sistema de enfileiramento para gerenciar solicitações simultâneas. Este sistema permite que os serviços de pesquisa obtenham o maior número possível de consultas por segundo. Quando o limite de pedidos concorrentes é atingido, o sistema coloca pedidos adicionais numa fila. Se a fila estiver cheia, o sistema rejeita mais pedidos e estes têm de ser novamente submetidos.
O número total de consultas do classificador semântico por segundo depende dos seguintes fatores:
- O nível do serviço de pesquisa. A capacidade da fila e os limites de solicitação simultânea variam de acordo com a camada.
- O número de unidades de pesquisa utilizadas no serviço de pesquisa. A maneira mais simples de aumentar o número máximo de consultas simultâneas de classificação semântica é adicionar mais unidades de pesquisa ao seu serviço de pesquisa.
- A capacidade total disponível do classificador semântico na região.
- A quantidade de tempo que leva para servir uma consulta usando o classificador semântico. Este período varia consoante a ocupação do serviço de pesquisa.
A tabela a seguir descreve os limites de restrição do ranker semântico por nível, conforme a capacidade disponível na região. Você pode entrar em contato com o suporte da Microsoft para solicitar um aumento de limite.
| Recurso | Básico | S1 | S2 | S3 | S3 HD | L1 | L2 | Desenvolvedor Serverless |
|---|---|---|---|---|---|---|---|---|
| Pedidos concorrentes máximos (por unidade de pesquisa) | 2 | 3 | 4 | 4 | 4 | 4 | 4 | 4 (por serviço) |
| Tamanho máximo da fila de pedidos (por unidade de pesquisa) | 4 | 6 | 8 | 8 | 8 | 8 | 8 | 8 (por serviço) |
Limites de solicitação de API
Existem limites para consultas porque consultas ilimitadas podem desestabilizar seu serviço de pesquisa. Normalmente, essas consultas são criadas programaticamente. Se a sua aplicação gerar consultas de pesquisa de forma programática, desenhe-a para não gerar consultas de tamanho ilimitado.
Existem limites de carga por motivos semelhantes, assegurando a estabilidade do seu serviço de pesquisa. O limite aplica-se a todo o pedido, incluindo todos os seus componentes. Por exemplo, se a solicitação agrupar vários documentos ou comandos, toda a solicitação deverá caber dentro do limite suportado.
Se tiver de ultrapassar um limite suportado, teste a sua carga de trabalho para saber o que esperar.
Exceto onde indicado, as seguintes solicitações de API se aplicam a todas as interfaces programáveis, incluindo os SDKs do Azure.
Geral:
- O limite máximo de carga útil suportado é de 16 MB para indexação e solicitação de consulta via API REST e SDKs.
- Comprimento máximo de URL de 8 KB (aplica-se apenas a APIs REST).
APIs de indexação:
- Suporta no máximo 1.000 documentos por lote de carregamentos, mesclagens ou exclusões de índice.
- Cada pedido suporta entre 1 e 32.000 ações de indexação.
APIs de consulta:
- Máximo de 10 campos em uma consulta vetorial
- No máximo 32 campos na cláusula $orderby.
- Máximo de 100.000 caracteres em uma cláusula de pesquisa.
- O número máximo de cláusulas na pesquisa é de 3.000.
- Limites máximos para consultas de caracteres especiais e expressões regulares, conforme imposto por Lucene. Ele limita o número de padrões, variações ou correspondências a 1.000 instâncias. Este limite está em vigor para evitar sobrecarga do motor.
Termos de pesquisa:
- O tamanho máximo do termo de pesquisa suportado é de 32.766 bytes (32 KB menos 2 bytes) de texto codificado em UTF-8. Aplica-se à pesquisa por palavra-chave e à propriedade "text" da pesquisa vetorial.
- O tamanho máximo de um termo de pesquisa suportado é de 1.000 caracteres para pesquisa de prefixo e regex.
Limites de resposta da API
- Cada página de resultados de pesquisa devolve até 1.000 documentos.
- Cada pedido da API Suggest devolve até 100 sugestões.
O mecanismo de pesquisa retorna 50 resultados por padrão, mas você pode substituir esse parâmetro até o limite máximo.
Limites de chave da API
Use chaves API para autenticação de serviços. Existem dois tipos de chaves API. As chaves de administrador, que especifica no cabeçalho do pedido, fornecem acesso completo de leitura e escrita ao serviço. As chaves de consulta, que especifica no URL, são apenas de leitura e normalmente distribuídas a aplicações cliente.
- Cada serviço suporta até duas chaves de administração.
- Cada serviço suporta até 50 chaves de consulta.