Planejar e gerenciar custos de um serviço de Pesquisa de IA do Azure

Note

O Pesquisa de IA do Azure está disponível através do portal Azure, APIs REST e SDKs do Azure. Também sustenta o Foundry IQ, a camada de conhecimento gerida que transforma conteúdos empresariais em bases de conhecimento reutilizáveis e conscientes de permissões para agentes no portal Microsoft Foundry.

O Pesquisa de IA do Azure está disponível em dois modelos de preços:

  • Dedicado: Capacidade provisionada com preço fixo. Seleciona um nível de serviço e ser-lhe-á cobrado um valor por hora com base em Unidades de Busca (SUs). Ideal para cargas de trabalho estáveis, previsíveis e de alta utilização.

  • Serverless (Pré-visualização): Preços com base no consumo, medidos em Unidades de Computação por hora (CU/hr) e por GB/mês para o armazenamento indexado. É ideal para cargas de trabalho pouco frequentes, com picos ou muito variáveis.

Este artigo explica como funciona a faturação em cada modelo e fornece orientações para estimativa, minimização e monitorização de custos.

Compreenda o modelo de preços

O Pesquisa de IA do Azure tem dois modelos principais de preços: Dedicado e Serverless. Ambos os modelos implicam custos cobrados em separado para funcionalidades premium, como classificador semântico, recuperação agêntica e enriquecimento com IA.

As taxas do Pesquisa de IA do Azure são um componente da sua fatura total do Azure. É cobrado por todos os serviços e recursos do Azure usados na sua subscrição, incluindo serviços fora do Pesquisa de IA do Azure.

Para serviços dedicados, utilize a calculadora de preços Azure para estimar os custos com base no seu planeamento capacidade e funcionalidades. Uma folha de cálculo de planeamento de capacidade pode ajudá-lo a modelar o tamanho esperado do índice, a taxa de indexação e os custos de indexação.

À medida que a sua carga de trabalho de pesquisa evolui, siga estas dicas para minimizar custos tanto durante a implementação como durante a operação. Você também pode usar métricas internas para monitorar solicitações de consulta e o Gerenciamento de custos para criar orçamentos, alertas e exportações de dados.

Modelo dedicado de preços

Quando cria ou utiliza um serviço de pesquisa dedicado, paga pela combinação mínima necessária de réplica e partição (R × P) à taxa horária proporcional do nível de serviço que selecionar. Cada réplica e combinação de partição representa uma unidade de capacidade dedicada.

Para mais detalhes sobre os níveis de serviço disponíveis, consulte Escolher um modelo de preços e um escalão de serviço.

À medida que aumentas ou diminuis o número de réplicas ou partições, o total de unidades de pesquisa muda e os custos escalam em conformidade. Para mais informações e exemplos, consulte Taxas de faturação.

Modelo de preços sem servidor (Pré-visualização)

Importante

O nível Serverless Developer está atualmente em pré-visualização. Esta pré-visualização é fornecida sem um acordo de nível de serviço e não é recomendada para cargas de trabalho em produção. Certas funcionalidades podem não ser suportadas ou podem ter capacidades limitadas. Para mais informações, consulte Termos Suplementares de Utilização para Microsoft Azure Previews.

A faturação para o escalão Serverless Developer tem início em 13 de setembro de 2026. As taxas de utilização a partir dessa data aparecem na sua fatura Azure. Não é cobrado pelo uso antes de 13 de setembro de 2026. O Serverless Developer é um nível pago assim que a faturação começa. A camada Serverless Developer não suporta migração para ou de outras categorias de preços e algumas funcionalidades disponíveis noutros níveis não são suportadas durante a Pré-visualização Pública. Os limites de serviço, funcionalidades suportadas e detalhes de preços podem mudar antes da disponibilidade geral.

Durante a pré-visualização, o modelo de preços Serverless é suportado apenas em regiões específicas.

O modelo de preços Serverless cobra com base na utilização, sem capacidade pré-provisionada ou inativa. Paga apenas pelos recursos de computação consumidos pelas operações e pelo armazenamento usado pelos seus índices.

Ao contrário do modelo dedicado, não se configuram réplicas ou partições. O serviço gere automaticamente a capacidade com base na procura de carga de trabalho e nos limites de serviço.

A faturação do modelo serverless tem duas dimensões independentes:

  • Computação (Unidades de Computação, CU):
    A utilização de cálculo é medida em Unidades de Cálculo por hora (CUs/hr). O custo de cálculo é determinado por fatores como complexidade de consulta, tamanho do índice, volume de dados e tipo de operação (consulta, indexação ou enriquecimento).

  • Armazenamento indexado:
    O armazenamento é cobrado por GB/mês com base no tamanho em disco dos seus índices. Este tamanho inclui conteúdo indexado e estruturas de dados de suporte utilizadas para a recuperação.

Como és cobrado pelas funcionalidades premium

As funcionalidades premium acarretam custos além dos custos de computação e armazenamento pelo seu serviço de pesquisa, independentemente de utilizar o modelo de preços Dedicado ou Serverless.

A tabela a seguir lista os recursos premium e suas unidades de faturamento. Todas estas funcionalidades são opcionais, por isso, se não as utilizar, não incorre em quaisquer encargos.

Feature Unidade de faturação
Extração de imagens (enriquecimento IA) 1 Por 1.000 imagens. Veja a página de preços.
Habilidade de pesquisa de entidade personalizada (enriquecimento de IA) Por 1.000 registros de texto. Consulte a página de preços
Competências incorporadas ou personalizadas (enriquecimento de IA) 2 Número de transações. Faturado à taxa do fornecedor de modelos: modelos ou recursos alojados no Microsoft Foundry ou Azure.
Vectorizers2 Número de operações de vetorização. Faturado à taxa do fornecedor de modelos: Azure Vision em Foundry Tools, Azure OpenAI ou Foundry.
Classificador semântico Número de consultas de queryType=semantic. Faturado com uma taxa progressiva. Veja a página de preços.
Recuperação agêntica Número de tokens de raciocínio agente, mais número de tokens usados no planeamento de consultas e formulação de respostas. Veja a página de preços.
Link privado compartilhado Cobrado pela largura de banda enquanto a ligação privada compartilhada existir e for usada.

1 Refere-se a imagens extraídas de um arquivo dentro do pipeline do indexador. A extração de texto é gratuita. A extração de imagem é cobrada quando você habilita o indexAction parâmetro ou quando chama a habilidade Extração de Documentos.

2 Cobranças para modelos Azure OpenAI e modelos Foundry aparecem na sua fatura por esses serviços.

Como você é cobrado de outras maneiras

Dependendo da sua configuração e utilização, poderão aplicar-se os seguintes encargos:

1 As sessões de depuração estão disponíveis apenas nos serviços dedicados do modelo de preços.

Note

Nos serviços dedicados, não lhe é cobrado por consulta. No entanto, os limites de serviço aplicam-se a cada nível de preço. No modo Serverless, as consultas consomem CU/h com base na complexidade e no tamanho do índice.

Estimar e planear custos para o modelo de preços dedicado

Para estimar custos para o modelo de preços dedicado, use o calculador de preços Azure para estimar os seus custos base para Pesquisa de IA do Azure. Você também pode encontrar custos estimados e comparações de camadas na página Selecionar nível de preço durante a criação do serviço.

Para testes iniciais do modelo de preços dedicados, crie uma folha de planeamento de capacidade. A folha de cálculo ajuda a compreender a relação índice-fonte e o impacto das funcionalidades de enriquecimento ou de vetores na capacidade e no custo.

Para criar uma planilha de planejamento de capacidade:

  1. Indexe uma pequena amostra (1–5%) dos seus dados. Inclua qualquer OCR, enriquecimento ou habilidades de incorporação que você planeja usar.

  2. Meça o tamanho do índice, a taxa de indexação e os custos de indexação.

  3. Extrapole os resultados para estimar os requisitos de escala completa para seus dados.

Estimar e planear custos para o modelo de preços Serverless

Para estimar e gerir custos em Serverless, monitorizar tanto o consumo de cálculo como o tamanho do índice, e otimizar consultas e design de esquemas para reduzir o uso de recursos.

Primeiro indexe uma amostra representativa, depois execute consultas típicas e meça o consumo de CU via x-ms-request-charge. Quando tiveres uma média de consumo, extrapola os custos com base nessa média. Para orientações sobre como monitorizar o uso de computação, consulte Otimizar custos com o modelo de preços Serverless.

Minimizar custos para o modelo de preços dedicados

Para minimizar custos no modelo de preços dedicados, utilize as seguintes estratégias:

Implementação e configuração

  • Crie um serviço de pesquisa em uma região com mais armazenamento por partição.

  • Crie todos os recursos relacionados do Azure na mesma região (ou no menor número possível de regiões) para minimizar ou eliminar os encargos de largura de banda.

  • Escolha o nível de serviço mais leve que satisfaça as suas necessidades. Basic e S1 oferecem acesso total à API moderna com a menor taxa horária por SU. * Para cargas de trabalho com tráfego variável ou em rajadas, o modelo de preços Serverless pode ser mais económico do que um serviço Basic ou S1 provisionado continuamente.

  • Use os Aplicativos Web do Azure para seu aplicativo front-end para manter as solicitações e respostas dentro do limite do data center.

Scaling

  • Adicione partições somente quando o tamanho do índice ou a taxa de transferência de ingestão exigirem.

  • Adicione réplicas somente quando suas consultas por segundo aumentarem, quando consultas complexas estiverem limitando seu serviço ou quando for necessária alta disponibilidade.

  • Aumente a escala para operações que consomem muitos recursos, como indexação, e reajuste para baixo para cargas de trabalho de consulta regulares.

  • Escreva código para automatizar o dimensionamento para padrões de carga de trabalho previsíveis.

  • Lembre-se de que a capacidade e os preços não são lineares. A duplicação da capacidade mais do que duplica os custos no mesmo nível. Para um melhor desempenho a um preço semelhante, considere mudar para um nível mais alto.

Indexação e enriquecimento

Minimizar custos para o modelo de preços Serverless

Para minimizar custos no modelo de preços dedicados, utilize as seguintes estratégias:

  • Monitorize a telemetria em CU/h para identificar consultas dispendiosas.
  • Use o tipo de consulta mais simples que satisfaça as necessidades de relevância.
  • Remover índices não utilizados para reduzir os custos de armazenamento.

Saiba mais: Otimize custos com o modelo de preços Serverless.

Monitorizar os custos

Ao nível do serviço, pode monitorizar métricas incorporadas para consultas por segundo (QPS), latência de pesquisa, consultas limitadas e tamanho do índice.

A forma como utiliza estas métricas depende do seu modelo de preços:

  • Modelo dedicado de preços:
    Utilize as métricas de QPS, latência e estrangulamento para determinar quando adicionar ou remover réplicas ou partições. A capacidade de escalabilidade afeta diretamente tanto o desempenho como o custo, por isso monitorizar estes sinais ajuda a otimizar as suas unidades de pesquisa.

  • Modelo de preços sem servidor:
    Use estas métricas para compreender os padrões de carga de trabalho e identificar fatores de custo. Como a capacidade serverless é gerida automaticamente, não escalas adicionando réplicas ou partições. Em vez disso, concentre-se em monitorizar o consumo de computação e otimizar a utilização.

Para Serverless, pode monitorizar o uso computacional por pedido usando o cabeçalho de resposta x-ms-request-charge e analisar padrões de consulta usando Azure Monitor logs. A monitorização do consumo de CU por tipo de consulta ou carga de trabalho ajuda a identificar oportunidades para reduzir custos através da otimização de consultas, da conceção do esquema ou da distribuição da carga de trabalho.

No nível de assinatura ou grupo de recursos, o Gerenciamento de Custos fornece ferramentas para rastrear, analisar e controlar custos. Use a Gestão de Custos para:

  • Crie orçamentos que definam e acompanhem o progresso em relação aos limites de gastos. Para um acompanhamento mais detalhado, personalize os seus orçamentos usando c0 para recursos ou serviços Azure específicos. Os filtros ajudam a garantir que o acompanhamento de custos está alinhado com cargas de trabalho ou implementações específicas.

  • Crie alertas que notifiquem automaticamente as partes interessadas sobre anomalias de gastos ou riscos de gastos excessivos. Os alertas baseiam-se na despesa em comparação com os limiares orçamentais e de custos, e aplicam-se ao nível da subscrição ou do grupo de recursos.

  • Exporte dados de custos para uma conta de armazenamento para uma análise mais aprofundada. Por exemplo, as equipas financeiras podem analisar dados exportados usando Excel ou Power BI. Exportar dados de custos num calendário é o método recomendado para recuperar conjuntos de dados de custos.

FAQ

Posso encerrar temporariamente um serviço de pesquisa para poupar custos?

A pesquisa é executada como um serviço contínuo. Recursos dedicados estão sempre operacionais e alocados para seu uso exclusivo durante a vida útil do seu serviço.

No modelo de preços dedicados, para parar completamente a faturação, tem de eliminar o serviço. A exclusão de um serviço é permanente e também exclui seus dados associados.

No modelo de preços Serverless, não há custos de computação quando está inativo. Só pagas pelo armazenamento indexado enquanto o serviço não está a processar pedidos.

Posso alterar o modelo de preços ou a taxa de faturação (nível) de um serviço de pesquisa existente?

Depois de escolher o modelo de preços Dedicado ou Serverless, não pode alternar os seus serviços de Pesquisa de IA entre um e outro.

Se optar pelo modelo de preços dedicados, os seus serviços existentes podem alternar entre os níveis Básico e Standard (S1, S2 e S3). Sua configuração de serviço atual não pode exceder os limites da camada de destino e sua região não pode ter restrições de capacidade na camada de destino. Para obter mais informações, consulte Alterar o nível de preços.