Introducción

Completado

Las aplicaciones de inteligencia artificial exigen una recuperación de datos rápida y rentable que se escala con conjuntos de datos crecientes y aumenta la complejidad de las consultas. Este módulo le guía a través de la optimización del rendimiento de las consultas para Azure Cosmos DB para NoSQL, lo que le ayuda a reducir la latencia, reducir los costos y controlar las cargas de trabajo de producción de forma eficaz.

Imagine que es un desarrollador que ha creado una plataforma de búsqueda semántica que ayuda a los usuarios empresariales a encontrar documentos relevantes en millones de archivos almacenados. La aplicación almacena metadatos de documentos, texto extraído e incrustaciones vectoriales generadas por Azure OpenAI. Los usuarios buscan por palabras clave, filtran por intervalos de fechas y tipos de documento y esperan resultados semánticamente similares clasificados por relevancia. Los usuarios esperan tiempos de respuesta inferiores a 100 milisegundos.

La aplicación funciona bien en el desarrollo, pero las pruebas de producción revelan problemas graves de rendimiento. Las consultas consumen muchas más unidades de solicitud de las presupuestadas y generan picos de latencia durante los picos de uso. La investigación muestra que la política de indexación predeterminada indexa cada propiedad, incluidas matrices de representación grandes que inflan los costos de almacenamiento. Algunas consultas realizan exploraciones completas del contenedor porque los índices compuestos necesarios no existen. Los usuarios se quejan de que los documentos cargados recientemente no aparecen inmediatamente en los resultados de búsqueda. El equipo debe optimizar la configuración de la base de datos para admitir los diversos patrones de consulta de la aplicación mientras permanece dentro de los objetivos de costo. Debe analizar qué consultas funcionan mal, comprender qué tipos de índice admiten los patrones de consulta, configurar los índices adecuados para los patrones de acceso y seleccionar niveles de coherencia que garantizan que los usuarios vean su contenido cargado. En este módulo se proporcionan las técnicas para transformar las consultas lentas y costosas en operaciones eficaces.

Después de completar este módulo, podrá:

  • Análisis de patrones de consulta y uso de métricas para identificar cuellos de botella de rendimiento y índices que faltan
  • Configurar índices de intervalo y compuestos para optimizar las operaciones de filtrado y ordenación para los patrones de recuperación de inteligencia artificial.
  • Seleccione el tipo de índice vectorial adecuado en función del tamaño del conjunto de datos, los requisitos de precisión y los objetivos de rendimiento.
  • Diseñar directivas de indexación que equilibren el rendimiento de lectura con los costos de escritura del perfil de carga de trabajo
  • Elegir niveles de coherencia que cumplan los requisitos de la aplicación al minimizar el consumo de RU