Introducción

Completados

El ciclo de vida de desarrollo de IA generativa es iterativo y la evaluación es un mecanismo de retroalimentación que indica si un cambio ha mejorado realmente el sistema. Los procedimientos de evaluación seguros le ayudan a medir la calidad de respuesta, la calidad de recuperación, la seguridad y la confiabilidad antes de enviar una característica y después de cambiar los mensajes, los datos o los modelos.

Captura de pantalla del flujo del ciclo de vida de desarrollo de IA generativa. Los pasos incluyen definir tu caso de uso, mapear, medir, mitigar y operar. La gobernanza es un concepto presente durante todas las fases del ciclo de vida. Hay flechas alrededor del ciclo de vida, ya que el proceso es iterativo.

La imagen muestra el "Ciclo de vida de desarrollo de IA generativa" con un diagrama de flujo. El diagrama se establece en un fondo claro y usa una combinación de colores azul y blanco con colores de énfasis para los iconos. El ciclo de vida comienza con "Definir el caso de uso" a la izquierda, lo que conduce a un rectángulo redondeado grande que contiene las fases principales del proceso. Dentro de esta área principal, hay cinco componentes clave organizados horizontalmente: mapa, medida, mitigación, funcionamiento, gobernanza. El diseño implica un flujo secuencial desde el Map hasta Operar, con el Gobierno dominando todas las etapas. Una flecha grande forma un bucle alrededor de todo el proceso, empezando por "Definir el caso de uso", moviendo el sentido de las agujas del reloj a través de todas las fases y, a continuación, volviendo al principio. Esto sugiere un ciclo de vida iterativo continuo para el desarrollo de inteligencia artificial.

Aunque cada paso del proceso es esencial para crear soluciones de inteligencia artificial generativas de confianza, la fase de medición es donde los equipos comprueban que una aplicación se comporta según lo previsto. Microsoft Foundry proporciona funcionalidades de evaluación, análisis de resultados y observabilidad que le ayudan a evaluar modelos, sistemas de generación aumentada por recuperación (RAG) y agentes de forma repetible. En este módulo se presentan los conceptos clave para elegir datos de evaluación, seleccionar evaluadores e interpretar los resultados.

Objetivos de aprendizaje

Al completar este módulo, podrá hacer lo siguiente:

  • Aplicación de procedimientos recomendados para elegir datos de evaluación
  • Explicar cuándo usar datos reales, sintéticos y de adversarios
  • Describir el ámbito de los evaluadores integrados
  • Elegir evaluadores que se ajusten a su caso de uso
  • Interpretar los resultados de la evaluación y usarlos para guiar las mitigaciones

Prerrequisitos