Resumen

Completados

La evaluación de aplicaciones de IA generativas requiere más de una sola puntuación. Necesita datos representativos, la combinación correcta del evaluador y una manera disciplinada de interpretar los resultados. Microsoft Foundry admite flujos de trabajo de evaluación basados en el portal y el SDK, mientras que el catálogo del evaluador integrado le ayuda a evaluar la calidad de escritura, la similitud con la verdad básica, el comportamiento de RAG, la seguridad y el comportamiento del agente.

La práctica de evaluación más eficaz combina ejecuciones automatizadas con revisión humana dirigida. Use datos reales siempre que sea posible, complételo con datos sintéticos cuando la cobertura sea limitada, use red teaming de IA u otras pruebas antagónicas cuando necesite sondear riesgos de seguridad y protección, y compare las ejecuciones con una línea base estable antes de decidir si un cambio ha mejorado el sistema.

Antes de poner en funcionamiento el flujo de trabajo, confirme las entradas necesarias de cada evaluador, el soporte técnico de destino, el estado de vista previa y la compatibilidad con regiones en las instrucciones actuales de Microsoft Learn. Esa comprobación es importante para la evaluación en la nube, la seguridad y los flujos de trabajo del equipo rojo, evaluadores personalizados, calificaciones y algunos evaluadores centrados en el agente.

Una vez que tenga resultados, tradítelos en acción. Mejore la recuperación cuando los fundamentos o la relevancia son débiles, refuerce las instrucciones de seguridad y el filtrado cuando los evaluadores identifiquen riesgos, y agregue evaluadores personalizados cuando los criterios empresariales van más allá del catálogo integrado.

Saber más