lunes, 3 de agosto de 2026

IA y modelos

Microsoft lanza ASSERT para probar el comportamiento de la IA

Microsoft ha lanzado ASSERT, un marco de trabajo de código abierto que, al parecer, ayuda a los desarrolladores a evaluar el comportamiento de los sistemas de IA para requisitos específicos de productos y servicios.

Microsoft launches ASSERT for AI behavior testing
Foto: Microsoft

El martes, Microsoft presentó ASSERT, un marco de trabajo de código abierto diseñado para evaluar el comportamiento de la IA específico para cada aplicación. La herramienta, cuyo nombre es un acrónimo de Adaptive Spec-driven Scoring for Evaluation and Regression Testing, tiene como objetivo simplificar el proceso de pruebas para los desarrolladores. Permite convertir descripciones de alto nivel en lenguaje natural sobre objetivos, políticas o comportamientos previstos en pruebas estructuradas y puntuadas. Este lanzamiento se produce en un momento en que las empresas y los desarrolladores se enfrentan a lo que parece ser una necesidad nueva y específica de garantizar que los sistemas de IA se comporten según lo previsto para sus productos o servicios específicos.

ASSERT funciona tomando descripciones en lenguaje sencillo sobre el comportamiento y las políticas esperadas de un modelo de IA, convirtiéndolas en un conjunto estructurado de comportamientos aceptables e inaceptables. Luego, el marco de trabajo genera escenarios de problemas y casos de prueba, los ejecuta contra el sistema objetivo y puntúa los resultados. Para ayudar a los desarrolladores a inspeccionar dónde ocurren los fallos, la herramienta puede registrar las rutas que toma el sistema de IA, incluyendo acciones intermedias y llamadas a herramientas. Los desarrolladores también pueden proporcionar contexto del sistema, herramientas y restricciones para personalizar aún más lo que cubren las evaluaciones. Por ejemplo, un desarrollador podría especificar que un agente de IA de investigación de documentos no debe enviar correos electrónicos a personas fuera de la empresa, y ASSERT utilizará esas reglas para generar casos de prueba que verifiquen el cumplimiento de forma continua.

Según Microsoft, el marco de trabajo llena un vacío que las evaluaciones más amplias y generales no pueden abordar cuando los modelos de IA deben comportarse de una manera moldeada por el contexto, las políticas y las herramientas específicas de una aplicación. Sarah Bird, directora de producto de IA Responsable en Microsoft, enfatizó la importancia de este enfoque personalizado. «Una de las cosas que hemos aprendido es que las evaluaciones son absolutamente críticas para tomar buenas decisiones», dijo Bird. Señaló que, sin entender el comportamiento de un sistema de IA, a las organizaciones les cuesta saber si cumple con sus estándares, y añadió que construir un sistema confiable requiere evaluar muchas más dimensiones que son específicas de la aplicación. Bird afirmó que ASSERT puede utilizarse para evaluar sistemas durante el desarrollo, después de la implementación y para el monitoreo continuo.

El lanzamiento de ASSERT se alinea con un cambio gradual y más amplio en la industria de la inteligencia artificial hacia pruebas repetibles y verificaciones de regresión a medida que los modelos se vuelven más capaces. El marco de trabajo de Microsoft se une a un ecosistema creciente de herramientas de evaluación y benchmarks. Estos incluyen el benchmark HELM (Holistic Evaluation of Language Models) de la Universidad de Stanford, AILuminate (un benchmark de evaluación de IA) de MLCommons y METR (un grupo de evaluación de IA), que han estado lanzando benchmarks para medir cómo se comportan los modelos bajo diferentes condiciones.

Por qué importa

El marco de trabajo aborda una brecha crítica en el desarrollo de IA: aunque existen benchmarks generales, a menudo no tienen en cuenta el contexto, las políticas y las herramientas específicas que definen cómo debe comportarse una aplicación de IA en producción.