Cada semana aparecen titulares que aseguran que una inteligencia artificial ha superado a personas expertas en un examen, un concurso o una prueba de razonamiento. Son resultados que pueden importar mucho. Pero una puntuación elevada no responde por sí sola a la pregunta más ambiciosa: ¿cuán general, fiable y adaptable es realmente el sistema?
Para interpretar estos anuncios necesitamos entender qué miden las evaluaciones, qué dejan fuera y cómo distinguir una mejora reproducible de un resultado llamativo.
1. Qué es un benchmark
Un benchmark es un conjunto de tareas y reglas de evaluación que permite comparar sistemas bajo ciertas condiciones. Puede incluir preguntas de conocimiento, problemas matemáticos, programación, imágenes, razonamiento o tareas interactivas.
Su principal virtud es la comparabilidad. Si las condiciones están bien definidas, podemos observar cambios de rendimiento entre versiones y detectar fortalezas o debilidades.
Su principal límite es igual de importante: una prueba representa solo una parte del mundo. Un modelo puede destacar en preguntas cerradas y equivocarse cuando debe interpretar instrucciones ambiguas, pedir aclaraciones o reconocer información insuficiente.
2. Cinco cosas que una puntuación no siempre revela
- Contaminación de datos: algunas preguntas pueden parecerse demasiado a materiales vistos durante el entrenamiento.
- Variación de instrucciones: pequeños cambios en la formulación pueden alterar el resultado.
- Herramientas disponibles: utilizar búsqueda, ejecución de código o múltiples intentos cambia lo que se está midiendo.
- Fiabilidad: acertar una vez no equivale a resolver el mismo tipo de tarea de manera consistente.
- Transferencia: rendir bien en problemas conocidos no garantiza adaptación a situaciones nuevas.
Por eso conviene leer la metodología antes de comparar porcentajes entre sistemas.
3. ¿Qué pruebas se utilizan?
| Evaluación | Qué intenta observar | Precaución al interpretarla |
|---|---|---|
| MMLU | Conocimientos y resolución de preguntas en múltiples disciplinas | No equivale a desempeño general en el mundo real |
| GPQA | Preguntas científicas complejas diseñadas para exigir conocimiento especializado | Sigue siendo una evaluación delimitada |
| SWE-bench | Resolución de incidencias reales de software en repositorios | Los resultados dependen del entorno, herramientas y protocolo |
| ARC-AGI | Resolución de tareas visuales de abstracción y generalización | Una puntuación no establece por sí sola AGI |
Estas pruebas no son intercambiables. Cada una observa capacidades diferentes y tiene condiciones propias. Tampoco existe un umbral universal que convierta una puntuación en una declaración aceptada de inteligencia artificial general.
4. El problema de optimizar para el examen
Cuando una prueba se vuelve popular, investigadores y empresas tienen incentivos para mejorar específicamente en ella. Eso puede acelerar el progreso, pero también reducir la capacidad del examen para distinguir avances amplios de optimizaciones locales.
En investigación se habla de Goodhart's law para describir, de manera aproximada, cómo un indicador puede perder valor cuando se convierte en objetivo. No significa que todas las evaluaciones sean inútiles; significa que debemos renovarlas, combinarlas y contrastarlas con tareas independientes.
Una evaluación rigurosa debería informar no solo la puntuación máxima, sino también el procedimiento, la incertidumbre y los casos de fallo.
5. ¿Cómo sería una evaluación más convincente de inteligencia general?
Una evaluación de capacidades generales tendría que abarcar más que respuestas correctas en un conjunto estático. Entre otros aspectos, sería útil medir:
- Adaptación a tareas verdaderamente nuevas.
- Transferencia de conocimientos entre dominios.
- Robustez ante información incompleta o cambios de contexto.
- Capacidad de reconocer errores y solicitar ayuda.
- Rendimiento sostenido con límites claros de tiempo, coste y recursos.
- Seguridad y control cuando se permite actuar con herramientas.
Incluso una batería amplia no resolvería automáticamente los desacuerdos sobre la definición de AGI. Pero proporcionaría evidencia más sólida que un solo marcador.
6. Una guía rápida para leer el próximo récord
Cuando veas que un sistema «superó a los humanos», comprueba:
1. A quiénes se comparó: especialistas, público general o una referencia estadística. 2. En qué tareas: preguntas de examen, problemas abiertos o trabajo real. 3. Con qué recursos: tiempo, herramientas, intentos y supervisión. 4. Con qué independencia: quién diseñó y ejecutó la evaluación. 5. Con qué límites: qué errores se observaron y qué escenarios quedaron fuera.
El resultado puede seguir siendo extraordinario después de responder esas preguntas. De hecho, cuanto más transparente sea la evaluación, más útil será para comprender el avance.
Conclusión
Medir la inteligencia artificial no consiste en encontrar un número mágico. Consiste en reunir evidencia sobre capacidades, generalización, fiabilidad y límites.
Para el debate sobre superinteligencia, esta distinción es decisiva: no podemos inferir una inteligencia superior en todos los ámbitos a partir de un récord en una prueba concreta.
7. Ejemplo práctico: dos modelos con el mismo porcentaje
Imagina dos sistemas hipotéticos que obtienen un 85 % de aciertos en una evaluación. El titular podría presentarlos como equivalentes, pero ese dato no basta para compararlos.
| Condición | Sistema A | Sistema B |
|---|---|---|
| Intentos por pregunta | Uno | Varios, seleccionando la mejor respuesta |
| Herramientas | Ninguna | Búsqueda y ejecución de código |
| Tiempo y coste | Limitados | Sin límite comparable |
| Casos de fallo | Publicados | No detallados |
El 85 % es un ejemplo inventado para explicar el método, no una puntuación atribuida a modelos reales. Ambos resultados podrían ser valiosos, pero responden a protocolos diferentes. Compararlos sin explicar esas condiciones sería engañoso.
Una ficha mínima de evaluación reproducible
Antes de interpretar un resultado, busca o solicita estos datos:
- Conjunto de tareas y versión: qué problemas se utilizaron y cuándo se definieron.
- Protocolo: número de intentos, instrucciones, herramientas y criterios de puntuación.
- Presupuesto: tiempo de ejecución, cómputo o coste por tarea, cuando corresponda.
- Independencia: quién realizó la prueba y si se conocen posibles conflictos de interés.
- Incertidumbre y fallos: dispersión entre ejecuciones, errores típicos y límites reconocidos.
- Disponibilidad: si otras personas pueden repetir la evaluación o revisar su metodología.
Una comparación rigurosa debería utilizar el mismo protocolo o explicar claramente las diferencias. La reproducibilidad no siempre es completa, especialmente con sistemas propietarios, pero esa limitación también debe declararse.
Capacidad no es permiso para actuar
Una prueba de razonamiento no mide automáticamente la seguridad de un agente conectado a cuentas, herramientas o servicios. Para evaluar sistemas que ejecutan acciones, conviene complementar los benchmarks con pruebas de permisos, supervisión y recuperación ante errores.
Por eso este tema conecta con los riesgos actuales y existenciales de la IA y la alineación de objetivos y controles.
Fuentes y lecturas
- Hendrycks y colaboradores, *Measuring Massive Multitask Language Understanding* (MMLU).
- Rein y colaboradores, *GPQA: A Graduate-Level Google-Proof Q&A Benchmark*.
- Jimenez y colaboradores, *SWE-bench: Can Language Models Resolve Real-World GitHub Issues?*.
- Chollet, *On the Measure of Intelligence*.
- Google DeepMind, *Levels of AGI*.
Puedes continuar con AGI, superinteligencia y singularidad, inteligencia, autonomía y conciencia y el problema de alineación.