GUÍAS

Cómo medir la inteligencia de una IA: pruebas, límites y falsas certezas

Qué miden los benchmarks de inteligencia artificial, por qué pueden fallar y qué evidencia necesitamos antes de hablar de AGI.

XFacebookWhatsAppTelegram

Cada semana aparecen titulares que aseguran que una inteligencia artificial ha superado a personas expertas en un examen, un concurso o una prueba de razonamiento. Son resultados que pueden importar mucho. Pero una puntuación elevada no responde por sí sola a la pregunta más ambiciosa: ¿cuán general, fiable y adaptable es realmente el sistema?

Para interpretar estos anuncios necesitamos entender qué miden las evaluaciones, qué dejan fuera y cómo distinguir una mejora reproducible de un resultado llamativo.

1. Qué es un benchmark

Un benchmark es un conjunto de tareas y reglas de evaluación que permite comparar sistemas bajo ciertas condiciones. Puede incluir preguntas de conocimiento, problemas matemáticos, programación, imágenes, razonamiento o tareas interactivas.

Su principal virtud es la comparabilidad. Si las condiciones están bien definidas, podemos observar cambios de rendimiento entre versiones y detectar fortalezas o debilidades.

Su principal límite es igual de importante: una prueba representa solo una parte del mundo. Un modelo puede destacar en preguntas cerradas y equivocarse cuando debe interpretar instrucciones ambiguas, pedir aclaraciones o reconocer información insuficiente.

2. Cinco cosas que una puntuación no siempre revela

  • Contaminación de datos: algunas preguntas pueden parecerse demasiado a materiales vistos durante el entrenamiento.
  • Variación de instrucciones: pequeños cambios en la formulación pueden alterar el resultado.
  • Herramientas disponibles: utilizar búsqueda, ejecución de código o múltiples intentos cambia lo que se está midiendo.
  • Fiabilidad: acertar una vez no equivale a resolver el mismo tipo de tarea de manera consistente.
  • Transferencia: rendir bien en problemas conocidos no garantiza adaptación a situaciones nuevas.

Por eso conviene leer la metodología antes de comparar porcentajes entre sistemas.

3. ¿Qué pruebas se utilizan?

EvaluaciónQué intenta observarPrecaución al interpretarla
MMLUConocimientos y resolución de preguntas en múltiples disciplinasNo equivale a desempeño general en el mundo real
GPQAPreguntas científicas complejas diseñadas para exigir conocimiento especializadoSigue siendo una evaluación delimitada
SWE-benchResolución de incidencias reales de software en repositoriosLos resultados dependen del entorno, herramientas y protocolo
ARC-AGIResolución de tareas visuales de abstracción y generalizaciónUna puntuación no establece por sí sola AGI

Estas pruebas no son intercambiables. Cada una observa capacidades diferentes y tiene condiciones propias. Tampoco existe un umbral universal que convierta una puntuación en una declaración aceptada de inteligencia artificial general.

4. El problema de optimizar para el examen

Cuando una prueba se vuelve popular, investigadores y empresas tienen incentivos para mejorar específicamente en ella. Eso puede acelerar el progreso, pero también reducir la capacidad del examen para distinguir avances amplios de optimizaciones locales.

En investigación se habla de Goodhart's law para describir, de manera aproximada, cómo un indicador puede perder valor cuando se convierte en objetivo. No significa que todas las evaluaciones sean inútiles; significa que debemos renovarlas, combinarlas y contrastarlas con tareas independientes.

Una evaluación rigurosa debería informar no solo la puntuación máxima, sino también el procedimiento, la incertidumbre y los casos de fallo.

5. ¿Cómo sería una evaluación más convincente de inteligencia general?

Una evaluación de capacidades generales tendría que abarcar más que respuestas correctas en un conjunto estático. Entre otros aspectos, sería útil medir:

  • Adaptación a tareas verdaderamente nuevas.
  • Transferencia de conocimientos entre dominios.
  • Robustez ante información incompleta o cambios de contexto.
  • Capacidad de reconocer errores y solicitar ayuda.
  • Rendimiento sostenido con límites claros de tiempo, coste y recursos.
  • Seguridad y control cuando se permite actuar con herramientas.

Incluso una batería amplia no resolvería automáticamente los desacuerdos sobre la definición de AGI. Pero proporcionaría evidencia más sólida que un solo marcador.

6. Una guía rápida para leer el próximo récord

Cuando veas que un sistema «superó a los humanos», comprueba:

1. A quiénes se comparó: especialistas, público general o una referencia estadística. 2. En qué tareas: preguntas de examen, problemas abiertos o trabajo real. 3. Con qué recursos: tiempo, herramientas, intentos y supervisión. 4. Con qué independencia: quién diseñó y ejecutó la evaluación. 5. Con qué límites: qué errores se observaron y qué escenarios quedaron fuera.

El resultado puede seguir siendo extraordinario después de responder esas preguntas. De hecho, cuanto más transparente sea la evaluación, más útil será para comprender el avance.

Conclusión

Medir la inteligencia artificial no consiste en encontrar un número mágico. Consiste en reunir evidencia sobre capacidades, generalización, fiabilidad y límites.

Para el debate sobre superinteligencia, esta distinción es decisiva: no podemos inferir una inteligencia superior en todos los ámbitos a partir de un récord en una prueba concreta.

7. Ejemplo práctico: dos modelos con el mismo porcentaje

Imagina dos sistemas hipotéticos que obtienen un 85 % de aciertos en una evaluación. El titular podría presentarlos como equivalentes, pero ese dato no basta para compararlos.

CondiciónSistema ASistema B
Intentos por preguntaUnoVarios, seleccionando la mejor respuesta
HerramientasNingunaBúsqueda y ejecución de código
Tiempo y costeLimitadosSin límite comparable
Casos de falloPublicadosNo detallados

El 85 % es un ejemplo inventado para explicar el método, no una puntuación atribuida a modelos reales. Ambos resultados podrían ser valiosos, pero responden a protocolos diferentes. Compararlos sin explicar esas condiciones sería engañoso.

Una ficha mínima de evaluación reproducible

Antes de interpretar un resultado, busca o solicita estos datos:

  • Conjunto de tareas y versión: qué problemas se utilizaron y cuándo se definieron.
  • Protocolo: número de intentos, instrucciones, herramientas y criterios de puntuación.
  • Presupuesto: tiempo de ejecución, cómputo o coste por tarea, cuando corresponda.
  • Independencia: quién realizó la prueba y si se conocen posibles conflictos de interés.
  • Incertidumbre y fallos: dispersión entre ejecuciones, errores típicos y límites reconocidos.
  • Disponibilidad: si otras personas pueden repetir la evaluación o revisar su metodología.

Una comparación rigurosa debería utilizar el mismo protocolo o explicar claramente las diferencias. La reproducibilidad no siempre es completa, especialmente con sistemas propietarios, pero esa limitación también debe declararse.

Capacidad no es permiso para actuar

Una prueba de razonamiento no mide automáticamente la seguridad de un agente conectado a cuentas, herramientas o servicios. Para evaluar sistemas que ejecutan acciones, conviene complementar los benchmarks con pruebas de permisos, supervisión y recuperación ante errores.

Por eso este tema conecta con los riesgos actuales y existenciales de la IA y la alineación de objetivos y controles.

Fuentes y lecturas

Puedes continuar con AGI, superinteligencia y singularidad, inteligencia, autonomía y conciencia y el problema de alineación.

LA CONVERSACIÓN CONTINÚA

¿Qué pregunta te gustaría entender mejor?

Escríbenos ↗