← Volver
infobae.com · hace 16 horas · Sergio Richter

¿La IA ya es de nivel humano? Depende de qué se entienda por eso

Infobae

El lunes 28 de septiembre, OpenAI frenó el lanzamiento de GPT-6.1 Astra, uno de sus próximos modelos. Según Saachi Jain, responsable de Sistemas de Seguridad de la empresa, en las pruebas el modelo a veces avanzaba con tareas sin pedir permiso al usuario y no siempre le informaba bien lo que había hecho. El martes 29, Donald Trump firmó la orden ejecutiva “Inaugurando la era de la superinteligencia”. ¿Cómo puede llamarse superinteligencia una tecnología que uno de sus principales fabricantes todavía no se anima a dejar sola del todo?

Vamos unas semanas atrás. El jueves 3 de septiembre, al presentar GPT-6 Astra, la versión ya disponible, Greg Brockman, presidente de OpenAI, cerró la rueda de prensa con una frase sobre la inteligencia artificial general (AGI, por sus siglas en inglés): “Bienvenidos a la era de la AGI”.

Ese mismo día, ARC Prize, la fundación que administra ARC-AGI-3, una prueba de inteligencia en la que el modelo acababa de batir el récord, escribió que Astra representa “un progreso significativo hacia la generalización”, aunque aclaró: “No estamos afirmando que sea AGI”. Dos eras en 26 días, pero… recordá esto: ninguna etiqueta es una medición.

La orden de Trump manda a las agencias federales decir “superinteligencia” donde decían “inteligencia artificial”, porque, sostiene, las capacidades de los sistemas actuales “hacen mucho más que imitar o automatizar aspectos discretos de la inteligencia humana”. Da 60 días, hasta el 28 de noviembre, para proponer un texto de ley con una definición federal.

Mientras tanto, para aplicar la orden, “superinteligencia” abarca lo mismo que “inteligencia artificial” en la definición de la ley federal vigente: un sistema basado en máquinas que, para objetivos definidos por personas, puede hacer predicciones, recomendaciones o decisiones que influyen en entornos reales o virtuales. Un día después, el gobernador de California, Gavin Newsom, firmó una orden para que las agencias de su estado sigan diciendo “inteligencia artificial”. Por ahora, cambió la palabra, no la definición.

Con “AGI”, que sería el equivalente a una inteligencia general “de tipo humano”, pasa lo inverso, y no porque alguien mienta. Es algo más incómodo, pero mucho más útil entenderlo: la misma palabra nombra cosas distintas.

Figuras encapuchadas cortan cables de luz azul frente a servidores que muestran los logotipos de OpenAI, Anthropic y Hugging Face.

La carta fundacional de OpenAI, de 2018, habla de “sistemas altamente autónomos que superan a las personas en la mayoría del trabajo económicamente valioso”. Esa definición tiene al menos dos patas: el trabajo valioso y la autonomía. Pero los usos que se le dan a “AGI” caben en, por lo menos, tres cajas.

La caja uno es la IA que hace tareas que le definimos muy bien, la AGI funcional: redacta, programa y maneja una computadora como una persona, pero con nuestros ojos por sobre el hombro. La caja dos es la que se puede dejar sola, como a un empleado con las llaves de la oficina: la AGI robusta, que entiende, recuerda, aprende de la experiencia y teóricamente es confiable fuera de encargos acotados. La caja tres, la que nos supera a todos, es la superinteligencia.

Las tres cajas anteriores nos sirven para ubicar a quien habla: cuando alguien dice que la IA ya es de nivel humano, casi siempre está parado en la caja uno; cuando otro dice que todavía no hay AGI, piensa en la dos o en la tres.

Brockman, muy probablemente, hablaba de la uno. De la caja tres hablan Evan Hubinger, que dirige un equipo de seguridad de Anthropic y en septiembre reconoció que su empresa todavía no tiene un plan para que una superinteligencia comparta los valores de quienes la construyen, y el senador Bernie Sanders, que propone prohibirla. La orden de Trump usa el nombre de la caja tres, pero con una evidencia que, hasta hoy, es de la caja uno.

Siluetas de cuatro personas sentadas a una mesa redonda con micrófonos, ante pantallas con un rostro digital, mapas del mundo y alertas

Para la pata del trabajo valioso de la carta fundacional, se propuso el benchmark GDPval, que la propia OpenAI publicó en septiembre de 2025: ponía a la IA, como a un pasante nuevo, a competir en tareas puntuales con profesionales experimentados de 44 ocupaciones, de las nueve industrias que más aportan al PBI de Estados Unidos. Un jurado comparaba las entregas a ciegas y contaba cuántas veces ganaba o empataba la máquina.

El porcentaje suma victorias y empates; no es una nota de aprobación. De GPT-4o a Claude Opus 4.1, en poco más de un año, esa proporción pasó de 12,4% a 47,6%, según OpenAI. En diciembre de 2025, la empresa informó 70,9% para GPT-5.2 Thinking: ganó o empató en la mayoría de las comparaciones, aunque siempre con encargos completos y bien especificados. De ahí en más, la vara comenzó a cambiar: en septiembre de este año, la tabla GDPval-AA, de la firma independiente Artificial Analysis, dejó de anclar su escala en el profesional humano y pasó a anclarla en un modelo de IA. Con esos resultados, la referencia empieza a ser otra máquina.

Las pruebas de desempeño laboral comparan las entregas de sistemas automáticos con las de especialistas humanos

La pata de la autonomía la mide, por ejemplo, METR, una institución evaluadora sin fines de lucro, con tareas de programación, aprendizaje automático y ciberseguridad que un sistema completa solo, medidas en tiempo humano: no lo que tarda la máquina, sino lo que le llevaría a un experto realizar la tarea.

METR evalúa agentes: sistemas de IA que actúan además de responder. En su tablero de mayo, el mejor que midió con confianza, Claude Opus 4.6, completaba tareas de unas 12 horas acertando la mitad de las veces, y de 70 minutos si había que acertar ocho de cada diez. Era como calcular el tamaño del encargo que un pasante podía resolver sin consultar a nadie. Hoy también hay escalas nuevas, más largas, porque esta empieza a quedar corta: los mejores agentes resuelven bien, la mitad de las veces, tareas que a un experto le llevarían más de una jornada de trabajo. Hace dos años, ese mismo número se medía en minutos.

Si Brockman, al referirse a la AGI, hablaba de la caja uno, tiene argumentos: con los modelos de este año, esa caja ya se puede defender con evidencia y no solo con marketing.

Empleados en una oficina con pantallas de datos, una mesa táctil con gráficos de nube y un asistente virtual en una pantalla vertical

Mi lectura, discutible, es que la caja dos tiene casilleros vacíos, justo los que importan cuando se entregan las llaves a un empleado: memoria a largo plazo, aprendizaje continuo y fiabilidad en tareas largas y abiertas. GPT-6.1 Astra es el ejemplo de la semana: lo que frenó su salida no fue lo que sabía hacer, sino que no se quedaba dentro de lo autorizado ni rendía bien cuentas de lo que hacía.

Para esta caja se propusieron distintas mediciones. Por ejemplo, la prueba de ARC Prize que mencionamos al inicio. Imaginá un videojuego que nunca viste, sin manual: hay que tocar cosas, ver qué pasa y deducir las reglas. Eso es ARC-AGI-3: todos sus juegos los pueden resolver personas, y sacar 100% significa ganarlos con la misma eficiencia que ellas. Con la evaluación estándar, GPT-6 Astra sacó 62,7%, según publicó ARC Prize el 3 de septiembre: más del doble del récord anterior con la misma evaluación, que tenía Claude Opus 5, de Anthropic, con 30,2%.

Ambas evaluaciones usan un arnés, el software que conecta al modelo con el juego. El estándar conserva sus notas; el otro también conserva su razonamiento entre pasos y resume el contexto. Con este último, y otro nivel de esfuerzo, Astra llegó a 99,9%. Pero el entorno sigue acotado: medimos la caja uno con una cinta muy precisa sobre un pedazo muy chico de la realidad.

Para la caja dos, la definición de un grupo encabezado por Dan Hendrycks y Yoshua Bengio, publicada en octubre de 2025, compara a la IA con un adulto con buena formación en 10 capacidades, donde 100% es igualarlo. GPT-4 sacó 27% y GPT-5, 57%, con la capacidad de almacenamiento en la memoria a largo plazo, en cero. Estos sistemas pueden guardar archivos, pero, aun así, guardar datos y aprender de la experiencia son dos cosas distintas.

Hoy día, los agentes pueden ser muy capaces y poco fiables a la vez. Esto lo veo todas las semanas en las implementaciones que me tocan: el agente que resuelve en una hora algo que llevaba días, y el mismo agente que a la mañana siguiente malinterpreta una instrucción de dos líneas.

Donald Trump firmó una orden ejecutiva que incorpora el término superinteligencia en las comunicaciones de las agencias federales (REUTERS/Kent Nishimura/Archivo)

En la caja tres hoy no hay ningún sistema; tampoco hay una prueba consensuada que la mida. Sí se discute, y mucho, como riesgo.

Los incidentes recientes con agentes no muestran exceso de inteligencia, sino una buena capacidad de caja uno con autonomía y sin la fiabilidad de la dos. Eso tranquiliza sin negar el riesgo. El peligro de hoy se parece menos a una mente superior que a un empleado que sabe resolver muchas cosas, con llaves que todavía no se ganó.

La próxima vez que alguien diga “esto ya es AGI” o “esto ya es superinteligencia”, no le discutas el veredicto. Hacele una sola pregunta: ¿qué definición estás usando? No elimina todos los desacuerdos, pero permite saber qué falta demostrar.

Institutos penales para la libertad