investigación - 2026-09-04
¿Un nuevo modelo de AGI: GPT-6 Astra?
Compara GPT-6 Astra, Sol y Claude Fable en uso del PC, programación e investigación. Métricas publicadas y motivos de Perfectory para migrar.
¿Deberíamos migrar todas nuestras aplicaciones a GPT-6 Astra?
Nuestra respuesta es sí: queremos adoptar Astra en todas nuestras aplicaciones. La razón es práctica. En nuestras primeras pruebas, resulta rápido y eficaz al trabajar en nuestro PC, resuelve bien las tareas rutinarias y aporta una comprensión más profunda a la investigación.
La pregunta «¿un nuevo modelo de AGI?» funciona como titular, pero un benchmark no permite establecer esa conclusión. Para nuestro equipo, lo más útil es saber si el modelo mejora el trabajo real de nuestras aplicaciones.
Astra vs Sol vs Fable: los resultados publicados
Las tres tablas siguientes recogen resultados seleccionados del anuncio de Astra de OpenAI. Son puntuaciones publicadas por el proveedor, no mediciones de Perfectory. Un valor mayor es mejor. NR significa que no se ha publicado el resultado. Se muestra el mejor nivel de esfuerzo evaluado; los resultados en producción pueden variar.
Uso del ordenador y tareas rutinarias
| Evaluación | GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Fable 5 |
|---|
| Agents’ Last Exam | 59.3% | 53.6% | NR | 48.7% |
| ScreenSpot-Pro (sin herramientas) | 92.7% | 76.9% | NR | 87.3% |
| AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% |
Fuente de las evaluaciones de uso del ordenador y trabajo profesional: OpenAI. Las columnas Fable corresponden a Claude Fable.
Ingeniería de software
| Evaluación | GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Fable 5 |
|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 42.0% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% |
Fuente de las evaluaciones de programación: OpenAI.
Investigación y razonamiento
| Evaluación | GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Fable 5 |
|---|
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% |
| GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% |
| Humanity’s Last Exam (con herramientas) | 57.2% | NR | 65.0% | 63.8% |
Fuente de las evaluaciones académicas: OpenAI. Fable obtiene mejores resultados en Humanity’s Last Exam; Astra no gana todas las comparaciones.
Lo que observamos en nuestro trabajo
Nuestra evaluación inicial es cualitativa: este artículo no publica datos internos de tiempos, un tamaño de muestra ni una comparación controlada con Sol o Fable. Las observaciones explican la decisión sin convertir impresiones en porcentajes inventados.
| Área evaluada | Nuestra primera impresión de Astra | Medición que registraremos para Astra, Sol y Fable |
|---|
| Trabajo en nuestro PC | Rápido y eficaz en el uso práctico | Mediana y percentil 95 del tiempo hasta completar y verificar una tarea |
| Tareas rutinarias | Ejecución útil del trabajo cotidiano | Tasa de finalización y correcciones humanas por tarea |
| Investigación | Comprensión más profunda del tema | Calidad de las pruebas y exactitud valorada por revisores |
| Preguntas aclaratorias | Plantea preguntas que no habíamos visto en otros modelos | Ambigüedades importantes resueltas antes de la entrega |
La diferencia más interesante está en las preguntas. Astra hace preguntas de seguimiento que revelan contexto ausente y nos ayudan a comprender mejor el tema. En nuestra experiencia, otros modelos a menudo pasaban por alto esas preguntas. Es una observación sobre las tareas que probamos, no una afirmación de que otro modelo nunca pudiera formularlas.
En un asistente de investigación, una buena pregunta adicional puede cambiar el valor de la respuesta final. En una aplicación que maneja un ordenador, nos importa completar correctamente una tarea con poca supervisión. Queremos que la migración mejore esos resultados.
Qué significa migrar todas nuestras aplicaciones
Queremos que Astra sea el modelo predeterminado de nuestras aplicaciones. Cada una pasará por su proceso habitual de evaluación y publicación, empezando por los flujos de trabajo en PC, la automatización rutinaria y la asistencia a la investigación. Así comprobaremos las mejoras que percibimos a diario.
Compararemos las mismas tareas, entradas, herramientas y criterios de aceptación en Astra, Sol y Fable. Además del tiempo de ejecución, registraremos la exactitud, la intervención humana y el coste por tarea completada correctamente. Una respuesta rápida solo sirve si todo el flujo produce el resultado correcto.
Nuestras migraciones anteriores confirmaron el valor de evaluar la tarea real. La decisión actual es avanzar con Astra; las comprobaciones de cada aplicación determinarán cuándo está lista su integración.
Nuestra conclusión: sí, deberíamos migrar
Sí, deberíamos migrar nuestras aplicaciones a GPT-6 Astra. En nuestra experiencia inicial es rápido y eficaz en el PC y en las tareas rutinarias. También profundiza en la investigación, plantea preguntas valiosas que otros modelos omitieron en nuestro trabajo y nos ayuda a comprender mejor el tema.
Esa combinación explica el cambio. Las comparaciones publicadas aportan información y nuestra experiencia práctica orienta la decisión. Cuantificaremos estas observaciones durante la evaluación de cada aplicación y realizaremos la migración aplicación por aplicación.
FAQ
¿Es GPT-6 Astra un modelo de AGI?
El artículo lo plantea como pregunta. Los resultados de benchmarks, por sí solos, no demuestran AGI.
¿Son resultados de pruebas de Perfectory?
Los números proceden del anuncio de OpenAI. Las observaciones de Perfectory son cualitativas; aquí no publicamos tiempos internos ni una comparación controlada.
Planning an AI automation initiative? Read the AI automation POC guide.