recherche - 2026-09-04
Un nouveau modèle d’AGI : GPT-6 Astra ?
Comparez GPT-6 Astra, Sol et Claude Fable sur PC, en programmation et en recherche. Métriques publiées et décision de migration de Perfectory.
Faut-il migrer toutes nos applications vers GPT-6 Astra ?
Notre réponse est oui : nous souhaitons adopter Astra dans toutes nos applications. La raison est pratique. Lors de nos premiers essais, il s’est montré rapide et efficace sur notre PC, à l’aise avec les tâches courantes et capable d’approfondir les sujets de recherche.
La question « un nouveau modèle d’AGI ? » fait un bon titre. Un benchmark ne permet toutefois pas de l’établir. Pour notre équipe, il est plus utile de savoir si le modèle améliore le travail réel de nos applications.
Astra vs Sol vs Fable : les résultats publiés
Les trois tableaux suivants reprennent une sélection de résultats de l’annonce d’Astra par OpenAI. Ces scores sont publiés par le fournisseur et ne sont pas des mesures de Perfectory. Plus le score est élevé, mieux c’est. NR signifie non renseigné. Les scores correspondent au meilleur effort évalué ; les résultats en production peuvent différer.
Utilisation de l’ordinateur et tâches courantes
| Évaluation | GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Fable 5 |
|---|
| Agents’ Last Exam | 59.3% | 53.6% | NR | 48.7% |
| ScreenSpot-Pro (sans outils) | 92.7% | 76.9% | NR | 87.3% |
| AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% |
Source des évaluations sur ordinateur et du travail professionnel : OpenAI. Les colonnes Fable désignent Claude Fable.
Ingénierie logicielle
| Évaluation | GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Fable 5 |
|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 42.0% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% |
Source des évaluations de programmation : OpenAI.
Recherche et raisonnement
| Évaluation | GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Fable 5 |
|---|
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% |
| GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% |
| Humanity’s Last Exam (avec outils) | 57.2% | NR | 65.0% | 63.8% |
Source des évaluations académiques : OpenAI. Fable arrive en tête sur Humanity’s Last Exam ; Astra ne gagne pas toutes les comparaisons.
Ce que nous observons dans notre travail
Notre première évaluation est qualitative : cet article ne publie ni relevé interne de durées, ni taille d’échantillon, ni comparaison contrôlée avec Sol et Fable. Les observations expliquent notre décision sans transformer des impressions en pourcentages inventés.
| Domaine évalué | Notre première observation sur Astra | Mesure à relever pour Astra, Sol et Fable |
|---|
| Travail sur notre PC | Rapide et efficace en pratique | Médiane et 95e percentile du temps jusqu’à la réalisation vérifiée d’une tâche |
| Tâches courantes | Exécution utile du travail quotidien | Taux de réussite et corrections humaines par tâche |
| Recherche | Compréhension plus approfondie du sujet | Qualité des preuves et exactitude évaluée par des relecteurs |
| Questions de clarification | Pose des questions que nous n’avions pas vues chez les autres modèles | Ambiguïtés importantes résolues avant livraison |
La différence la plus intéressante concerne les questions. Astra pose des questions complémentaires qui révèlent le contexte manquant et nous aident à mieux comprendre le sujet. Dans notre expérience, les autres modèles omettaient souvent ces questions. Cela décrit les tâches essayées, sans affirmer qu’un autre modèle ne pourrait jamais les poser.
Pour un assistant de recherche, une bonne question complémentaire peut changer la valeur de la réponse finale. Pour une application qui pilote un ordinateur, nous voulons une tâche correctement accomplie avec peu de supervision. Ce sont les résultats que la migration doit améliorer.
Ce que signifie migrer toutes nos applications
Nous voulons faire d’Astra le modèle par défaut de nos applications. Chacune suivra son processus habituel d’évaluation et de mise en production, en commençant par les tâches sur PC, l’automatisation courante et l’assistance à la recherche. Nous pourrons ainsi vérifier les gains ressentis au quotidien.
Nous comparerons les mêmes tâches, entrées, outils et critères d’acceptation avec Astra, Sol et Fable. Outre la durée, nous mesurerons l’exactitude, l’intervention humaine et le coût par tâche réussie. Une réponse rapide n’est utile que si le processus complet produit le bon résultat.
Nos précédentes migrations ont confirmé l’intérêt de tester la tâche réelle. La décision actuelle est d’avancer avec Astra ; les vérifications propres à chaque application détermineront quand son intégration sera prête.
Notre conclusion : oui, nous devrions migrer
Oui, nous devrions migrer nos applications vers GPT-6 Astra. Notre première expérience montre qu’il est rapide et efficace sur notre PC et dans les tâches courantes. Il approfondit aussi la recherche, pose des questions utiles que les autres modèles avaient omises dans notre travail et améliore notre compréhension du sujet.
Cette combinaison motive notre choix. Les comparaisons publiées éclairent la décision, tandis que notre expérience pratique lui donne une direction. Nous quantifierons ces observations lors de l’évaluation de chaque application, puis effectuerons la migration application par application.
FAQ
GPT-6 Astra est-il un modèle d’AGI ?
L’article pose la question. Les résultats des benchmarks ne suffisent pas, à eux seuls, à établir une AGI.
S’agit-il des résultats de tests de Perfectory ?
Les comparaisons chiffrées proviennent de l’annonce d’OpenAI. Les observations de Perfectory sont qualitatives ; nous ne publions ici ni durées internes ni comparaison contrôlée.
Planning an AI automation initiative? Read the AI automation POC guide.