Forschung - 2026-09-04
Ein neues AGI-Modell: GPT-6 Astra?
GPT-6 Astra, Sol und Claude Fable im Vergleich: PC-Nutzung, Programmierung und Recherche. Veröffentlichte Benchmarks und Perfectorys Wechselentscheidung.
Sollten wir alle unsere Anwendungen auf GPT-6 Astra umstellen?
Unsere Antwort lautet Ja: Wir wollen Astra in allen unseren Anwendungen einsetzen. Der Grund ist praktisch. In unseren ersten Versuchen arbeitet es schnell und effektiv an unserem PC, erledigt Routineaufgaben gut und ermöglicht ein tieferes Verständnis bei Recherchen.
Die Frage „ein neues AGI-Modell?“ eignet sich als Überschrift. Aus einem Benchmark lässt sich diese Schlussfolgerung jedoch nicht ableiten. Für unser Team ist wichtiger, ob das Modell die tatsächliche Arbeit unserer Anwendungen verbessert.
Astra vs. Sol vs. Fable: die veröffentlichten Zahlen
Die folgenden drei Tabellen enthalten ausgewählte Ergebnisse aus OpenAIs Astra-Ankündigung. Es handelt sich um Herstellerangaben, nicht um Messungen von Perfectory. Höhere Werte sind besser. NR bedeutet nicht veröffentlicht. Angegeben ist die beste bewertete Leistungsstufe; Ergebnisse im Produktivbetrieb können abweichen.
Computernutzung und Routineaufgaben
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Fable 5 |
|---|
| Agents’ Last Exam | 59.3% | 53.6% | NR | 48.7% |
| ScreenSpot-Pro (ohne Werkzeuge) | 92.7% | 76.9% | NR | 87.3% |
| AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% |
Quelle der Bewertungen für Computernutzung und professionelle Aufgaben: OpenAI. Die Fable-Spalten beziehen sich auf Claude Fable.
Softwareentwicklung
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Fable 5 |
|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 42.0% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% |
Quelle der Programmierbewertungen: OpenAI.
Recherche und Schlussfolgern
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Fable 5 |
|---|
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% |
| GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% |
| Humanity’s Last Exam (mit Werkzeugen) | 57.2% | NR | 65.0% | 63.8% |
Quelle der akademischen Bewertungen: OpenAI. Bei Humanity’s Last Exam liegt Fable vorne; Astra gewinnt nicht jeden Vergleich.
Was wir bei unserer Arbeit beobachten
Unsere erste Einschätzung ist qualitativ: Dieser Artikel veröffentlicht weder interne Zeitmessdaten noch eine Stichprobengröße oder einen kontrollierten Vergleich mit Sol und Fable. Die Beobachtungen erklären unsere Entscheidung, ohne Eindrücke in erfundene Prozentwerte umzuwandeln.
| Bewerteter Bereich | Unsere erste Beobachtung zu Astra | Geplante Messung für Astra, Sol und Fable |
|---|
| Arbeit an unserem PC | Schnell und effektiv im praktischen Einsatz | Median und 95. Perzentil der Zeit bis zur überprüften Aufgabenerledigung |
| Routineaufgaben | Nützliche Ausführung alltäglicher Arbeit | Erfolgsquote und menschliche Korrekturen pro Aufgabe |
| Recherche | Tieferes Verständnis des Themas | Qualität der Belege und durch Prüfer bewertete Richtigkeit |
| Klärende Fragen | Stellt Fragen, die wir bei anderen Modellen nicht gesehen haben | Vor der Lieferung geklärte wesentliche Unklarheiten |
Der interessanteste Unterschied liegt für uns bei den Fragen. Astra stellt Rückfragen, die fehlenden Kontext aufdecken und uns helfen, ein Thema tiefer zu verstehen. Andere Modelle haben diese Fragen in unserer Erfahrung oft ausgelassen. Das ist eine Beobachtung zu den erprobten Aufgaben und keine Behauptung, ein anderes Modell könne solche Fragen niemals stellen.
Bei einem Rechercheassistenten kann eine gute Rückfrage den Wert der endgültigen Antwort verändern. Bei einer Anwendung, die einen Computer bedient, zählt für uns eine korrekt erledigte Aufgabe mit wenig Aufsicht. Diese Ergebnisse soll die Umstellung verbessern.
Was die Umstellung aller Anwendungen bedeutet
Wir wollen Astra zum Standardmodell unserer Anwendungen machen. Jede Anwendung durchläuft ihren bestehenden Bewertungs- und Freigabeprozess, beginnend mit PC-Abläufen, Routineautomatisierung und Rechercheunterstützung. So können wir die im Alltag beobachteten Verbesserungen überprüfen.
Wir werden dieselben Aufgaben, Eingaben, Werkzeuge und Abnahmekriterien mit Astra, Sol und Fable vergleichen. Neben der Bearbeitungszeit erfassen wir Richtigkeit, menschliche Eingriffe und Kosten pro erfolgreich erledigter Aufgabe. Eine schnelle Antwort ist nur hilfreich, wenn der gesamte Ablauf das richtige Ergebnis liefert.
Frühere Modellwechsel haben uns gezeigt, wie wichtig die Prüfung an der tatsächlichen Aufgabe ist. Unsere Entscheidung ist, mit Astra weiterzugehen; die Prüfungen je Anwendung zeigen, wann die jeweilige Integration bereit ist.
Unser Fazit: Ja, wir sollten umstellen
Ja, wir sollten unsere Anwendungen auf GPT-6 Astra umstellen. Nach unserer ersten Erfahrung arbeitet es am PC und bei Routineaufgaben schnell und effektiv. Es vertieft außerdem Recherchen, stellt wertvolle Zusatzfragen, die andere Modelle bei unserer Arbeit ausgelassen haben, und hilft uns, das Thema genauer zu verstehen.
Diese Kombination motiviert den Wechsel. Die veröffentlichten Vergleiche liefern Anhaltspunkte, unsere praktische Erfahrung gibt die Richtung vor. Wir werden die Beobachtungen bei der Bewertung jeder Anwendung quantifizieren und den Wechsel Anwendung für Anwendung umsetzen.
FAQ
Ist GPT-6 Astra ein AGI-Modell?
Der Artikel stellt diese Frage. Benchmark-Ergebnisse allein belegen keine AGI.
Sind das eigene Benchmark-Ergebnisse von Perfectory?
Die Zahlen stammen aus OpenAIs Ankündigung. Perfectorys Beobachtungen sind qualitativ; interne Zeitmessdaten oder einen kontrollierten Vergleich veröffentlichen wir hier nicht.
Planning an AI automation initiative? Read the AI automation POC guide.