дослідження - 2026-09-04
Нова модель AGI — GPT-6 Astra?
Порівняння GPT-6 Astra, Sol і Claude Fable: робота на ПК, програмування та дослідження. Опубліковані метрики й рішення Perfectory щодо переходу.
Чи варто перевести всі наші застосунки на GPT-6 Astra?
Наша відповідь — так: ми хочемо перейти на Astra в усіх наших застосунках. Причина практична. За першими враженнями, модель швидко й ефективно працює на нашому ПК, добре виконує рутинні завдання та дає глибше розуміння під час досліджень.
Запитання «нова модель AGI?» добре підходить для заголовка. Проте результати тесту не дають підстав встановити такий висновок. Для нашої команди важливіше, чи покращує модель реальну роботу наших застосунків.
Astra проти Sol і Fable: опубліковані показники
Наступні три таблиці містять вибрані результати з анонсу Astra від OpenAI. Це показники, опубліковані постачальником, а не вимірювання Perfectory. Вищий результат — кращий. NR означає, що дані не опубліковані. Наведено найкращий оцінений рівень зусиль; результати у виробничому середовищі можуть відрізнятися.
Робота з комп’ютером і рутинні завдання
| Тест | GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Fable 5 |
|---|
| Agents’ Last Exam | 59.3% | 53.6% | NR | 48.7% |
| ScreenSpot-Pro (без інструментів) | 92.7% | 76.9% | NR | 87.3% |
| AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% |
Джерело оцінок роботи з комп’ютером і професійних завдань: OpenAI. У стовпцях Fable йдеться про Claude Fable.
Розробка програмного забезпечення
| Тест | GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Fable 5 |
|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 42.0% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% |
Джерело оцінок програмування: OpenAI.
Дослідження та міркування
| Тест | GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Fable 5 |
|---|
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% |
| GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% |
| Humanity’s Last Exam (з інструментами) | 57.2% | NR | 65.0% | 63.8% |
Джерело академічних оцінок: OpenAI. Fable лідирує в Humanity’s Last Exam; Astra перемагає не в кожному порівнянні.
Що ми бачимо у власній роботі
Наша початкова оцінка якісна: у статті немає внутрішнього набору вимірювань часу, розміру вибірки або контрольованого порівняння із Sol і Fable. Спостереження пояснюють наше рішення, не перетворюючи враження на вигадані відсотки.
| Що оцінюємо | Наше перше спостереження щодо Astra | Що вимірюватимемо для Astra, Sol і Fable |
|---|
| Робота на нашому ПК | Швидка й ефективна в практичному використанні | Медіана та 95-й перцентиль часу до перевіреного виконання завдання |
| Рутинні завдання | Корисне виконання щоденної роботи | Частка виконаних завдань і кількість виправлень людиною на завдання |
| Дослідження | Глибше розуміння теми | Якість доказів і правильність за оцінкою рецензентів |
| Уточнювальні запитання | Ставить запитання, яких ми не бачили від інших моделей | Суттєві неоднозначності, усунуті до передачі результату |
Найцікавіша для нас відмінність — запитання. Astra ставить додаткові запитання, які виявляють відсутній контекст і допомагають глибше зрозуміти тему. За нашим досвідом, інші моделі часто їх пропускали. Це спостереження щодо випробуваних завдань, а не твердження, що інша модель ніколи не могла б поставити такі запитання.
Для дослідницького асистента вдале додаткове запитання може змінити цінність підсумкової відповіді. Для застосунку, що керує комп’ютером, нам важливо правильно виконати завдання з мінімальним наглядом. Саме ці результати має покращити перехід.
Що означає перевести всі застосунки
Ми хочемо зробити Astra основною моделлю в наших застосунках. Кожен пройде наявний процес оцінювання та випуску, починаючи з роботи на ПК, рутинної автоматизації та допомоги в дослідженнях. Так ми зможемо перевірити покращення, які помічаємо щодня.
Ми порівнюватимемо Astra, Sol і Fable на однакових завданнях, вхідних даних, інструментах і критеріях приймання. Окрім часу виконання, фіксуватимемо правильність, втручання людини та вартість успішного завдання. Швидка відповідь корисна лише тоді, коли весь процес дає правильний результат.
Попередні переходи між моделями підтвердили цінність перевірки на реальному завданні. Нинішнє рішення — рухатися вперед з Astra; перевірки кожного застосунку покажуть, коли його інтеграція готова.
Наш висновок: так, варто переходити
Так, варто перевести наші застосунки на GPT-6 Astra. Наш перший досвід показує, що модель швидка й ефективна на ПК і в рутинних завданнях. Вона також поглиблює дослідження, ставить цінні додаткові запитання, які інші моделі пропускали в нашій роботі, та допомагає краще зрозуміти тему.
Саме це поєднання мотивує зміни. Опубліковані порівняння інформують рішення, а практичний досвід визначає напрям. Ми кількісно оцінимо спостереження під час перевірки кожного застосунку й здійснюватимемо перехід застосунок за застосунком.
FAQ
Чи є GPT-6 Astra моделлю AGI?
Стаття ставить це запитання. Самі лише результати тестів не доводять AGI.
Це власні результати тестів Perfectory?
Числові порівняння взято з анонсу OpenAI. Спостереження Perfectory якісні; внутрішні вимірювання часу чи контрольоване порівняння тут не опубліковані.
Planning an AI automation initiative? Read the AI automation POC guide.