investigação - 2026-09-04
Um novo modelo de AGI: GPT-6 Astra?
Compare GPT-6 Astra, Sol e Claude Fable no PC, programação e investigação. Consulte as métricas publicadas e a decisão de migração da Perfectory.
Devemos migrar todas as nossas aplicações para o GPT-6 Astra?
A nossa resposta é sim: queremos adotar o Astra em todas as aplicações. A razão é prática. Na nossa experiência inicial, é rápido e eficaz a trabalhar no PC, executa bem as tarefas de rotina e aprofunda a compreensão na investigação.
A pergunta «um novo modelo de AGI?» dá um bom título, mas um benchmark não permite estabelecer essa conclusão. Para a nossa equipa, importa mais saber se o modelo melhora o trabalho real das aplicações.
Astra vs Sol vs Fable: os números publicados
As três tabelas seguintes apresentam resultados selecionados do anúncio do Astra pela OpenAI. São pontuações divulgadas pelo fornecedor, não medições da Perfectory. Valores mais altos são melhores. NR significa resultado não divulgado. As pontuações usam o melhor nível de esforço avaliado; os resultados em produção podem variar.
Utilização do computador e tarefas de rotina
| Avaliação | GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Fable 5 |
|---|
| Agents’ Last Exam | 59.3% | 53.6% | NR | 48.7% |
| ScreenSpot-Pro (sem ferramentas) | 92.7% | 76.9% | NR | 87.3% |
| AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% |
Fonte das avaliações de utilização do computador e trabalho profissional: OpenAI. As colunas Fable referem-se ao Claude Fable.
Engenharia de software
| Avaliação | GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Fable 5 |
|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 42.0% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% |
Fonte das avaliações de programação: OpenAI.
Investigação e raciocínio
| Avaliação | GPT-6 Astra | GPT-5.6 Sol | Fable 5.1 | Fable 5 |
|---|
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% |
| GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% |
| Humanity’s Last Exam (com ferramentas) | 57.2% | NR | 65.0% | 63.8% |
Fonte das avaliações académicas: OpenAI. O Fable lidera no Humanity’s Last Exam; o Astra não vence todas as comparações.
O que observamos no nosso trabalho
A nossa avaliação inicial é qualitativa: este artigo não publica dados internos de tempos, dimensão da amostra ou uma comparação controlada com Sol e Fable. As observações explicam a decisão sem transformar impressões em percentagens inventadas.
| Área avaliada | Observação inicial sobre o Astra | Medição a registar para Astra, Sol e Fable |
|---|
| Trabalho no nosso PC | Rápido e eficaz na utilização prática | Mediana e percentil 95 do tempo até concluir e verificar uma tarefa |
| Tarefas de rotina | Execução útil do trabalho diário | Taxa de conclusão e correções humanas por tarefa |
| Investigação | Compreensão mais profunda do tema | Qualidade das evidências e exatidão avaliada por revisores |
| Perguntas de esclarecimento | Faz perguntas que não tínhamos visto noutros modelos | Ambiguidades relevantes resolvidas antes da entrega |
A diferença mais interessante está nas perguntas. O Astra coloca questões de seguimento que revelam contexto em falta e nos ajudam a compreender o tema mais profundamente. Na nossa experiência, outros modelos frequentemente não faziam essas perguntas. É uma observação sobre as tarefas que experimentámos, não uma afirmação de que outro modelo nunca as poderia fazer.
Num assistente de investigação, uma boa pergunta adicional pode mudar o valor da resposta final. Numa aplicação que opera um computador, interessa-nos concluir a tarefa corretamente com pouca supervisão. São esses os resultados que queremos melhorar com a migração.
O que significa migrar todas as aplicações
Queremos tornar o Astra o modelo predefinido das nossas aplicações. Cada uma seguirá o processo existente de avaliação e lançamento, começando pelos fluxos de trabalho no PC, automação de rotina e apoio à investigação. Assim verificaremos as melhorias observadas no uso diário.
Compararemos as mesmas tarefas, dados de entrada, ferramentas e critérios de aceitação em Astra, Sol e Fable. Além do tempo de conclusão, registaremos a exatidão, a intervenção humana e o custo por tarefa bem-sucedida. Uma resposta rápida só é útil se todo o processo produzir o resultado correto.
As migrações anteriores reforçaram a importância de avaliar a tarefa real. A decisão atual é avançar com o Astra; os testes de cada aplicação indicarão quando a integração está pronta.
A nossa conclusão: sim, devemos migrar
Sim, devemos migrar as nossas aplicações para o GPT-6 Astra. A experiência inicial mostra rapidez e eficácia no PC e nas tarefas de rotina. O modelo também aprofunda a investigação, coloca perguntas valiosas que outros modelos omitiram no nosso trabalho e ajuda-nos a compreender melhor o tema.
É essa combinação que motiva a mudança. As comparações publicadas informam a decisão e a experiência prática orienta-a. Quantificaremos as observações durante a avaliação de cada aplicação e faremos a migração aplicação a aplicação.
FAQ
O GPT-6 Astra é um modelo de AGI?
O artigo coloca essa questão. O desempenho em benchmarks, por si só, não demonstra AGI.
Estas avaliações foram feitas pela Perfectory?
Os números vêm do anúncio da OpenAI. As observações da Perfectory são qualitativas; não publicamos aqui dados internos de tempos nem uma comparação controlada.
Planning an AI automation initiative? Read the AI automation POC guide.