Claude Opus 5 Supera Fable 5 na Maioria dos Testes—Por Metade do Preço

By: rootdata|2026/07/24 18:28:43
0
Compartilhar
copy
Avalie no GoogleAvalie no Google

Claude Opus 5 foi lançado hoje. É mais barato para as empresas operar do que o modelo líder da Anthropic, Claude Fable 5, que a empresa posicionou como o produto de ponta do dia a dia para usuários pagantes. Além disso, o Opus 5 também supera o Fable 5 em benchmarks significativos.

Para entender onde o Opus 5 se encaixa: a linha de produtos da Anthropic possui quatro níveis. Haiku é rápido e barato. Sonnet é de médio alcance. Opus é o trabalhador pesado. Acima disso está a classe Mythos—um nível que a Anthropic introduziu nesta primavera—que inclui o Claude Fable 5 para o público e o Claude Mythos 5, uma versão com menos restrições reservada através do Projeto Glasswing para pesquisadores de cibersegurança verificados e operadores de infraestrutura crítica.

O Fable 5 teve um desempenho difícil como o carro-chefe dos assinantes. Foi lançado em 9 de junho, retirado globalmente três dias depois após o governo dos EUA emitir uma ordem de controle de exportação de emergência citando uma vulnerabilidade de jailbreak, e voltou em 30 de junho—apenas para mudar imediatamente para um modelo apenas de créditos, não mais incluído nos planos padrão. O Opus 5 agora preenche o espaço que o Fable 5 não conseguiu manter.

Lovable, uma plataforma de desenvolvedores com milhões de usuários, testou o Opus 5 em suas avaliações internas e observou que os ganhos vão além das pontuações brutas: "Não é apenas melhor em nossas tarefas de codificação mais difíceis, subindo 22% em relação ao Opus 4.7, é mais estável, com muito menos variação de execução para execução," disse Fabian Hedin em uma declaração compartilhada pela Anthropic.

Os benchmarks

Pode parecer estranho, mas o Opus supera o Fable em quase tudo que importa para o usuário comum, enquanto não é rotulado como classe Mythos como o Fable.

No Frontier-Bench v0.1—um benchmark que testa se agentes de codificação de IA podem completar tarefas reais de engenharia de software de ponta a ponta, pontuado como uma porcentagem de tarefas concluídas—o Opus 5 alcançou 43,3%. O Fable 5 ficou em 33,7%. O GPT-5.6 Sol da OpenAI, principal rival comercial da Anthropic, pontuou 34,4%.

A maior margem está no ARC-AGI-3, um teste de resolução genuína de problemas baseado em quebra-cabeças novos que um modelo não poderia ter memorizado a partir dos dados de treinamento, pontuado como uma porcentagem de quebra-cabeças resolvidos. O Opus 5 alcançou 30,2%; o GPT-5.6 Sol pontuou 7,8%; e o Fable 5 não foi testado. No GDPval-AA v2—um benchmark de trabalho de conhecimento pontuado via classificações Elo, o sistema de classificação estilo xadrez usado para medir o desempenho relativo em tarefas profissionais reais—o Opus 5 alcançou 1.861 contra 1.747 do Fable 5 e 1.736 do GPT-5.6 Sol.

A Zapier testou o Opus 5 no AutomationBench, uma avaliação que pontua se um modelo pode realizar um fluxo de trabalho empresarial completo do início ao fim sem ajuda humana. O veredicto deles: o modelo "pegou uma planilha de saúde de conta bruta e executou uma sequência completa de prevenção de churn de ponta a ponta: sinalizando contas em risco, alertando o proprietário certo e resumindo para operações de retenção. Modelos anteriores não passaram; o Opus 5 alcançou 100%."

A Anthropic também está promovendo o Opus 5 como uma atualização de pesquisa. A Ultima Genomics, uma empresa de sequenciamento de DNA, disse que o modelo "se comporta mais como um cientista cuidadoso do que qualquer modelo que já executamos. Ele busca os testes estatísticos corretos para descartar confundidores, verifica seus próprios resultados por métodos independentes e mantém o foco em análises longas de múltiplas etapas."

Dito isso, essas duas áreas—jurídica e saúde—são as únicas nas quais o Fable 5 se destaca por uma pequena margem.

O lançamento ocorre uma semana após a Moonshot AI, uma startup com sede em Pequim apoiada pela Alibaba, revelar o Kimi K3—um modelo de 2,8 trilhões de parâmetros (o que significa que qualquer um pode baixar o código subjacente para executá-lo de forma independente) que a Moonshot descreve como o maior sistema de IA aberto do mundo. Benchmarks independentes consistentemente colocam o Kimi K3 em terceiro lugar geral, atrás tanto do Fable 5 quanto do GPT-5.6 Sol, superando esses dois em áreas específicas.

O Opus 5 está disponível agora via API a $5 por milhão de tokens de entrada e $25 por milhão de saída. (Tokens são a unidade básica de informação que um modelo de IA pode processar tanto na entrada quanto na saída). Um modo Rápido, funcionando a aproximadamente 2,5 vezes a velocidade padrão, também está disponível, ao dobro do preço base—$10 por milhão de tokens de entrada e $50 por milhão de saída.

Este lançamento pode acabar com a ansiedade sobre a falta de disponibilidade pública do Fable 5. O Opus também está disponível por assinatura para todos.

Aviso: Este conteúdo é fornecido apenas para fins de divulgação e informação geral da marca e não constitui aconselhamento financeiro, de investimento, jurídico ou tributário. Quaisquer eventos, recompensas, eventos online ou informações relacionadas mencionados neste documento não devem ser considerados uma recomendação, solicitação ou convite para comprar, vender, negociar ou de qualquer outra forma realizar transações com criptoativos ou usar quaisquer serviços. Criptoativos são altamente voláteis, e sua negociação pode resultar em perdas. Os serviços e eventos online da WEEX podem não estar disponíveis em todas as regiões e estão sujeitos às leis, regulamentos e requisitos de elegibilidade aplicáveis. É sua responsabilidade garantir que o uso dos serviços da WEEX esteja em conformidade com as leis locais e avaliar cuidadosamente os riscos antes de participar de quaisquer atividades relacionadas a criptomoedas.

Você também pode gostar

iconiconiconiconiconiconicon
Atendimento ao cliente:@weikecs
Parcerias comerciais:@weikecs
Quant trading e MM:bd@weex.com
Programa VIP:support@weex.com