Título original: "O Vale do Silício copiando os deveres de casa da China: a próxima questão é a aplicação de IA"
Autor original: Beating
O Vale do Silício começou a copiar os deveres de casa da China.
Recentemente, surgiram nos EUA uma série de modelos abertos de baixo custo, com o objetivo de alcançar as capacidades dos modelos de código aberto da China, mantendo os preços no mesmo nível.
O Thinking Machines Lab de Mira Murati lançou no mês passado o primeiro modelo, Inkling. Na descrição oficial, foram mencionadas duas coisas: a arquitetura subjacente é baseada no DeepSeek-V3, e os dados de treinamento foram gerados pelo Kimi K2.5.
Os mais caros do Vale do Silício estão usando a estrutura dos modelos de código aberto da China, alimentando-os com dados gerados por modelos chineses. Se olharmos para dois anos atrás, isso só aconteceria ao contrário.
No início deste ano, o Trinity-Large-Thinking da Arcee AI obteve 91,9 pontos no PinchBench, 1,4 pontos a menos que o Opus 4.6 da Anthropic, mas custando apenas 4% do preço deste último.
O CEO da Arcee AI, Mark McQuade, disse: "Estamos trabalhando para que os EUA alcancem e superem a China."
O que o Vale do Silício está copiando não são apenas os modelos, mas também os preços estabelecidos pelas empresas chinesas.
A arquitetura pode ser referenciada, os métodos de treinamento podem ser replicados, e os dados podem ser gerados em massa por outros modelos. Uma vez que os pesos são liberados, os desenvolvedores podem continuar a desenvolver. A questão do preço é ainda mais simples: se uma empresa cortar os preços, as outras eventualmente terão que acompanhar.
Nos últimos três anos, as empresas de modelos grandes prosperaram com parâmetros, poder computacional e código fechado, mas agora esse edifício está prestes a desmoronar.
Na madrugada de 17 de julho, a Dark Side lançou o Kimi K3. Com um total de 2,8 trilhões de parâmetros e um contexto de 1 milhão de tokens, é o maior modelo aberto do mundo.
No Frontend Code Arena, o K3 obteve 1679 pontos, à frente de Claude Fable 5 e GPT-5.6 Sol. Esta é a primeira vez que um modelo aberto supera um modelo fechado. Em sete direções de programação front-end, ele conquistou seis primeiros lugares.
Elon Musk comentou sob os resultados: "Impressionante".
A API do K3 não é barata, cobrando 100 yuans por milhão de tokens gerados. No entanto, nos testes horizontais do SuperCLUE, sua pontuação de tarefa foi 18% superior à do segundo colocado, e o custo médio foi 16% menor ao completar a mesma série de tarefas.
O custo de um modelo não deve ser avaliado apenas pelo preço por milhão de tokens, mas sim pelo custo total para completar uma tarefa do início ao fim. Esses dois números estão se distanciando cada vez mais, tornando o preço em si cada vez menos significativo.
Na noite de dois dias depois, a Dark Side suspendeu as assinaturas de novos usuários no C-end. O volume de solicitações em 48 horas superou em muito as previsões, e a capacidade computacional não foi suficiente.
Em 27 de julho, o K3 liberou todos os pesos, juntamente com o relatório técnico e a infraestrutura de suporte.
Em seguida, foi a vez do DeepSeek.
O mercado estava esperando pela versão oficial do V4. No final de abril, o DeepSeek lançou as versões beta V4-Pro e V4-Flash, ambas suportando um contexto de 1 milhão de tokens, que a empresa chamou de "Era de Contexto de Milhões". Após dois ou três meses de silêncio, em 2 de agosto, o V4 Flash foi oficialmente lançado e os pesos foram liberados. Com um total de 284 bilhões de parâmetros, a inferência única ativou apenas 13 bilhões, e a pontuação nos testes de programação DeepSWE subiu de 7,3 para 54,4.
O que impressionou ainda mais foi o preço. Naquela ocasião em maio, o V4-Pro foi reduzido para um quarto do preço original, o que já era a quarta vez que o DeepSeek ajustava seus preços em um mês. Quando o Flash foi oficialmente lançado, todos ficaram surpresos com sua relação custo-benefício.
"Você recebe o que paga" era a regra do passado. Agora, os modelos chineses estão se tornando cada vez mais eficazes, enquanto os preços estão caindo cada vez mais. Os concorrentes estrangeiros, é claro, estão insatisfeitos, mas não há muito que possam fazer. Os usuários já viram produtos que são baratos e eficazes, e ninguém quer voltar a ser enganado.
Logo depois, a Alibaba anunciou que liberaria os pesos do Qwen3.8-Max na próxima semana. A série Max, que sempre esteve na posição de flagship de código fechado, também começou a se abrir. Seu preço internacional é cerca de 40% do Opus 5, enquanto a saída é apenas 24%.
Essas coisas aconteceram em apenas 16 dias.
No passado, as empresas de modelos dependiam de preços escassos, onde apenas eu poderia fazer, e você teria que pagar o que eu dissesse. Com uma diferença de poucos pontos na lista, os preços podiam variar em dezenas de vezes.
As três empresas Kimi, DeepSeek e Qwen têm rotas tecnológicas diferentes, mas estão fazendo a mesma coisa: elevando suas capacidades, abrindo seus pesos e cortando seus preços, e rapidamente integrando isso em seus produtos.
Nos EUA, algumas pessoas também entenderam essa tendência.
No final de 2025, a Arcee AI apostou quase todo o seu dinheiro. Em 33 dias, 2048 placas B300, 20 milhões de dólares, com apenas 30 pessoas na empresa. O Trinity Large resultante tem um total de 400 bilhões de parâmetros, ativando 13 bilhões em cada inferência, e quase metade dos dados de treinamento é sintético. Em julho deste ano, a Arcee também assinou uma parceria com o Departamento de Energia dos EUA para desenvolver um modelo voltado para pesquisa.
A equipe, os resultados, os custos e os pedidos do governo estão todos em ordem. No entanto, a porta do financiamento é impossível de abrir.
A Arcee levantou até agora um total de 50 milhões de dólares, com uma avaliação de 240 milhões de dólares. No atual cenário de modelos grandes, esse valor não é suficiente nem para entrar na mesa, muito menos para entrar em uma sala privada.
O CEO Mark McQuade disse: "Quase todos os VCs de primeira linha nos rejeitaram."
Os modelos abertos dos EUA ainda não enfrentaram diretamente a China, mas já foram barrados por seus próprios comitês de investimento.
No primeiro trimestre de 2026, as startups de IA em todo o mundo levantaram 255,5 bilhões de dólares, com quase dois terços concentrados em três transações: 122 bilhões da OpenAI, 30 bilhões da Anthropic e 20 bilhões da xAI. O dinheiro flui quase todo para empresas de código fechado.
Joe Floyd, parceiro da Emergence Capital e investidor inicial da Arcee, disse que ouviu de muitos VCs razões semelhantes para rejeitar:
"Eu não quero que esse modelo tenha sucesso. Eu não quero investir, porque isso prejudicaria meu investimento na Anthropic e na OpenAI."
Os únicos que realmente estão dispostos a gastar dinheiro em modelos abertos são os vendedores de chips.
Em março deste ano, a NVIDIA revelou em documentos da SEC que planeja investir 26 bilhões de dólares nos próximos cinco anos para apoiar pesos abertos. A Reflection AI, Poolside e o Thinking Machines Lab receberam seu dinheiro.
Jensen Huang entende isso melhor do que ninguém. Os modelos de código fechado ganham dinheiro com APIs, enquanto os modelos abertos queimam cartões. Quanto mais baratos os modelos forem, mais os desenvolvedores usarão, e melhor será a venda das placas da NVIDIA.
Na noite de 24 de julho, Jensen Huang registrou uma conta no X e seu primeiro tweet foi o compartilhamento de uma carta aberta intitulada "Pesos Abertos e a Liderança dos EUA no Campo da IA". A carta dizia que a capacidade dos EUA de continuar liderando a indústria não deve ser avaliada apenas pela posse dos modelos mais avançados, mas também pela existência de um ecossistema que possa se espalhar por todas as indústrias.
Mais tarde, quase 200 fundadores de startups americanas assinaram uma carta ao governo Trump, se opondo à proibição de modelos abertos da China. O que achei mais interessante nessa carta foi que não havia uma única frase bonita. Eles não defenderam a China, nem levantaram a bandeira do liberalismo, apenas argumentaram que os modelos chineses baratos se tornaram ferramentas de produção, e se fossem realmente banidos, teriam que voltar a comprar APIs caras dos EUA.
McQuade também disse em uma entrevista que a ampla adoção é apenas uma questão de tempo.
Enquanto o Vale do Silício ainda debate se deve ou não fazer pesos abertos, a China já começou a avançar para a próxima fase.
As palavras "ano da aplicação de IA" foram repetidas muitas vezes nos últimos três anos. Mas para julgar se uma tecnologia realmente entrou em sua fase de aplicação, devemos observar duas coisas: se os usuários estão dispostos a gastar dinheiro e se as empresas estão integrando isso em seus negócios.
Neste ano, tanto a Claude Code quanto a Cursor ultrapassaram uma receita anual de 1 bilhão de dólares, com a taxa de penetração de ferramentas de programação de IA entre desenvolvedores individuais chegando a quase metade.
As mudanças são ainda mais significativas no setor empresarial. De acordo com uma pesquisa do Sand Dune Think Tank, a taxa de adoção de agentes de IA nas empresas chinesas subiu de 17,3% no final de 2024 para 40,3% em meados de 2026.
Li Yanhong introduziu um novo indicador chamado DAA, que significa número de agentes ativos diários. Anteriormente, as empresas de internet contavam quantas pessoas abriam seus produtos diariamente; no futuro, contarão quantos agentes estão trabalhando para as pessoas e quantos resultados reais foram entregues.
A curva de uso é ainda mais impressionante. De acordo com as estatísticas da CCTV, o volume médio diário de chamadas de tokens na China aumentou de cerca de 100 bilhões no início de 2024 para 140 trilhões no final de março deste ano, mais de mil vezes em mais de dois anos.
Os modelos estão se tornando cada vez mais baratos, mas o poder computacional está se tornando cada vez mais escasso. Em março deste ano, Tencent Cloud, Alibaba Cloud e Baidu Smart Cloud aumentaram consecutivamente os preços de capacidade computacional em cerca de 30% em dez dias. No primeiro semestre, com a explosão dos agentes, o preço de aluguel da capacidade de inferência subiu mais de 40%.
A razão é que a forma como as pessoas usam IA mudou. Antes, faziam uma pergunta e recebiam uma resposta, o que não consumia muitos tokens. Agora, um agente precisa realmente concluir o trabalho, levando em conta o contexto, ajustando várias ferramentas, verificando várias vezes e, se cometer um erro, começando tudo de novo. O preço unitário caiu, mas o consumo aumentou exponencialmente.
A queda de preços não diminuiu o mercado; ela trouxe de volta a demanda que antes não era contabilizada.
Em 1981, a IBM abriu a arquitetura do PC, e rapidamente as máquinas compatíveis invadiram o mercado, fazendo com que os preços do hardware caíssem. No final, quem realmente ganhou dinheiro não foram os fabricantes de máquinas, mas sim os softwares que rodavam nelas, como Lotus 1-2-3, WordPerfect e, posteriormente, a Microsoft.
Hoje, o caminho é quase idêntico. Todos ainda estão focados nas capacidades subjacentes, enquanto as empresas acima já começaram a competir por usuários, por entradas e por fluxos de trabalho.
As empresas americanas podem estudar a arquitetura do DeepSeek, usar os dados gerados pelo Kimi e até gastar 20 milhões de dólares para treinar um modelo aberto com um desempenho razoável. Mas a aplicação não é tão fácil de replicar.
A aplicação não tem pesos disponíveis para download, nem benchmarks. O que determina se ela funcionará ou não é o conhecimento acumulado por uma empresa ao longo de mais de uma década.
No passado, as grandes empresas costumavam transformar modelos em produtos independentes, esperando que os usuários abrissem uma janela de chat especificamente para isso. Agora, os modelos estão começando a se integrar ao DingTalk, Feishu e WeChat empresarial, com o agente se inserindo diretamente nas organizações e processos existentes.
Nos Estados Unidos, um agente de escritório pode crescer ao longo do Gmail, Slack e Salesforce. Na China, ele começará a partir do DingTalk, Feishu e WeChat empresarial, e depois se conectará a softwares financeiros, cadeias de suprimentos, sistemas de fábricas e plataformas governamentais. Mesmo que ambos os lados usem o mesmo modelo, os produtos finais não serão iguais.
De 2022 a 2025, as restrições dos EUA às chips chineses se intensificaram. H100 não é vendido, B300 não é vendido, e processos avançados e equipamentos de fabricação também estão sendo controlados. Sob essas condições, as empresas chinesas conseguiram criar o maior modelo aberto do mundo.
Em 2026, os EUA começaram a discutir a limitação dos pesos dos modelos chineses. A OpenAI e a Anthropic, segundo relatos, já expressaram preocupações aos reguladores, e o Congresso também está estudando se os pesos dos modelos ainda podem transitar internacionalmente.
A faca ainda não caiu, mas os próprios americanos já estão reclamando da dor.
As proibições de chips afetam a oferta das empresas chinesas, enquanto as proibições de modelos cortam os custos das startups americanas. A carta conjunta também deixa claro que a proibição não pode impedir a disseminação; ela apenas forçará os desenvolvedores a baixar todos os modelos disponíveis antes que a porta se feche.
Os chips são físicos, podendo bloquear pedidos, logística e fábricas de terceirização. Os pesos, uma vez que saem, podem ser baixados, espelhados, quantizados, ajustados e destilados infinitamente.
O que é ainda mais difícil de controlar é o preço.
Os EUA ainda lideram em modelos fechados de ponta. A OpenAI e a Anthropic ainda estão na primeira fila, e treinar os modelos mais avançados ainda depende das placas da NVIDIA, e isso não mudará no curto prazo.
Mas, ao chegar na aplicação, o resultado raramente é decidido por um único modelo mais forte. O que conta é se o modelo é barato o suficiente, se a empresa tem uma entrada digital pronta e se os desenvolvedores conseguem realmente se integrar aos processos de negócios.
Olhando para os últimos trinta anos, a China venceu muitas vezes, mas a forma de vencer foi geralmente a mesma.
Pagamentos móveis, e-commerce, entrega de comida, transmissões ao vivo, todos pegaram tecnologias inventadas do exterior e as inseriram na rotina de bilhões de pessoas, criando negócios de escala impressionante. A base mais baixa foi, a longo prazo, fornecida por outros. Transistores vieram do Bell Labs, x86 pertence à Intel, TCP/IP foi financiado pelo governo dos EUA, e Windows, Android e iOS cresceram na costa oeste. Até mesmo os frameworks de aprendizado profundo mais usados, TensorFlow e PyTorch, vieram do Google e Meta, respectivamente.
"Invenção nos EUA, escala na China", essa frase foi dita por trinta anos, raramente encontrando exceções reais.
Agora, a exceção apareceu.
As especificações técnicas do Thinking Machines Lab deixam isso bem claro. Uma das novas empresas mais notáveis e ricas do Vale do Silício, que se baseou na arquitetura de uma empresa chinesa para a camada de base do modelo, e depois usou dados gerados por outro modelo chinês para o treinamento.
No passado, o Vale do Silício comprava capacidade da China, recrutava talentos ou buscava mercados. Agora, ele começa a seguir diretamente as rotas tecnológicas validadas pelas empresas chinesas.
A adoração do Vale do Silício, claro, tem suas origens. Nos últimos anos, a maioria das tecnologias de base mais importantes da indústria de computadores realmente surgiu de lá. Desde os chips nas máquinas até o IDE que os programadores abrem todos os dias, o Vale do Silício sempre esteve no topo da cadeia tecnológica.
Mas, no final, o mundo da tecnologia observa os resultados. Quem pode propor novas arquiteturas, quem pode reduzir custos, quem pode fazer os concorrentes começarem a imitar, quem tem o direito de redefinir o topo.
Agora, os nomes das empresas chinesas começam a aparecer nessa lista.
O Vale do Silício provavelmente alcançará isso no futuro; lá há engenheiros, capital e chips suficientes. Mas as aplicações que já estão integradas aos negócios reais não vão esperar. Quem primeiro se infiltrar nos processos empresariais, quem primeiro ganhará clientes, dados e a oportunidade de melhorias na próxima rodada. A linha de partida nunca é a mesma.
A era da aplicação de IA não vai começar com um dia auspicioso e festivo. Os primeiros lugares onde ela aparece são relatórios financeiros, um aumento explosivo no volume de chamadas, e um programador que, mais uma vez, esgota seu limite à meia-noite.
A ampla disseminação é apenas uma questão de tempo. Essa frase foi dita por um americano.
Link do artigo
Este conteúdo é fornecido apenas para fins informativos gerais e não constitui aconselhamento financeiro, de investimento, jurídico ou tributário. Quaisquer eventos, recompensas, promoções online ou informações relacionadas mencionadas neste documento não devem ser consideradas uma recomendação, solicitação ou convite para comprar, vender, negociar ou realizar qualquer outra transação com criptoativos. Criptoativos são altamente voláteis e podem resultar em perdas. A disponibilidade dos serviços, produtos e eventos relacionados da WEEX pode variar conforme a região. É de sua responsabilidade garantir que sua participação esteja em conformidade com as leis e regulamentações locais aplicáveis.





























