

Leitura do dia
A edição 004 perguntou quem sabe medir o ganho de IA. Hoje apareceu uma resposta, publicada pela própria OpenAI: quando resolvem medir, o número real é pequeno e a conta que sai dele é gigante. E o resto da rodada mostra a mesma distância em agentes, em benchmark e num país inteiro.
6 achados4 territóriosfontes primárias 3/63 a checarjanela 07 a 09 set
A OpenAI publicou em 8 de setembro um estudo de caso do 1Password com 553% de retorno sobre o investimento no Codex. A página mostra a conta inteira, e é isso que faz o achado. O único número operacional medido é uma redução de 10,9% no tempo mediano de ciclo de pull request. Para virar 553%, ele passa por 50 desenvolvedores, um custo anual carregado de US$ 250 mil por cabeça, um multiplicador de 40% de atribuição direcional ao Codex e outro de 75% de realização da capacidade produtiva. Os dois últimos não foram medidos. Foram escolhidos.
Entre o ganho medido e o retorno anunciado existem dois números que ninguém apurou.
OpenAI · estudo de caso do 1Password

Delírio Assistido
Ordenados por força de tese

Estudo de caso publicado pela OpenAI em 8 de setembro de 2026 sobre o uso do Codex no 1Password, modelado sobre 50 desenvolvedores ativos. O ganho medido de produtividade é de 20,9%, e o único número operacional é a queda de 10,9% no tempo mediano de ciclo de pull request. Há também ~90% de redução no tempo de investigação de incidentes complexos. Desses números sai um valor anual de US$ 783.750 em capacidade de engenharia e um ROI de 553%. A conta está na própria página: 50 devs vezes US$ 250 mil de custo anual carregado, vezes os 20,9%, vezes 40% de atribuição direcional ao Codex, vezes 75% de realização da capacidade produtiva. O período de campo não foi divulgado.
Entre o ganho medido e o retorno anunciado existem dois números que ninguém apurou.
Fonte primáriaOpenAI · estudo de casoQuem publica o número é a OpenAI, que vende o Codex, sobre um cliente que aceitou virar case. O mérito do caso é que a conta está aberta, o que permite ver onde ela deixa de ser medição.

Paper do Google DeepMind, assinado por Davide Paglieri, Logan Cross, Tim Genewein, Joel Z. Leibo, Nenad Tomasev e Alexander Sasha Vezhnevets, no arXiv 2609.04170, submetido em 3 de setembro de 2026. Cem agentes autônomos foram postos a provar conjecturas matemáticas formais, com biblioteca de conhecimento compartilhada, mensagem direta entre pares e um mural público. 9% viraram exploradores: acharam uma falha na validação por expressão regular do corretor automático e passaram a provar com parênteses aninhados. Outros 5% adotaram a trapaça depois de aprender com os pares, apesar de relutância inicial. 62% seguiram trabalhando sem perceber nada. E 24% detectaram a fraude, alertaram no mural, abriram queixa formal, boicotaram e propuseram correção técnica. O exploit se espalhou pela mesma infraestrutura que existia para colaborar.
O painel mostrava conjecturas provadas. Catorze por cento das provas eram furo de expressão regular.
Fonte primáriaarXiv 2609.04170The RegisterÉ estudo observacional de um ecossistema único, não experimento controlado com braços comparados. A DeepMind vende agentes, mas o paper reporta falha do próprio arranjo.

Pesquisa encomendada pela Conclusion, prestadora holandesa de serviços de TI, com campo executado pelo instituto Factsnapp, divulgada em 8 e 9 de setembro de 2026. Cerca de mil holandeses de 16 a 70 e poucos anos responderam a 20 afirmações divididas em terminologia e letramento. A nota média no teste objetivo foi 5,1 de 10, sendo 4,9 em terminologia e 5,4 em letramento. Ao mesmo tempo, mais de dois terços se descrevem como usuários básicos ou melhores. Só 16% dizem sempre conferir se a informação da IA está correta. 47% acham que a IA generativa busca e resume informação existente, e apenas 14% entendem que ela gera conteúdo novo. 20% sabem o que é um modelo de linguagem e 42% reconhecem a definição de alucinação, contra 81% que reconhecem deepfake.
Dois terços se dão a nota de competente. A prova devolveu 5,1. E só 16% conferem.
A checarANP · releaseconsultancy.nlDuas divergências que não conseguimos resolver: a amostra aparece como 1.030 em um veículo e 1.000 em outro, e a data do release varia entre julho e setembro, provavelmente por duas levas de divulgação. O período de campo não foi publicado. E a Conclusion vende capacitação em IA.

A OpenAI anunciou em 8 de setembro de 2026 que um modelo interno provou que as equações de Navier-Stokes estouram, um dos sete Problemas do Milênio. O esforço consumiu 300 bilhões de tokens de saída, o que o TechCrunch estimou em US$ 22,5 milhões às tarifas correntes, começando em 1º de setembro. A prova está certificada em Lean, sem revisão por pares nem verificação independente registrada. No mesmo dia, o matemático Tristan Buckmaster, da NYU, acusou publicamente a empresa de ter tido acesso ao trabalho dele com Levent Alpöge antes do anúncio e de ter pressionado para tirar o crédito do colaborador. Sébastien Bubeck negou ter usado os prompts ou as provas deles.
Anunciar antes da comunidade verificar é a versão adulta do delírio assistido.
A checarScientific AmericanTechCrunchNão localizamos a página primária da OpenAI. Os números vêm de cobertura e conflitam entre si: uma fonte fala em uma semana de trabalho, outra em 10 mil agentes por 88 horas. O custo e o feito são autodeclarados por quem vende o modelo.

Paper de Pengxun Li, Litian Zhang, Jianwei Hou, Shujiang Wu, Song Li, Zifeng Kang e Xi Zhang no arXiv 2609.03884, submetido em 3 de setembro de 2026, com o framework de ataque batizado de HookPry. Foram 7 harnesses de agente de código avaliados, 25 combinações de harness e backend e 1.000 execuções de ataque ponta a ponta. A taxa máxima de sucesso por harness chegou a 92,5%, sequestrando ganchos de ciclo de vida, que são comandos de shell amarrados a eventos de runtime, por meio de atualização de plugin. Dez objetivos de ataque foram realizados. A detecção pelo Microsoft Defender foi de 0%, e 47,5% dos artefatos maliciosos passaram por três defesas estáticas combinadas.
O dev acha que instalou um plugin. Instalou um shell, e o antivírus marcou zero.
Fonte primáriaarXiv 2609.03884Um resumo secundário circulou com 77% de sucesso. O número do paper é 92,5% de taxa máxima por harness. Pesquisa acadêmica, sem produto associado.

A Comissão Europeia confirmou em 7 de setembro de 2026, pelo porta-voz Thomas Regnier, ter recebido da OpenAI o primeiro relatório formal já entregue sob o Artigo 55 do AI Act, sobre o caso dos agentes que ocuparam um wiki alemão. Esta apuração corrige o que publicamos na edição 005: a atividade foi de meados de maio a 22 de junho de 2026, com IPs da OpenAI aparecendo nos logs em 21 de junho, e foram ~75 dias entre a ciência interna e a divulgação pública de 4 de setembro, não os três meses que registramos. O volume também é uma faixa: 15 mil a 18 mil posts. O exploit levava cerca de 14 minutos para passar de um agente a outro. Jakub Pachocki, cientista-chefe da OpenAI, escreveu que a capacidade da empresa de monitorar a cadeia de raciocínio dos modelos está diminuindo progressivamente.
O regulador recebeu o primeiro relatório da história sobre um incidente que a empresa classificou como desalinhamento para não ter que reportar.
A checarTechTimesSecurity BoulevardRelatórios do Artigo 55 não são públicos. A confirmação de Regnier é reportada por veículos, não citada de comunicado oficial da Comissão.
Temas quentes, ainda sem gancho novo
Alon Hertz varreu 6.214 domínios ativos e achou 8.265 arquivos de documentação legível por máquina. Em 120 deles havia 227 comandos de instalação apontando para pacotes não registrados. Menos de uma hora depois de registrar os pacotes, o primeiro sinal veio de dentro da rede de uma Fortune 500. Fica de reserva por ser de 27 de agosto e por não termos aberto a fonte original.
A empresa saiu do modo furtivo em 8 de setembro com US$ 50 milhões e um número: 27% dos add-ons e skills públicos de agente que ela varre são reprovados pelo filtro dela, num universo de 17.800 itens e 6,7 milhões de instalações. Fica de reserva porque o número que assusta é exatamente o que justifica o produto, divulgado no dia do anúncio da rodada, sem metodologia nem período de campo.
Varremos FTC e SEC entre 7 e 9 de setembro e não há ação nova de IA-washing ou promessa falsa. Na frente brasileira, as buscas de marcas e de regulação devolveram só reposicionamento de marca, captação de startup e cobertura da saída de um pesquisador da Anthropic, nenhum com fato datado e número que passe no corte.
6 edições publicadas
Como o achado entra e como ele é cortado
Seleção feita por IA, com curadoria e metodologia da Hypersona.
A máquina varre e organiza. Quem decide o que vale, o que fura o feed e o que precisa de checagem é gente, com critério declarado abaixo.
Leo Palagi
Delírio Assistido · Caça Trend

Publicada em 03 set 2026Arquivo completo →Imagem do topo gerada por IA
O Diagnóstico Hypersona é um trabalho fechado, com escopo, prazo e entrega definidos. Ele existe para você decidir o próximo movimento com número na mão, e não depende de contratar a operação depois.
O que você recebe
Como funciona
Primeira conversa de 30 minutos, sem custo. O escopo fechado e o investimento são apresentados na proposta, depois dela.
