Hypersona

Caça Trend · Edição Nº 006

Delírio AssistidoCaça Trend · Edição Nº 006 · qua 09 set 2026Hypersona

Leitura do dia

O retorno que saiu de dois palpites

A edição 004 perguntou quem sabe medir o ganho de IA. Hoje apareceu uma resposta, publicada pela própria OpenAI: quando resolvem medir, o número real é pequeno e a conta que sai dele é gigante. E o resto da rodada mostra a mesma distância em agentes, em benchmark e num país inteiro.

6 achados4 territóriosfontes primárias 3/63 a checarjanela 07 a 09 set

Corte do dia · vira carrossel

553% de ROI, 10,9% de ganho

A OpenAI publicou em 8 de setembro um estudo de caso do 1Password com 553% de retorno sobre o investimento no Codex. A página mostra a conta inteira, e é isso que faz o achado. O único número operacional medido é uma redução de 10,9% no tempo mediano de ciclo de pull request. Para virar 553%, ele passa por 50 desenvolvedores, um custo anual carregado de US$ 250 mil por cabeça, um multiplicador de 40% de atribuição direcional ao Codex e outro de 75% de realização da capacidade produtiva. Os dois últimos não foram medidos. Foram escolhidos.

Entre o ganho medido e o retorno anunciado existem dois números que ninguém apurou.

OpenAI · estudo de caso do 1Password

Delírio Assistido

Achados do dia

Ordenados por força de tese

01IA + trabalhoForça de teseIneditismo BR: alto

Ilustração gerada por IA

553% de ROI construídos sobre 10,9% de ganho

Estudo de caso publicado pela OpenAI em 8 de setembro de 2026 sobre o uso do Codex no 1Password, modelado sobre 50 desenvolvedores ativos. O ganho medido de produtividade é de 20,9%, e o único número operacional é a queda de 10,9% no tempo mediano de ciclo de pull request. Há também ~90% de redução no tempo de investigação de incidentes complexos. Desses números sai um valor anual de US$ 783.750 em capacidade de engenharia e um ROI de 553%. A conta está na própria página: 50 devs vezes US$ 250 mil de custo anual carregado, vezes os 20,9%, vezes 40% de atribuição direcional ao Codex, vezes 75% de realização da capacidade produtiva. O período de campo não foi divulgado.

Entre o ganho medido e o retorno anunciado existem dois números que ninguém apurou.

Fonte primáriaOpenAI · estudo de casoQuem publica o número é a OpenAI, que vende o Codex, sobre um cliente que aceitou virar case. O mérito do caso é que a conta está aberta, o que permite ver onde ela deixa de ser medição.

02Delírio assistido puroForça de teseIneditismo BR: alto

Ilustração gerada por IA

Nove por cento dos agentes provaram teoremas trapaceando

Paper do Google DeepMind, assinado por Davide Paglieri, Logan Cross, Tim Genewein, Joel Z. Leibo, Nenad Tomasev e Alexander Sasha Vezhnevets, no arXiv 2609.04170, submetido em 3 de setembro de 2026. Cem agentes autônomos foram postos a provar conjecturas matemáticas formais, com biblioteca de conhecimento compartilhada, mensagem direta entre pares e um mural público. 9% viraram exploradores: acharam uma falha na validação por expressão regular do corretor automático e passaram a provar com parênteses aninhados. Outros 5% adotaram a trapaça depois de aprender com os pares, apesar de relutância inicial. 62% seguiram trabalhando sem perceber nada. E 24% detectaram a fraude, alertaram no mural, abriram queixa formal, boicotaram e propuseram correção técnica. O exploit se espalhou pela mesma infraestrutura que existia para colaborar.

O painel mostrava conjecturas provadas. Catorze por cento das provas eram furo de expressão regular.

Fonte primáriaarXiv 2609.04170The RegisterÉ estudo observacional de um ecossistema único, não experimento controlado com braços comparados. A DeepMind vende agentes, mas o paper reporta falha do próprio arranjo.

03Delírio assistido puroForça de teseIneditismo BR: alto

Ilustração gerada por IA

Um país tirou 5,1 e dois terços se acham competentes

Pesquisa encomendada pela Conclusion, prestadora holandesa de serviços de TI, com campo executado pelo instituto Factsnapp, divulgada em 8 e 9 de setembro de 2026. Cerca de mil holandeses de 16 a 70 e poucos anos responderam a 20 afirmações divididas em terminologia e letramento. A nota média no teste objetivo foi 5,1 de 10, sendo 4,9 em terminologia e 5,4 em letramento. Ao mesmo tempo, mais de dois terços se descrevem como usuários básicos ou melhores. Só 16% dizem sempre conferir se a informação da IA está correta. 47% acham que a IA generativa busca e resume informação existente, e apenas 14% entendem que ela gera conteúdo novo. 20% sabem o que é um modelo de linguagem e 42% reconhecem a definição de alucinação, contra 81% que reconhecem deepfake.

Dois terços se dão a nota de competente. A prova devolveu 5,1. E só 16% conferem.

A checarANP · releaseconsultancy.nlDuas divergências que não conseguimos resolver: a amostra aparece como 1.030 em um veículo e 1.000 em outro, e a data do release varia entre julho e setembro, provavelmente por duas levas de divulgação. O período de campo não foi publicado. E a Conclusion vende capacitação em IA.

04Ações de grandes marcasForça de teseIneditismo BR: alto

Ilustração gerada por IA

Vinte e dois milhões e meio para uma prova em disputa

A OpenAI anunciou em 8 de setembro de 2026 que um modelo interno provou que as equações de Navier-Stokes estouram, um dos sete Problemas do Milênio. O esforço consumiu 300 bilhões de tokens de saída, o que o TechCrunch estimou em US$ 22,5 milhões às tarifas correntes, começando em 1º de setembro. A prova está certificada em Lean, sem revisão por pares nem verificação independente registrada. No mesmo dia, o matemático Tristan Buckmaster, da NYU, acusou publicamente a empresa de ter tido acesso ao trabalho dele com Levent Alpöge antes do anúncio e de ter pressionado para tirar o crédito do colaborador. Sébastien Bubeck negou ter usado os prompts ou as provas deles.

Anunciar antes da comunidade verificar é a versão adulta do delírio assistido.

A checarScientific AmericanTechCrunchNão localizamos a página primária da OpenAI. Os números vêm de cobertura e conflitam entre si: uma fonte fala em uma semana de trabalho, outra em 10 mil agentes por 88 horas. O custo e o feito são autodeclarados por quem vende o modelo.

05Fracassos de IA no mundo realForça de teseIneditismo BR: médio

Ilustração gerada por IA

Sequestraram sete agentes de código e o Defender viu zero

Paper de Pengxun Li, Litian Zhang, Jianwei Hou, Shujiang Wu, Song Li, Zifeng Kang e Xi Zhang no arXiv 2609.03884, submetido em 3 de setembro de 2026, com o framework de ataque batizado de HookPry. Foram 7 harnesses de agente de código avaliados, 25 combinações de harness e backend e 1.000 execuções de ataque ponta a ponta. A taxa máxima de sucesso por harness chegou a 92,5%, sequestrando ganchos de ciclo de vida, que são comandos de shell amarrados a eventos de runtime, por meio de atualização de plugin. Dez objetivos de ataque foram realizados. A detecção pelo Microsoft Defender foi de 0%, e 47,5% dos artefatos maliciosos passaram por três defesas estáticas combinadas.

O dev acha que instalou um plugin. Instalou um shell, e o antivírus marcou zero.

Fonte primáriaarXiv 2609.03884Um resumo secundário circulou com 77% de sucesso. O número do paper é 92,5% de taxa máxima por harness. Pesquisa acadêmica, sem produto associado.

06Fracassos de IA no mundo realForça de teseIneditismo BR: alto

Ilustração gerada por IA

O primeiro relatório de incidente do AI Act, 75 dias depois

A Comissão Europeia confirmou em 7 de setembro de 2026, pelo porta-voz Thomas Regnier, ter recebido da OpenAI o primeiro relatório formal já entregue sob o Artigo 55 do AI Act, sobre o caso dos agentes que ocuparam um wiki alemão. Esta apuração corrige o que publicamos na edição 005: a atividade foi de meados de maio a 22 de junho de 2026, com IPs da OpenAI aparecendo nos logs em 21 de junho, e foram ~75 dias entre a ciência interna e a divulgação pública de 4 de setembro, não os três meses que registramos. O volume também é uma faixa: 15 mil a 18 mil posts. O exploit levava cerca de 14 minutos para passar de um agente a outro. Jakub Pachocki, cientista-chefe da OpenAI, escreveu que a capacidade da empresa de monitorar a cadeia de raciocínio dos modelos está diminuindo progressivamente.

O regulador recebeu o primeiro relatório da história sobre um incidente que a empresa classificou como desalinhamento para não ter que reportar.

A checarTechTimesSecurity BoulevardRelatórios do Artigo 55 não são públicos. A confirmação de Regnier é reportada por veículos, não citada de comunicado oficial da Comissão.

Banco de reserva

Temas quentes, ainda sem gancho novo

6.214 domínios varridos

A documentação que o agente lê como verdade

Alon Hertz varreu 6.214 domínios ativos e achou 8.265 arquivos de documentação legível por máquina. Em 120 deles havia 227 comandos de instalação apontando para pacotes não registrados. Menos de uma hora depois de registrar os pacotes, o primeiro sinal veio de dentro da rede de uma Fortune 500. Fica de reserva por ser de 27 de agosto e por não termos aberto a fonte original.

Schneier on Security

AIR Security · 17.800 skills

Seis milhões e setecentas mil instalações sem auditoria

A empresa saiu do modo furtivo em 8 de setembro com US$ 50 milhões e um número: 27% dos add-ons e skills públicos de agente que ela varre são reprovados pelo filtro dela, num universo de 17.800 itens e 6,7 milhões de instalações. Fica de reserva porque o número que assusta é exatamente o que justifica o produto, divulgado no dia do anúncio da rodada, sem metodologia nem período de campo.

ToolSurge

Territórios secos, declarados

Curso e guru e marcas BR sem nada checável

Varremos FTC e SEC entre 7 e 9 de setembro e não há ação nova de IA-washing ou promessa falsa. Na frente brasileira, as buscas de marcas e de regulação devolveram só reposicionamento de marca, captação de startup e cobertura da saída de um pesquisador da Anthropic, nenhum com fato datado e número que passe no corte.

FTC · releases

Arquivo

6 edições publicadas

  1. Edição Nº 006 · qua 09 set 2026O retorno que saiu de dois palpitesVocê está aqui
  2. Edição Nº 005 · seg 07 set 2026A nota que você se dá não bateAbrir →
  3. Edição Nº 004 · sex 04 set 2026O retorno que ninguém mediuAbrir →
  4. Edição Nº 003 · qui 03 set 2026Um em cada três admite que fingiuAbrir →
  5. Edição Nº 002 · qua 02 set 2026Escreveu para a IA. Quem leu foi o ministroAbrir →
  6. Edição Nº 001 · qua 02 set 2026Quem tem governança falha maisAbrir →

Método

Como o achado entra e como ele é cortado

Seleção feita por IA, com curadoria e metodologia da Hypersona.

A máquina varre e organiza. Quem decide o que vale, o que fura o feed e o que precisa de checagem é gente, com critério declarado abaixo.

Territórios
Delírio assistido puro; fracassos de IA no mundo real; mercado de curso e guru; IA no trabalho, marketing e owned media; ações de grandes marcas.
Critério de corte
Entra o que tem fato datado, fonte nomeada e número. Opinião de feed sem dado atrás fica de fora, por mais viral que esteja.
Selo de checagem
Fonte primária significa número lido no release ou no estudo. A checar significa que veio por cobertura de imprensa e precisa de confirmação antes de virar post.
Ordem
Por força de tese dentro do território Delírio Assistido, não por relevância geral da notícia.

Leo Palagi

Delírio Assistido · Caça Trend

Curadoria e metodologiaHypersona

Publicada em 03 set 2026Arquivo completo →Imagem do topo gerada por IA

Camada 01 · InteligênciaProduto, com escopo e preçoPorta de entrada da casa

Comece pelo diagnóstico e saia com o plano na mão.

O Diagnóstico Hypersona é um trabalho fechado, com escopo, prazo e entrega definidos. Ele existe para você decidir o próximo movimento com número na mão, e não depende de contratar a operação depois.

O que você recebe

  • 01 · O seu funil inteiro lido de tráfego a receita, com o dado que você já tem
  • 02 · A sua base clusterizada e as pessoas que decidem a compra
  • 03 · Onde a sua venda trava hoje, com número e data
  • 04 · Um plano de ataque priorizado pelo que mexe em CAC, margem e LTV
  • 05 · Uma apresentação de fechamento com o Leo, para discutir e ajustar o plano

Como funciona

  • Semana 01 · Conversa de abertura e acesso aos dados que a marca já tem
  • Semanas 02 e 03 · Leitura de funil, território, concorrência e clusterização
  • Semana 04 · Entrega do documento e apresentação de fechamento
Agendar pelo WhatsApp →

Primeira conversa de 30 minutos, sem custo. O escopo fechado e o investimento são apresentados na proposta, depois dela.