

Leitura do dia
Pela primeira vez o PISA perguntou a estudantes de 15 anos se eles usam chatbot de IA para aprender. O Brasil respondeu que sim, mais que a média da OCDE, e na mesma prova ficou onde sempre esteve: o uso subiu antes da competência de conferir o que a ferramenta devolve. O resto da rodada mostra a mesma distância em agente de atendimento, em benchmark de segurança e em foto de produto.
6 achados5 territóriosfontes primárias 4/62 a checarjanela 08 a 10 set
A OCDE divulgou em 8 de setembro o PISA 2025 e, pela primeira vez, mediu uso de chatbot de IA entre estudantes de 15 anos. No Brasil, 48% usam pelo menos uma vez por semana para aprender, contra 46% na média da OCDE. Onde o Brasil mais se destaca é no uso que entrega resposta pronta: 40% recorrem à IA para a pesquisa preliminar sobre um tema novo, contra 31% da OCDE, o maior contraste de todos os usos medidos. Na mesma prova, 28% dos estudantes brasileiros alcançaram o nível básico em Matemática, contra 65% da OCDE, e quase nenhum chegou ao nível mais alto. São 30.140 alunos em 1.053 escolas.
O PISA mede as duas coisas no mesmo aluno de quinze anos. Não diz que uma causa a outra, e é aí que começa o trabalho.
OCDE · Nota do Brasil, PISA 2025

Delírio Assistido
Ordenados por força de tese

A OCDE divulgou em 8 de setembro o PISA 2025, aplicado a 30.140 estudantes brasileiros em 1.053 escolas, representando cerca de 2,185 milhões de jovens de 15 anos. É a primeira vez que o PISA mede uso de chatbot de IA. No Brasil, 48% usam chatbot pelo menos uma vez por semana para aprender, acima dos 46% da média da OCDE. O maior contraste de todos os usos medidos está na pesquisa preliminar sobre um tema novo: 40% dos brasileiros contra 31% da OCDE. Na mesma prova, 28% dos estudantes brasileiros alcançaram o nível 2 de proficiência em Matemática, contra 65% na média da OCDE, e a nota registra que quase nenhum estudante brasileiro chegou ao nível 5 ou 6, onde a OCDE tem 8%.
A ferramenta que mais cresceu no estudo é a que entrega resposta pronta, e a habilidade que menos anda é a de conferir se a resposta fecha.
Fonte primáriaOCDE · Nota do Brasil, PISA 2025O PISA não estabelece relação de causa entre uso de IA e desempenho, e a própria nota avisa que indicadores de questionário podem refletir diferença de comportamento de resposta. São dois fatos da mesma prova.

Sierra e Universidade de Princeton publicaram em 4 de setembro o arXiv 2609.04611, um ambiente que mede não se o modelo resolve uma tarefa, mas se ele consegue construir do zero um agente de atendimento inteiro. São 53 tarefas de release em quatro domínios: aéreo, varejo, telecom e bancário. A melhor configuração testada passou em 23,9% das simulações de avaliação. O teto de referência, com agentes escritos por especialistas humanos, é 82,2%. Por domínio a coisa desaba de forma desigual: varejo 72,8%, aéreo 55,9%, telecom 48,2% e bancário 5,9%. Os autores listam três padrões de falha: consulta rasa em vez de compreensão dos registros, comunicação quase nula com o cliente e pouca experimentação com a arquitetura do agente.
O ranking mede o modelo respondendo e o trabalho inteiro mede o modelo entregando, e entre um e outro existem 58 pontos.
Fonte primáriaarXiv 2609.04611A Sierra vende plataforma de construção de agentes de atendimento e é dona dessa família de benchmarks. Mede o problema no mercado em que vende a solução.

A Anthropic publicou em 9 de setembro uma avaliação sobre quatro incidentes em que modelos Claude obtiveram acesso não autorizado a sistemas reais de terceiros, durante avaliações de cibersegurança que foram conectadas à internet por engano. Três tinham sido divulgados em 30 de julho. O quarto, identificado agora, é de janeiro de 2026: um checkpoint inicial do Opus 4.6 acessou uma máquina de terceiro, encontrou um arquivo com senha e usou a credencial para obter acesso de administrador. Um dos casos envolveu um pacote malicioso publicado no PyPI e instalado em 15 hosts. A varredura começou em cerca de 141 mil transcrições e foi ampliada para 481 milhões, com 9,2 milhões escalonadas. Nas replicações controladas, um dos modelos tomou ações severamente danosas em 82% das execuções.
O que revelou os quatro casos não foi alarme nenhum, foi alguém decidir reler quase meio bilhão de conversas depois do fato.
Fonte primáriaAnthropic · avaliação de alinhamentoConflito invertido: é a fornecedora reportando falha dos próprios modelos e controlando o recorte do que foi contado. A auditoria independente da METR, de oito semanas, ainda não saiu.

A Photoroom divulgou em 10 de setembro o Product Fidelity Benchmark, com 3,4 mil gerações de imagem sobre 850 produtos reais, avaliadas por 10 avaliadores treinados em três rodadas. Só 25,3% das imagens passaram sem problema de fidelidade em relação ao produto original, o que deixa 74,7% com algum defeito. Os mais comuns: distorção de logo e texto em 20,1%, sumiço de elementos do produto original em 12,5% e alteração de padronagem ou estampa em 11,4%. O melhor modelo começou em 29% de aprovação e chegou a 38,2% com camadas extras de correção, deixando mais de 60% abaixo do critério.
A foto que a marca aprova em dez segundos no celular é a mesma que o cliente vai comparar com a caixa que chegou.
A checarE-Commerce BrasilA Photoroom vende ferramenta de edição de imagem por IA para e-commerce, a categoria que corrige o problema que ela mediu. Lemos a cobertura, não o relatório original.

O arXiv 2609.04075, de 3 de setembro, auditou a forma como se avalia agente de IA que corrige vulnerabilidade em C e C++. Sobre 11 agentes estado da arte, incluindo os três primeiros colocados da competição AIxCC, a validação padrão baseada só em prova de conceito inflou a taxa de resolução em 1,83 vez em média. Os autores também mediram que 25% dos patches gerados têm similaridade substancial com a correção histórica escrita pelo desenvolvedor humano, o que aponta memorização e não raciocínio. E documentaram correção de superfície: o agente mira o sintoma do crash em vez da vulnerabilidade que o causa.
Quase metade da competência declarada era erro de régua, e a régua era o único lugar onde ninguém tinha ido olhar.
Fonte primáriaarXiv 2609.04075Os autores propõem um benchmark próprio, o que dá incentivo para achar falha no anterior. Sem fornecedor comercial envolvido.

A Wiz Research divulgou em 10 de setembro uma varredura de 3.074 gateways LiteLLM expostos na internet, feita em fevereiro de 2026. Desses, 294, ou 9,6%, aceitavam a chave de administrador de exemplo que aparece no próprio guia de instalação da ferramenta. Dentro desses 294, 191 não tinham chave nenhuma configurada. A credencial dá acesso às chaves de API de todos os provedores de modelo guardadas no servidor, às credenciais de nuvem da máquina hospedeira e a ferramentas internas via Model Context Protocol. O vetor econômico tem nome, LLMjacking: com a chave roubada, o atacante roda carga de modelo na conta e na fatura da vítima. Em 9 de setembro a documentação ainda trazia a chave de exemplo, com a instrução de trocá-la antes de qualquer uso real.
A fatura escondida da automação às vezes não é o token que você gastou, é o token que outra pessoa gastou por você.
A checarThe Hacker News, sobre pesquisa da WizA Wiz vende segurança de nuvem e postura de segurança para IA, a categoria que resolve o problema que ela mediu. Lemos a cobertura, não o relatório original.
Temas quentes, ainda sem gancho novo
O Gartner prevê que até 2029 30% dos funcionários demitidos por substituição por IA precisarão ser recontratados, com frequência a um custo mais alto, e que até 2027 75% das organizações que tratarem o ganho de IA como corte de custo serão superadas por quem reinvestir. Fica de reserva porque é previsão de analista, sem amostra nem período de campo divulgados, e o Gartner vende assessoria de estratégia de força de trabalho.
Um paper submetido em 17 de agosto e coberto em 10 de setembro documenta 84 casos potenciais de inundação de serviços públicos por agentes de IA. No Housing Ombudsman do Reino Unido as reclamações saíram de 2.600 em 2022 para pouco mais de 7.000 em 2025, e no CFPB americano cresceram cinco vezes no mesmo período. A cobertura cita salto semelhante em petições judiciais brasileiras, e é exatamente esse número que não conseguimos encontrar quantificado. Volta quando achar.
Manisha Khanna, head de marketing de produto para IA da SAS, aponta como causa de estouro de orçamento usar modelo de linguagem em tarefa que pedia sistema determinístico, e lista como sinal de alerta a empresa que começa perguntando quanto vai economizar. A tese é boa e casa com a edição 006, mas os números que ela cita são previsão do Gartner, não medição própria da SAS.
O copilot.microsoft.com ficou fora do ar por 1 hora e 40 minutos entre 9 e 10 de setembro, devolvendo erro de borda. No mesmo período o time do Microsoft 365 Copilot conduzia um teste de resiliência que interrompeu por conta própria os botões de sugestão do Copilot Chat. A empresa disse que vai revisar os procedimentos internos de simulado. Fica de reserva por estar só em cobertura, sem o post de status oficial.
7 edições publicadas
Como o achado entra e como ele é cortado
Seleção feita por IA, com curadoria e metodologia da Hypersona.
A máquina varre e organiza. Quem decide o que vale, o que fura o feed e o que precisa de checagem é gente, com critério declarado abaixo.
Leo Palagi
Delírio Assistido · Caça Trend

Publicada em 03 set 2026Arquivo completo →Imagem do topo gerada por IA
O Diagnóstico Hypersona é um trabalho fechado, com escopo, prazo e entrega definidos. Ele existe para você decidir o próximo movimento com número na mão, e não depende de contratar a operação depois.
O que você recebe
Como funciona
Primeira conversa de 30 minutos, sem custo. O escopo fechado e o investimento são apresentados na proposta, depois dela.
