Modo IA: 400 pessoas, 5 demos, 1 pergunta em comum

400 pessoas, 5 demos, 1 pergunta em comum

Semana passada eu fui no meetup da comunidade Claude em São Paulo. O formato é direto: uma keynote da Anthropic Brasil, cinco demos de gente que construiu coisa real, Q&A entre elas e networking no fim. A lógica do evento é deixar quem botou a mão na massa mostrar o que fez.

Alguns números pra dar a dimensão:

  • Foram mais de 4.500 inscritos pra cerca de 400 lugares
  • 75 propostas de demo pra 5 vagas.
  • Um terço da sala não era técnica, um terço era de mulheres
  • Dois terços já usam Claude todo dia. No primeiro evento desse tipo, no começo do ano, esse último número era um terço.

O que a abertura mostrou

A keynote ancorou a noite numa curva. Existe um benchmark que mede a capacidade dos modelos pelo tempo que um humano levaria pra fazer a mesma tarefa. No começo de 2025, os modelos davam conta sozinhos de tarefas de 10 minutos. No começo de 2026, de uma hora e dez. Hoje, com o modelo mais recente da fronteira, passa de 3 horas.

Tamanho da tarefa que o modelo dá conta sozinho, medido pelo tempo que um humano levaria

início de 2025
  10 min
início de 2026
  1h10
hoje
  3h+

Do lado do custo, modelos de mesma capacidade ficam 10 vezes mais baratos por ano. Na prática, todo ano você escolhe entre um modelo 10 vezes mais inteligente ou o mesmo modelo 10 vezes mais barato.

O que apareceu nas demos

As cinco eram bem diferentes entre si, e é isso que fez o padrão aparecer depois:

  • Gestão de crise por WhatsApp. Um palco caiu na área VIP de uma festa de 6 mil pessoas, na madrugada de sexta pra sábado, com mais de 300 pessoas afetadas e uma fila de atendimento que chegou a 23 horas de espera. O fundador e o sócio, nenhum dos dois programador e sem engenheiro disponível no fim de semana, montaram o atendimento inteiro conversando com o Claude. Resposta em 2 segundos, triagem por urgência, comprovante personalizado. R$100 mil reembolsados e NPS +54, depois de um palco cair.
  • Um projeto open source tocado por uma pessoa só. Uma alternativa open source ao NotebookLM, criada como hobby, chegou a 35 mil estrelas no GitHub. O criador quase perdeu a comunidade porque o volume não cabia em uma pessoa: 1.200 tickets, 3 mil pessoas no Discord, 62 contribuidores externos com código pra revisar. Hoje o Claude faz a triagem, o review e o atendimento. Faz mais de um ano que ele não escreve código, mas a decisão de release continua sendo dele.
  • Uma operação logística descoberta pelo WhatsApp. Uma indústria grande tocava a logística inteira por 40 grupos de WhatsApp. O time usou o Claude pra mapear a operação do zero, sem receber uma linha de documentação, e depois transformou cada mensagem solta em evento auditável numa timeline. A informação ali ficava 24 horas à frente do ERP, porque a verdade estava nas mensagens antes de alguém registrar no sistema.
  • Uma empresa de 10 pessoas rodando software próprio. CRM, ERP, módulo financeiro e health score de cliente, tudo construído com Claude, numa empresa de educação inclusiva que já impactou 18 mil estudantes.

A pergunta que se repetiu

Demos assim diferentes deveriam ter pouco em comum. Mas em quase todas, quando alguém do público perguntava como eles sabiam que aquilo estava funcionando, a resposta ia pro mesmo lugar: eles tinham escrito antes o que era um bom resultado.

Essa foi a ideia que eu mais levei da noite, e ela tem nome técnico feio (eval), então deixa eu explicar do jeito que ela funciona no dia a dia.

Como você sabe que ficou bom?

Pensa numa coisa que você já pede pra IA toda semana. Um resumo de reunião, digamos.

Você pede, lê, acha que ficou bom. Na semana seguinte você mexe no pedido, lê de novo, acha que ficou melhor. Repara no verbo: você achou. Sem um critério escrito em algum lugar, a única régua disponível é a sua impressão daquele dia, que muda conforme seu humor e o quanto você está com pressa.

Sem critério escrito, você não está melhorando o resultado, está trocando um resultado por outro.

A saída é escrever o gabarito antes. No caso do resumo de reunião, pode ser algo tão simples quanto três linhas num arquivo:

gabarito-resumo-de-reuniao.md

Cita todas as decisões que foram tomadas 0 a 5
Diz quem ficou responsável por cada próximo passo 0 a 5
Cabe em 10 linhas 0 a 5

Aí você roda e dá as notas. Da próxima vez que mexer no pedido, roda de novo e compara. Leva uns 10 minutos pra montar e resolve o problema de estar iterando no escuro.

O time que constrói um assistente pra médico recém-formado de plantão levou essa ideia ao limite, e faz sentido: ali o erro custa vida. Eles montaram um benchmark próprio pro sistema de busca e passaram a otimizar contra ele. A prova de que funcionou foi elegante: subiram a versão nova sem avisar ninguém, e os médicos, que antes reclamavam da busca, começaram a elogiar sozinhos. Ninguém perguntou se tinha melhorado. Eles perceberam.

Essa mesma demo abriu com dois dados que me parecem explicar boa parte do fracasso das iniciativas de IA:

  • MIT: 95% dos projetos de IA iniciados em 2025 foram abandonados.
  • Microsoft Research: quanto mais confiamos numa IA, menor fica o nosso senso crítico.

Junta os dois e o modo de falha aparece. As pessoas param de checar bem no momento em que a ferramenta começa a funcionar, e acabam construindo coisas que ninguém consegue avaliar. O gabarito devolve um humano ao processo justamente quando ele tende a sair.

O que mais me marcou

Teve um detalhe que passou meio despercebido e que eu fiquei pensando no caminho de volta. Em todas as cinco demos, um humano dava a palavra final.

  • O criador do open source testa cada release.
  • A empresa de 10 pessoas trabalha só na exceção.
  • O time do assistente médico decide o trade-off entre qualidade, custo e latência.

O discurso lá fora é que os agentes rodam tudo. A prática que eu vi na sala é que os agentes rodam tudo até a decisão que importa. Vale lembrar disso quando alguém te vender autonomia total.

Pra testar essa semana: pega uma entrega sua que se repete, escreve 3 critérios com nota de 0 a 5 num arquivo, e deixa a IA iterar contra eles. Você provavelmente vai descobrir que a parte difícil era saber o que “bom” significava.


Gostou? Encaminha para alguém que também curtiria. A Modo IA cresce no boca a boca. Cada indicação ajuda a continuar produzindo conteúdo gratuito toda semana.

É só encaminhar esse email ou mandar o link: modo-ia.beehiiv.com

Valeu pela confiança.