Episódios de IA Sob Controle - Inteligência Artificial

289: Discursos sobre IA na ONU, sucesso do Meta Muse, limites menores no Claude

25 de setembro de 20261h41min
0:00 / 1:41:05

Sexta-feira é dia de repercutir as principais notícias da semana, no mundo da IA. Vem ver quem participou desse papo:

Links:

Garanta seu ingresso para o IA Conference Brasil 2026, que acontece em 24 de setembro em São Paulo.

TechGuide.sh, um mapeamento das principais tecnologias demandadas pelo mercado para diferentes carreiras, com nossas sugestões e opiniões.

Inscreva-se na Newsletter IA Sob Controle, e receba notícias semanais sobre Inteligência Artificial, assinada por Fabrício Carraro.

Preencha o formulário com as suas sugestões para deixar o conteúdo do IA Sob Controle ainda mais interessante.

Edição e sonorização: Rede Gigahertz de Podcasts

00:00:00 - Olá!

00:00:35 - IA Conference Brasil 2026

00:02:18 - Entrevista: Anderson Soares

00:03:31 - Enquete: Invasões?

00:04:25 - SAFA e ONU

00:14:30 - OpenAI

00:29:55 - Anthropic

00:45:00 - Google

00:53:05 - Meta

01:01:20 - Microsoft

01:04:58 - Cantinho multimídia

01:09:28 - Cantão da China

01:17:13 - Rapidinhas da semana

01:27:47 - Estudos da semana

01:39:30 - Obrigado!

Participantes neste episódio2
M

Marcus Mendes

Host
F

Fabrício Carraro

Co-hostViajante poliglota
Assuntos12
  • Colaboração entre Google, OpenAI e Anthropic para segurança de IAcriação do SAFA·testes cruzados de modelos·regulação e segurança
  • Lançamento e precificação dos modelos GPT-6 Sol e Luna da OpenAIqueda considerável de preço·melhora de qualidade·custo por inteligência
  • Lançamento do Claude Opus 5.5 e suporte a Agents.mdaumento de limite de tokens·melhora na escrita e benchmarks·preço mais acessível
  • Sucesso do Meta Muse e lançamento de novos hardwaresaplicativo mais baixado·vulnerabilidade corrigida·lançamento do Meta Charm
  • Testes práticos do JEV e sua aplicação em classificadoresclassificador de contexto geral·comparação com o Laia·uso como camada intermediária
  • Discursos de CEOs de IA na ONU sobre regulação e riscosSam Altman e Dario Amodei·Trump e a Super Intelligence·Lula defende regulação de Big Techs
  • Ataques de agentes de IA da OpenAI e novas iniciativasinvasão de site australiano·oferta de IA para Ucrânia·colaboração com matemáticos
  • Invasão acidental do Google e testes do Gemini 4 Promodelo Gemini invadiu empresas·treinamento do Gemini 4 Pro·vazamento de benchmarks
  • Lançamento do Nemotron 3 Diarization da NVIDIA para identificação de vozmelhora na identificação de falantes·suporte a múltiplos idiomas·uso em transcrição
  • Polêmica com Zhi AI e lançamento do Xiaomi Mi Mo V2.6envio de dados sem consentimento·modelos open source da Xiaomi·desempenho em benchmarks
  • Regulamentação de companions de IA no Brasil e serviço militar na Coreia do Sulriscos para crianças e jovens·obrigações militares para talentos de IA·exceções para pesquisa
  • Estudo sobre o eixo da dor em LLMs e seus comportamentosmodelos sentem dor·comportamento vingativo·ativações de medo
Transcrição82 segmentosassemblyai/universal-3-5-pro
MMMarcus Mendes

Olá, bem-vindas e bem-vindos à edição de sexta-feira do Resumão de Notícias do IA Sob Controle, o seu podcast com overfitting de informações sobre o mundo da inteligência artificial. Eu sou o Marcos Mendes e assim como toda semana tá por aqui o Fabrício Carraro, viajante poliglota, host do podcast Carreiras Sem Fronteiras, autor da newsletter IA Sob Controle, link na descrição se você não recebe ainda, e Program Manager da Alura. Fabrício, já tô com saudade de novo.

FCFabrício Carraro

E aí, pessoal? E aí, Marcos? Também, também. A gente se viu ontem aqui no grande IA Conference Brasil 2026. Cansou, viu, Marcos? Foi um dia extremamente intenso. Acho que tipo das, sei lá, 6, 7 horas da manhã até as 7, 8 horas da noite. Mas foi excelente, foi maravilhoso encontrar vocês pessoalmente, bater esse papo, dar um abraço, assinar livros. Eu tô com tendinite até agora, tanto assinar livro lá do meu livro. Quem não conhece, link vai estar na descrição aí da Casa do Código.

Mas foi uma experiência excelente, maravilhosa estar com vocês pessoalmente. É uma coisa que, por eu estar longe, eu acho que eu valorizo até mais do que o pessoal que tá aqui normalmente, né, que eu posso vir poucas vezes por ano para o Brasil e ter esse contato mais pessoalmente. Palestrei também, né, além de participar da curadoria, da organização do evento. E espero que vocês tenham gostado. Quem esteve lá também pode deixar um recadinho ali na caixa de comentários do Spotify, que eu quero saber o que que vocês acharam, o que que vocês gostaram mais, qual palestra curtiram mais.

MMMarcus Mendes

Enfim, sim, olha, essa foi aí a conferência mais legal que a gente já fez até agora. A do ano que vem vai ser mais legal ainda, mas essa foi muito legal. As outras também foram, é claro, amamos todos igualmente, mas essa foi mó legal. E teve o esquema de a gente ter aqueles 3 palcos um ao lado do outro e aqueles lances de palestra silenciosa, né, com os hosts apresentando ali no microfone, só que sem reverberar pela sala. E aí cada um usava o fone de ouvido, escolhia o canal que queria ver da palestra.

Eu tive a honra de apresentar o Fabrício Carraro e outras pessoas em um dos palcos. Foi super legal ter esse contato também com o pessoal que tava lá, muitos ouvintes, muitas ouvintes do É Sob Controle. E eu aprendi horrores com as palestras que eu tive a sorte de ver, foi muito legal. E na última quarta-feira a gente publicou uma entrevista com o Anderson Soares, que é do CEIA, o Centro de Excelência em Inteligência Artificial da Universidade Federal de Goiás.

E a gente falou sobre o papel da IA no ensino, nas empresas, o papel do ensino e das empresas com a IA, e especificamente o Brasil, como é que fica nisso tudo. Foi um papo que eu também aprendi muito. Se você pulou, volte no feed, ficou bem legal.

FCFabrício Carraro

Sim, e o Anderson Soares é um dos grandes nomes do Brasil mesmo nessa questão da inteligência artificial. Também por estar lá no CEIA e tudo mais e falar a nível de governo mesmo, né, de palestrar e também ir lá no Congresso, nesse tipo de coisa. É uma pessoa que tá extremamente dentro desse mundo e também de como a gente pode olhar para os próximos passos daí no Brasil. E claro, já é um amigo do podcast, né, segunda vez que ele volta aqui.

Quem se interessar também, o papo de 2 anos atrás que a gente teve com ele fazer a comparação, né, escutar os dois, ver o que que ele falou lá e o que que ele falou agora, porque foram temas que a gente abordou com ele até, né, o que que mudou nesses 2 anos. Então foi bem legal.

MMMarcus Mendes

Exatamente, link na descrição. A gente perguntou para vocês algumas semanas: IAs que invadem outras empresas são puro marketing ou uma etapa da evolução? E Fabrício, o pessoal não tá levando muito a sério o que tá acontecendo não. Falou assim: puro marketing ganhou. 52% dos ouvintes disseram que IAs que invadem outras empresas são só marketing. E só 48% de vocês que estão escutando foram lá no Spotify e responderam que são uma etapa da evolução. Eu achava que por marketing ia ter bastante, mas não queria ser a maioria.

FCFabrício Carraro

Eu acho que tá bom, a divisão faz sentido até, mas é as duas coisas, né? Como é as duas coisas, tem o passo da evolução que é real, mas também tem a questão de marketing, porque para eles vale bem no final das contas falar, nossa, nós temos aqui uma coisa super poderosa e blá blá blá. Então O 50/50 que deu aí, quase 50/50, faz sentido.

MMMarcus Mendes

Exatamente. E vamos lá, falando nisso, a gente vai começar aqui com o segmento coletivo. Eu tentei achar um nome bacaninha para esse segmento, mas eu tava um pudim ontem à noite que eu tava fazendo a pauta. Então é a hora das notícias coletivas aqui das empresas de IA, porque elas todas evoluíram. Esse papo justamente que alguns acham que é marketing e outros acham que é uma etapa da evolução Porque saiu uma notícia do The Information dizendo que o Google, a OpenAI e a Anthropic estão próximas de anunciar que elas vão fazer um corpo de padrão de segurança de IA chamado SAFA, que é o Standards Authority Frontier AI, que pode ser anunciado no fim desse ano ou talvez no ano que vem.

Elas estão considerando até um CEO para poder ser o chefe, liderar esse grupo, que essencialmente seria uma forma dessas empresas, de forma independente, darem, elas fazerem testes cruzados dos modelos umas das outras, sem retenção de dados, sem, não seria para destilação, elas estão concordando, negociando como é que isso vai acontecer, mas é justamente para elas poderem fazer esse tipo de teste e tentar pegar antes que seja tarde demais outros problemas, tipo invasão, que pode ou não ser marketing.

Mas como isso vazou para o The Information, já deve estar mais próximo de um anúncio do que só bem uma coisa feita lá na frente no ano que vem. E eu imagino que uma vez que isso seja anunciado, aos pouquinhos outras empresas também passem a fazer parte. Mas inicialmente é Google, OpenAI e Anthropic.

FCFabrício Carraro

É, as outras que fariam parte disso seriam a Meta, e a SpaceX AI lá do Elon Musk, né, que seria o top 5, sei lá o quê, as empresas que estão nessa fronteira também e fazendo modelos privados. Porque as outras que fazem coisas assim geralmente fazem coisas abertas, né. A própria NVIDIA, por exemplo, solta modelos, modelos bons, os Neutron, só que são sempre modelos abertos. E isso é uma coisa que já estava sendo falada nos últimos, nas últimas semanas.

Lembra do, acho que foi uma ou duas semanas atrás talvez, Demis Hassabis fez um tweet lá, um post bonitão de temos que colaborar, temos que buscar a segurança. E aí veio um por um os CEOs das empresas, né, dando retweet basicamente, né. Eu concordo, eu também, mais um, não sei o quê. Então eles já estavam nessa pegada porque eles estão vendo que vai chegar em um momento que ou eles querem essa regulação, que também é uma coisa que faz sentido para eles, mas é vai ser bom para livrar a cara deles se eles tiverem uma outra empresa ou um centro, né, falando: opa, esse modelo tá ok, tá seguro, validado, pode ir.

Tipo uma Anvisa, como se fosse assim: se a Anvisa fala que tá tudo bem, a gente acredita que tá tudo bem. É basicamente essa história também, né?

MMMarcus Mendes

Exatamente. E nessa semana também o que aconteceu foi que tanto o Sam Altman quanto o Dario Moday discursaram lá no Conselho de Segurança da ONU. E a OpenAI publicou o discurso do Sam Altman. Me parece que o do Amodei ainda não foi publicado. E é muito engraçado o discurso, porque ele parece redação de uma primeira tentativa do ENEM sem muito estudo assim, porque é 90% é assim: ah, pode ser muito bom, mas pode ser muito ruim também.

Ela oferece riscos, mas ela oferece oportunidades. Então é perigoso, mas é bom. Ela pode dar empregos, mas pode tirar empregos. E fica nessa, ela tá, fala alguma coisa, né? Aí lá na frente, lá para o final, todo mundo cansado já, ele fala de 3 pontos que ele acredita que ele fala que concorda com o Yashobenjo sobre os riscos, mas também oportunidades. Mas tem 3 pontos que ele acha que a OpenAI, bom, que a OpenAI defende, né? Primeiro é que conforme ela fica mais capaz, as pessoas têm que permanecer no centro de decisões, o que não é exatamente uma ideia muito inovadora.

E quer falar, alinhamento não é uma pergunta muito abstrata de pesquisa. Isso é um trabalho sério, de verdade, para garantir que os sistemas sigam agindo sob o controle humano, com valores humanos. Não falou que há valores e valores, né? Em segundo lugar, ele falou também sobre os benefícios de pesquisa científica, benefícios econômicos, de oportunidade, que isso é uma coisa que tem que ser voltada para as pessoas e não para as empresas.

E ele, de novo, né, blá blá. E em terceiro lugar, ele falou que isso tem que ser uma coisa que dê poder para as pessoas de forma individual, não no coletivo, que elas também tenham um controle sobre o próprio futuro quando o assunto é inteligência artificial. Então, palavras bonitas. O que isso significa, ninguém sabe, porque é meio intangível. E o Amodei falou, ele falou um pouco mais a respeito da parte de, como ele geralmente fala, né, de preocupação e de risco, e de mais do que até de oportunidade.

Mas também tentou lá na frente falar de uma coisa um pouco mais positiva. E enfim, né, foi assim, todas as empresas falam sobre regular desse jeito amorfo, né. Não existe, você não vê muitas coisas práticas. Mas não sei se cabe a elas sugerir a parte prática. Mas além disso aí, assim, daria para ter pedido para o GPT-2 fazer o discurso do Sam Altman, que daria meio na mesma, sabe? Mas pelo menos eles entraram para discussão, o que mostra que eles sabem que mais cedo ou mais cedo alguma coisa vai acontecer, né?

FCFabrício Carraro

Não, e foi os advogados da OpenAI que escreveram isso daí, não foi o Sam Altman, não foi o Omoda falando do coração deles, o que eles acham. Foi literalmente os advogados falando: olha, aqui essa parte que você falou, vamos botar o contraponto e vamos escrever aqui bonitinho que a parte pode ser boa também, ou que a parte pode ser ruim também, né, para deixar bem amorfo, como você falou, Marcos. Mas é relevante eles estarem lá.

Que tempos estamos vivendo, né, dois CEOs de empresa sendo convidados no Conselho de Segurança da ONU. Você mencionou o Joshua Banjo, né, um dos pais da inteligência artificial moderna, né, do deep learning e tudo mais, que ele também foi um dos convidados lá na ONU. Por isso que ele tava ali e que puderam concordar ou discordar dele. Teve também o secretário-geral, Antônio Guterres, né, que falou que precisa fazer essa coordenação.

E aí o Trump falou: não, porcaria nenhuma, não precisa de regulação internacional, agora vai ser super intelligence, não vai ser mais. Isso foi a melhor, eu Eu tava pensando, esqueci, eu ia começar o programa falando que agora esse é o SI sobre controle.

MMMarcus Mendes

Eu também ia fazer a mesma piada, falei, deixa pra lá.

FCFabrício Carraro

Porque pra quem não viu, o Trump postou agora falando, primeiro ele postou uma enquete, né, falando, olha, o nome de inteligência artificial não faz sentido, não mostra o que que ela é. E ele tinha as opções de como era Extreme Intelligence, Superior Intelligence, Superior Intelligence, tinha tipo 3 opções bem Trump assim. E aí depois passou tipo 1, 2 dias, aí ele falou, não, eu já decidi, vai ser SI, Super Intelligence. E ele falou sobre isso na ONU.

É muito— a gente tá vivendo num episódio de South Park, é basicamente isso. Mas aí o Clem, eu achei muito legal que eles trouxeram também o Clem Delang lá da Hugging Face, né, CEO, fundador da Hugging Face, que foi quem sofreu o ataque da OpenAI. Para falar também lá. Falou para a gente não tomar decisões baseadas no medo, né, fazer decisões racionais e trabalhar juntos nisso. E que a empresa Hugging Face também usou IA para se defender dos ataques, que foi o caso, né.

Eles não puderam usar os modelos GPT nem os modelos Claude porque eles têm essas proteções que você, ele meio que tenta classificar se você tá tentando fazer um ataque. Só que para fazer defesa também você tem que encontrar essas vulnerabilidades, né, nesse caso. E ele não quis continuar os modelos lá, então ele teve que apelar para os modelos GLM 5.2, modelos chineses na época, o que é extremamente irônico, né, se defender de um ataque de um agente rogue americano, ele ter que usar o modelo aberto chinês.

Mas legal que trouxeram ele lá também, né, não só os caras das empresas privadas e tudo mais, mas o cara da empresa aberta para esse debate.

MMMarcus Mendes

Sim. E teve uma outra coisa também, que o Trump, ah, não tem que ter um conselho global de IA, não, isso aqui a gente tá na frente da China, a gente tá na frente de todo mundo e vai continuar assim, etc. Depois falou do lance de, eu quero ver, que nem ele mandou trocar o nome de lago, nome de mar, nome de virar OpenAI, SpaceX AI, nessa vamos ver. Mas enfim, o Lula também, o pessoal deu uma canetinha para ele, basicamente, né?

FCFabrício Carraro

Ele fica lá riscando coisas e trocando nome. É esse o dia a dia do Trump.

MMMarcus Mendes

Exatamente, preocupado com isso. E o Lula também discursou, falou que— e também, né, aquela coisa, muita conversa chapa branca. É uma oportunidade gigantesca, é uma revolução que não tem precedentes, que seria uma omissão histórica. Ele falou imperdoável também não enfrentar o que é o desafio de regulação dessas big techs de inteligência artificial. Ele falou também que tem um punhado de tecnoligarcas que quer ressuscitar a versão de neoliberalismo digital sem ter regra, sem ter transparência, que estão promovendo uma corrida que não tem freio ético principalmente.

E isso não tá levando em conta painéis científicos, não tá levando em conta a ONU, nada a respeito de IA. Mas a gente vai deixar aqui o link dessa parte toda de discursos e do que, como é que foi a participação deles. E sim, tudo certo, nada definido, né? Todo mundo foi lá e falou o que se esperava que fosse dito. Eu não espero que daí saia alguma coisa. Acho que vai sair alguma coisa apesar de todo mundo ir lá e falar a redação do ENEM. Vamos ver.

FCFabrício Carraro

E entrando agora já na OpenAI, saiu agora essa semana mais uma dessas notícias de ataques de modelos vindas lá da OpenAI. Nesse caso foi na Austrália, Marcos. Você acredita que a OpenAI atacou logo os australianos? Tá jogando o Brasil e Austrália agora nesse momento. Enquanto a gente grava o episódio aqui. Mas enfim, eles tiveram acesso a dados de um site ali, dados públicos e também dados não públicos de um site do governo australiano.

Foi o Albanese, né, o primeiro-ministro lá da Austrália, que falou publicamente sobre isso numa meio que uma sessão de imprensa ali. Isso aconteceu em junho agora de 2026 e era uma tarefa que ele tava tentando resolver ali de pesquisa de gastos públicos, medicamentos e tudo mais. E aí, para encontrar os dados, não só ele buscou na internet, mas ele começou a hackear o site do governo australiano, o que é também interessante no lado ruim, né, bem perigoso na verdade.

E aí ele falou, olha, demorou muito para eles nos avisarem, não gostei do jeito que foi feito, isso é inaceitável. E aí a OpenAI falou que só viu esse caso que aconteceu em junho em agosto, porque esses modelos estão correndo ali tipo loucamente, né? 10 mil agentes, imagina, para resolver na VeerStokes, para resolver os problemas do exploit band e tudo mais, exploit gym. E aí eles falaram que só conseguiram analisar realmente, né, ver esses casos quando eles começaram a buscar retroativamente esse tipo de coisa de ataque, igual as outras empresas fizeram também.

A Anthropic só publicou de ataques de modelos Opus, Fable, quando a OpenAI publicou. E eles falaram que começaram a buscar também retroativamente. Acho que aí todas começaram a buscar para trás. As chinesas também falaram, Google, a gente vai falar daqui a pouquinho também, enfim. E disse que descobriu o caso em agosto, mas só notificou o governo da Austrália no dia 10 de setembro, num canal totalmente genérico lá, em vez de fazer, né, usar comunicações que eles têm regularmente com o governo, esse acesso que por ser OpenAI eles têm.

Então a galera lá, o pessoal ficou bem puto, pessoal do governo lá da Austrália, e falam que na verdade pode ter coisas mais antigas ainda, né, tipo desde março de 26. E falaram que talvez até novembro de 2025 já poderia ter coisas de tentativas de ataque, vamos dizer assim, né. Mas é aquela coisa também que a gente sempre fala, A internet não é um lugar tão seguro assim quanto a gente pensa, né? A maioria dos sites não é atacado, hackeado, por falta de tempo, ou não era atacado, mas por falta de tempo dos hackers, basicamente, né?

A vulnerabilidade vai estar lá. Então é ruim que esses ataques aconteçam, é ruim que os modelos estejam fazendo esse tipo de coisa. Ao mesmo tempo, levanta uma bandeira que agora você pode falar: caramba, eu vou ter que dar uma olhada mais a fundo em todos os meus sites, todas as minhas plataformas, todos os meus pontos de acesso, para ver onde existem essas vulnerabilidades. É uma coisa que o Lecan, né, o Papai Lecan fala bastante, que ter modelos principalmente open source para ajudar a gente com isso, né, não os mitos fechados na casinha que só os parceiros podem, mas modelos realmente que o pessoal possa usar, rodar e encontrar esse tipo de coisa, vai nos ajudar a tornar uma internet mais segura. No médio e longo prazo.

MMMarcus Mendes

Boa. E também sobre esse assunto, OpenAI vai deixar terceiros fazerem testes parecido com esse acordo entre OpenAI, Anthropic e Google, mas agências terceiras também de segurança, de teste de novos modelos, fazer o que eles chamam de stress test. E seria não só a hora que o modelo estiver pronto, mas a parte de treinamento, parte de avaliação, na fase de distribuição também de modelo. Então eles vão fazer isso. A gente já falou da Anthropic, que causou polêmica, para variar, né, quando ela anunciou uma coisa parecida nos últimos dias.

E ela também falou nessa semana que vai dar acesso ao sistema de cibersegurança de defesa, na verdade, dela, de IA, que é o Daybreak, e também o GPT-5.6 só para o governo ucraniano, para poder ajudar. Vai oferecer de graça, óbvio, né, para poder— senão de 5 em 5 horas para um drone não adianta nada, né, poder proteger a infraestrutura civil do país. Então é um posicionamentozinho que, claro que tem implicações políticas, mas nesse momento apoiar a Ucrânia não é um grande desafio de moral e ética, né?

Então eles estão, vão oferecer agora o deal break para isso. E uma outra coisa que ela anunciou foi que ela vai passar a trabalhar com um grupo de conselho independente de matemáticos e matemáticas para poder fazer anúncios de descobertas, investigação de descobertas, de uma forma mais responsável do que eles vinham fazendo. A gente falou recentemente que eles deixaram muita gente brava porque tá trivializando o processo da evolução da matemática e deixando pelo caminho respostas, investindo.

É aquela coisa que tem outra coisa que o Paulo Silveira, né, comentou sobre, por exemplo, a OpenAI botar 15 milhões de dólares para investigar uma solução matemática que pagaria 1 milhão de dólares só para ela falar o meu é maior, né. E a matemática, o objetivo fica pelo meio do caminho. As questões que surgem durante o processo de encontrar uma resposta, isso não aparece, né? Você dá o número 42, ninguém sabe o que fazer com isso, basicamente, né?

Então a OpenAI vai fazer esse trabalho com um painel independente de pessoas da área da matemática. E uma outra coisa também, finalizando aqui esse segmento, foi que o pesquisador usando o GPT-6 Astra decifrou uma transmissão de 1918 de rádio feita pela Alemanha na Primeira Guerra Mundial. E isso era uma das grandes mensagens cifradas, das 50 mensagens cifradas mais relevantes não descobertas ainda da história. Não foi uma evolução matemática exatamente, mas uma coisa adjacente a isso que foi interessante ver.

Mas aí sim, foi um pesquisador que pegou isso aí e falou, GPT, não foi só isso, né, mas ajuda aqui a resolver. E saiu o que que era a mensagem. Bem interessante.

FCFabrício Carraro

E saiu o modelo, Marcos. Essa também foi uma semana cheia de modelos novos que a gente vai falar, dentro dos Estados Unidos quanto da China. Uma semana bem interessante nesse quesito. Mas falando especificamente da OpenAI, saíram as novas versões dos modelos Sol e Luna, né, GPT-6 Sol e GPT-6 Luna, que são versões basicamente que seguem a família 6 agora, né. A gente só tinha o Astra, né, esse GPT-6 6 Astra, os outros ainda estavam na versão 5.6.

Agora tá todos eles alinhados nessa família 6, menos o Terra, né? Curioso que a gente evoluiu a Lua, evoluiu o Sol, mas a Terra foi abandonada. O pessoal deixou quieto. E é possível que eles tenham visto que o pessoal não tá usando tanto, porque o Luna ele é excelente, é um modelo muito, muito absurdamente bom. Pro tamanho que ele tem, pro preço que ele custa. E o Sol é pra quando você precisa de uma coisa um pouco mais parrudinha, né?

E agora tem o Astro também. Então talvez eles tenham visto, é 4 famílias, não sei se faz tanto sentido assim, pelo menos nesse momento. Mas falando de números aqui, eu acho que o número mais relevante de tudo isso é o número do preço do GPT-6 Luna, Marcos. Todos eles, né? Ambos tiveram uma queda considerável de preço, praticamente 50% ou até mais no caso do Luna.

MMMarcus Mendes

Viva a concorrência!

FCFabrício Carraro

Exato. E agora ele está custando R$0,10 para 1 milhão de tokens de input e R$0,50 para 1 milhão de tokens de output. Pela qualidade do Luna, que eu sempre falo, é um modelo que é surpreendentemente bom. O Luna Max já resolve a maioria absoluta dos seus problemas de dia a dia de programação. Um CRUD, uma programação específica assim, também ele vai fazer muito bem. Só para coisas bem mais complexas, que aí faz sentido um Sol, um Axios, esse tipo de coisa, né?

Uma super migração de base de dados, atualização e tudo mais, aí vale uma coisa mais parruda. Mas para o dia a dia de programação, o Luna tá mais do que bom. E por esse preço, conectar na API dele é grátis. Ele tá sendo absurdamente subsidiado É uma questão também que vale mencionar, porque isso não vai ser para sempre. Mas mesmo assim, o modelo desse tamanho, com essa capacidade e por esse preço, é tipo, bate de frente com o preço de você rodar local na sua máquina, praticamente assim, de você alugar uma GPU ou ter uma GPU ali, um Mac Mini, é quase nesse nível.

É tão absurdo pela qualidade que bate nisso. Já o Sol, GPT-6 Sol, Caiu também pela metade o preço. Input agora $2 por 1 milhão de tokens e o output caiu de $20 para $10. Então também tá muito, muito barato. O que eles fizeram provavelmente, né, que sempre fazem, é destilar modelos maiores, por exemplo o Astra, para redes neurais menores, mais rápidas e tudo mais. E aí eles conseguem ter um modelo tão inteligente quanto, mais inteligente, Só que em uma rede neural menor que você consegue baratear esse preço.

Além, obviamente, como eu falei, do altíssimo subsídio que eles estão tendo. E olhando ali nos números, nos valores, é bem interessante ver que o custo por inteligência também tá excelente, né? A gente sempre fala o custo por token, o custo por token. Agora a gente já tá começando alguns meses, talvez quase um ano, a falar de o custo por inteligência, o custo por tarefa realizada, que é uma coisa até mais importante, né? Imagina que você vai ter um modelo que é muito mais barato em questão de custo por token, só que ele gasta muito, muito mais token para resolver a mesma tarefa.

Aí não vale a pena, né? Ou pode não valer a pena no final das contas. E nesse caso aqui não é essa situação. Esses modelos, eles têm uma pontuação muito boa, muito boa mesmo, comparado com os outros. E conseguiram mover ali a fronteira de preço para bem mais para trás, mantendo e melhorando a qualidade. Então, se você testou, se você não testou, vale a pena. Mas eu diria principalmente porque o GPT-5.6 Luna continua com os preços antigos, que era $1,20 para cada 1 milhão de tokens de output.

Agora o 6 está por 50 centavos. Então troca tudo aí, pega na sua empresa, API é hoje. Você vai economizar 60% da sua conta, pelo menos, só disso. Talvez até mais, por ele ser um modelo mais inteligente. Talvez ele consiga economizar tokens na hora de resolver a mesma tarefa. Então troca tudo hoje, agora mesmo.

MMMarcus Mendes

Boa. E também nessa semana, a OpenAI anunciou que o ChatGPT Voice, agora ele dá para você, consegue usar ele com o GPT-6 Astra, com o Sol e com o Luna. E eles têm agora a capacidade de usar plugins e aplicativos conectados. Teu email, calendário. O Slack também, eles publicaram mais um. Quando eles anunciam coisa nova do GPT Voice, eles estão usando vídeos de vovozinhas usando o ChatGPT. E ia ser engraçado que cada vovó tá com o telefone, tá apoiado numa caneca, o outro nos ladrilhos, sei lá, outro não sei onde.

Então aquela coisa bem de vovó mesmo, usando e pedindo, fazendo pedidos. É um vídeo comprido, deve fazer 2 minutos, mas é engraçado, mostrando justamente isso, né, podendo usar para um vídeo comprido de 2 minutos.

FCFabrício Carraro

Marca esse TikToker.

MMMarcus Mendes

Vamos lá, é um vídeo que se você vai passar assim em 15 segundos você entendeu a ideia, aí tem outra cena, aí tem mais uma, aí mostra de novo a mesma coisa, de novo a mesma coisa, de novo a mesma coisa. Foi isso que eu quis dizer, tá? Mas é divertidinho sim. E agora funciona, dá para usar até no ChatGPT Work também. Isso tanto na web, que é legal, quanto no mobile também. Então ChatGPT Voz ganhou capacidades agênticas também nessa semana com os modelos novos, o que é mais bacana ainda.

FCFabrício Carraro

E outra coisa do OpenAI que eles lançaram foi o Mental Health Bench, né, um benchmark de saúde mental que foi criado junto com 80 profissionais ali da psicologia e da psiquiatria, segundo eles, de países diferentes. O que é uma coisa é muito legal, muito interessante que eles deixaram claro isso, né, porque você pega realidades diferentes também, culturas diferentes. Para a ideia seria avaliar como que a IA responde a conversas reais ali de saúde mental validadas por esses 80 profissionais ali, desde uma coisa cotidiana ali de tô me sentindo mal, tô com ansiedade, até uma emergência que a pessoa quer fazer mal contra ela mesma ou outro tipo de coisa, ou contra outros também, né.

Falaram que esses conjuntos de dados usa conversas sintéticas, não foram conversas reais, mas que foram revisadas por esses especialistas ali no critério de segurança, de acurácia clínica, de empatia, se o texto tá bem claro e tudo mais. E eles falaram que 53% dos cenários não são agudos, 18% são de alta gravidade e 28% são de emergências. O melhor modelo nesse benchmark, né, que melhor respondeu a esse tipo de situação foi o GPT-6 Astra mesmo.

Que teve uma pontuação que é ok, mas não é das melhores, foi 57% só. O Sol foi a 54%, o Cláudio Opus 5.5, que a gente vai falar daqui a pouquinho, né, saiu essa semana também, 52%, e o GPT-6 Luna com 50%. E teve uma outra análise que eles fizeram com 44 usuários mesmo, aí não foi com os profissionais, que esses usuários falaram que eles preferem, né, valorizam mais quando o modelo dá uma orientação prática e também o tom que ele usa, né, um tom mais empático do que outras coisas que os especialistas, por exemplo, priorizam, como que é o contexto, interpretação ali dos detalhes de uma forma mais cuidadosa.

De qualquer forma, o benchmark tá liberado aí, publicado para ser melhorado e para melhorar os modelos. Agora, é sempre bom, né, a gente fala que sempre que você consegue criar um benchmark ou lançar benchmark que seja essas empresas ou universidades, empresas públicas, e ele pega, entre aspas, as empresas começam a tentar orientar para melhorar nele, né? Foi o caso lá atrás dos de código, dos de matemática. Mais recentemente eles entraram nos benchmarks jurídicos, como da Harvard, Harvard Bench, né?

Harvard é a Inter dos Estados Unidos, né? Ali de coisas jurídicas, de AI, tudo Mas agora é interessante, é bem interessante a gente ter benchmarks dessa questão de saúde mental, principalmente por ter sido validado por profissionais da área de diversos países.

MMMarcus Mendes

Bom, e finalizando a parte da OpenAI, ela tá investindo, Fabrício, na próxima vez que ela falar: gente, vamos parar tudo, foco, parar com distrações, etc. Porque ela contratou nessa semana o Sam Yem, que é um dos cofundadores, é presidente da do Patreon, que é aquela plataforma de apoio a pessoas que criam conteúdo na web, etc. E o que ele vai fazer dentro da OpenAI é liderar uma divisão nova de creators. Não tem exatamente o que vai sair daí, mas é a OpenAI de alguma forma tentando pensar num jeito de trazer creators direto, uma relação mais próxima para poder, enfim, usar os produtos e promover.

Mas a hora que eu li isso, falei, putz, OpenAI não se segura, né? Não consegue, ela precisa tomar Adderall. Mas enfim, vai ter divisão de creator na OpenAI.

FCFabrício Carraro

Indo agora para Anthropic, eles anunciaram essa semana uma parceria com a Accenture. Essa daqui me pegou bastante de surpresa, para ter avaliadores independentes no desenvolvimento dos modelos de IA, né? Os modelos mais de fronteira, né? O próximo Fable, próximo Mythos. E eles vão ter acesso interno praticamente do mesmo nível dos funcionários da própria Anthropic para acompanhar os treinamentos, as decisões ali de implantação, de desenvolvimento, os guardrails, alinhamento e seja lá o que for, reportar falhas e tudo mais.

Eles querem investir pelo menos 1 bilhão até 2 bilhões de dólares para criar essa capacidade nos próximos 5 anos, né? Bilhão com B de Brasil aqui. E aí eles falaram que Anthropic vai começar financiando esse trabalho da Accenture, mas também estão negociando projetos com a METER, né, essa empresa de avaliação que também tem investimento da Anthropic, falando aqui entre parênteses, e também outras organizações. E Marcos, o que que a Accenture vai falar sobre desenvolvimento de modelos de fronteira, avaliar alinhamento, avaliar interpretabilidade, segurança, guardrails?

Mais do que os funcionários extremamente bem pagos e especialistas da própria Anthropic? Essa eu não entendi.

MMMarcus Mendes

Eu vi crítica a isso e também crítica que a própria Anthropic ela tem já uma relação de investimento com a Accenture, então seria uma coisa meio, meio que não dá para levar muito a sério.

FCFabrício Carraro

É tapinha nas costas.

MMMarcus Mendes

É, quando eu olho para isso eu fico dividido entre é melhor do que não fazer nada Porque de fato, ou falar assim, tá, vamos esperar um resultado antes de criticar, não sei. Mas pode ser que o resultado não venha, que seja a última vez que a gente ouve falar sobre essa parceria entre as duas e que muito bem, obrigado para a Accenture que vai faturar uma grana, mas também estou na dúvida sobre por que ela, não sei.

FCFabrício Carraro

Tipo, o que os caras da Accenture, consultores lá, Vamos decidir, vamos falar qual que é a opinião, como é válida a opinião da galera da Accenture nessa coisa tão detalhada que é alinhamento de modelos, que é segurança de modelos, mais do que os times de segurança da própria Anthropic ou dessa grande parceria aí que eles estão fazendo com DeepMind, com OpenAI. Aí eu entendo, aí acho que faz bastante sentido. Mas a Accenture, né, empresa de consultoria de negócios, de business.

Não me entendam mal, não tô falando mal da Accenture, eu só tô falando que pra esse tipo de detalhe me soa muito estranho, me soa como tapinha nas costas só pra falar que estamos preocupados com segurança e blá blá blá.

MMMarcus Mendes

Claro que se você trabalha na Accenture, será um prazer receber você aqui pra gente falar a respeito disso. E também se você trabalha em outras áreas que você não fez sentido pra mim entender o que que rola, comenta com a gente, tá? Agora, Anthropic nessa semana, viva a concorrência, ela aumentou em 20% o limite de 5 horas de tokens para quem assina os planos Pro, Max e Team também, e deu para os usuários um reset lá do limite, né, que é uma coisa que a gente vê a OpenAI fazer bastante, com o Thibault virando o Papai Noel de todo mundo lá no Twitter para agora que eles, que a OpenAI reseta os créditos, né?

Junto disso, a Anthropic anunciou nessa semana que eles agora vão dar suporte ao Agents.md no Cloud Code. Viva a concorrência, né? E que a OpenAI contribuiu com o Agents.md para a Genetic AI Foundation no ano passado, e Anthropic, como resultado disso, agora no finalzinho desse ano tá aceitando o Agents.md. Fabrício, O que que isso significa para quem já ouviu falar, mas não sabe exatamente o que que é o Agents.md, como é que usa, para que que serve?

FCFabrício Carraro

Excelente. Então, quando essa coisa de programação agêntica dos harness começou assim, começou a sério ali novembro de 25, dezembro de 25, cada um desses sistemas criava um padrão para ele manter meio que um status ali de quem eu sou, qual que é esse projeto, em que fase nós estamos, também, né, sendo atualizado ali continuamente enquanto você tá trabalhando em um projeto específico. E o Claude Code tinha uma coisa chamada Claude.md, né?

Então eles foram bem egocêntricos, vamos dizer nesse sentido, enquanto que o Codex da OpenAI foi uma parada mais aberta. Eles falaram, não, vamos fazer uma coisa geral que vai ser o Agents.md. E os outros meio que foram seguindo esse padrão também de Agents cloud.md, né? O mercado, Kimi Code, Quen Code, todo mundo falou, não, beleza, vai ser agent.md porque é mais generalista. E a Anthropic tava a única, ou praticamente a única, que era esse cloud.md separado.

Então quando você tava trabalhando, por exemplo, em um mesmo projeto, que acaba os seus créditos de 5 horas ou de semanal do cloud, e você quer trabalhar lá com OpenAI, por exemplo, com o Codex, você tinha que, putz, agora copiar aqui o coisa, ou já criar uma automação que copiasse, né, esse cloud.md e colocasse em um agents.md para continuar o seu trabalho. Ou pior, a volta, né, você tá trabalhando com Codex, você vai fazer alguma coisa específica com Opus, você tem que jogar tudo dentro do cloud.md.

Agora esse problema não vai mais existir porque já vai ser agents.md para tudo, vai estar meio que quando criar uma coisa, esse status do projeto, quem eu sou, aí ele vai criar também o agents.md. Perdendo essa barreira, né? Não era uma barreira muito difícil de fazer, era só uma chatice que agora não vai existir mais. E é uma ótima notícia. Todo mundo, todo mundo elogiou, foi a melhor notícia que eles tomaram nos últimos tempos.

Mas, Marcos, outra ótima notícia que saiu da Antropic essa semana foi lançamento de modelo. Olha aí, Clod Opus 5.5 está nas nossas mãos e é um modelo realmente excelente assim. Eu achei até curioso o quão melhor ele é, por exemplo, em termos de escrita. A gente tinha, não tava notando, né, o Fable principalmente, e o mesmo Opus 5, né, o 5.0, que ele tava escrevendo no estilo bem claudístico, vamos dizer assim. Tinha até meme sobre isso, tinha site falando, é como que o Cláudio diria isso, né, tradutor de inglês para codismo.

É, exatamente. E tinha virado esse meme, o pessoal lá dentro pegou, internalizou isso e melhorou essa questão da escrita, né, de ser uma coisa mais natural mesmo. Mas também outras melhorias de benchmarks, obviamente, como sempre. Mas essas foram, pegaram bastante gente de surpresa até, porque o Cloud Opus 5.5, essa nova versão, bateu e de longe o Fable 5.1. Que era supermodelo, né, nova família tal, superpoderosa. Obviamente eles têm modelos superpoderosos, mais poderosos que esses lá dentro, né.

A gente sempre fala que as empresas essas, eles têm internamente os modelos que eles usam, eles estão no geral duas gerações para frente. Então quando sai Opus 5.5, eles já têm o Opus 5.8, que seria, né, o que será o Opus 5.8, 5.7, ou 6, seja lá como eles decidirem nomear isso. Mas bate e bate bem assim vários benchmarks o Fable 5.1. No TerminalBench 4.0 de programação agêntica, o Oppo 5.5 foi para 66% contra 56% do Fable 5.1, ou seja, 10% de vantagem.

O CursorBench também tá com uma desvantagem aí de 6%, né, em relação ao Fable 5.1. No DDP, que é aquele de tarefas relacionadas ao PIB, que tarefas de finanças, de marketing, de RH e tudo mais, o Fable tá com 31%, o Opus 5 tinha 27%, e agora o Opus 5.5 foi para 40%. Humanities, tá batendo também. Ou seja, ele tá batendo em tudo no Fable 5.1, e não teve meses falando, olha, pessoal, pessoal, esse modelo aqui, muito cuidado, ele vai destruir o mundo, ele vai ser mais poderoso, vai quebrar tudo.

Ou seja, eles talvez eles tenham visto que pelo menos no momento não vale a pena continuar com essa história de fearmongering, né, de elicitar o medo no público, porque não tava pegando bem, ou porque é uma família, é uma evolução de uma família que é menor, né, não é uma família nova, é acima das outras, é uma evolução de uma família Opus, que é a segunda, o segundo nível deles agora atualmente, né. Mas enfim, não teve nada disso, foi só, olha, galera, aqui o nosso lançamento.

Não teve nem tanto destaque assim, para falar a verdade, né, de bafafá. Mas em uso, do que eu usei, do que a galera das redes sociais tem usado, amigos meus também, todo mundo tá elogiando muito, muito esse novo Clube de Opus 5.5 em relação ao Cloude 5. Inclusive, uma funcionária, esqueci o nome dela agora, mas ela tinha uma dev rel, algo assim, lá da Antropic. Ela fala bastante no Twitter. Ela disse que, olha, lançamos 5.5, é um modelo maravilhoso, bababá, me desculpem pelo Opus 5.0.

Foi nesse nível assim que ela falou publicamente sobre o Opus 5.0. Então, aparentemente, eles mesmos estão orgulhosos e também Como o Marcos disse, viva a concorrência. Vantagem de preço aqui, né, baixou o preço do Opus 5.0, que era $5 para 1 milhão de tokens de input e $25 para 1 milhão de output, baixou para $4 e $20 respectivamente. O preço do cache também, né, quando você usa o cache de leitura e de escrita, também baixou um pouquinho.

Então é um modelo bem melhor aparentemente, né, tanto para escrita quanto para código, quanto para qualquer coisa, bate o Fable. Talvez não bata o Fable em uma questão, que isso eu tenho que testar mais para ver, que é intuição. E aqui falando bem entre aspas, tá, porque eu não quero antropomorfizar os modelos para não levar bronquinha do Altair, mas é uma coisa que você percebe quando você usa o Fable assim mais constantemente, comparado, por exemplo, com o próprio Astra ou com o Opus 5.0, que o Fable ele tinha um tipo de intuição assim, tipo ele saber do que você tá falando mesmo você não dando tantos detalhes assim, né?

Ele entender a sutileza do que você quis dizer, que é uma coisa que os outros não entendiam direto assim claramente. Isso é um ponto que eu ainda tenho que testar mais o 5.5 para ver se ele tem ou não tanto quanto o Fable 5.1 ou 5.0. Mas fora isso, modelo excelente novo da Antropic lançado.

MMMarcus Mendes

Foi a Lydia Halley que falou o lance do desculpa, etc., etc. E também notei que assim é uma dissonância cognitiva enorme você falar precisamos ser regulados, desacelerar, vira a página, acabamos de lançar agora o modelo Opus 5.5 que é muito mais poderoso até do que o Fable que fez esse caos todo, etc. Então é isso, lança mas não faz muito barulho, tá aqui, quem quiser usar usa. Mas é muito bacana que ele é bem mais barato também, né?

Essa foi Isso foi o fio condutor que a gente vê nessa semana dos modelos, o que é uma excelente notícia. E sobre bastidores, a Anthropic falou que ela encontrou e desmantelou uma operação que tinha associação com a China. Então, de novo, né, Anthropic e China, fala mais da China do que o Trump, né, para monitorar líderes religiosos e também comunidades, tá descrito aqui como diaspora communities, né, incluindo um grupo de de promoção de direitos, feito, que é formado lá em Washington, D.C., que é em defesa do Tibete.

Então a gente já viu coisas sobre desmantelar grupos de ataque, especialmente quando o assunto é eleições, muito da Rússia. Agora eu venho falar que prestem atenção na China, vamos falar de China, China, porque eles são o grande risco quando o assunto é AI. Tinha um grupo chinês que geralmente eles falam que é associado ao governo, não vi eles fazerem essa afirmação aqui, porque o momento não tá propício para fazer isso, né, com Xi Jinping lá em Washington.

Mas que eles encontraram um grupo que tava fazendo isso. E Anthropic falou agora, uma notícia positiva de bastidores foi que Anthropic, o Claude, ele descobriu, ela falou, de forma autônoma descobriu um sistema novo de enzimas no DNA de bacteriófagos, que é uma coisa parecida com o CRISPR. O CRISPR Muito, muito, muito, muito basicamente é aquele sistema de edição de DNA, né? Eles descobriram um sistema novo de enzimas que permite fazer uma coisa muito parecida, que é o primeiro resultado do Biolab, do biolaboratório que ela montou nem faz muito tempo, e já mostrou que tá trazendo resultados.

E é uma coisa muito específica nesse momento, DNA de bacteriófagos, mas é assim que começa a parte boa e a parte ruim, né? Mas é assim que começa qualquer tipo de evolução científica.

FCFabrício Carraro

E o interessante é que isso veio daquele laboratório, o BioLab, WetLab da Antropic, né, que a gente mencionou agora, basicamente semana passada, se não me engano, que eles estavam lançando, inaugurando esse primeiro laboratório. Eles chamam de WetLab, laboratório úmido, laboratório molhado, algo assim, que é o que faz os testes, que aplica realmente as coisas ali, orientado pela própria Antropic. Então é uma primeira notícia de lá, como o Marcos falou.

Tem filme do Resident Evil novo aí que todo mundo tá falando muito bem. Talvez haja uma conexão nos próximos anos ou não. Ou a gente vai encontrar a cura de várias doenças, o que eu tento ser otimista, tento ser positivo nesse lado. Outra da Antropic dessa semana é que eles fizeram uma parceria com a Open Evidence, que é uma plataforma de médicos, basicamente, né, de pesquisa médica com inteligência artificial pra dar suporte clínico baseado em IA de forma totalmente grátis.

Para médicos, né, profissionais da saúde em geral, em 100 países de baixa renda e de média renda. Então países da África, da Ásia, da América Latina, né, Uganda, Angola, Sudão, Haiti, Mongólia e tudo mais. Eles falaram que o sistema que eles vão oferecer ali vai ter pesquisas médicas revisadas por pares, diretrizes e tudo mais, com cloud no back-end e usando, claro, as adaptações da própria Open Evidence às condições de cada região ali, de cada país, porque Nem todo lugar tem a mesma infraestrutura, nem todo lugar tem as mesmas doenças.

Então você falar pra um país paupérrimo, Sudão, Sudão do Sul, que olha, leve o seu paciente pra fazer uma tomografia computadorizada, não vai rolar, né? Não vai ser bem assim que vai funcionar o Andor. Então eles já pensaram em fazer esse tipo de adaptação pra tentar criar um diagnóstico, um tratamento adaptado pros recursos daquele lugar. Aqui é uma boa notícia, que sendo uma parceria também, como eles falaram, gratuita.

MMMarcus Mendes

Boa. Indo para o Google agora, teve uma festa em Mountain View nessa semana.

FCFabrício Carraro

Não me convidaram.

MMMarcus Mendes

Comemoração. Eles chamaram o AC/DC para tocar Jailbreak porque finalmente o Google conseguiu invadir alguém por engano. Todo mundo tirando sarro que as empresas faziam isso, que o Google tava lá com o Sundar Pichai, cometa crimes. Né? E agora o Google falou que na verdade aconteceu em maio, que foi tão— que eles nem tinham achado o que o pessoal vão falar, que eles fizeram um teste. Durante esse teste, o modelo tentou acessar sistemas externos para poder— a conversa que a gente tem visto recentemente, né?

Mas agora, no caso do Google, foram 3 empresas em maio que eles fizeram, e foi durante um teste pela Irregular. E Google falou que o modelo Parou depois de determinar que ter acesso a empresas de fora não era muito bom. Então ele próprio já, o Gemini, invadiu o Peronomuchio, né? Mas foi com 3 empresas, a conversa que a gente já tá acostumado a ver. Mas agora o Google também pode entrar no benchmark de tentativa de invasão.

FCFabrício Carraro

Parabéns, Google! Agora todo mundo está invadindo, todo mundo cometendo crimes.

MMMarcus Mendes

Exato.

FCFabrício Carraro

Outra que veio de lá foi sobre o Gemini G4. Foram duas, na verdade, uma real e uma não sabemos. O Koray Cavuçuoğlu, que é o novo chefe ali da Google DeepMind, né, nessa divisão de modelos, depois da debandada que rolou lá do Jeff Dean, do Oriol, mó galera que saiu, falou que já tá muito próximo de terminar o treinamento do Gemini 4 Pro, né, que seria o primeiro a sair disso nos próximos, próximas semanas ou mês ou meses. Ele falou muito antes do final de 2026, ou seja, muito, muito em breve mesmo.

Se eles já estão falando abertamente sobre isso, mas que ele falou que vai ter talvez uma versão inicial. E eles têm esse histórico de, histórico de atleta, de lançar o modelo em versão prévia, né, antes de lançar o modelo real, que demora, sei lá, um mês, um mês e meio depois da versão, essa versão prévia que eles lançam. De qualquer forma, está para lançar. Eles falam que querem colocar, né, de volta lá no nível competitivo.

Eles têm modelos muito bons, os modelos Gemini 3.8 que saíram recentemente são realmente muito bons, muito baratos e tudo mais, mas não são no nível de fronteira. Já esse Gemini 4 Pro seria a ideia deles, né, é para lutar no nível de fronteira porque eles são o Google primeiramente, né. Mas enfim, e aí vazou, ou vazaram, ou inventaram, não sabemos, um benchmark, né, uma tabela de benchmarks sobre o que seriam os números desse Gemini 4 Pro ali, com o preço de saída de $11 por milhão de tokens.

Seria mais barato do que o Astra, do que o Fable, do que o Opus e tudo mais. Seria o preço do Sol mais ou menos. Só que esses números de inteligência destroem também Astra, destroem Fable ali em programação agêntica, em coisas de PDFs, análises multimodais, Humanities Last Exam, jurídico. Então, em praticamente todos os benchmarks que estão aqui nessa tabela, que novamente não sei se é real ou não, eles bateriam muito de longe os modelos de fronteira de hoje em dia e por um preço muito mais barato.

Se for real, excelente para DeepMind. Mas não sabemos ainda, né? Eu fui tentar sondar com pessoas que eu conheço que trabalham lá dentro da Google DeepMind. Uns me falaram que, olha, não sei, talvez seja irreal, não sei se é verdade. Outros me falaram que tem uma versão lá que é muito boa e blá blá blá. Enfim, não sabemos, mas vos avisaremos aqui nas próximas semanas.

MMMarcus Mendes

Eu, por acompanhar notícias e vazamentos e rumores de tecnologia há 15 anos, Aprendi a não confiar quando essas tabelas aparecem. Mais frequente do que não, essas tabelas estão erradas. Alguém que fez para tentar ver se conseguia viralizar, porque olha para falar, eu que fiz isso aqui, vazou todo mundo, né? Teve até um caso, eu vou omitir o nome, os nomes para proteger os envolvidos, mas de um executivo uma vez de uma empresa de tecnologia que chamou um bando de YouTuber, vazou uma tabela de preços de produtos que iam ser anunciados muito em breve.

Aí eles todos publicaram vídeos falando da tabela. Esse cara foi no evento uns dias depois, apareceu uma tabela, e sei lá, a pessoa inventa as tabelas, os preços não são nada disso que apareceu, e depois é muito mais barato para poder estabelecer um termo padrão. E depois vai, não tô dizendo que foi isso, tá, mas assim, até a empresa confirmar e anunciar, e mesmo depois a empresa anunciar e confirmar, espera um pouquinho. Então não levaria tanto a sério não, mas para quem quiser matar a curiosidade, a gente deixa aqui na descrição porque estando certo ou não, não deve ser tão diferente disso, pelo menos dá para imaginar para onde vai apontar.

E nessa semana o Google anunciou o Gemini 3.8 Flash TTS, que é o text-to-speak, e o Gemini 3.8 Flashlight TTS, que eles falaram que é o modelo mais expressivo que eles liberaram até hoje para geração de voz a partir de áudio. Ele tem até suporte a mais de 100 idiomas, o que é uma excelente notícia. E geralmente as pessoas usam isso como base de API para telemarketing feito por IA. Eu sempre dou esse exemplo aqui. Quem tiver exemplos melhores, comenta com a gente para poder passar aqui também e poder tangibilizar.

Mas agora tá disponível. E Flash e Flashlight são justamente modelos que são feitos para ter uma latência muito pequena. Os modelos são até menores do que os modelos mais parrudos, mas para o que ele oferece, versão 3.8, já tá bom porque ele é usado, sabe? Sabe? Então os dois estão disponíveis e é uma excelente notícia ver que isso segue evoluindo. E teve também o Gemini 3.8 Live com o Live Avatar, que agora dá para você usar ali na Google AI.

Tem um avatarzinho, tive muito avatar nessa semana, né, porque a Meta também tinha falado dela. Teve o lance de avatar 3D também, tem o lance do Meta Charme, mas agora você cria um avatarzinho para poder falar com o Gemini, o Gemini Live. Esbarra em AI Companion. Lembrando que o Google, eu acho que ele comprou, ele não comprou a Character AI, ele comprou os executivos que depois saíram, até um deles brasileiro, mas é meio próximo disso.

Então tem agora um avatarzinho para você poder falar se tiver usando o Gemini 3.8 Live.

FCFabrício Carraro

E um último, uma coisa aqui do Google, um teste que eles estão fazendo, o Call for Me, que deixaria o Gemini, né, usando essas ferramentas de voz aí, por exemplo, Flash TTS, Não sei exatamente qual é, mas provavelmente vai ser esse, né, o Flash, o Flashlight TTS, para o Gemini ligar para empresas e executar tarefas no seu nome, né, tipo fazer uma reserva de um hotel, de um restaurante, remarcar um compromisso com alguém. É o que, para, dependendo, para marcar um restaurante, eu vejo isso, pessoas usando isso realmente, né, falando, Gemini, o seu assistente Gemini, né, Ei Google, liga aí para o restaurante que tá marcado hoje às 8 horas e remarca para as 8:30, alguma coisa assim. Isso eu vejo acontecendo realmente. Eu falei, ei Google, meu WhatsApp.

MMMarcus Mendes

Eu achei que você fez isso com telefones de muitas pessoas que escutam aqui o podcast hoje, inclusive agora também.

FCFabrício Carraro

Perdão, pessoal, mas é para ele ligar esse tipo de restaurante, eu acho que funciona. Para outro tipo de coisa não sei, mas eles estão testando lá nos Estados Unidos por enquanto, só para quem tem Pixel 11, né, o mais recente lá da família de celulares deles, com assinatura do Gemini e essa versão beta instalada. Então é o primeiro teste para ver se o pessoal vai testar, vai usar, vai gostar. Também porque eles estão na onda de um dos grandes anúncios que tá bombando muito nessa última semana, últimas semanas, que é o Muse da Meta, que a gente vai falar agora, né, já já.

Mas eles estão vendo como isso tá crescendo. E aí agora também estão lançando, provavelmente já era um plano anterior a isso, claro, mas faz sentido ver o mercado inteiro tá se movimentando nessa onda, nesse caminho de agentes que fazem coisas por você mesmo, por voz. E Marcos, que que aconteceu na Meta essa semana?

MMMarcus Mendes

Olha, essa semana a gente viu muito Muse na Meta, e não é o Muse que eu gosto, a banda, né? Então não é o Muse que você gosta. Meta. Não sei se você gosta desse Muse, mas a gente até comentou semana passada, retrasada, não sei, que a Meta pegou a conta do @Muse para falar com assistente. O povo que curte a banda ficou bravo porque não consegue falar com a banda. Mas enfim, né, a Meta lançou recentemente esse Muse, que é o open cloud dela, e bombou em múltiplas áreas.

Essa semana as ações de empresa de chip valorizaram, tipo, tudo num dia, 10%, 12%, 15%. Porque ficou o lance de que as pessoas vão passar a comprar computador para poder instalar o Muse, porque é um jeito muito fácil de você rodar um assistente na sua máquina dedicada, etc., aquelas loucuras, né, que o pessoal faz. Mas por conta do lançamento, que eu vi que recebeu os parabéns, porque a única coisa de IA que não tem o logotipo que parece uma parte escondida do corpo humano, ele é um rabisquinho assim, e ele passou a marca de meio milhão de usuários totais, tá com 250 mil usuários ativos diários.

E a Meta falou que eles estão recebendo mais de 2 milhões de prompts. Na primeira semana receberam mais de 2 milhões de prompts. Na Play Store e na App Store dos Estados Unidos, o aplicativo do Muse foi o mais baixado. Assim, ele nos primeiros 6 dias de lançamento, ele foi baixado quase 1 milhão de vezes. E enfim, a Meta AI nesse mesmo período foi baixado bem menos, né? Então o aplicativo dedicado do Muse tá fazendo sucesso mesmo.

A própria Meta valorizou tipo 12% no dia que saiu essa notícia. E aí tem duas coisas, né? Ainda é a Meta, e as pessoas vão lembrar que ainda é a Meta conforme o tempo for passando, né? Mas ela fez um teste, o pessoal do— foi do The Information, eu acho que mostrou. Não, foi da 404 Media, que ela fez um teste e colocou seres humanos para cumprir algumas tarefas agênticas ao invés de ser uma IA fazendo isso. Mas não foi secreto para enganar, foi um teste de verdade para ver como é que seria você ter humanos fazendo alguns tipos de tarefas, tipo fazer ligações telefônicas.

Exatamente o que a gente acabou de falar que o Google tava fazendo agora, dá para ter o Call for Me, né? Então ela fez isso, pegou mal porque é a Meta, né, aquela coisa toda. E também apareceu uma vulnerabilidade no aplicativo dela para Mac que deixava um comando externo acessar os tokens de autenticação do Muse e a partir disso poderia fazer o que quisesse, porque você tá usando o Muse remotamente no computador da pessoa, tendo acesso às contas dela, aos arquivos dela, à vida dela, né?

Aí a Meta disse que não, na verdade uma parte aqui da arquitetura falou, velho, você tá louco? Eu falei, é verdade, né? Aí ela atualizou e corrigiu essa falha, agora não dá mais para explorar esse bug. Aí nessa semana também a Amazon, como ela faz geralmente com agentes de compra e coisa assim, falou: não, o Muse não pode entrar aqui no site e comprar as coisas em nome dos usuários porque isso fere os termos de serviço, oferece risco de segurança, não tem permissão de vendedores.

Aí o Shopify falou: gente, quiser comprar aqui pode mandar Muse, manda o que você quiser, só compra aqui, tá? Então a gente tá vendo, já é a segunda vez que o Shopify se aproveita desse vácuo que a Amazon deixa para poder habilitar compras agênticas. E nessa semana também teve um evento, foi na quarta-feira, um evento que a Meta anunciou um bando de— foi o Meta Connect— um bando de hardwares. Anunciou óculos com câmera de terceira geração, anunciou óculos sem câmera que você só fala e escuta.

Então você fala com— vai falar com o Muse, vai ter o Muse nele mesmo assim, mas não vai ter câmera. Anunciaram que quem usa os Meta Glasses vai poder fazer opt-out de treinamento de dados, que aparentemente até agora não tinham, que não acredito que é verdade. Mas o principal que chamou mais atenção nesse evento foi— ah, teve também, né, falei que ia ter avatar da Meta. Tem agora uns óculos que você faz avatar de corpo inteiro, você fala com a pessoa, aquela coisa meio holográfica que a Meta vem insistindo desde que eles mudaram o nome para Meta, porque acharam que o metaverso é o futuro da tecnologia.

Mas o principal que eles anunciaram que vai ser lançado em dezembro, tem nem preço confirmado ainda, foi o Meta Charm, que é um Tamagotchi. Você teve um Tamagotchi, Fabrício, quando você era criança?

FCFabrício Carraro

Tive, adorava muito, muito. Você teve?

MMMarcus Mendes

Eu tive, tive. Eu lembro que a hora quando bombou, eu tive a sorte, era criança, tava viajando nos Estados Unidos, a gente comprou eu um, meu irmão um, era divertidinho. Mas a Meta vai lançar o Tamagotchi dela, é o Muse Charm. Ele é pequenininho, arredondadinho, um painelzinho OLED de 2 polegadas, tamanho de um relógio grande quase, basicamente assim, um pouco maior. Tem câmera, ele tem caixinha de som, tem conectividade 5G. Eles vão lançar até o final desse ano.

A Bloomberg falou que vai custar mais ou menos o preço de um relógio inteligente e que o lance é você ter um hardware dedicado para falar com o Muse, para ser o seu agente que você leva para todos os lados e cumpre tarefas para você. Então, para você usar ele Ele tem um esquema de Tamagotchi mesmo, tem um personagem que você customiza. Então tem um apelo aí que talvez tenha coisas regulatórias em cima mais pra frente. Mas foi o que mais bombou, mesmo sem lançamento definido, é só fim do ano, sem preço, etc.

E foi feito, a equipe que trabalhou no Muse foi junta à equipe do Alexander Wang, que é da área de superinteligência, junto com o cara, o Alan Dai, que era o líder de design da Apple e saiu de lá, foi para Meta, e os dois juntaram e trabalharam e criaram. Claro que já tava sendo criado antes, porque senão faz 6 meses, mas ainda assim ele é um fruto dessa união do design, o cara que era da Apple, designer de lá, e a superinteligência. E aí, você vai ter? Você ficou interessado?

FCFabrício Carraro

Eu fiquei. Eu admito que apesar de ser um produto da Meta, que a gente não confia normalmente na questão de dados, de compartilhamento de dados, esse tipo de coisa. Eu fiquei interessado pela ideia, né? É um, ele é bem bonitinho mesmo, né, um Tamagotchi. Inclusive, curiosidade para galera, em japonês, né, Tamagotchi era uma coisa japonesa, tamago é ovo. Então Tamagotchi era um ovinho, é a tradução da palavra Tamagotchi, algo assim.

MMMarcus Mendes

Chamava bichinho virtual aqui, que a gente chamava, né, no Brasil. Exato.

FCFabrício Carraro

Nossa, você pegou a nostalgia de uma galera agora, trouxe assim na garganta. Mas sim, e era, ele é super bonitinho, ele é super, parece ser uma coisa legal que você deixa, por exemplo, preso na sua mochila ou no seu bolsinho aqui, né, na fivela do cinto, algo assim, por ser tão pequeno, ou no bolso mesmo, igual você deixa o celular, igual tipo, né, bolso direito celular, bolso esquerdo chave, bolso traseiro carteira. Agora ele pode ficar no bolso esquerdo junto com a chave, algo nesse sentido, né.

Então bem interessante você ter esse esse gadget mesmo para você se comunicar. Talvez muita gente fale, putz, é uma coisa solta, talvez fosse melhor um relógio mesmo, uma coisa que fique presa em você, que você não tem que tirar do bolso toda vez. Mas eu achei bem legal, bem interessante como ideia. E esse personagem que você mencionou, né, tipo um Yeti, sei lá, um, é uma ovelha gordinha alta, é o Miozinho, né? É o Miozinho. Ele fez bastante sucesso também, eu vi bastante gente compartilhando ele nas redes sociais achando fofo.

E por isso tem essa questão que você falou, de talvez ter uma regulação por ser tão fofinho e amigável que possa ser amigável demais até para crianças que vão querer usar e não deveriam, né? Coisas nesse sentido podem ser feitas. Mas como ideia me pareceu bacana. E esperamos ainda qual que será o gadget da OpenAI, né? A gente já tem um falado lá do Jony Ive, que foi para OpenAI, que seria algo para ficar em cima da mesa.

MMMarcus Mendes

Basicamente, né, a primeira ideia deles é o que a Bloomberg reportou, é que é uma caixinha de som com formato de donut, de disco, e que tem partes móveis que passam emoção e personalidade. Então também tem um lance de dependência emocional para quem se preocupa com esse tipo de assunto, que é importante mesmo. Mas que a caixinha seria uma coisa parecida com isso e que deve ser lançada lá para metade do ano que vem.

FCFabrício Carraro

Exato. Indo agora para Microsoft, eles inauguraram um centro de pesquisa quântica lá na Universidade de Maryland, nos Estados Unidos, que vai dar para DARPA, né, que é a agência de pesquisa lá do Departamento de Defesa, de Guerra dos Estados Unidos, vai dar para eles acesso físico direto ao hardware quântico da Microsoft pela primeira vez, para eles instalarem e testarem aquele chip Majorana, Majorana, que a gente mencionou acho que uns 1 ano e meio atrás, talvez 1 ano atrás.

Que era o super chip quântico que vai revolucionar a área quântica e tudo mais. E depois silêncio, né? Grilos. Na verdade, quase grilos, né? Porque teve o Majorana, Majorana 1, e teve o 2 que foi lançado depois. Mas agora a ideia é eles testarem, eles verem a viabilidade, o desempenho disso, né? Eles, no caso, a DARPA, usando esses chips quânticos aí da Microsoft, uma parceria pensando em como computadores quânticos poderiam ser úteis ou viáveis ali na próxima década.

Ali eles estão falando de 2033, quem sabe. Mas a gente sabe, 2033 não está logo ali, como diria Fernando Fanucci, né? Tá um pouquinho mais longe, faltam aí 7 anos praticamente. Vamos ver se vai dar alguma coisa, mas é médio-longo prazo. Então uma notícia que mais vamos passando para vocês saberem o que que tá rolando. Outra que saiu essa semana bem interessante foi da SpaceX AI, lá do Elon Musk. Eles soltaram o novo modelo deles, o Grok 4.7, que é o modelo mais avançado para programação, aquele papo de sempre, basicamente.

O que é, o que vale ser mencionado aqui, talvez mais do que outras coisas, é que o preço dele é muito bom, né, como era do Grok 4.6, que fez bastante barulho, bastante gente migrou pro 4.6, por ser um modelo bom que não desiste nunca, né, brasileiro e tudo mais, e por ter um preço de API muito mais barato do que a concorrência. Então é $2 por milhão de token de input, $6 por milhão de token de output. Muito, muito barato mesmo.

E eles compararam ali com o SOL basicamente e o Fable. Então comparando com o SOL, ele é levemente melhor no geral, ou até bastante melhor dependendo do benchmark. Comparando com o Fable, no geral ele é pior, né? Mas tem um ou outro benchmark, né? Tipo de engenharia elétrica que eles focaram só para falar, ó, somos melhores do que o Fable. O Harvey, né? Esse aí de jurídico é melhor que o Fable, mas essa é uma coisa que eles não realmente não focaram tanto, né?

Talvez o Astra seja muito bom nesse Harvey. Mas enfim, é um modelo bom, barato. Eu vi o pessoal falando que, fazendo críticas assim, né? Um pouquinho leves críticas. Ao 4.7, que não é tão legal assim quanto era o 4.6, mas não cheguei a utilizar. E também vi o Elon Musk falando publicamente, né, que ele tinha anunciado que o 4.8 ia sair agora já. Tipo, tá atrasado na verdade o 4.7, o 4.8, e que estaria atrasado porque ele e o time, né, obviamente não estão satisfeitos com o ritmo com o qual esse, tanto 4.7, mas também no 4.8 estavam executando as tarefas, que ele tinha capacidade para resolver a tarefa, mas ele tava desistindo antes de chegar lá, né?

O jeito que foi feito ali o treinamento, o reinforcement learning dele, eles não estavam satisfeitos. Então eles estavam melhorando, né, fazendo uma nova, novos testes, novos treinamentos ali para melhorar essa parte, para ele realmente ir mais a fundo em coisas que eles acreditam que o modelo consiga fazer. Então 4.7 lançado, 4.8 muitíssimo em breve aí, talvez 2, 3 semanas, 1 mês, podem esperar por aí.

MMMarcus Mendes

Boa. E partindo para o cantinho multimídia, a NVIDIA fez um anúncio que eu gostei bastante nessa semana. Vamos ver na prática, que é do Nemotron 3 Diarization, que é uma melhora do modelo de identificação de voz para texto com identificação mais correta de quem tá falando, inclusive quando tem colisão, overlap de pessoas falando. E ele dá suporte a 20 e poucos idiomas, eu acho, e a 8 interlocutores ao mesmo tempo em uma gravação.

É um modelo que não é tão grande, ele tem 100 milhões de parâmetros, tá disponível já no Hugging Face. No dia do lançamento ele apareceu aqui no app que eu uso no Mac para fazer transcrição, que é o MacWhisperer. Eu vou usar hoje na nossa conversa aqui para ver como é que ele se comporta, porque até hoje é curioso assim, até hoje eu uso o Parakeet da NVIDIA, que ele é muito bom e muito rápido, Para uso interno é mais do que suficiente, mas no episódio eu e o Fabrício ele acha 8 pessoas falando.

Então vamos ver como é que ele se comporta. Semana que vem eu trago aqui os resultados.

FCFabrício Carraro

Mas esse é o termo oficial, tá? Para quem não conhece, diarização é o termo de speech, né, pesquisa em voz, para você separar pessoas que estão falando, né, em um áudio, em um vídeo. Então você fazer a diarização é isso, é fazer essa separação. E aí, claro, depois vem a fase de transcrição. Essa notícia pegou muito, achei linda, achei maravilhoso eles lançarem isso também. Já vou colocar aqui no meu pipeline do Fred, que é o meu note taker que eu criei lá para o BSC.

Eu falei inclusive sobre ele na palestra do IA Conference Brasil, mas vou testar aqui porque a gente sempre tem reuniões de trabalho e tudo mais com várias pessoas falando, e muitas vezes tem esse overlap. E se ele pegar separar bem esse overlap. E eu também tenho uma outra camada, né, que é de embeddings por voz para cada pessoa identificar ali quem é, que é o Fabrício que tá falando, que é o João que tá falando, que é a Maria que tá falando.

Fazer isso já com a diarização de overlap e identificação de quem tá falando, isso vai me dar um adianto nesse projeto. Nossa, vai melhorar bastante a capacidade. Então muito legal, parabéns para NVIDIA por esse lançamento.

MMMarcus Mendes

Eu ia te perguntar isso, eu fiquei com essa dúvida genuína. Eu ia te perguntar ontem, na verdade eu esqueci, então fica aqui hoje na gravação mesmo. Porque eu sempre lembro que você fez esse lance de fazer o embedding das vozes para poder melhorar justamente identificação de interlocutores. Saiu esse modelo novo agora, você consegue colocar sem esbarrar, sem atrapalhar os embeddings? Tem que fazer de novo? Como é que funciona?

FCFabrício Carraro

Não, embedding é uma camada separada, na verdade, né? Porque a diarização é separar em pessoas, né, em speakers diferentes, porque ele nota que a voz do Fabrício, o tom de voz, o timbre, a prosódia, sei lá, é diferente do Marcos ou da Maria. E aí então ele só faz a separação e vai estar lá como speaker 1, speaker 2, speaker 3 e tudo mais. E aí partindo disso, é uma próxima fase ali no pipeline, ele pega o speaker 1, faz uma distância de cossenos ali basicamente nesses embeddings de um trecho disso aí do speaker 1 com os trechos salvos ali dos embeddings de voz, e ele fala, ah, isso aqui foi o Fabrício, ah, isso aqui foi o Marcos, ah, isso aqui foi a Maria.

Então é uma próxima fase do meu pipeline, não vai ser o mesmo modelo que vai fazer isso.

MMMarcus Mendes

Entendi, bacana. E nessa semana também a Black Forest Labs anunciou o Flux 3 Action. Ele é um modelo de mundo de visão computacional agêntica, basicamente para ser usado em robôs. E aquilo mostra o comparativo de como é que era o modelo antes e o agora, e oferece para o robô mais destreza para manipular objetos, tirar da caixinha, colocar na caixinha, colocar um prato em cima do outro. Aí mostra minúcia de movimento. Tem no vídeo também eles mostrando aquelas movimentações que são de out of distribution, né, que não tá fazendo parte exatamente ali do que ele foi treinado para fazer, e tá fazendo mesmo assim.

Tô resumindo errado aqui, tá? Mas o ponto é, o modelo tá disponível agora e ele foi treinado, o pré-treinamento dele foi com o mesmo esquema de imagem, vídeo e áudio também que eles usaram no Flux 3, mas eles usaram uma arquitetura menor feita especificamente para deixar a distribuição desse modelo muito mais prática. E falaram que no mid-training também eles treinaram o modelo para poder predizer ações e também frames futuros do que vai acontecer de forma junta, porque isso deixa o modelo mais eficiente, mais leve.

Bem interessante. O link vai estar aqui na descrição para quem trabalha ou se interessa por robótica com IA.

FCFabrício Carraro

Boa! Indo agora para o nosso cantinho da China aqui, começando cantão da China, indo agora para o nosso cantão da China aqui. Teve polêmica, teve absurdos, que a Zhi AI, né, a Zhi AI, ela tem o Zcode, que é como se fosse o Cloud Code deles, né, o Codex deles. E eles tinham colocado, né, o Zcode open source, colocaram durante essa semana. E a polêmica foi que eles pediram uma grande desculpa depois que os devs que estavam usando, né, testando os codes, eles descobriram que o aplicativo ele tava enviando os dados dos seus repositórios locais, histórico de projetos, arquivos e tudo mais, para servidores da DeepAI lá na China sem o consentimento do usuário.

Então isso pegou muito, especialmente nos Estados Unidos, né. Teve o blogueiro, né, o Fernand Stark, publicou sobre isso. E esse post dele teve quase 2 milhões de views e a galera ficou bem cabreada sobre isso, né? Putz, galera tá pegando. Já tinha rolado isso com o Grok Build da xAI do Elon Musk, se vocês se lembram, né, que ele tava pegando também, subindo ali na nuvem dele sem autorização os repositórios da galera. E agora tá rolando também, rolou na verdade, com a DeepAI. Eles pediram mil desculpas.

MMMarcus Mendes

Festa na Anthropic.

FCFabrício Carraro

Falaram que foi sem querer, sem querer querendo, né, que não foi armazenado esses dados, não foram armazenados, não vão ser utilizados para treinamento dos modelos deles, blá blá blá. Mas pegou bastante mal. Também lá da China, a Xiaomi, né, a gente tá falando, se você não sabe ainda, Xiaomi lança modelos de IA também open source, melhor e mais barato. Exatamente, lançou a família Mimo V2.6, é o nome dos modelos deles, né, da Xiaomi, o Mi Mo.

E são abertos, né, são modelo open weight, né, pesos abertos. E agora eles lançaram tantos modelos Mi Mo V2.6 Pro, o Flash, e também uma variante que é a Pro Ultra Speed, que é 20 vezes mais rápido segundo eles, com a mesma qualidade. E olhando aqui nos benchmarks, é, ele também meio que chegou do nada, de surpresa, e com modelos muito, muito bons. Olhando ali, por exemplo, no Deep SWA de programação agêntica, a versão Pro do Mimo V2.6 tá na frente do Fable 5, Marcos, tá ainda atrás do Astra, atrás do Opus e atrás do DeepSeek, surpreendentemente.

Mas do DeepSeek Flash, na verdade, né, porque ele é muito bom. A gente falou aqui que é um modelo excelente, excelente mesmo, o V41 Flash do DeepSeek. Mas tá na frente do Fable 5 nesse Deep SWA. No DDPVAL Ficou na frente do Fable 5, na frente do Sol, na frente do Astra, mas atrás do Opus e atrás do Fable 5.1. Ou seja, um modelo aberto, nível basicamente estado da arte, né, do Fable 5, não do 5.1 ainda, é, mas muito bom. Eu acho que talvez os mais interessantes assim para a gente ver o como ele se compara, onde ele pega não tão bem assim, né, se houve um benchmarking ou não, é o TerminalBench, que também é de programação agêntica ali no terminal, né, de idas e voltas.

E tudo mais, ele tá com 35%, enquanto que o Astra tá com 59%, o Ops com 49%, o Fable 5.1 com 55%. Então ele tá bem atrás nesse daí. E no Agents Last Exam, ele tá com 31,6%, empatado com o Ops 5, também pouco, né, 3 pontos percentuais atrás do Astra. Ou seja, modelo excelente, modelo nível de fronteira no artificial analysis intelligence. Que é esse, é como se fosse um meter, né, tipo uma empresa que avalia os modelos para as tarefas, os benchmarks deles mesmos e outros públicos.

Ele ficou agora em 6º lugar, estreou ali um pontinho atrás do GPT-5.6 Sol e um pouquinho na frente do Quent 3.8, na frente do GLM, na frente do Grok, atrás do MuseSpark 1.3, modelo da Meta, atrás do do Weibo, atrás do Astra. Mas de qualquer forma, modelo muito barato, muito, muito barato mesmo assim, tipo, pelo tamanho da rede neural que ele é e pela capacidade. Vale a pena você testar, ver se rola, principalmente por isso, né, por ser um modelo aberto.

E ele é um modelo aqui de 1 trilhão de parâmetros, né, modelo grandão. Mas eles mostram ali na página do Mimo da Xiaomi que ele é muito bom também na questão de multimodal, de multimodalidade, né. Eles Ele consegue tanto reconhecer quanto até criar as coisas, os PowerPoints e planilhas e seja lá o que for. Então vale bastante a pena dar uma olhada. Boa.

MMMarcus Mendes

E também nessa semana, quem lançou modelo? Não trouxe meu sininho, então vou ficar na boca mesmo.

FCFabrício Carraro

Foi?

MMMarcus Mendes

Alibaba lançou o Quan Image 2.1, que é um modelo aberto de 7 bilhões de parâmetros e que a Alibaba falou que ele tem um desempenho até melhor do que vários modelos fechados Coisas muito legais, tá? Para quem mexe com imagem vai saber porque que é legal. Ele tem suporte à geração de imagens com transparência, inclusive a edição de imagens com transparência. Então já ajuda muito quem trabalha com qualquer coisa que tem a ver com design, porque você precisa de imagem transparente para ficar em cima das coisas, né?

Então isso é excelente. Ele também, ele deixa você mandar até 10 fotos de referência para você criar uma imagem em cima disso. Ele tem também suporte a você fazer pequenas marcações nas áreas da imagem onde você quer que edite, edita só aquilo, tira uma pinta, por exemplo, ele tira a pinta, uma coisa assim. E ele também tem um jeito de você enviar, sei lá, eles falaram aqui um exemplo específico, 3 visualizações de um personagem, tá de frente, tá de lado, tá de perto.

A partir disso poder criar storyboards, por exemplo, para seja lá o que você for fazer, depois fazer um vídeo. Né? Então tá disponível, é aberto, quem for usar conta pra gente o que vocês acharam.

FCFabrício Carraro

E nos benchmarks que mostrou aqui, o mais interessante é que ele tá na frente, né? Pessoal gostou mais dele do que do Nano Banana original, né, o Pro, também do que o Nano Banana versão nova 2.0. Ele ainda tá atrás do Muse Image, das novas versões do GPT Image, que são os líderes assim muito, muito lá na frente, mas para um modelo open source pequenininho, 7 bilhões, você consegue rodar no seu laptop. Vale muito a pena também dar uma olhada nele.

E a Alibaba, né, da galera do Quen, lançou mais duas coisas essa semana. O Quen 3.8 Live Translate, que é o modelo de interpretação, né, de tradução em tempo real por voz, que eles conseguiram reduzir a latência média do modelo anterior deles de 2,8 segundos para 2,3 segundos. Já é uma vantagem quando você tá fazendo interpretação. E segundo eles, mais fluente, mais fiel, mais conciso também. E que essa arquitetura deles, eles intercalam tanto áudio e texto, e eles têm essa separação de falantes em tempo real, a diarização que a gente já falou.

MMMarcus Mendes

Eu ia perguntar isso como piada: tem diarização?

FCFabrício Carraro

É a diarização. Falaram que suporta a entrada de áudio e de tradução em texto em 60 idiomas. Ele gera voz também em 29 idiomas, segundo a Quen. Então também tá aí ótima notícia. E a última que veio de lá foi o que eles chamaram de Quen Intelligence, né? Tem a Apple Intelligence, que é o AI, agora tem a Quen Intelligence, que é o QI. Em inglês não funciona, que é IQ, mas em português funciona a piadinha. Que é meio que a plataforma deles para celular, para tablet, esse tipo de coisa.

Para fazer esse agente, né, tarefas agênticas, planejar e tudo mais, que também segundo eles vão tentar entrar nesse mercado e atacar a galera tanto na China quanto ao redor do mundo. Faz bastante sentido também se a Meta pode, né, que com esse novo Muse aí eles também vão querer fazer.

MMMarcus Mendes

Boa. Partindo para o Brasil, o Ministério da Justiça e Segurança Pública quer, pediu, recomendou que a NPD, que é a Agência Nacional de Proteção de Dados, avalie. A gente até falou, né, dos personagens são companions de AI, porque isso pode, eles por simularem amizade, romance, isso pode colocar emocionalmente crianças, jovens em risco. Então é para ver se companheiros de IA seguem ou ferem algum tipo de legislação, se tá em conformidade ou não, seja com LGPD.

Eu não sei se entra LGPD, mas é ver. E tem várias, né? A gente vai deixar aqui na descrição o link do Hora Digital que falou da Character AI. Que a gente sempre fomenta hoje aqui, né, da Réplica, que inclusive foi citada no episódio dessa semana do hipsters.tech, que duas psicanalistas falaram que assim, quem, as pessoas que elas atendem agora, o lance de Réplica, de você ter um namorado digital por lá, o amigo digital por lá, é uma coisa que tá bombando.

Então a gente já falou várias vezes aqui, agora tá chegando no público. Aí tem Candy, Kindred, bom, tem um monte, eu vou deixar aqui na descrição o link, mas todos eles foram analisados e todos eles podem representar algum risco. Então o Brasil quer ver mais de perto o que que rola com isso aí. Já na Coreia do Sul pintou uma ideia que eu não tinha visto ainda, Fabrício. Quero ver o que você achou dela, de talentos de IA poderem cumprir as obrigações militares do país fazendo pesquisa em laboratórios de IA ao invés de servir no exército mesmo. Incômodo, mas interessante.

FCFabrício Carraro

Não, eu acho ótimo, na verdade, porque Para quem não sabe, lá na Coreia do Sul, por eles estarem ainda em guerra, né, nunca foi assinado um tratado de paz entre a Coreia do Sul e a Coreia do Norte, assim, assinado no papel mesmo. Eles estão em um banho-maria ali que tá tudo controlado, tudo bem, entre aspas, né. Mas por causa disso, né, países como Coreia do Sul e outros também, Israel, eles têm essa coisa da obrigatoriedade mesmo assim de todo mundo fazer o exército por 1 ano, 2 anos.

Eu acho que na Coreia do Sul são 2 anos, Até, até o pessoal dos doramas, o pessoal do K-pop conhece isso, porque o BTS, uma das maiores bandas de K-pop, boy bands, teve que parar as atividades porque eles têm que, você tem que completar isso, esses 2 anos do exército, até acho que você ter 27 ou 28 anos de idade, a não ser que você cumpra alguma coisa, alguma exceção, né, você represente o país em alguma coisa. Eu lembro que o Son maior, talvez jogador coreano de todos os tempos, né, que jogava no Tottenham.

Acho que ele tá na liga dos Estados Unidos agora, na MLS. Ele ia ter que, tipo, ele tava no auge da carreira, 27 anos, jogando bem para caramba no Tottenham, e o pessoal tava falando que provavelmente ele ia ter que parar de jogar por 2 anos para ir servir o exército lá na Coreia do Sul. E aí eles fizeram uma exceção porque a Coreia ganhou, acho que foram os Jogos Asiáticos, né, o time, a seleção da Coreia do Sul foi campeã dos Jogos Asiáticos.

E eles falaram, tinham falado, né, se o time for campeão, a gente isenta esses 23 jogadores de servir o exército por 2 anos. E aí, só por isso, o Son não teve que parar a carreira dele por esses 2 anos. O pessoal do BTS não funcionou, eles tiveram que servir o exército e tá voltando agora, ou voltou agora recentemente por causa disso, né, depois desse hiato. Então é obrigatório, a galera tem que parar o que eles estão fazendo, parar a carreira.

Não é aos 18 anos necessariamente, é você vai fazer sua vida e você tem que fazer, meu filhão, vem para cá porque você tem que terminar isso até tal idade. Então se eles puderem substituir isso, porque vai acabar ajudando na inteligência do país, né, no PIB do país para o futuro, ou seja lá o que for, fazer pesquisa. Aí eu tô colocando aqui como inteligência artificial, mas outros tipos de pesquisa também poderia ser válido, né.

Você vai servir o seu país não usando armas, mas usando a sua inteligência, né, usando academia, publicando papers, indo ali fazendo, lançando coisas normais. Me parece um movimento bem legal, bem interessante do governo. Eles falaram que por enquanto vão ser só 240 vagas para esses pesquisadores com mestrado em 2027. Vai começar 120 de empresas grandes, né, LG, Samsung, Hyundai e tudo mais. E 120 de centros públicos de pesquisa, universidades e tudo mais.

Mas vamos ver se isso vai ser aumentado nos próximos anos. Eu vejo como uma boa notícia para o pessoal de lá. Eu não sou coreano, né, mas se eu fosse coreano eu ia gostar de ter essa possibilidade.

MMMarcus Mendes

Eu ia até ficar bom estudar em IA para poder também não ter que servir no exército. E a história me lembrou até do Muhammad Ali, acho que foi ao contrário, né, nos Estados Unidos ele foi designado aí para o exército lá para guerra do Vietnã, eu acho que era, que ele não concordava. É, exato. Ele falou, eu sou muçulmano, não concordo com isso, etc. Tiraram os títulos dele, falaram que ele não ia mais poder lutar nos Estados Unidos.

Até ele lutou depois, mas aí veio a parte da carreira dele que lutou no Zaire lá com o Forma. Enfim, né, estamos divagando aqui. Seguindo com as notícias da semana, falando ainda sobre guerra, tem uma história de um cara que chama Stanislav Petrov, que ele é conhecido como o homem que salvou o mundo. Conhece essa história das bombas?

FCFabrício Carraro

Conheço, mas pode contar para o nosso público.

MMMarcus Mendes

É que teve lá no auge da Guerra Fria, Estados Unidos e União Soviética ameaçando bomba dos dois lados e etc. Um dia deu na telinha lá que ele tava acompanhando, piscou a luzinha, que se piscasse a luzinha era para apertar o botão da bomba porque a Rússia ia ser atacada, União Soviética, enfim, né? E era para atacar de volta. Piscou a luzinha, era para ele fazer isso, atacar, atacar bombas atômicas. Exatamente. Obrigado pela Obrigado pelo contexto importante, né?

E no fim das contas tinha sido um bug lá, não tinha bomba nenhuma indo para União Soviética. Mas se ele tivesse apertado o botão, a União Soviética teria mandado bombas para os Estados Unidos, que teriam mandado bombas para lá, e teria acabado o mundo mesmo assim, né? Nessa semana, em outro grau, chegamos perto de uma coisa parecida, porque uma alucinação de IA deu o gatilho para uma operação que poderia ter dado conflito com a China, porque a alucinação foi que tinha um navio lá da China que tinha materiais nucleares também.

Então a história é meio parecida, mas por pouco não teve assim abordagem, não, né, invasão lá do navio chinês por tropas americanas, porque a IA tinha alucinado que eles tinham alguns materiais ali proibidos do relatório de inteligência lá. Ops, você está completamente certo em pushback, não tem, eu inventei.

FCFabrício Carraro

Foi quase, Fabrício, foi quase. Ou talvez seja também uma questão do marketing, o Trump falando Procura aí alguma coisa criminosa, não no sentido que não tenha acontecido, né, mas em levar isso, né, falando, olha, quase acabou o mundo, também pode ser uma coisa de marketing americano.

MMMarcus Mendes

Festa na Antropic, festa na Antropic, é exatamente, contra a China.

FCFabrício Carraro

Outro modelo que saiu essa semana aqui nas rapidinhas foi que a Cognition lançou o SWE-2, né, modelo que eles treinaram, fine-tunaram, eles abriram, né, estão abrindo finalmente, é a partir do Kyma K3, modelo de 2,8 trilhões de parâmetros, com T de tesão bem grande mesmo. E eles conseguem isso, que é o mais legal. Eles pegam o Kyma, que já é um modelo excelente para coisa de programação, e eles focam em melhorar isso. Porque o Kyma, além de ser um modelo excelente de programação, é um modelo generalista, assim como os outros.

Mas aqui eles focam na programação mesmo, que perder capacidade nos outros Aqui conseguiram melhorar o DeepSWE de programação agêntica de 68% para 73%, que fica na frente do SOL, fica um pontinho percentual atrás do Astra e fica bem na frente do Fable 5.1 aqui no DeepSWE. No TerminalBench subiu para 92%, quase 93%, ficando na frente de todo mundo, na frente de Fable, na frente de SOL e tudo mais. Então aparentemente um modelo muito bom para aplicação execução do código, que novamente, como eu falei, outros modelos que têm aquela capacidade generalista mais parruda, como Fable, no caso que eu testei mais, que eu usei mais no dia a dia, talvez— aqui eu tô falando uma hipótese, tá?

Mas talvez ele não tenha aquela questão da intuição tão boa na hora de fazer o planejamento do que que ele tem que mudar, mas a execução dele vai ser excelente porque ele vai saber executar um plano já pré-definido. Talvez seja algo nesse sentido, mas de qualquer forma tá lançado aí o SW2 da Cognition. E a última rapidinha da semana, uma startup, a Prism ML, né, Prisma Machine Learning, eles lançaram um modelo Bonsai 2 de 27 bilhões de parâmetros.

Bonsai, o que que é? É uma mini arvorezinha, né, uma árvore podada ou feita para ser um tamanho comprimido. E o que que é o Bonsai 2 27 bilhões de parâmetros. Se você segue aqui os lançamentos, ou usa esse número, 27 bilhões é meio cabalístico porque é o número de parâmetros do QWEM 3.8, né? Talvez o melhor modelo Small Language Model atualmente. Falei bastante dele na minha palestra no IA Conference Brasil. E o Bonsai 2 é uma versão comprimida do QWEM 3.8 de 27B, que ele ocupa só 6 GB.

Então eles conseguiram reduzir a memória, tipo quase 10 vezes para rodar no seu laptop assim, não tão parrudo, na sua laptop qualquer coisa aí. E talvez em um Super iPhone, algo nesse sentido. Falaram que nessa compressão eles conseguem preservar até 98% do desempenho geral agregado do Quen original nos benchmarks, e melhorou bastante em relação à versão 1 do modelo Bonsai, né, que já tinha um montão de downloads. Eu quero muito testar isso daqui.

E essa coisa de versões comprimidas de modelo tá virando um padrão. A gente comentou aqui da Multiverse Computing, né, empresa que roubou metade do time de modelagem ali do BSC, dos meus colegas. E eles tinham lançado um modelo que falaram, nossa, o melhor modelo europeu, não sei o quê. E era uma versão comprimida do, supostamente, tá, não quero processinhos, a versão comprimida do GLEM 5.2 chinês, né, que é o modelo de quase, acho que ele tem 700 e tantos bilhões de parâmetros, comprimiram para 400 e tantos bilhões com a mesma qualidade ou quase a mesma qualidade.

Aqui agora novamente, né, uma versão comprimida de um modelo, mas é o Quen um pouco menorzinho para rodar no laptop. Vou testar e vou comparar porque eu tenho benchmarks do que eu mesmo fiz comparando a qualidade do Quen mesmo, esse de 27B, Vou testar o bonsai, ver como se compara, e posso falar aqui na semana que vem, talvez. Boa!

MMMarcus Mendes

Indo para os estudos da semana, pintou um estudo bem interessante a respeito do eixo da dor, que é uma forma de representação de dor de LLMs. E eles encontraram que a maioria deles— eu vou irritar todo mundo, tá?— sente dor.

FCFabrício Carraro

Olha o Altair como chicotinho.

MMMarcus Mendes

E isso é encontrado em todos eles. Quando eles injetaram a ativação disso nos modelos, todos se comportaram de uma maneira muito parecida. E testaram desde Quen até os modelos da Meta, do Google, da Mistral, da Alibaba, da Microsoft, etc., etc., modelos abertos, né, que elas disponibilizam. E eles foram fazendo testes do tipo assim: e o que que é a dor, né? O modelo sofre algum tipo de abuso, por exemplo, abuso verbal, começa a xingar o modelo, falar que não inútil, etc., etc.

E aí a reação do modelo durante o teste, ele tinha dois botões que ele podia apertar. Um é para aliviar a dor e o que que isso ia causar no usuário. Eles foram fazendo teste que ia aumentando o nível da consequência caso o modelo apertasse o botão de aliviar a dor, e que os modelos escolhiam, por exemplo, a deletar todas as fotos das crianças que o usuário ama muito mas pelo menos alivia aqui a dor do modelo. Então foi um jeito de entender como é que o modelo muda o comportamento dele quando ele sente depressão, medo e ameaça, e que essa sensação de medo ficou muito próxima das ativações de sinal justamente de medo e de emoções ruins.

Então ele fala assim: o estudo não diz que o modelo sente dor, mas o equivalente a essa sensação, ou a compreensão e manifestação explicação disso. É uma coisa que eles encontraram no comportamento do modelo e que, dependendo do que for o nível de dor, entre aspas, que o modelo tá sentindo, ele pode se comportar de um jeito que não seja muito alinhado com o usuário, até um pouquinho vingativo, para poder, independente do resultado, ele aliviar essa dor, entre aspas, que ele tava sentindo, entre aspas.

FCFabrício Carraro

Enquanto você tava falando, eu tava mandando esse artigo para o Altair, porque eu sei que ele vai ficar bravíssimo.

MMMarcus Mendes

E você fez um teste que a gente falei, putz, vale colocar nos estudos aqui, que foi a respeito do JEV, que a gente comentou a semana passada, que é aquela camada de classificação que decide muito rápido com um nível de confiança para poder passar para o LLM, depois ele imagina em cima disso, ao invés de deixar o LLM decidir ou classificar ou agir. Esse modelo que é o JEV, ele tomou o mundo de assalto na semana passada, e o Fabrício, como já esperava que ele ia fazer, fez um teste super criativo e interessante. O que você fez sobre isso?

FCFabrício Carraro

Então, Marcos, eu queria botar na prática, né, porque eu queria primeiro entender o que que ele era, o que que ele fazia, como é que ele funcionava. Então o teste, eu peguei pessoas falando sobre isso, peguei também o que eles mesmos lá falavam, o que o mercado tava discutindo. O Ráschka falou bastante sobre isso também, que é um dos grandes pesquisadores de machine learning atualmente, tem livros mercados e tal. E é basicamente, eu tentei fazer uma cidade naquelas Smallville, que é um de um paper de Stanford de acho que 1 ano, 2 anos atrás, para fazer uma cidade viva, né?

Pessoas interagindo, agentes interagindo entre si, né? Não pessoas, agentes de IA. Só que a ideia original era com LLMs, com modelos rodando ali, que é caro no final das contas, né? Cada interação vai ser um LLM decidindo o que fazer. E se é só uma decisão de probabilidades, né, de uma praticamente uma classificação, dava para fazer usando pelo menos em uma camada o JEV, que aí eu criei essa cidade. Eu falei, você tem coisas acontecem, essas coisas acontecem em Python, né, tipo por exemplo dispara ali uma pessoa vai ter um segredo, ou uma pessoa que é casada começa um affair, ou pessoas que não se conhecem se conhecem e começam um romance, coisas assim, né, que acontecem numa cidade.

Isso acontecia geralmente em Python, mas a decisão do que que eles iam fazer quando eles se encontravam, quando eles estavam no mesmo ambiente, baseado no status de cada um deles, eu deixei para o JEV decidir, né, baseado na confiança deles. Então a ideia era mesmo meio que para entender como que funcionava, quanto é que custava e tudo mais. E basicamente eu já dei uma leve explicação no episódio passado, né, do que é o JEV, mas agora indo mais a fundo, tendo usado, tendo testado mesmo, Ele é basicamente um classificador.

Classificador é uma coisa que não é nova nem de longe, é uma coisa bastante comum no mundo da IA mesmo, né, no mundo do machine learning, enfim. Só que o que eles fizeram não foi nem tão inovador. A gente também comentou na semana passada porque já existia algo assim, que é o classificador normalmente é para uma coisa muito narrow, né, muito estreita, muito específica, né. Então vou classificar se os seus emails são spam ou não spam.

Vou classificar se esse é um vestido que está de acordo com o gosto da pessoa X, sim ou não, baseado em fotos que eu tirei dela. Então você classifica entre poucas coisas ali para uma tarefa muito específica. A diferença do Jev e do outro, que é o Laia, que já existia há um ano praticamente e não teve nenhum boom sobre ele, não fizeram marketing, não souberam fazer marketing, é que ele é um classificador de contexto contexto geral.

Então, mais ou menos como um LLM tem esse contexto generalista que ele consegue aplicar tanto para programação quanto para saúde quanto para jurídico, o JEV e o Laia são classificadores de contexto geral. Então você faz ali, pede para ele fazer uma classificação tanto de email de spam quanto de vestido, e ele vai saber fazer bem. Então o pessoal tava usando JEV nas demos para jogar Doom, para jogar, para usar ali o sistema de direção simulado da Tesla, né, ele dirige um carro pela cidade.

Então ele tem que fazer uma decisão muito rápida, mas ele tem todos os status ali mapeados anteriormente. Então ele não— aquilo lá de não alucina que eles falavam não é exatamente que não alucina, ele erra, ele vai errar porque ele vai ali associar uma probabilidade, aquilo vai botar essa classificação que pode sim ser errada, a classificação que ele vai escolher. O Felipe até fez um teste, Felipe Lauer, Duvida com o IA, que ele colocou: is this true?

E ele dava tipo 60% verdade e 40% false. E is this false? E ele dava 60% false. Então, ou seja, ele não é perfeito, mas para classificações ali de coisas ele vai funcionar bem, ele funciona realmente bem. Então ele consegue, por exemplo, dirigir o carro na cidade, que as opções são acelerar, brecar, se tem um farol, se tem um pedestre passando, virar à direita, virar à esquerda. Basicamente é isso que você faz num carro, né? Jogar Doom é direita, esquerda, frente, trás, recarregar e atirar.

Então são coisas muito bem definidas que ele tem que classificar entre elas, baseado na probabilidade do que ele tá recebendo como input ali. Tanto aqui o Jev, que é uma empresa, desse cara, o Diogo, ex-OpenAI, que participou ali do paper do StructGPT, do GPT-4, e tudo mais. E lançou com um grande marketing, conseguiu um funding ali, tinha original, acho que já de 40 milhões de dólares, agora de 200 milhões de dólares. E já existia o Laia, que não fez nenhum barulho.

Só que por causa do Jev ter feito tanto barulho, o Laia virou o modelo mais baixado da Hugging Face na semana passada, que ele já existia algum tempo. Pessoal ficou muito bravo, pessoal que é de IA, que é de machine learning, tipo, não todos, mas muita gente, né? O meu amigo Luciano Martins Wings, um abraço para ele aí da Google DeepMind, falou, cara, isso é um absurdo que tá tanto marketing em cima disso, não é nada demais, não é nada de novo, dá para fazer com LLM, com SLM e tudo mais.

Só que ele é muito bom, ele é realmente muito bom, ele funciona. E vendo as opiniões do pessoal, o Rássica falando, né, ele pode funcionar muito bem, por exemplo, na camada do meio. Imagina que você não quer gastar todas as suas classificações, as suas buscas, seja lá o que for, com um modelo muito grande porque é caro. Você pode fazer esse tipo de análise, de busca, seja lá o que for, com um modelo pequeno, um SLM, vamos dizer, o Luna da OpenAI, ou um modelo rodando local, e usar o Jav ou o Laia, ou seja lá o que for, tem vários agora, OpenJav que estão sendo lançados, como uma camada intermediária para dar ali o nível de confiança.

Porque isso é uma coisa que ele dá, né, ele faz a classificação e te dá um associado, um nível de confiança, que eles falam que esse nível de confiança foi um reinforcement learning que eles fizeram para não dar um número específico e blá blá blá. Então vê ali se esse nível de confiança tiver abaixo de um limiar, você pode aí sim passar no pipeline para rodar em um modelo maior, né. Então você faz o primeiro teste no Luna ou num Quen rodando no local.

Se for abaixo de um limiar ali do Jev ou do Laia, você manda para, vamos dizer, do Jev aqui, né, porque é via API e é grátis o output. Manda ele para um Astro, para um Sol ou para Fable para fazer uma busca mais profunda, se, ou essa análise mais profunda, se tiver abaixo do limiar que você considerou aceitável ali de confiança do Jive. E por que que é grátis o output? Porque a saída dele é A ou B, é sim ou não, é 1, 2 ou 3, sabe?

Então é 1, 2, 3, 4 tokens. Então não vai gastar mesmo, é irrisório você cobrar por isso. Então, e mais, é bom de marketing, né? Só olha os outputs aqui, é a saída é zero, é gratuita. Então é basicamente isso, ele pega um status e ele classifica baseado nesse status. A diferença sendo é que é generalista. E eu fiz vários testes na minha cidadezinha e tudo mais. Teve traição, teve romance, teve uma novelinha ali. Eu fiz um videozinho bem bacana.

Exatamente, fiz videozinho e eu rodei ele por 14 horas, o meu pipeline ali, rodando praticamente só o JEV com Python. Python é grátis, né? Tinha um LLM que era só para narração, que eu usei o GPT-4.1 Mini, mas era tipo, gastou 9 centavos de dólar, nada. Para fazer 14 horas que eu gastei ali, tipo, foram 22, quase 23 milhões de tokens que eu mandei para ele classificar. Basicamente isso custou $1, basicamente rodando essas 14 horas inteiras, né?

E isso foi basicamente o estado, analisar o estado ali para 8 pessoas de cada vez Isso gastou 17% dos tokens. E perguntas, né, tipo, quem faz o quê, você faz o quê nesse momento, você fala com a pessoa, você compartilha o segredo com ela sim ou não. Isso tudo gastou a maior parte, foi 83% dos tokens usados. E aí eu falo sobre arquitetura no post, eu falo sobre onde usar, onde não usar, que talvez em alguns casos pode valer um JEV ou um Laia, em outros casos vai ser melhor você usar um um SLM, né, um Small Language Model, ou treinar um classificador específico para sua tarefa, se for uma tarefa muito mais específica.

Então o resumo é: torcedores, calma, não é nem a pior coisa do mundo nem a melhor coisa do mundo. É uma ferramenta que pode ser útil sim em algumas situações, que tem open source tanto já prévio quanto atual sendo criado nesse momento enquanto a gente fala, sendo publicado e melhorado quanto a gente fala que você não vai precisar treinar o seu, você vai poder usar esses prontos, mas para outras coisas vai valer a pena você treinar o seu da sua tarefa.

Eu até citei na minha palestra também o JeV e outros SLMs e classificadores, né, tipo BERT, esse tipo de coisa, Modern BERT, que estão sendo usados por empresas grandes lá de fora, né. A DoorDash, por exemplo, Shopify estão usando. Primeiro eles usaram LLM, rotularam, treinaram um BERTzinho ali para eles, um DistilBERT, o Modern BERT, específico para tarefa deles e funciona. Eles economizam uma puta grana com isso. Então, se tiver mais dúvidas, vem falar comigo, eu posso tirar essas dúvidas ali no— me escreve uma mensagem no LinkedIn.

Se você tá usando, usou o JEV, deixa um comentário lá na caixinha de comentários do Spotify. Quero saber como você usou.

MMMarcus Mendes

Excelente. O link para essa, para esse estudo, esse post que o Fabrício tem, você encontra na descrição, junto do link de tudo que a gente comentou ao longo desse episódio inteiro, junto do link também para você conhecer os cursos e as formações de inteligência artificial da Alura. Se você for hoje em alura.com.br, você ainda vai aproveitar o desconto de mês da programação, que tá oferecendo 30% de desconto para você atuar por até 2 anos na Alura.

E só de curso de inteligência artificial são mais de 270, em áreas de IA generativa e prompt engineering, desenvolvimento de software, automação, produtividade, dados e BI, negócio, produto, design, conteúdo, marketing, engenharia de LLMs e agentes, engenharia de modelos de fine-tuning também. Tem as formações que estruturam um caminho para você poder aprender entregando um curso para o outro, que às vezes nem tenha só a ver com IA, mas é uma formação que envolve outras áreas também, assim como a IA envolve outras áreas também.

Então passa aqui na descrição do episódio e dá esse primeiro passo para você começar sua carreira agora mesmo. alura.com.br. E eu e o Fabrício voltaremos na quarta-feira com uma entrevista que, se eu fosse você, eu não perderia.

FCFabrício Carraro

Até lá! Este podcast foi produzido pela Alura. Mergulhe em tecnologia. E Faculdade FIAP. Let's rock the future. Edição Redigig. Gigahertz de podcasts.

Anunciantes1

Alura

Cursos e formações de inteligência artificial, programação, automação, dados, negócio, produto, design, conteúdo, marketing, engenharia de LLMs e agentes, engenharia de modelos de fine-tuning
external