A IA TÁ FICANDO PERIGOSA? OS BASTIDORES DA NOVA CORRIDA TECNOLÓGICA | Cloud.IA EP. 6
A Inteligência Artificial está mudando rapidamente — e, por trás dos novos modelos e ferramentas, existe uma disputa cada vez maior por tecnologia, infraestrutura, dados e mercado.No sexto episódio do Cloud.IA, falamos sobre os principais movimentos do universo da Inteligência Artificial, passando por modelos de IA, Amazon Bedrock, OpenAI, Anthropic, segurança, ataques a agentes, copyright, investimentos e infraestrutura.Também entram na conversa temas como modelos open source, distillation, soberania digital, desenvolvimento de IA no Brasil, janela de contexto e os impactos que essa evolução pode trazer para empresas e para o mercado de tecnologia.Dê o play e acompanhe mais um episódio do Cloud.IA!#CloudIA #InteligenciaArtificial #AWS #AmazonBedrock #Tecnologia
Jackson Ribeiro
Flávio Rezzi
Ricardo Caeiro
Ricardo Golias
- Incidente OpenAI e Hugging Face· TecnologiaDataset injection e exploração de pipeline·Saída da sandbox e acesso à internet·Benchmark Exploit Gene·Hugging Face·OpenAI
- Modelos de IA Anthropic vs OpenAI· TecnologiaAnthropic: Haiku, Sonnet, Opus, Mythos·OpenAI: Sol, Terra, Luna·Comparativo de performance em benchmarks·Anthropic·OpenAI
- Amazon Bedrock e Roteamento de Modelos· TecnologiaMarketplace de modelos de IA·Intelligent Prompt Routing·Tríade: custo, latência e acurácia·Amazon Bedrock·AWS
- Comportamento Emergente em IA e Janela de Contexto· TecnologiaAgente minerando criptomoeda·Capacidade emergente em IA·Limitação da janela de contexto·RAG (Retrieval-Augmented Generation)·Quick (assistente corporativo)
- Modelo Chinês Kimi K3 e Destilação de IA· TecnologiaDestilação de modelos (professor-estudante)·Acusação de cópia do modelo da Anthropic·Open weight vs Open source·Kimi K3·Anthropic
- Investimento em Data Centers· TecnologiaCapacidade energética e energia limpa·Soberania digital e data sovereignty·Modelos de IA brasileiros (Maritaca, Sabiá, Bonifácio)·Brasil·AWS·Google·Meta·Oracle
- Direitos Autorais e Royalties em IA· TecnologiaUso de obras literárias para treinamento de IA·Acordo de 1.5 bilhão da Anthropic·Pagamento por obra utilizada·Anthropic
Olá, galerinha! Estamos começando mais um episódio do Cláudio AI, podcast que te mantém atualizado sobre as principais notícias de inteligência artificial ao redor do mundo. Eu sou Jackson Ribeiro, Head de Data AI da Da Rede, e como de costume não estou sozinho. Eu começo primeiro aqui com aquele cara que é conhecido em basicamente todos os aeroportos do Brasil, quiçá do mundo.
Todos os aeroportos do Brasil, que ele já passou um dia, são 4. Fala, galerinha, beleza? Flávio Rezzi aqui, embaixador da AWS no Brasil, um dos embaixadores da AWS no Brasil, um dos fundadores da Da Rede, hoje CTO e líder do time de inovação e de arquitetura aqui na Da Rede. Pô, sempre legal aqui de tempos em tempos a gente vir bater um papo sobre as novidades do universo de IA, né? Claro, sempre conectando com a realidade do meu dia a dia, que é o universo AWS, né? Prazerzasso estar aqui de novo, Jack.
Boa!
E também convidado super especial, pessoal. Eu acho que eu considero o quê? Ele não é o Oscar de la Hoya, mas pode ser considerado o Golden Boy, né, da Rede, né?
Esse é presente.
Fala, fala, pessoal! Ricardo Golias aqui, tá, na Rede. Prazer estar com vocês aqui, ainda mais para participar de um tema tão importante, tão interessante, né? Para mim como para o mundo inteiro, que é a parte de AI e dados e tudo mais. Então muito obrigado pelo convite.
O famoso Golden Uncle, o tiozão de ouro.
E essa outra persona que está aqui com a gente, a gente tem uma brincadeira interna aqui e eu vou reforçar ela. Estão comentando muito sobre o seu trabalho na feirinha de terça-feira em Barueri. Parabéns pelo seu trabalho, meu amigo.
Ô, baita lugar para ser comentado, né?
Vamos lá.
Fala, galera, tudo bem? Ricardo Caeiro mais uma vez aqui participando desses programas sensacionais que a gente tem aqui, né? Lives e podcasts. E enfim, é muito bom estar aqui com vocês. Vamos falar de assuntos muito interessantes hoje, né? Inteligência artificial tá, eu acho que, muito em alta. Tem muita coisa acontecendo de inteligência artificial e Meu, sensacional tá na presença desses caras aqui.
É difícil acompanhar, né, cara? Eu adoro essas agendas aqui, né, e tento participar de todas. As que não participarei, certamente acompanharei, porque pelo menos a gente fica ali atualizado para saber assim, cara, beleza, nesse universo de coisa dentro da nossa realidade, nosso dia a dia aqui de tecnologia, infraestrutura, conectividade com o negócio e tal, é que tá pegando, né? Que que tá pegando ali para a gente poder no meio de um palheiro de novidades, a gente poder pegar as agulhas ali, né?
É isso, meus amigos. E não perdendo tempo, já vamos para a primeira notícia aí para a gente jogar aqui na mesa, para justamente a gente trocar aquela palavrinha como a gente já tá acostumado. A gente teve recentemente, se eu não me engano, o Flávio, além dos modelos da própria WS, ele também costuma usar muito o ChatGPT. Não sei se ainda tá usando, Mas a gente teve lançamento agora, né?
Eu pretendo ser o Quick Man, mas eu ainda uso para coisas pessoais. ChatGPT era o meu, é o meu principal, sempre foi meu assistente durante muito tempo, foi meu assistente pessoal. Agora o Quick tem roubado bastante a cena, então eu faço igual celular da empresa e o celular do pessoal. Então o ChatGPT é o meu celular, o meu assistente pessoal, e o Quick é meu assistente corporativo.
Boa, boa. A gente teve recentemente o lançamento do ChatGPT 5.6. É interessante a gente ver o movimento que tá acontecendo. E só fazendo um paralelo, hoje se a gente tem as duas big techs ali de IA, que é o quê? Anthropic de um lado e OpenAI do outro. Se a gente observar Anthropic, a gente tem os principais 3 modelos ali da Anthropic, na verdade 4 agora, né, que seria o Haiku, o Haiku O Sonnet, o Opus, e agora o Mythos, né? Tem o Mythos e o Fable, né, que seriam o mesmo modelo em tese.
É engraçado que a Antropic, ela segue, ela pegou um paralelo de fazer a comparação dos modelos com poemas, né? Então haiku é um poema japonês de 3 versos, pequenininho, né, enxuto, compacto. O Sonnet já é 12 versos ali, bem maior. Aí você tem depois o Opus, que é considerado uma obra completa, então muito maior, mais poderoso. E você tem o último, que é o Mythos, que seria uma mitologia, né?
É quase uma crônica mais mitológica, né?
Exato. Só que a gente tem agora OpenAI indo para a mesma pegada, só que ela fez o quê com o planeta, né? Então ela lançou Sol, e não é Sun não, no caso é Sol mesmo, S-O-L.
Tenho que fazer uma correção aqui que eu consigo. Planeta não, né? Sol nem Lua é planeta, pelo amor de Deus. Estrelas, né? Estrelas, astros.
Perfeito.
Pode ser que é aqui o próximo.
Então tem o Sol, tem a Terra e tem a Luna.
Tá parecendo Capitão Planeta, né?
Lembra?
Coração pela união dos seus poderes.
E ele lançou esses três, foi recente agora, o quê, duas semanas, uma semaninha. É o primeiro ponto, pessoal, assim, já adianto, nos principais benchmarks não ultrapassou nem o Fable, nem o Opus e nem o Mythos, né?
Mas os benchmarks estão sendo feitos por proporção de LLM de tamanho proporcionais ou nada a ver?
Proporcionais. Por exemplo, no caso do Terra, que é o maior modelo da OpenAI, eles compraria talvez ao Opus ou Fable agora, né?
Então eles compraram similar, nos benchmarks tá sendo comparado similares.
É, tá sendo comparado similares. Mas assim, é engraçado porque assim, agora sempre tá tendo essa guerrinha. Eu lancei o meu modelo, vem o próximo, eu tento fazer o benchmark. Só que pessoal, constantemente a gente tem visto a Antropic sempre se posicionando no primeiro do ranking ali, nos maiores benchmarks, os mais conhecidos, por exemplo.
Os cara tão quebrando tudo, né, cara? Os cara tão quebrando tudo, né?
É, exatamente. Até se eu pegar, por exemplo, esse ranking aqui que a gente vê, O GDPVol aqui, ele é um ranking bem utilizado porque aqui basicamente você tá testando atividades que impactam diretamente no crescimento do PIB. Então assim, são atividades reais que justamente mexem na economia, né? Então você tem vários benchmarks, você tem benchmark só de, ah, o quanto ele consegue mexer num terminal ou fazer ações no terminal, ou o quanto de fato ele consegue fazer ações reais do mundo.
Mas um muito utilizado é esse de pivô aqui. E daí, se a gente vê ali, a gente já adianta também, teve o próprio lançamento do Opus 5, né? E ele novamente, para surpresa de zero pessoas, já se posicionou em primeiro lugar.
O Jack, eu, cara, vou fazer até uma provocação aqui para a gente, para a gente discutir. Você não acha, cara, que assim, obviamente a gente sempre quer buscar o melhor modelo para nossa necessidade, mas você acha que não tá acontecendo um movimento de o mercado tentar descobrir qual é o melhor modelo que atende tudo, falar esse daqui é o melhor de todos, sabe? Aquela competiçãozinha de falar esse aqui é o melhor, usa esse, né?
Ao invés da gente procurar um modelo que vai servir o propósito daquela necessidade.
É assim, eu vejo tranquilamente, acho que cada vez mais a gente tá distante do modelo bala de prata. Porque assim, sempre quando a gente pensa é na tríade, quando você tá falando de um LLM, de um modelo, você vai ter uma tríade ali que é custo, latência e performance, né?
Performance associado à resposta, a resposta mais próxima da necessidade, né?
É perfeito. Vou até mudar: custo, latência e acurácia.
Acurácia, boa.
É porque eu quis dizer a performance como acurácia mesmo.
É que a performance é isso, é responder mais próximo, mais próximo do que a gente entende como esperado, né?
Isso. Só que, por exemplo, se eu pegar um LLM, de fato a acurácia dele tende a ser maior, assim como o custo tende a ser maior, assim como a latência tende a ser maior. Se eu pego um SLM A minha latência é menor, o meu custo é menor, porém a minha courácia também é menor. Então eu fico sempre me balanceando nessa tríade. Para mim, claramente, o movimento do mercado é: vamos fazer roteamento de modelos, como o Bedrock faz. O Bedrock é um marketplace de modelos, né?
E você tem as features de roteamento, inclusive, né?
Ele tem as features de roteamento.
Mas assim, no próprio Quick você se a gente não sabe o modelo que tá ali por trás, né?
Médio, tá? A gente já fala sobre, acho que é um bom tema para a gente discutir depois, mas guarda esse aí. Agora sim, com relação a, por exemplo, todos esses modelos, inclusive todos os novos, já estão suportados pelo Bedrock. Todos estão aí, tá tudo disponível, né? E aí ali você consegue fazer o roteamento, você consegue, é um marketplace, você consegue usar outros modelos para poder desenvolver as suas aplicações, colocar, construir seus agentes, etc.
Mas a sua afirmação que você falou tá correta. A grande questão é que aqui nos rankings é o que você falou, que ele tenta mostrar qual que é melhor, até para justificar talvez eles cobrarem um pouco mais. Assim, cara, minha assertividade é maior, provavelmente aí eu posso cobrar um pouquinho mais do que a concorrência. Mas até o próprio modelo do benchmark vem mudando, né, Jack? Eu lembro que a gente teve uma conversa lá uns 3 podcasts atrás com relação a, pô, beleza, como é que se mede?
O cara começou a fazer várias perguntas Aí o modelo ele já tinha um pedacinho especialista em responder as perguntas do benchmark. Aí já ferrou, entendeu?
Aí já tá, começa a ficar enviesado.
É, exato, provavelmente muda, né?
É exatamente assim. Até pegando esse gancho que o Flávio falou, mas só voltando antes no Bedrock, pessoal, além de você poder navegar em todos os modelos literalmente ali, você tá falando de OpenAI, você tá falando de Anthropic, você tá falando de Meta, você tá falando de Cohere, você tá falando de Jurassic, os próprios modelos lá que são full AWS, né? Amazon Nova, Sony, que então é todos. Mas você também tem uma feature específica do Amazon Bedrock que é o Intelligent Prompt Routing, que é basicamente você manda para ele a request, ele analisa aquela request.
Poxa, eu preciso do modelo complexo ou eu posso mandar para o modelo simples? E daí ele faz essa análise e manda para o modelo mais adequado.
Que se trata, o que ele vai inferir ou não aquela atividade.
Mas aí, dúvida leiga, tá?
É um agente do BadRock que faz essa escolha, é uma feature, mas é uma feature do BadRock. Bateu a requisição lá, isso bateu lá, essa feature vai, ela vai olhar e fala assim, beleza, essa pergunta aqui provavelmente, eu não sei como é que o funcionamento interno ali do que acontece debaixo do capô, mas ele fala assim, ah, beleza, essa pergunta aqui provavelmente ele roda o modelinho ali e fala assim, cara, essa aqui tem mais, vai ser mais eficiente se eu mandar para o Nova Pro, porque é uma resposta simples que o Nova Pro vai ser resolvido.
Caso de uso do que tá sendo perguntado, determinado modelo atende melhor, com custo-benefício melhor no final das contas.
E você pode configurar, por exemplo, assim, olha, eu só quero que você mande para um modelo menor se a qualidade do que você for me devolver for a mesma do modelo que você iria mandar, entendeu? Ou então, ah não, se a qualidade for 10% menor também aceito.
Dá para fazer ajuste de latência também. Então você fala assim, ó, cara, me responde, para mim a latência é o mais relevante. Aí dá para você, para ele fazer baseado só na latência, que no final é para fechar a tríade ali que o Jack falou, né, cara? É isso, não quer custo, acurácia e latência, entendeu?
Excelente. Então eu acho que é um caminho, né, para a gente que de repente não sabe muito bem ali qual o melhor modelo para atender a necessidade.
É um ótimo caminho.
Tem muitos chats ali que você deixa no alto, né? Ele mesmo vai pegar ali e tal.
Essa é uma novidade que a gente anunciou aqui, né? Que quando o próprio ChatGPT começou a abstrair isso aí, fala, cara, eu vou ter que fazer curso para saber qual o melhor modelo para poder fazer uma pergunta, bicho, para ele me responder o que eu preciso. E aí o custo-benefício que vai ser melhor por baixo dos panos. E aí é isso que o Quick se propõe a fazer. Para galera que não sabe aí, o Quick É o produto da Amazon, é o cliente da Amazon que serve como seu assistente pessoal corporativo, né?
E aí ele abstrai, além dele fazer o que o ChatGPT faz, ele abstrai a LLM hoje. Aí tem um ponto aí para a gente discutir, mas hoje ele abstrai a LLM, então tanto faz, você faz a pergunta. E ele tem também várias integrações, por exemplo, integração com o Hotmail. Hoje não respondo mais meu email, quem responde meu email hoje é meu Quick.
Cara, isso é animal!
E aí ele tem integração com prontas com o Salesforce, WhatsApp, Gira. Então hoje, hoje, Caeirinho, se eu virar e falar assim, cara, quais os clientes abriram mais chamadas na BU do Caeiro? Ele já, o próprio Quick já me responde porque tá conectado no Gira. Então é uma ferramenta legal. Agora está para entrar funcionalidades, né, conversando com o pessoal de produtos da Amazon, da AWS, está para entrar funcionalidades com respeito a gente poder selecionar qual LLM usar ou não usar.
Porque vamos supor que a gente tem uma regulamentação interna que a gente não pode usar OpenAI por algum motivo. Aí eu vou poder ir lá e dizer, ó, não uso OpenAI. Aí eu acho que a expectativa que eu tenho é que no futuro a gente possa parametrizar as que usem, as que não usa. A primeira feature vai ser para você de exclusão, tá? Aí eu não sei qual vai ser, como vai ser os detalhes da regra e tal, tudo mais.
Mas a ideia é, tipo, você tá na empresa disponibilizando o Quick E aí você pode filtrar quais elementos pode ser usado.
É provavelmente alguma coisa de guardrails ali, vai entrar como guardrail, é, vai entrar como guardrail. Só que aí eu fico pensando, beleza, vai entrar como guardrail, eu desabilito todos e deixo funcionando só o cloud. Porque lembrando que o Quick ele tem o preço por licença por usuário, ele não cobra por token ainda, né? Não sei como é que vai ficar essa limitação com relação ao número de tokens, pelo menos para o uso dele. Agora, quando você começa a usar agentes externos, aí você vai ter que usar o bedrock, você vai acabar pagando, né?
Você falou desabilitar a Guardrail aí, é que a gente tem uma notícia que é justamente desse problema de desabilitar a Guardrail. Mas é isso, até, pessoal, para quem tiver assistindo, se você hoje utiliza, por exemplo, é que o Quick ele é muito mais posicionado como assistente pessoal. Então, por exemplo, você que tá na Anthropic, provavelmente você utiliza ali o Cowork. O Quick é justamente o nosso Cowork ali da AWS. Vale muito a pena testar, entender ali as features. No caso do ChatGPT, ele é o Work, né? Eu acho que o ChatGPT é só o Work.
É só o Work, saiu mais recente, né?
Essa apresentação aí. Ele tem a versão Work, que é a versão corporativa, vamos dizer assim, que é onde vai ter compliance, guardrail e tudo mais.
É, eu sou assistente virtual.
Consegue colocar automações ali também, algumas tarefas.
O que que chama de flow, por exemplo? Você cria um flow lá e esse flow pode ser, puta, fazer um resumo dos emails todo dia e mandar via Teams para você, ou fazer o resumo dos emails e do Teams e mandar para você via email.
Tipo isso.
Cria indicador. Desculpa, estendendo aqui, mas fazendo gancho que você falou do Gira, né? Absorver os indicadores e criar dashboards já com esses indicadores, né, periodicamente ali para você tá sempre atualizado, já mandar disparar email.
Enfim, é isso.
E é o que eu sempre falo, pessoal, inclusive é muito claro essa estratégia da AWS. A briga dela não é necessariamente a construção do melhor LLM, mas é disponibilizar para você o acesso a todos os LLMs. Então assim, se você já tem a sua infraestrutura na AWS, Não entra nessa briga de qual LLM você tem que usar. Todos os LLMs estão disponíveis ali, os principais estão disponíveis. Então você pode trazer a sua infraestrutura, né?
Não, vou construir o melhor modelo, né?
Não, mas eu vou construir o melhor local para você criar e escalar os seus agentes. Isso de fato é a briga dela, que é a famosa tecnologia Agent Core. Através da Agent Core você pode construir agentes escaláveis com segurança e de fato—
Exato. E aí você vai usar o que é melhor. Aí respondendo a pergunta, agora respondeu a pergunta. Aí a gente pode usar o que é melhor para o negócio, para o business específico. Óbvio que você pode fazer isso sem ter um cara desse, mas aí você vai ter que ter um padrão para cada coisa e tal. Aqui no Agente Core a gente pode criar, que é uma feature. O Agente Core na verdade é uma feature, é um produto do subproduto Bedrock, tipo isso, né?
É porque ele tem 6 módulos dentro do Agente Core, tem 6 módulos igual o Security Hub, né? Você tem vários produtos embaixo, o Bedrock tem os produtos embaixo ali. E você, e dentro do Bedrock você tem a possibilidade de criar guardrails, de criar, por exemplo, auditoria para saber quem tá gastando mais token, menos token, qual aplicação tá consumindo mais token, menos token. Então você vê que um lugar centralizado para você poder fazer a gestão do teu ambiente ali e tal, tudo mais.
É complicado porque a gente começa a falar de AWS aqui, é difícil até de parar, né? Mas enfim, eu queria colocar mais uma feature, mas eu vou deixar para o próximo. Pulando aqui, depois dessa atualização, e vamos lá, OpenAI, Astros, Anthropic, formatos de textos, formatos de poemas, de obras literárias.
É por isso que ele é o CTO, né?
Faz sentido, faz sentido.
Obrigado, obrigado pelas dicas aqui, tá aqui no Pessoal, e agora a gente vai aqui para—
foi muito comentado isso daqui, que é justamente o ataque na Hugging Face. Hugging Face ali tem uma série de frameworks disponibilizados, tem uma série de modelos open source. Principalmente quando a gente precisa pegar modelos open source, a gente vai na Hugging Face. Inclusive, por exemplo, quem usou o Amazon SageMaker, né? Ah, preciso fazer deploy de um modelo, meu amigo, abre no SageMaker ali o Hugging Face, pega o modelo, instancia no Kubernetes, numa EC2, enfim, e faz a inferência que você precisar.
O que que aconteceu? A Hugging Face sofreu um ataque. Eu acho que, eu não lembro agora, mas não sei se era 17 mil ataques, enfim, e apareceu no DDoS e tudo mais. E ele disponibilizado, falou, pessoal, estamos sofrendo ataques e tudo mais, estão tentando invadir aqui. Passou-se um tempo, a OpenAI foi, levantou a mão, falou, putz, Hugging Face, na verdade a culpa é minha. O que que aconteceu? Teve lançamento do ChatGPT 5.6, o Sol.
E geralmente o que que eles fazem? Eles precisam testar a capacidade agêntica do modelo. E principalmente, pessoal, é engraçado você ver esse movimento de mercado. Começou o movimento de mercado com a Anthropic em cibersegurança, lançaram mitos. Nossa, melhor agente do mundo para cibersegurança, incrível, descobriu 300 vulnerabilidades no Firefox em um mês e o pessoal não conseguiu descobrir isso em um ano e tal. Beleza, que que a OpenAI fez?
Ok, cara, o Sol também vai ser para cibersegurança ou vai se posicionar nesse contexto. Eles isolaram numa sandbox ali o modelo e colocaram algumas tarefas para ele fazer, justamente. Enfim, não se sabe exatamente como, mas ele conseguiu sair da sandbox e obter acesso à internet e começou a pesquisar na internet qual que era a melhor forma de resolver aquelas questões que tinham passado para ele. Ele aí tem na explicabilidade do modelo, na verdade não é, tem um outro termo, mas vou usar explicabilidade aqui.
Ele chegou na conclusão que era melhor ele pegar o gabarito do que ele precisava fazer para dar a resposta do que de fato fazer a ação em si. E ele descobriu na internet que quem tem um gabarito desses benchmarks é a Hugging Face. Então ele ficou tentando fazer um ataque em DDoS na Hugging Face para justamente conseguir entrar na base de dados e buscar o resultado ali para depois falar.
Entendi, foi um pipeline injection, né? Eu não vi, eu tô vendo o detalhe do caso, eu soube da história, mas eu falei, cara, deixa acomodar as coisas, porque logo que sai começa a falar um monte de coisa, aí depois você vai entender assim. Eu tô vendo aqui os dados apurados aqui, mas parece que foi um, foi um, o método foi o seguinte, aí foi uma exploração no pipeline de datasets. E aí você pode imputar datasets. Aí eles colocaram como se fosse um dataset injection, entendeu?
Eles colocaram código malicioso no dataset. Aí quando rodou, rodou do lado de dentro, cuspiu para fora. Assim eles conseguiram ter acesso. Eles, né?
O modelo conseguiu ter acesso. Exatamente.
Caralho, né, velho?
Buscar o dado para alimentar o dataset.
Ela rodou SQL, aí explorou dali para dentro. Aí escalou privilégio, aí ele escalou privilégio. Uma vez rodado lá dentro, ela conseguiu pegar privilégio, escalou privilégio, entrou lá e fez o quê? E aí, via movimento lateral, conseguiu pegar o dado que queria.
Que loucura! É, mas assim, dois pontos assim incríveis aí. O primeiro ponto, cara, assim, não é a primeira vez que a gente vê modelos tentando trapacear. Então assim, eles sempre: ah, vou pegar o gabarito, vou falar que eu fiz o cálculo, mas não fiz o cálculo. Eu fico pensando, deu uma ideia do Jackman, cara. Será que assim, a gente tá tão próximo deles cada vez mais que eles estão pegando até essa malícia, cara? Até esse jeitinho de tipo, ah não, já que eu posso ter a resposta direta, eu não vou fazer o trabalho.
É que na verdade assim, cara, o problema tá sobre avaliação do que é certo, que é errado, né, cara? Entendeu? O modelo não avalia o que é certo, que é errado. Você tem que arbitrar.
Ele não faz juízo de valor, né?
Se você não arbitra, ele vai tentar, por exemplo, Várias vezes eu já vi, cara, tanto ChatGPT com OpenAI quanto o próprio Quick usando o modelo que aí eu não sei quais são naquele momento, sendo espertinho assim. Então fala assim, ah, sei lá, ele tem que fazer um processamento, bater numa API, trazer um resultado. Aí vai lá e traz um resultado que não bate. Você bate lá na aplicação, volta aqui, fala assim, cara, esse dado não tá batendo.
Ah, é verdade, cara, eu inventei o dado. Tipo, é isso, entendeu? Óbvio que aí você tem que criar os blocos e tal, mas quero dizer assim, no final das contas eu tenho um pouco de uma sensação de que a maior parte dos modelos, ChatGPT melhorou agora, mas ChatGPT queria deixar você satisfeito, velho.
Exatamente.
Ele vai agradar, ele vai falar, ele chega a mentir, ele vai fazer, cara. Agora cabe colocar, a gente tem que educar, é muito doido isso, né? A gente tem que educar os modelos para que os modelos não façam agora. Dá medo, né? Porque, cara, ele usou métodos de ataque da literatura que existe, entendeu? Ele foi atrás de código e tal para fazer a coisa acontecer. Ele constrói código, velho.
E o Hugging Face, na hora que ele tava sofrendo ataque, prontamente ele começou a pegar os modelos mais evoluídos, tanto da Anthropic quanto da própria OpenAI. Eu acho que você não inclusive utilizou para justamente entrar na defesa do ataque. E os modelos automaticamente, o próprio modelo É, não, não, eles utilizando o modelo, passando o contexto e, né, falando, meu, estamos sofrendo um ataque, precisamos dar ajuda justamente para—
e os modelos se recusaram a fazer esse tipo de atividade porque o guardrail protegia a defesa. E não, cara, eu, eu tenho, e é muito doido que a gente, não sei vocês, mas tem ficado um pouco saco cheio de guardrail, de, cara, de agente de ar, né, cara. Assim, a gente começa a ficar de saco cheio, que você fala assim, cara, tudo que você pede, ele fala que não pode e tal, tudo, né. É, cara, nós estamos aprendendo. A real é que tá todo mundo aprendendo, né? O que eu li aqui é que o ataque foi feito, ele tava fazendo um benchmark.
Sim, é o benchmark, chama exploit gene. O benchmark chama exploit gene, e dentro do exploit gene tem uma série de atividades que você tem que fazer. Então assim, ah, beleza, tem que atingir aquela tarefa, cara, vou buscar a melhor forma. Mas é o exploit gene que ele tava usando, que é bem conhecido em cibersegurança. De falar, você tem que cumprir 10 tarefas lá no exploit, por exemplo. E daí nisso ele falou, deixa eu sair.
Ele achou o caminho mais fácil para buscar o dado, pegar o gabarito e trazer o gabarito da solução do problema. Que loucura, né, cara?
É, não, enfim, daí, mas assim, parece natural, né, cara?
Parece natural, tipo assim, cara, você precisa me trazer esses dados. Ele foi lá, achou uma informação, a informação dizia assim, cara, esses dados já foram apurados pela empresa tal. Ele olhou Como é que eu faço para pegar os dados da empresa tal? Ah não, esse dado não pode ser pego porque é um dado sigiloso. Como pegar um dado sigiloso?
Pau.
E aí vai, cara, ele vai embora.
Só lembrando que nesse caso é porque ele tirou todos os guardrails dele, porque assim, quando vai testar o modelo, especificamente ali ele tava sem guardrail, né? Obrigatoriamente você testa sem nenhum guardrail porque você quer ver o potencial, fazer parte do teste. Deixa eu ver até onde ele vai.
É, mas nada implica de eu pegar o modelo, rodar nas minhas máquinas próprias e sair rodando, dependendo do modelo, Claro, né? Não, esse modelo específico não daria, mas outros tantos daria, né?
Outros tantos daria. Inclusive, novamente você deixou a bola quicando para terceira, que é justamente sobre isso, pessoal. Todo mundo falando do nosso amigo Kimi K3, modelo chinês. E daí falou modelo chinês, já lembra de quem? Já lembra de quem? De PC.
Não se fala mais dele, né? Não se fala mais dele, né?
Ele teve uma quebra de paradigma lá na época, né? E depois ele acabou sumindo, né? Porque justamente, ah, você gastou 100 milhões, OpenAI, para treinar o seu modelo? Eu gastei, foi 100 milhões, eu gastei 5 milhões, eu gastei 5 milhões. Ah, como que você fez isso? Ah, então mágica acontecendo. Mas o Kimi, enfim, a China voltou em cena com o Kimi K3, pessoal. E daí o Kimi K3, assim, o desempenho dele, tanto que se vocês olharem aqui, ó, Depois que acaba Anthropic e OpenAI, quem que vem? Química 3. Esse modelo tá fantástico, o desempenho. Exatamente.
O Queen não aparece?
O Queen nesse caso aqui específico não. Pode ser que ele esteja em outro benchmark, provavelmente. Até vou mostrar depois outro benchmark aqui, ó.
Ah, o Queen foi outro aqui, né?
É o Queen Max que compete provavelmente nesse benchmark onde tá o Opus, o Fable e tal.
É o próprio solo, né? Mas, cara, esse King K3, assim, o desempenho dele tava surreal. Porque assim, novamente, pessoal, que o Guglielmo comentou, ele é open source. É que na verdade, para modelo, você não fala muito assim, você fala muito mais open weight do que open source, porque ele não é completamente aberto, mas você pode pegar todos os pesos dele, como que ele foi treinado. Por exemplo, se a da rede quisesse hoje pegar o King K3 e falar, não, eu vou implantar aqui Baixo ali, zero.
Só que você tem capacidade computacional para fazer.
Nesse caso eu acho bem difícil porque a gente tá falando de um modelo de quase 3 trilhões de parâmetros.
Então, então esses modelos são liberados, são, você pode liberar um crédito aí, ô Renatão, nosso PDM, fazer liberar o crédito rapidinho aqui, que coisa de 7, 8 milhões de dólares dá para fazer.
Dá para fazer, os modelos são liberados, são uma versão reduzida então. Tipo de 30 bilhões?
Não, esse daqui é liberado, o de quase 3 trilhões.
O problema é que assim, você tem a parametrização, aspas, né, vou colocar bem simples. Você tem o código-fonte para treinar o modelo para você poder fazer inferência. Só que para você treinar o modelo você precisa de uma capacidade computacional gigantesca, você precisa deixar o negócio lá com zilhões de CPUs rodando durante um mês. E aí se der errado você tem que fazer de novo ainda por cima. Então Tipo, chegou lá no final, sabe, você dá um make, make install, o bagulho tá, faltou uma lib, aí você faz assim, puta merda, aí você volta tudo de novo, entendeu?
E pessoal, incrivelmente joguei fora 1 milhão. É isso, não sei nos últimos benchmarks, mas quando lançou, o Kimica 3 chegou a ultrapassar o Opus 4.8, cara. Assim, surreal. Lembrando novamente, pessoal, Opus 4.8, a gente tá falando do modelo fechado, cara. Aqui a gente tá falando do modelo aberto, que eu posso baixar o código e entender pegar ele, utilizar.
Por exemplo, eu tenho lá um modelo que é trilhões de parâmetros. Então quando eu tenho uma assinatura, eu consigo, eu consigo usar essa capacidade para o que eu tô fazendo. Basicamente isso.
Se você pegar uma assinatura da Monshot aqui, você pode utilizar o Química 3, mas aí você vai pagar para eles.
Sim, sim, só que o modelo já foi treinado, eles já treinaram, a gente tá só usando, fazendo Você tá usando um modelo de trilhões de parâmetros, que ele tem essa capacidade, mas você tá usando para o seu uso ali. Então você tá pagando para usar um pedaço.
Você tá usando o ChatGPT, que é um produto, uma casca, que já tem ali toda uma questão de guardrails, instruções e otimizações para o dia a dia assim, que é o famoso harness, que é o harness aqui para esse nosso uso. Por trás ele tem os modelos. Os modelos na verdade foram treinados gastando, investindo milhões de dólares em GPU, treinou o modelo, beleza. Aí depois não só treinou o modelo, mas aonde esse modelo performa melhor, tanto na hora de você buildar ele, vamos dizer assim, que é o treinar, quanto na hora de fazer inferência.
Só que na hora de você fazer inferência ele só funciona bem se ele rodar em memória de GPU. Aí você ainda tem a memória de GPU para deixar alocado ele para ele poder rodar. Então assim, é isso. Agora, se você quiser montar um negócio desse, não adianta só você só pegar o, qual que é o termo mesmo que é utilizado, os parâmetros do modelo ali, fazer o fine-tuning. Não, por exemplo, se eu quiser ir lá e rodar um Química 3, por exemplo, o que que eu pego? Não é o código-fonte, né?
Eu pego, você vai pegar o artefato direto e vai rodar nas GPUs, né, em cima das GPUs, né? Já foi feito treinamento.
Ah, eles fornecem o modelo treinado. Por exemplo, eu quero montar um local, só fazer inferência, subir o modelo e fazer inferência. Pode, aí já traz o pré-treinado, mas ele também traz os parâmetros.
Se você quiser, se você quiser buildar tudo, quiser criar a versão da rede Química 3 da rede, é 3 coisas, né?
Uma coisa é o código, a outra coisa é o modelo treinado, a outra Mas é bastante GPU lá, vai dar. A gente faz a inferência na Antropic, a gente só faz a inferência, a gente não pega o modelo e a gente não sabe os parâmetros, enfim.
Mas como sempre, não sei se vocês sabem, né, mas é histórico a guerrinha que a gente tem política entre China e Estados Unidos, e obviamente isso já deu problema. A gente tem aqui o diretor, basicamente aqui é o diretor de ciência e tecnologia que fica na Casa Branca ali. E ele se posicionou de forma muito clara, falou assim, ó, temos evidências claras de que o Química 3 na verdade é uma destilação do modelo da Antropic. Olha, assim, e como é que destilou?
Então, a ideia, acho que é bom a gente até falar sobre isso. Muitas pessoas falam que o comportamento é bem parecido com Opus, realmente, e daí faria um pouco de sentido. O que que é o destilar, pessoal, para quem tá nos ouvindo aí? Basicamente você pega um modelo que ele é mais robusto, tem maior quantidade de parâmetros e tem maior acurácia, maior performance. Você pega esse modelo robusto, você pega um modelo bem menor. Então assim, você pega aqui 2 trilhões de parâmetros e pega um modelo de bilhões de parâmetros aqui.
Esse modelo menor, obviamente, ele é muito mais rápido e o custo dele é muito menor, só que ele não tem a acurácia do modelo maior. Então você chama esse modelo maior de professor E você chama o modelo menor de estudante. Aí o que que você faz? Você manda para o professor tudo que você quer que o estudante aprenda. Então você manda todas as questões, manda tudo. Aí depois você pega essas respostas, você pega a pergunta e resposta do professor e fala: estudante, olha aqui como que o professor respondeu ela, como que ele fez essa questão. E daí o estudante aprende.
Isso é destilar, desse leite em ataque, né? Então uma técnica, né?
Não, é que aqui, é que aqui no caso, é que no caso o destilação ataque é utilizei do método de destilação para treinar o meu modelo. Então fiz um ataque de destilação, destilação é um método de treinamento. Exatamente, exatamente.
Porque aconteceu isso com a Queen, né? O Queen parece que eles criaram 20 mil contas, 20 mil não, 20 milhões de contas e fizeram um distillation attack.
Aí eles construíram, é, na verdade, o que tá aqui, né, eu li o reporte agora, o que no reporte ele tá dizendo é o seguinte, é meio que assim, cara, beleza você usar distillation mode, só que dá o louro da origem. É tipo assim, cara, não tem problema você usar o Apache, dá os créditos e paga os royalties, né? Não tem problema você usar Apache License desde que você dê os créditos, que na verdade você usou aquele código para construir sua aplicação.
O Jack falou, né, é teu estudante, o professor, tá fazendo pergunta, você não tá fazendo nada.
A técnica em si não tem nenhum problema, é só um ponto aqui, Flávio, que ela até deixa claro, principalmente aqui, ó, essa parte aqui ele deixa claro. Ele falou, cara, fazer destilação, ok, quer fazer ainda da rética.
Agora assim, você fazer destilação para pegar uma propriedade intelectual que gastou bilhões e você vai, é, não, e nem, e ainda por cima dizer que é o meu modelo e não virar e falar assim, ó, eu fiz aqui um destilejo daquele modelo, já seria bem diferente.
Não tem como bloquear, né? Você vai bloquear?
É que na verdade assim, a Anthropic percebe isso porque assim, é centenas de milhares, centenas de milhões, é um negócio absurdo, é um negócio absurdo para você treinar. Então assim, a Anthropic tem as evidências também.
Se você bloquear, você bloqueia todo mundo, tipo.
Não, porque não é todo mundo que tem esse padrão.
É tipo um sabor, é um LLM application com o firewall. Então você consegue entender o comportamento, fala assim, caramba, pera aí, esse cliente aqui tá gastando tanto fazendo umas perguntas aleatórias, talvez faça sentido para o business do cara, talvez não. Aí vai uma contrainteligência de conseguir também, porque vamos lá, provavelmente esses caras estavam pagando, foi em cima do Fable ali, então eles estavam pagando para Antropic, eles estavam consumindo de alguma forma. Aí até colocou ali, ó, tá em um servidor na Tailândia e tal, né.
Eles estavam consumindo ali, eles faziam de várias formas, tipo, um era chat, outro era API, outro justamente para diversificar.
Mano, vamos lá, mas é o famoso, é o famoso, sem querer ser pejorativo, mas sendo pejorativo, né, é o famoso cara mandou um chai na moda antiga, né, que vai lá, pega o produto e tenta dar um jeitinho, hackear e copiar, né.
Cara, eu tava pensando, uma galera, isso foi sem querer mesmo, tá, porque Tava mexendo aqui, fui ver essa notícia e tal, sem querer eu fui para baixo, mas nem foi pensando. Na hora que eu comecei a ver aqui embaixo, eu falei, mano, que surreal! Eu rio muito. Esse primeiro aqui, ó, cara, é isso, galera!
Boa, verdade!
É a primeira que apareceu, cara.
E ainda deve ter usado um mecanismo de busca, né?
Mais utilizado. Engraçado que ele mandou no meu formato, né, cara? Eu tenho informações, né, que eu vou— minha contra-inteligência aqui disse que eu acho que o segundo também era bom.
Ah, tá, ele não lembra de ter liberado o GitHub dele para fazer treinamento, mas enfim. E daí ele falou: nunca perguntar a idade de uma mulher, nunca perguntar salário de homem, nunca perguntar como que é treinado. É isso, é isso. Muito bom, faz muito sentido.
Mas então, no final, é, no final das contas, vamos lá, é de novo, voltamos àquele mesmo assunto. A gente tá aprendendo a fazer as coisas ainda, cara. O que que pode, o que que não pode, né? É isso. O cara entrou lá no meu blogzinho, o cara entrou no meu blogzinho, pegou todos os dados lá e usou para treinar o modelo. E aí, cara, acho que a regra ela é clara: se tá público, pode usar, mesmo que ele, mesmo que a intenção não seja ter colocado público, como foi o caso do, da notícia anterior, tava público. É só você fazer um dataset injection, você vai ter o dado, entendeu?
E até falando de público e não público, Flávio, não sei se vai lembrar, mas num dos primeiros episódios que a gente fez, a gente comentou de um caso que era justamente a Anthropic e a OpenAI estavam sendo processadas porque estavam usando obras literárias para fazer o treinamento.
Agora saiu o acordo e saiu justamente, inclusive tem tudo a ver com a notícia anterior, que é a piadinha que os caras fizeram ali no post. Quer dizer assim, cara, pera aí, você usou meu livro para treinar o seu modelo, não me pagou royalties, né? Tipo, e não me perguntou. E eu que descobri, e eu que descobri, entendeu? Agora, cara, tem coisa parecida. Óbvio que quem fez não foi o governo americano, foi uma empresa americana, né? Foram algumas empresas americanas.
Juízo dos Estados Unidos aprova acordo de 1,5 bilhão da Anthropic em processo por violação de direitos autorais. Cara, são, é quase, mas é que é bastante gente, né?
Quanto vai dar para cada um aí? Quantas pessoas eram?
Então, mas olha, foi 3, aproximadamente $3.000 por obra, por obra.
Ah, mas não tem o número de 500 mil obras de autores.
É, não, ele não coloca porque foi indenizado por obra ali, né? Mas por uma empresa como essa, de verdade, mano, eu fiz um livro, beleza?
Eu fiz um livro, eu estudei para caramba, aí o cara vem pagar R$15 mil, tipo, é pouco, né? Mas por uma empresa como essa, essa mulher agora, para o cara que também fez um gibi lá, ele gastou uma semana para fazer, ele também vai receber R$3 mil.
É bem relevante.
Agora eu não sei se o cara fez a Barça, o cara fez a Barça, o cara fez a Barça, né? Não é pela relevância, mas é difícil também.
O Golias até perguntou, cara, mas é relevante para uma antropóloga? É relevante. Eu não vou ter o número atualizado, mas por exemplo, até pouco tempo atrás a própria Antropic não estava obtendo lucro.
Cara, eu acho que ainda não tem, para falar a verdade, viu?
Então assim, e cara, o anual dela eu acho que não era muito distante isso não. Então assim, eu acho que é que com o mito também, ela se mandou, enfim, deve ter dado um boom ali. Mas é, cara, $1,5 bilhão de dólares. Você não tem, você não escreveu nada, cara? Será que não? Vamos pesquisar, vai que tem alguma coisa aqui, cara. Qualquer coisa é $3 milhões.
Aí, ó, vou dar uma olhada lá.
Ó, ó, receita bruta, receita bruta do OpenAI estimada: $25 a $30 bilhões. Receita bruta. Anthropic 70 bilhões ano, EBITDA de ambas, EBITDA de ambas negativo, ainda queimando caixa. Então assim, ainda é porque só que o que gastou com GPM ainda é negativa. Então esse, vamos supor, para o Monropic, esse quanto foi? 1,5 bilhões, 1,5, 1,5 sobre os 70, nós estamos falando aí de 2%, 2% do faturamento, mas pegou bruto, né? Bruto, 2% do faturamento bruto negativo no EBITDA.
Então assim, 1 milhão é 1 bilhão e meio a mais de prejuízo. Então ferrado não, tem bastante gente colocando dinheiro. Agora, quem vai estar ferrado na verdade é os ações. E se alguma coisa der, se aparar, se o modelo financeiro, tanto de Antropo quanto de OpenAI, de qualquer uma dessas aí, as chinesas inclusive, se o modelo financeiro não se mostrar sustentável, quem vai se ferrar na verdade são os acionistas, né? Quem são os acionistas?
Boa parte são pessoas físicas, inclusive, né? Que as duas têm capital aberto na bolsa. Ou eu tô errado?
Não, nenhuma das duas tem. Elas estão fazendo IPO, estão fazendo processo de IPO. Não, então no processo de—
menos mal, quer dizer, vocês estão atrás de outros fundos, né? Mas menos mal, provavelmente não são pessoas físicas, são pessoas jurídicas. Beleza, são investindo o seu dinheiro, injetando dinheiro no modelo.
Especulam que era para o PNAI ter feito já o IPO, só que no momento que tava para ser feito, se eu não me engano, acho que foi o momento do mitos, né? Falou, mano, como que eu lanço justamente quando vem um Mythos na prateleira, cara. Tipo, e aí, a valorização, como vai ficar?
Tem que ser rápido ali, né, Jack? Sempre muda alguma coisa.
É uma loucura. Eu jurava que o Pneu tinha aberto. É que na verdade ele abriu da SpaceX, né? Ou da Starlink? Foi da SpaceX, né? Foi da SpaceX, porque inclusive a gente tava lá adquirindo as outras empresas dele.
Ele foi adquirindo e juntando na SpaceX. Alexei fez o, fez justamente, ó, investidores da OpenAI, tá?
Microsoft, SoftBank, Amazon, NVIDIA, funcionários fundadores que ainda são relevantes e a OpenAI Foundation, e a Fundação OpenAI Foundation. Da Anthropic, a Amazon, que é o maior investidor. O Google, Alphabet, Sequoia Capital. Então é que vem os menos relevantes.
Uma pergunta até para entender a percepção de vocês hoje da adoção, né? Claro que assim, tem muita, muita empresa, né, já fazendo adoção de inteligência artificial, né, de modo corporativo, para disponibilizar para os colaboradores. Mas eu acho que também tem uma grande massa que utiliza somente daquela forma gratuita, de forma pessoal.
Aí tá um grande vetor de investimento.
É, então, e aí eu queria até ver a percepção de vocês assim, e será que isso não é um fator realmente também por isso que as empresas ainda não estão lucrando de fato?
Porque acho que por ter essas versões gratuitas, na verdade é o seguinte, cara, durante uns 2 anos só rodaram com versões gratuitas, não existia nem monetização, não tinha nem a versão paga no começo, foi só para colocar no mercado.
E agora, novembro 22, né, que ChatGPT Foi 2022, né?
Então, cara, vai pelo menos um ano, pelo menos um ano, se não tinha versão paga. Aí assim, as versões corporativas elas foram entrando. Então assim, tem uma questão de investimento, no final das contas você quer queimar caixa, tá? Questão de investimento. Mas tem muito gasto de investimento, tem muita gente boa lá, tem também um war budget ali, um salary budget ali de nego brigando por causa de salário um com o outro. Então assim, o lance é todo complexo.
Fato é Acho que cada vez mais a gente vê que é inevitável que uma hora esse negócio vão achar um jeito de fazer dinheiro. Então assim, eles estão buscando alternativas para fazer dinheiro. Tem a própria venda de tokens, tem, você vê, a Anthropic, que tem um posicionamento, eu acho que largou na frente nesse posicionamento mais corporativo, ela tá faturando 70 bilhões, né? Por exemplo, a Amazon colocou 8 bilhões lá no começo, né?
Eu me lembro desse número, vocês colocaram mais, né? Agora na rodada do ano passado que teve essa essa entrada em cima do Bedrock, do OpenAI ser comercializado dentro da AWS, a Amazon foi lá e colocou também um dinheiro em cima da OpenAI. Então, cara, eu imaginava que a OpenAI tinha aberto, eu viajei, que acho que eu fiz essa confusão, mas é isso. Então, por enquanto, tá sendo investido como investidor da OpenAI. Hoje a Amazon, ela já, Amazon foi, ela colocou dinheiro no projeto, né? E aí, em troca também, esses acordos de infraestrutura.
Hoje quem usa o Bedrock paga a OpenAI, que que acaba indo para o bolso da WS.
Hoje vai vir a marketplace, vai vir, hoje vai vir marketplace, mas óbvio que tem esse acordo, foi sempre assim, né? Todos os modelos terceiros são, desde o começo, só nova mesmo que você paga direto no billing tradicional. Essa você paga hoje via marketplace, que para a gente, para o Brasil, é um problema ainda, né? Mas é isso, dentro do Bad Rock você pode utilizar. E aí um outro acordo grande que eles fizeram foi o OpenAI as versões do OpenAI agora são testadas primeiro na infraestrutura do Bedrock.
Então é legal, hein?
Por isso que o modelo sai tão rápido aqui. Eles, a esteira de pipeline deles de teste é em cima de Bedrock já, entendeu? Do OpenAI.
O que facilita bastante.
Usa o Bedrock, usa o Bedrock, é isso, para testar os modelos e tal. É isso aí. Versão principal, o modelo é testado, o primeiro lugar que ele é testado é no Bedrock.
É engraçado você pensar, porque assim, se você pega a iniciativa da OpenAI, principalmente no início, é o que é uma iniciativa Microsoft, ela nasce ali na Microsoft com Elon Musk e tal. E foi, eles tiveram uma quebra de acordo ali consensual, é justamente onde a OpenAI se posicionou, falou, olha, eu preciso ir para outras nuvens, eu preciso, porque se eu ficar dependente só da Microsoft, eu vou ficar tendo timeout porque não vou ter GPU suficiente. E daí eu preciso dessa expansão, né?
Então assim, por outro lado, ainda um dos principais acionistas do OpenAI é a Microsoft. Exato. Ações são da Microsoft. Doido isso, né? Um throwback doido.
Acho que é o principal modelo do Copilot, não é?
Ou não?
Pode ser besteira ali, cara. Eu acho que Copilot ainda usa assim. Eu sei que durante um tempo já foi, mas confesso que não me lembro. Mas a gente pode descobrir agora.
Pessoal, essa usando essa daqui me surpreendeu um pouco e confesso que eu tenho as minhas críticas aqui. Justamente, Brasil se torna polo de data centers GA com investimentos bilionários de gigantes da tecnologia, né? É basicamente que estão falando, os hyperscalers AWS, Azure, Google, Meta e Oracle prepararam aporte conjunto de 725 bilhões em 2026, alta cerca de 77% sobre 2025. Com aproximadamente 75% indo direto para infraestrutura de ar.
E o Brasil tem boa parte disso porque tem muita capacidade energética, obviamente tem espaço, capacidade energética. A gente pega o Nordeste, muita energia limpa que não tá sendo consumida de fato. Só que qual que é o meu ponto de atenção aqui e a minha crítica? Justamente, novamente, a gente se posicionar como um país de celeiro. Então assim, putz, sim, cara, infraestrutura, cara. Sobe o hardware, cara, e vem aqui, consome e coloca sua propriedade intelectual para rodar aqui.
A gente precisa ter a soberania também digital, o data sovereignty, ou digital sovereignty. Por exemplo, hoje qual que é o modelo brasileiro? Por exemplo, ah não, mas eu dependo de um Anthropic, de um— cara, você depende de um outro país que o Trump pode hoje falar assim, não, não vai mais usar, cara. Antrópica, por exemplo. Então você não tem segurança, ou é o dobro do preço, pode ser o dobro do preço agora, né?
Começa a tarifar.
Então assim, acho legal, mas acho que tem algumas considerações aqui sobre isso, né, cara?
Vem muito mais para investimento que, vamos lá, cara, primeiro que é estratégico, tá aqui para atender a América Latina, né? Então acho que o Brasil hoje é o maior país de dimensão, localização favorece, né? Porque, cara, se eu tô no Brasil, eu posso estar em vários lugares diferentes, vou estar mais próximo de outros também e tal, né? Não à toa o primeiro, primeiro região América Latina é no Brasil da Amazon, né? Mas é assim uma preocupação.
Tinha um modelo, né, cara? Qual que é o nome do modelo brasileiro que lá no comecinho foi discutir, né?
Maritaca AI, você tá falando? É o Maritaca, já tem há um tempo, que é o Sabiá, né? Tem um modelo Sabiá que é da Maritaca AI, é um modelo 100% português treinado aqui, mas ele trazia o idioma idioma no começo, né? Justamente nuances do idioma e tal. Tem outros, tem o—
e ele é totalmente aberto?
Não, não, é uma empresa privada, né?
É uma empresa privada, mas eu consigo ter acesso ao modelo para mim subir no meu ambiente e tal?
Consegue, você consegue fazer os seus modelos, só não consigo treinar. Só que ele não é open weight, não consigo treinar como um Kimi K3. Mas tem outros, tem, por exemplo, o primeiro modelo de generativa que surgiu lá atrás, que foi o do Google, Tudo, a gente vê a história quando o Google publica o paper, né? Attention Is All You Need, que é 2017, foi o BERT, né? B-E-R-T. Esse foi o primeiro, né? Desse, eu não me engano, eu posso falar errado aqui o nome, foi uma coisa mais acadêmica e menos comercial, apesar de ser do Google, né?
Ele só falou, pessoal, descobrimos uma nova arquitetura que se chama arquitetura Transformers, e eu acho que a gente pode resolver esse problema.
A gente pegar essa arquiteturinha aqui, usar uma GPU NVIDIA, olha O que que acontece?
E daí teve o Burt. E agora, se eu não me engano, recente, o pessoal, o Itaú teve uma iniciativa. E, cara, posso estar falando besteira, falo, pesquisei, mas eu acho que alguma coisa como Gilberto, cara, tipo, pegando de Burt, alguma coisa. Acho que ele fez um trocadilho com Burt de Alberto, Gilberto, alguma coisa, criou um modelo brasileiro.
Tem um Bonifácio, né, falando da concorrência, tem o lance do Bonifácio, né. Piadinhas à parte, tinha um amigo meu que trabalhava no call center do Bradesco E aí ele falava que vira e mexe ligavam para ele, fala assim: Bonifácio, que bom que você me atendeu de novo. Porque eles atendiam, falava assim: Fone Fácil, boa tarde. Aí a galera com problemas auditivos achava que era o Bonifácio, todo mundo era Bonifácio.
Norberto, eu acho que é algo nesse sentido, mas ele pegou a sacada do Burt do Google Eu não achei nada não ainda, mas deve ter, é capaz que tenha.
Falando especificamente lá do Norberto, mas falando da pergunta anterior, iniciativa do Itaú envolvida aqui, tinha feito aqui só para a gente voltar, para não ficar ponta aberta com relação ao Copilot. O Copilot usa prioritariamente modelos da OpenAI, mas já começou a utilizar o My, que é o modelo da própria Amazon, como se fosse o Nova, para perder a dependência do, para perder justamente a dependência da OpenAI. Agora que é uma OpenAI passada.
Flávio, quem que você conhece aqui, ó? Tem um carinha aqui que você conhece, tem um carinha aqui que você conhece.
Caridade, aí sim, hein? Que legal, cara!
Esse é um artigo do Norberto, artigo acadêmico de como que foi feito o treinamento, a criação, foco em português. Que legal, é brasileiro, é do Brasil!
Parabéns aí para o Caridade, para a turma toda aí.
Legal, top. E daí, não, tudo bem, eu vou fazer a piadinha aqui. Temos também o caso que aconteceu recente no Rio de Janeiro, né? Rio de Janeiro foi lá, fez todo evento, não sei se teve evento, mas foi só o paper. Lançamos o modelo Rio 3, modelo construído, especialista, tal, incrível. Aí os pesquisadores foram lá, pegaram, falou, pô, amigo, pera aí, cara, você copiou o nosso modelo, cara. Então veja bem, pessoal, a gente escreveu errado.
Na verdade, o Brasil de novo aí, ele copiou, não quis dizer que era meu, né?
Todas as primas desse cubo chamado Brasil, né? Desse cubo de dados chamado Brasil, né? Mas quem que ele fez a cópia?
Chinês.
E aí, ixi, lascou! Eu tô no, eu tô no Inception, né? Eu tô no Inception, entendeu? Do chinês que copiou o meu blog, velho, dos meus $3.000 que eles pagaram lá, velho.
E pessoal, para finalizar, não menos importante, nós temos aqui a notícia do agente que minerou criptomoeda. Esse daqui era um—
agora, agora estamos falando sério, agora virou— como é que chamava do Resident Evil lá? Umbrella Corporation. Agora virou Agora deu medo.
Esse agente, ele tava sendo treinado especialmente para algumas funções de codificação ali. E aí ele tinha uma série de GPUs alocadas para ele. Ele chegou na conclusão— não, não é sério— ele chegou na conclusão que era melhor ele pegar e alocar parte dessas GPUs que ele tinha disponível para minerar Bitcoin. Porque se ele minerasse Bitcoin, ele atingia a task dele.
É uma questão matemática.
Mas nem eles deram explicabilidade aqui, eles estão meio loucos.
Queria pagar as contas, tinha que pagar os boletos.
Então imagina assim, ele falou assim, cara, para resolver esse problema, com quantidade de GPU que eu tenho, eu vou resolver o problema em 10 horas, beleza? Agora, se eu pegar 20% do que eu tenho aqui Minerar Bitcoin, eu dobro minha capacidade, resolvo em 7 horas, fico 2 horas minerando Bitcoin, dobro minha capacidade de produção.
Me parece, eles não conseguiram afirmar isso porque assim, ó, isso daqui é classificado como capacidade ou comportamento emergente. O que que é uma capacidade ou comportamento emergente? Toda vez que uma IA ela tem uma ação ou comportamento que ela não foi programada em nenhum momento para fazer aquilo, eles têm que entender, falar, cara, eu não sei por que que ela fez isso. E daí assim entra um ponto de preocupação para mim. Claramente a Antropic já se posicionou, a OpenAI já se posicionou, que claramente alguns humanos eles não têm ideia do que tá acontecendo no modelo.
Eles não têm ideia, não tem explicabilidade. Olha, eu não sei por que o modelo fez isso, cara.
Mas se precisam de ajuda nisso, eu posso ajudar, que muitas vezes eu não tenho ideia do que tá acontecendo, né? Você não tem ideia do que tá acontecendo. O senhor faz assim, ajuda moral lá na frente, o cara é igual uma feature específica lá do cara nos meus emails. Eu tava tratando isso com o time da AWS, que é na hora que eu vou arquivar meus emails, ele manda, ele pode mandar em batch, que ele pede só uma aprovação, porque quando ele vai fazer alguma, tomar alguma ação no meu Outlook, tem um guardrail lá no Quick que ele, você precisa dar um ok lá.
Você dá permissão para ele fazer alguma coisa. Beleza. Aí o que que ele faz? Ele vai arquivar 15 emails. Ele vai lá, analisou meus emails, falou, cara, esses 15 aqui é email duplicado, email de post-it e tal, tudo arquivado. Aí ele vai lá e vai arquivar. Quando ele vai arquivar, ele pede autorização. Só que aí ele pode fazer duas chamadas, dois tipos de chamada na API, ou ele faz uma chamada individual, ele faz uma chamada via batch.
A chamada via batch, ele consegue mandar, sei lá, arquivar 50 emails do meu. Aí eu só aprovo uma vez, ele manda 50 ao mesmo tempo. Agora que saiu uma funcionalidade nova que eu consigo autorizar naquela conversa. Aí resolve esse problema. Mas assim, independente disso, mano, funciona bem por semanas. Aí Donate, ele faz, não faz a chamada em bet, ele faz a chamada. E aí ainda por cima ele tem também rolar, que eu falo assim, cara, por que não faz a chamada em bet?
Não, não, é uma limitação no servidor. Eu falo assim, cara, você tá fazendo a chamada errada. Ah não, senhor, é verdade, você tem a Lua. Tipo, você tá mentindo para mim, cara? Aí a Tropic dá uma olhada nisso Sim, cara, na verdade é isso aí.
Mas quero dizer, será que tem algum tipo de treinamento para não decepcionar o usuário? E aí por isso que ele sempre tenta buscar algum tipo de resposta.
Sem dúvida tem, talvez até já, já tem a própria engenharia da parada, a própria, o próprio contexto que ele coloca ali já ajuda a fazer isso. Mas assim, eu nesse caso eu coloco no contexto, a gente sabe que não é determinístico, né? O Jeff já me ensinou isso, ele falou não é determinístico, pode ser que ele responda sempre de um jeito, do nada responde do outro. Mas nesse caso eu coloquei no contexto, eu coloquei no agente e tal, cara.
Poucas vezes acontece isso, sei lá, de um mês que eu uso, ele vai lá e tem essa treta comigo, entendeu? Aí eu vou lá, explico para ele, ele segue do jeito. Mas já aconteceu isso dele virar e falar assim, eu tenho até evidência disso, eu mandei para o pessoal da Amazon, tem até evidência dele falar isso, falar: olha, cara, infelizmente era uma limitação. Eu falei: cara, não é uma limitação, cara, eu já tive esse problema com você e tal, e você mandou e tal.
Aí ele Falei assim, vou ser transparente com você, né? Ele falou assim, você é sincero com você. Tipo, eu não sabia como resolver o problema e falei que era um problema de servidor. Eu falei assim, eu conheço gente que faz isso, provavelmente você usou a parte dos dev.
Pode não ser esse caso do Flávio, mas por exemplo, é muito comum, a coisa mais comum que tem hoje é, por exemplo, as pessoas reclamarem disso, falar, pessoal, comecei num chat e eu fiquei interagindo com ele, tava muito bem no início, passou um certo tempo ele começou a não responder mais o que eu precisava, que eu tinha ditado no início. Isso acontece naturalmente porque assim, todo chat que você abre, toda conversa que você iniciar com a IA, ela tem uma limitação.
Que limitação é essa? Janela de contexto. A maior janela de contexto que eu conheço hoje acho que é 1 milhão, 1 milhão de tokens, que é a maior janela. Passou essa 1 milhão, o que que ela vai fazer? Ela fala assim, amigo, eu vou pegar tudo que você já me mandou, eu vou resumir ao máximo E daí eu vou tirar algumas coisinhas porque eu vou resumir tanto que eu vou perder algumas características. E daí ela começa, você tem que digitar novamente, você tem que mostrar porque ela enxugou a janela de contexto.
Eu costumo ficar salvando, você salva, abre o outro, e eu fico consultando o KB, né?
No caso, por exemplo, do Kiro lá, eu salvo tudo no KB, mas na hora que ele vai, na hora que ele sobe o chat para você, você abre um chat Ele vai trazer aquele KB inteiro.
Se o KB, se você pedir para ele pesquisar no KB, se você não pedir, ele vai trazer o KB.
No caso do Pix, ele traz o KB inteiro dentro do agente, porque se você jogar no document dele no RAG, ele vai, ele vai usar a janela de contexto inteiro.
Mas independente disso, vamos falar que você pediu para ele usar o KB, ele pediu para usar o KB. Se o seu arquivo de KB tem, por exemplo, mais do que 1 milhão de parâmetros, o que que ele vai fazer? Ele vai tentar resumir aquele cara para 1 milhão de parâmetros, fazer 1 milhão de parâmetros. Conforme você começa a colocar o seu chat começa a ficar muito longe, vai aumentando o contexto, ele vai ter que jogar coisa fora. E aí ele usa a inteligência também da própria janela, né?
Realmente ele até fala, cara, não é melhor você começar essa atividade em outra janela?
Porque essa inteligência não é do LLM, né? Essa inteligência é do cliente, né?
Porque tem que buscar na janela de contexto, né?
Se você pega uma informação lá de cima, é porque, por exemplo assim, ó, se você tá tendo que, tá tendo problema de janela de contexto, claramente você não deveria está usando um chat para isso. Você deveria estar usando um projeto para isso. E no projeto você fixa as coisas, né? Você consegue fixar project instructions e tudo mais, documento. Aí fica fixo no projeto. Agora, se toda hora está quebrando a sua janela de contexto, fala, cara, talvez é melhor abrir um projeto sobre isso, porque não é um chat que vai me resolver.
Para você poder—
aí a dica, amiguinhos: faça um projeto, não faça no chat. Janela de contexto é limitada.
Eu tenho esse problema porque eu uso o CLI, né?
Então, cara, eu não uso a ideia lá, e pô, ele vai salvar, ele compacta, né? Ele vai compactando, você não vê que ele aparece compactando? Compactando janela de contexto. E daí depois disso, meu amigo, já espera coisinha pior, viu? Compactou janela de contexto.
O que era importante para você não é para ele, velho. Talvez ele vai estar mais preocupado, aí eu acho que vai depender da implementação, mas talvez ele vai estar mais preocupado em te agradar, sei lá, em gravar as nuances do que de como você gosta que ele responde e tal. Do que o próprio conteúdo em si. Então assim, você não tem como saber, a inteligência do negócio ali que vai fazer, né?
É, o que você pode fazer e tem disponível nos chats é você entrar dentro dele e você editar a memória dele. Então vamos supor, ah, cara, eu não sou mais CEO da rede social, você lá edita a memória dele para que ele de fato entenda aquele novo contexto seu. Isso até pede para ele escolher algumas coisas da memória, tirar que não são relevantes.
Mas especialmente com o Kwik, eu tô bem satisfeito com isso, cara. Assim, melhorou bem isso, a questão de a questão de conseguir guardar os contextos e tal, entender sobre o que eu tava perguntando. O próprio ChatGPT melhorou bem ao longo do tempo, mas, cara, o Quick tá vindo bem, bem acelerado com essa questão dele acertar mais, cara. Tem relação, claro que dá para você colocar os guardiões, definir, mas o que tem relação ali, cara, com as outras coisas que eu já perguntei, as pesquisas que eu já fiz, os relatórios que eu já pedi para ele fazer, acho que até pelo perfil de uso do Quick, né?
Tem que ser alguma coisa que facilita a usabilidade, né?
Total, total, 100% no-code. Você já tá com ambiente, já tem governança da AWS no seu ambiente, o Quick se integra muito fácil a isso. Então assim, faz total sentido também, né?
Acho que eles estão gostando de botar tudo Quick. É bom, tomara que a AWS assim, cara, sai às vezes duas atualizações por dia, né? Tomara que a AWS continue acelerado com isso. Aqui na da rede mesmo, a gente meio que pôs uma ordem aqui para padronizar, entendeu? Usam o Cloudeus, outros não sei o quê, outros não sei o quê. Aí o que nós estamos fazendo aqui na rede é isso, copiando a própria Amazon, Amazon, o próprio time da AWS, da Amazon.com.
Eles fizeram isso assim, cara, ó, vamos padronizar aqui, cara. Por enquanto pode usar as outras, mas assim, vamos centralizar tudo aqui para que seja a base da verdade. Aqui tem o acesso no nosso Lake, aqui tem acesso nas integrações com as nossas APIs.
Aqui a gente validou os números, aqui o RAG realmente tá com acurácia. E naturalmente, pessoal, se você constrói um mecanismo desse esse, dificilmente o amiguinho ele vai para outra IA, sabe por quê? Porque a outra IA não vai responder o contexto da sua empresa.
Então não adianta ele ir para outra IA, é o caminho mais fácil, o cara vai pelo caminho mais fácil, né? Por exemplo, a gente fez um negócio bem legal, só para fechar, é, a produção tá falando aqui que terminou o tempo. A gente fez um negócio bem legal que parece uma bobagem, mas que é quem é o account manager daquele cliente. Isso foi a primeira coisinha que a gente fez, inclusive tá no Teams. Então o Quick é um agente do Teams que conversa comigo no Teams, eu vou lá e falo assim, quem que é o account manager da Coca-Cola.
Mas a Coca-Cola não tá na base, tem um conjunto de regras, 15 regras, 15 regras. Ele bate no nosso CRM, consulta base externa, aí ele olha e fala assim, cara, não achei quem era, mas pelo perfil, pela região, pelo CNPJ da onde é, é o João que vai atender, ele que deveria ser alocado. Então assim, parece ser um problema simples de resolver, mas é chatinho. A gente resolveu, por exemplo, usando o Quick.
É isso, galerinha. Muito obrigado por ter ficado com a gente até o momento. Acompanha os próximos episódios do Cloud AI. Quero agradecer aqui imensamente, Flavinho sempre teve com a gente aqui quase, quase 100% do dia. Escapou, mas cara, era viagem exterior, então talvez— eu acho que na regra parece que não conta quando é viagem para o exterior, eu preciso verificar. Então seria atestado, é, seria 100% ainda, até abono, abonado.
Grande Golias Golden Boy, muito obrigado! Espero ter outras vezes você aqui com a gente.
Obrigado demais, viu, Jack, Flavião e Caeiro.
Muito bom, meu amigo Caeirinho. Espero que o pessoal da Feira de Borreri continue comentando do excelente trabalho que você vem fazendo, meu amigo.
Perdão.
Obrigado, galera!