290: Como a IA pode ajudar a fortalecer línguas indígenas de forma ética, com Claudio Pinhanez
Nesta semana, recebemos Claudio Pinhanez, cientista de IA e professor, para conversar sobre o uso de IA no fortalecimento de línguas indígenas, sobre os desafios de criar ferramentas com poucos dados e, sobre a participação das comunidades nesse processo.
- Marcus Mendes, host sob controle
- Fabrício Carraro, co-host sob controle, Program Manager da Alura, autor de IA e host do podcast Carreira Sem Fronteiras
- Claudio Pinhanez, cientista de IA e professor
Links:
- Centro de Inteligência Artificial da USP — C4AI
- Estudo Harnessing the Power of Artificial Intelligence to Vitalize Endangered Indigenous Languages: Technologies and Experiences
- Projeto Yẽgatu Digital
- Ferramentas de escrita do Yẽgatu Digital
- Constituição Federal traduzida para Nheengatu
- No Language Left Behind — NLLB, da Meta
- Estudo Facebook FAIR’s WMT19 News Translation Task Submission
- Estudo Human Evaluation of the Usefulness of Fine-Tuned English Translators for the Guarani Mbya and Nheengatu Indigenous Languages
- Filme A Chegada
- Declaração de Los Pinos e o princípio “Nada para nós sem nós”
- Estudo Fixing Rogue Memorization in Many-to-One Multilingual Translators of Extremely-Low-Resource Languages by Rephrasing Training Samples
- Estudo Quantifying the Ethical Dilemma of Using Culturally Toxic Training Data in AI Tools for Indigenous Languages
- Alfabeto Fonético Internacional — IPA
- Te Kōhanga Reo e a revitalização da língua Māori
- Claudio Pinhanez comenta o fechamento do laboratório da IBM Research no Brasil
- Claudio Pinhanez comenta sua busca por trabalho sete meses após a demissão
Conheça a escola de Inteligência Artificial da Alura e mergulhe com profundidade para dominar as principais ferramentas que estão moldando o agora.
Inscreva-se na Newsletter IA Sob Controle, e receba notícias semanais sobre Inteligência Artificial, assinada por Fabrício Carraro.
Preencha o formulário com as suas sugestões para deixar o conteúdo do IA Sob Controle ainda mais interessante.
- Alura Cursos de Tecnologia – https://www.alura.com.br
Edição e sonorização: Rede Gigahertz de Podcasts
- O uso da inteligência artificial para fortalecer línguas indígenas ameaçadasdesafios de criar ferramentas com poucos dados·participação das comunidades no processo·línguas indígenas ameaçadas de extinção no Brasil
- O projeto Yẽgatu Digital para estimular o uso da língua Nheengatu no mundo digitaldesenvolvimento de tradutor e corretor ortográfico·parceria com comunidades do Alto Rio Negro·criação de salas digitais para ensino
- A importância da ética e governança na coleta de dados em comunidades indígenastradição histórica de não dar nada em troca·necessidade de retorno útil para a comunidade·dados como material tóxico e sensível
- Desafios técnicos e instabilidade de modelos de IA com poucos dadosfine-tuning puro causa overfit e instabilidade·modelos tendem a repetir palavras e entrar em loop·limitação de dados para línguas minoritárias
- A busca por emprego e a confusão no mercado de inteligência artificialmercado não sabe o que quer·ruído e interesses contraditórios·dificuldade para posições sênior
- O futuro da IA e as áreas de interesse para pesquisa e desenvolvimentouso de LLMs na educação·interação com robôs usando linguagem·criação de linguagem para máquinas que falam
Olá, bem-vindas e bem-vindos à edição de quarta-feira, edição de entrevista do IA Sob Controle, o seu podcast com overfitting de informações sobre o mundo da inteligência artificial. Eu sou o Marcos Mendes e assim como toda semana tá por aqui o Fabrício Carraro, viajante poliglota, host do podcast Carreiras Sem Fronteiras e Program Manager da Alura. Fabrício, tudo bem?
E aí, Marcos? E aí, pessoal? Mais uma entrevista aqui que a gente vai voltar um pouco para o mundo acadêmico, mas não só. Tem muita coisa prática também que a gente vai bater um papo hoje, e até coisas de povos indígenas do Brasil, que é um tema que me interessa muito, que eu tô até trabalhando nele.
Não dou spoilers por enquanto, talvez, mas no futuro a gente vai começar com isso. Inclusive, professor Cláudio Pinhães, cientista de IA, professor de Vale também, né, e já tá há algumas décadas nessa área. Bem-vindo ao IA Sob Controle.
Obrigado pelo convite, é um prazer estar aqui. Queria saudar aí todos e todas que estão nos ouvindo. É sempre ótimo falar sobre inteligência artificial, né? Eu trabalho nessa área desde 1987, quando fundei o primeiro grupo de estudo na USP dessa área. E quando estávamos vivendo o verão anterior de IA, tá, em que as máquinas iam acabar com todos os empregos lá na década de 80, tá?
Também. É muito bom poder trazer essa perspectiva de alguém que já viveu algumas vezes esse ciclo todo de interesse e o desinteresse, o vale da desilusão e o inverno, e voltar investimento, etc. Mas o Fabrício já deu spoiler aqui. Eu queria começar falando sobre isso porque a gente algumas vezes comentou sobre investimentos e estudos de aplicação, desenvolvimento de inteligência artificial aplicado a linguagens indígenas. A gente tem uma ideia meio tangencial do que deve ser, um pouco para preservação, compreensão.
A partir disso você expande esse conhecimento para registros. Mas agora oportunidade perfeita para falar: é isso mesmo? Qual que é o propósito e como é que funciona você aplicar a inteligência artificial para estudar linguagens indígenas?
Existem muitas maneiras da gente usar inteligência artificial em qualquer área, qualquer área, né? Aqui nesse caso nós Estamos usando essas tremendas capacidades que os LLMs têm de trabalhar com linguagem para focar em tecnologia que pode ajudar principalmente línguas indígenas ameaçadas de extinção, tá? Isso é, grande maioria delas está ameaçada de se extinguir nesse século. Quando a gente olha para o Brasil, o Brasil tem cerca de 200, 250 línguas.
A maioria esmagadora delas está ameaçada de desaparecer, particularmente porque nenhuma língua no Brasil tem um número expressivo de falantes. O ticuna, que é a língua mais falada, tem em torno de 50 mil. Só para comparar, o quechua, da região ali do Peru, tem 1 milhão de falantes. É outra categoria de língua. O guarani paraguaio tem 6 milhões, é língua oficial, tá? Nós estamos falando de línguas realmente circunscritas a alguns povos, algumas áreas.
E aí, como é que você usa isso? No nosso caso, a gente, nesse projeto que a gente desenvolveu dentro do Centro de IA da USP, né, que era uma parceria da IBM, da FAESP e da USP, a gente desenvolveu um trabalho de coleta usando algumas ferramentas de inteligência artificial para ajudar a processar os dados. Isso foi feito com Guarani e Nhãndeva aqui no litoral de São Paulo, tá ali perto da Praia Grande. Ali tem muita aldeia naquelas montanhas lá, a gente não sabe, tá? Você olhar ao longo dessa costa de São Paulo, tem mais de 50 aldeias.
Não sabia mesmo, tá?
Não precisa ir longe, você vai São Paulo aqui, você vai no sul da cidade, tem a terra indígena Tenã da Porã, que é dos Mbiá, muito povo, muito organizado, grande, estruturado. Todo mundo lá fala a língua, tá? Tem escola e tal. A gente trabalhou um pouco com eles no passado, mas o nosso esforço principal é um pouco longe daqui, é lá no Alto Rio Negro. Isso é 4.000 km de avião, é longe, 5 horas de barco só lá naquela região. E a gente começou a trabalhar com eles por conta de que nós começamos a desenvolver tecnologia para o Nyengatu, que é uma língua É interessante porque ela é uma língua que foi criada artificialmente para ser uma língua franca entre os povos indígenas da Amazônia, muito pelos jesuítas.
Ela, que a gente chama Língua Geral da Amazônia, que era a língua franca da Amazônia todo o século 17, 18, início do 19. Aí veio o Marquês de Pombal e disse, não vai falar mais isso aqui, aqui é lugar de português, tá? E aí essa língua foi adotada por gente de diferentes modos. A gente trabalha com os Barés. Com os Barés, o problema deles é que a internet chegou via satélite, aliás, como toda a Amazônia, e as comunidades deles, que são muito ativas, têm escolas bilíngues, as crianças sabem ler e escrever em português e em ngatu, eles sentiram que a pressão no mundo digital estava na direção do português.
Então a gente criou um projeto para ajudar e estimular crianças e jovens a usar o Nyingatu escrito no mundo digital. Para isso a gente desenvolveu tradutor, a gente desenvolveu completador de palavra, corretor ortográfico, porque é isso que ajuda a gente a escrever mais e melhor. E é um problema que eles têm também. Então assim, ah, você bota o celular e eles vão escrever em Nyingatu? Em português tem tudo isso, em Nyingatu não tem.
E eu lembro tudo assim, eles sabem, mas eles não têm influência. E a verdade é, depois dos 15 anos você só escreve no mundo digital, você não escreve mais em papel. Então a gente estabeleceu uma parceria, montou duas salas digitais lá no meio do Rio Negro, lá para as comunidades, e até hoje a gente interage com eles e treina os professores agora para que eles ensinem as comunidades a escrever nesse mundo que chegou e chegou para ficar.
E como é que funciona a coleta de material, de dados, para fazer o treinamento disso? De onde vem? Já tinha alguma coisa digitalizada? Envolveu esse esforço também? Essa parte técnica é bem interessante.
Olha, essa é uma pergunta super importante, porque a gente vem de TI, a gente, ah, eu quero fazer o bem, eu vou coletar dados, vou colocar open source. No mundo indígena não funciona assim, porque Porque existe uma tradição histórica de coletar dados e não dar nada em troca. Pesquisa é uma palavra suja na maioria das línguas indígenas, tá? Então a gente teve muito cuidado e a gente foi muito auxiliado pelos linguistas da USP que trabalham nessa área, que são nossos parceiros, de entrar em contato.
Quando entrar em contato, a gente disse, nós não vamos fazer coleta, nós vamos usar o que existe já na internet. E no caso de Engatu existe muito, existe muita coisa. A gente vai ver que não é muita coisa logo logo, tá? E a gente entende que à medida que a gente constrói ferramentas que são úteis, aí a conversa de coleta começa a ficar mais simples e mais justa. Então assim, primeiro tem que identificar um retorno que seja útil para comunidade.
E aí dizer, muito bem, para melhorar essa ferramenta eu vou ter que coletar, como é que a gente vai fazer governança? E aí também já tem uma cultura digital um pouco um pouquinho mais avançada. A gente tentou fazer isso antes, eu acho que não dá certo, ou você consegue aprovação que não é uma aprovação real de alguém que tá entendendo o que você tá fazendo. E assim, isso é debate no mundo inteiro, tá? Eu já fui N vezes contactado, olha, você não quer botar os seus dados aqui nesse repositório open source?
Olha que coisa legal! Eu não tenho autorização. Não é necessariamente uma coisa legal para eles, e esse é um processo que envolve retorno, e o retorno não é colocar dados lá. Eu acho que isso é algo que a gente aprendeu bastante forte nesse projeto e que ainda é um mito que tem, que precisa ser trabalhado com pesquisadores, de que basta coletar e botar o pensose, você tá fazendo o bem por aí.
Eu tô muito interessado inclusive nesse tema, porque como eu falei, sem dar muitos spoilers, mas eu tô trabalhando exatamente com isso atualmente, né, fazendo um projeto de pesquisa com línguas indígenas, não só do Brasil, né. Uma que eu acho que eu comentei no podcast com o papiamento, né, que é uma língua ali das Ilhas ABC do Caribe, mas também com línguas indígenas do Brasil. Por enquanto só pesquisa, mas que pode virar outra coisa também.
Vou até conversar com você depois aqui em off, Professor Cláudio, Mas desse lado técnico mesmo, eu entendo das minhas pesquisas, né, você mencionou de LLMs e tudo mais, que para idiomas que têm tão pouco recurso, mesmo como o Yengatu, né, que tem a Constituição traduzida online, tem outros livros da comunidade publicados e tudo mais, conseguindo essas autorizações para treinar e fazer um LLM ou SLM, um fine-tuning de alguma coisa nesse sentido, tende a funcionar pior, né, porque eles são decoder-only.
Do que um modelo encoder-decoder, como aquele do NLB do Facebook. Tem outros que estão por aí. Isso ainda é verdade hoje em dia, na sua visão?
Olha, nossa experiência trabalhando com uma língua aí de 20 mil falantes, que era o Niengatui, que realmente tem proporcionalmente, tem muito, tem mais recursos que a média de línguas desse tamanho, é que assim, a quantidade de dados que você consegue achar é bem limitada. E aí é importante a gente fazer uma distinção, que quando a gente tá falando de línguas indígenas, a gente pode estar falando de Quechua, que é uma língua de 1 milhão de é outra lógica.
Ela já— ninguém é dono do quechua, tá, ou do guarani no Paraguai, tá. Aí é outra lógica, coleta funciona diferente, tá. Tô falando de línguas que é uma comunidade pequena, tem interesse em preservar, mas ao mesmo tempo eles têm poucos recursos mesmo para produzir muito conteúdo. Então, por exemplo, para o tradutor, tradutor você tem que coletar pares de sentenças numa língua e noutra. A gente trabalhou, trabalhou, trabalhou, coletou em torno de 9 mil sentenças.
Só que tinha aí um problema que a gente teve que lidar, que era muitas das sentenças continham versos da Bíblia. Não porque a gente pegou a Bíblia, mas tem. Isso é uma questão delicada no universo indígena, que para muitos, sabe, a presença da igreja é muito forte, mas ao mesmo tempo tem uma tradição de violência associada, particularmente ali no Rio Negro. Eu cheguei a conversar com sobreviventes, gente que Apanhou por falar em engatu na escola, tá?
Nesse nível, 30 anos atrás. Então fala do passado, tá? Então assim, aí a gente teve que chegar, limpou essa outra questão, tá? A gente tinha uma pessoa no grupo, por conta das convicções religiosas dela, pela prática, ela sabia fazer isso, tirou as coisas, tá? Que era importante. E aí sempre ficou 8 mil por aí. Aí você diz, dá para construir um tradutor com 8 mil sentenças? Olha, acredita, saindo de um tradutor que já existe, tá?
A gente pegou um tradutor alemão e inglês como saída, que era um tradutor muito bom, tinha sido treinado com 500 milhões de pares. Aí eu pego 8 mil e tento transformar ele num tradutor de português, tá? Incrivelmente funciona até um certo ponto. Os amigos linguistas que eu trabalhava não acreditavam que fosse possível, até porque precisaria Como ele não engole a gramática? Não, não engole não, não precisa, mas tem problemas. Quer dizer, você na abertura falou em overfit, é um overfit tremendo em cima de uma máquina dessas, tá?
Isso é um pequeno modelo especializado em tradução, foi o que a gente achou melhor, melhor que o NLDB, por exemplo, NLDB, tá? Que a gente também trabalhou com aquilo. E assim você consegue transformar em algo usável para quem conhece a língua. E é esse o objetivo. Agora, existe uma coisa que quem trabalha com fine-tuning, esse processo de pegar um modelo que já foi e usar uma massa de dados e fazer uma fine-tuning pura overfit, no fundo, sabe que não só tem o problema de ser overfit, como tem um outro problema: os modelos gerados tendem a ficar instáveis.
Alucina pra caramba!
Não, é instabilidade mais grosseira, começa a repetir palavra, sabe, entra em loop. Alucina. Mas é muito essa coisa de ele é instável, assim, de repente você põe uma frase, ele começa a ficar maluco, começa a gerar um monte de coisa. Mais incrível ainda, é tão instável, numericamente fica tão instável, que quando você muda de máquina, um tradutor que tava funcionando bem numa máquina, você muda, ele para de funcionar bem. Isso é pura instabilidade numérica.
Posso assim, como o topo lá, tá, sabe, você tá tirando probabilidades muito perto uma da outra. Na hora de selecionar o próximo token, tá? Aí sim que a gente entendeu o que tava acontecendo. E olha que a gente checou tudo, se era biblioteca errada, diferente, se era biblioteca errada, se não chegava à conclusão que a gente chegou assim. É aquilo, é conhecido que fine-tuning aumenta instabilidade, tá? Aumenta, diminui segurança.
Isso é um resultado já estabelecido. Mas esse é um problema que você faz, então ele tá, então começa a aparecer problemas técnicos. Isso foi uma coisa interessante para nós porque a gente é técnico. Mas isso na prática limita o que você pode fazer ou não pode fazer.
E uma nessa sequência então é até para tentar, vamos dizer, tirar a parte que pode tocar em algo que a gente não, como falando, que a gente não quer criar violências contra comunidades, né? Mesmo sem querer, a gente não quer fazer isso. Então vou dar um exemplo totalmente hipotético aqui. Os venusianos chegam na Terra amanhã e a gente tem ali livros e tudo mais. O que que você acha que é, vamos dizer, um mínimo necessário para ter uma coisa boa?
Não uma coisa ok, né, igual o que a gente tem hoje em dia para línguas minoritárias, mas uma coisa realmente aceitável, boa, para fazer seja um encoder-decoder, seja LLM, para fazer com áudio também, né, um tradutora ali que escuta, faz um ASR e transcreve para outra língua, para mesma língua, ou traduz para outra língua. Com toda essa visão, né, de todos esses possíveis tradutores, o que que você acha que é o mínimo necessário de dados?
Isso é uma pergunta difícil. Como você tá dizendo, o problema dos venusianos é outro. O problema dos venusianos é que a gente não sabe se eles têm a mesma semântica que a gente, porque eles podem ter sensores diferentes. Assim, se eles forem que nem morcegos, não faz sentido falar em eu vi uma cor vermelha. Então assim, eu tenho uma amiga que imagina, que estuda isso, ela tá na Universidade de Havaí, ela estuda como falar com alienígena.
Tem gente que é paga para estudar isso, porque quem sabe um dia aquilo que acontece naquele filme A Chegada acontece.
Sim.
E aí tem que, você tem que conversar com alguém que você não sabe o que pensa.
Um dos meus filmes preferidos, inclusive.
É um filme muito bom. Os linguistas dizem, mas enfim, coisa de linguista. Tá bom? Mas é interessante quando a gente pensa, porque eu acho que a questão é que a gente tem que trabalhar com essas comunidades pensando, primeira coisa, seguindo uma regra que na verdade foi adotada por eles mesmos, que é, imagina que eu sou indígena falando, nada para nós sem nós, tá? Então acho que a primeira conversa é o que que eles precisam. E aí eu acho que tradutor é um bom, ele é bom para fazer pesquisa Porque já existe muita coisa, existe lá métricas que dizem se o resultado é bom, que na prática não valem, eu vou ser bem franco.
Aquelas métricas, você vê a origem delas, é interessante, porque elas vieram de um pessoal até que eu conheço, que era da IBM Research, lá de onde eu trabalhava, lá do início do século 20, né? Mas são métricas extremamente formais, tá? Então assim, a gente tem que tomar cuidado, mas a comunidade adora que tem uma métrica. Tem bancos de dados, as sentenças não são muito longas, sabe assim, é bom para fazer pesquisa. E tem coisas que é bom para fazer pesquisa que a gente tem que continuar fazendo pesquisa em si.
Então, por exemplo, meu grupo pegou 40 Bíblias traduzidas para línguas brasileiras que a gente achou e fez uma série de experimentos em cima. Ah, se eu puser várias parecidas ao mesmo tempo para treinar o modelo versus só uma, será que é melhor? Eu acho que com o material de pesquisa é ótimo, Bíblia é material de pesquisa, a gente tem que chegar e tratar como vírus nível 5, tá? Você deixa lá fechadinho, você não passa para frente.
É material altamente tóxico dentro dessa área, mas é um material que existe, é bom, tá? E você cria um tradutor para Bíblia, que é uma coisa diferente de linguagem, tá? Vamos ser bem franco, tá? É uma linguagem muito específica. Mas aí, então assim, a pergunta é: o quanto Que nível de erro eles podem viver na aplicação que eles estão pensando? Isso também, na verdade, eu acho que essa é uma pergunta que todos nós devemos fazer hoje em qualquer aplicação de Transformers no mundo real.
Aquelas máquinas erram, alucinam, são incontroláveis. Quanto erro eu consigo viver na minha aplicação? Ou é fácil uma pessoa receber o resultado e filtrar? Essa é a minha visão. Fantásticas máquinas erram. Tá, mas ali no caso línguas indígenas, quer dizer, tem um problema de comunicação. Ah, eu vou, eu quero usar isso para ajudar médicos a conversar com os pacientes, sei lá, para entender o que eles estão sentindo, por exemplo.
Isso eu já ouvi falar. Isso aí, agora você tá no terreno muito complicado. Tem semânticas diferentes, você tem visões de mundo diferentes e Poucos dados, diga-se de passagem. Alto valor, tremendo alto valor. Quando teve a crise lá dos Yanomami, lá no Rio Negro, é uma área lá do Rio Negro, houve uma dificuldade muito grande de levar linguagem entre os médicos, os enfermeiros com os Yanomami, tá? É duro, ainda mais porque a visão do que a gente tem dentro para eles é diferente do que talvez a gente ache, que a gente fala, que não sabe hoje.
Ali no fígado, cara, olha para você, fígado, que que é fígado, tá? Talvez ele saiba, fica na associação com animais, tá? Lembra que eles fazem autópsia, digo, eles cortam animais o tempo inteiro. Então até talvez tenha uma boa ideia, mas calma, vamos com calma, tá? Em todas essas tradições. Então assim, os venusianos não estão tão longe, porque são mundos que funcionam diferente. Aí, por exemplo, a pessoa chega para você e diz: ah, quando eu faço xixi, as formigas vêm.
O que que isso significa? Diabetes. É a clássica maneira usada para a comunidade pobre diagnosticar diabetes. Aliás, século 19, os médicos usavam isso no mundo inteiro, tá? Passa, se atrai inseto porque tá doce, ou até Vai lá e põe o dedinho e vê se tá doce, tá? Mas assim, ele fala isso, isso tem que estar traduzido: tem açúcar no meu sangue, tá? Então tem uns problemas assim, mas eu acho assim, esse é um interessante, que em Yanomami existe um dicionário escrito de saúde, a única língua que eu conheço no Brasil que tem isso, foi feito em 81, tá?
Para não alto nível, para consulta, tá? Eu acho que é uma coisa, se eu tivesse aqui, se tivesse dinheiro para investir, só fazer isso para todas as línguas. Isso é útil, criar dicionário, contratos linguísticos e tal, tá? É uma coisa de— e vamos tentar botar para auxiliar, não é para tomar conta. Isso é crítico demais para tomar conta. Agora, por exemplo, a gente, só para quando a gente tá fazendo escrita— escrita é um processo que a pessoa pode revisar, e no caso é escrita em sala de aula.
Quer dizer, o tradutor, o tradutor, principalmente o corretor, que é uma coisa importante, mais importante para eles. O corretor dá erros, faz parte também do que aluno faz, do que às vezes o mesmo professor diz: poxa, eu não tenho dúvida. Eu vi casos que o cara foi ligar para um outro cara dizer: como é que você escreve aquilo lá mesmo? Tá bom. Então assim, tem que ser bom o suficiente, isso vai determinar os dados. O que é bom o suficiente?
A comunidade, comunidade por ontem. Não tem como fazer isso fora do contexto, tá? Eu acho, acho que a gente põe só assim às vezes coisa muito se trata como a gente fez com as Bíblias. Mas mesmo assim, sabe, só para ter uma ideia se algumas coisas são viáveis ou não.
E mesmo uma mesma língua no mesmo contexto pode ter grafias diferentes, né, por línguas que não são oficializadas.
Todas essas línguas têm grafias diferentes. A Constituição que você referia, a Constituição escrita em linguatu, tem 4 grafias diferentes, às vezes na mesma frase. Porque o que escreve de um jeito foi escrito por um deles, um outro que escreve com uma grafia diferente escreve, corrigiu um pedaço. Assim, o professor Tom Findel, que é o especialista do trabalho, ele diz: aquilo lá é uma sopa de grafias. Até interessante do ponto de vista de um historiador.
Mas, por exemplo, no Alto Rio Negro eles foram muito claros: tem que usar a grafia das escolas, que era diferente do maior parte do material que a gente tinha. E a gente trabalhou com eles, conseguiu criar uma série de regras de conversão ortográfica, né? E aí criou um conversor automático que cuidava de 90, 95% dos casos, tá? E conseguiu fazer para poder retreinar os nossos sistemas com os dados na ortografia deles. É interessante, o lado oposto, o automático não funcionava. Porque tinha problema de um para muitas, assim.
E professor, uma coisa que você tava falando agora pouquinho sobre o modelo começar a produzir uma coisa que seja útil, mas ele é bem instável. E partindo da premissa de que você já usou a maior parte dos dados, talvez todos os dados que dava para usar, então colocar mais dado para treinar o modelo, alguma coisa assim, talvez não seja uma possibilidade. Qual que é a solução mais promissora? Dado sintético? Limpar talvez os dados que já estão lá, arquitetura? Sim. Para onde vai?
Olha, a gente limpou muita coisa. Primeira coisa que você tem que, quando você tá trabalhando com fine-tuning nesse nível, você não se pode dar ao luxo de ter erro nos dados. A gente gastou muito tempo limpando, tendo certeza, em alguns lugares conferindo lá com o especialista que a gente tinha, porque muito sério. Um erro ali é suficiente para criar uma instabilidade. Se você começar a trabalhar com uma comunidade bem e aquilo lá for útil, você vai gerar escrita.
E aí a questão é você negociar que aquilo ali seja reusado e como vai ser feito. Até porque assim, ah, eu vou pegar seus dados do WhatsApp, delicado, bem delicado, tá? A gente tem que tomar cuidado assim. Ah, isso aqui é escrita religiosa, isso aqui é escrita que só homem pode ver, isso escrita que só mulher pode ver. Tudo isso faz parte desses universos, tá certo? Então a gente, mas assim, digamos, agora aí, poxa, se eu pegasse o WhatsApp deles de 2 meses em Ingatu, eu dobrava o Corpus.
Então assim, por outro lado, como o Corpus é muito pequeno, é fácil ampliar nesse nível, ampliar 10 vezes já começa a ficar outra categoria, porque você achou maior, chega no limite de quanta pessoa o quanto uma comunidade de 10 mil falantes escreve. A gente tem um plano super ambicioso que alguma hora talvez a gente ganhe lá uma fortuna de alguma dessas fundações e implemente lá. Hoje eu atuo em duas escolas, em torno de 50 alunos.
Imagina que eu alcançasse todas as escolas bilíngues dos barés, que são em torno de 10, 12 naquela área, tá? Eu teria lá uns 500 alunos jovens. Com 500 eu já tenho efeito de comunidade, se eu souber fazer. Eu posso falar em produtores, que alguns sejam produtores de conteúdo, que alguns sejam desenvolvedores de apps. E aí a gente tinha uma ideia que as comunidades estão interessadas também, assim, de você criar um espaço, uma internet para língua, um espaço em que os apps são na língua, Eles são adequados para a cultura, são produzidos e criados por gente de lá, tá?
E você começa a criar uma engatunete, um espaço. Aí eu acho isso vai criar muita, muitos dados, porque assim, sei lá, ainda existe uma visão naquela área tradicional que você, olha só que interessante, você não casa com uma pessoa que fala a mesma língua que você. Mas que raio Já não basta, já é difícil falar com esposa ou com esposo, ainda quer que sejam de línguas diferentes. Sabe por que que eles fazem isso? Para evitar casamento consanguíneo.
Comunidades que se cruzam muito, é uma maneira de evitar que irmãos, pequenas comunidades, que irmãos casem, tá? E aí tem regras do que a mãe pode ensinar para os filhos e para as filhas. Aí você vê, você faz direitinho, a conta tá certinha para evitar consanguíneo. É o mesmo motivo que muitas comunidades têm clãs. O clã muitas vezes é usado pelas comunidades na prática com as regras. Você olha e diz, ah, isso são regras para evitar casamento com sangue, que é um problema sério.
Mas enfim, isso mostra assim, se eu vou fazer Tinder em Inglaterra, eu tenho que trabalhar com duas línguas ou mais, tá? Tem que envolver duas comunidades. Não é muito mais assim, eu não vou ser, tá? Mas assim, O mundo é outro, tá? O mundo é outro, tá? Vai ter um influencer que vai dizer, olha, hoje eu vi porco-do-mato em tal lugar, vamos lá para caçar, certo? Esse, eu acho que esse seria o grande impulsionador dessas línguas em termos de sobrevivência, elas criarem o mundo delas, do uso, da fonte, da escrita, das ferramentas, mas também do da estrutura social delas refletida na internet que elas usam.
Isso seria o grande, a coisa bem legal. E teria isso aí, custa, não custa muito dinheiro, mas eu não achei ninguém para bancar não.
Então você constrói ferramenta e com o uso da ferramenta esses viram os dados para você alimentar o modelo e retroalimentar e evoluir a partir daí.
É isso, com adoção, né?
Com adoção.
Mas eu acho que existe essa escala qualitativa que é importante, tá? Eu chegar e dizer, não, eu vou de uso, em vez de usar no WhatsApp, eu vou usar no comércio local, tá? Por exemplo, são comunidades assim que você não encontra uma loja nessas comunidades. Comércio tem uma referência negativa na história deles, então as pessoas trocam as coisas diretamente na internet. Tem que ser assim deles. E é isso, eu acho que é quando você consegue isso, aí dá para falar em, não, e aí você tá preservando a cultura também de uma forma mais, está mapeando a cultura deles na internet, isso já também ajuda esse processo.
Já fica a sugestão de nome então, Yenga Tinder, já para quando for ser aplicada. Nessa parte de culturas ainda e o que que é decidido, aqui é uma pergunta talvez mais até filosófica, talvez um pouco de ética. Quando você tá fazendo isso, você tem que considerar o que eles usam no dia a dia. E a gente vê empresas dessas grandes de IA muitas vezes querendo controlar, por exemplo, que você não possa usar um palavrão ou coisa nesse sentido.
Como que isso pode ser visto do nosso ponto de vista, que tá tentando construir, por exemplo, no caso, um tradutor ou algo nesse sentido para eles? A gente tem esse direito, você acha, de, eu não sei nem se condescendente, de patronar eles, né? Falar, olha, palavrão é errado, não vamos colocar palavrões no treinamento. Ou o contrário, vamos colocar palavrões, só que aí pode sair um palavrão para uma criança. Tipo, onde que é a linha aí?
Olha, eu acho que a gente tem esse problema em qualquer língua, na internet, no dia a dia, assim. Palavrão tem lugar na língua, tem lugar de uso, tem lugar que é permitido, tem lugar que ele é bem, bem, que ele, que a gente precisa dele, tipo campo de futebol, sabe? Tem assim, eu tenho horas que você vai, sabe, intimidar, faz parte de um processo de intimidação que é válido, tá? Você pega lá o exemplo interessante disso é a haka dos neerlandeses, dos maoris.
Raca, meu, que eles estão falando na raca é sujo, meu. Eles estão falando do inimigo, não é bonitinho não, tá? Eu vou falar o que eu vou fazer com você enquanto agora não é legal, tá? Vamos ser franco, faz parte, tô lá. É uma linguagem de intimidação. É lógico que ela não tem momentos para ser usada e tem momentos que ela não deve ser usada, como a linguagem sagrada tem momentos que ela tem que ser usada. Então eu não vejo como um um sistema de tradução, um sistema que língua a língua, um modelo de linguagem, eu não acho que faz o menor sentido a gente poupar ele disso.
Até porque ele, se eu precisar usar ele para detectar esses problemas de linguagem, ele vai ter tido muito poucos dados dispostos, tá? A língua incorpora todas essas palavras, incorpora sexo, incorpora palavras sujas de sexo, não tem jeito, tá? Até porque muitas vezes essas palavras também são usadas no cotidiano, Não dá para filtrar. Então o que você tem que filtrar é depois. Ah, não quero que certas coisas apareçam com criança.
Desenvolve um filtro, e como todo filtro ele vai fazer coisas erradas, não tem muito jeito, mas vai deixar passar coisas, mas tudo bem, diminui a chance, tá certo? Mas eu acho que assim, não vamos, não vamos ser ingênuos sobre o que é o mundo, o que é a língua, sabe? No mundo tem tudo isso. E você usa no momento certo, faz parte da estrutura, né? Não tem jeito.
É, e não romantizar também, né? Os povos indígenas são pessoas como nós, exatamente, né? Então eles vão usar as mesmas coisas, mas podem ter coisas assim.
A gente se deparou isso trabalhando com os guaranis em Biá aqui, que existe parte da língua deles usada em rituais. Isso tá fora de limites de gravar, tá? Até Sei lá, você trabalha com os Barés, na tradição deles tem uma parte da língua que é específica para homens, tá? Aí você, o oposto disso, você mexe lá com os Tucanos, a cerâmica tucana, homem não pode tocar, senão desanda, desanda a argila, tá? Então assim, culturas, cultura a gente não discute.
Então é por isso que é essencial trabalhar com eles, tá? Essencial. Não tem como fazer isso de longe, não tem como fazer isso. Ah, eu falei com uma pessoa, ele autorizou e nunca mais falei com ele. Eu não vejo assim, eu não vejo, não faço o menor sentido.
Perfeito, eu concordo plenamente. E eu queria voltar um pouco no tópico lá da grafia que a gente tava conversando. A gente tá falando por enquanto, pelo menos, de línguas, entre muitas aspas, maiores dentro dessas bem pequenas, que tem alguma coisa geralmente, né, tem algo de jesuíta escritas de 200 anos atrás, tem como a Constituição do Niágatu, ou tem livros infantis. Mas pensando que tem várias populações que nem isso hoje em dia tem, né, não tem a escrita em si, mas que talvez por uma questão de preservação de idioma, por uma questão de comunicação com entes governamentais, seja lá o que for, que seria interessante existir essa, essa comunicação, nesses tradutores ou algo nesse sentido.
É, como que o senhor acha que seria o ideal para fazer isso? Seria nós, sei lá, uma comissão de linguistas decidir qual que é o padrão? Seria usar o alfabeto internacional IPA, algo nesse sentido, para se for criar uma tradução de texto ou mesmo uma transcrição de um áudio, algo nesse sentido? Porque supondo agora que as pessoas da comunidade não escrevam elas mesmas, então para ela meio que tanto faz a grafia em si.
Olha, assim, se olhar o Brasil, deve ter umas 60, 70 línguas que tem escrita das 250. A maior parte que não tem, a gente tá falando em gravar para preservar. Essas aí, sabe, tão, tão em condições que só velhos falam e assim por diante. Existe uma regra importante para dizer que uma língua é ameaçada, é a gente olhar se os jovens falam e usam a língua. Não adianta os velhos falarem, tá? No fundo, ela tá sendo transmitida. Então, se eu quero fazer, se eu quero que uma língua viva, eu tenho que ensinar os jovens.
Então, assim, ó, geralmente, por exemplo, a gente tá trabalhando lá com os Inhandevas lá do litoral, tá? E lá pouquíssima gente da comunidade ainda fala. Qual é a primeira coisa que você faz? Cartilha. Não é tradutor, não é cartilha. E nesse processo, tentar o material para o professor, que muitas vezes não, também não sabe aprender o suficiente para ensinar, tá? Então, pegar o caso clássico de língua, de, tem dois grandes casos clássicos de línguas que estavam praticamente mortas, foram revividas, são fortes hoje.
Primeiro é o hebreu. Hebreu era uma língua morta no início do século 20, ninguém falava, mas tinha muita escrita e tinha ainda cantos religiosos que naquela época os caras nem sabiam o que estavam cantando, era transmitido oralmente. Aí foi feito mapeamento e tal, e aí foi feito um esforço gigante para chegar hoje em 7 milhões, uma língua viva e assim por diante. O outro é o maori, mas hoje também a língua tá quase acabada. Aí o que eles fizeram?
Puseram um velhinho em creche. Os velhinhos que falar, os velhinhos, velhinhos, vai na creche. E na creche só fala com eles e fala, interage criança, né? Criança pega qualquer coisa rapidinho, isso é vantagem. Criança até 7 anos, maquininha de aprender língua aqui, né? Porque aí eles, e aí você começa a fazer. Então assim, que que é prioridade? Cartilha. Cartilha, o processo educacionais para criança e jovem. Começa a falar, a ouvir, e junto você tem que ter um material para os professores.
Acho que isso. E aí a pergunta é: como é que eu posso usar inteligência artificial nesse processo? Tá, uma coisa que eu descobri assim: linguista tem muita dificuldade de criar cartilha porque é muito simples para eles, tá? Mas geralmente é o que as comunidades mais pedem em troca: faz uma cartilha para gente. Cartilha, ou para outros anos mais avançados, um livro de um livro de, sei lá, de quinta, de quinta, de quinto ano fundamental de escrita.
E eles não sabem fazer isso, não foram treinados para fazer isso, tá? E aí eu acho assim, aí teve espaço assim, ah, usar IA para de repente ajudar a criar cartilhas, fazer muito exercício. Exercício é uma coisa chata, cria lá, é um padrão, tem uma formulazinha. Eu acho que tem muitos usos aí. Ah, cria ilustração, sabe? Sabe assim, acho que eventualmente cria um software, sabe, para fazer, para ensinar. Eu acho que esse é o caminho.
Aí você dali você vai indo, mas você não tem que pegar essas crianças com 3 anos de idade.
Mas aí a criança de 3 anos de idade, que ela vai, por exemplo, ser fluente, ela vai ser fluente na fala, na compreensão, mas não na escrita. Então era mais nessa pegada da escrita mesmo. Então a gente cria com base no português, né, na fonética do português brasileiro, ou no IPA, se for só para usar para treinamento de IA?
Um problema que aconteceu com línguas indígenas no Brasil, escritos em línguas indígenas, as línguas que foram, isso é bem genérico, tá, tô falando assim, mas que foram, cuja escrita foi criada pelos jesuítas e já vem sendo usada há muitos anos, em geral Ela é bem feita. O problema é que teve muitas grafias que foram criadas num esforço que teve em torno dos anos 60, patrocinado por uma igreja americana que botou pessoas, segundo os linguistas, que botou pessoas com muito pouco conhecimento linguístico para criar texto de Bíblia em língua indígena.
Então ali, segundo eles, dizem: olha, tem inglês demais naquela escrita. Eles ouviam coisas e de repente enfiavam a gramática do inglês. Porque eles não entenderam a complexidade. Então assim, tem escritas que foram mal desenvolvidas nesse processo, porque é um processo. E criar uma grafia não é simples, tá? E tem uma dicotomia que aparece sempre. Os linguistas querem criar uma grafia em que você leia e não tenha dúvida que som produzido dado o que está escrito.
Em geral, as comunidades indígenas querem criar uma grafia que é fácil de ensinar. Para pessoas que ouvem o tempo inteiro, então não tem essa dificuldade, tá? Isso bate de frente. Eu vi nessa história com os Nyan Deves, eu vi essa história lá com os tucanos, com os barés, tá? Eu acho assim, são coisas, são interesses, são— cada um tem. O linguista é bom ter uma escrita muito estável, nem que eu tenha que enfiar trocentos acentos, tem que enfiar mais 10 letras para reproduzir diferentes sons.
Pro falante, pro cara da comunidade, assim, pô, se eu tiver mais 10 letras, são mais 10 letras pra ensinar pras crianças. Repara que uma das coisas que eu descobri nesse processo de trabalhar com línguas indígenas, que eu não mexia até 4, 5 anos atrás, era o quanto eu era ignorante. A gente é tremendamente ignorante sobre indígenas, sobre línguas indígenas no Brasil, tá? Vejam só, eu acho que enquanto isso, enquanto a história antiga do Brasil E a história antiga do Brasil não é a da Europa, é dos povos que chegaram 20 mil anos atrás aqui nessa área, 20 por aí, até 1500, tá?
Enquanto isso aí não fizer parte do vestibular, sabe, não vai ter, as pessoas não vão saber. E acho que hoje, o que que você faria para difundir esse conhecimento? 3 questões em cada vestibular do ENEM são sobre Brasil, o Brasil antigo, Brasil de fato antigo. Antes de 1500. Aí agora tem que estudar. Poxa, haviam— ah, você acredita que tenham mil línguas naquela época no Brasil? Você acredita que haviam mais gente no Brasil do que na Europa?
Sabe, ainda mais porque muita coisa se aprendeu nos últimos 20 anos, muita coisa sobre as populações indígenas, principalmente na Amazônia, foram aprendidas nos últimos 20 anos. E a gente, sei lá, considera um homem culto assim Eu não sabia nada, não sabia nada absolutamente. E a maioria das pessoas não sabe nada, e é uma vergonha. Eu digo assim, não tem outra palavra, é uma vergonha para a gente. Mas tem que ser mudado também na nossa base, como todo lugar, tá?
Professor, algumas semanas você postou no LinkedIn um texto bastante franco e transparente sobre desde que vocês falaram, faz 7 meses que eu fui laid off, né? Você trabalhava tanto na IBM, trabalhou junto no Centro de IA da USP e retratou, mas pode me corrigir se eu não tiver colocando da forma correta, como tem sido essa jornada da busca para passar a continuar suas pesquisas e o seu trabalho. Queria entender melhor você que está vivendo isso, né, essa visão de o que que o mercado está buscando hoje, tanto mercado acadêmico quanto o mercado corporativo privado.
Como é que tem sido a sua percepção do que eles estão buscando e essa sua jornada no meio desse caminho?
Bem, o que é conhecido é que assim, dezembro do ano passado, a IBM decidiu acabar com o laboratório da IBM Research no Brasil, tinha em torno de 100 profissionais, tá, para acabar completamente, tá. Eu junto com uma série de profissionais de diferentes níveis, a grande maioria, algumas pessoas não, mas 95%, 98% das pessoas foram para o mercado. Eu considero assim, o meu caso é muito particular, tá? Eu sou um pesquisador sênior, cientista, mas que sempre trabalhou na indústria, na indústria científica, chamaria assim, num laboratório científico da indústria, não é nenhum laboratório de inovação.
Eu tenho até minha carreira, uma carreira meio fora do comum, porque eu sou muito multidisciplinar. Quando alguém no meu nível, na minha experiência, entra no mercado, é quase assim, você tem que criar um emprego para pessoa, tá certo? Então é por isso que eu digo, a minha situação é muito particular. E aí o que eu notei assim, que também ocorre, que as pessoas não sabem que estado você está da sua busca. Então o que que, qual foi a minha intenção quando eu fiz aquele post?
Olha, eu ainda tô buscando, tá? E deu uma chacoalhada lá na minha rede de contatos, tá? E eles assim, poxa, já tive várias conversas interessantes nas últimas duas semanas. E eu acho que é uma estratégia interessante, principalmente para posições mais sênior, tá? Sei lá, eu sei que numa posição como as posições, no tipo de atuação que eu tenho, posições fixas maiores vão demorar um ano. A média é de 6 a 1 ano para achar outra.
Mas você tem que ser ativo, senão não acontece. Isso é uma questão, tá? E ajudou. Mas eu acho que a gente, falando aí do mercado, acho que a gente tá no momento que o mercado não sabe o que ele quer. Tem tanto ruído no mercado de inteligência artificial que a minha impressão é que ninguém tá assim, tá todo mundo perdido. Outro dia, por conta até desse negócio, tava conversando com um amigo meu e ele disse que um cliente dele, ele tem uma consultoria de uma empresa que faz design uma consultoria nessa área, uma pequena empresa.
Chegou o cliente dele e disse, olha, eu quero que você faça uma IA que substitua você, sabe? Primeiro assim, o que ele faz eu não acho que essa IA, que as IAs de hoje têm a menor chance de substituir. Assim, uma pessoa que vai lá, conversa com as pessoas, entende qual é o problema tal, pensa, transforma em algo, sabe? Não é óbvio assim, envolve conhecer gente, conhecer, saber lidar com gente, tá? Mas você fazer uma proposta que você entregue para pessoa coisa que vai acabar com a sua relação como cliente realmente me assustou assim.
Isso aí você não vai, isso aí não é nenhuma proposição decente a ser feita para alguém, tá certo? Mas enfim, eu acho que a gente tá no momento que tem tantas conversas contraditórias. Ao mesmo tempo tem tantos interesses para criar essas conversas contraditórias que fica difícil alguém entender o que tem que ser feito, o que pode ser feito e o que não deve ser feito. Isso se reflete em toda a busca de emprego, tá? Uma parte disso vem que eu não entendo porque as pessoas acreditam nas palavras de quem tem tudo a ganhar com aquilo, tá?
Se um diretor de uma grande empresa de IA diz, vai substituir todos os empregos se vocês comprarem essa IA de mim, eu digo, é, eu confio tanto em você falando isso como eu confio num CEO lá de uma fábrica de refrigerante dizendo que refrigerante é bom para saúde. Eu não tenho por que confiar em você, não devo, tá? É ser santo, quer dizer, tem que ser crítico, tá? Isso é parte do ruído, mas eu acho que também assim existe dinheiro investido investido para propagar esse ruído.
Ela vai fazer uma IPO, se eu pagar 10 milhões de dólares para influenciadores para levantar 0,1% no preço da ação, já valeu a pena. E eu acho que isso tá acontecendo. Eu não tenho, eu faria isso se eu tivesse na posição deles, tá certo? E acho que assim, se prometeu o mundo em cima de uma tecnologia fantástica, mas não se entende ela o suficiente, como ela funciona, E ela tem problemas, claro, ela produz erros, ela é incontrolável, ela é bajuladora na forma que ela é feita atualmente. Isso são problemas. Podemos lidar com isso?
Vamos.
Mas vamos olhar e dizer: muito bem, como ela tem esses problemas, para tal problema eu não vou usar, para tal situação, ou tal situação envolve controle da saída de uma outra forma. Isso não pode ser usado se eu não tiver a saída. Lembra que a gente falou lá dos de palavrão para criança. Se eu não sei como detectar palavrão para criança, eu não devo usar uma máquina dessa para falar com ela. Então assim, minha visão é que a gente, nesse universo confuso que a gente tá, ficar procurando emprego, mesmo procurando emprego de curto prazo, é difícil, tá?
Eu acho que assim, eu sou uma pessoa sensata nessa área, até por estar muito tempo. Ser sensato não vende palestra, isso eu já descobri nesses 6 meses. Ou você fala que vai mudar o mundo, você fala que vai destruir o mundo. É isso que vende palestra hoje no mundo aqui, tá? Então assim, é um momento difícil. E eu não tô falando só de mim, eu conversei com muita gente ao longo desses 6 meses que eu respeito e tal, e que tá tendo dificuldade, principalmente quem é meio freelancer, coisa assim, tá?
Dificuldade para acertar consultoria porque tem pedidos absurdos, dificuldade para apresentar para cursos, porque existe uma confusão que eu acho. Tem um nível que é deliberado, tá? Tem um nível de puro ruído, que é outras que a gente tá vivendo em outras áreas também, tá? Política e sociedade, coisa nisso. Mas eu, como alguém que já vivi alguns altos e baixos na vida, tá? Aí, há dos anos 80, internet, Sabe, a crise dos dot-com.
Eu olho e disse, não adianta, uma hora tem que quebrar para limpar o ruído. Foi o que aconteceu com as dot-com, tirou um monte de gente que não devia estar lá. Coitado, assim, tive amigos meus, tá? Não é ruim por aquilo, mas enquanto a gente voltar a ser sano na nossa conversa e dizer assim, olha, se o meu software de aumentar em 10% a produtividade é muita coisa, 10% de lucrosidade é um mundo, gente, real. 10% real, não empurrar aquele serviço para outro. 10% real, tá?
É um mundo. É lucro 10%, gente, não é pouca coisa não. Aí a gente chega e aí a gente volta. E tem outra questão que é importante: às vezes você precisa de tecnologias de apoio que ainda não estão lá. A internet tava naquele boom em 2000 e não tinha como fazer pagamento seguro. Enquanto não se fez pagamento seguro, sabe, público com razão temia usar aquilo, somente o leigo. Então assim, às vezes demora porque o resto, pô, as máquinas que a gente usava para como servidor não tinham sido feitas para aquilo, de jeito nenhum.
Na verdade, a IBM fez muito dinheiro criando servidores específicos para aplicações web, porque é um hardware específico que não existia. Então assim, Como a gente vai ter que inventar um hardware diferente para entregar IA, provavelmente esses modelos, como a gente vai ter que inventar um sistema de precificação que faça sentido, porque cobrar por token não faz sentido nenhum na minha visão.
Tem algum palpite de para onde isso pode apontar se não for por cobrança por token?
Vai ser algo tão disruptivo quando a GoTo.com disser: não precisa banner, Mas você precisa ter, mas você pode vender ordem, tá? Que não foi a Google que inventou, foi a Goto.com, patenteou, e depois a Google transformou em milionários os caras da Goto.com. Eu não vou falar mais que isso porque não, isso é conhecido. O que aconteceu na negociação não se sabe, tá? Mas assim, mas tem uma parte que é sigilosa dessa compra, mas eles se deram bem porque eles inventaram algo que tirou algo extremamente irritante do início da internet, que eram os banners.
E agora a gente já imagina assim, ah, essa história de quanto maior é o seu trabalho, mais você tá pagando. Gente, não dá para viver assim. O cérebro da gente não funciona assim. Tanto que a gente tá vendo esse problema das empresas estourando os orçamentos delas, tá? É uma precificação que reage ao custo diretamente, mas não ao uso. E aí é uma questão, tudo isso é coleta de dados suficiente, você mapeia algo que faz sentido num custo que faz sentido e sai para os dois lados, ficam felizes depois de um tempo.
Mas agora não sei, você põe um toquinho a mais, é um incentivo para que o sistema gere cada vez coisas maiores. Quer dizer, se eu tô usando isso para criar um programa Pô, mas bota um programa lá que toda a biblioteca do código refatorado de todo, sei lá, o TensorFlow, meu, você só gerou muito mais token, né? Faz sentido, entende? Tem coisas que não fazem sentido, a gente precisa alertar que não fazem.
Professor, muito obrigado pelo seu tempo, por compartilhar seu vasto conhecimento com a gente. Para quem quiser continuar esse papo contigo, vai para onde?
Olha, eu posto no LinkedIn as coisas que me incomodam. Eu tô agora nesse semestre num trabalho de também explorar mais a minha carreira, uma carreira talvez mais fatiada, tá? Acho que a gente é outra coisa que é real. E mesmo que eu volte para alguma empresa, laboratório, universidade, eu acho que é uma coisa que eu vou continuar, tá? Eu só não fiz isso menos no primeiro semestre passou depois da minha demissão por uma série de questões meio pessoais, mas agora eu tô realmente pensando nisso.
E eu tô assim, tem duas coisas que me interessam muito, se eu posso falar, que eu gostaria, adoraria trabalhar. Primeiro é como é que a gente usa LLMs em educação sem escravizar as crianças de jogo, tá? Que também é uma coisa que a gente já soube, já soube, já aprendeu a fazer no passado. A gente tá errando A gente tá lá, a gente voltou no tempo, tá fazendo o mesmo erro em educação que o pessoal fez na década de 80 com os micros.
Aí apareceu o Papert e disse: esquece, não é nada disso, estão todos errados. E mudou tudo. Aí, e a outra coisa, e esse assim, eu acho que existe um mundo muito interessante de robótica vindo aí, e principalmente de como é que eu interajo com robô usando linguagem, porque um robô É que nem o venusiano que a gente falou lá atrás, assim, ele vive num mundo semântico diferente. Ele não pode viver na nossa linguagem. A gente tem que expandir a nossa linguagem para falar o mundo do robô.
Não tem sentido falar que um táxi inteligente não viu alguma coisa. Ele não vê nada, ele calcula distâncias. Esse é o modo principal de— ele é um morcego, voltando ao velho provérbio, é um morcego. Então eu não devia estar conversando com ele. Quando você viu aquilo lá, e a gente tem que, eu acho que essa, criar uma linguagem para se falar com máquinas que falam é um dos grandes, para mim, um dos grandes mistérios que a gente vai enfrentar aí nessa área.
Como é que eu crio, como é que os humanos aprendem, tá? O Luke Skywalker entende o que o Arthur de Tufão, certo? Como é que ele aprendeu aquilo lá? Mas é um pouco isso, tá? Aquilo eu acho errado, aquilo é fundamentalmente errado, mas existe ali essa. E além, e a língua do Arthur de Tufão é diferente, o mundo dele é diferente. Mas enfim, eu só falei assim porque eu acho que são coisas, tem muita coisa interessante aí para ser feita, tem muita, muita coisa interessante.
Interessante, esses mundos que estão vindo. E eu adoraria estar trabalhando nesse tipo de tema de novo, num laboratório de pesquisa, porque na verdade pesquisa é o que me dá emoção, me dá recompensa. Acho que é aí que eu trabalho melhor, me sinto melhor.
Excelente. A gente vai deixar aqui na descrição o link para o pessoal poder entrar em contato com você, continuar essa conversa, falar também sobre oportunidades. E na descrição do episódio também, ou em iassubcontrolio.tech, você encontra o link para Escola de Inteligência Artificial da Alura. Lembrando que hoje que tá saindo o episódio, dia 30 de setembro, é o último dia para você aproveitar até 30% de desconto para o mês da programação que a Alura tá oferecendo para você estudar por até 2 anos.
E se você passar aqui ou for em alura.com.br para conhecer a Escola de Inteligência Artificial da Alura, você vai ver os cursos, as formações também em todas as carreiras basicamente que tocam em tecnologia, que são todas, né? Então design, negócios, a própria programação, desenvolvimento. Passa aqui na descrição do episódio, pega o link, não perde essa chance. Até 30% de desconto para você estudar por até 2 anos na Alura. E eu e o Fabrício voltaremos na sexta-feira com o nosso resumão das notícias do mundo da inteligência artificial, incluindo o Dev Day da OpenAI, que teve um bando de novidade. Você vai acompanhar com a Na sexta-feira.
Até lá! Este podcast foi produzido pela Alura. Mergulhe em tecnologia. E Faculdade FIAP. Let's rock the future. Edição Rede Gigahertz de Podcasts.
Alura
Escola de Inteligência Artificial