Sou o Renan Donato, engenheiro de software no Brasil. Trabalho com inferência de modelos de linguagem em produção, e tem uma pergunta que não me larga: o que precisa ser verdade para IA de qualidade rodar localmente, em português, em hardware que cabe no bolso do brasileiro?
Tudo o que publico aqui sai dessa pergunta. Faço benchmarks de Whisper, TTS e wake word em PT-BR rodando em Raspberry Pi e ESP32, escrevo sobre inferência (quantização, latência de voz, llama.cpp vs vLLM) sempre aterrissando no que isso significa na prática, e mantenho o diário de construção de um protótipo de assistente de voz totalmente local em português.
Estou pesquisando e prototipando, como projeto pessoal, um assistente de voz local em PT-BR: do wake word ao TTS, sem enviar áudio para a nuvem por padrão. Ainda é pesquisa, não produto. Publico as decisões de arquitetura, os números e os fracassos conforme acontecem, com scripts e configs para quem quiser reproduzir.publico
Go, Python, JavaScript/TypeScript, C++, C e Zig. Experiência com microsserviços em nuvem, programação de sistemas e, nos últimos anos, inferência e serving de LLMs.
E-mail: contato@renandonato.com.br