Sou o Renan Donato, engenheiro de software no Brasil. Trabalho com inferência de modelos de linguagem em produção — e a pergunta que me move é: o que precisa ser verdade para IA de qualidade rodar localmente, em português, em hardware que cabe no bolso do brasileiro?
É essa pergunta que organiza tudo o que publico aqui: benchmarks de Whisper, TTS e wake word em PT-BR rodando em Raspberry Pi e ESP32; explicações de inferência (quantização, latência de voz, llama.cpp vs vLLM) aterrissadas em “o que isso significa para rodar IA na sua casa”; e o diário de construção de um protótipo de assistente de voz 100% local em português brasileiro.
Estou pesquisando e prototipando, como projeto pessoal, um assistente de voz local-first em PT-BR — do wake word ao TTS, sem enviar áudio para a nuvem por padrão. Ainda é pesquisa, não produto: publico as decisões de arquitetura, os números e os fracassos conforme eles acontecem, com scripts e configs reproduzíveis.
Go, Python, JavaScript/TypeScript, C++, C e Zig. Experiência com microsserviços em nuvem, programação de sistemas e, nos últimos anos, inferência e serving de LLMs.
Português (nativo), inglês (profissional).