2026
Voice Assistant
IA de voz 100% local

Assistente de voz full-duplex com visão de tela para Windows, com conversa interrompível e respostas conscientes do que está na tela, totalmente offline, sem nuvem e sem API keys.
Um assistente de voz para Windows com áudio full-duplex de verdade: dá para interrompê-lo no meio de uma frase, e a interrupção vira a próxima pergunta. No instante em que você fala, ele captura a tela e usa a imagem como contexto para responder.
Todo o pipeline roda localmente, com uma única infraestrutura de GPU (GGML + Vulkan) compartilhada entre o reconhecimento de fala e o LLM, o que o torna portátil entre GPUs AMD, NVIDIA e Intel. A meta é menos de 2 segundos entre o fim da sua fala e a primeira sílaba da resposta.
Interrupção natural
Barge-in com menos de 100 ms de latência, detectado pelo VAD Silero enquanto o assistente ainda fala.
Visão da tela
Um screenshot vai para o modelo junto com a pergunta; dá para desligar nas configurações, por privacidade.
Voz em streaming
A transcrição chega em tempo real e a resposta é falada frase por frase enquanto é gerada, com Piper em português.
Sem nuvem
whisper.cpp e llama.cpp em Vulkan, com modelos baixados do Hugging Face no primeiro uso. Sem chave de API e sem dados saindo da máquina.