Recursos poderosos.
Zero excesso.

O VibeVox foi projetado para usuários avançados que querem controle total sobre privacidade, latência e qualidade.

mic icon

Escrita ao vivo

Dite e veja o texto se digitar sozinho no seu aplicativo em tempo real, com um retoque final quando você para. Prefere o jeito clássico? O modo tradicional, com o texto no fim da gravação, continua sempre disponível.

keyboard icon

Controle por atalho global

Pressione sua tecla de atalho global em qualquer lugar do Windows para iniciar/parar o ditado, mantenha-a pressionada como um walkie-talkie (aperte para falar), ou deixe o modo automático distinguir um toque de um pressionar contínuo. Sem trocar de janela — o app flutua sobre o seu trabalho.

lock icon

Privado por padrão

Sua fala é transcrita localmente com o mecanismo NVIDIA Parakeet, rodando na sua CPU. Nada é enviado para a nuvem, a menos que você ative explicitamente os recursos de IA.

globe icon

Multilíngue, offline

O Parakeet detecta automaticamente e transcreve 25 idiomas europeus inteiramente no seu dispositivo. O norueguês (Bokmål e Nynorsk) está disponível por um pacote opcional NB-Whisper, baixado sob demanda.

cpu icon

IA: Traduzir e Reescrever

Use sua própria chave da OpenAI, Anthropic, Google Gemini, DeepSeek, Groq, Mistral, OpenRouter, YandexGPT — ou qualquer endpoint personalizado compatível com OpenAI. Traduza seu ditado ao vivo, selecione texto em qualquer lugar e reescreva-o por voz — ou não selecione nada, e seu ditado chega escrito a limpo. Sua chave fica na sua máquina.

zap icon

Feito para o fluxo de trabalho

Atalhos personalizados (combinações de teclas, toque duplo em um modificador ou botões do mouse), um painel de áudio completo com seletor de microfone, sensibilidade e medidor de nível ao vivo, redução de ruído, um histórico de transcrições pesquisável e um pacote de idioma norueguês sob demanda.

type icon

Injeção Inteligente

O VibeVox digita o texto diretamente no seu aplicativo ativo. Se você trocar de janela no meio do ditado, o texto vai em segurança para a área de transferência em vez do app errado. Ajuste fino da saída com opções de formatação — como primeira letra minúscula ou remoção do ponto final.

25 idiomas, totalmente offline

O Parakeet detecta o idioma automaticamente e o transcreve inteiramente no seu dispositivo. Sem nuvem, sem conta — sua voz nunca sai da máquina.

Búlgaro
Croata
Tcheco
Dinamarquês
Holandês
Inglês
Estoniano
Finlandês
Francês
Alemão
Grego
Húngaro
Italiano
Letão
Lituano
Maltês
Polonês
Português
Romeno
Russo
Eslovaco
Esloveno
Espanhol
Sueco
Ucraniano
globe icon
Pacote opcional

Norueguês? Também coberto.

Bokmål e Nynorsk rodam com o NB-Whisper Small — um modelo da Biblioteca Nacional da Noruega. O VibeVox o baixa uma única vez (~670 MB) direto das Configurações, e ele também funciona totalmente offline.

cpu icon

Além da lista: tradução por IA

Com a tradução por IA ativada, seu ditado pode ser traduzido na hora para praticamente qualquer idioma que o seu provedor de IA entenda — você fala em um idioma, e o texto chega em outro.

Especificações técnicas

Mecanismo de inferência
Transdutor neural quantizado (INT8)
Arquitetura do modelo
FastConformer (0,6 bilhão de parâmetros)
Precisão
Reconhecimento de primeira linha entre os modelos abertos
Velocidade de transcrição
2–8× mais rápido que o tempo real na CPU (depende do hardware)
Sistemas suportados
Windows 10/11 — roda na CPU (não precisa de GPU)
Download do modelo
~620 MB (INT8), incluído no app

Por dentro: arquitetura de nova geração

hourglass icon

Token-and-Duration Transducer (TDT)

Ao contrário dos RNN-T tradicionais, que preveem um token por vez, nossa arquitetura TDT prevê em conjunto o token e a sua duração. Isso permite ao modelo pular silêncios e quadros redundantes durante a inferência, reduzindo drasticamente o tempo de computação.

  • Previsão conjunta de token e duração
  • Aceleração de inferência com salto de quadros
waveform icon

FastConformer com subsampling 8x

Baseado na arquitetura Conformer, mas otimizado para velocidade. Usa um fator de downsampling de 8x para processar quadros de áudio com mais eficiência, combinando o contexto global dos Transformers com a extração local de características das CNNs.

  • Fator de downsampling de 8x
  • Roda inteiramente na CPU — não precisa de GPU