Funciones potentes.
Cero relleno.

VibeVox está pensado para usuarios avanzados que necesitan control total sobre su privacidad, latencia y calidad.

mic icon

Escritura en vivo

Dicta y mira cómo el texto se escribe solo en tu aplicación en tiempo real, con un pulido final al detenerte. ¿Prefieres lo clásico? El modo tradicional de «todo al final» sigue ahí.

keyboard icon

Atajo de teclado global

Pulsa tu atajo global configurado en cualquier parte de Windows para iniciar/detener el dictado, mantenlo pulsado como un walkie-talkie (pulsar para hablar) — o deja que el modo automático distinga un toque de una pulsación larga. Sin cambiar de ventana: la app flota sobre tu trabajo.

lock icon

Privado por defecto

Tu voz se transcribe localmente con el motor NVIDIA Parakeet, en tu CPU. No se envía nada a la nube a menos que actives expresamente las funciones de IA.

globe icon

Multilingüe, sin conexión

Parakeet detecta y transcribe automáticamente 25 idiomas europeos por completo en tu dispositivo. El noruego (Bokmål y Nynorsk) está disponible mediante un paquete NB-Whisper opcional bajo demanda.

cpu icon

IA: traducir y reescribir

Usa tu propia clave de OpenAI, Anthropic, Google Gemini, DeepSeek, Groq, Mistral, OpenRouter, YandexGPT — o cualquier endpoint personalizado compatible con OpenAI. Traduce tu dictado en vivo, selecciona texto y reescríbelo con la voz — o no selecciones nada y tu dictado llegará escrito en limpio. Tu clave permanece en tu equipo.

zap icon

Hecho para tu flujo de trabajo

Atajos personalizados (combinaciones de teclado, un modificador de doble toque o botones del ratón), un panel de audio completo con selector de micrófono, sensibilidad y medidor de nivel en vivo, reducción de ruido, un historial de transcripciones con búsqueda y un paquete de idioma noruego bajo demanda.

type icon

Inserción inteligente

VibeVox escribe el texto directamente en tu aplicación activa. Si cambias de ventana a mitad del dictado, el texto va a parar al portapapeles en lugar de a la app equivocada. Ajusta el resultado con opciones de formato, como primera letra en minúscula o sin punto final.

25 idiomas, totalmente sin conexión

Parakeet detecta automáticamente el idioma y lo transcribe por completo en tu dispositivo. Sin nube, sin cuenta — tu voz nunca sale del equipo.

Búlgaro
Croata
Checo
Danés
Neerlandés
Inglés
Estonio
Finés
Francés
Alemán
Griego
Húngaro
Italiano
Letón
Lituano
Maltés
Polaco
Portugués
Rumano
Ruso
Eslovaco
Esloveno
Español
Sueco
Ucraniano
globe icon
Paquete opcional

¿Noruego? También cubierto.

Bokmål y Nynorsk funcionan mediante NB-Whisper Small — un modelo de la Biblioteca Nacional de Noruega. VibeVox lo descarga una sola vez (~670 MB) directamente desde Ajustes, y también funciona completamente sin conexión.

cpu icon

Más allá de la lista: traducción con IA

Con la traducción con IA activada, tu dictado puede traducirse al instante a prácticamente cualquier idioma que entienda tu proveedor de IA — hablas en un idioma y el texto llega en otro.

Especificaciones técnicas

Motor de inferencia
Neural Transducer cuantizado (INT8)
Arquitectura del modelo
FastConformer (0,6 B de parámetros)
Precisión
Reconocimiento de primer nivel entre modelos abiertos
Velocidad de transcripción
2–8× más rápido que el tiempo real en CPU (según el hardware)
Sistema operativo
Windows 10/11 — funciona en la CPU (sin GPU)
Descarga del modelo
~620 MB (INT8), incluido con la aplicación

Bajo el capó: arquitectura de nueva generación

hourglass icon

Token-and-Duration Transducer (TDT)

A diferencia de los RNN-T tradicionales, que predicen un token cada vez, nuestra arquitectura TDT predice conjuntamente el token y su duración. Esto permite al modelo saltarse los silencios y los fotogramas redundantes durante la inferencia, reduciendo drásticamente el cómputo.

  • Predicción conjunta de token y duración
  • Aceleración por salto de fotogramas
waveform icon

FastConformer con submuestreo 8x

Basado en la arquitectura Conformer pero optimizado para la velocidad. Usa un factor de reducción 8x para procesar los fotogramas de audio con más eficiencia, combinando el contexto global de los Transformers con la extracción local de características de las CNN.

  • Factor de submuestreo 8x
  • Funciona íntegramente en la CPU — no requiere GPU