Starke Funktionen.
Kein Ballast.

VibeVox ist für Power-User gemacht, die volle Kontrolle über Datenschutz, Latenz und Qualität wollen.

mic icon

Live-Tippen

Diktiere und sieh zu, wie sich der Text in Echtzeit in deine App tippt – mit letztem Feinschliff, sobald du stoppst. Lieber klassisch? Der gewohnte Modus „alles am Ende“ bleibt erhalten.

keyboard icon

Globale Tastenkürzel

Drücke dein globales Tastenkürzel überall in Windows, um das Diktat zu starten/stoppen, halte es gedrückt wie ein Funkgerät (Push-to-talk) – oder lass den Auto-Modus Tippen und Halten selbst unterscheiden. Kein Fensterwechsel nötig – die App schwebt über deiner Arbeit.

lock icon

Standardmäßig privat

Deine Sprache wird lokal mit der NVIDIA-Parakeet-Engine auf deiner CPU transkribiert. Nichts wird in die Cloud gesendet, solange du KI-Funktionen nicht ausdrücklich aktivierst.

globe icon

Mehrsprachig, offline

Parakeet erkennt und transkribiert 25 europäische Sprachen vollständig auf deinem Gerät. Norwegisch (Bokmål & Nynorsk) ist über ein optionales NB-Whisper-Paket auf Abruf verfügbar.

cpu icon

KI: Übersetzen & Umformulieren

Nutze deinen eigenen Schlüssel für OpenAI, Anthropic, Google Gemini, DeepSeek, Groq, Mistral, OpenRouter, YandexGPT – oder einen beliebigen OpenAI-kompatiblen eigenen Endpunkt. Übersetze dein Diktat live, markiere Text und formuliere ihn per Stimme um – oder markiere nichts, und dein Diktat kommt sauber geschrieben an. Dein Schlüssel bleibt auf deinem Rechner.

zap icon

Für den Workflow gebaut

Eigene Tastenkürzel (Tastenkombinationen, ein doppelt getippter Modifikator oder Maustasten), ein komplettes Audio-Panel mit Mikrofonauswahl, Empfindlichkeit und Live-Pegelanzeige, Rauschunterdrückung, ein durchsuchbarer Transkriptionsverlauf und ein norwegisches Sprachpaket auf Abruf.

type icon

Intelligente Texteingabe

VibeVox tippt Text direkt in deine aktive Anwendung. Wechselst du während des Diktats das Fenster, landet der Text sicher in der Zwischenablage statt in der falschen App. Mit Formatierungsschaltern passt du die Ausgabe an – z. B. kleiner Anfangsbuchstabe oder ohne Punkt am Ende.

25 Sprachen, komplett offline

Parakeet erkennt die Sprache automatisch und transkribiert sie vollständig auf deinem Gerät. Keine Cloud, kein Konto — deine Stimme verlässt den Rechner nie.

Bulgarisch
Kroatisch
Tschechisch
Dänisch
Niederländisch
Englisch
Estnisch
Finnisch
Französisch
Deutsch
Griechisch
Ungarisch
Italienisch
Lettisch
Litauisch
Maltesisch
Polnisch
Portugiesisch
Rumänisch
Russisch
Slowakisch
Slowenisch
Spanisch
Schwedisch
Ukrainisch
globe icon
Optionales Paket

Norwegisch? Auch abgedeckt.

Bokmål und Nynorsk laufen über NB-Whisper Small — ein Modell der norwegischen Nationalbibliothek. VibeVox lädt es einmalig (~670 MB) direkt aus den Einstellungen herunter, und auch das funktioniert vollständig offline.

cpu icon

Über die Liste hinaus: KI-Übersetzung

Mit eingeschalteter KI-Übersetzung kann dein Diktat direkt beim Sprechen in praktisch jede Sprache übersetzt werden, die dein KI-Anbieter versteht — du sprichst in einer Sprache, der Text kommt in einer anderen an.

Technische Daten

Inferenz-Engine
Quantisierter Neural Transducer (INT8)
Modellarchitektur
FastConformer (0,6 Mrd. Parameter)
Genauigkeit
Erkennung auf Spitzenniveau unter offenen Modellen
Transkriptionsgeschwindigkeit
2–8× schneller als Echtzeit auf der CPU (hardwareabhängig)
Betriebssystem
Windows 10/11 — läuft auf der CPU (keine GPU nötig)
Modell-Download
~620 MB (INT8), in der App enthalten

Unter der Haube: Architektur der nächsten Generation

hourglass icon

Token-and-Duration Transducer (TDT)

Anders als klassische RNN-Ts, die ein Token nach dem anderen vorhersagen, sagt unsere TDT-Architektur Token und Dauer gemeinsam voraus. So kann das Modell Stille und überflüssige Frames bei der Inferenz überspringen und die Rechenzeit drastisch senken.

  • Gemeinsame Token- & Dauer-Vorhersage
  • Beschleunigung durch Frame-Überspringen
waveform icon

FastConformer mit 8x Subsampling

Basiert auf der Conformer-Architektur, ist aber auf Geschwindigkeit optimiert. Ein 8-facher Downsampling-Faktor verarbeitet Audio-Frames effizienter und verbindet den globalen Kontext von Transformern mit der lokalen Merkmalsextraktion von CNNs.

  • 8-facher Downsampling-Faktor
  • Läuft vollständig auf der CPU — keine GPU nötig