強力な機能。
余計なものはゼロ。

VibeVoxは、プライバシー・遅延・品質を細かくコントロールしたいパワーユーザーのために設計されています。

mic icon

ライブ入力

口述すると、テキストがリアルタイムでアプリに入力されていき、停止すると最後に仕上げが入ります。従来の方式がお好みなら、録音終了後にまとめて入力するクラシックモードもいつでも使えます。

keyboard icon

グローバルホットキー

Windowsのどこにいても、設定したグローバルホットキーを押すだけで音声入力を開始/停止。トランシーバーのように押し続ける方式(プッシュ・トゥ・トーク)や、タップと長押しを自動で判別するオートモードも選べます。ウィンドウを切り替える必要はありません — アプリは作業の上に浮かんで動作します。

lock icon

既定でプライベート

音声はNVIDIA Parakeetエンジンにより、お使いのCPU上でローカルに文字起こしされます。AI機能を明示的にオンにしない限り、クラウドには何も送信されません。

globe icon

多言語、オフライン

Parakeetは25のヨーロッパ言語を自動検出し、完全にデバイス上で文字起こしします。ノルウェー語(ブークモール&ニーノシュク)は、オンデマンドのNB-Whisperパック(オプション)で利用できます。

cpu icon

AI:翻訳と書き換え

OpenAI、Anthropic、Google Gemini、DeepSeek、Groq、Mistral、OpenRouter、YandexGPT — またはOpenAI互換のカスタムエンドポイントに、ご自身のキーで接続。口述をその場で翻訳したり、任意のアプリでテキストを選択して声でリライトしたり — 何も選択しなければ、口述そのものが清書されて届きます。キーはお使いのマシンから出ません。

zap icon

ワークフローのために

カスタムホットキー(キーの組み合わせ、修飾キーの2回押し、マウスボタン)、マイク選択・感度・ライブレベルメーターを備えたオーディオパネル、ノイズ除去、検索できる文字起こし履歴、オンデマンドのノルウェー語パック。

type icon

スマートインジェクション

VibeVoxはテキストをアクティブなアプリに直接入力します。口述の途中でウィンドウを切り替えても、テキストは誤ったアプリではなくクリップボードに安全に保存されます。先頭を小文字にする、文末のピリオドを削除するなどの書式トグルで出力を微調整できます。

25言語、完全オフライン

Parakeetは言語を自動検出し、完全にデバイス上で文字起こしします。クラウドなし、アカウントなし — あなたの声がマシンの外に出ることはありません。

ブルガリア語
クロアチア語
チェコ語
デンマーク語
オランダ語
英語
エストニア語
フィンランド語
フランス語
ドイツ語
ギリシャ語
ハンガリー語
イタリア語
ラトビア語
リトアニア語
マルタ語
ポーランド語
ポルトガル語
ルーマニア語
ロシア語
スロバキア語
スロベニア語
スペイン語
スウェーデン語
ウクライナ語
globe icon
オプションパック

ノルウェー語?それも対応。

ブークモールとニーノシュクは、ノルウェー国立図書館によるモデル NB-Whisper Small で動作します。VibeVoxは設定画面から一度だけダウンロードし(約670 MB)、こちらも完全にオフラインで動作します。

cpu icon

リストの先へ:AI翻訳

AI翻訳を有効にすると、口述はAIプロバイダーが理解する事実上あらゆる言語へその場で翻訳されます — ある言語で話すと、テキストは別の言語で届きます。

技術仕様

推論エンジン
量子化ニューラルトランスデューサー(INT8)
モデルアーキテクチャ
FastConformer(0.6Bパラメータ)
精度
オープンモデルの中でもトップクラスの認識精度
文字起こし速度
CPU上で実時間の2〜8倍の速さ(ハードウェアに依存)
対応OS
Windows 10/11 — CPUで動作(GPU不要)
モデルのダウンロード
約620 MB(INT8)、アプリに同梱

内部構造:次世代アーキテクチャ

hourglass icon

Token-and-Duration Transducer(TDT)

1トークンずつ予測する従来のRNN-Tと異なり、TDTアーキテクチャはトークンとその継続時間を同時に予測します。これにより推論中に無音や冗長なフレームをスキップでき、計算時間を大幅に削減します。

  • トークンと継続時間の同時予測
  • フレームスキップによる推論高速化
waveform icon

8倍サブサンプリングのFastConformer

Conformerアーキテクチャをベースに速度最適化。8倍のダウンサンプリングで音声フレームをより効率的に処理し、Transformerのグローバルな文脈理解とCNNのローカルな特徴抽出を組み合わせています。

  • 8倍ダウンサンプリング
  • 完全にCPU上で動作 — GPU不要