ESPN DeportesKings: Raynaud con posible lesión de rodilla graveThe Jerusalem PostPalestinians deserve accountable leadership, not further delays to democracy - editorialESPNSources: Cardinals finalizing deal to trade WR Harrison Jr.InquirerRegulators OK Meralco rate hike after 15 yrsالنهارتصعيد حوثي كبير.... 12 قتيلاً وأكثر من 300 جريح بالهجوم على مطار الرياضZDF heuteAktuelle Pressemitteilungen des ZDFSky TG24Auto, oltre 11 milioni di italiani lasciati a piedi in un anno: ecco i guasti più comuniSouth China Morning PostHuanggang Port a ‘milestone’ for integrating Hong Kong, Greater Bay Area: John LeeBellaNaijaBBNaija Season 11’s Final Five Talked Boldness, Authenticity & What Comes Next With Guinness
The Daily Newsstand · Free, Always
Sunday, October 11, 2026

CPUのみで動作するリアルタイム多言語音声認識「早耳」、GPUもクラウドAPIも使わずメモリ2GB未満でライブ字幕表示からブラウザ表示・話者ラベル付け・翻訳字幕まで可能

Translate

「Hayamimi(早耳)」はGPUやクラウドAPIに依存せずCPUのみで動作する軽量なリアルタイム多言語音声認識システムです。メモリ2GB未満の環境でもライブ字幕表示・話者ラベル付け・翻訳字幕生成まで対応し、発話中から字幕が出始め話し終えて約100msで確定する高速性が特徴です。

oboroge0/hayamimi: 早耳 - Real-time multilingual speech-to-text on CPU only. Live subtitles, browser dashboard, speaker labels, translation. No GPU, no cloud.
https://github.com/oboroge0/hayamimi

従来のCPUベースの音声認識は単一モデルに依存しがちでしたが、Hayamimiは発話ごとに言語を判定して最適な専用モデルに振り分ける独自のアプローチを採用しています。使用されるモデルはINT8量子化されたONNX形式でsherpa-onnx上で動作するためPyTorchやCUDAは不要で、実際のテレビ放送の日本語音声で「文字誤り率(Character Error Rate:CER) 3.8%」という高い精度を達成し、6コアのデスクトップCPUで実時間の10~50倍の速度を実現しています。

Hayamimiは以下の通り、多岐にわたる機能を備えています。

・5つの言語カタログ:5つの主要言語(日・中・韓・広東語・英)に加えて欧州24言語を専用モデルで処理、それ以外の約1600言語はMeta Omnilingual ASRにフォールバック
・ドラフト字幕:発話中に約0.5秒ごとにドラフトテキストを更新
・高速確定:日本語の場合、話し終えて約100msで確定文を出力
・二段パス補正:2秒の無音後に直前の発話を再デコードし「清書」トランスクリプトを生成、日本語CERを15.5%から12.0%に改善
・話者ラベル付け:「--speakers」オプションでCAM++によるリアルタイム話者タグ付け、清書パスでpyannote/segmentation-3.0による本格的な再分離を実施
・翻訳:「--translate」オプションで日本語字幕を指定言語(例: en・zh・ko・es)へリアルタイム翻訳
・ホットワード:「--hotwords」で固有名詞認識強化を実行
・置換辞書:「--replace」で事後検索置換を実行
・漢数字→算用数字変換:日・中・広東語で漢数字を算用数字へ変換
・実行時辞書API:セッション中に置換辞書やITN(Inverse Text Normalization)例外/強制指定を差し替え可能
・構造化イベント+実行時設定:EventHubにイベントを発行しパイプラインの各段階をリッスン可能
・OBSオーバーレイ+ダッシュボード:「--serve」でローカルHTTPサーバーを起動しブラウザソースオーバーレイとライブダッシュボードを提供
・ネットワーク音声入力:「--input ws」でWebSocket経由の音声入力を受け付け
・スピーカーループバック入力:「--input speaker」(Windows専用)でPC内部スピーカー音声、「--input mix」でマイクとスピーカー音声を合成したループバックストリームの文字起こしに対応
・英語v2ティア(オプトイン):「--en-tier v2」でParakeet TDT v2に切り替え、英語WERを10.0%から6.6%に改善
・4クラス日本語句読点(オプトイン):「--punct-model 4class」で句読点を直接予測する単一モデルに切り替え
・メモリ上限管理:LRUモデル退避により常駐モデルを上限内(既定は2GB)に制御

Hayamimiを動作させる場合、動作環境にはPython 3.10以上とPATHの通ったffmpegが必要です。まずは適切な場所にリポジトリをクローンします。

git clone https://github.com/oboroge0/hayamimi.git

次に仮想環境作成と依存関係インストールします。

python -m venv .venv

# Windowsの場合
.venv\Scripts\pip install -r requirements.txt

# macOS / Linuxの場合
.venv/bin/pip install -r requirements.txt

最後にモデルをダウンロードします。

# Windowsの場合
.venv\Scripts\python scripts/download_models.py

# macOS / Linuxの場合
.venv/bin/python scripts/download_models.py

「--minimal」オプションを指定すると日本語と英語のみの約1.1GB構成も可能となっています。

リアルタイム認識を実行するには以下のコマンドを実行します。

# マイク入力 (Windows)
.venv\Scripts\python scripts/realtime_transcribe.py

# マイク入力 (macOS/Linux)
.venv/bin/python scripts/realtime_transcribe.py

# PC内部スピーカー入力 (Windows専用)
.venv\Scripts\python scripts/realtime_transcribe.py --input speaker

# マイク+スピーカー合成入力
.venv\Scripts\python scripts/realtime_transcribe.py --input mix

# ダッシュボード+OBSオーバーレイ付き
.venv\Scripts\python scripts/realtime_transcribe.py --serve

なおHayamimiにはデモUIが用意されています。「--serve」オプションでローカルサーバーが起動し、ブラウザから以下の3ページにアクセスできます。

・http://localhost:8833/dashboard:ダッシュボード:発話中のテキスト・確定行・翻訳・清書版トランスクリプトが表示される
・http://localhost:8833/:OBSオーバーレイ:OBSのブラウザソースURLとして設定すると配信画面に字幕が表示される
・http://localhost:8833/transcript:トランスクリプトページ:清書版トランスクリプトのみを表示

記事作成時点でのHayamimiの制限事項は以下の通りです。

・1文中に複数言語が混在する発話には未対応
・効果音やBGM直後の短い発話では言語判定を誤ることがある
・同時に話す2人の話者は分離不可
・翻訳品質は小型モデルに依存するため、中国語・韓国語翻訳では数値や金額の間違いが発生する可能性あり
・オプトインの4クラス句読点モデルは既定では感嘆符「!」を出さない

View the original on GIGAZINE →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.