· ローカルAI

NVIDIAが公開した1億パラメータの音声話者識別モデル

20秒でわかる内容解説

NVIDIAが2026年9月23日、最大8話者に対応するオープンウェイト話者識別モデル「Nemotron 3 Diarization」を公開した。パラメータ数は1億と軽量で、ローカルPCでのストリーミング推論に適している。商用・非商用利用が許可されており、自作AIアプリや会議録音の自動文字起こしに直接組み込める。技術者向けに最適化されている。

1億パラメータの軽量アーキテクチャ

本モデルは「誰が」「いつ」話したかを判定する音声活動検出パイプラインだ。31層のTransformerエンコーダーを採用し、10 ms(ミリ秒)のメルスペクトログラムを入力とする。出力は10 ms(ミリ秒)ごとの話者活動確率となり、最大8チャンネルまで並列処理できる。

ストリーミング推論ではAOSCとFIFOキューを用いて過去の話者情報を保持する。AOSCは話者IDを保持し、FIFOキューは最新フレームの文脈を提供する。最低推奨構成の入力バッファレイテンシは0.32秒だ。遅延が重要な用途では80ミリ秒まで短縮可能である。

単一チェックポイントで商用・非商用の両利用が許可されている。Hugging Faceから直接ダウンロードし、NVIDIA NeMo-Speech.cppやTransformersライブラリ経由でローカル実行できる。計算時間は除くバッファ待ち時間のみをレイテンシとして定義している。

区分仕様
推論モードストリーミング・オフライン
最小レイテンシ80ミリ秒
推奨レイテンシ0.32秒
学習データ約9万2千時間
対応GPUアーキAmpere〜Blackwell

出力フレーム解像度は10 ms(ミリ秒)の倍数に設定できる。30 msや80 msに調整すれば処理負荷をさらに抑えられる。チャンク推論を用いれば録音時間の上限は存在しない。入力は16キロヘルツのモノラル音声ファイルに対応する。ローカルPCのGPUメモリ消費を抑えつつ、長時間の会議録音やポッドキャストの解析が可能になる。

実会話とシミュレーション音声の学習経緯

モデルの基盤にはSortformerの仕組みが採用されている。入力音声の各話者の初回出現順に出力チャネルを並べ替えることで、話者の入れ替え問題を解決する。ストリーミング時はAOSCが話者IDを保持し、FIFOキューが最新フレームの文脈を提供する。

学習データは実会話約1万時間とシミュレーション音声約8万2千時間で構成される。実データにはFisherやAMI Meeting Corpus、ICSIが含まれる。シミュレーションにはLibriSpeechやDavid AIの単一音声約2万8千時間をFastMSSツールで混合した。

言語は英語と中国語が中心だが、ヒンディー語やベンガル語などの多言語データも学習に用いられている。データには通話音や会議音、ポッドキャスト、合成ノイズが含まれる。DIHARD IIIやDISPLACE 2024などの多言語コーパスも学習に組み込まれている。

実会話データにはVoxConverse v0.3やAISHELL-4、AliMeeting Mandarin Corpusが用いられた。David AIのライセンス契約データは3から4話者の1千時間分を含む。シミュレーション音声はLibriSpeechやAMIの単一ヘッドセット録音をFastMSSで混合した。計8万2千時間の多話者混合音声で、1から8話者の構成を網羅している。

入力音声は8分の1にダウンサンプリングされ、80 ms(ミリ秒)のエンコーダーフレームレートになる。エンコーダー上にはConv1D層が配置され、10 ms(ミリ秒)の解像度に戻す。31層のTransformerエンコーダーはRoPEを用いて位置情報を埋め込む。ローカル環境でのメモリ効率を高める設計だ。

C++ランタイムとGPU対応状況

2026年9月24日にHugging Faceのトレンド入りした同モデルは、軽量設計とC++ランタイムの提供が評価されている。NeMo-Speech.cppを用いればPython環境を構築せずともターミナルから直接推論できる。

対応ハードウェアはAmpere世代のRTX 30シリーズからBlackwell世代のRTX 50シリーズまで幅広い。RTX 40シリーズやL40S、B200などのデータセンターGPUにも最適化されている。

ローカルPCのGeForce RTX 3060や4060でも実用的な推論速度が期待できる。ストリーミングモードでは低遅延設定を切り替えるだけで、会議システムやリアルタイム字幕アプリへの組み込みが容易になる。NVIDIAの公式デモページではストリーミングASRとの連携動作が公開されている。Linux環境での動作が公式にサポートされている。

ハイエンドPC向けにHugging Face Transformersネイティブ対応も完了している。pipコマンドでソースからインストールすれば、AutoModelForAudioFrameClassificationクラス経由で読み込める。デバイスマップをautoに設定するだけでGPUメモリを自動割り当てできる。

評価データと統合パイプラインの予定

評価データセットのDIHARD III Eval表は公開資料で途中までしか記載されていない。完全なDER値や言語別性能はまだ公開されていない。DERは話者識別誤り率を表す。

NeMo Framework v3.0との統合パイプラインを通じて、対話型AIシステムへの組み込みテストが進められる。V字モデルに基づきユニットテストとシステムテストが繰り返される予定だ。V字モデルは段階的なテスト手法だ。

2026年9月23日に公開されたチェックポイントは一般公開版として提供される。e2e_diarize_speech.pyスクリプトを用いてパラメータ調整が可能だ。bf16精度やcompile_encoderの切り替えで速度を最適化できる。今後の評価スクリプト更新でストリーミング挙動のベンチマーク値が確定する見込みだ。

出典