NVIDIAは、話者分離(ダイアライゼーション)モデル「Nemotron 3 Diarization」をHugging Faceで公開しました。
同モデルは会話中の「誰がいつ話したか」を推定し、音声が重なっても最大8人の話者を追跡します。
モデルは約1億パラメータで、1つのチェックポイントでオフライン録音とリアルタイム配信の両方に対応するとしています。
重ねて話す場面でも、同一フレームで複数の話者チャネルが同時に立ち上がる設計です。
重複話者のラベルは到着順で安定させ、ストリーミングではArrival-Order Speaker CacheやFIFOキューを用いて過去情報を保持します。
推論はLinux上でNVIDIA NeMo経由により行い、対応GPUはAmpere、Ada Lovelace、Hopper、Blackwellです。
重みはOpenMDW License 1.1で提供され、商用利用が可能です。
遅延はオフラインで30.4秒から、推奨設定の超低遅延で0.32秒までの運用点を示しています。
Voice Arenaの初期評価では、12システム17構成の中でDER 14.72%を記録し1位になったと報告されています。
ただし8話者を超える収録や強いノイズ、残響、遠距離マイクでは誤りが増える可能性があります。
参照元:2026/09/24 「NVIDIA Releases Nemotron 3 Diarization: A 100M-Parameter Open-Weight Model That Tracks 8 Speakers in Real Time」 https://www.marktechpost.com/2026/09/23/nvidia-releases-nemotron-3-diarization/
この記事へのリアクション
このニュースをどう受け止めましたか?



コメント