NVIDIA、8話者を同時追跡するNemotron 3 Diarizationを公開

NVIDIAは、話者分離(ダイアライゼーション)モデル「Nemotron 3 Diarization」をHugging Faceで公開しました。
同モデルは会話中の「誰がいつ話したか」を推定し、音声が重なっても最大8人の話者を追跡します。
モデルは約1億パラメータで、1つのチェックポイントでオフライン録音とリアルタイム配信の両方に対応するとしています。
重ねて話す場面でも、同一フレームで複数の話者チャネルが同時に立ち上がる設計です。
重複話者のラベルは到着順で安定させ、ストリーミングではArrival-Order Speaker CacheやFIFOキューを用いて過去情報を保持します。
推論はLinux上でNVIDIA NeMo経由により行い、対応GPUはAmpere、Ada Lovelace、Hopper、Blackwellです。
重みはOpenMDW License 1.1で提供され、商用利用が可能です。
遅延はオフラインで30.4秒から、推奨設定の超低遅延で0.32秒までの運用点を示しています。
Voice Arenaの初期評価では、12システム17構成の中でDER 14.72%を記録し1位になったと報告されています。
ただし8話者を超える収録や強いノイズ、残響、遠距離マイクでは誤りが増える可能性があります。

参照元:2026/09/24 「NVIDIA Releases Nemotron 3 Diarization: A 100M-Parameter Open-Weight Model That Tracks 8 Speakers in Real Time」 https://www.marktechpost.com/2026/09/23/nvidia-releases-nemotron-3-diarization/

この記事へのリアクション

このニュースをどう受け止めましたか?

Reader Reaction

このニュース、みなさんはどう感じましたか?ぜひコメント欄であなたの声を聞かせてください。

※本記事に掲載している情報は公開時点のものです。最新情報は公式発表等をご確認ください。

ぜひコメントを添えてシェアお願いします。
  • URLをコピーしました!
  • URLをコピーしました!

アンケート

悩み相談をするなら、どちらに打ち明けたいですか?

回答者数:2人 投票期間:2026/04/16〜2026/09/24
回答はお一人様1回までです。


PR:実務直結の稼げるAIスキルを学べる

DMM 生成AI CAMP

AIを使いこなす側か、使われる側か。今がキャリアの分岐点。

全コース学び放題
入会金・教材費0円
最低契約期間なし・いつでも解約OK

受講生同士が繋がれるコミュニティ

Google検索で 3min AI を優先表示できます

Google検索の「優先ソース」に追加すると、通信ニュースを検索した際に、3min AIの記事が見つけやすくなります。

※Googleの設定画面が開きます。表示されたサイトにチェックを入れると、優先ソースとして設定できます。

Google検索の優先ソースに追加する

コメント

コメントする

CAPTCHA


日本語が含まれない投稿は無視されますのでご注意ください。(スパム対策)

目次