核心信息

NVIDIA 的 Nemotron 3 说话人分离模型,即使在声音重叠时也能追踪谁在何时发言,现已上线 Hugging Face。该模型支持多达八位说话人,拥有 1 亿参数。

要点

  • 能处理重叠语音,生成准确的转录文本。
  • 支持对话中多达八位说话人。
  • 1 亿参数的模型已上线 Hugging Face,并获得 transformers 的 Day-0 支持。