核心信息
NVIDIA 的 Nemotron 3 说话人分离模型,即使在声音重叠时也能追踪谁在何时发言,现已上线 Hugging Face。该模型支持多达八位说话人,拥有 1 亿参数。
要点
- 能处理重叠语音,生成准确的转录文本。
- 支持对话中多达八位说话人。
- 1 亿参数的模型已上线 Hugging Face,并获得 transformers 的 Day-0 支持。
NVIDIA 的 Nemotron 3 说话人分离模型,即使在声音重叠时也能追踪谁在何时发言,现已上线 Hugging Face。该模型支持多达八位说话人,拥有 1 亿参数。