核心信息

Qwen发布了Qwen-Audio-3.1,升级了ASR、TTS和实时功能,并新增两个模型:TTS-Next和ASR-Next。该系列大幅降价:TTS约降70%,实时约降85%,ASR最高降95%。

要点

  • 五个模型构成完整的音频栈,涵盖理解、生成、交互和创作。
  • ASR改进包括更强的多语言和方言识别,自动去除语气词和重复,使转录更清晰。
  • ASR-Next支持多说话人ASR,带说话人标签、时间戳和校准转录,并能理解情绪、环境声和机器声,用于声音描述和事件定位。