核心信息

Stability AI 互动研究团队发布了 SemanTok,通过让早期视频 token 具备更强的语义含义,使其表征更易预测,从而提升视频生成效率。

要点

  • 视频生成常见做法是从粗到细构建场景:初始 token 捕捉整体画面,后续 token 补充细节
  • SemanTok 进一步让早期 token 更具语义意义,使模型更清楚地理解场景内容
  • 使用 SemanTok 的模型达到了可比的表现(详见论文),实现更高效的视频生成
  • 核心思路是通过提高表征可预测性来缩小视频世界模型的规模,而不仅是依赖压缩