核心信息

Hugging Face 将在 Hub 上支持强化学习环境,理由是环境本质上由任务、测试、容器和奖励函数构成,应当像数据集一样被统一管理。

要点

  • 目前 RL 环境分散在自定义 hub、运行时注册表、带自定义加载器的 GitHub 列表中
  • 为一个框架发布后,其他框架的用户无法加载
  • 环境由任务、测试、容器、奖励函数组成,与数据集高度相似
  • Hub 已经为数百万用户做版本管理、门控和预览,无需另建系统