核心信息
Hugging Face 将在 Hub 上支持强化学习环境,理由是环境本质上由任务、测试、容器和奖励函数构成,应当像数据集一样被统一管理。
要点
- 目前 RL 环境分散在自定义 hub、运行时注册表、带自定义加载器的 GitHub 列表中
- 为一个框架发布后,其他框架的用户无法加载
- 环境由任务、测试、容器、奖励函数组成,与数据集高度相似
- Hub 已经为数百万用户做版本管理、门控和预览,无需另建系统
Hugging Face 将在 Hub 上支持强化学习环境,理由是环境本质上由任务、测试、容器和奖励函数构成,应当像数据集一样被统一管理。