核心信息

Perplexity 使用提示引导的自蒸馏方法对计算机模型进行后训练,使其能够从自身错误中学习。在实时 A/B 测试中,较晚的检查点相比于较早的检查点,工具调用失败率相对降低了 21.2%。

要点

  • 在提示存在的情况下,未变化的模型在 93.7% 的情况下避免了原始失败,而之前为 75.1%。
  • 在另一项实时测试中,不同训练版本之间的工具调用失败率从 2.24% 降至 1.77%,且推理时不使用提示。
  • 全文可通过提供的链接获取。