核心信息
Mistral Large 4 被定位为可执行复杂工作流、收集信息并交付完整成果的通用智能体模型。在 AutomationBench 上,它于 657 项涵盖 Gmail、Google Sheets、Slack、Salesforce 等模拟办公应用的业务工作流测试中,领先于 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。
要点
- Mistral Large 4 主打端到端智能体工作流,而非单轮问答
- AutomationBench 覆盖 657 项跨模拟办公应用的业务工作流
- 被其超越的竞品包括:Kimi K3、MiMo-V2.6-Pro、DeepSeek V4 Pro
- 在 Harvey 法律智能体基准(LAB)中,Mistral Large 4 是排名第一的开源模型
- 测试涉及的常用工作应用包括 Gmail、Google Sheets、Slack 和 Salesforce