AI 日报 · 9月19日:实测显示不同提供商 DeepSeek V4.1 Flash 吞吐差异达 2.6 倍
今日实测揭示 DeepSeek V4.1 Flash 在不同提供商间有效吞吐最高达 197 token/s,差异 2.6 倍;另有 Qwen 实时同传模型、Grok 语音转录低价上线,以及缓存命中率影响成本的警示。
当前展示最新一期(9月19日)。每天的日报在次日生成。
-
DeepSeek V4.1 Flash 实测速度差异达2.6倍
实测 2679 次真实调用显示,DeepSeek V4.1 Flash 在不同提供商路线上中位有效吞吐量最高 197 token/s,最慢路线相差 2.6 倍。
-
Qwen 发布 Qwen3.8-LiveTranslate 实时同传模型
Qwen发布Qwen3.8-LiveTranslate,采用Interleave架构,60种语言平均延迟从2.8秒降至2.3秒,并新增说话人分离功能。
-
xAI 推出 Grok Voice Transcribe 2.0,批量转录 $0.10/小时
xAI在Grok Voice API中上线Grok Voice Transcribe 2.0,批量转录每小时$0.10,流式转录每小时$0.20。
-
缓存命中率低导致 Token 消耗最高增至 3 倍
部分 AI 推理提供商缓存命中率低,导致 Token 消耗增至 3 倍;据称目前只有 DeepSeek 真正实现 99% 的缓存命中率。
-
Cline Desktop 上线,限免 Kimi K3 等开放权重模型
Cline 发布桌面应用 Cline Desktop,限时免费提供 Kimi K3,另有 DeepSeek-V4.1-Flash、Musespark-1.3,或自带 API 密钥。
-
Meta 的 SAM 3.1 已在 Meta Model API 上线
Meta 的 SAM 3.1 已登陆 Meta Model API,支持单次调用完成检测、分割与跟踪,推理针对该架构优化。
-
决策模型 Jev 上架 OpenRouter 与 Requesty
Typesafe AI 的决策模型 Jev 现已通过 OpenRouter 和 Requesty(typesafe/jev-latest)提供,适合是非/选择类问题,成本与速度约为常规 LLM 的 1/10。
-
Command Code 集成 GLM-5.3 FlashX,吞吐约 200 TPS
Command Code 的 AI 编码环境已上线 GLM-5.3 FlashX,宣称吞吐约每秒 200 tokens。
-
Cline 插件让 Jev 模型自主操控 Chrome 浏览器
Cline 推出 jev-browser 插件,让前沿模型 Jev 能在 Cline Desktop 中自主使用 Chrome,可通过市场安装。