8 月 1 日消息,深度求索(deepseek)昨日(7 月 31 日)通过 api 文档发布日志,宣布 deepseek-v4-flash 正式版 api 上线公测。@artificialanlys、@arena 等 ai 跑分基准平台今天(8 月 1 日)同步更新了相关基准测试结果。
@artificialanlys (artificial analysis)
@artificialanlys (artificial analysis) 是一家领先的国际独立 ai 基准测试与分析机构,专门针对大语言模型(llm)、视频生成、ai 音乐等多领域进行无偏见的性能与托管成本评估。
其中,artificial analysis intelligence index(智能指数)是最核心的综合性技术基准,用来全面衡量 ai 模型的绝对智能水平并追踪技术演进。
报告指出 deepseek v4 flash 0731 在人工智能分析智能指数 (aii) 中获得 50 分,比 deepseek v4 flash(2026 年 4 月发布)高出 10 分,比 deepseek v4 pro 高出 6 分。
deepseek v4 flash 0731 的智能指数比 gpt-5.6 luna(最高 51 分)低 1 分。即使 openai 今天将 gpt-5.6 luna 的价格下调了 80%,deepseek v4 flash 0731 在其自有 api 上的单任务成本仍然比 gpt-5.6 luna(最高 51 分)低约 60%。
造成这一差异的关键因素是 deepseek 为其自有 api 提供了约 98% 的缓存命中折扣,这一折扣力度远超业内大多数厂商提供的 90% 缓存命中折扣。
@arena (arena.ai)
@arena (arena.ai) 是当前全球 ai 行业最权威的“人类偏好”大模型即时对战与评测平台。它源自著名的 lmsys chatbot arena 团队,采用类似国际象棋的 elo 积分系统,通过纯粹的人类开发者双盲盲测(blind a/b testing)来对全球 ai 模型进行高强度的淘汰赛排名。
在其细分榜单中,frontend code arena(前端代码竞技场,又称 webdev arena)是目前评估大模型网页开发、前端工程与 agent 级自动化编码能力的黄金标准与行业风向标。
报告称 deepseek-v4-flash-high 以 1586 分的成绩重塑了 frontend code arena 跑分榜单。
每个 mtoken 的价格为 0.14 美元(it之家注:现汇率约合 0.95 元人民币)/0.28 美元(现汇率约合 1.9 元人民币),是同类产品中性价比最高的。
在前端代码领域,它的总排名为第 7,开放类别的排名第 3!在各个类别中,它在消费产品领域排名第 4,在基于参考的设计、数据与分析、游戏领域排名第 6,在品牌与营销领域排名第 7。
与 deepseek-v4-flash-high-preview 相比,这是一个显著的提升,性能提高了 154 分。而与 deepseek-v4-pro-preview 相比,提升幅度更大,达到了 121 分。