• 回答数

    0

  • 浏览数

    6

  • 收藏数

    0

作者:admin 发表于 12 小时前
跳转到指定楼层
IT之家 8 月 1 日消息,深度求索(DeepSeek)昨日(7 月 31 日)通过 API 文档发布日志,宣布 DeepSeek-V4-Flash 正式版 API 上线公测。

@ArtificialAnlys、@arena 等 AI 跑分基准平台今天(8 月 1 日)同步更新了相关基准测试结果。

【@ArtificialAnlys (Artificial Analysis)】
@ArtificialAnlys (Artificial Analysis) 是一家领先的国际独立 AI 基准测试与分析机构,专门针对大语言模型(LLM)、视频生成、AI 音乐等多领域进行无偏见的性能与托管成本评估。

其中,Artificial Analysis Intelligence Index(智能指数)是最核心的综合性技术基准,用来全面衡量 AI 模型的绝对智能水平并追踪技术演进。

报告指出 DeepSeek V4 Flash 0731 在人工智能分析智能指数 (AII) 中获得 50 分,比 DeepSeek V4 Flash(2026 年 4 月发布)高出 10 分,比 DeepSeek V4 Pro 高出 6 分。

DeepSeek V4 Flash 0731 的智能指数比 GPT-5.6 Luna(最高 51 分)低 1 分。

即使 OpenAI 今天将 GPT-5.6 Luna 的价格下调了 80%,DeepSeek V4 Flash 0731 在其自有 API 上的单任务成本仍然比 GPT-5.6 Luna(最高 51 分)低约 60%。

造成这一差异的关键因素是 DeepSeek 为其自有 API 提供了约 98% 的缓存命中折扣 ,这一折扣力度远超业内大多数厂商提供的 90% 缓存命中折扣。



【@arena ( Arena.ai )】
@arena ( Arena.ai ) 是当前全球 AI 行业最权威的“人类偏好”大模型即时对战与评测平台。

它源自著名的 LMSYS Chatbot Arena 团队,采用类似国际象棋的 Elo 积分系统,通过纯粹的人类开发者双盲盲测(Blind A/B Testing)来对全球 AI 模型进行高强度的淘汰赛排名。

在其细分榜单中,Frontend Code Arena(前端代码竞技场,又称 WebDev Arena)是目前评估大模型网页开发、前端工程与 Agent 级自动化编码能力的黄金标准与行业风向标。

报告称 DeepSeek-V4-Flash-High 以 1586 分的成绩重塑了 Frontend Code Arena 跑分榜单。

每个 MToken 的价格为 0.14 美元(IT之家注:现汇率约合 0.95 元人民币)/0.28 美元(现汇率约合 1.9 元人民币), 是同类产品中性价比最高的。

在前端代码领域,它的总排名为第 7,开放类别的排名第 3!在各个类别中,它在消费产品领域排名第 4,在基于参考的设计、数据与分析、游戏领域排名第 6,在品牌与营销领域排名第 7。

与 DeepSeek-V4-Flash-High-Preview 相比,这是一个显著的提升,性能提高了 154 分。而与 DeepSeek-V4-Pro-Preview 相比,提升幅度更大,达到了 121 分。



【和其它模型对比】
IT之家查询 X 平台,发现有不少开发者分享了使用 DeepSeek-V4-Flash 正式版的对比视频:

DeepSeek-V4-Flash 和 GPT-5.6 Luna 模型的视频对比

DeepSeek-V4-Flash 和 GPT-5.6 Luna 模型的视频对比

DeepSeek-V4-Flash 和 GPT-5.6 Luna 模型的视频对比

DeepSeek-V4-Flash 和 Kimi K3 模型的视频对比

[来源链接] https://www.ithome.com/0/984/417.htm
分享:
回复

使用道具

成为第一个回答人

高级模式 评论
您需要登录后才可以回帖 登录 | 立即注册
⚠️

AI客服助手

×
AI
您好!我是AI客服助手,有什么可以帮助您的吗?

请先登录后使用AI客服助手

立即登录
内容由非常AI大模型生成,仅供参考,相关风险需自行承担。

赚钱

会员VIP

留言板

商务合作

联系电话:17308937318

QQ邮箱

QQ:118275

邮箱:118275@qq.com

友情链接