游客发表
DeepSeek-V4 系列模型迎来重大升级。列迎抢在 7 月最后一天(31 日),升级DeepSeek-V4-Flash 正式版上线。列迎
根据官方消息,升级DeepSeek-V4-Flash 正式版的列迎模型架构、大小和与预览版相同,升级免费网站9.1下载官方版下载即 MoE(混合专家)架构、列迎2840 亿总参数、升级130 亿激活参数、列迎1M 上下文,升级在此基础上,列迎正式版仅重新进行了后训练,升级Agent 能力便大幅增强,列迎麻豆入口基准测试得分远超 V4-Pro-Preview。升级
官方性能对比的列迎是国产编程代表 GLM-5.2 及美国的 Opus 4.8。DeepSeek-V4-Flash 正式版的整体性能超过了 GLM-5.2,逼近 Opus 4.8。相比对标模型,V4 Flash 只是免费抖阴免费版下载个小参数模型,GLM-5.2 总参数高达 7440 亿,激活参数为 400 亿,均远高于 V4 Flash。
具体来看官方给出的 9 项 Agent 基准测试得分,在考察终端操作能力的 Terminal Bench2.1 上,DeepSeek-V4-Flash 正式版的成年人91官方版得分从 61.8 涨到了 82.7;在代码仓库理解与修改任务 NL2Repo、DeepSWE 上,分别得分 54.2 和 54.4,而其前身 Flash Preview 在 DeepSWE 项目上的得分仅为 7.3。
另外,其指向网络安全任务的 Cybergym 得分为 76.7,反映工具调用能力的桃传媒免费官方版 Toolathlon-Verified 达到 70.3。
在更综合的智能体评测中,DeepSeek-V4-Flash 正式版在 Agent Last Exam 和 Automation Bench Public 上的得分分别为 25.2 和 25.1,这两个项目都是 2026 年新推出、面向 AI 智能体的现实任务评测基准,用来检验大模型 Agent 能不能真正完成真实工作,区别于 MMLU、毛片91官方版下载Humanity ’ s Last Exam 这类纯问答测试。
在内部全栈开发测试 DSBench-FullStack 与高难度编码测试 DSBench-Hard 上,得分则达到 68.7 和 59.6。多项指标远超今年 4 月上线的 V4-Pro 预览版。
新版本上线后,Artificial Analysis 和 Arena.ai 两大 AI 评测平台同步更新了该模型的污视频官方版下载基准测试结果。
Artificial Analysis 智能指数显示,DeepSeek-V4-Flash 获得 50 分,比 4 月发布的 Flash 版本高出 10 分,仅比 OpenAI 的 GPT-5.6 Luna(51 分)低 1 分。该平台发文称,即使 OpenAI 将 GPT-5.6 Luna 的高清无码官方版价格下调了 80%,DeepSeek-V4-Flash 正式版在其自有 API 上的单任务成本仍然比 GPT-5.6 Luna 低约 60%。
Arena.ai 的报告称,DeepSeek-V4-Flash 正式版以 1586 分的成绩重塑了 Frontend Code Arena 跑分榜单。每 MToken 的价格为 0.14 美元 /0.28 美元,是同类产品中性价比最高的。
申万宏源证券最新研报称,黄91官方版下载DeepSeek-V4-Flash 继续展现国产模型超高性价比;国联民生证券称,DeepSeek-V4-Flash 轻量模型追平旗舰性能,利好 AI 应用产业链。
随机阅读
热门排行