实测 DeepSeek V4 正式版:3 块钱干完 5 件事,AI「智价比」之战开打了

顶级模型的竞争,正在从单纯比拼能力上限,转向同时争夺「智价比」。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。

科技圈的刺激,总是来得猝不及防。

同一天,两家大模型领域的绝对顶流,不约而同地丢出了自己的重磅炸弹。一边是 OpenAI 突然宣布 GPT-5.6 系列模型价格大跳水;另一边,DeepSeek 正式发布 V4-Flash 模型,带着通过后训练(Post-Training)全面强化的推理与代码能力,霸气登场。

过去两年,大模型的竞争主线是追赶能力上限:参数更大、上下文更长、跑分更高。今天这两份公告放在一起,则释放出另一个信号:

顶级模型的竞争,正在从单纯比拼能力,转向争夺「智价比」。

这种变化对 Agent 尤其重要。

让聊天机器人写一封邮件,模型回答一次,工作基本结束。让 Codex 修一个 Bug,它却要先读项目文件、搜索代码、应用补丁,再运行测试;一旦测试报错,还得回头检查并重新执行。

任务越长,模型调用次数越多,价格就越直接地影响 Agent 能否真正投入日常工作。

DeepSeek V4-Flash 的 API 价格仍是每百万 token 输入 1 元、输出 2 元。OpenAI 则把 GPT-5.6 Luna 的 API 价格下调约 80%,Terra 也便宜了 20%。

能力继续往上走,调用成本却开始往下掉。这次我们更想知道的是:价格更低的模型,能不能把事情同样做好?

模型还是那个模型,但更会干活了

DeepSeek 今天更新的 V4-Flash,目前只能通过 API 使用,网页版和 App 都没有更新。

开发者使用 API 调用 deepseek-v4-flash,后台则会自动换成新发布的 V4-Flash-0731。它可以一次读取 100 万 token 的内容,适合塞进大份文档或整个代码项目,也原生支持 OpenAI 的 Responses API,可以接入 Codex。

有意思的是,DeepSeek 称,V4-Flash-0731 与预览版的模型结构、尺寸完全一致,这次只重新进行了后训练。

可以把基础训练理解成上学,后训练更像入职后的专项练习。模型原本已经会写代码、读文档,接下来还要反复练习怎么拆解任务、选择工具、发现错误,以及如何把一件事情从头做到尾。身板没变,做事的习惯变了。

官方给出的提升幅度确实很大,甚至宣称「远超 V4-Pro-Preview」。在测试模型能否操作终端、连续完成任务的 Terminal Bench 2.1 中,它从 61.8 分涨到 82.7 分;另一项代码 Agent 测试 DeepSWE,则从 7.3 分涨到 54.4 分。

这些数字翻译成人话就是,新版不只更会写代码,也更擅长调用工具,把一件事情从头做到尾。

更关键的是,能力上涨并没有伴随涨价。V4-Flash 仍维持每百万 token 输入 1 元、输出 2 元。

几乎同一时间,OpenAI 也在降低模型调用门槛。据 Axios 报道,上线仅 3 周的 GPT-5.6 Luna 输入和输出价格均下调约 80%,Terra 也降价 20%。降价后的 Luna 每百万 token 输入 0.2 美元、输出 1.2 美元。

但便宜的前提是能把活干完。Agent 往往要连续调用模型几十次,任何一步出错,整个任务都可能返工。

所以这次,我们把 DeepSeek V4-Flash 接入了 Proma,给它安排了 5 个从简单到复杂的任务。过程中不追加提示,也不替它处理问题,看看它拿出的第一版到底能不能用。

5 个任务跑下来,V4-Flash 的惊喜不只是便宜

第一轮,我们把爱范儿和 APPSO 的 320 篇早报数据交给 V4-Flash,让它分析两个账号的阅读、互动、选题和发布节奏,并把结果做成一份网页报告。

查看文件夹里的早报文章数据,多维度分析数据,然后给我清晰明了的分析报告,输出为交互式的 html

V4-Flash 先用几张数字卡片交代整体情况,再把内容拆成账号对比、阅读趋势、互动画像、选题分析、结构透视、爆款榜单和全量明细。页面里混用了柱状图、折线图、环形图、雷达图和散点图,散点图还能切换账号、缩放查看。

视觉上也相当成熟。深色背景、蓝黄色强调色和卡片层级保持一致,十几张图塞在同一页里,依然能一眼分清重点。虽然这份报告很长,但好在并没有明显的拼贴感。

接下来,我让 DeepSeek V4 做了一个稍微复杂一些的任务——一个打砖块小游戏,既要处理球、挡板和砖块的碰撞,又要加入重力、动量传递、砖块耐久、连锁爆炸、4 种道具和粒子效果。

它给出的结果意外地还不错,普通砖、金属砖和爆炸砖在视觉上有明确区分;金属砖被击中后会出现裂纹,爆炸砖会波及周围砖块。多球、加宽挡板、粘性挡板和激光也不是只出现在说明里,实际游玩时都能触发。

请为我编写一个单文件 HTML 格式的打砖块小游戏。要求使用 HTML5 Canvas 绘制,且具备以下核心要素:
  1. 真实的物理引擎:球与砖块、墙壁和挡板的碰撞遵循弹性碰撞与动量守恒。挡板移动时的速度应该能传递给球(例如:向右快速移动挡板击球时,球会获得额外的向右水平速度)。加入轻微的重力效果,使轨迹更丰富。
  2. 砖块类型与生命值:设计不同颜色和耐久度的砖块(如普通砖块需要击打 1 次,金属砖块需要击打 3 次并伴有视觉开裂效果,爆炸砖块被击碎时会炸毁周围的砖块)。
  3. 道具系统:击碎特定砖块会随机掉落道具,包括:多球模式(分裂出 3 个球)、挡板加宽、粘性挡板(球碰到挡板后先粘住,按空格键再发射)、以及激光射击(挡板可以发射子弹直接摧毁砖块)。
  4. 视觉与特效:包含击碎砖块时的粒子散落效果、球撞击时的微弱屏幕抖动、流畅的 60 FPS 动画,以及简洁现代的 UI 界面(计分板、生命值显示、暂停和重新开始按钮)。
  5. 代码结构:所有的 HTML、CSS 和 JavaScript 代码必须全部打包在一个文件中,确保可以直接双击在浏览器中运行,且无外部依赖库。

接下来,我们又把题目换成了三体轨道模拟器。这类页面很容易靠星空、光球和拖尾蒙混过关,真正的难点是算出三颗星体下一秒各自会去哪里,并让轨道持续运行。

请写一个单文件 HTML 的三体运动轨道交互式模拟器,具体要求:
  1. 物理计算:使用龙格-库塔法(RK4)或 Verlet 积分算法来计算三个质点在万有引力作用下的运动轨迹。允许用户实时调整引力常数 G、三个质点的质量、初始位置和初始速度矢量。
  2. 交互与控制:用户可以通过鼠标拖拽来改变质点的初始位置,或者通过轨迹线上的箭头调整初始速度。包含暂停、单步调试、重置、以及内置几种经典稳定轨道(如 figure-8 八字形轨道、Lagrange 轨道等)的一键预设功能。
  3. 可视化效果:使用 Canvas 绘制质点的实时运动,并保留渐隐的运动轨迹拖尾(利用半透明背景刷新实现)。实时显示每个质点的位置、速度和加速度数值。
  4. 代码要求:完全原生 JavaScript 实现,无需外部库,界面设计美观、富有科技感。

V4-Flash 交付的页面采用了四阶龙格-库塔法,也就是 RK4 来计算轨道。它还加入了引力软化,避免两个质点距离太近时数值突然爆炸;当加速度变大、天体接近相遇时,程序会自动把一个计算步长继续拆细,降低轨迹发散的概率。

界面完成度同样在线。主要画面留给轨道,复杂参数集中在右侧,状态信息收在左上角,没有因为控制项多就变成一块密密麻麻的工程面板。

算完轨道,我们再换个方向,看看它的审美。任务是一张科幻控制舱仪表盘,不仅要有实时波形、环形进度和滚动日志,点击「超载模式」后,整套界面还要同时进入警报状态。

请为我设计一个单文件 HTML 格式的未来感科幻控制舱仪表盘(Sci-Fi Dashboard)。具体要求:
  1. 视觉风格:深色调背景,使用荧光蓝、霓虹绿和警示橙作为主配色。加入网格背景暗纹、发光特效(box-shadow)和数字科技感字体。
  2. 动态组件:包含一个实时波形图(使用 Canvas 绘制的音频波形或心率图模拟)、几个带有平滑过渡动画的环形进度条(展示 CPU 占用率、能源百分比等),以及一个不断滚动的实时日志终端(Terminal)。
  3. 交互控制:用户可以点击「超载模式」按钮,此时仪表盘所有指示灯变为闪烁的红色,数据刷新速度加倍,且有警告音效(用 Web Audio API 合成,无需外部音频文件)。
  4. 代码规范:使用响应式设计,所有 CSS、HTML 和 JS 代码必须内嵌于同一个文件中,保持现代优雅的视觉表现力。

V4-Flash 这一版却做得像模像样,挺有内味的。实时波形、环形进度、能量流、系统状态和日志终端有清楚的主次关系,发光效果没有盖过数据本身。波形持续运动,环形数字平滑变化,终端也会不断刷出新的系统日志。

前面的任务都可以在本地完成。最后,我们加入联网、调用 API 和读取外部资料,让 V4-Flash 从一句话开始,做出一份开源 AI 项目周报。

请帮我写一个 Python 脚本,调用 GitHub API 拉取过去 7 天内 Stars 增长最快的 10 个开源 AI 项目。提取它们的 README 摘要,并自动生成一份 Markdown 格式的周报。

把这个周报做成一个美观、有科技感的网页,略有极客风,简洁明了的界面。

它创建了 Python 脚本,实际运行并检查结果,最终交付了脚本、Markdown 周报和一份 JSON 原始数据,以及一个精致的网页。

5 个任务全部结束后,我回头看了一眼费用——

DeepSeek 后台一共记录了 393 次 API 请求,累计消耗约 3422 万 token,前前后后只花了 2.85 元。测试前充进去的 10 元,连三分之一都没用完。

当大模型开始从「做大」转向「做精」

5 个任务当然无法测出一个模型的全部能力,但它们已经足够让我们一窥 V4-Flash 的优势:速度快、价格低,也能把一段含糊、抽象的要求变成完整、可操作的成品。

过去几年,AI 行业主要遵循 Scaling Law:模型参数更多、训练数据更大、投入算力更高,能力通常也会随之提升。

华为何庭波提出的「韬(τ)定律」,代表的则是另一种思路——当几何缩微越来越困难,就把优化范围从单个器件扩展到电路、芯片和整个系统,通过缩短信号传播时间、提高协同效率,继续挖掘性能。

两者讨论的并不是同一个技术问题,却代表了两种不同的发展路径:一条继续扩大规模,另一条想办法让现有系统运行得更有效率。

V4-Flash 这次的变化,更接近后一种思路。模型结构和尺寸没有变化,仅靠后训练,它在代码、工具调用和连续执行任务上的表现就有了明显提升。它没有否定 Scaling Law,只是说明继续堆参数之外,数据质量、强化学习、推理策略和训练方法,依然可以从现有模型里挖出更多能力。

无独有偶,OpenAI 今天也宣布 GPT-5.6 系列模型大幅降价。顶级模型的竞争,正在从单纯比拼能力上限,转向同时争夺「智价比」。

模型厂商之间的价格战已经全面展开。对厂商而言,这会继续压缩利润空间,并加速行业洗牌;但对开发者和普通用户而言,模型价格下降意味着 Agent 可以调用更多次、思考更长时间,也能承担过去因成本过高而无法落地的任务。

当模型能力继续提升,调用成本持续下降,真正被打开的,或许不只是一个更便宜的聊天机器人,而是一个可以长时间运行、反复试错,并真正替人完成复杂工作的 Agent 时代。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。

郑廷旭
郑廷旭
文章: 60