DeepSeek、千问、智谱轮番登场,PC 厂商终于等到了它们的弹药

AMD 想用电脑把昂贵的 AI Token 账单降下来

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。

没有新显卡,也没有跑分轰炸,这场 IFA 2026 的 AMD 开幕演讲只讲了一件事:Personal AI(个人 AI)。

以及支撑它的三样新品:Ryzen AI Max 400(代号 Gorgon Halo)平台、下一代 HP ZBook 笔记本的首度曝光,和一台 96 核、全液冷的「桌上超算」Threadripper Halo Station。

Image

AMD 高级副总裁、计算与图形总经理 Jack Huynh 在 45 分钟的演讲里,从绕月飞行的 Artemis II、手术机器人讲到芬兰的 LUMI 超算和 PlayStation 5 Pro,回顾了一遍 AMD 的算力版图。

随后,把问题落到了每个人的电脑上:当 AI 像员工一样整天规划、调用工具和修改结果,这些计算究竟应该放在哪里?

Image

AMD 高级副总裁、计算与图形总经理 Jack Huynh

AMD 的答案叫 Personal AI。电脑先处理自己能完成的工作,涉及敏感数据和个人上下文的任务尽量留在本地;需要更大规模时,再调用云端与数据中心。

AMD 沿着这套构想,从支持 192GB 统一内存的 PC 一路到桌边工作站,再与微软和 SUSE 合作,补充了 Windows 开发与企业部署。不同产品和伙伴似乎都在回答同一个问题:怎样让 AI 先从离用户最近的设备开始工作

Image

DeepSeek、千问、GLM、gpt-oss 和 Laguna 也出现在台上,但它们在这场演讲里成了新的衡量指标。

刚发布一周多的 Qwen3.8-Flash-Next 就能放进 AMD 的新平台里运行、拥有 3200 亿总参数的 GLM-5.3-Flash 也能装进统一内存里。AMD 用这些开放权重模型证明,从普通 AI PC 到桌边工作站,任何硬件确实都有任务可跑。

对这些电脑芯片厂商来说,过去他们都在比游戏帧率,现在已经变成了比较我的电脑到底能装下多大的模型

「AI 是新的电力」,但电费快付不起了

Jack 把生成式 AI 过去几年的变化压缩成四步:先学会对话,再获得视觉和语音能力,随后开始推理;到了 2025 年,AI 从回答问题的模型变成了能够规划、调用工具、检查结果并继续工作的 Agent。

类似的转变除了带来更好的用户体验,更多的是工作负载的增加。

一次普通 ChatGPT 对话只要几百到几千 token,而一个「帮我规划全家意大利旅行」的 agent 任务,要查日历、订机票、改酒店,一次就是数十万甚至上百万 token。

按 AMD 给出的数字,消费者级用户每天将消耗数百万 token,创作者是数千万,开发者和创业者则是 5000 万起步。

Image

宏观数据则显示过去一年,全球月度 AI token 处理量从约 0.7 quadrillion(700 万亿)蹿升到 1.7 quadrillion(1700 万亿);到 2030 年,预计达到每月 120 quadrillion(12 亿亿)

与此同时,93% 的企业正在超支 AI 预算。Jack 提到一个活跃用户每天 1500 万输出 token,走云端大约是 300 欧元一天;一年为一个人的 AI 用量买单,需要支付接近 10 万欧元。

Image

「我们不能只是花更多钱,必须算得更聪明。」这句话,大概就是 AMD 整场发布会的题眼,如何把 AI 从云端拉回本地。

模型在变小,PC 在变大

本地化叙事能成立的前提,是本地模型和闭源的前沿模型相比足够好,即模型体积要变小、性能要变强

去年 8 月 OpenAI 放出的开放权重模型 GPT-OSS-120B 在 GPQA(研究生级推理基准)上曾拿到 80 分,已经作为很多开发者的本地部署首选。

几个月后,阿里的 Qwen3.5-9B 只用 90 亿参数,就在同一基准上拿到了更高的分数,参数少了 13 倍,成绩反而更好

Image

而放眼最近这几个月,开源模型和闭源模型的竞争更是如火如荼,从 Kimi K3 对标 Fable 5,到 DeepSeek、GLM,甚至 Flash 模型都开始对标 Claude Opus 系列模型。

AMD 的路线图也是沿着这条曲线展开,当前 Gorgon Point处理器,也就是Ryzen AI 400系列可以本地跑 240 亿参数模型;128GB 统一内存的 Strix Halo 则可以运行 2000 亿参数模型。

这些本地模型的表现,AMD 在现场也给出了对比,完全跑在 Strix Halo 上的开源模型 Laguna S 2.1,在一项软件工程基准上超过了云端的 Claude Sonnet 5(70.3 分)。

Image

1000 万输出 token,Claude Sonnet 5 云端约 90 欧元,本地为零

把计算搬回电脑,而不是放在数据中心,这是 AMD 针对本地计算的想法。

而在本地计算解决速度与成本之后,隐私与控制也是 Agent 比较敏感的一方面。AMD 希望这些资料先留在用户身边,由用户决定什么内容可以离开设备、发往哪里。

最后是个人上下文,这是 Jack 眼中比应用、模型和算力多出来的第四层。同一句「帮我准备明天」,对上班族可能意味着客户会议和三个待定事项,对学生则可能意味着考试与学习小组。

模型知道世界知识还不够,它还得知道提问的人明天要面对什么。本地计算、隐私与控制、个人上下文,这就是 AMD 所押注的个人 AI 三个关键词。

Image

在具体的产品上,AMD 介绍了 Gorgon Halo,对应的市场名是 Ryzen AI Max 400 系列。统一内存从 128GB 提升到 192GB,本地可运行模型从 2000 亿推到 3000 亿参数。

在现场,AMD还展示了来自智谱的 GLM-5.3-Flash,3200 亿参数可以在 Gorgon Halo 上本地运行,并展示了在同一基准上,本地模型的表现甚至要优于云端的 Claude Fable 5;作为对照,Fable 5 跑 1000 万输出 token 大约要花 500 欧元。

应用该芯片的电脑也有联想在 IFA 2026 旗舰发布的 ThinkCentre X Ultra,搭载 Gorgon Halo,小到可以摆在桌面上,最多四台可以组成集群。

此外,Jack 还首次公开了代号 Sundance 的下一代 HP ZBook:192GB 统一内存,现场用一条 prompt 在本地实时生成了一整个 3D 世界,然后又用它流畅跑了《微软飞行模拟》。

Image

「白天创造世界,晚上打游戏。一手是真实世界,一手是我想象的世界。」

Gorgon Halo 仍然是一台面向个人的紧凑型电脑。演讲接近尾声时,Jack 把「个人 AI」推到了另一种尺寸。

首次亮相的 Threadripper Halo Station,把 96 核 Threadripper PRO 和数据中心级 AMD Instinct MI350P 放进一台桌边工作站。

现场展示机装有两张 MI350P,并预留了扩展到四张的空间;系统内存最高 2TB,四卡配置下的 HBM3E 总容量最高 576GB,整机采用液冷。

Image

AMD 称,它可以运行超过 1 万亿参数的模型,并称其为「全球最强工作站」

这台机器把 AMD 所说的个人 AI 从一台 PC 扩到了办公室里的共享节点。一名开发者可以直接使用,团队也可以共同调用;个人电脑容纳不了的任务,也未必需要立刻回到按 token 计费的公有云。

本地 AI 的生态拼图

硬件能把模型装进去,不代表 Agent 已经能在电脑上安全工作。

它还要跨应用、服务和文件执行操作,操作系统必须易用,如果算力很强,但都是 Linux 系统的 Ubuntun,用户上手也非常困难。此外,软件上还必须管住它能看什么、能改什么,以及什么时候需要用户授权。

微软 Windows 与设备业务执行副总裁 Pavan Davuluri 在台上介绍,Windows 正在为统一内存访问和工作负载调度做适配,让大模型能够使用 Gorgon Halo 的内存与 GPU。

微软此前公布的 Microsoft Execution Containers,则试图为 Agent 提供隔离的执行环境,保护用户、数据和设备;目前这项能力仍处于早期预览。

Image

微软还公布了 Project Zenith,一套面向开发者级硬件的开箱即用 Windows 体验。它要求设备至少拥有 64GB 统一内存,预装 VS Code、WSL、GitHub Copilot CLI、PowerShell 和一组开发者设置,并将率先随 Ryzen AI Halo 设备提供。

他还现场演示了阿里 1250 亿参数的新模型 Qwen3.8-Flash-Next 跑在 Gorgon Halo 上的效果。从「帮我写个函数」这种小任务,到对敏感文件做本地取证分析,再到一句话生成一个设计师作品集网站,全程本地完成。

Pavan 给这个愿景起了个名字:PC 将成为「unmetered intelligence」的家——不计量的智能

Image

从能运行 24B 模型基于Gorgon Point的普通AI PC,到 192GB 统一内存的 Gorgon Halo,再到瞄准 1T+ 模型的 Threadripper Halo Station,AMD 已经把 Personal AI 的硬件层级摆上台。

这套路线能否成为新的换机理由,除了要看设备的稳定性,更多的可能还是开源模型的能力。

这些开源模型,似乎正在成为全球 PC 复兴叙事的「弹药供应商」,硬件公司需要它们来证明本地算力,是有价值的;开源模型也借着这些新的硬件,把影响力带到了全世界的桌面。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。

张子豪
张子豪
文章: 133