把千亿模型装进笔记本,Windows 终于要反击 Mac 了

都想让 PC 成为 AI 的运行环境

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。

AI PC 这个概念喊了两年,终于有人把「本地跑大模型」从演示台搬进了背包。

联想在柏林 IFA 2026 期间的 Lenovo Innovation World 2026 上发布了一系列 AI 终端,手表、手机、平板、笔记本电脑、显示器等等。

其中最重要的产品,毫无疑问是联想联合英伟达推出的 Lenovo Yoga Pro 9n(国内型号:YOGA Pro 15 Spark),这是一台可以本地运行千亿参数大模型的量产笔记本。

Image

这款笔记本重 1.65 千克,最薄 16.7 毫米,最高配备 128GB 统一内存。而按照英伟达对 RTX Spark 的规格说明,这套配置已经可以在本地运行 1200 亿参数、最高支持 100 万 token 上下文的大语言模型。

以往我们讨论 AI PC 时,要不就是放在桌面上的专业主机,像是 DGX Spark 和 Mac Studio 等产品,要不就是能让我们为了一只龙虾抢疯的 Mac Mini。

一台笔记本要成为合格的 AI PC,似乎要不就是在硬件上堆到尽可能的极致,要有大内存,要有顶级显卡,然后尽可能保持电脑的尺寸和散热。

或者在软件上,曾经是能无痛安装 OpenClaw 也可以,以及能最大限度的支持各种 AI Agent 的使用,就像 AI 手机一样,AI 能操作的 APP 越多,这个设备就越 AI,电脑同样如此。

Image

但是当 AI PC 也开始走完一个完整的周期:概念走红、参数比拼、用户追问价值。我们也开始想知道,这些算力,到底能在我的电脑上做成什么?

应付实时翻译、会议降噪这类功能级任务或许绰绰有余,但完整的大模型推理,稍微复杂一点的 AI 工作流,仍然要回到云端处理。

本地大模型,更多时候站在演示台上,而不是我们的桌面上。

联想这次推出的 Yoga Pro 9n 换了一条路线,它选择深度接入了英伟达的端侧 AI 架构体系,搭载 NVIDIA RTX Spark 超级芯片,通过 NVLink-C2C 互联,将 20 核 NVIDIA Grace CPU 与 6144 个 CUDA 核心的 Blackwell RTX GPU 合为一体,提供 1 PFLOPS(FP4 精度)的 AI 性能。

Image

一台 Windows 笔记本电脑,也有了成为 Agent 主机的潜力。

统一内存成了 AI PC 的新趋势

传统 PC 中,CPU 内存与 GPU 显存相互独立,大模型参数在两者之间反复搬运,显存的容量往往直接决定能跑多大的模型

过去做高性能电脑,独显几乎是标配,但独显峰值算力再强,消费级产品的显存通常也就十几二十 GB,模型稍微大一点,就装不下了。

英伟达 RTX Spark 的统一内存架构则是让 CPU、GPU 共享同一个物理内存池,最高 128GB 对两者同时可用,模型权重、输入数据和中间结果只需保存一份;千亿参数级的大模型也得以在一台笔记本上本地运行。

Image

英伟达给出的参考值,是 1200 亿参数、100 万 token 上下文的大语言模型。

开发者可以沿用熟悉的 CUDA 技术栈,数据不必上传云端,项目文档、代码与素材都留在本地。平台还能在后台协调多个 AI 智能体,跨应用自动完成复杂的创作任务。

值得一提的是,联想 X Power 散热架构把 80W TDP 压进了最薄 16.7 毫米的机身,配 15.3 英寸 2.5K 165Hz PureSight Pro OLED 屏;基于 RTX 平台,Yoga 家族也获得了进阶的游戏能力。

开发 AI 应用、剪高分辨率视频、渲染 3D 场景,都可以在这一台机器上完成。

Image

Luca Rossi,联想集团执行副总裁兼智能设备业务集团(IDG)总裁

同平台的 Lenovo Yoga 9n 2-in-1,则把这份算力装进了一台 360 度翻转创作本:最高 64GB 统一内存,支持「屏幕 + 触控板」双表面手写。

Image

2 in 1 是联想的二合一型笔记本电脑

联想不是唯一押注统一内存的玩家。就在前不久,苹果刚刚更新的 Mac mini 和 Mac Studio,几乎也是把本地 AI 计算的性能上限再抬高一截。

Mac mini 提供 M6 和 M5 Pro 两种芯片,统一内存最高 64GB,并且支持通过 Thunderbolt 把多台机器组成集群。

Mac Studio 则提供 M5 Max 与 M5 Ultra,其中 M5 Ultra 版本最高支持 512GB 统一内存、每秒 1.2TB 带宽,按苹果的说法,足以承载数百亿乃至数千亿参数的模型。

Image

今年 6 月 WWDC26 的一场特别活动上,苹果还现场演示过这种集群的玩法:4 台 Mac Studio 通过 Thunderbolt 5 互联,用 LM Studio 基于 MLX Distributed 跑起了万亿参数规模的开放权重模型 Kimi K2.6。官方数据显示,4 机集群的推理性能最高可以达到单机的 3 倍。

苹果笔记本这边,128GB 统一内存的 MacBook Pro(M5 Max)也可以在本地运行 120B 参数的开源模型 gpt-oss-120b,有实测显示最高约 79 token/s,但前提是 4-bit 量化,且长上下文会明显挤占内存。

Image

把两家 PC 更新的方向放在一起,很明显能看到端侧 AI 的瓶颈已经从单纯的算力,转到了「模型装不装得下、数据搬不搬得动」的比拼。苹果用统一内存加 Thunderbolt 集群铺开了从笔记本到桌面的整条线。

联想和英伟达这次的意义,则是把同样的能力第一次带进 Windows + CUDA 生态,并用 FP4 精度和统一内存,把本地上下文的上限推高到了 100 万 token 这个数量级。

Windows,也开始争夺 Agent 主机

但在这场比拼里,还有一个容易被忽略的变化:Windows 入场了。当我们把这件事放到更大的生态竞争里看,Lenovo Yoga Pro 9n 的意义就不只是停留在「又一台很强的 AI PC」。

过去一段时间里,真正能稳定承载本地大模型、长上下文和多智能体工作流的设备,讨论度往往集中在 Mac 和 Linux 操作系统。

Image

Mac 靠统一内存和 MLX,一只「龙虾」就能让 Mac mini 卖断货;Linux 则是英伟达、工作站和开发者工具链的大本营。

像 DGX Spark 这样的个人 AI 超算,本身就是建立在 Linux 软件栈之上,大量 CUDA 开发和模型部署工具也首先围绕 Linux 成熟起来。

而 Windows 虽然一直是最广泛的个人电脑平台,却很少被视为本地大模型和 Agent 的主场。

现在,随着联想把 RTX Spark 这套能力装进量产笔记本,再把可扩展的小型超算节点带进商用场景,Windows 也开始拥有了承载千亿参数模型和本地 Agent 的现实基础。

Image

英伟达 RTX Spark 芯片介绍网页,多款 Windows 电脑搭载了该超级芯片

对于已经围绕 CUDA 开发 AI 应用的人来说,RTX Spark 背后有着 CUDA 多年积累的开发工具、软件库和开发者群体;既有的知识和开发经验可以继续沿用,这也让 Windows 在争夺个人 Agent 主机时,多了一份软件上的吸引力。

当 Mac 正在变成开发者和创作者的本地 AI 工作站时,Windows 也显然不想错过这块市场。

笔记本之外,一切都在为 Agent 服务

把算力和内存做大做匀之后,下一个问题是:这些能力为谁准备?联想的答案是 AI Agent。

当 AI 从「有问必答的助手」变成「能自己规划、持续干活的协作者」,它对设备的要求也变了:任务一跑就是几小时,上下文要长期留存,数据和权限都得留在本地。

联想的商用新品 ThinkCentre X Ultra(国内型号:ThinkCentre X Tiny)就是冲着这个需求来的。1.6 升的机身里,塞进了 AMD 锐龙 AI Max+ PRO 495 系列处理器和最高 128GB 统一内存。

Image

和 DGX Spark 仅支持 Linux 系统不同,这款超算盒子,联想提供了面向 Windows 和 Linux 的预配置 AI 工具与工作流

更有意思的是它的扩展方式,最多四台设备可以集群互联成一个统一计算平台,运行更大的模型、更长的上下文和多智能体工作流。

一个部门可以先从一台用起,业务增长、模型变大时再逐台叠加。从「一人一台电脑」到「AI 一台我一台」,办公桌正在变成最小的 AI 算力节点。

除了「千亿参数进笔记本」和这台对标英伟达 DGX Spark 个人超算之外,联想这次的阵容铺得很满,我们简单盘点了一下包括下面这些信息:

  • 两款概念机:Project Aeroblade 用与 Frore Systems 合作的 AirJet 固态主动散热取代风扇,在不足 10 毫米、不到 1000 克的机身里做到无风扇全性能;Project Swan 把卷轴屏带进商用本,合上是 14 英寸,展开是 17 英寸。

Image

  • 平板:Lenovo Yoga Tab Plus Gen 2 / Yoga Tab Gen 2(国内型号:拯救者 Y900 13 / Y900 11),主打笔优先交互,4K 144Hz 屏配 8192 级压感手写笔;Lenovo Smart Canvas Concept 演示了创作在一体机与平板之间跨设备接力。
  • 主流与家用:与潘通合作的七色 IdeaPad Vibe 系列;无中置主机设计的 IdeaCentre AIO i 一体机。

Image

  • 商用:ThinkBook 14 Gen 9(骁龙 X2 Plus,80 TOPS,至高 26 小时视频续航)、12.9 毫米 990 克的 ThinkBook 14x Gen 2、ThinkCentre M75 系列,以及四款 ThinkVision 显示器,其中包括全球首款获微软认证的雷电 VoIP 显示器 P34WD-4v。
  • 摩托罗拉:首款内置 Motorola Qira 的智能手表 moto watch ultra;搭载摩托罗拉史上最高 2 亿像素主摄的 edge 70 plus;镶了 35 颗施华洛世奇水晶的 razr 特别版。
  • 个人 AI:Lenovo \& Motorola Qira 支持门槛只需要 16GB 内存 PC,随 Android 17 覆盖更多手机平板,并借 Workato 打通邮件与日历;国内的天禧个人智能体升级到 4.3,支持全双工自然语音对话。

Image

从买电脑,到买算力

过去两年,Windows 和 Mac 走出了两条截然不同的 AI PC 路线。

Windows 最早最积极地喊着 AI PC,早早就把 AI 变成操作系统的一部分:NPU、Copilot+ PC、实时翻译、Recall,以及越来越多的系统级 AI API。

但真正说到本地跑大模型、搭 AI 工作流,Mac 则凭借统一内存和 MLX,意外成为了开发者最喜欢的本地大模型工作站之一。

Image

前者解决的是「怎么让 PC 多一些 AI 功能」,后者解决的是「怎么让大模型真正跑在 PC 上」。

而 RTX Spark 这样的设备出现之后,Windows 和 macOS 的两条路线开始汇合。

Windows PC 也开始拥有百 GB 级统一内存、千亿参数模型和 CUDA,本地 AI 不再只是系统里的一个功能,而可以成为整台电脑长期运行的工作负载。

模型厂商会更有动力为端侧做蒸馏和量化,开发者也可以基于 CUDA 或 MLX 生态做本地优先的应用,而隐私、延迟和订阅成本这三座大山,或许也开始有了绕开的可能。

Image

顺着这条路往下想,手机、平板、手表未必没有机会跑本地大模型。其实这次联想把 Qira 的支持门槛已经下探到 16GB 内存的 PC,宣布随 Android 17 覆盖更多摩托罗拉手机和平板,甚至让它登上了 moto watch ultra 这块手表。

不过眼下在手腕的端侧模型,还只是一个「调取跨设备记忆」的助手,但内存容量和带宽的爬坡曲线一旦延伸到移动端,端侧模型从笔记本向更小设备扩散,就只是时间问题。

Image

下一场 AI PC 的竞争,开始拥有一条更容易理解的衡量标准:

一台电脑有多 AI,不再只看它有多少 AI 功能,还要看有多少原本必须交给云端的工作,现在可以留在你的电脑里完成。

过去这个位置更多属于 Mac 和 Linux,现在 Windows 设备也开始带着统一内存、CUDA 和千亿模型能力加入争夺。

到那时,无论 Windows 还是 macOS,我们买的都将会是一台真正属于自己的 Agent 主机。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。

张子豪
张子豪
文章: 133