那些想用但不让用 AI 的公司,终于可以用 AI 了

把飘在云端的大模型拉回地面,装进权限严格的本地算力盒子里。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。

昨天晚上,ChatGPT、Claude、Grok 等主流 AI 产品和后端模型 API 服务突发宕机。大量个人和企业用户反馈无法登录、服务不能正常使用,坊间猜测根源为 AWS 等云服务商基础设施大规模故障。

这是很多急于实现「AI 转型」的传统企业都在面临的尴尬处境。大模型和 Agent 火了,所有人都在畅想着 AI 能给自己带来多大的帮助;API 充了值,Agent 真的部署起来了,却越来越头疼。

头疼的有好几层:

第一层是越好的模型自然越受欢迎,用的人越多也越不稳定。当复杂业务流程运行在一个云端 API 驱动的智能体上,网络波动或云端限流会导致任务中断,难以找回,一切恐怕得推倒重来,这对于追求稳健的生产环境来说,是不可接受的;

第二层是老板们鼓励团队多用 AI,真用多了又心疼钱烧的太快,更何况仅仅在「搭建」一个达到要求的 Agent 的阶段,就已经发生了巨量的 token 消耗,结果都还没有看到;

第三层凸显于医药、金融、工业制造等特定的行业,隐私、安全、合规要求使得他们无法使用「常规 AI」,包括在线的 AI 模型对话/agent 产品以及云端 API。

解痛的方法,只有本地 AI。

近日,来自北京大学的元空智能与惠普一起,将开源大模型和 Agent 框架,以及面向常规办公、金融、科研等不同场景的专有知识,全部塞进了本地设备。

这是模型、框架和算力的整合,其中前两者由元空 AI 提供:

多款 Boxer 开源模型,包括稠密和稀疏激活版本作为中间的模型层;上层是两款平行的 Agent 产品「元空 AI Work」和「元空 AI Science」。

底层算力由惠普提供,根据场景不同,可以是常规形态的笔记本电脑,或者英伟达 GB10 架构的桌上计算盒子,以及传统的塔式工作站。惠普将向企业用户直接销售这些预装打包好的设备,以及配套的 FDE(前线部署工程师)服务。

这是一套面向企业市场的成套解决方案。它对于典型的普通 AI 用户来说没有意义,不仅一次性费用远比常规 AI 订阅更贵,也并没有那么方便——

但对于那些因为数据安全合规方面要求极高,而长期以来不能用、不敢用 AI 的特种行业,所有的所谓劣势都反过来成了优势:一次性的前置费用让成本有了极大的确定性,后续的所有 token 均在本地产生;安全的本地沙箱环境的确带来了使用门槛,但能够让特种行业在合规前提下充分利用强大模型和 Agent 框架,为工作提质增效。

曾经因为云端 AI 的流行而边缘化的「本地 AI」,已经离少数极客的玩票越来越远,也不再是退而求其次的技术妥协。对于许多低调但价值巨大的行业来说,本地 AI 推理一直是唯一的可行路径,而今天他们终于有了一个堪用的选项。

「倒贴钱」的算力账本

中国惠普有限公司副总裁周信宏发现,许多专有知识与技能(统称为 know-how)密集型的企业,在过去使用云端 AI 的时候面临一种隐含的双重代价:

第一重代价是看得见的 token 消费所对应的成本;第二重则是自己的 know-how、商业洞察,在交互过程中也许有被大模型「反向蒸馏」的潜在风险。

这种焦虑在特定行业的放大效果是极强的,比如投行和律所,对于数据合规的敏感度极高,公司往往会明令禁止将敏感的审计底稿和法务材料上传至公有云,包括使用公开的、非企业统一管理的 AI 产品来处理这些资料。

数据主权和算力成本的双重夹击下,原本习惯了按需租用 API 服务的企业,态度正在发生明显转变。

中国惠普有限公司副总裁、大中华区个人信息产品事业部总经理周信宏

元空 AI 与惠普共同推出的这项面向企业用户的本地推理解决方案,其卖点在于用一次性的资本支出 (CAPEX) 来替代云端订阅费用(本质上是运营成本 OPEX)。硬件买回来之后,后续的本地推理除了电费之外边际成本几乎为零。

如果我们用一个百人规模、使用海外旗舰闭源模型 API 的小团队举例,其一个月的云端 API 开销可能在数十万元左右,一年在百万元量级。但如果根据需求采购本地算力设备,例如惠普的 ZGX Nano AI 工作站(基于英伟达 GB10 方案),跑上一两个月所节省掉的 API 费用可能就已经抵消了前期一次性的设备采购成本。

元空 AI 创始人兼 CEO 逄大嵬告诉 APPSO:「组织是永远在算账的。如果多掏一点设备钱就能把活干完,还能守住所有的核心机密,企业自然会做出理性的选择。」

中尺寸模型进入干活的「甜区」

在发布会现场的演示环节,元空智能联合创始人宁鲲鹏博士直接做了一个颇有挑衅意味的动作:他在 HP ZGX Nano 上关掉了 Wi-Fi,完全断网

在 Linux 环境下,元空 AI Work 调用 Boxer 本地模型在短短几分钟内,自动调取底层的脚本工具,逐张扫描了本地文件夹里的 53 张发票,不仅完成了格式解析与分类归档,还直接在本地生成了一张结构完整的 Excel 报表,精准统计出每一个维度的支出

随后,在另一台微型工作站上,又在离线状态下穿透了一份多达数千个条目的银行流水单,精准抓出了短时间内资金快进快出的洗钱异常特征

以往许多人对端侧 AI 的印象,还停留在手机厂商塞进去的 1B、3B 小模型,日常用来修图或者润色文案。但如今的情况已经大不一样。

「3B 以下的模型只能用来做 Chatbot,写写诗或者陪人聊天,根本干不了长链路的严肃任务。」逄大嵬给出了相当明确的技术分水岭判断:参数量过小的模型,理解上下文和工具调用的能力极其有限,无法胜任复杂的企业工序;而千亿参数量以上的超大模型,日常部署又过于笨重和昂贵

元空团队正在布局的是 20B 到 100B 参数量的中等尺度模型,他们认为这个尺度才是当前真正能干活的生产力甜区。

依托现在的后训练技术,像他们发布的 27B 稠密模型和 35B-A3B 稀疏模型,其智能密度已经能够追平一年前甚至一年半之前的顶尖云端模型。

在针对高并发与硬件架构进行算子优化后,这种体量的模型运行在十多 GB 的经典笔电到上百 GB 内存的桌面算力盒子和塔式工作站上流畅运行,预填充 token 速度达到数百 tok/s,解码速率达到数十 tok/s,延迟达到了 100ms 甚至 50ms 以下。

单有模型只是有了一个脑子,如果缺乏手脚,它依旧什么都做不了。这次发布的元空 AI Work 智能体,核心在于它自带一套 harness 体系和「长期记忆」(Memory)机制

元空智能联合创始人姚佳雨博士介绍,这套系统并不是简单地保存对话历史,而是像版本控制系统一样,将每一次执行动作的轨迹结构化为资产

如果长程任务在中途发生中断,模型可以随时从检查点无损恢复。即便断网运行 24 小时,它依然记得用户昨天的偏好与前天未跑完的数据结构

内存浩劫下的新思路

如果端侧 AI 的门槛是每位员工都必须配一台顶配的新电脑,这件事情在现实中依然难以推行

存储芯片和高性能显卡的价格过去几年已然居高不下,今年更是迎来所谓的「RAMmageddon」(内存浩劫),存储产品涨价远超理性。

这意味着绝大部分企业的 IT 预算根本无法支撑全员换机。更何况,许多办公室里服役的还是几年前采购的传统轻薄本,没有海量内存,连稍大一点的本地模型都无法载入

惠普和元空给出的工程解法显得非常务实:他们展示了由两台 ZGX Nano 盒子堆叠组成的部门级微型算力服务器:一台盒子可以稳定带动四到五台普通笔记本,两台堆叠就能在局域网内给八到十个人的小团队提供专属的模型算力支持

员工依然可以在自己那台连大模型都装不下的老电脑上办公,但所有的推理负载、敏感数据库读取和文档重构,都在工位旁边的物理盒子里实时消化完毕——前面提到的所有本地优势,包括数据不出域、无边际成本的 token 供应,仍然适用。

对于硬件厂商惠普来说,这次与元空的合作也是战略聚焦的体现

周信宏在群访中谈到了 PC 行业的真实分化:700 美元以下的廉价电脑市场确实承受着巨大的出货压力,利润空间被严重压缩;但在 700 美元以上、具备严肃算力的高单价设备领域,惠普看到了两位数的营收正增长

企业用户不是不愿意掏钱,而是不再愿意为缺乏生产力工具属性的纯硬件买单。

AI 拓客的下半场,不在 AI,在设备上

一种新的共识在行业形成:模型卷到头了。

从预训练的维度,更准确的说法是互联网上公开的文本数据已经被大模型吃得差不多了。

AI 发展的这几年,我们看过太多震撼眼球的发布,每一家模型巨头都在承诺一个全知全能的超级大脑,但现在无论它们发布怎样的新模型,大家似乎都很难再感受到那种「核弹爆炸」「瘫坐在地」式的震撼。传统预训练上的 scaling law 边际回报已然急速递减。

元空 AI 认为,真正的增量空间发生在后训练和强化学习阶段,而具体场景则需要落地到物理设备——包括但不限于 AIPC、手机、千行百业的 IoT 设备甚至非智能设备。

元空这次发布的另一个重头产品是元空 AI Science。脱胎于北大科学智能学院的他们,把大模型直接接入了真实的生命科学实验平台

在传统的科研流程中,从查阅文献、分子推演,再到实验室里真实的试剂配比、摇晃试管,干实验与湿实验之间往往隔着巨大的鸿沟

为此,元空正在开发一个旨在统一所有非标准接口「笨设备」的抽象协议层,让 AI 既能阅读文献、预测蛋白质结构,又能直接调度机械臂去进行样本存取与细胞培养,并根据检测仪器回传的真实物理指标来修正下一步动作。

「模型在真实操作中留下的交互轨迹,才是未来最稀缺的数据。」

药企的研发配方、工厂产线的声学异响检测、甚至实验台上的高温酶重组,这些信息永远不可能被公开上传到外网。只有当模型深深驻扎在端侧设备里,与真实的物理环境产生闭环,它才具备自我迭代和进化的可能

这两年大家听了太多关于 AI 的宏大设想,似乎只要用上最新的大模型,任何问题都能迎刃而解

但真正要在日常业务里用起来,多数团队最在意的无非就是:把活干完,确保数据安全,以及账单别太贵

元空和惠普这次做的尝试,其实就是把飘在云端的大模型拉回地面,装进权限严格的本地算力盒子里

这种做法可能听上去没有云端模型那么耀眼,但对于那些精打细算、在意安全的企业来说,这反而是眼下最稳妥、也最容易拿到结果的选择

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。