MLog
返回文章列表
Tech#AI基础设施#端侧AI#模型压缩#开源模型

PrismML 把 270 亿参数塞进 iPhone:端侧 AI 的「压缩革命」

发布于: 2026年7月22日阅读时长: 8 min

加州理工分拆的初创公司 PrismML 用全新压缩技术,将阿里 Qwen 3.6 的 270 亿参数模型从 54GB 压缩至 4GB 以内,成功在 iPhone 17 Pro 本地运行。苹果已展开接触,端侧 AI 的算力账本可能被重新书写。

54GB 变 4GB,不是魔术是数学

2026 年 7 月 9 日,一家从加州理工学院走出来的初创公司 PrismML 扔出了一枚炸弹:他们把阿里巴巴开源的 Qwen 3.6 模型——完整 270 亿参数的稠密版本——从原本 54GB 的体积,压缩到了不到 4GB。

这意味着什么?一个原本需要在数据中心多块 GPU 上协同运行的庞然大物,现在可以塞进 iPhone 15 及更新机型的 8GB 内存里。而且它不是只激活一小部分参数来「装样子」——所有 270 亿个参数同时保持活跃,全部参与推理计算。

压缩后的性能指标同样惊人:内存占用降低 10 到 15 倍,推理速度提升 6 到 8 倍,运行能耗降低 3 到 6 倍。

不是「缩印」,是「重写目录」

要理解这项技术为什么让行业震动,得先搞清楚它和传统方案的本质区别。

主流的模型压缩手段是量化——把 16 位精度的权重降到 8 位甚至 4 位,本质上是在「缩印一本厚书」,字变小了,但每页内容还在。代价很直接:精度损失,性能下降。

PrismML 走的是另一条路。CEO 巴巴克·哈西比(Babak Hassibi)——这位加州理工的电气工程教授——在采访中解释,他们的技术重构了模型内部信息的存储方式:将原本可以取数以万计可能值的 16 位权重,压缩映射到只有 1 到 3 个离散的取值空间。

打个比方:传统量化是「缩印一本厚书」,PrismML 的做法更像是「把整本书提炼成一份目录」——只保留最核心的结构信息,大幅砍掉冗余。哈西比声称,这种方案在保持接近 FP16 模型精度的同时,不会出现传统量化那种「断崖式」性能下降。

核心技术专利由加州理工学院持有,并独家授权给 PrismML。今年 3 月,公司完成了由 Khosla Ventures 领投的 1625 万美元种子轮融资。领投人维诺德·科斯拉(Vinod Khosla)——就是那个在 2018 年押注 OpenAI 的人——将这项技术称为「AI 领域继 OpenAI 之后的标志性新方向」。

苹果的端侧困局,等来关键拼图

这件事之所以迅速和苹果扯上关系,是因为苹果一直坚持「设备端优先」的 AI 路线,但现实很骨感。

苹果现有端侧模型 AFM 3 Core Advanced 名义上有 200 亿参数,但采用稀疏架构——实际每次只有 10 亿到 40 亿参数处于激活状态。苹果自己也尝试过把更大的模型压缩进 iPhone,却遭遇了严重的性能下滑。

今年 6 月发布的新版 Siri,最复杂的功能仍然需要依赖谷歌云的算力支持。这与苹果主打隐私、强调本地处理的叙事存在明显落差。

PrismML 的技术恰好切中这个痛点:270 亿参数全量激活,不需要联网。7 月 14 日,哈西比向 CNBC 确认,苹果及其他公司正在评估其技术,双方洽谈处于「非常早期的阶段,但进展顺利」。行业分析师推测,潜在合作方向包括技术授权甚至直接收购。

代价与质疑

压缩不是没有代价。

哈西比坦诚,压缩后模型整体性能会下降数个百分点。其中推理、数学、编程能力受影响较小,但事实性长程记忆的衰减会相对更早出现。更关键的是功耗——一个强大到能频繁执行智能体任务的模型,即便内存占用低,持续运行也可能对手机电量造成显著消耗。

目前 PrismML 的声明尚缺少独立第三方验证数据,已公开验证的压缩案例也仅限于 Qwen 3.6 270B 这一款模型(下一个目标是谷歌 Gemma 系列)。

行业内的分歧同样尖锐。以 Argmax 为代表的「混合架构」派公开质疑:云端大模型保持着每周级别的迭代速度,纯本地端运行的压缩模型如何跟进最新性能红利?

哈西比的回应透露出他对未来的判断:「三年后,你所需要的 95% 的智能服务都能在本地获取——手机、笔记本电脑、家电上,真正需要去云端的,可能只剩最后 5% 的高端需求。」

算力账本的重写

PrismML 这件事的真正意义,或许不在于它当下的性能有多强,而在于它打破了「端侧只能跑小模型」的行业共识。

如果全量 270 亿参数能在手机上跑通的逻辑被验证——甚至未来万亿参数模型也能被压缩到端侧运行——那么 AI 基础设施的算力账本,可能要被重新计算。

不只是降低云端依赖、节省推理成本,更意味着那些对隐私极度敏感的场景(健康数据、个人财务、实时对话)终于有了本地化处理的可能。

与此同时,国内端侧 AI 也在加速落地。2026 年 7 月 15 日,国家网信办公布了 7 款手机端侧生成式 AI 服务备案,涵盖 Apple 智能、华为小艺 AI、OPPO AndesGPT、vivo 蓝心端侧大模型、小米澎湃 AI、三星盖乐世 AI 及努比亚豆包手机大模型。端侧 AI,正在从实验室的 Demo 走向每个人的口袋。

正如 Counterpoint Research 研究总监 Tarun Pathak 所言,最终考验将是「数百万次查询、数千种设备组合以及大规模稳健测试」。技术已经跨过了实验室的门槛,但能不能从演示视频走进用户的日常,还要看接下来的每一轮谈判和每一次实测。