Kimi K3:中国开源大模型冲进 3T 时代
月之暗面发布全球首个开源 3T 级大模型 Kimi K3,2.8 万亿参数、百万 token 上下文、编程能力全球第一,7 月 27 日前完整开放权重。
2026 年 7 月 16 日,WAIC 2026 开幕前夕,月之暗面悄无声息地往开源社区扔了一颗核弹——Kimi K3。
2.8 万亿参数,全球首个开源的 3T 级大模型。这不是什么"小步快跑"的迭代,而是一次直接拉满的规格跃迁。
参数即正义
先说最直观的数字:2.8 万亿参数。
这不是噱头。参数规模直接决定了模型的知识容量和推理上限。月之暗面自己打了个比方——参数就像人脑里的神经连接,近 3 万亿参数意味着这个模型能把更多知识和规律装进"脑子",懂得更多、想得更深、答得更准。
而真正关键的是:它是开源的。在此之前,这个量级的模型全部是闭源的。Claude Fable 5、GPT-5.6 Sol 这些顶级模型你只能通过 API 调用,看不到权重,更谈不上自己部署和微调。Kimi K3 计划在 7 月 27 日前完整开放权重,这意味着任何人都可以在自己的硬件上跑一个全球顶级的基座模型。
能力到底怎么样
Kimi K3 原生支持视觉理解,上下文窗口拉到 100 万 token,差不多能一口气吞下整套《三体》三部曲。面向的场景也很有针对性:软件工程、知识工作、深度研究、多模态理解。
在编程领域,Kimi K3 在公认的排行榜上已经冲到全球第一。这是中国开源模型第一次在编程这个硬核赛道上登顶。
当然,月之暗面也很坦诚——K3 的综合智能水平仍然落后于 Claude Fable 5 和 GPT-5.6 Sol。差距存在,但他们选择在开源这条路上死磕,用社区的集体智慧来加速追赶。
技术架构的取舍
K3 用了一套自研的注意力机制——KDA(Kimi Delta Attention),配合注意力残差结构。这本质上是一套"混合线性注意力"方案,在长上下文场景下比传统 Transformer 的复杂度优势明显。
不做技术细节展开,但有一点值得关注:这是月之暗面从模型架构到底层训练方法全链路自研的成果。中国 AI 公司正在从"调参侠"的角色里走出来,开始在基础架构上做真正的原创贡献。
怎么用
发布当天就全渠道开放了:
- kimi.com 网页端
- Kimi App(iOS / Android)
- Kimi Work 桌面客户端
- Kimi Code 编程专用工具
- Kimi API 开发者接口
普通用户可以直接用网页或 App 体验,开发者可以通过 API 接入,等 7 月 27 日权重开放后还可以本地部署。
开源的格局
这件事的意义不止于一个模型。
2026 年的 AI 竞赛正在从"谁家模型更强"转向"谁家生态更厚"。闭源模型靠 API 收费,开源模型靠生态繁荣。Kimi K3 选择开源,是把筹码押在了后者。
WAIC 2026 上另一个值得注意的信号是"众智 FlagOS"开放计算技术栈的成型,PyTorch、HuggingFace、Eclipse 基金会等都在参与推动。全球 AI 开源力量正在形成合力,K3 的发布恰逢其时。
回头看,从 DeepSeek 到 Qwen,再到现在的 Kimi K3,中国开源大模型正在从"单点亮相"走向"群体突破"。这不是某个公司的事,是一整条产业链在往前推。
K3 到底好不好用,等权重开放、社区跑完一轮评测就知道了。但至少现在,开源这条路上又多了一个愿意下重注的玩家。