MLog
返回文章列表
产品动态#AI智能体#开源#Kimi K3#大模型

Kimi K3 发布:2.8万亿参数开源模型,正面挑战 GPT 与 Claude

发布于: 2026年7月18日阅读时长: 6 min

7月17日,月之暗面发布 Kimi K3——全球首个开源 3T 级大模型。2.8万亿参数、KDA 注意力机制、100万上下文,在多项编程与智能体基准测试中与闭源模型展开正面竞争。

2026 年 7 月 17 日凌晨,月之暗面(Moonshot AI)发布了新一代旗舰大模型 Kimi K3。2.8 万亿参数、100 万 Token 上下文窗口、原生视觉理解——这款全球首个开源 3T 级别的模型,直接把开源阵营的技术门槛抬到了与 GPT-5.6 Sol 和 Claude Fable 5 正面较量的高度。

马斯克在评论区留下了 "Impressive",而 Arena AI 的 Frontend Code Arena 榜单上,Kimi K3 以 1679 分登顶第一。

不止是参数大

Kimi K3 的 2.8 万亿参数当然引人注目——这是过去 12 个月中,Kimi 模型第 9 次刷新开源模型的参数上限。但更值得关注的是架构层面的创新。

K3 基于两项核心技术构建:

  • Kimi Delta Attention (KDA):一种混合线性注意力机制,在序列长度维度上优化信息流动
  • Attention Residuals (AttnRes):注意力残差技术,在模型深度维度上有选择地检索表示而非均匀累积

MoE 层面,K3 在 896 个专家中激活 16 个,配合 Stable LatentMoE 框架实现稳定路由。月之暗面官方表示,相比前代 K2,这些结构性改进带来了约 2.5 倍的扩展效率提升——让算力更有效地转化为智能。

训练方面,K3 从 SFT 阶段即采用量化感知训练,使用 MXFP4 权重 + MXFP8 激活,兼顾精度与硬件兼容性。

编程:长周期任务的新标杆

编程是 Kimi K3 最亮眼的能力面。

基准测试 Kimi K3 Claude Fable 5 GPT-5.6 Sol
Terminal Bench 2.1 88.3 84.6 88.8
SWE Marathon(长会话) 42.0 35.0 39.0
Program Bench 77.8 76.8 77.6
DeepSWE 67.5 70.0 73.0
FrontierSWE 81.2 86.6 71.3

在衡量超长程软件工程的 SWE Marathon 中,K3 以 42.0 分位列第一;在终端操作能力基准 Terminal Bench 2.1 上以 88.3 分超过 Fable 5。真实代码仓库修复任务(DeepSWE、FrontierSWE)上仍略逊于闭源头部,但差距已经很小。

更令人印象深刻的是实战案例:

  • 芯片设计:K3 在 48 小时自主运行中,使用开源 EDA 工具在 Nangate 45nm 工艺上完成了一款芯片的构建、优化与验证
  • GPU 编译器:从零构建了 MiniTriton——一个紧凑的 Triton 风格编译器,包含自研 tile 级 IR、优化 pass 和 PTX 代码生成管线
  • 科研复现:约 2 小时内完成了通常需要研究员 1-2 周的计算天体物理研究复现,交叉验证 20+ 篇论文,生成 3000+ 行 Python 代码

智能体:懂搜索、能操作、会剪辑

在智能体相关基准上,K3 同样表现抢眼:

基准测试 Kimi K3 Claude Fable 5 GPT-5.6 Sol
BrowseComp(长上下文检索) 91.2 88.0 90.4
Automation Bench 30.8 29.1 29.7
SpreadsheetBench 2 34.8 33.4 33.7

多模态方面,K3 展示了"视觉闭环"能力——在游戏开发和前端设计中,模型可以在代码与截图之间无缝迭代,实时查看并优化输出。一段 36 秒的官方宣传视频,由 K3 从 56 段原始素材中自主完成选片、动作匹配剪辑、逐帧卡点和多轮修改。

开源与可用性

K3 模型权重将于 2026 年 7 月 27 日 正式发布。目前可通过以下渠道使用:

  • Kimi.com、Kimi App(iOS/Android/鸿蒙)
  • Kimi Work 桌面端(Windows / Apple Silicon Mac)
  • Kimi Code 终端工具
  • Kimi API 平台

API 定价为:缓存命中输入 $0.30/MTok,缓存未命中输入 $3.00/MTok,输出 $15.00/MTok。基于 Mooncake 分离式推理架构,官方 API 在编程场景下缓存命中率超过 90%。

局限与展望

官方坦诚列出了 K3 的不足:对思考历史敏感(中途切换模型会导致质量不稳定)、在边界模糊时可能替用户做过多决策、整体体验与 Fable 5 和 GPT-5.6 Sol 仍有可感知差距。

但无论如何,Kimi K3 标志着中国开源大模型在追赶美国闭源模型的路上迈出了实质性一步。Anthropic CEO 曾判断 6-12 个月内会出现与 Fable 5 同等能力的开源模型——K3 的到来比这个预判更早,也更猛。