争议的核心在于K3是否通过“蒸馏”技术复制了海外先进模型的能力。所谓模型蒸馏,是指利用大型教师模型的输出来训练较小规模的学生模型,使其具备接近教师模型的性能。这一技术在AI领域虽属常见,但若未经授权大规模使用商业模型进行训练,则可能涉及知识产权和公平竞争问题。此前,Anthropic曾公开指控部分中国AI企业通过交互方式获取其Claude模型能力,引发行业对“工业规模蒸馏攻击”的担忧。
面对质疑,月之暗面Kimi企业业务负责人黄震昕首次公开回应。他强调,K3的性能突破源于底层架构的原创性创新,而非对现有模型的复刻。据南方都市报报道,黄震昕详细介绍了三大自研技术:首先是Moon Clip优化器,这是Kimi首次在大模型训练中应用的二阶优化技术;其次是Kimi Linear Tension线性注意力机制,该机制将上下文窗口扩大十倍的同时,仅使训练成本同步增加十倍,契合“AI可执行任务时长每7个月翻一倍”的行业规律;第三是Attention Residuals技术,这项曾获马斯克公开称赞的创新显著提升了模型效率。
在商业运营方面,Kimi团队也面临挑战。7月19日,该模型发布致歉信,宣布因用户请求量远超预期,为保障现有订阅用户的体验,将暂停接受C端新用户订阅。黄震昕解释称,这一决定是权衡利弊后的选择:“我们宁愿暂时放弃新增收入,也要守住付费客户的使用体验底线。”针对定价争议,他表示开源模型不应被贴上低价标签,Kimi作为达到SOTA(State-of-the-Art)水平的模型,其定价反映了技术价值。
黄震昕还重申了Kimi坚持开源路线的承诺。他表示,团队将继续公开核心底层技术和研究论文,保持对行业的开放态度,这一战略未来不会改变。此次争议不仅凸显了中国AI模型在全球竞争中的崛起,也反映了技术自主创新与行业规范之间的复杂关系。随着K3的发布,月之暗面能否在性能突破与商业可持续性之间找到平衡,将成为行业观察的重要案例。