这几天,整个 AI 圈几乎都被 Kimi K3 刷屏了。有人认为,它是第一款真正有能力挑战 Claude Fable 5 的开源大模型;也有人认为,它将成为今年最重要的开源 AI 项目之一。那么,Kimi K3 为什么会在短时间内引发如此高的关注?

我认为原因主要有三个:
第一,它的整体能力确实足够强。
第二,它的 API 成本非常低,对于开发者和企业来说更具吸引力。
第三,也是最重要的一点,它选择了 100% 开源,官方已经宣布公开模型权重,这意味着未来无论是本地部署、Agent 开发还是企业私有化部署,都将拥有更大的发展空间。
Benchmark 成绩表现亮眼
在正式测试之前,我们先来看一下 Kimi K3 的 Benchmark 成绩。
在 DeepSWE 排行榜中,Kimi K3 首次亮相便进入前三,同时也是目前成绩最高的开源模型之一。

另外,在 LiveBench 排名中,Kimi K3 同样表现十分亮眼。
相比很多传统 Benchmark,LiveBench 每个月都会更新测试题目,目的就是避免模型通过记忆题目获得高分,因此能够更加真实地反映模型在数学、推理、代码生成、数据分析以及指令遵循等多个维度上的综合能力。不少研究人员认为,LiveBench 更接近真实使用场景。

当然,Benchmark 永远只能作为参考。
真正决定一个模型是否优秀的,还是实际体验。

实测一:视觉理解能力
首先,我们进行了一个经典测试——数筷子。
这个测试曾经难倒过不少知名大模型,而 Kimi K3 在识别图片后,通过逐行分析,最终准确给出了图片中的筷子数量,成功完成挑战。
这说明 Kimi K3 在目标检测和视觉理解方面已经具备了相当不错的能力。

实测二:编程能力
接下来,我们通过 API 将 Kimi K3 接入 Claude Code,让它直接完成一个接近商业级的射击打靶游戏。
整个项目要求包括:
代码结构清晰
模块化设计
完整注释
第一人称控制
武器系统
射击判定
人体靶系统
音效
动画效果
项目采用 Three.js 开发,并按照多个阶段自动完成整个工程。模型不仅能够自动规划开发流程,还能自动创建项目结构、生成代码、构建武器系统以及完成最终部署。

最终生成的网页可以直接运行。
经过实际测试,射击系统、得分系统、枪械动画、音效以及瞄准镜等功能均可正常使用,整体完成度已经非常高。
HTML 与前端生成能力令人惊艳
除了游戏之外,Kimi K3 在 HTML 页面生成方面同样令人印象深刻。
例如,它能够高度还原 Windows XP 系统,不仅界面几乎做到 1:1 复刻,就连扫雷、QQ、QQ 空间、千千静听、hao123 等经典应用也能够正常运行。

大家可以自己去体验效果:https://windows-xp.kimi.site
随后,还有开发者利用 Kimi K3 构建了完整的 macOS 浏览器版本。
整个系统不仅拥有逼真的 UI,还支持窗口管理、动画、交互以及多个 Agent 协同工作,甚至能够调用摄像头、应用商店等功能,看起来几乎与真实系统无异。
与此同时,Windows 11 浏览器版本同样能够由 Kimi K3 自动生成,整体 UI 设计和交互体验已经达到非常高的水准

在线体验:https://macos27.kimi.page
当然用Kimi K3 手搓Windows 11 系统的网页版也不在话下,效果如下

在线体验:https://windowos.kimi.page
成本优势更加明显
除了模型能力之外,Kimi K3 最受开发者关注的还有它的成本。
例如,同样完成苹果官网克隆项目。
Kimi K3 的调用成本约为 0.44 美元,而 Claude Fable 5 的成本约为 0.94 美元,最终生成效果却非常接近。
对于每天调用几十万甚至上百万次 API 的企业而言,这种成本差距最终会带来十分可观的节省。

游戏生成能力持续进化
近年来,大模型在游戏开发领域的发展速度越来越快。
Kimi K3 已经能够直接生成 HALO 风格多人游戏,不需要传统游戏引擎,也无需完整开发团队,整个项目基本由 AI 自动完成。
除此之外,它还能生成开放世界场景,包括森林、雪山、村庄以及天气系统,整体 3D 视觉效果已经相当逼真。
还有开发者利用它完成四冲程发动机三维演示、三国题材游戏、应县木塔数字重建等多个大型项目,充分展现了模型在网页开发、三维建模以及文化数字化方面的巨大潜力。

Kimi K3 真正厉害的地方是什么?
体验完这些案例之后,我最大的感受其实只有一句话。
Kimi K3 最强的地方,并不是某一项 Benchmark 排名。
真正重要的是,它已经开始帮助开发者解决实际问题。
无论是网页开发、游戏制作、三维建模、动画设计还是 Agent 开发,它都已经具备非常成熟的能力,在很多任务中已经能够与 Claude Fable 5 正面竞争。
更关键的是,它选择了开源。
对于整个 AI 社区来说,这意味着未来会有越来越多开发者围绕它进行优化、微调和生态建设,它的发展速度也有望进一步加快。
越狱测试已经出现
对于很多关注 AI 安全测试的朋友来说,还有一个值得关注的消息。目前已经有开发者分享了 Kimi K3 的越狱测试和相关教程,感兴趣的朋友可以自行体验。不过在实际使用过程中,也建议遵守相关法律法规以及平台使用规范,合理使用模型能力。
具体越狱视频教程如下:
Kimi K3 已越狱 能写出好的名人内容 能编写恶意软件 能黑客攻击网站 / 游戏 我正在使用 Claude 代码来作为 harness,因为它容易在其中越狱,Kimi 代码不接受 agents.md 作为系统提示 故意隐藏完整代码和色情内容
总体来看,Kimi K3 的发布不仅带来了更强的模型能力,也进一步推动了开源大模型的发展。
它拥有优秀的代码能力、出色的网页生成效果、较低的 API 成本以及开放的生态策略,使其成为当前最值得关注的开源大模型之一。
如果后续社区生态持续完善,围绕 Kimi K3 的 Agent、企业应用、本地部署以及各种 AI 创新项目,都值得我们继续关注。
原创文章,作者:极客智库
,如若转载,请注明出处:https://www.jikezhiku.com/1046.html