作者:互联网 时间: 2026-07-21 18:01:05
AI模型Kimi K3与GPT-5.6 Sol在3D游戏开发上正面交锋,用童年经典游戏复刻实测能力高下。核心内容:1. 两大模型在5款经典游戏复刻中的具体表现对比2. 通过复杂3D游戏开发场景揭示模型真实工程能力3. Kimi K3独立完成全栈后端项目的额外测试结果
Datawhale干货
作者:筱可,Datawhale成员

上周,AI 圈迎来了一位新的硬核开源玩家,Kimi K3,发布就登顶 Frontend Code Arena 榜第一。我们 Datawhale 第一时间对模型进行了与另外一个顶级模型的横向对比测试。我们一直在想:怎么才能让所有的读者也直观感受到两个模型的差异?最后想到一个办法,让它们复刻我们小时候玩的游戏。

Kimi K3 是 Moonshot 最新开源的大参数模型,规模到了 2.8 万亿级。官方原文说它的整体表现仍落后于 Claude Fable 5 和 GPT-5.6 Sol 这些最强闭源模型。这次只选 GPT-5.6 Sol 做横向对照,没测 Claude Fable 5:一是太贵,二是我们的号被封了,没法稳定复测。我们这次主要考察它在 3D 游戏开发上的水平。很多模型写普通前端已经不错了,但 3D 游戏涉及渲染、碰撞、状态管理、实时交互,是更难的场景,也更容易看出能力边界。
于是我们让它做了 5 款童年经典游戏,和 GPT-5.6 Sol 用同样的提示词做对照。录了视频、核了代码、比了成品感,最后发现:有的游戏能直接玩,有的已经接近成品,有的还差一截。

判断模型代码能力,常见的做法是让它生成单文件前端页面。这种方式成本低,但看不出复杂工程里的真实水平。
3D 游戏开发是更好的试金石:它涉及渲染、碰撞、状态管理、实时交互,模型不只要写代码,还要根据页面视觉反馈反复调试。于是我们让两个模型用完全相同的提示词和视觉约束,各自复刻 5 款童年经典游戏,比谁更能跑出可玩的成品。
但游戏只能比"谁更强",回答不了"K3 自己能不能独立交付真实工程"。所以我们额外给 K3 加了一个非游戏类的全栈后端项目:从零搭数据库、写 REST 接口、跑通前端渲染,全程无人工介入。
Kimi K3 走 Kimi Code + WebBridge,GPT-5.6 Sol 走 Codex。唯一的变量是模型本身和对应的 Agent 工具链。
Kimi K3 的版本打开后能看到绿色草坪、僵尸推进、土豆雷爆炸。玩的时候会发现,它只有无尽波次,没有选关、没有暂停、没有星星评价,也没有胜场统计。GPT-5.6 Sol 的版本除了核心对战,还做了选关界面、星星评价和胜负统计。
从代码结构看,Kimi K3 单文件内联全部系统,存档直接读写。GPT-5.6 Sol 拆成多个模块,额外加了默认存档逻辑和数据校验。
Kimi K3 打开就能玩,但玩过几局后缺少目标感和进度反馈。GPT-5.6 Sol 的流程更长,有明确关卡和评价体系。
Kimi K3-植物大战僵尸
GPT-5.6 Sol-植物大战僵尸
Kimi K3 的版本能看到自定义角色渲染,但敌人种类比 GPT-5.6 Sol 少两种。玩的时候最明显的区别是死亡后直接结束,不能续关。GPT-5.6 Sol 做了检查点,死亡后可以从断点继续。
从代码结构看,Kimi K3 用圆形碰撞判断,文件组织偏紧凑。GPT-5.6 Sol 用矩形碰撞箱,结构上更接近标准游戏架构。
Kimi K3 的画面有自己的风格,但容错率低,死亡成本高。GPT-5.6 Sol 的敌人更丰富,容错更高,更像街机原版体验。
Kimi K3-合金弹头
GPT-5.6 Sol-合金弹头
K3 版有角色选择和难度选择,必杀技反馈密集,人物渲染细节比 GPT-5.6 Sol 的方块人更好。但缺舞台选择、血量/时间/伤害倍率等规则调整,设置项也没有持久化。
GPT-5.6 Sol 把这些选项做全了,规则可以保存,更像能反复调整着玩的格斗游戏。
Kimi K3-拳皇 97
GPT-5.6 Sol-拳皇 97
K3 版打开就能玩,射击和移动正常,但缺标题画面、选关、暂停和继续;悬浮陆地只有视觉效果,人物站不上去。
GPT-5.6 Sol 做了完整街机流程,平台碰撞生效,更接近完整街机体验。
Kimi K3-魂斗罗
GPT-5.6 Sol-魂斗罗
K3 版基地保护、升级、地雷等核心机制都在,但缺菜单、暂停、关卡返回和关卡管理。
GPT-5.6 Sol 有完整菜单系统、暂停菜单、结算界面和关卡配置校验,更像能长期打开的游戏。
Kimi K3-坦克大战
GPT-5.6 Sol-坦克大战
判断维度就五个:能不能直接玩、画面完成度、操作手感、规则完整性、聪明程度。
K3 的优势:5 个游戏都能直接打开玩,核心机制成立;植物大战僵尸和拳皇 97 视觉氛围强,高光反馈密集;能在提示词之外主动加星星升级、武器切换等内容;某些单点(如角色渲染)甚至优于 GPT-5.6 Sol。
K3 的短板:规则完整性普遍不足。大多数游戏缺菜单、暂停、选关、存档校验等外围流程;部分游戏死亡惩罚过重、容错率低;单款游戏 UI 精致度参差不齐。
GPT-5.6 Sol 的成品感更强,因为它把预算花在了玩家不会夸但缺了会出戏的地方:菜单层级、规则持久化、边界校验、屏幕特效。
效率上也有差距。GPT-5.6 Sol 在 Codex 上合理利用子 Agent 并发,完成时间约为 K3 的 25%,token 消耗也更省。但 GPT-5.6 Sol 的 API 定价更高,加上跨境访问和支付门槛,国内个人开发者的实际使用成本反而更高。K3 虽然单次任务消耗更多 token,但国内可直接访问,进入门槛更低。
游戏对比能直观展示两个模型的差异,但它有一个局限:场景相对单一,主要看前端表现力;而且前面 5 款游戏不管有没有后端,我们都没有把数据库部分作为呈现重点。我们还想知道,当任务从"写一个可玩的页面"切换到"非游戏类的真实全栈工程",需要数据库设计、REST 接口、前端联调一起跑通时,Kimi K3 能不能独立完成。
于是我们单独给 K3 布置了一个全栈项目:基于开源项目 https://github.com/li-xiu-qi/paper-graph-manager(论文引用关系图谱管理系统),让它自己从零跑通后端、补齐接口、验证前端渲染。整个过程没有手动介入调试,全部由 K3 自己完成。
K3 的第一步是安装依赖并启动服务。它正确识别了 FastAPI 后端需要的全部依赖并安装完成,随后执行 uvicorn main:app --host 0.0.0.0 --port 8001启动服务。

启动过程中它连续遇到三个 ModuleNotFoundError:dotenv、pyvis、kimi_agent_sdk。K3 判断这些都是环境依赖问题,不是代码 bug,逐个安装后服务成功跑在 http://localhost:8001,健康检查返回 ok。

核心需求是给论文引用关系增加完整的后端能力。K3 改动了三个文件:
• database.py:新增 paper_references表,含复合主键、外键、索引;
• graph.py:新增 build_reference_graph()和 export_reference_html();
• main.py:新增 4 个引用端点 + 2 个图谱端点。

为了验证交付质量,K3 在全新端口 8002 上跑了 8 步端到端测试,全部通过:入库论文、添加引用、查询 outgoing/incoming、获取 graph、导出 HTML、删除引用、删除后验证为空。新增测试 36 个全部通过;全量 134 passed、2 failed,K3 用 git stash撤回自己的改动后这 2 个失败依然存在,证明是项目预存的 legacy 问题,与本次功能无关。

后端跑通后,K3 继续处理前端。启动 Vite 时遇到路径别名报错:Failed to resolve import "@/lib/utils" from "src/components/ui/dialog.tsx"。这是典型工程化问题:前端能跑起来,但代码里残留了未正确配置的别名引用。

K3 没有卡住,而是通过 Kimi Code 的 WebBridge 直接控制浏览器验证页面状态:注入 JS 探测 rootLen,确认页面从 0 增长到 30081,说明前端确实渲染出来了。

最终页面成功渲染。Paper Graph Manager 仪表盘首页展示了总论文数、已标注数、笔记覆盖率、最近入库论文列表(如 Mistral 7B、Verifiable Fully Homomorphic Encryption),以及论文管理、知识图谱、智能聊天、笔记管理等模块入口。

Kimi K3 在呈现效果、游戏逻辑和操作流畅度上表现出色。作为开源模型,能达到这个完成度已是少数能打的存在,是中国开源模型参数的里程碑。
但就在昨天,K3 因算力不足已整体关闭购买渠道,这也说明 Kimi 比较在意老用户体验。感兴趣的小伙伴,可以等他们算力充足后再购买体验。

但把标准拉到"能直接发给玩家反复打开",K3 在系统完整度、规则严谨性和包装层上还有明显差距。它更适合快速产出可玩原型,而不是一步到位的完整产品。
横向对比之外,全栈项目补上了另一层判断:K3 能读懂已有项目结构,区分环境问题和代码问题,独立完成数据库设计、REST 接口和前端联调,并通过浏览器自动化验证真实渲染。这说明它的能力边界不只有前端页面,真实后端工程也能端到端跑通。
如果你在考虑是否用 K3:它在核心玩法实现上已具备可玩性,在真实后端工程中能独立跑通,角色渲染、视觉表现等单点还有优势。但如果你要的是开箱即用的完整产品体验,它在系统完整度和工程规范上还有追赶空间。从游戏 case 完成度看,K3 已接近顶级闭源模型 90% 以上的水平。你抢到Kimi会员了吗~

登录查看剩余 70% 内容