大家好,我是蓝戒。本篇我们来聊聊:“Gemini 3.7 Flash、GLM-5.3、Grok 4.6实测写小游戏谁最强”。
同一套Prompt写牛来跑酷小游戏!实测Gemini 3.7 Flash、GLM-5.3、Grok 4.6:谁一发入魂,谁在疯狂翻车?
如今大模型发版的速度比打工人的周报还频繁。但跑分榜单上的那些数字,究竟能不能转化为我们实际开发时的“爽感”?为了不看PPT看疗效,我直接拉出近期热度爆棚的三大顶级模型:Gemini 3.7 Flash、GLM-5.3 以及刚接入 Cursor Pro 的 Grok 4.6,在全部开启“中等推理(Reasoning Medium)”模式下,用同一段包含复杂多角色、多换装、多场景及响应式物理机制的自然语言 Prompt,让它们完整手搓一个网页跑酷小游戏《牛来跑酷》。
开局不多废话,我已经将三个模型写的网页游戏部署上线了,这里放出链接,使用下方链接在浏览器打开直接可以玩:
- 1. Gemini 3.7 Flash 版 牛来跑酷:
https://168116.xyz/example/niulai/gemini/index.html - 2. GLM-5.3 版 牛来跑酷:
https://168116.xyz/example/niulai/glm-5-3/index.html - 3. Grok 4.6 版 牛来跑酷:
https://168116.xyz/example/niulai/grok-4-6/index.html
一、 考题揭秘:这不是玩具Demo,而是一场全栈“大考”
为了彻底榨干模型的逻辑推理、UI布局、状态管理和移动端适配能力,我给出的 Prompt 没有留任何水份:
需求内容:
开发网页游戏《牛来跑酷》,以《牛来》主角“牛来”(小牛犊)为默认角色,每局可切换 7 个角色(牛来妈妈、云雀、蛇、豹拉、狼、牛二、牛爸爸)。
- 服饰系统: 支持帽子、鞋子、衣服套装配置(每种支持 6 种风格)。
- 场景与难度: 支持 5 种赛道(森林、城市、沙漠、雪山、草原),3 种难度(简单、正常、困难)。
- 核心机制: 收集金币(1分),吃苹果加速并在 10 秒内金币得分 10 倍膨胀;根据难度动态调整初速与障碍密度;撞击场景特异性障碍后死亡结算;支持即时重开与重选配置。
这套考题涵盖了 Canvas/DOM 渲染、键盘/触控双端事件映射、状态机切换、音效与物理碰撞判定。三位选手的表现究竟如何?实测过程可谓精彩纷呈。
二、 选手实战复盘:从一发入魂到修罗场重构
1. Gemini 3.7 Flash:教科书级别的“降维打击”
Gemini 3.7 Flash 给人的第一印象是:极快、极稳、极度务实。
- 生成耗时: 三者中最短,推理链路干净利落。
- 交付水准: 第一轮输出即达成了令人惊叹的“开箱即用”。不仅完整实现了 8 个角色的切换、换装状态与多场景跑道,连移动端触控适配、游戏配音音效、难度梯度调节都在第一轮全数做齐。
- 实测体验: 手机竖屏与横屏打开均丝滑无比,无任何掉帧、遮挡或按键冲突,障碍物刷出距离恰到好处。
- 唯一槽点: 角色与服装的视觉审美偏向“程序员极简风”,几何感过重,稍微差点二次元或写实的灵动感。


2. GLM-5.3:审美封神,但经历了一场“空间几何重构”
GLM-5.3 的测评过程最为戏剧化,宛如一个有着顶级美术功底却偶尔方向感迷失的资深架构师。
- 第一轮翻车: 交付的游戏界面极其惊艳,但跑酷视角居然设计成了“纵向伪3D背对玩家视角”,金币和障碍物直接被前方的角色模型自身大面积遮挡。逻辑判定没毛病,但可玩性直接归零。
- 第二轮修改: 提出修改跑道为横向后,GLM 展现出了极高的代码重构认知,直言:“改跑道方向是个大改动:从‘纵向伪3D追尾视角’改为‘横向侧面视角’……整体重构 game.js 渲染引擎 + 调整操控映射 + 速度参数重调。” 改完后跑道对了,但角色模型却是正面面朝玩家横着平移,违背了横版跑酷角色的侧身物理直觉。这也从侧面反映出模型在纯文本空间坐标映射时的一丝短板。
- 第三轮修复: 再次指出问题后,GLM 给出了一段令人震撼的像素级质检反馈:
“验证:像素级朝向检测确认口鼻/喙/狼眼均位于角色右侧;8 角色 × 6 套装扮 × 跳/滑姿势 × 5 赛道 × 15 障碍渲染零报错;主流程全部回归通过。” - 亮点与优势: 最终版在移动端竖屏视距、横屏弹窗滚动等细节上全部打磨完美。最绝的是,三个模型中唯独 GLM-5.3 主动生成了站点 Favicon 图标、中断暂停弹窗,UI 与配色的整体美感也是全场断档领先。


3. Grok 4.6:花 20 刀开会员,换来大型“治低血压”现场
为了深度测试马斯克家的当家花旦 Grok 4.6,我特意怒充 20 刀开通了 Cursor Pro,然而实际表现却一言难尽。
- UI 排版失衡: 第一版生成的设置面板完全没有栅格化美感,左边留下一大块尴尬的空白,右边按钮却堆叠拥挤,交互层次混乱。
- 致命“撞脸”Bug: 跑道方向和角色朝向虽然误打误撞做对了,但移动端视距计算严重失误。角色刚迈步,障碍物和金币就直接“贴脸生成”,玩家完全没有反应时间。
- 难度平衡崩盘: 经过第二轮调整适配后,第三轮实测又暴露出离谱的数值逻辑 Bug——最简单的“简单模式”,障碍物生成频率居然堪比弹幕地狱,试玩者撑不过 10 秒即暴毙,让人一度怀疑自己是不是菜到家了。
- 综合感受: 几轮提示词拉扯下来才勉强达到合格线,整体工程完整度与交互理解明显落后于前两者。


三、 横向多维对比:从三款模型看代码生成的底层代差
| 评估维度 | Gemini 3.7 Flash | GLM-5.3 | Grok 4.6 |
| 首轮交付完整度(Zero-Shot) | ★★★★★(一发入魂) | ★★★☆☆(视角/空间偏差) | ★★☆☆☆(布局与数值Bug) |
| 空间与物理常识理解 | ★★★★★(自然合理) | ★★★☆☆(需纠偏朝向逻辑) | ★★★☆☆(视距参数失衡) |
| 移动端响应式与边缘处理 | ★★★★★(丝滑适配) | ★★★★☆(经多轮打磨后完美) | ★★☆☆☆(贴脸撞障、布局拥挤) |
| 视觉审美与工程细节 | ★★★☆☆(偏工程风) | ★★★★★(自带Favicon/暂停/美工惊艳) | ★★☆☆☆(版式空乱) |
| 代码重构与自我修复能力 | ★★★★★(极强) | ★★★★☆(重构规范、反思透明) | ★★★☆☆(改一处漏一处) |
从本次实战可以看出明显的梯队划分:Gemini 3.7 Flash 综合工程落地最强,GLM-5.3 美术与细节上限最高,Grok 4.6 表现相对垫底。
四、 榜单之外的冷思考:公开评分与真实体感的割裂
目前各大主流大模型打榜(如 LMSYS Chatbot Arena、SWE-bench 等),往往更侧重于单元算法题、合成单测集或纯文本多轮对话。
然而在全栈前端交互、Canvas 图形渲染、多约束状态管理这类复杂真实场景中,模型面临的不仅是“语法对不对”,而是“用户体验是否符合人类直觉”:
- 视觉常识不等于逻辑常识: 模型知道角色在“跑”,但不一定能意识到角色应该“朝右侧身”还是“朝屏幕微笑”。
- 静态代码不等于动态帧率: 跑分能测出语法合法性,却测不出移动端竖屏下 300ms 内障碍物生成距离是否会造成玩家生理不适。
- 这就是为什么很多在 Benchmark 上傲视群雄的模型,一旦放到 IDE 或真实业务场景下就漏洞百出。
五、 模型底座是引擎,Harness 与 Agent 工程才是底盘
这场《牛来跑酷》的小游戏实测,揭示了大模型竞争下半场的一个残酷真相:纯粹比拼底座参数规模的时代正在过去,Harness(评测/工程脚手架)与 Agent 协同链条的完善度,正在决定最终交付质量的生死线。
- Gemini 3.7 Flash 之所以能够“一发入魂”,得益于其底层对于系统级调用、前端上下文感知以及多端物理规律的极致工程优化。
- GLM-5.3 展现出的强大重构自省机制(如口鼻朝向检测、全流程回归判定)以及对 Favicon、弹窗等周边生态的主动补全,证明了国产大模型在 Agent 工作流与审美设计上的深厚积累。
- 单一模型的智商只是发动机,厂商如何围绕模型打造工具链(Tooling)、上下文压缩机制、自我反思纠错循环(Reflection Loop),才是决定开发者用起来是“效率翻倍”还是“血压翻倍”的关键。
文章评论