蓝戒博客

  • 首页
  • 研发说
  • 架构论
  • 效能录
  • AI谈
  • 随笔集
智构苍穹
融合 AI、架构与工程实践,沉淀方法论,构建可持续的技术价值。
  1. 首页
  2. AI谈
  3. 正文

我用大模型写了个牛来跑酷网页游戏上线了,免费玩

2026年8月20日 4点热度 0人点赞 0条评论

大家好,我是蓝戒。本篇我们来聊聊:“Gemini 3.7 Flash、GLM-5.3、Grok 4.6实测写小游戏谁最强”。

同一套Prompt写牛来跑酷小游戏!实测Gemini 3.7 Flash、GLM-5.3、Grok 4.6:谁一发入魂,谁在疯狂翻车?

如今大模型发版的速度比打工人的周报还频繁。但跑分榜单上的那些数字,究竟能不能转化为我们实际开发时的“爽感”?为了不看PPT看疗效,我直接拉出近期热度爆棚的三大顶级模型:Gemini 3.7 Flash、GLM-5.3 以及刚接入 Cursor Pro 的 Grok 4.6,在全部开启“中等推理(Reasoning Medium)”模式下,用同一段包含复杂多角色、多换装、多场景及响应式物理机制的自然语言 Prompt,让它们完整手搓一个网页跑酷小游戏《牛来跑酷》。

开局不多废话,我已经将三个模型写的网页游戏部署上线了,这里放出链接,使用下方链接在浏览器打开直接可以玩:

  • 1. Gemini 3.7 Flash 版 牛来跑酷:
    https://168116.xyz/example/niulai/gemini/index.html
  • 2. GLM-5.3 版 牛来跑酷:
    https://168116.xyz/example/niulai/glm-5-3/index.html
  • 3. Grok 4.6 版 牛来跑酷:
    https://168116.xyz/example/niulai/grok-4-6/index.html

一、 考题揭秘:这不是玩具Demo,而是一场全栈“大考”

为了彻底榨干模型的逻辑推理、UI布局、状态管理和移动端适配能力,我给出的 Prompt 没有留任何水份:

需求内容:

开发网页游戏《牛来跑酷》,以《牛来》主角“牛来”(小牛犊)为默认角色,每局可切换 7 个角色(牛来妈妈、云雀、蛇、豹拉、狼、牛二、牛爸爸)。

  • 服饰系统: 支持帽子、鞋子、衣服套装配置(每种支持 6 种风格)。
  • 场景与难度: 支持 5 种赛道(森林、城市、沙漠、雪山、草原),3 种难度(简单、正常、困难)。
  • 核心机制: 收集金币(1分),吃苹果加速并在 10 秒内金币得分 10 倍膨胀;根据难度动态调整初速与障碍密度;撞击场景特异性障碍后死亡结算;支持即时重开与重选配置。

这套考题涵盖了 Canvas/DOM 渲染、键盘/触控双端事件映射、状态机切换、音效与物理碰撞判定。三位选手的表现究竟如何?实测过程可谓精彩纷呈。

二、 选手实战复盘:从一发入魂到修罗场重构

1. Gemini 3.7 Flash:教科书级别的“降维打击”

Gemini 3.7 Flash 给人的第一印象是:极快、极稳、极度务实。

  • 生成耗时: 三者中最短,推理链路干净利落。
  • 交付水准: 第一轮输出即达成了令人惊叹的“开箱即用”。不仅完整实现了 8 个角色的切换、换装状态与多场景跑道,连移动端触控适配、游戏配音音效、难度梯度调节都在第一轮全数做齐。
  • 实测体验: 手机竖屏与横屏打开均丝滑无比,无任何掉帧、遮挡或按键冲突,障碍物刷出距离恰到好处。
  • 唯一槽点: 角色与服装的视觉审美偏向“程序员极简风”,几何感过重,稍微差点二次元或写实的灵动感。

2. GLM-5.3:审美封神,但经历了一场“空间几何重构”

GLM-5.3 的测评过程最为戏剧化,宛如一个有着顶级美术功底却偶尔方向感迷失的资深架构师。

  • 第一轮翻车: 交付的游戏界面极其惊艳,但跑酷视角居然设计成了“纵向伪3D背对玩家视角”,金币和障碍物直接被前方的角色模型自身大面积遮挡。逻辑判定没毛病,但可玩性直接归零。
  • 第二轮修改: 提出修改跑道为横向后,GLM 展现出了极高的代码重构认知,直言:“改跑道方向是个大改动:从‘纵向伪3D追尾视角’改为‘横向侧面视角’……整体重构 game.js 渲染引擎 + 调整操控映射 + 速度参数重调。” 改完后跑道对了,但角色模型却是正面面朝玩家横着平移,违背了横版跑酷角色的侧身物理直觉。这也从侧面反映出模型在纯文本空间坐标映射时的一丝短板。
  • 第三轮修复: 再次指出问题后,GLM 给出了一段令人震撼的像素级质检反馈:
    “验证:像素级朝向检测确认口鼻/喙/狼眼均位于角色右侧;8 角色 × 6 套装扮 × 跳/滑姿势 × 5 赛道 × 15 障碍渲染零报错;主流程全部回归通过。”
  • 亮点与优势: 最终版在移动端竖屏视距、横屏弹窗滚动等细节上全部打磨完美。最绝的是,三个模型中唯独 GLM-5.3 主动生成了站点 Favicon 图标、中断暂停弹窗,UI 与配色的整体美感也是全场断档领先。

3. Grok 4.6:花 20 刀开会员,换来大型“治低血压”现场

为了深度测试马斯克家的当家花旦 Grok 4.6,我特意怒充 20 刀开通了 Cursor Pro,然而实际表现却一言难尽。

  • UI 排版失衡: 第一版生成的设置面板完全没有栅格化美感,左边留下一大块尴尬的空白,右边按钮却堆叠拥挤,交互层次混乱。
  • 致命“撞脸”Bug: 跑道方向和角色朝向虽然误打误撞做对了,但移动端视距计算严重失误。角色刚迈步,障碍物和金币就直接“贴脸生成”,玩家完全没有反应时间。
  • 难度平衡崩盘: 经过第二轮调整适配后,第三轮实测又暴露出离谱的数值逻辑 Bug——最简单的“简单模式”,障碍物生成频率居然堪比弹幕地狱,试玩者撑不过 10 秒即暴毙,让人一度怀疑自己是不是菜到家了。
  • 综合感受: 几轮提示词拉扯下来才勉强达到合格线,整体工程完整度与交互理解明显落后于前两者。

三、 横向多维对比:从三款模型看代码生成的底层代差

评估维度Gemini 3.7 FlashGLM-5.3Grok 4.6
首轮交付完整度(Zero-Shot)★★★★★(一发入魂)★★★☆☆(视角/空间偏差)★★☆☆☆(布局与数值Bug)
空间与物理常识理解★★★★★(自然合理)★★★☆☆(需纠偏朝向逻辑)★★★☆☆(视距参数失衡)
移动端响应式与边缘处理★★★★★(丝滑适配)★★★★☆(经多轮打磨后完美)★★☆☆☆(贴脸撞障、布局拥挤)
视觉审美与工程细节★★★☆☆(偏工程风)★★★★★(自带Favicon/暂停/美工惊艳)★★☆☆☆(版式空乱)
代码重构与自我修复能力★★★★★(极强)★★★★☆(重构规范、反思透明)★★★☆☆(改一处漏一处)

从本次实战可以看出明显的梯队划分:Gemini 3.7 Flash 综合工程落地最强,GLM-5.3 美术与细节上限最高,Grok 4.6 表现相对垫底。

四、 榜单之外的冷思考:公开评分与真实体感的割裂

目前各大主流大模型打榜(如 LMSYS Chatbot Arena、SWE-bench 等),往往更侧重于单元算法题、合成单测集或纯文本多轮对话。

然而在全栈前端交互、Canvas 图形渲染、多约束状态管理这类复杂真实场景中,模型面临的不仅是“语法对不对”,而是“用户体验是否符合人类直觉”:

  1. 视觉常识不等于逻辑常识: 模型知道角色在“跑”,但不一定能意识到角色应该“朝右侧身”还是“朝屏幕微笑”。
  2. 静态代码不等于动态帧率: 跑分能测出语法合法性,却测不出移动端竖屏下 300ms 内障碍物生成距离是否会造成玩家生理不适。
  3. 这就是为什么很多在 Benchmark 上傲视群雄的模型,一旦放到 IDE 或真实业务场景下就漏洞百出。

五、 模型底座是引擎,Harness 与 Agent 工程才是底盘

这场《牛来跑酷》的小游戏实测,揭示了大模型竞争下半场的一个残酷真相:纯粹比拼底座参数规模的时代正在过去,Harness(评测/工程脚手架)与 Agent 协同链条的完善度,正在决定最终交付质量的生死线。

  • Gemini 3.7 Flash 之所以能够“一发入魂”,得益于其底层对于系统级调用、前端上下文感知以及多端物理规律的极致工程优化。
  • GLM-5.3 展现出的强大重构自省机制(如口鼻朝向检测、全流程回归判定)以及对 Favicon、弹窗等周边生态的主动补全,证明了国产大模型在 Agent 工作流与审美设计上的深厚积累。
  • 单一模型的智商只是发动机,厂商如何围绕模型打造工具链(Tooling)、上下文压缩机制、自我反思纠错循环(Reflection Loop),才是决定开发者用起来是“效率翻倍”还是“血压翻倍”的关键。
标签: Gemini 3.7 Flash GLM-5.3 Grok 4.6 大模型实测
最后更新:2026年8月19日

cywcd

我始终相信,技术不仅是解决问题的工具,更是推动思维进化和创造价值的方式。从研发到架构,追求极致效能;在随笔中沉淀思考,于 AI 中对话未来。

打赏 点赞
< 上一篇

文章评论

razz evil exclaim smile redface biggrin eek confused idea lol mad twisted rolleyes wink cool arrow neutral cry mrgreen drooling persevering
取消回复

cywcd

我始终相信,技术不仅是解决问题的工具,更是推动思维进化和创造价值的方式。从研发到架构,追求极致效能;在随笔中沉淀思考,于 AI 中对话未来。

最新 热点 随机
最新 热点 随机
我用大模型写了个牛来跑酷网页游戏上线了,免费玩 吊打前代Plus!阿里Qwen3.8-27B开源:4G显存可跑 DeepSeek开源Harness深度拆解:当大模型穿上“动力骨骼”,Claude Code迎来最强劲敌? 为什么你狂学上百个“搞钱套路”依然一事无成?如何建立战略思维破局 别再用ChatGPT死记硬背了!港大开源DeepTutor:给每个人配专属私教 DeepSeek V4 Pro正式版默默上线:加量没加价,真Agent时代被撕开缝隙?
斩杀线又提了!DeepSeek V4 Flash 正式版开源,Frontend Coding 炸翻圈子深扒 Google Gemini Spark 这位"24小时不下班"的AI管家等不到Gemini 3.5 Pro?谷歌突然丢出Gemini 3.6 Flash,刀法精湛还是挤爆牙膏?上线即登顶GitHub!开源AI黑马OpenHuman,凭什么让传统智能体集体“失业”?AI还没淘汰你,打工思维先摧毁了你:普通人的反淘汰逃生指北2.4万亿参数野兽上线!阿里Qwen3.8-Max实测与全网七大AI模型硬核横评
从“会说话”到“会做事”:AI 智能体全景解读 移动端微信分享弹出遮罩层js效果 一个文件让AI写代码不再"翻车":45K星的Karpathy指南火了 React-Native学习指南 别再盲下大模型了:用 llmfit 一秒看懂你的电脑到底能跑谁 js页面滚动到一定位置时触发事件:隐藏、固定显示相互切换
最近评论
渔夫 发布于 10 个月前(11月05日) 学到了,感谢博主分享
沙拉小王子 发布于 9 年前(11月30日) 适合vue入门者学习,赞一个
沙拉小王子 发布于 9 年前(11月30日) 适合vue入门者学习,赞一个
cywcd 发布于 9 年前(04月27日) 请参考一下这篇文章http://www.jianshu.com/p/fa4460e75cd8
cywcd 发布于 9 年前(04月27日) 请参考一下这篇文章http://www.jianshu.com/p/fa4460e75cd8

COPYRIGHT © 2025 蓝戒博客_智构苍穹-专注于大前端领域技术生态. ALL RIGHTS RESERVED.

京ICP备12026697号-2