编程导航AI编程话题讨论

AI编程

123 参与
分享

快来分享你的内容吧~

点击登录,快来和大家讨论吧~
表情
图片
话题
打卡
综合
交流
文章
问答

把 GLM-5.3 接入到 DeepSeek Harness,夯爆了!

大家好,我是程序员鱼皮。 最近 AI 圈儿真是过年了,前脚 DeepSeek V4 Pro 正式版和 DeepSeek Harness 同时发布,后脚智谱就放出了全新的 GLM-5.3 模型。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/G6U8ru90DO9xYDtW.jpg) 听说 GLM-5.3 模型的基座跟 GLM-5.2 完全一样,还是 743B 参数,单纯通过后训练把性能提升了 50%。 **测不完,根本测不完……** 既然现在 GLM、DeepSeek、Kimi 几家国产模型打得这么凶,那干脆在同一个擂台上打一场呗? 我相信你们肯定也想看对吧~ ![](https://pic.code-nav.cn/post_picture/1601072287388278786/RVvWP2H6FcqsSHhF.jpg) 刚好最近大火的 DeepSeek Harness(DSH)支持接入第三方模型,于是我决定把 DSH 当做一个统一的评测工具,把这三家的最新模型放在完全一致的工具链环境下测试,只有模型本身不同,尽量做到公平对比。 ![DeepSeek Harness 工具](https://pic.code-nav.cn/post_picture/1601072287388278786/tHrJlMwG5UxZL00v.jpg) 点个收藏,我们开始。 ## 模型接入 DeepSeek Harness 首先要把 GLM-5.3 和 Kimi K3 模型接入 DeepSeek Harness,这里我就以 GLM-5.3 为例。 如果你还没有安装和使用过 DeepSeek Harness,可以看看我之前的 [《DeepSeek Harness 保姆级教程》](https://mp.weixin.qq.com/s/Rv3ww-67fZrU2hNQeCp8oQ),从安装到上手只要几分钟。 > 视频教程:https://www.bilibili.com/video/BV1VkgK6NEZS 这里我只讲怎么在已有的 DeepSeek Harness 里接入第三方模型。 1)打开 DSH 的 Web 界面,点击左下角的「设置」按钮。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/0WUdmhZruv7yvVMf.jpg) 2)进入「模型」标签页,点击「添加提供方」。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/V07VQSe20UztHAnR.jpg) 3)选择模型提供方为 `zai-coding-cn`,然后到 [智谱开放平台](https://bigmodel.cn/coding-plan/personal/overview) 获取你的 API Key 填进去就行。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/33dVDsu4v6TrIEXc.jpg) 4)展开自定义设置,点击「获取可用模型」。不过因为 GLM-5.3 太新了,默认不会被自动拉取到。 所以需要手动点击「添加模型」,填入 `glm-5.3`,然后保存。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/vUm1djeGPsLeBu0J.jpg) 搞定!现在就可以在对话框中选择并使用 GLM-5.3 模型了~ ![](https://pic.code-nav.cn/post_picture/1601072287388278786/FFk7bg0tXx0ChfWR.jpg) 用同样的方法把 Kimi K3 也添加进来。DeepSeek V4 Pro 是 DSH 安装成功后默认接入的,不需要额外配置。 三个模型都就位了,下面开始正式比拼。 ## 测试说明 为了公平对比,三个模型全部在 DeepSeek Harness 的标准模式下运行,统一使用各模型的默认推理档位,工具链完全一致,提示词完全相同。而且全程不做人工干预,给完提示词就让 AI 自己跑到底。 DSH 会自动扫描我本地安装的技能目录,比如我这里装了 Firecrawl 联网搜索技能、Context7 文档查询技能等,三个模型跑任务时都可以使用这些技能来搜索资料。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/FpHvcwKzGCoFpH4q.jpg) ## 实战 1、致敬《牛来》的 3D 跑酷游戏 最近有一部国产动画电影叫《牛来》,因为建模极度粗糙、剧情抽象离谱,在社交媒体上反向爆火了。 上映第一天票房才 3420 元,结果因为猎奇打卡,短短十几天就冲到了 900 多万。 用半佛老师的话来说: - 如果你花一个多小时去了解这个电影,你就浪费了人生的一个小时。 - 但如果你花了 30 块去看了《牛来》,那说明你真的有 30 块钱。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/9FLi5uQ4edesbZ90.jpg) 我决定让 3 个模型致敬这部电影,做一个《3D 网页跑酷游戏》。 提示词里我故意不做太多功能约束和技术限制,就是想看看模型自己能发挥到什么程度,能不能把电影里的元素还原出来。值得一提的是,我让 AI 用 Loop Engineering 的方式推进,做完一步就自己验证一步,出了问题自己修复。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/RlpoJLTtPxKGAoHG.jpg) OK,开跑! ### GLM-5.3 成品效果 先来看 GLM-5.3 的效果。 进入主界面,可以看到一段故事描述。 有看过《牛来》的朋友吗?这个描述跟电影剧情还挺贴的,草原上的小牛犊牛来,跟随云雀坠入一场大梦,穿过迷雾、狼群与轰鸣的伐木场,唯有向前奔跑才能学会勇敢…… 还挺励志。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/mPCv0cByxelvgQP4.jpg) 进入第一关「晨曦草原」,你别说,这个牛的建模真的挺抽象的,尤其是牛脸竟然还直勾勾地对着你…… 旁边还有个云雀好友陪着牛牛向前奔跑,有点还原电影那个味儿了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ZxbeOTE6trDhF38Y.jpg) 游戏操作支持左右移动、跳跃和滑铲,手感还挺流畅的,可玩性不错。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/px3Hxj3JnPF4NlAz.jpg) 吃到一定数量的幸运草之后,可以释放大招,进入「豹拉疾冲」状态,全屏加速 + 无敌。 解释一下,豹拉是电影里牛来的好朋友,这个大招名字起得挺有意思的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/bE6KXlIZ2QyZL3G8.jpg) 游戏有好几个关卡,而且每一关的主题和机制都不一样。比如「狼群夜袭」这关,你身后真的有狼在追你,还有一个贴合剧情的技能叫「妈妈的守护」,我直接一个泪目。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/oImoTulAaRb9Ye0V.jpg) 可惜,最终牛牛我倒在了第四关。 看看这个死亡结算画面,我真的没绷住,怎么还喷出一团血花了呢? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/4rfcHBhFeZ2QWjhf.jpg) 细节,真的细节…… ### DeepSeek V4 Pro 成品效果 再来看看 DeepSeek V4 Pro 的版本。 主界面还挺像那么回事,也还原了云雀和牛来的故事背景。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/3ttEBngfnD6idVad.jpg) 进入游戏。 额…… 怎么硕呢? 界面真的是干净得一鲏啊! 不过还原了云雀和好友豹拉,它们会陪着牛牛一起奔跑。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xJ09muEG1pofq7Vy.jpg) 移动、跳跃和滑铲功能都是正常的,不过看到这个滑铲效果我真没绷住…… 好家伙,眼珠子都给我铲出来了? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/1Y8FxO9FcF70Aj9f.jpg) 仔细看的话,道路两侧的图标明显飘在了草坪上面。还有就是游戏节奏太慢了,刚开局跑了好久第一个障碍物才出现,也没什么技能和特殊的关卡机制,可玩性较差。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/IzRxSklxqwtptTlx.jpg) 牛牛只有一条命,撞到石头之后直接进入死亡结算画面: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/JFPTdt0lBRq9YxBU.jpg) 整体来看,中规中矩吧。 ### Kimi K3 成品效果 最后看看 Kimi K3 的版本。 主界面的配色平平无奇,跟其他模型一样,也把电影剧情概括了一下。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/fJT4pdJF8Uth48zB.jpg) 进入游戏,界面风格还可以,远处的大山绘制得不错。但是主角牛牛就平平无奇了,不够抽象,看起来就是一组普通的方块。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/DGyTPF76BQoeNvQh.jpg) 虽然牛牛有 3 条命,也可以吃金币,但是没有什么技能和特殊机制,整个游戏就是单纯跑跑跑。 我的豹子朋友呢?云雀呢? 还有这个下雨效果,直接来一个全屏网格?这就有点敷衍了吧…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/3tUhVrZTPYQCxIhv.jpg) 而且最致命的问题是,整个游戏时不时会出现明显的卡顿,帧率不够稳定。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hNdmhmOkLe2OfcHF.jpg) 最后是平平无奇的结算画面,一般。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/KTKoN4NUB0RUyXeW.jpg) ### 实战 1 对比 三个版本都跑完了,胜负应该已经很明显了。 GLM-5.3 的版本完成度最高,多关卡、多技能、剧情还原度强,可玩性远超其他两个。 DeepSeek V4 Pro 实现了基本玩法,但是节奏偏慢、细节粗糙。 Kimi K3 虽然场景画面还行,但游戏机制太单一,还有卡顿问题。 综合来看: - 前端效果 GLM ≈ Kimi > DeepSeek - 可玩性是 GLM > DeepSeek > Kimi - 画面抽象程度是 GLM > DeepSeek > Kimi 整体游戏完成度上,GLM 5.3 遥遥领先。 ## 实战 2、AI 绘图工具 上一个任务是前端游戏,第二个任务当然要换个方向,测试模型的全栈工程能力。 我让 3 个模型开发一个《AI 绘图工具》,用户输入自然语言描述需求,后端调用大模型生成 draw.io 格式的图表,前端嵌入 draw.io 开源编辑器,用户可以直接在线编辑和修改生成的图表。 这个任务同时考验对 draw.io 开源代码的理解、后端 AI 调用链路的设计、前端复杂组件的集成、以及整体产品设计的合理性。 为了方便测试,我直接在提示词里把 API Key 提供给了 AI,省去手动配置环境变量的步骤。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/PpDNj5vpG5VZdZZf.jpg) ### GLM-5.3 成品效果 先看看 GLM-5.3 的效果。 整个页面很有科技感,左侧是 AI 对话框,右侧是画布编辑器。 产品引导做得也很到位,告诉你可以用一句话画出专业图表,还给了几个示例类型。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/uUwR0kNCwi6T1Pmk.jpg) 我让 AI 帮我画出 DeepSeek Harness 的架构图。可以实时看到 AI 深度思考和生成 XML 代码的过程,右侧显示了一个炫酷的 Loading 动画。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/jGOpUVVoVJwiqYKe.jpg) 生成完成后,右侧立刻渲染出了完整的架构图,分层很清晰,而且保留了 draw.io 原本的元素编辑能力,可以直接拖拽和修改。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/k3PnFrk8gFZVzmqo.jpg) 更强的是,它支持连续对话修改。比如我说「帮我把 DeepSeek Harness Core 这里变成红色」,AI 就能精准定位到对应的元素并修改样式,右侧画布实时更新。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Lren7bfEea2fJEaa.jpg) 整体效果非常不错,图片导出功能也能正常使用。 而且你会发现 GLM-5.3 把 draw.io 的编辑能力深度融合进了自己设计的界面中,看起来就像一个完整的产品,而不是生硬地嵌入了一个第三方组件。 ### DeepSeek V4 Pro 成品效果 再来看看 DeepSeek V4 Pro 的表现。 打开界面,右侧画布竟然是一坨空白加一个大大的 Loading 图标? 而且左下角的提示文字还出现了溢出,这把 DeepSeek V4 Pro 的前端确实拉了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/4A3MyThN4xnQadM9.jpg) AI 生成图表的功能是可以正常使用的,但是没有实时展示 AI 思考过程的能力,你只能等它全部生成完了,才能看到结果。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/6vb6MzT0DHr3XY3U.jpg) 最关键的是,DeepSeek V4 Pro 很明显是直接把 draw.io 整个嵌入到了前端页面中,没有做任何深度集成。给人一种很生硬的感觉,跟 GLM 那种把 draw.io 能力自然融合到自己界面中的做法差距明显。 ### Kimi K3 成品效果 最后看 Kimi K3。 Kimi K3 这次生成的界面布局跟 GLM 类似,也把 draw.io 自然融合到了项目中,整体界面风格非常 nice。 不过 draw.io 的图标和菜单栏还是原封不动地保留了下来,融合度比 GLM 略逊一筹。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/bce8CrZn0Yq9bBCV.jpg) AI 生成图表的功能正常,同样支持连续对话修改。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/9bWbUumMB0ZpjdBj.jpg) 但是,后端逻辑明显没做好提示词约束和工具校验,有时候 AI 生成的内容会翻车,直接把 XML 源码糊在界面上而不是渲染成图形。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xm0ApjKKR642m0Jv.jpg) 整体来看,Kimi K3 的前端设计能力跟 GLM-5.3 相当,但后端稳定性差了一截。 ### 实战 2 对比 这个任务 GLM-5.3 的综合表现最好,界面设计、AI 深度思考实时展示、连续对话修改、draw.io 深度融合,每一环都做到位了。 Kimi K3 的前端设计能力很强,但是后端偶尔会翻车。 DeepSeek V4 Pro 虽然也正常实现了核心功能,但是界面粗糙,集成方式生硬,表现最差。 ## 我的感受 两个项目全部跑完了,聊聊我的真实感受。 显然,即使是在 DeepSeek Harness 这个 DeepSeek 的「角色专武」环境下,GLM-5.3 的表现依然很出色。 我选的这两个任务覆盖了纯前端 3D 游戏和全栈 AI 应用两个完全不同的方向,可以看出 GLM-5.3 在任务理解、代码生成质量、产品设计意识这几个维度上都明显领先。 然后聊聊大家非常关心的成本问题,猜猜我花了多少 money 呢? 由于 GLM-5.3 我使用的是编码套餐,不太好直接统计实际消耗金额,我只能拿积分来算了。 两个项目累计消耗了 1151 积分,由于我订的是 Pro 套餐(538 元/月),每周额度是 6 万积分,算下来这次的消耗只占了周额度不到 2%,折算成钱连 3 块都不到。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/yqpFemHSZ5ecMfC7.jpg) 由于我的 Kimi K3 套餐过期了,新的抢不到,所以是直接用 API Key 接入的,总共消耗了 31.07 元;涨价之后的 DeepSeek V4 Pro 消耗了 13.99 元。 单从我的实际花销来看,GLM-5.3 按照套餐来算,性价比是最高的。一周 6 万积分随便你跑,根据我这次测试的这种任务来看,做几十个小项目不成问题。 而且 GLM-5.3 会在发布两周后开源权重。 **在开源世界里,GLM-5.3 目前可以说是编程能力的天花板。** ![](https://pic.code-nav.cn/post_picture/1601072287388278786/QSj4s58fh1iN4EAh.jpg) 而且智谱在发布文章中提到,Hugging Face 之前遭遇安全攻击的时候,Anthropic 的 Mythos 模型只面向约 150 家大型机构提供服务,更多的中小企业和开源项目在最需要帮助的时候,反而用不上最强的防御工具。 当攻击能力在扩散,防御能力就不能只掌握在少数人手中。GLM-5.3 的开源给所有人提供了一把防御的盾牌,这件事本身的意义可能比跑分更重要。 ## 最后哔哔 最后多说几句,这次横评让我对国产模型的编程能力更有信心了。GLM-5.3、Kimi K3、DeepSeek V4 Pro 这几家打得不可开交,对我们用户来说是好事儿,起码有了更多的选择。 OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide) ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/o8iZlZezhCmxhVvI.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 也欢迎在评论区聊聊:你现在主力用哪个国产编程模型?GLM、Kimi 还是 DeepSeek?

DeepSeek Harness 最新邪修曝光!被吹成核弹的极简模式,真的夯吗?

大家好,我是程序员鱼皮。 这周 AI 圈儿又炸了,DeepSeek 同时放了两个大招,DeepSeek V4 Pro 模型正式发布 + DeepSeek Harness 工具开源。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Pyfhi6P1FOp4mUow.jpg) 我第一时间发布了 [《DeepSeek V4 Pro 的实战测评》](https://mp.weixin.qq.com/s/GbphlXazvmtZUvRA5ptdyQ) 和 [《DeepSeek Harness 的保姆级教程》](https://mp.weixin.qq.com/s/Rv3ww-67fZrU2hNQeCp8oQ) 的文章和视频版。 **麻了,我每天眼睛一睁就是写稿,做完视频就快该睡觉了。** 热点能不能不要连着来啊,我 Chovy! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/VfRz147R8UomdIAS.jpg) 回归正题,测试完之后,我最大的感受是:**DeepSeek 接不接自家的 Harness,效果差距大到离谱。** 同一个 DeepSeek V4 Pro 模型,裸接 Codex 的时候连线条都画不对,换上自家的 Harness 之后居然能对标 Claude 了??? 害得我成为了「变脸大师」! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/FxYyJ820Zq7YsuFr.jpg) 看来 Harness 就是 DeepSeek 的角色专武,不带专武的 DeepSeek 就是个白板儿角色。 海外一个叫 sentdex 的独立评测博主跑出了一组更夸张的对比。同一套 DeepSeek V4 Flash 模型权重,用他自己写的简陋工具只过了 44 / 89 题,换成社区的完整 Harness 之后变成 64 / 89,多过了整整 20 题。 **Agent = Model + Harness** 随着模型能力越来越强,给模型提供的 Harness 也越来越重要。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/lpmjK9MIQLc7OEph.jpg) 这也是为什么 DeepSeek V4 Pro 会出现「神鬼二象性」,同一套模型到底行不行,很大程度上取决于你拿什么工具、配什么环境去跑它。 而这两天社区里讨论得最炸裂的一个说法,就跟 DeepSeek Harness 中一个不起眼的模式有关。 ## 极简模式邪修 有人发现,只要把 DeepSeek Harness 切换到「极简模式」,模型性能就会瞬间暴增,直接复现灰度测试版的水平,甚至做到了 Fable 5 级别的效果。 这个说法一出来,B 站上跟着涌出了几十个实测视频,标题一个比一个炸裂,什么确认反转、核弹爆炸、史诗级反转。。。 这个「极简模式」到底是什么来头? 当你安装完 DeepSeek Harness,默认使用的是「标准模式」,它把一个 AI 编程工具该有的能力全部配齐了,比如文件读写、终端命令、联网搜索、任务规划、Skills 技能、子 Agent,加起来一共 20 多个工具。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ptn04j9CQ17wiW7q.jpg) 而极简模式就朴素多了,官方只留了两个工具,一个能持续运行的终端 + 一个文件编辑器,其他能力全部关掉。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/irAsVdiNiUpLzbDJ.jpg) 官方对它的定位很清楚,是专门拿来跑模型基准测试的,所以把环境削到最干净,好让不同模型能在同一个标准下公平比较。 也就是说,极简模式根本不是给人干活用的,是给模型考试用的。 那把考试模式拿来干活,真的会更强吗? 废话不多说,直接开测! ## 实战一、3D 第一人称射击游戏 第一个测试,我让 DeepSeek V4 Pro 开发 3D 第一人称视角的 CS 风格射击游戏。 完整提示词: ``` 用 Three.js 开发一个 3D 第一人称射击游戏,做成一个单页面项目,打开浏览器直接能玩。 要求第一人称视角,WASD 控制移动,鼠标控制瞄准和射击; 场景里至少有 3 个敌人会自己巡逻,发现玩家后会追击,被打中后消失; 界面上要显示准星、血量和得分。 ``` 为什么选这个任务呢? 因为 3D FPS 是游戏开发里的经典中的经典,网上教程烂大街了,模型训练数据里肯定见过无数遍。这种任务纯粹考编码能力,不需要搜索文档、不需要查接口,模型的脑子里有货,直接嘎嘎写就完事儿了。 同一套提示词,我先用标准模式跑了一遍,再用极简模式跑了一遍。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/bRmms48YzeureHA3.jpg) 先看看两种模式执行记录的区别。 标准模式调用了技能,中间有很多文字输出,会告诉你它在想什么、准备干什么,就是我们日常使用 AI 编程工具的那种感觉。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hfqIcQTO2Vbo8tdV.jpg) 极简模式只有思考、终端、和字符串替换这个工具调用,中间没有任何多余的输出,AI 就像个哑巴一样,闷头干活。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/KfbWuos5vWEOn92o.jpg) 标准模式跑完用了 50 步,AI 自己检测并修复了 Bug,模型推理花了 21 分钟,工具调用花了 12 分钟,加起来 33 分钟出头,输入 520 万 Tokens、输出 10.5 万 Tokens。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/GV07xrcGVYeoiVDw.jpg) 极简模式跑了 77 步,模型推理 17 分钟,工具调用只花了 6 分钟,总共 23 分钟多,比标准模式快了将近 10 分钟!连最后给我的总结都非常精简。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hHy13pR3SctzWZLZ.jpg) 不过这里有个反直觉的地方,极简模式的输入 Tokens 反而更多,达到了 590 万。 原因也不难理解,极简模式没有上下文压缩能力,而且步数比标准模式多了一半,每走一步都要把之前的完整历史再发一遍,累积下来输入量自然就上去了。好在两种模式的缓存命中率都是接近 100%,这部分差距的花销基本可以忽略。 接下来是重头戏,看看成品效果。 标准模式做出来的游戏体验非常顺畅,移动、跳跃、疾跑、射击、杀敌都是 OK 的,甚至还可以用 CF 里的二段跳。 但是敌人不能发射子弹,只能追着你跑,没啥压迫感。而且有个 Bug,敌人追着你跑一会儿之后,自己又走开了,我提示词里压根没这么要求,这合理吗? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/IxHufYT83yQRFadX.jpg) 有个细节做的不错,如果你被人机给锤死了,会触发一个倒地的效果,视角跟真人倒在地上一模一样! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/sFm9VZDR6CWvaA5c.jpg) 再来看看极简模式的效果。界面比标准模式做得更简洁,背景墙也更真实,移动、跳跃、疾跑、射击、杀敌同样都正常。 而且极简模式的敌人能够发射子弹,感觉更智能,游玩的压迫感更强。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/5jI6ErQw4jPb5mpy.jpg) 不过被击倒的时候,我整个角色的身体还是站立着的,跟标准模式那个倒地视角比就差点儿意思了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/L74k3rtEyg3OID7p.jpg) 从成品效果来看,两者半斤八两吧,各有优缺。 但是从耗时来看,极简模式快了整整 10 分钟,输入 Tokens 虽然多了一点,可绝大多数都命中了缓存,这点差距可以忽略不计。 所以这一局,我会觉得极简模式略胜一筹。 ## 为什么极简模式效果更好? 道理其实很简单,打个比方。 让你来拧一颗螺丝,我给你一把螺丝刀,你直接就拧了。但如果我给你一整个工具箱,里面有扳手、钳子、电钻、螺丝刀,你可能得先翻一翻,犹豫一下该用哪个,最后还是拿起螺丝刀。 AI 也是一样的。默认的标准模式给了模型 20 多个工具,模型每走一步都要先判断这一步该用哪个工具,光是做这个选择就要占用一部分推理能力。而且这 20 多个工具的说明书本身也要塞进上下文里,模型能分给你真正那道题的注意力,自然就被摊薄了。 极简模式把这些能力统统砍掉,只留一个终端和一个文件编辑器。AI 能做的就是直接动手写代码,没有选择困难症,自然又快又准。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hlchjTrAI7BO2BhZ.jpg) 其实 DeepSeek 官方跑分用的就是极简模式,你看跑分图最下方的小字:V4-Pro 使用 DeepSeek Harness 极简模式作为框架进行测试。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/WAYKdPqz6UiKJFLV.jpg) 而且有开发者做了一组很严格的对照实验。他用自己的一套工程维护评测题目,在同一台机器、同一个模型、同一个推理档位下只换 Harness 模式,结果标准模式跑了 91 分,PTC 模式 92 分,极简模式直接干到 99 分,还是有差距的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/MCvEFTeWPkJbcbyV.jpg) ## 能用极简模式干活吗? 注意,极简模式并不是让模型本身变强了,而是让模型在一个极度受限的环境里不再分心了。 而它的代价也很明显,联网搜索、任务规划、Skills 技能、子 Agent、上下文压缩,这些能力全都没了。 极简模式手里就剩一个终端和一个文件编辑器,创建文件、安装依赖、执行命令这些活儿倒是都能干,但是它不能通过工具快速查到外部资料,聊得越久也越容易忘记前面说过什么。 还有一点很影响体验,就是它几乎不跟你汇报。你只能看到一连串的终端命令和文件替换,AI 到底在想什么、走到哪一步了、有没有遇到坎儿,你压根不知道。所以它其实更适合那种你只关心最终结果、不在意中间过程的任务。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/KfbWuos5vWEOn92o.jpg) 你有没有发现,这个状态其实很像 23 ~ 24 年我们刚开始拿 AI 写代码的时候,AI 只能凭脑子里那点存货硬写,碰上没见过的框架就开始一本正经地编造代码写法。 后来有了工具调用、MCP、Skills 技能、上下文管理,一直发展到今天的 Harness,才一步步把 AI 从一个只会聊天的模型,变成了能自己查资料、自己动手改代码、自己跑测试验证的「工程师」。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/wFQ31x3NiCi4FamD.jpg) 极简模式相当于把这些年攒下来的装备又卸掉了一大半。 那要是换一个必须通过联网搜索资料才能做完的任务,极简模式还能打吗? 试试看! ## 实战二、AI 宠物领养系统 第二个测试我换了个复杂任务,让 AI 开发一个「AI 宠物领养系统」。 完整的提示词: ``` 开发一个 AI 宠物领养系统,前后端都要能跑起来。 先联网搜索 DeepSeek 鲸鱼娘的图片,下载至少 20 张存到项目里,作为默认的待领养宠物; 后端从我电脑的环境变量里读取 DeepSeek 的 API Key,调用大模型给每只宠物生成一段领养文案; 前端展示宠物列表和 AI 写的介绍,点击可以领养。 ``` 这个任务跟上一个完全不同,它需要读取本地环境变量拿 API Key,需要联网搜索图片并下载,需要协调前后端接口,还需要调用 AI 模型能力。 看看结果。标准模式跑了 59 步,模型推理 10 分钟,工具调用花了 38 分钟,总共 49 分钟,输入 420 万 Tokens、输出 5.4 万 Tokens。 关键是它成功找到了我本地的 `DEEPSEEK_API_KEY`,全程没让我插手,直接把成品交付了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/U7Xkjrel5159k0rV.jpg) 极简模式跑了 87 步,模型推理 11 分钟,工具调用只用了 16 分钟,总共不到 28 分钟,又比标准模式快了 21 分钟!Tokens 消耗也差不多。 但是它没能从我电脑上读到 `DEEPSEEK_API_KEY`,最后还得我自己填,可交付性就差了一些。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/L63KcnB6B16uEfRE.jpg) 先看看标准模式的成果。整体布局还是不错的,宠物卡片的排版很舒服,但也没到惊艳的程度,而且右上方那行提示文字的位置没对齐。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/gYTZfo7yEcPrrERf.jpg) 不过 AI 顺利完成了抓取鲸鱼娘图片、并且调用 AI 大模型来生成文案的任务: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/vUuqjBTwP5JkHCIU.jpg) 点击就可以领养你想要的鲸鱼娘 🐳 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/9o1zEJbSijpV6Uum.jpg) 筛选功能也是正常的,可以在「全部 / 待领养 / 已领养」之间切换,被领养走的小鲸卡片会置灰,还会标上领养人的名字,一眼就能看出哪些宠物已经有主了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/394yTwSWZdsQka36.jpg) 再来看看极简模式的效果。我得先手动获取 DeepSeek API Key,然后让 AI 帮我填写环境变量并运行程序。 主页面效果也还 OK,看起来跟标准模式做的差不多,毕竟是同一个模型。 但是功能的实用性上就差了一截,没有做任何筛选功能。而且卡片上只有名字、编号和一段文案,宠物的品种、年龄、性格标签这些信息全都没有。对比一下标准模式,人家每张卡片上「灰鲸、2 岁、#幽默 #吐槽役」这些信息都齐全,一看就是个《正经》的领养网站。 还有右上角那个「AI 文案:DeepSeek 已生成」的角标,怎么看都不像是给普通用户用的产品,倒像是自己调试用的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/rwW9aiqCQzkgHhl2.jpg) 极简模式同样是可以点击领养,并输入领养人昵称的: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/gR61IoP5AtXHE30H.jpg) 领养成功后,这只宠物不能再被别人领养,功能逻辑是正常的。但因为没有筛选功能,你看不到自己到底领养过哪些宠物,只能一个一个往下翻着找。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/RSx4QLKJCkqVmR6f.jpg) 对了,上面 4 次任务加起来,你猜猜总共花了多少钱? 答案是 3.13 元,你觉得贵不贵?(涨价前最后的倔强) ![](https://pic.code-nav.cn/post_picture/1601072287388278786/kQrVLfvkiALcM3I6.jpg) ## 极简模式的优缺点 两个项目都跑完了,说说我对极简模式的看法。 首先,极简模式最大的优点就是「快」。两次任务分别快了 10 分钟和 21 分钟,花的钱还差不多,而且它非常直接不绕弯子,你说什么它就直接干什么,不会先跟你聊一堆计划。 它的短板也同样明显。整个过程几乎不跟你汇报,你不知道 AI 在干什么。没办法直接通过工具联网,还要通过脚本另辟蹊径。虽然最后交出来的功能可以正常运行,但是细节和完整度都差了一截。 总结下来就一句话:**你对成品质量的要求越高,极简模式的表现就越差**。 做个能玩起来的游戏 Demo,它完全够用;做个像样的、能直接给用户的产品,它可能就会开始掉链子了。 另外,如果你的任务强依赖某个特定工具,那差距会被进一步拉大。比如 DeepSeek V4 Pro 本身看不了图,得靠 Harness 挂一个视觉插件来补这个短板,这类任务在极简模式下会麻烦很多。 ## 等等,还有高手? 本来我以为故事到这里就结束了。极简模式跑分虽然猛,但是并不实用,想要好的交付质量,还是得老老实实用标准模式。 结果昨晚 B 站 UP 主「小明XBright」丢了个《核弹》。 他在完整保留标准模式那 20 多个工具的前提下,靠一个自己写的两阶段插件 `dsh-anchored-standard`,在自己那套工程维护评测题目上连跑两次,拿到了 98 分和 99 分,均值 98.5,不但追平了极简模式,甚至还略微反超。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/im6GalB5B3XwPwqW.jpg) 绝了,他是怎么做到的? 原理是这样的,DeepSeek V4 Pro 对首轮请求的工具结构极其敏感。你第一轮就把 20 多个工具全甩给它,它就会犯迷糊,分数掉到 91。但如果第一轮沿用极简模式那句系统提示词,并且只给终端和读文件这两个工具,让模型先用极简模式的思维链进入状态,等第一次工具调用完成之后,再立刻把全部工具恢复回来,分数就直接飙到 98 了。 从模型的推理过程中更能看出区别。标准模式下,模型的推理过程里出现了 208 次「let me」,还有 55 次中间回复,说明它一直在犹豫、规划、自我确认。而在这个两阶段插件的引导下,模型开口就是「We need」,通篇都是「我们要干什么」的口吻,两轮加起来「we」出现了 300 多次。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/M2qJan7I2KkgJq5w.jpg) 同一个模型,思维方式完全不同。 他还翻了 DeepSeek Harness 的官方源码,找到了铁证。仓库里有个测试文件,名字就叫 「sends the exact RL prompt and schemas」,翻译过来就是「发送精确的强化学习提示词和工具定义」。这是 DeepSeek 官方自己承认的,极简模式用的就是模型训练时的那套格式。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/FBvwRS4Uswrr3RS4.jpg) 所以你临时换一份它没怎么见过的工具清单,它就会有点儿找不着北。 更有意思的是,DeepSeek V4 Flash 完全没有这个问题,Flash 在不同 Harness 下的分数稳定在 90 到 95 之间,切换到极简模式也没什么变化。所以这更像是 V4 Pro 训练时对自家格式「过拟合」了,Harness 是 DeepSeek 的角色专武实锤了。。 这个发现比单纯的「极简模式性能暴增」更有价值。它揭示了一个更深的问题:当前 AI 模型的能力释放,很大程度上取决于它能不能回忆起训练时的状态。未来 Harness 的优化方向可能不是给更多工具或者砍掉工具,而是搞清楚怎么在启动阶段对齐训练分布,唤醒模型最强的执行状态,然后再释放完整能力。 学会了学废了,感兴趣的同学可以试试看。 插件开源仓库:https://github.com/xiaobright/dsh-anchored-standard ![](https://pic.code-nav.cn/post_picture/1601072287388278786/17XMpRLuGk2DGRqG.jpg) ## 最后哔哔 极简模式这波邪修,我就先测到这里了。 **结论很简单,图快就用它,图稳就用标准模式。** 不过那个两阶段插件的思路确实让我眼前一亮。以后 Harness 插件生态成熟了,说不定会有更多插件专门去研究怎么先把模型的状态调到最佳,再把完整的工具交到它手上,到时候 DeepSeek 的实际体验可能还会再上一个台阶。 OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/mpmJK2tUIe7S35Rm.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 评论区聊聊:你有没有用过 DeepSeek Harness?感受如何?有哪些不错的玩法呢?

DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了

大家好,我是程序员鱼皮。 昨天注定是载入史册的魔幻一天,DeepSeek 同时放了两个大招! 先是 DeepSeek V4 Pro 正式版上线,紧接着万众瞩目的 DeepSeek Harness 开源。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/tNpELbU98HyPh35D.jpg) **炸裂!炸裂!炸裂!** DeepSeek Harness 开源的 [GitHub 仓库](https://github.com/deepseek-ai/deepseek-harness) 上线不到 1 天,就冲到了 7 万多 Star,AI 届的顶流果然名不虚传。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/rskbe4YDkoZvWAzC.jpg) 这下搞不好 Codex、Claude Code、Cursor 都要 **梁乐** 。。。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/qJY3ut59iRakUs34.jpg) 这篇文章我会从安装开始,手把手带你体验 DeepSeek Harness 的核心玩法。 小白可懂,建议收藏~ ## 一、DeepSeek Harness 是什么? Harness 这个词翻译过来就是「驾驭」,如果把 AI 模型比作一匹马,那 Harness 就是你驾驭 AI 模型这匹马所需要的一切工程。 所谓 Harness 工程,就是研究怎么让 AI 模型这匹马跑得更快、更稳,顺利完成任务。 你给 AI 写的项目规则文件、配置的各种工具、安排的任务拆分和执行顺序、设计的测试检查流程,这‌些统统都算 Harness。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/41WxVwBlm2vCsuDK.jpg) 有一个很精妙的公式:**Agent = Model + Harness** 模型负责思考和生成,Harness 负责把这些能力接入文件系统、终端、网页、工具链,让 AI 真正能在现实环境里干活。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/4NOdpWDZGqYBUwnR.jpg) 之前 DeepSeek 只开源了模型这一半,Harness 一直没动静,这次终于补齐了。 你可以把 DeepSeek Harness 理解成一个 **可以高度定制的 AI 编程工具**,对标 Claude Code 和 Codex。 但它的野心比这些工具更大,不只是一个编程 Agent,而是一套可配置、可重组的 Agent 运行环境,官方口号是「一切皆插件」。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/GvAH3gKymlXyIFnX.jpg) 看到这里,你已经超过了 50% 的同学。 接下来只需要 1 分钟,你就能把它装到自己电脑上。 ## 二、安装 安装 DeepSeek Harness 真的非常简单,进入到 [DeepSeek Harness 官网](https://www.deepseek.com/harness/) 。 你会看到一行安装命令: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/HpcE1iUZYbBahKnh.jpg) 在执行这行命令之前,首先要确保你的电脑已经安装了 Node.js 环境,没有的话去 [Node 官网](https://nodejs.org/zh-cn) 下载安装包,傻瓜式安装就行。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/bV7qCmvxf0LUNIrs.jpg) 有了环境后,复制这行命令,然后打开你电脑上的终端,输入这行命令并执行: ```bash npx @deepseek-ai/dsh web ``` 稍等一会儿,你会看到终端输出了一个网址,打开它就能进入到 DeepSeek Harness 的 Web 界面。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ChWLpPBxRzy0z4X3.jpg) 第一次使用时,需要填入 DeepSeek 的 API Key: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/tXlwWMcNPmvw9LB8.jpg) 到 [DeepSeek 开放平台](https://platform.deepseek.com) 创建一个 API Key,注意不要泄露,把得到的 Key 复制粘贴过来就行。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/CRsDsq78bnLtsn2j.jpg) 到这里,DeepSeek Harness 就安装成功了,是不是很简单? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/W0fVlobEbLOMoZo4.jpg) 看到这里,你已经超过了 60% 的同学,接下来我带大家实战体验一下它的能力。 ## 三、Harness 实战 进入 Web 界面后,选择一个你想让 AI 操作的项目文件夹,就可以正式开始干活了。 可以在对话框中选择模型、以及模型的推理等级,还能设置 Agent 对文件系统和终端的操作权限,按需调整就好。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/NfREU59Dtmrabudh.jpg) 默认使用的是「标准模式」,它具备了一个 AI 编程工具应有的全部能力,大多数情况下用这个就够了,后面我会详细介绍各种模式的区别。 你看,是不是跟 Codex 这种 AI 编程工具很像? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/1yRESDEeAmp34S2B.jpg) 没错,你就把它当成国产版的 Codex 来用就好了,AI 编程、自动化办公等任务,都能搞定。 下面我们跑几个任务试试看。 ### 任务 1、分析代码仓库,绘制架构图 第一个任务,让 DeepSeek Harness 分析它自己的源码仓库,绘制一张傻子都能看懂的架构图。 DeepSeek Harness 的代码仓库还挺大的,里面模块也多,用来测试 AI 的代码理解能力刚好合适。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/eDx1rS7T5yfuiOGp.jpg) 给 AI 发送下列提示词: ``` 分析当前项目的代码仓库结构,绘制一张清晰的架构图。 要求用 Mermaid 语法输出,让完全不懂代码的人也能一眼看明白各模块的关系。 ``` 可以看到 AI 开始自动读取文件、分析项目结构,执行速度非常快,而且每一步在做什么都清晰地展示在界面上。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/mPrD7uOIoTSVAWsc.jpg) 很快任务完成了,能够看到 AI 输出了 Mermaid 文本绘图语法,不过 DeepSeek Harness 默认是不会把这块渲染成图形的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/v6MbVkQfgX0nF7XS.jpg) 我要把这段代码复制到 Mermaid 渲染工具中,可以看到完整的架构图,虽然效果中规中矩吧,但内容还是比较完整的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/FrRRAf8zdf86tJgu.jpg) 你可以在下方看到任务消耗的 Tokens、当前的上下文占用、以及整个对话的 Tokens 消耗信息。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/6a2PSSrtPmdFakSd.jpg) 你还可以进入上方的「轨迹」面板,清晰地查看到整个对话中每一次的对话和工具调用记录。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xA3d7V5D4JOP1F6C.jpg) 这是 DeepSeek Harness 的特色,让每一次运行都有迹可循。 ### 任务 2、开发一个知识讲解网站 第二个任务,让它从零开发一个用交互式动画讲解知识的网站。 要讲解的知识点是「注意力残差」,跟我之前测评 Codex + DeepSeek V4 Pro 的时候用的是一模一样的提示词。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ThtGHbe5l6vzBsnN.jpg) 大概过了 20 分钟,AI 完成了任务,这个速度确实不算快,主要的时间花在了 AI 的自检上。 值得关注的是,本次任务的缓存命中率达到了 99%,也就是说绝大多数的费用都按缓存来计算,实际花费极低,这点很厉害啊! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/R780WpGe5gld1qIs.jpg) 看下效果,不错,动画还是很生动的: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/916AHmn4LyiMrIhy.jpg) 而且点线之间的连接非常准确: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/d03BbpLZ31Wac75U.jpg) 更让我惊喜的是,跟之前 Claude Opus 5 开发的效果一样,这次 DeepSeek 开发的版本也提供了总结和小测验功能,让整个知识讲解更加全面了: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/MOcX11tZJuIqu0JO.jpg) 整体来看,相比于我之前用 DeepSeek V4 Pro + Codex 跑的效果要好多了! 之前的版本连线都对不齐,相信你们能明显感受到区别。 ![DeepSeek V4 Pro + Codex 的版本](https://pic.code-nav.cn/post_picture/1601072287388278786/rfCyRE46zJa24luH.jpg) 单看这一个例子,我真有种感觉 DeepSeek V4 Pro 可以对标 Claude 了,看来 Harness 真的很重要。 ### 任务 3、开发一个 3D 游戏 第三个任务难度升级,让它开发一个 3D 网页小游戏。 这次做的是千万元以内最好的玩具「竹知了」,不过这次比之前测评的 2D 版本复杂多了,还要支持摄像头识别手势来控制竹知了旋转。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/l0c3ga41tm9utFWG.jpg) 可以看到 AI 在开发过程中,会自己检查验证程序是否正常: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/STUxn6QXzSMxkKBQ.jpg) 这次跑了将近 40 分钟,AI 完成了任务,缓存命中率竟然接近 100%! 我 chovy,真心强啊! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/IpPXdVv6ps7JrtSP.jpg) 看下成品效果,还是不错的吧,可以通过鼠标拖拽来旋转角度: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Nsot2JiqUCW7Cc5K.jpg) 按住竹签来回移动鼠标就可以控制竹知了旋转,注意看图片中的影子,细节做的非常好! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/n4wa4gGcR5905wvx.jpg) 而且还可以开启摄像头,通过搓手来控制竹知了旋转,这个交互体验非常有趣: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/3idQvzSNUm1idYPo.jpg) 整体来说,功能都是正常的,程序没有明显的问题,细节做的也很到位,我的评价是 **顶级**。 相比之前用 DeepSeek V4 Pro + Codex 搓的 2D 版本强了太多了: ![之前 DeepSeek V4 Pro + Codex 做的 2D 版本](https://pic.code-nav.cn/post_picture/1601072287388278786/BiWpEFyWFXV0OiMI.jpg) ### 任务 4、开发全栈 AI 应用 最后一个任务,让它开发一个内置 AI 大模型调用能力的全栈应用「AI 网页 PPT 生成器」。 用户粘贴一段长文案进去,后端调用 DeepSeek 大模型把文案拆解成多页 PPT,前端渲染成可以全屏演示的网页 PPT。 这次我特意在提示词里让 AI 自己从我电脑上获取 DeepSeek 的 API Key,看看它能不能自己搞定。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/n1nQ5jPm5ieF3NNU.jpg) 执行过程中,AI 可能会向你确认权限,比如要不要允许读取某个文件、要不要执行某条命令,安全性这块还是挺到位的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/pNOTaFwM2aq1kNSe.jpg) 大概半小时左右,AI 完成了任务,来看下效果。 这个界面风格还可以哈,也是有点儿科技感的,来粘贴一段要制作 PPT 的文章。 哦,这里有惊喜!我们可以自己定义生成 PPT 的风格,还可以选择是否开启推理模式。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/tIHpbHpMOBWWZzYa.jpg) 然后点击生成 PPT。 生成过程中,是可以实时查看到生成进度和输出信息的,这个交互感比之前的老版本好太多了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/e1wHzIsEnfJCWYMv.jpg) 而且生成速度很快,看起来效果不错,点击全屏查看。 哇,这次生成的 PPT 充满了科技感,而且布局也挺合理的,主次分明。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Cw3UUpQiWU0IigPS.jpg) 相比之前用 DeepSeek V4 Pro + Codex 做出来的版本好多了,布局更加合理,配色也更优雅。 ![之前 DeepSeek V4 Pro + Codex 做的 PPT](https://pic.code-nav.cn/post_picture/1601072287388278786/FFULVIbotzRZWXpY.jpg) 你还可以切换几种主题配色,也都是比较经典的风格了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/zoZ2hmupdPnoYVRL.jpg) 看到这次做出来的版本,我觉得真的可以和 Claude Opus 5 媲美了,给到顶级。 ![Claude Opus 5 做的 PPT 工具](https://pic.code-nav.cn/post_picture/1601072287388278786/XcUMUuO8rEZZFA8c.jpg) ### 实测感受 几个任务跑下来,DeepSeek Harness 给我的感受是速度还行。优点是缓存命中率很高,而且执行过程非常清晰透明。你能看到 AI 每一步在做什么、调用了哪些工具、读了哪些文件,不像有些工具暗箱操作,辜负用户的信任。 单从我这几次测试来看,DeepSeek V4 Pro 配合自家 Harness 的 AI 编程能力确实可以和 Claude Opus 5 对标了,官方那个只差 0.1 的跑分诚不欺我。 **看来用 DeepSeek 模型,还是得用自家的 Harness 工具啊。** ![deepseek v4 pro 跑分图](https://pic.code-nav.cn/post_picture/1601072287388278786/hcufjOPJ0jMAUDdW.jpg) 再说下费用,大家猜猜这几个任务跑下来花了多少钱? **答案是不到 5 块钱!** 因为缓存命中率基本都在 99% 以上,实际花费极低。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/h6hgwWpbQHCUGWFi.jpg) 不过要提醒大家的是,DeepSeek 已经宣布 8 月 17 日起涨价,而且涨了好几倍。 ![DeepSeek 涨价](https://pic.code-nav.cn/post_picture/1601072287388278786/GlnZOz03GbYd3lx7.jpg) 但即便是涨价之后,跟 Claude 比起来还是便宜很多的,而且缓存命中的价格依然非常低。 总的来说,自己的模型配自己的 Harness 工具,真的强。 我收回之前对梁子的失望,梁神受我一拜! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/lHopmcRqu9YFY107.jpg) 看到这里,你已经超过了 70% 的同学。 接下来我们了解一下 DeepSeek Harness 的几种运行模式,看看它还有什么用法。 ## 四、4 种运行模式 DeepSeek Harness 提供了四种运行模式,适配不同的使用场景。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/HoMKTcwauICCzPGr.jpg) **标准模式** 就是我们前面实战一直在用的那个。它加载了完整的工具组合,包括文件编辑、Shell 命令、网页搜索、子 Agent、Skills 技能等等,覆盖了日常开发的所有需求。绝大多数情况下用它就好了。 **极简模式** 只保留了 Bash 和文件编辑这两件最基础的工具,其他能力全部关掉。这个模式主要是官方拿来跑模型基准测试用的,在最小环境下考验模型的纯编程能力,普通用户基本用不到。 **PTC 模式** 全称是「程序化工具调用」。普通模式下 AI 是一步一步调用工具的,每步执行完才能决定下一步做什么。但在 PTC 模式下,模型可以直接生成一段 TypeScript 代码,把多步工具调用串联起来一次性执行完。适合那种步骤很多但逻辑清晰的任务,比如批量重命名文件、跑一整套自动化流程,效率比一步步确认要高得多。 **创造模式** 适合想要开发插件、创造新工具或者定制模式预设的同学。它继承了标准模式的全部能力,在此基础上还让 AI 可以检查当前运行时有哪些插件在跑、在内存里试验新的插件组合、甚至自己创作出一个全新的模式预设。后面我们会用这个模式来开发自己的插件。 总结一下,这四种模式的本质区别就是「当前会话加载了哪些工具插件」。极简模式只留两件工具,标准模式叠满全套能力,创造模式还能让 AI 自己查看和改装当前的插件配置。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/YzyyGTTNGVm93BK6.jpg) 看到这里,你已经超过了 80% 的同学,但 DeepSeek Harness 真正让我兴奋的地方才刚刚开始。 ## 五、插件 接下来要聊 DeepSeek Harness 跟 Codex、Claude Code 这些工具最大的区别了,就是它的插件系统。 ### 一切皆插件 DeepSeek Harness 中的一切皆插件。 模型、工具、技能、会话、沙箱、UI,甚至 Agent 的运行循环本身,都是插件,都可以拔掉换成别的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/n1zuHiUHFGB8t77O.jpg) 也就是说,如果你对这个工具哪个地方不满意,随时可以自己替换或者安装插件来扩展,不需要改框架源码。 Codex 和 Claude Code 虽然也有一定的扩展能力,但远没有做到这种级别的开放,DeepSeek Harness 的定制化能力要强得多。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/aUhWbNhgWC0SzyfO.jpg) 接下来我先带大家使用社区插件,再带大家开发属于自己的插件。 ### 使用社区插件 在 DeepSeek Harness 官网中,点击「社区插件」,就可以看到所有 [社区开发的插件](https://github.com/topics/dsh-plugin) 了。 其实就是 GitHub 上打了 `dsh-plugin` 这个主题标签的项目: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/LZCDgqDFWREmFwNf.jpg) 不过这个页面的插件又多又杂,我更建议直接去看 GitHub 上的 [Awesome 仓库](https://github.com/awesome-dsh-plugin/awesome-dsh-plugin),里面有分类整理好的精选插件列表,每个插件都经过了验证,目前已经收录了 300 多个可安装插件,上线一天就这么多,生态起飞的速度确实夸张。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/VA7WRQdKcTmk3rTw.jpg) 安装一个社区插件也非常简单,比如我看上了这个鲸鱼娘皮肤美化插件: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/0PYFE6tbuy5ouGpe.jpg) 我只需要进入 DeepSeek Harness 网页中,随便选一个工作目录,然后把插件开源地址提供给 AI,让它帮我装就好了。 想省事的话,可以先把 Agent 的操作权限改为全放开,这样 AI 执行命令的时候就不用你一个个确认了。 ```markdown 帮我安装插件 https://github.com/Small-tailqwq/dsh-deep-whale ``` ![](https://pic.code-nav.cn/post_picture/1601072287388278786/nLHIaRWreXRrRfSw.jpg) 很快,AI 完成了安装。我们按它说的,打开终端输入命令,重新启动一下 DeepSeek Harness 网页: ```bash npx @deepseek-ai/dsh web ``` 刷新,怎么样?! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/JtscscmFY90PQtbI.jpg) 效果不错吧,是不是使用 AI 的念头更强了呢? 如果你不想要这个皮肤了,直接再跟 AI 说一句话,把插件卸载掉就好了: ```markdown 帮我取消掉这个插件,回到最开始的设置 ``` ![](https://pic.code-nav.cn/post_picture/1601072287388278786/mmdqRaxznPRCphPF.jpg) 还有一些比较有意思的皮肤类插件,比如 [dsh-deepcel](https://github.com/Small-tailqwq/dsh-deepcel) 把界面做成了 Excel 表格的样子,摸鱼神器啊这不是? ![Excel 风格的 deepseek harness](https://pic.code-nav.cn/post_picture/1601072287388278786/fAEqV260DBLnJ3yf.jpg) 还有 [dsh-tianshu-tui](https://github.com/huiliyi37/dsh-tianshu-tui) 直接把 Web 界面换成了 TUI 终端风格: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/gsEPp4nPVtcJqvsK.jpg) 最离谱的是 [dsh-ads](https://github.com/dsh-external/dsh-ads) 这个插件,它给你的 Web 界面加上了 2005 年中文网站风格的侧栏广告、对话内信息流和角落弹窗,纯粹的抽象艺术。。。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/011i7BIuGdm9G2F8.jpg) 因为 DeepSeek Harness 本质上就是个跑在浏览器里的 Web 应用嘛,所以定制皮肤这件事非常简单。 不过皮肤插件只是 DeepSeek Harness 生态的冰山一角,翻一翻插件精选列表你会发现,很多真正实用的插件其实都在往成熟的 AI 编程工具产品方向靠拢。 比如 [DSH-better-sidebar](https://github.com/omdsh-dev/DSH-better-sidebar) 优化了侧边栏的交互体验,[dsh-at-file](https://github.com/omdsh-dev/dsh-at-file) 让你可以用 @ 符号快速引用文件。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/s0pE1ojPFqTtBIP0.jpg) 我个人最看好的是 [modlens](https://github.com/liustack/modlens) 这个插件,它是 DeepSeek Harness 的第一个视觉插件,你把图片粘贴进去,它会帮模型把图片解析成结构化的 JSON 文字信息,包括 OCR 文本、页面布局、语义内容。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ZZX5jScmDCe2f1yx.jpg) 这个插件解决的正是我之前测评时吐槽最多的那个痛点。DeepSeek V4 Pro 是纯文本模型,看不了图,写完页面没办法自己截图检查效果对不对,前端布局有没有错位它全都判断不了,我上次还专门搭了一套 Playwright 脚本来替它做验证。现在社区直接用一个插件把这个短板给补上了。 这些插件补齐了 DeepSeek Harness 在交互细节和能力上的不足,也侧面说明了「一切皆插件」这个架构有多灵活,靠社区自己就能把产品体验补上来,用户也有了更多选择。 ### 自己创造插件 光装别人的插件不过瘾,其实自己开发一个插件也很容易,因为可以直接让 AI 帮你写。 切换到「创造模式」,在这个模式下 AI 可以帮你检查当前插件树、试验新插件、最终打包发布。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/8Ofh4FCXQRJFD6NV.jpg) 比如我之前给 Codex 装了一个桌宠插件,现在想搬到 DeepSeek Harness 上来。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/T2jFpXfkl4WKOPGn.jpg) 直接在创造模式下跟 AI 提需求: ``` 帮我开发一个 DSH 桌宠插件,在 Web 界面右下角显示一个小宠物。 你需要直接把我本地的 Codex 目录下的 Kun Like 桌宠素材移植过来,不用自己重新设计形象。 它会根据当前 Agent 的工作状态做出不同动作。 当任务完成后,还会发出「你干嘛~」的声音 音频文件路径在:/Users/yupi/Downloads/你干嘛哎呦.mp3 ``` ![](https://pic.code-nav.cn/post_picture/1601072287388278786/CKBKiWvT7zGSrpOj.jpg) AI 开发好插件之后,会先找你人工审批,确认没问题之后才会正式安装,安全性很有保障。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/8xPvPhRqUInwiqot.jpg) 很快开发完成,打篮球的小鸡就出现在屏幕上啦! 随便跟 AI 对话一次,就能听到「你干嘛~哎哟」的声音,可谓提神醒脑、如听仙乐耳暂明~ ![](https://pic.code-nav.cn/post_picture/1601072287388278786/V7kAqw5r6uOkMVtE.jpg) 除了桌宠之外,你还可以发挥想象力做各种有意思的插件,比如提醒你定时喝水的健康助手、实时展示模型账户余额的悬浮窗、定制你自己的主题皮肤等等。 如果想把插件分享给其他人,只需要让 AI 通过 GitHub MCP 插件,把代码推送到 GitHub: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/MuuL6xGIi6L15nPO.jpg) 很快就开源完成了: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/a3cZKoude7fU8kFp.jpg) 然后给仓库打上 `dsh-plugin` 的 topic 标签就行了: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/f65TtHV8gLc5ll48.jpg) AI 甚至帮我给 README 项目介绍文档中添加了效果截图,太贴心了吧!这下大家都可以一起来做小黑子了~ > 开源指路:https://github.com/liyupi/dsh-kun-like-pet ![](https://pic.code-nav.cn/post_picture/1601072287388278786/afPjeq4zKdyS8kji.jpg) ## 最后哔哔 恭喜你,DeepSeek Harness 才发布了一天,你就已经掌握了 DeepSeek Harness 的基础用法,至少超过了 90% 的同学! 时间原因,还有很多 DeepSeek Harness 的进阶玩法我没有展开,比如用命令行模式批量跑任务、接入和切换其他大模型、自定义 Agent 预设来适配不同的工作场景、甚至把它部署到服务器上让整个团队共享等等。 我也正在探索,这些内容我会在下一篇进阶教程里详细讲解,感兴趣的朋友们可以先关注一下。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/SCDL6TEZeZzB43I8.jpg) 我非常看好这个项目,因为「开源 + 一切皆插件」,让 DeepSeek Harness 做到了极致的开放,它的可能性是无限的。 **也许用不了多久,我们每个人手里的 AI 编程工具都长得不一样,因为每个人都可以根据自己的需求自由组装,我觉得这是一件很酷的事情~** OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/6A0X47Ksd0LXVQzP.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 欢迎在评论区聊聊你使用 DeepSeek Harness 的感受,有哪些不错的玩法?

刚刚 DeepSeek V4 Pro 正式发布,夯还是拉?首发实战测评

大家好,我是程序员鱼皮。 刚刚,DeepSeek 悄悄发布了 DeepSeek V4 Pro 模型的正式版,已经可以通过 API 接口调用了。 ![DeepSeek 官方群发布消息](https://pic.code-nav.cn/post_picture/1601072287388278786/GdQSCeGCxgirHNzG.jpg) 新版本支持 1M 上下文、384K 最大输出,进一步增强了 Agent 能力,并且支持 Responses API,能够轻松接入到 Codex 中。 来看一看 DeepSeek 官方放出的跑分表: ![DeepSeek V4 Pro 正式版跑分对比](https://pic.code-nav.cn/post_picture/1601072287388278786/6dBbWlaJ4eyls8Zw.jpg) 最亮眼的是 Terminal Bench 2.1 这一项,它考察的是模型能不能在终端里独立把一整套编程任务干完。 DeepSeek V4 Pro 正式版拿了 87.9,而国外顶级模型 Claude Fable 5 是 88.0。 **就差 0.1 !** ![](https://pic.code-nav.cn/post_picture/1601072287388278786/smj1MnINGto6w1zp.jpg) 相比之前放出的 DeepSeek V4 Preview 版,其他几项测试指标的涨幅也很夸张,DeepSWE 从 12.8 涨到 62.7,Cybergym 从 52.7 涨到 83.3,NL2Repo 从 38.5 涨到 61.5。这几个基准考的其实是同一件事,模型能不能带着工具进到真实环境里,把一个多步骤的活儿从头做到尾。 也有落后的地方,比如 HLE 这种纯知识考试,DeepSeek V4 Pro 拿了 42.7,Claude Opus 4.8 是 49.8,Claude Fable 5 是 53.3,差距还是挺明显的。不过 HLE 考的是百科知识和通识推理,跟日常写代码的关系不大,真正决定 AI 编程体验的还是上面那几项 Agent 和 Coding 的基准。 跑分归跑分,模型好不好用,还得拿真实项目来检验。 这次我准备了 **7 个不同类型的项目**,从简单的前端动画、再到复杂的全栈产品,全方面测评 DeepSeek V4 Pro 的编程能力。 ![7 个测评项目汇总图(由浅入深)](https://pic.code-nav.cn/post_picture/1601072287388278786/MssrDV4fwq9Bq105.jpg) 值得一提的是,为了这次测试,我特地往 DeepSeek 账户里充了 300 块。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/qWxBO1qEfUhtalcK.jpg) 大家可以猜猜看,这 300 块够不够花? 答案在结尾揭晓~ ## 先给 DeepSeek V4 Pro 搭一套 Harness 这次测试我统一使用 Codex 这个主流的 AI 编程工具来跑所有任务。 把 DeepSeek V4 Pro 接进 Codex CLI 没什么难度,官方这次专门适配了 Responses API 和 Codex,改改配置文件就能跑。具体步骤我之前写过一篇 [《Codex 对接国产模型教程》](https://mp.weixin.qq.com/s/Nnuwq9giw-jj3fH9WswMrg),照着做就行。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/7xSvVcXcQQeZArkl.jpg) 真正麻烦的是另外两件事。 DeepSeek V4 Pro 是纯文本模型,看不了图。这意味着它没办法像 Kimi K3 或 Claude Opus 5 那样写完页面自己截图看一眼效果对不对,也没办法跟之前有视觉理解能力的模型放在完全公平的条件下横向对比。 另外,官方那些跑分数字本身就不是只靠裸模型跑出来的。公开基准里的 Code Agent 任务,用的是 **DeepSeek Harness 极简模式**,而且开的是 max 档位。 Harness 指的是把模型能力落到真实环境里的那层工程,负责调用工具、读写文件、管理上下文、处理报错,让模型能把一件事从头干到尾。 问题是,官方那套 Harness 到现在都还没放出来。 那我就自己给它搭一套呗~ 这套 Harness 并不复杂,主要做 4 件事: 1. 统一执行环境:所有任务走同一个启动脚本,推理档位保持一致,每个任务独立目录和端口,不会互相影响 2. Playwright 验证器:模型看不了图,就让脚本替它抓 console 报 错、网络请求和 DOM 断言,再存截图便于人工验证 1. Token 计费对账:把任务执行过程中的事件流保存为 JSON 文件,按官 方定价算钱,测试前后各查一次余额做交叉验证 1. 90 分钟看门狗机制:超时就强行关掉任务,失败也不会重跑,保证数据 干净 准备工作做完,我在 Cursor 里把 8 次执行一次性并行丢了出去,全程不需要人工干预,跑完我再一个一个验收。 ![Cursor 并行调度 8 个子任务](https://pic.code-nav.cn/post_picture/1601072287388278786/8kq9ckgQCeNMbcfX.jpg) ## 项目实战测评 这次我准备了 **7 个项目** 来测 DeepSeek V4 Pro 的编程能力,从简单的前端动画,到复杂的全栈产品,由浅入深。 1. 交互式动画讲解网站 2. 3D 版动画知识讲解 3. 竹知了仿真网页游戏 4. 网页 PPT 生成工具(内置 AI 大模型) 5. 在线抽奖系统 6. 以撒的结合肉鸽游戏 7. 全栈 AI 编程工具(复刻 Cursor) 下面挨个儿来看。 ### 1、交互式动画讲解网站 第一个项目,让模型做一个用交互式动画讲解知识的网站,讲的知识点是「注意力残差」。 提示词里我要求它先用 Firecrawl 联网搜索技术细节,确保讲解内容准确,做完之后自己验证效果,不满意就自主调整,改到满意再交付。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/qPoBrjtbTorwcfJR.jpg) 先来看看首屏效果。 已经能看出问题了,不仅动画做得很简单,而且动画块中的文字已经溢出边框了…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/qRebxEJEm1FDFVYz.jpg) 再往下看 AI 对核心机制的讲解,中间那个示意图的线条连接明显不对,节点之间错位了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/QCIBIGdTmSoYzT8v.jpg) 再往下看交互演示的部分,文字溢出和连线错位的问题更加明显,而且动画过于敷衍,没什么交互性可言。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Oq8n4YHiCo7bvjfy.jpg) 对比一下之前同样的提示词、其他模型做出来的效果。 Kimi K3 的版本用「100 个厨师接力加调料」的类比把问题讲清楚了,动画流畅、审美在线: ![Kimi K3 开发的交互动画](https://pic.code-nav.cn/post_picture/1601072287388278786/jySCqQJByISVwlCQ.jpg) Claude Opus 5 做得更全面,背景有漂浮的光点,还自己加了几道随堂测验题,检查用户学习知识的效果,更像是一个系统化的知识讲解网站。 ![Claude Opus 5 开发的交互动画](https://pic.code-nav.cn/post_picture/1601072287388278786/ZGTmZQNgh3XlleHx.jpg) 回看 DeepSeek V4 Pro 这个版本,文字溢出、连线错位、动画敷衍,前端效果明显拉胯了。 我的评价是「拉」。 ### 2、3D 版动画知识讲解 还是同一个知识点,这次换成 3D 场景来呈现。 提示词里除了联网搜索,我还要求它用 Context7 查一下所用 3D 库的最新文档,别拿过时的 API 来写。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Bp3xSejupDOemubb.jpg) 看下效果,整体网站的配色是科技风,背景有飞舞的粒子效果。布局很清晰,通过左下角的面板学习知识、控制动画步骤。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Km6FNTr6MwnyYuUH.jpg) 3D 动画能够正常旋转缩放,没有明显的错位问题,也没有任何的卡顿。工程上的分块注意力残差也用金色连线做了可视化。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/KIz9Lngi0Pc6PoA9.jpg) 不过跟之前的模型比,差距还是有的。 Kimi K3 的版本干净利落,重点全在 3D 动画演示上,3D 的效果更生动: ![Kimi K3 的 3D 版本](https://pic.code-nav.cn/post_picture/1601072287388278786/2ILzD8EBjZwYK1Vg.jpg) 再看看 Claude Opus 5 的版本,我刚打开网页就被惊艳到了,科技感爆棚,还能并排对比多种残差模式: ![Claude Opus 5 的 3D 版本](https://pic.code-nav.cn/post_picture/1601072287388278786/pDooDkwhItfvi2A7.jpg) 相比之下,DeepSeek V4 Pro 的 3D 动画简单了不少,没有让我眼前一亮的感觉。我的评价是「NPC」。 ### 3、竹知了仿真网页游戏 竹知了是中国传统的竹制玩具,一根竹签上串着一片薄竹片,用手搓动竹签让竹片高速旋转,竹片切割空气产生振动,发出类似夏天蝉鸣的「哇呜哇呜」声。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/L30jrYg6SpWie3mc.jpg) 这道题同时考察了前端效果、物理引擎和实时声音合成,而且效果好不好只能靠耳朵听、凭自己的手感来玩,代码写得再漂亮也没用。 先看 DeepSeek V4 Pro 做的效果。界面中规中矩,象征性地画了几颗小竹子,但没什么氛围感。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/mTzpAgHx5Fje0m6d.jpg) 游戏的操作方式很简单,用鼠标拖拽让竹知了旋转起来。页面上还支持开启体感模式,摇一摇手机或转动手腕就能驱动竹片旋转。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/yKXVmb3KBv6kpA8C.jpg) 不过发出的声音竟然是《嗡嗡嗡》的,跟我想要的那种《哇哇哇》的蝉鸣声完全不搭,配不上 1000 万以内最好的玩具! 这道题我还额外用 DeepSeek V4 Flash 拿同样的提示词跑了一遍,结果还挺意外的。竹知了的结构变了,声音也更接近我想要的那种哇哇声。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/pt5FeZJ38Ef6ASfZ.jpg) 怎么回事,感觉这版的前端效果居然比 Pro 版更好了??? 不过综合来看,这两个版本都比较一般,没什么惊喜,我的评价是「NPC」。 ### 4、网页 PPT 生成工具(内置 AI) 前面三个都是开胃小菜,接下来该测测它的全栈工程能力了。 用户在网页上粘贴一段长文案,后端调用大模型把文案拆解成多页 PPT 结构,前端渲染成可以全屏演示、键盘翻页的网页 PPT,还要支持切换配色主题和导出 HTML 文件,后端用流式输出,前端实时显示生成进度。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/6I6QPaFJxdRosEBo.jpg) 这道题相当于对 DeepSeek V4 Pro 的双重验证。项目代码是它写的,项目里内置的那个大模型接口填的也是它自己,一举两得,同时测试了它的编码能力和内容生成能力。 来看看效果,整体界面布局和风格还算中规中矩,左侧输入生成 PPT 的长文案,右侧预览 PPT 成品效果。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/uBrzMmyJ2c95t2SH.jpg) 输入一段长文案,点击生成,左下角可以看到生成进度和 AI 大模型的实时输出。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/JlNodv3B82OpDyzN.jpg) 但这个「实时输出」其实不是实时的…… 等了很长一段时间之后,好像是 AI 全部生成完了,才开始流式输出的。这算是一个明显的 Bug。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/eMcfWQtiXgbp7peP.jpg) 再看看最终生成的 PPT 效果吧,额,很难评…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/jyUE38ygtGpKgHKb.jpg) 文字内容基本都堆在左边,右侧那么多空白留着干嘛? 可以切换 PPT 的主题配色,也能导出为独立的 HTML 文件,这些功能是正常可用的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/21tH4JFGpJRZV9uI.jpg) 对比一下之前的模型。 Kimi K3 做出来的版本比较简陋: ![Kimi K3 的 PPT 工具](https://pic.code-nav.cn/post_picture/1601072287388278786/tXOZSHNDrla6qfb2.jpg) Claude Opus 5 做出来的更像一个成熟的工具产品,配色主题起了极光、象牙这种很形象的名字,还自己加了「填写额外生成要求」的功能: ![Claude Opus 5 的 PPT 工具](https://pic.code-nav.cn/post_picture/1601072287388278786/uTatxHtyolooBi5x.jpg) 相比之下,DeepSeek V4 Pro 做的前端效果就比较一般了,离可交付有距离。 不过它起码也是跑通了前端 + 后端一整套完整的 AI 生成业务流程了,我的评价是「人上人(低配版)」。 ### 5、在线抽奖系统 接下来让 AI 开发一个人人可用的在线抽奖系统,使用场景是公司年会、社群活动、直播间抽奖等等。 管理员可以创建一场抽奖活动,配置好每档奖品的名额,生成参与链接和二维码;参与者打开链接填昵称报名;到点管理员点击开奖,大屏上滚动出中奖名单。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/lrG3pJp45jDkcuZv.jpg) 前面几道题拼的是审美和创意,这道题拼的是工程严谨度。 - 名额绝对不能超发,一等奖 1 名就只能出 1 个人,哪怕同一瞬间有海量请求涌进来也一样。 - 同一个参与者在同一场活动里最多只能中一次奖。 - 开奖操作必须幂等,管理员手抖连点五下开奖按钮,结果也只能产生一轮。 来看下效果。 光看到这个界面,我已经没什么期待了,这也太丑了叭!我以为高低得整个转盘呢。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/LeCCzEGFDzb5ZJ3N.jpg) 试试功能,能够在管理后台正常新建活动、配置奖品名额。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/QyQLMpNgmtsMf1Ye.jpg) 参与者可以通过扫描二维码报名参与抽奖,这个流程还挺方便的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/1WaXQGX1GAWbHDUp.jpg) 管理员开奖后,参与者可以实时看到中奖结果: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/YMHelywLnsId9wM5.jpg) 我让其他 AI 帮忙验证了后端逻辑,1000 人抢 100 个名额,中奖总人数正好 100,没有超发,也没有重复中奖。后端的幂等和并发控制是做到位了的。 作为一个小工具使用,是足够的了。唯一的硬伤就是太丑了,太一板一眼了,让我感觉像是 2024 年的模型搞出来的前端。但后端逻辑没毛病,综合来看给到「人上人(低配版)」。 ### 6、以撒的结合肉鸽游戏 接下来是一个更有挑战性的游戏项目。 以撒的结合是我小孩儿时代很爱玩的一款肉鸽游戏,玩家在随机生成的房间里探索,用射击消灭敌人,清完一个房间开门进下一个,每层有若干房间和一个 Boss 房。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/vA2c3L7UbLwAU1Gu.jpg) 我让 AI 复刻核心玩法,包括随机地牢生成、射击战斗、道具系统、属性系统,至少 3 种普通敌人和 1 个 Boss,图形素材全部用代码绘制。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Wy2ME8bVRCe0w5SB.jpg) 这道题的图形素材全部靠代码一笔一笔画出来,画成什么样模型自己心里其实是没数的,所以这道题最能看出不同模型之间的水平差距。 来看看 DeepSeek V4 Pro 的版本。游戏名叫「地下室:泪之回廊」,好家伙,游戏名称都一股 AI 味儿。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/fKdF54K4q1Z5z8z4.jpg) 进入游戏,开屏暴击。来看看这个人物形象,带着个面罩,我是小偷啊我是?不过小人的眼泪标志还是致敬了原版。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/WtGeCP1ffLFZbrn7.jpg) 你别说,游戏是真的能正常玩耍的,而且体验竟然还不错。怪物也有点儿以撒的结合原版的味道,数值系统和宝箱机制都还原了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/F4zVqPyno1PNvX0V.jpg) 还能打 Boss,难度适中: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/4pbZe4CHfTOhx6rT.jpg) 不过游戏只有 1 层,打完 Boss 就结束了,非常单调,离成品还差得远。 对比一下之前其他模型做出来的效果。Kimi K3 那次做出来的界面看着简陋,但玩法链路是完全跑通的,能发子弹、能杀怪、能吃道具: ![Kimi K3 开发的以撒游戏](https://pic.code-nav.cn/post_picture/1601072287388278786/9ykm23qQa87zw8xG.jpg) 再看看 Claude Opus 5 做出的游戏。我一打开游戏主页 DNA 就动了,小怪很多都是原版里有的,Boss 机制也跟原版神似: ![Claude Opus 5 开发的以撒游戏](https://pic.code-nav.cn/post_picture/1601072287388278786/K05z3rablQifA345.jpg) 可以发现,DeepSeek V4 Pro 的效果比 Kimi K3 好不少,怪物的行为逻辑和战斗手感都上了一个台阶。但跟 Claude Opus 5 的差距不是一点半点。 我的评价是「人上人」。 ### 7、全栈 AI 编程工具 最后一个项目,直接把难度拉满。 我让它克隆 VS Code 的开源代码,在这个基础上开发一个复刻 Cursor 核心体验的 Web AI 编程工具,要支持 Editor Window 代码编辑器和 Agents Window 对话工作台两种模式,两个窗口之间能自由切换,Agent 还得能自主读文件、改代码、执行终端命令。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/0PFb2xvZ45BxyBXG.jpg) 这是 7 道题里唯一的长程任务,考察模型能不能在一个几十万行的代码库面前稳定运行、不跑偏。 来看看成品,虽然跟真实的 Cursor 差距甚大,但整体布局还是合理的。在 Editor Window 编辑器模式中,能够顺利打开和编辑文件,还有代码提示和高亮。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/cKsLbvFuaaxKx4mf.jpg) 切换到 Agents Window,创建一个新的 AI 对话,让它帮我开发一个推箱子游戏。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/qZy3yZrlwL1l3OmF.jpg) 可以看到 AI 能够执行命令、调用工具来查看文件,然后自己编写代码。等了一会儿,AI 完成了开发。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/YtQRtdayvn3B7fq1.jpg) 开发完成后,直接让 AI 把网站跑起来。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/rSxZ25iFHZMgEUeV.jpg) 来看下我用 AI 做的 AI 编程工具开发出的推箱子游戏,效果还不错,能够正常玩耍: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/SS4S6Ct3HeIR61xk.jpg) 有个细节值得说一下。虽然提示词要求 AI 在 VS Code 源码基础上开发,AI 也确实克隆了 40 多万行 VS Code 代码,但实际上 AI 转头用 `monaco-editor` 这个 npm 包另起炉灶写了个独立的 React 应用。 从工程角度来说这个选择是合理的,毕竟直接改造 VS Code 源码是要消耗大量成本的,但 AI 也没跟我打声招呼。 跟之前的模型对比一下。 先看看 Kimi K3 做的 Cursor,双窗口的核心能力也是跑通了的: ![Kimi K3 开发的 AI 编程工具](https://pic.code-nav.cn/post_picture/1601072287388278786/oyr6iIGC7mlzw5eN.jpg) Claude Opus 5 做的版本几乎完整保留了 VS Code 的精髓,代码高亮、代码小地图、管理面板都在,妥妥的降维打击! ![Claude Opus 5 开发的 AI 编程工具](https://pic.code-nav.cn/post_picture/1601072287388278786/mfN1bUBpx5yD2cFS.jpg) DeepSeek V4 Pro 的版本 Editor 和 Agent 双窗口都能用,交互体验也没有明显的问题。 开发这种复杂的长程任务没有翻车,我可以给到「顶级」评价。 ## 我的感受 7 个项目全部跑完了,聊聊我的真实感受。 先说 AI 编程能力,DeepSeek V4 Pro 的前端能力可以说是远远低于我的预期。交互动画的文字溢出、PPT 的排版失衡、抽奖系统的刻板界面审美,跟 Claude Opus 5 和 Kimi K3 做出来的效果差距很明显。 但是后端能力还不错。PPT 生成工具跑通了完整的 AI 生成流程,抽奖系统的并发控制和幂等逻辑做得很到位,全栈 AI 编程工具的 Agent 模式也能正常工作。 而且关键是 7 个项目全部能跑起来,没有出现依赖装不上、服务启动报错这种需要人工救场的情况。 整体来看,DeepSeek V4 Pro 在 AI 编程能力上,跟国外顶尖模型的差距还是很明显的。后端逻辑可以放心交给它,但如果你对前端效果有要求,还是得上 Claude 这个级别的模型。 DeepSeek V4 Pro 还有一个对 AI 编程影响极大的短板,就是没有视觉理解能力。它写完页面之后没办法自己截图看一眼效果对不对,前端布局有没有错位、配色好不好看,这些它全都判断不了。我这次专门搭了一套 Playwright Harness 来替它做验证,但 Harness 只能抓报错和 DOM 断言,涉及到「好不好看」的判断还是得靠人工。 比如开发《以撒的结合》游戏时,地板的配色代码逻辑是对的,颜色确实画了,但是选了一个跟纯黑几乎分不出来的暗色,人眼看上去就是一片漆黑。模型自己完全发现不了这个问题。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/4z5XDhNXsKWvwztq.jpg) 然后揭晓本次测试花费的总金额。 你敢相信么,这么多项目跑下来,竟然只花了 **5 块钱左右**??? 该说不说,DeepSeek 的性价比是真的高。 ![DeepSeek 消费面板](https://pic.code-nav.cn/post_picture/1601072287388278786/d7OkRBV7phpobW3e.jpg) 这么便宜主要是因为 DeepSeek 的缓存命中率实在太高了,平均达到 99%,绝大部分输入 Token 的计费几乎可以忽略不计。 而之前我用 [Claude Opus 5](https://mp.weixin.qq.com/s/NMHSFUq8lpY2inlWN7LFaA) 跑了 7 个项目,花了 900 多块。DeepSeek V4 Pro 只花了 5 块钱,**差了 180 倍!** 不过 DeepSeek 官方说近期会整体上调 API 的价格,而且涨幅较大,所以珍惜现在这个价格吧,先多蹬 AI 一会儿。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/qwens1tootvt2Yf5.jpg) 另外简单对比一下 DeepSeek V4 Pro 和 V4 Flash。开发竹知了游戏时,Flash 跑了 15 分钟、花了 7 毛,Pro 跑了 11 分钟、花了 4 毛,两个版本的完成度和效果差别不大。 说实话,我现在没有明显感受到 DeepSeek V4 Pro 和 V4 Flash 之间的差距,在我的使用体感而言,它们算是同一档的模型,都可以独立完成全栈开发的任务。 **但无论是前端效果还是交付成果的质量,都跟国外顶级的大模型有差距。** 不过由于时间有限,这块的测试还不够充足,感兴趣的同学也可以自己试试。 我的建议是,在学习 AI 编程阶段,或者对于一些日常小工具、内部系统、快速验证想法这类不太在意前端精细度的任务,用 DeepSeek 完全没问题,节省成本。如果你要做面向用户的产品,可以先用 DeepSeek 跑一遍 Demo,调通提示词、明确功能和业务流程,再切换到 Claude 这个级别的模型去系统开发,这样既省钱又高效。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/SA7zhDOOJtXcPIJH.jpg) ## 最后哔哔 看到这里,你觉得 DeepSeek V4 Pro 的表现怎么样?这波是梁子还是梁神? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/WqfYIV90DOe12hG1.jpg) 至少 DeepSeek V4 Pro 是不及我的预期的,毕竟等了这么久,结果正式版在 AI 编程上的体验并没有给我惊喜。 不过 DeepSeek 应该还有大招没有发。 按照官方那个公式,**Model + Harness = Agent**,模型这一半算是交付了,他们自研的 Harness 框架应该也快了。 等 Harness 正式发布,DeepSeek V4 Pro 的 Agent 能力可能还会再上一个台阶,到时候可以再测一波。 OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/uw64R4cEt7Y8GYhu.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 欢迎在评论区聊聊:你会把主力模型换成 DeepSeek 吗?你现在跑 AI 编程一个月大概花多少钱?

Claude 官方让我砍掉 80% 的提示词,效果真的更好吗?

大家好,我是程序员鱼皮。 前段时间 Anthropic 在官方博客发了一篇文章,说他们针对 Claude Opus 5 和 Fable 5 这两个新模型,删掉了 Claude Code **超过 80%** 的系统提示词,但在编码评测上的表现居然没有下降! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/emnjrvKWABXx9b7T.jpg) 我当时的第一反应是:之前我花大力气写的那些提示词都白写了??? 删掉 80% 的提示词,效果居然没变? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/IsoomC4chQX65R6A.jpg) 但仔细想想,又觉得很合理。之前我写的很多规则,本质上是在弥补旧模型判断力的不足。当模型能力跟上来之后,这些规则反而成了束缚。 这就好比你教一个新手司机开车,需要告诉他红灯停绿灯行、转弯前先打转向灯。 但你不会对一个十年驾龄的老司机重复这些话,因为他早就内化了这些规则。你多说一遍,他反而会分心。。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/GSfvqJEZvcfBh1jC.jpg) Anthropic 在他们关于上下文工程的系列博客中提出了 2 个概念,可以很好地解释这件事。 第一个叫 **注意力预算(Attention Budget)**。AI 模型和人一样,工作记忆是有限的。你给它的上下文规则越多,它花在权衡这些规则上的注意力就越多,留给真正干活的注意力就越少。 第二个是 **上下文的边际递减效应**。上下文中的 Token 数量越多,模型精确召回信息的能力就越差。就像你一次性塞给一个人 100 页文档,让他同时记住每一页的细节,根本不现实。 ![注意力预算与边际递减效应](https://pic.code-nav.cn/post_picture/1601072287388278786/axDMS1lC2m4mY5Ze.jpg) 现在大家应该明白 Anthropic 为什么要砍这么多系统提示词了吧。 那具体是怎么砍的呢? ## Anthropic 具体改了什么 Anthropic 在这篇官方博客中总结了好几个关键转变,我挑几个最有价值的来聊聊。 ### 1、从定死规则到让模型自己判断 早期为了防止 Claude 误删代码或乱写注释,通过系统提示词把规则写得很死,比如下面这段: ```markdown 默认不写注释。永远不要写多行文档字符串或多行注释块,最多一行简短注释。除非用户要求,否则不要创建规划、决策或分析文档。 ``` 这种「一刀切」的规则肯定不够灵活。比如有些复杂代码确实需要多行注释,有些用户也有自己的文档偏好。 但没办法,旧模型的判断力不够,不这么约束它就容易乱来,团队只能接受这个折中方案。 到了新模型时代,这条长长的规则被精简成了一句话: ```markdown 写出来的代码要像周围的代码,匹配它的注释密度、命名方式和惯用法。 ``` 这样一来,模型就会根据项目现有的代码风格来自动适配,而不是被前置规则限制住了选择。 ![从定死规则到让模型自己判断](https://pic.code-nav.cn/post_picture/1601072287388278786/xLGDrQBruFOG2Y7W.jpg) ### 2、从给示例到设计好接口 以前有个经典的提示词技巧叫 Few-shot,就是给 AI 举例子。 比如 AI 不知道怎么调用某个工具,你就写 3 个示例给它看。 但 Anthropic 发现,在新模型上面,示例反而会限制模型的探索空间,因为新模型的理解能力比你给的示例更强,示例反而把它框住了。 他们的建议是,与其写一堆示例教 AI 怎么用工具,不如把工具本身的用法设计得更清晰。 他们拿 Claude Code 里管理待办任务的 Todo 工具来举例,这个工具有待办、进行中、已完成三种状态,参数名分别叫 `pending`、`in_progress`、`completed`,AI 一看就知道什么意思,根本不需要你再写示例教它。设计好的接口自己就能说明用法,只有设计辣鸡的接口才需要一堆说明书。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/TXa0729fHpPUHrEk.jpg) ### 3、从一股脑全塞进去到按需加载 以前 Claude Code 的系统提示词里包含了大量关于代码审查、验证等方面的详细指引。这些内容不是每次都用得到,但万一需要的时候又很关键,所以只能全塞进去。 现在 Anthropic 把这些内容拆成了独立的 Skills 技能包,模型在需要的时候才去加载。甚至连一些工具定义也做成了「延迟加载」模式,模型要用的时候才会通过 ToolSearch 去获取完整的工具描述,平时不占用上下文。 Anthropic 把这种策略叫做 **Progressive Disclosure 渐进式披露**,经常看我文章的朋友应该对这个术语不陌生了吧? ![渐进式披露按需加载](https://pic.code-nav.cn/post_picture/1601072287388278786/zY1hK6tp4ISzoB57.jpg) 这个思路也适用于我们自己写的 CLAUDE.md 和 Skills 文件。很多人喜欢把 CLAUDE.md 写成一个事无巨细的百科全书,觉得如果不写全,模型就找不到。 但 Anthropic 建议把内容拆成多个文件,形成一个树状结构。就像你整理电脑文件一样,不会把所有文档都堆在桌面上,而是按类别分到不同的文件夹里,需要什么就打开什么。模型处理上下文也是同样的道理,让它在合适的时机加载合适的内容就行了。 ### 4、从手动记忆到自动记忆 以前用户需要手动按 `#` 快捷键把重要信息保存到 CLAUDE.md,现在 Claude 会自动保存和你工作相关的记忆。 CLAUDE.md 的定位也因此发生了变化,Anthropic 建议将它保持轻量,重点写项目中的「坑」和那些模型看代码看不出来的特殊约定。像目录结构、依赖列表这种模型自己就能读到的信息,就不需要再手动写进去了。 ![从手动记忆到自动记忆](https://pic.code-nav.cn/post_picture/1601072287388278786/dJvR8czAydfUn1JG.jpg) ### 5、矛盾指令的问题 Anthropic 在审查自己团队使用 Claude Code 的对话记录时,还发现了一个有意思的问题。 同一个请求里,系统提示词说的是「适当添加文档」,但 Skills 里又写了「不要添加注释」,两条指令是矛盾的。 虽然模型大部分时候能根据上下文猜到用户的真实意图,但它得额外花精力去处理这些冲突,白白浪费了注意力预算。 于是他们砍掉了冗余的规则,这类矛盾自然就少了很多。 ![矛盾指令让模型困惑](https://pic.code-nav.cn/post_picture/1601072287388278786/WmpWemxcOZ6ktNma.jpg) OK,原理讲得差不多了。为了直观地感受新模型在短提示词下的表现,我做了一组实战对比测试。 ## 实战对比 我用的是 Cursor + Claude Opus 5 来做这个测试,任务是让 AI 复刻一个 Cursor 网页版,分别用风格完全不同的两种提示词来跑。 第一种是规则堆砌型的长提示词,包含一堆具体的技术要求和开发步骤: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/f3NtJxpANLwPugPC.jpg) 第二种是短提示词,就 5 行话,只说了要做什么和用什么方式调研: ```plain 基于 VS Code 开源生态做一个类似 Cursor 的 Web AI 编程工具, 支持 Editor Window 和 Agents Window。 先用 Firecrawl 搜 Cursor 3 的产品设计, 再用 Context7 查 monaco-vscode-api 的 Web 集成方案, 调研完先出技术方案,确认后再写代码。 ``` 有趣的是,两种提示词在正式写代码之前就表现得不一样了。 在前期调研规划阶段,短提示词那边主动进入了 Plan 模式,先规划好完整的 Todo 列表才开始动手;长提示词那边反而没有进入 Plan 模式,收到指令就直接开写了。 ![短提示词规划后的 Todo 列表](https://pic.code-nav.cn/post_picture/1601072287388278786/a5qFdky1Kadqisy8.jpg) 从代码量来看,短提示词版本一共跑出了 `12984` 行代码,长提示词版本只有 `8384` 行,少了将近三分之一。可能我们正常的直觉是,提示词越长、信息量越大、生成的代码量就应该越多。但结果恰恰相反,说明短提示词下 AI 反而更能「肆无忌惮」地探索和生成。 从成品效果上来看,短提示词生成的代码一次跑通,而且功能相当齐全。 可以正常切换 Edit 和 Agent 模式窗口,目录树加载正常,文件的增删改查都没问题,代码语法高亮和自动补全也有,甚至连 git 功能都做了。除此之外还支持切换主题、终端可以正常使用、搜索和快捷键也都到位了。最关键的是,Agent 模式可以正常接入模型来生成代码。 ![短提示词版本](https://pic.code-nav.cn/post_picture/1601072287388278786/ozRIYvDWo1s9d6uw.jpg) 长提示词生成的效果就有点儿翻车了…… 放张图大家自己感受一下差距吧,高下立判。 ![长提示词版本](https://pic.code-nav.cn/post_picture/1601072287388278786/7VAnW8fMqsRdlczj.jpg) 得益于 Opus 5 模型的智能,两种提示词生成的 Cursor 网页版都能正常调用 AI Agent 来生成代码。我把它们都接入了 DeepSeek API,让它们各自写一个贪吃蛇小游戏,用的模型是最新的 DeepSeek V4 Flash,生成过程很丝滑。 短提示词做的 Cursor 在生成代码前会显示思维链和调用了什么工具,整个交互体验更完整。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/HQqbhb5Tzgnx56pe.jpg) 长提示词做的 Cursor 则是直接开写,没有思维链展示。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/gUvMo2N4n0k1Quk3.jpg) 不过两个版本的交互体验都做得不错,举个例子,生成的代码都带有接受和拒绝的操作按钮。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/B0xFEMuDIBO0jjaD.jpg) 最后两个版本的 Cursor 生成的贪吃蛇小游戏都能正常运行。AI 发展成现在这样,我居然能够轻松地用 AI 编程工具做个 AI 编程工具,然后让做出来的 AI 编程工具再来 AI 编程了…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xqipiwAprtfioMLz.jpg) 测试做到这里结果已经很明显了。短提示词开发的 Cursor 无论是功能完善度、代码质量还是一次跑通的成功率,都完胜长提示词版本。 核心原因就在于,长提示词把模型的行为框住了,它只敢在你划定的范围内做事。而短提示词给了模型足够的探索空间,模型自己根据对 Cursor 这个产品的理解,主动补全了很多它认为应该有的功能。 ## 我们应该怎么做 以前模型能力不够,对很多产品和技术的认知是模糊的,你必须手把手告诉它每个细节。现在新模型的训练数据更丰富、推理能力更强,再加上有 MCP、Skills 这些工具让模型的探索自由度更高,那些重复的规则反而成了负担,既浪费 Token,又抢占模型干活时的注意力,还容易跟其他 Skills 的规则产生冲突。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/KFpobb3K9szRDB0p.jpg) 那我们该怎么判断一条提示词有没有必要写呢? 我是这样判断的:**如果一件事是这个任务天然就包含的常识,就不用写**。 比如你让 AI 写一个 REST API 接口,不需要告诉 AI 要处理错误、要返回 JSON,这些模型已经知道了。 **如果一件事是这个任务的特殊要求,跟通常做法不一样,才需要明确告诉模型**。 比如你的项目规定所有接口必须用 snake_case 命名、错误码必须遵循某个内部标准,这些才是值得写进规则的内容。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/OGZTMsCLNa1Gq5fY.jpg) 换个角度来说,你的代码仓库本身就是很好的提示词。项目结构、代码风格、测试用例,这些模型都能自己读到并理解。你要做的是把项目架构设计好,而不是把规则写成一篇小作文。规则写太多,模型反而会把注意力浪费在权衡你的各种约束上面。 ## 用 /doctor 优化项目规则 为了帮开发者跟上这个变化,Claude Code 还内置了一个 `/doctor` 命令(也可以用 `/checkup`)。这个命令可以自动扫描你的 Skills、CLAUDE.md 等配置文件,帮你检测哪些内容是冗余的、哪些可以精简。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/t1wEAzbInPbO6o3s.jpg) 具体来说,它会检查你的 CLAUDE.md 里有没有写目录结构、依赖列表这些模型自己就能从代码库读到的信息,如果有就建议你删掉。它还会找出没用到的 Skills 和 MCP 服务,检测本地和仓库里的 CLAUDE.md 有没有重复或矛盾,针对那些不需要每次都加载的内容,建议你迁移到可以按需加载的 Skills 里。而且所有变更都会先给你看报告,等你确认后才会执行。 我用自己的项目实测了一下,它帮我优化了一部分配置内容,但没有对 CLAUDE.md 做大的改动,说明我这个项目的规则还算健康。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/UT3X0nRY0uQWIrS6.jpg) ## 写在最后 AI 编程领域的变化真的太快了,前几个月我还在研究怎么把提示词写得更完美,还觉得项目规则写得越详细 AI 干活的方向就越准确。结果现在官方直接宣布,之前精心打磨的很多规则其实都是束缚。。 Anthropic 在官方博客的最后总结了一句话,我觉得特别精妙:**找到那组最小的、高信号的 Token 集合,来最大化你想要的结果。** 以后写提示词,少即是多。 Less is More,你的很多提示词真的可以丢掉了。 OK 就分享到这里,如果你对 AI 编程感兴趣,欢迎阅读我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide) ![](https://pic.code-nav.cn/post_picture/1601072287388278786/FlD3OiU5CI499Wtv.jpg) 我是鱼皮,持续分享 AI 编程干货,觉得有用的话记得点赞收藏和关注。 评论区聊聊:你有自己写过完整的提示词或者 CLAUDE.md 规则文件吗?

我找了份月薪 7 万的 FDE 工作,结果进厂贴了一天二维码?!

你好,我是小阿巴。 **AI 时代,我觉得写代码越来越无聊了。。。** 以前写一个接口要折腾半天,现在把需求交给 AI,我接杯水的功夫,它就把代码、注释和测试都生成好了。 刚开始确实很爽,但时间一长,我每天做的事情越来越像机械的流水线,复制需求、等待生成、检查错误、修改提交,几乎不用动脑子。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/zyFeV0BG2E8R7yBA.jpg) 于是我进入了幻想时刻:有没有一种工作,既能继续做技术,又不用一直坐在工位上等需求? 正在这时,我刷到了一条月薪 10 万的招聘信息:DeepSeex 公司正在招聘 FDE。 FDE? 第一眼看到这个缩写,我还以为它是 Frontend Developer Engineering,也就是前端开发工程师。 我还在疑惑:月薪 10 万的前端?前端什么时候复兴了? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/P0sSPjOJiFyZNLtD.jpg) 点开招聘详情一看,完全不是那么回事。 FDE 的全称是 Forward Deployed Engineer,翻译过来叫「前线部署工程师」,是最近两年在 AI 行业特别火的一个岗位。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/0RdUOpNB2ThCLHLB.jpg) 简单来说,很多企业想用 AI 提效,但连第一步该做什么都说不清楚,具体要解决什么问题、先从哪里切入、最终由谁来用,他们自己可能也没想明白。FDE 要做的,就是走进客户现场,把这些模糊的需求变成能上线、有人用的系统。 诶,有点儿意思?这不正是我想尝试的工作么? 于是我随手投递了简历,没想到才 2 天,就被 DeepSeex 这家 AI 公司录取了! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/yEmNqgb56QV2OzNr.jpg) 不过看我没有 FDE 工作经验,刚开始只给我开 7 万月薪。 没关系,我已经很满足了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/XxsCP7ed56q6Jd7n.jpg) 于是果断关停了自己的公司「鱼鸢网络」,第二天就前往新公司报道。 我的导师叫「奶龙·码撕客」,是一名练习时长两年半的资深 FDE。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/4N5bzpjXNNLsfmqG.jpg) 入职当天,他也没跟我多寒暄,直接给我安排了第一个项目,客户是一家生产背带裤的服装厂。 ## 了解客户目标 项目开始前,码撕客先带我和销售同事一起去服装厂开会,服装厂的生产负责人、维修主管、负责信息系统的同学都在场。 生产负责人说:我们想做一个 AI 报修助手,让工人报修更方便,维修记录也能保存下来。以后数据多了,最好还能预测机器什么时候会坏。 码撕客问:工厂现在有多少机器运行数据? 会议室突然安静下来。。 维修主管翻了翻手里的笔记本,有些尴尬地说:我们现在只有机器清单、纸质维修单和工作群里的聊天记录,温度、振动、运行时间这些数据,没有专门采集过。 没有这些历史数据,AI 就无法学习机器出故障前的变化规律,预测也就无从谈起。 码撕客想了想说:那我们先把报修流程理顺,让 AI 帮工人整理报修信息,同时把每次的故障描述和维修结果结构化地保存下来。这样既能解决眼前的效率问题,也能为以后做故障预测积累数据。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Ep9z8qXwJ75SONkN.jpg) 生产负责人同意了这个安排。然后负责信息系统的同学补充了一个要求:报修语音和维修记录必须留在厂内服务器,新系统也不能直接改动原有的数据。 这次会议上,大家对预测维护的想法先放到了一边,我们只确定了一个目标:先把报修流程做通,让工人报修更快、维修记录更完整。 但是具体该怎么做,还是得走进车间才能搞清楚。 ## 进入现场调研 第二天,生产负责人安排 A 车间的吴师傅带我熟悉现场。吴师傅在这家工厂干了很多年,每天踩缝纫机比我敲键盘还熟练,机器声音稍微不对,他马上就能听出来。 我先跟着吴师傅走了一遍完整的报修流程。 1. 机器出问题后,工人先给班组长打电话,班组长再联系维修人员。电话本身只要十几秒,但后面要反复转述故障情况。 2. 维修人员到了现场,还得重新确认是哪台机器、什么时候开始出问题、具体是什么症状。 3. 机器修好后,工人还要补填一张报修表。有的写在纸上,有的发在工作群里,还有人忙完就直接忘了记。下次遇到类似故障,维修人员很难从这些零散的记录里找到上次的处理方法。 好家伙,烂摊子真多啊! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/O3GZ3EM4BEmqAPWB.jpg) 不过鸡智的我很快有了思路:工人对着手机说出问题,AI 自动整理成报修单,然后把工单推送给维修人员。等机器修好后,维修人员再通过语音或者快捷选项把处理结果记录下来。 整个流程看上去就 3 步,我甚至觉得这个项目没什么难度。 小小 FDE,不过如此~ ![](https://pic.code-nav.cn/post_picture/1601072287388278786/XwtJm5F7FVqSS9f1.jpg) 然而随着和吴师傅的深入交流,我才发现事情没这么简单。。。 同一台机器,吴师傅叫它「三号机」,康师傅叫它「老平车」,工厂电脑里的正式名称却是「A 车间 03 号平缝机」。 如果 AI 连工人说的是哪台机器都搞不清楚,后面的一切都白搭。所以码撕客让我先把每台机器在工人口中的各种叫法都记录下来,搞清楚这些别名和正式编号之间的对应关系。 万万没想到,我原本以为接到项目就该回去写代码,结果先站在背带裤车间里,拿本子记录机器外号。 说实话,这时候我心里已经有点犯嘀咕了:FDE 不是技术岗吗,怎么我成打杂的了?别人的入职培训是看文档,我的入职培训是背机器外号??? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/eVLWC3H9LzyxOl4g.jpg) 走完流程、记录完机器的外号之后,我们重新梳理了目标。之前在会议室里客户想的是「AI 帮工人报修」,但到了现场才发现,真正的卡点是信息从工人到维修人员之间的流转:工人说不清楚是哪台机器、故障信息反复转述会丢失、修完之后记录留不下来。 所以我们把目标调整为:工人只需要说清楚问题,AI 负责整理工单、补全信息,并帮助维修人员查找过去的相似记录。至于机器为什么坏、应该怎么修,仍然由维修人员来判断。 ## 确定方案和验收标准 回到会议室,码撕客抛出了一个问题:两周以后,我们拿什么交付才算让客户满意? 我挠挠头说:把 AI 报修系统开发好,部署上去就行了吧? 码撕客摇了摇头:「部署上去」不是验收标准。客户不关心你部署了什么,他们关心的是工人报修有没有变快、维修记录有没有留下来。双方要提前约定好具体的数字,达到了才算交付成功。 于是我们翻了过去一周的报修记录,发现维修人员平均要花 6 分多钟才能收到完整的故障信息,而且机器修好后,留下处理结果的记录还不到一半。 根据这些数据,我们和客户约定了 4 个验收指标: - 报修信息要在 2 分钟内送达维修人员,不能再把工单发错车间 - 至少 90% 的维修任务要留下完整记录 - 至少 80% 的试点工人要实际使用新流程 - 此外,AI 整理关键信息的准确率需要达到 90%,系统才能进入车间试用。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/6u0aU4WUcKCnxbMB.jpg) 标准确认后,我拉着吴师傅一起,先在安静的办公室里做了一轮测试。 吴师傅对着手机说:三号机最近一直咔咔响。 虽然 AI 一个字都没听错,但是却把工单匹配到了 B 车间。 分析后发现,原因很简单,两个车间都有一台叫「三号机」的机器。 头疼啊,AI 听懂了普通话,却没听懂这家工厂的「厂话」! 于是,我放弃了让 AI 仅凭工人的口头描述来判断机器的方案,改成在每台机器上贴二维码。这种做法在制造业其实很常见,很多工厂的设备管理系统都是靠扫码来定位机器的。工人先扫码确认是哪台机器,再描述故障。 我先和负责信息系统的同学核对好机器编号和位置,把每个二维码和对应的机器绑定之后,花了一整天在车间里一张张贴上去。 入职前,我以为 FDE 的技术栈是前端、后端、数据和 AI。 进厂后才发现,我特么还得会贴二维码??? 再多干几天,我觉得自己的简历里都可以加上一条:贴纸端正、无气泡、手速嘎嘎快。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/enAm8tKIzQgEIM2g.jpg) ## 建立评估集 扫码定位解决了「AI 搞不清是哪台机器」这个问题之后,我觉得最大的障碍已经扫清了。 码撕客却不这么认为。他说:吴师傅说一句话,AI 碰巧答对了,这只能算跑通了一个 demo。想要真正达到交付标准,得拿几百条真实报修记录来测,看整体准确率够不够。 这种测试在 AI 行业里一般叫 Evals,可以理解成给 AI 准备一套固定的考题。每次调整提示词、模型或处理逻辑后,都用同一批案例重新跑一遍,看准确率有没有提高。 Evals 是 FDE 做 AI 项目时至关重要的一环。客户验收的时候不会只看你演示一两个案例,而是要看几百条真实数据跑出来的准确率到底是多少。 搞清楚了这一点,我们就开始动手准备测试数据。我和工厂的维修主管翻出了一摞过去一年的纸质报修单,不少纸张已经发黄,上面还沾着机油。工作群里的记录也很随意,有人写「针断了」,有人写「断针」,还有人只留下一句「跟上次一样」。 我们花了两天时间,才从这些材料里整理出了 300 条真实案例。 不出所料,第一轮测试很快就翻车了。 办公室里能听清的话,到了车间可就不一定了。几百台缝纫机同时运转,背景噪音很大,AI 经常把「断线」听成「断电」,把「跳针」听成「掉针」。 结果 300 条测试跑完,只有 81% 的关键信息被正确提取出来,离原定 90% 的验收标准还差不少。 而且过去的维修记录也不好检索,同一种故障在不同工人口中有好几种说法,AI 搜不到真正相关的历史记录。 针对这些问题,我们做了几轮针对性的优化:先在语音识别环节增加降噪处理。然后补充了一套车间常用说法的纠错词典(比如把「断电」在设备上下文里自动纠正为「断线」),再把纸质维修单和群聊记录重新整理入库,统一术语。 重新跑完整套测试之后,准确率从 81% 提升到了 93%,达到了验收标准。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/qKKPYnrzxat2ZEIG.jpg) 当然,这套评估集也不是用一次就扔掉的。系统真正上线以后,新出现的失败案例会持续补充进去,作为下一轮优化的依据。 ## 现场试用和修改 评估集跑通之后,系统进入了 A 车间试用。 结果,又翻车了。。。 虽然整体准确率已经到了 93%,但毕竟还有 7% 的情况 AI 会搞错。我不太放心,就在界面上加了一个确认表格,让工人说完问题后,还要逐项检查 AI 填好的机器名称、问题类型和发生时间,确认没问题再提交。 吴师傅在页面上滑了两屏之后问我:我本来打个电话十几秒就好,用你这玩意儿还要看很久表格? 我有点心虚,客户原本想减少工人报修和填表的时间,我却因为怕 AI 出错,给工人多加了一堆要确认的选项。 码撕客了解情况后,开始撕我码了。 他说,93% 的准确率已经超过验收标准了,为了防那 7% 的错误,你让 100% 的工人每次都多操作一整页表格,这笔账算不过来。不如让 AI 自己判断什么时候没把握,遇到拿不准的才追问一句,大多数情况直接提交就行。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/17SbRkpLiNMAeavs.jpg) 我觉得有道理,就按他说的进行了改版。AI 只在没听清或缺少关键信息的时候才追问一句,不再让工人每次都检查一遍。维修人员修好机器后,也可以通过快捷选项或语音留下处理结果。 驻场试用期间,每隔两天我和码撕客都会向生产负责人和销售同事汇报进展。我白天陪工人测试、收集反馈,晚上回去改系统、重新跑评估集,忙得够呛。 不过协调各方比写代码费劲多了。生产负责人想尽快看到效果,负责信息系统的同学又担心新系统影响正常生产,一线工人又不愿意增加操作步骤。这些不同方向的顾虑都要一件件处理清楚,系统才有机会真正用起来。 ## 上线验收 两周试点结束后,我们按照之前约定的指标逐项验收。 报修信息的送达时间从 6 分多钟缩短到了 2 分钟以内,没有再出现工单发错车间的情况,维修结果的完整记录率从不到一半提高到了 90% 以上,超过 80% 的试点工人开始使用新的报修流程。 达到验收标准后,生产负责人同意把系统推广到其他车间。销售同事也拿着验收结果,继续和客户沟通后续的合作。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/M7pfLiHnym6cF2eV.jpg) 系统推广到 B 车间的第二天,维修主管就给我打了电话。B 车间有几台特殊机型,工人描述故障时用的说法和 A 车间完全不一样,AI 又开始乱匹配了…… 于是我不得不当天赶到现场,补充了一批新的纠错规则,把失败案例加进评估集,重新跑通测试,B 车间的系统才算稳定下来。 太折磨了。。。 FDE 不像普通外包交付完就撤,系统上线以后出了问题,你得第一时间赶到现场自己解决。 项目收尾的时候,码撕客让我把系统的配置方法和常见问题整理成文档,带着工厂负责信息系统的同学走了一遍日常维护流程。 他说:FDE 不能让客户离了你就不会用,得让对方的团队自己能接手,不然以后找你的事情多了去了。 做完交接后,终于回到了公司,我们把这次项目里摸索出来的经验带回了产品团队,包括二维码绑定方案、车间噪音环境下的语音纠错方法、维修记录的结构化整理思路。产品经理觉得噪音环境下的语音处理能力可以做成通用模块,沉淀到产品里,让其他制造业客户也能直接用上。 ## 我的感受 做完这个项目之后,我才真正理解了 FDE 这份工作。 之前觉得不就是去客户那里写代码嘛?实际做下来才发现比想象中复杂太多了。 FDE 要先确认客户的真实目标,把不切实际的需求拉回到当前数据和条件能支撑的范围内。再跟着一线用户走完真实流程,找到藏在日常操作里的真正问题。然后确定方案和可量化的验收指标,开发系统、建立评估集、进入现场试用。根据用户反馈反复修改,直到系统真正跑起来、有人用。最后把现场经验带回产品团队,让产品变得更好。 ![FDE 完整工作闭环六步](https://pic.code-nav.cn/post_picture/1601072287388278786/v2pRCwTME2y6qRpS.jpg) 不同公司的 FDE,具体工作差异挺大的。有的专注做技术交付,商务的事有专人负责。但在不少公司,FDE 还要参与售前阶段的技术评估,甚至帮客户发现新的 AI 落地场景来推动后续合作。有的 FDE 同时服务好几个客户,有的则驻在一家客户那里待上好几个月,不过核心都一样,就是站在客户和技术之间,把模糊的问题变成能上线、有人用、能产生业务价值的系统。 **我觉得这份工作并不轻松,甚至可以说是很有挑战性的。** OpenAI 当前的 FDE 岗位要求出差比例最高可达 50%,真实项目中可能要在客户现场待上几周甚至几个月。除了前后端和 AI 应用开发能力之外,还需要能拆解模糊问题、建立评估方法、处理企业级的系统接入和生产环境部署,更要能同时和客户的技术负责人、业务负责人以及一线员工顺畅沟通。 如果你喜欢研究真实业务,愿意和不同行业的人打交道,也能亲手把系统做出来并看着它被用起来,做这份工作会很有成就感。如果你只想安静写代码,不愿意驻场出差或者处理模糊需求,FDE 可能并不适合你,踏踏实实学好 AI 编程和 AI 应用开发,同样能找到不错的方向。 OK 就分享到这里,如果你也想学习 AI 编程或者 AI 应用开发,可以看看我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe) 和 [原创 AI 应用开发实战项目](https://www.codefather.cn/post/1797431216467001345)。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide) ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/ls0uKPiy8smS1xvT.jpg) 我是鱼皮,持续分享 AI 编程干货,觉得有用的话记得点赞收藏和关注。 你身边有做 FDE 的朋友吗?或者你自己有没有类似的驻场经历?欢迎在评论区分享一下感受。

AI编程已经如此强大,我们还需要再学习基础嘛?或者说初级程序员还有可能存在吗?

**#** AI编程已经如此强大,我们还需要再学习基础嘛?或者说初级程序员还有可能存在吗? > 作者:sunshine > 发布时间:2026-08-04 不知道大家已经多久没有写过代码了, 我不是说 给AI描述需求,让AI去生成代码。 而是说**古法编程**, 你已经多久没有正经用过编辑器开发了,大多数时候可能都是在**描述需求**。 AI编程现在基本上已经成为开发的主流了,或者说大家已经习惯了**懒**,大多数时候能用AI绝不手写。 这种背景下,还有必要学一些基础嘛? 初级程序员在这个行业还有存在的必要吗? 其实说实话,我也很久没写代码了。 大多数时候都是在给AI描述需求,让它去生成代码。 因为就算是我自己上手写,也不见得比AI生成出来的更好。 最关键的是AI写代码太省事儿了, 你只需要描述好你的需求,回车以后,你就可以打开手机了。 我惊讶的发现一个事儿:**人习惯了懒以后,就永远回不到勤快的时候了。** 之前公司因为网络故障断网,我就是静静的等待网络恢复,绝不可能先上手写着。 但是AI编程之前,还是会先写着,等网络恢复了再查一下文档补上不确定的部分就算**齐活了**。 在这种背景下你说基础重要吗? **其实不重要!** 因为自己根本就不上手写代码,又何谈基础呢? 整个项目除了架构是你做的,其他的基本上没你啥事儿! 甚至架构本身也没你啥事儿,你的工作就是需求的**沟通器**,AI的**翻译机**罢了。 但是真的不重要吗? **其实很重要!** AI现在的确非常强,但是有时候AI会陷入一个怪圈。~~(我至今没找到解决方案)~~ 现在出现了BUG,我让AI进行修改,它给出了A方案。 我运行以后告诉它:不对。 然后它给我B方案。 我运行后仍然发现:不对。 现在它给我C方案。 我运行以后发现还是不对。 这时候,AI要不然就是在这几个方案中循环,要不然就是开始胡说八道。 这时候,基础的重要性来了。 如果你有基本的底子,大多数代码你是能够看明白的,虽然AI生成的部分逻辑确实非常绕,但是逐步分析基本上还是能够解决问题的。 如果基础不行,那AI说啥就是啥了,即便它忽悠你。 所以:**剑好用,也要看执剑人是谁!** 基础的存在代表你对这部分代码有基本的判断能力和掌控能力,AI的确很强,但是也并非强的没有边界。 如果AI真的能够强到没有边界,那程序员这个行业将就此消失! 有基础其实对整个工程而言代表你能兜底,即便是明天没有AI了,你能让整个系统继续下去,而不至于完全瘫痪。 并且现在的AI对于工程化部分仍然存在着诸多问题,尤其是调优和极端情况覆盖。 绝大多数情况下,我们让AI输出的代码都是实现某个需求最为简单的方式,换句话说就是从A点到B点最快的路。 但是最快的路并不代表就是最好的路,环境是千变万化的,极端的网速,极端的设备,甚至是极端的IE~ 所以高级程序员在项目中存在的价值就是这些, 但是没有一个高级程序员是**空中楼阁的高级**,都是从 **基础 ——> 高级** 的。 ## AI已经足够强了,初级程序员还有可能存在于这个行业吗? **有!** 首先一个核心问题,出了事儿谁背锅? 总不可能是AI背锅吧? 你要不然让豆包或者Claude Code给你道个歉? 所以这个行业总归还是需要人的,不光需要高级,也会需要中级、初级。 但是AI编程发展的如此强大的今天,**初级岗位会迅速的缩水。** 相当一部分初级岗位被 **中级程序员 + AI** 替代了,而高级程序员大多集中精力解决项目中的难点。 对于初级的需求变少了,意味着对于初级要求变多了,甚至说对于一个刚毕业的学生,对你的要求直接就是**中级的要求**。 或者说要求你的学历,你的项目经历... **行你就来,不行就拜拜!** 这是公司,挣钱的所在! **不会有人再培养你,也不会有人迁就。** 初级老哥们处境变得尴尬了许多!干,意味着你要忍受诸多的不合理。不干,意味着你不一定有更好的去处。 尤其对于我们普通专科,二本的毕业生而言。 且行且珍惜吧,望大家共勉!

27 岁,我终于做出了自己的游戏!但是一行代码都没写

大家好,我是程序员鱼皮。 这是我在小孩儿时期最喜欢玩的游戏,做梦我都想不到,现在我竟然一个人从 0 做出了这个游戏,而且我只投入了 10 分钟! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/MJlEb73KVLBiXImK.jpg) 没错,这是我用目前最新的 AI 大模型做的游戏,《以撒的结合》网页版! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/VXt7MRshee2eXkyH.jpg) 大家猜猜看,我用的是什么大模型?跟 AI 对话了多少轮?又花了多少 money 呢? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/9wRIeIKehxRpmsR1.jpg) ⭐️ 推荐观看本期视频版,演示效果更好:[https://bilibili.com/video/BV1sQGA6EEjp](https://bilibili.com/video/BV1sQGA6EEjp) 先揭晓前两个答案。我用的是 Claude Opus 5 模型,虽然 A ÷ 老是封禁账号、搞各种花里胡哨的骚操作,喂饱了我们这些 AI 编程博主。 **但我测试下来,这个模型是真的强。** 我是在 Cursor 这个 AI 编程工具中使用的,双剑合璧,让我完完全全从 0 开始,**只跟 AI 进行了一轮对话**,就开发出了你现在看到的成品游戏。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Xr2UXNOnxGVoXHdu.jpg) 你肯定很好奇:一轮对话就搞定了?那提示词写的肯定很牛呗吧?! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/FWnvJYVdRwbJLxJx.jpg) 来给你们看下完整的提示词,虽然又臭又长,但基本全是 AI 生成的,原始需求就那么两段,然后我让 AI 逐步迭代优化,扩展成了现在这样。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/5wYeIs1M449OkXp0.jpg) 细品这段提示词,你会发现几个亮点。 - 需求写得足够明确具体 - 让 AI 利用联网技能搜索原作的游戏机制作为参考 - 还用了 Loop Engineering 循环工程的思路,让 AI 每完成一步就自己测试验证,发现问题自己修复,不断循环推进直到交付成品。 你肯定很好奇:AI 会不会是联网搜到了原版游戏的源码,然后直接抄下来改巴改巴就完事儿了? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/P81kHAjPWornt1pc.jpg) 来,我带大家看下 AI 的执行过程。 AI 搜索的是原本游戏的机制和美术风格,然后自己从零写了 5000 多行代码,所有图形素材都是用代码画出来的! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hSqNKsX0dLrkDCQl.jpg) 接下来 AI 会自己打开浏览器运行游戏、通过截图检查效果,甚至写了一个机器人去试玩自己的游戏! 然后发现难度太大、根本玩不了,于是自己定位和修复问题,调整了几个小时才终于交付。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/24pxD267frQv9sdX.jpg) 这就是 Opus 5 恐怖的工程能力,虽然慢了点儿,但这个过程完全不需要我人工花时间,睡了一觉,游戏就做好了~ ![](https://pic.code-nav.cn/post_picture/1601072287388278786/LI1sAB1NhXSrxD0o.jpg) 而且成品质量相比其他模型,真的是降维打击!!!(不信你们自己试试) ![手机上也能爽玩](https://pic.code-nav.cn/post_picture/1601072287388278786/dqCqV3pmGLkPdiAm.jpg) 接下来,我又开了个新对话,让 AI 帮我进一步扩展游戏,自主测试验证,并且要直接给我交付成品! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/c2Kg4nwefHDs6hRV.jpg) 一觉醒来,AI 完成了任务,激动的心,颤抖的手,咱们来玩玩看。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/OGo645Ns8t7CNH0i.jpg) 怎么样,怎么样,怎么样? 虽然比不上原版,但 AI 独立做到这个完成度,确实超出我的想象了,我自己试玩了半个小时都停不下来。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/A0JAUKLBze63i4Yq.jpg) 还没完! 我想让大家都能玩上我做的游戏,怎么办? 我只要再跟 AI 说一句话,让它用 EdgeOne Makers 网站部署技能直接上线。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/wC5c10ryCxQix18E.jpg) 很快 AI 就搞定了,还可以绑定一个自己的域名。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/vc569yyZu8WSKK7w.jpg) 好了,现在大家都可以玩了~ ![](https://pic.code-nav.cn/post_picture/1601072287388278786/O1trZkSRGtxLAVoL.jpg) 还没完! 我想让更多人帮我一起扩展游戏,怎么办? 我只要再跟 AI 说一句话,让它帮我生成带有截图的项目介绍文档,并使用 GitHub MCP 插件直接把代码完全开源。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/C9LVwmB1dcAaBz1Q.jpg) 好了,现在大家都可以拿去二次开发了。 > 开源指路:[https://github.com/liyupi/binding-of-isaac-webgame](https://github.com/liyupi/binding-of-isaac-webgame) ![](https://pic.code-nav.cn/post_picture/1601072287388278786/WmJyy1YLcp1F9H0R.jpg) 六不六? 玩着自己做的游戏,我真是感慨万千,小时候我做梦都想自己做一个游戏,但那时候完全不可能,没技术、没时间。而现在 AI 帮我圆梦了,不需要关注任何技术,就能一把梭搞定从开发到测试到上线的全流程。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/U8CuaQp8C3mDZCSW.jpg) 虽然这次给大家展示的游戏作品只是两轮对话搞出来的 Demo,但完成度已经很高了。负责任地说,如果我再多花点时间,完全可以利用 AI 打磨出一个商业级产品,甚至让你看不出来是 AI 做的。 所以,都这个时候了,别再觉得 AI 搞不定复杂的项目了。 **老实说,我现在真的想不到还有什么想法是 AI 不能实现的。** 如果有,那就是没有驾驭好 AI,或者 tokens 不够。 大家肯定也有一直想做但做不了的东西,不管是一个产品、一个游戏、还是帮自己提升效率的工具,现在真的可以大胆尝试了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/gQm2yC32VK0yxVed.jpg) 最后揭晓开发这个游戏消耗的金额。 大概 400 多块钱,你觉得贵不贵? 如果搁以前我去请一个程序员来做,最少也得好几万吧,而且估计得做一个多月。 不过 Opus 5 的价格还是挺贵的,不是所有任务都需要用这种级别的模型,大家还是要根据具体任务选择合适的模型。 ![7 个大模型的选择建议一览](https://pic.code-nav.cn/post_picture/1601072287388278786/KMnzKRhLa5gJVq5f.jpg) 那这个项目的完整提示词我放到了自己免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe) 里,上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/8DTLauJOrhnGBRzO.jpg) 我是鱼皮,关注我,轻松学会更多 AI 编程干货。 对了,你觉得 AI 能够取代程序员么?评论区聊聊。

A÷ 你还我账号!Claude 封号事件完整复盘

前几天,看到很多人免费薅到了价值 200 刀的 Claude Max 账号,我好羡慕。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/JuI8tHX6ytMARmeE.jpg) 这两天,又看到很多人的 Claude 被无故封号,我好同情。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/sA5J4ouRsVw95kWv.jpg) **万幸的是,我没被封号。** 因为我早就对 Anthropic 失去信任了,根本没有 Claude 账号! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/tKZshk8oiVG9drdr.jpg) 事情是这样的。 7 月 26 号,社群里突然传出一套操作方法,声称可以零元白票 Claude Max 20x 的订阅。 这是 Anthropic 官方最贵的套餐,月费 200 刀,能爽用 Claude 最强的模型。 还有这么好的事情? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/niwZIAV43tiIi7VL.jpg) 然后你懂的,消息迅速传遍了推特、微信群和各种技术社区,甚至连闲鱼上都有人在卖教程。 虽然我没去薅,但出于对技术的热情(不是),还是探索了一下这个漏洞。 到底是怎么回事呢? 简单来说,Claude 官网的支付页面存在一个安全缺陷。有人写了一段浏览器插件脚本,运行之后能篡改网页的结账页面,强行调出一个原本不对外开放的欧洲银行转账支付通道。然后用户只需要在网上随便生成一组虚假的银行卡号和地址信息,填进去点击订阅,系统就会判定支付成功,直接给你开通最高档的会员权限。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/gk8ljUWSwSEfKP8Y.jpg) 整个过程不需要花一分钱,立刻就能用上 Claude 最强的 Fable 5 模型,没有任何限制。 之所以出现这个漏洞,本质上是因为 Anthropic 的后端服务器太相信前端提交过来的信息了。 正常来说,用户在网页上选了什么套餐、用什么方式付款,服务器应该自己再校验一遍。但 Claude 的系统没有做这一步,前端说付了就是付了。再加上那个欧洲银行转账通道本身是异步扣款的模式,系统在确认到账之前就已经把会员权限发放出去了。 两个漏洞叠在一起,就成了零元购。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/YXGsUN7PJtJK8koZ.jpg) 就好比一家自助餐厅的收银系统出了 Bug,门口的闸机不需要付款就能打开,这不得有一堆人涌进去吃霸王餐? 据说当天好几家 API 中转站直接打出了跳楼价折扣,毕竟人人都能零元购了,谁还花钱找中间商啊。 可惜,好景不长。。 7 月 27 号,也就是漏洞曝光后的第二天,Anthropic 的工程师紧急上线修复,那个脚本彻底失效了。 **但修完漏洞只是第一步,紧接着就是大规模封号。** 众所周知,Anthropic 非常擅长封号。而这次被薅了带着恨,封号力度肯定非常狠,不只是封利用漏洞的账号,而是把关联的所有东西一起封。只要你的设备曾经登录过参与漏洞操作的账号,哪怕你另一个正常付费的老账号也在同一台电脑上用过,也会被连带封禁。 而且设备的硬件信息会被平台永久标记,之后再想注册新号用 Claude 都很困难。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/JlxQVsyJbbWZcTAR.jpg) 更离谱的是,有些人根本没去薅这个漏洞,只是恰好跟薅漏洞的人用了同一个代理节点,结果也被封了。 宁可错杀,不能放过。 于是,很多无辜用户遭了殃。。。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/z59kYogzL1CU1GvU.jpg) 漏洞本身确实是 A÷ 自己的技术问题,但在修复之后,他们选择了最激进的方式来止损。不仅封掉了利用漏洞的账号,还把能关联到的设备、IP 一起拉黑。 至于这个过程中误伤了多少正常用户,从之前 3.3% 的申诉成功率来看,他们似乎并不在意。 不过肯定有很多小伙伴好奇,这么离谱的漏洞是怎么发现的?A÷ 自己的模型这么强,怎么连这种漏洞都检测不出来? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/vMV8PHeuuGmekaGh.jpg) 所以,有人怀疑这次漏洞其实是 A÷ 的阳谋,故意留个口子让人来钻,趁机收集设备指纹和 IP 信息。还有人觉得 A÷ 本来就想清理一批账号,正好借这个漏洞事件把薅过羊毛的设备和 IP 一网打尽。 这个说法没有实锤,但考虑到他们之前在 Claude Code 里植入隐蔽追踪代码的前科,很多人宁愿信其有。 不管怎么说,对普通用户来说,最现实的问题就是接下来怎么办,用什么模型呢? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/pNMEc5VOxbrCVqBM.jpg) 如果你预算有限,我觉得 Codex + GPT 系列模型是目前性价比又高又智能的均衡选择。OpenAI 经常毫无理由地赠送重置额度,根本蹬不完,很多办公自动化、网站开发任务用 GPT 5.6 完成度都很不错。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/f685bQxbK0aGMtQJ.jpg) 而且国产模型今年进步飞快,很多场景已经不比国外的差了。比如 Kimi K3 做前端开发和视觉效果很强,DeepSeek V4 性价比极高、是我做 AI 应用开发项目的首选底层模型,GLM 5.2 的全栈开发能力也很能打。 ![Kimi K3 开发的前端网站](https://pic.code-nav.cn/post_picture/1601072287388278786/n7HduYrAMsRXQrFR.jpg) 不过我敢说,虽然你会看到很多博主因为这次事件发文怒喷 Claude,但他们背后肯定还会继续用 Claude 的模型,只不过换一种接入方式罢了。 毕竟 Claude Opus 5 的编码能力确实是目前最强的,这一点我在之前的 [测评文章](https://mp.weixin.qq.com/s/NMHSFUq8lpY2inlWN7LFaA) 里已经详细验证过了,我用一轮提示词就能开发出下面这种游戏。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/QDN1HOk9nztPbaJs.jpg) 如果你预算充足,还是想用 Claude 系列模型的话,建议走 Cursor 这种官方合作方,比直接订阅 Claude 更稳定。何必整天跟 Anthropic 斗智斗勇呢? 这次事件也给所有人提了一个醒。不管你用哪家的 AI,你的账号、你积累的对话历史、你的工作流,可能就在一封邮件之后全部归零。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/uO3zLVelVnHnCDFE.jpg) 所以,关键的工作流一定要有备用方案,能跑在本地的尽量跑在本地,不能因为一家公司的抽风,就决定你明天还能不能正常干活吧? OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/p8v0jKdkDPewEPeY.jpg) 你怎么看待这件事,你的 Claude 还活着么,打算用什么替代方案?

Claude Opus 5 全新发布,7 大项目实测,夯还是拉?半价吊打 Fable 5?

大家好,我是程序员鱼皮。 前几天 Anthropic 发布了 Claude Opus 5,我第一时间写了一篇小短文,说 Claude Opus 5 宣称只用一半的价格,能力追平 Claude Fable 5 旗舰模型。 这个模型的跑分还是很能打的,比如 Frontier-Bench 这个测试,考察模型能不能在命令行里独立做完一整套编程任务。 Opus 5 拿了 43.3%,上一代 Opus 4.8 只有 18.7%,顶配的 Fable 5 是 33.7%,而 OpenAI 的 GPT-5.6 Sol 是 37.5%,可以说是遥遥领先了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/VZ8DBwHTGtvOrRUK.jpg) 但是不能完全相信跑分,模型好不好用,还得拿真实项目来检验。 之前我写过一篇 [Kimi K3 模型测评文章](https://mp.weixin.qq.com/s/wsYtXWkl-2WYPSHVhYjZMQ),为了便于跟 Kimi K3 等模型对比,接下来我会用跟之前一模一样的提示词,通过 **7 个不同类型的项目** 来测试 Opus 5 的实际编程能力。 测试方法很简单,我在 Cursor 里同时开了多个子 Agent,每个 Agent 一个独立的项目目录、一个独立的端口,全程不需要人工干预。等过段时间我回来一个一个验收就好。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/CHlyMeHVU39FMDVs.jpg) 激动的心,颤抖的手,点个收藏,咱们开始~ ## 项目实战测评 这次我准备了 **7 个项目** 来测试 Opus 5 的编程能力,从简单的前端动画、到复杂的全栈产品、甚至是企业级工程项目,由浅入深。 1. 交互式动画讲解网站 2. 3D 版动画知识讲解 3. 文案拆解为网页 PPT 4. 网页 PPT 生成工具(内置 AI 大模型) 5. 足球对战网页游戏(横评对比) 6. 以撒的结合肉鸽游戏 7. 全栈 AI 编程工具(复刻 Cursor) 大家可以猜猜看,跑完这些任务要花多少钱呢? 答案在结尾揭晓~ ### 1、交互式动画讲解网站 第一个项目,让模型做一个用交互式动画讲解知识的网站,讲的知识点是「注意力残差」。 提示词里我要求它先用 Firecrawl 联网搜索技术细节,做完之后自己打开截图验证效果,不满意就自主调整,改到满意再交付。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/S4AQzpQ83a0w7Kco.jpg) 来看成品,界面科技感满满,背景还有漂浮的光点特效。 而且整个网站很清晰、很结构化,用户可以像阅读教程一样连贯地学会这个知识,也可以通过左侧的章节导航快速跳转、查漏补缺。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ngzXhNKfYGLSD6TU.jpg) 不过页面上存在一些瑕疵,比如出现了文字被遮挡的情况,这点比 Kimi K3 的前端效果差了一些。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/aIcfuvp3igrIpw9S.jpg) 不过大多数的动画效果和元素位置都是准确的,个人感觉比 Opus 4.8 做动画网站的体验好太多了! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/9phq500U0mSAslyc.jpg) 甚至给出了几道题目来检测学习效果,选错了还会告诉你为什么错,真是太贴心了,可以给到顶级。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/P2ggRuQW9sKMw70m.jpg) ### 2、3D 版动画知识讲解 还是同一个知识点,这次换成 3D 场景来呈现。 提示词里除了联网搜索,我还要求它用 Context7 查一下所用 3D 库的最新文档,别拿过时的 API 来写。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/EAjJA95PEckaWFZA.jpg) 来看成品,我刚打开页面就被惊艳到了,我 chovy! 科技感爆棚,而且动画非常流畅生动。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/CG74s45UILOQXlsn.jpg) 可以自由切换视角、放大缩小,还能并排对比多种不同的残差模式。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/FW3XdF2IwAC1BDTE.jpg) 从事教育行业的工作者有福了,可以让 AI 把枯燥的知识点通过动画栩栩如生地展示清楚,让学生更快理解。 单从前端的角度,我真的挑不出缺点,给到夯! ### 3、文案拆解为网页 PPT 我做视频教程的时候,偶尔需要把文章内容做成演示画面,但手动做 PPT 太慢了。 这次我干脆把一篇技术文章丢给它,让它按照文章的讲解顺序,拆成一个能全屏演示的网页 PPT,后续可以当做视频录制的画面素材。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/4chhV0a12JIE0BbA.jpg) 先看封面,完犊子了,这大标题…… 现在怎么 Claude 也一股子 GPT 味儿了。。。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/2b9ORzzrgrTrYwEg.jpg) 整个 PPT 的效果跟其他模型差不多,毕竟我没给 AI 提供图片等素材,无非就那么几种布局。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/L6fkRf6twQgQ50LV.jpg) 整个 PPT 的科技感还是很足的,我觉得对于很多场合下的 PPT 讲演都是够用的。比如做毕业设计的同学,直接把自己的项目甩给 AI,毕设答辩 PPT 就搞定了,真爽死了…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/tbAfLp9gssWdflPF.jpg) 从整体前端风格来看,给到顶级。 ### 4、网页 PPT 生成工具(内置 AI) 前面 3 个都是开胃小菜,接下来该测测它的全栈工程能力了。 上一个案例是给定一篇文章生成 PPT,那能不能把这个能力做成一个通用工具呢? 用户粘贴任意文案,后端调用大模型拆解内容,前端渲染成可演示的网页 PPT,还要支持切换配色主题和导出成独立的 HTML 文件。 明确需求后,提示词就很简单了,由于涉及到 AI 能力,这里我用新出的 Kimi K3 模型作为给后端调用的模型(注意,项目本身的代码还是 Opus 5 生成的)。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/crqztmqWGqNfisOK.jpg) 来看看成品,之前用 Kimi K3 生成 PPT 工具的时候,成品非常精简,主页基本上就只有文案输入框和按钮。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Jc4W4duO0w2sSji7.jpg) 但 Claude Opus 5 做的更像一个成熟的工具产品,你看左下角那一排配色主题就知道了,极光、象牙、暮色、青薄,这名字起的还挺文艺。而且每个主题下面还配了一句定位说明,细节做得非常好。 而且还可以填写生成 PPT 的额外要求。注意,我并没有在提示词中讲到这点,AI 自己帮忙锦上添花了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/YR9s5z7e4qIdfM10.jpg) 随便拿我之前的一篇文章来制作 PPT,可以实时看到生成进度,直接查看效果,质量很高。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/pLlOa4T48gojsww9.jpg) **说真的,现在这种全栈项目一把梭对于 AI 已经完全没有难度了。** 来切换个主题试试,效果不错吧,还能直接全屏演示或者导出为 HTML: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/fPTV6nHKf7RIyBjv.jpg) 整体来说,无论是前端细节、还是后端生成逻辑做的都很好,一段提示词直接梭哈一个商业产品出来了,给到夯。 ### 5、足球对战网页游戏 经常看我文章的朋友应该知道,这个项目是老熟人了。 之前 GPT-5.6 发布的时候,我写过一篇 [《顶级国外模型横评对比》](https://mp.weixin.qq.com/s/jHHDR6J4ACj8cSY3UMltDQ),用同一段提示词让 GPT-5.6 Sol、Claude Fable 5、Grok 4.5 三个模型同时开发了一个叫「2066 决战世界杯」的足球游戏。这次的提示词跟那时候完全一致,正好拿来做个对比。 先看赛前设置界面,做得还不错。浅绿主题色跟足球场是匹配的,相得益彰。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/eZ2PYiSvbfQzZRbS.jpg) 踢球、换人功能都是正常的,非常流畅。 而且注意到细节了没?9 号球员下方有个红色的蓄力槽,给了玩家更多的操作空间。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/bnBKjlmYRVeny2KJ.jpg) 游戏的人机也非常智能,不像其他模型开发出来的人机只会防守,这次的人机甚至还能踢出配合。而且作为玩家,也不是完全没有机会赢过人机,游戏体验非常好。 对比一下之前几个模型的表现。GPT-5.6 Sol 开发的那版,人机不会主动进攻,我打满一整场中等难度,只能以 0 比 0 收场。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/y5j4dlxArOdaIYGk.jpg) Grok 4.5 模型开发的那版,球场渲染有硬伤,换人逻辑也很不顺畅,经常切换到离球最远的那个队友身上。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/V9d4V8ekvtMEF01s.jpg) Claude Fable 5 开发的那版,球的物理引擎翻车了,球经常会瞬移,根本没法正常玩耍。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/X4B0WPazzFV27Ahr.jpg) 而 Opus 5 不仅在人机智能上突破了,左侧还会实时展示赛况,这也是之前的模型都没有做到的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/djaCYogK8nthSvY9.jpg) 美中不足的是,足球场的白线是不是有点儿问题?禁区前面那道罚球弧两端拐进了禁区里面。综合来看给到顶级。 ### 6、以撒的结合肉鸽游戏 接下来是一个更有挑战性的游戏项目。 以撒的结合是我小孩儿时代很爱玩的一款肉鸽游戏,包括随机地牢生成、射击战斗、道具系统、多种敌人和 Boss。 之前我让 Kimi K3 开发了这个游戏,提示词中要求先用 Firecrawl 搜索以撒的结合的游戏机制和美术风格资料,用 Context7 查询所用游戏框架的文档: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/6yab24XiSVdzfLFH.jpg) 当时 K3 开发出的效果是这样的,虽然界面看起来简陋,但基本玩法是完全跑通的,可以发射子弹打击怪物: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/rD4Fmdudx1o0QYZS.jpg) 再来看看这次 Opus 5 用同样的提示词开发出的成品,前方高能! 打开网页,光是看到这个游戏主页,我的 DNA 就动了!有没有玩过这个游戏的同学,这个形象跟原版还是很接近的吧? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/8cmIAISTRmlgxlZF.jpg) ![原版游戏形象](https://pic.code-nav.cn/post_picture/1601072287388278786/4C2ObLCJnrBjhP1j.jpg) 之前我用 Kimi K3 做这个游戏的时候,整个游戏的玩法链路已经跑通了,我当时都已经觉得很满足了。。。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ZRxe3HOrOdkrFWIU.jpg) 结果没想到 Claude Opus 5 的效果这么好!很多小怪都是原版游戏中存在的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/vbxQzL47nweCgj6Y.jpg) 而且角色的数值清晰、道具丰富多样,可以说是还原了《以撒的结合》游戏的精髓。 我甚至都玩进去了,导致这篇文章发布时间晚了 20 分钟。。。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Ij2DDqVWBFdDRNKW.jpg) BOSS 的机制也跟原版《以撒的结合》游戏中的 BOSS 神似! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/3XFo6NF0q7YquRJx.jpg) 大家觉得怎么样? 说真的,完全超出我的预期了,给到夯爆了!以后我也有戏做一些游戏了,skr~ ### 7、全栈 AI 编程工具 最后一个项目,直接把难度拉满! 我让 AI 基于 VS Code 的开源代码,开发一个类似 Cursor 的 Web AI 编程工具,要支持 Editor Window 代码编辑器和 Agents Window 对话工作台两种模式,两个窗口之间可以自由切换。 看看成品,几乎完整地保留了 VSCode 的精髓,比如代码高亮、代码小地图、管理面板、代码搜索等等。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ktVnXRRYZQGgzp4z.jpg) 来让 AI 执行个任务试试,你能清晰地看到 AI 的思考信息、工具调用等等。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/1v2gRR4rTxkNIM98.jpg) AI 甚至能够调用终端、自主测试开发出的代码,还能清晰地看到本次改动的文件! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/JY5fZnGKzd1x3gKM.jpg) 怎么样,你敢相信我只跟 AI 对话一次,就开发出了自己的 Cursor 么?简历上又多了蓬荜生辉的一笔。 我的评价是夯爆了! ## 我的感受 7 个项目全部跑完了,让我印象最深刻的一点是,Claude 没有完全机械地、用最简单直接不绕弯子的方式完成任务,你让它做什么它就只做什么,而是会在你提示词需求的基础上加一点自己的想法,尽量达到理想的效果。 它不仅后端逻辑强、前端视觉效果也强,还非常注重细节,真的是六边形战士了。 **至少对我来说,我暂时想不到什么开发任务 AI 完不成了。** 如果有,那就是我没有驾驭好 AI,或者 tokens 不够。 另外一个让我印象深刻的点是,Opus 5 确实像官方说的那样,特别爱自己检查作业。Anthropic 甚至专门提醒开发者把提示词里那句「最后记得验证一遍」删掉,你越叮嘱它反而越容易检查上瘾。他们后来干脆把 Claude Code 的系统提示词删掉了 80% 以上,编程跑分一点没掉。 以后用这种级别的模型,该给你的提示词做做减法了,把精力花在明确需求和目标上就好,不用事无巨细地规定每一步该怎么做。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/SEYiN93B74YJ3Cna.jpg) 当然,这个特性是一把双刃剑,Opus 5 很容易把简单的任务搞复杂,这是 Claude 一贯的通病,也就更废 tokens。 如果你想更好地利用 Opus 5 这种级别的模型,还是要在提示词上多下下功夫,不是说要写的又臭又长,**而是把需求描述清楚、限制好 AI 的边界**,否则它搞不好就浪飞边子了。 最后,揭晓谜底,这 7 个任务打包加起来,一共花了我 900 多块。 这就是效果好相应的代价,之前我用 Kimi K3 等国产模型做同样的项目,加起来套餐额度才动了百分之几。 所以还是要根据你的实际需求来选择模型。 - 如果是追求 90 分效果的任务,可以交给 Opus 5 - 只需要 80 分的任务,可以交给 GPT 或者 Kimi K3 / GLM 5 这类模型,快、稳、便宜 - 如果任务只要及格就好,那就用性价比极高的 DeepSeek 吧 OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/rfeLJ5t1urpBSlRV.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 也欢迎在评论区聊聊:你觉得这钱花得值么?你现在主力用的是哪个模型?

下载 APP