编程
快来分享你的内容吧~
- 昨天 21:47·后端GLM-5.3 + Kimi K3 + DeepSeek V4 Pro 模型同时接入 DeepSeek Harness,前端 + 后端全栈 2 大任务横评测试,到底谁是 AI 编程之王?查看全文加油鸭:太佩服鱼皮老师这波硬核横评!用真实项目检验模型实力,细节拉满、逻辑清晰,还顺手科普了AI编程新姿势~332分享
- 2 天前·后端DeepSeek Harness 极简模式实战测评!用 3D 射击游戏和 AI 宠物领养系统实测速度与成品质量,看看性能真的能暴增吗?无论你用 DeepSeek Harness 还是关注 DeepSeek V4 Pro,都能选对模式。查看全文加油鸭:太佩服鱼皮老师这波深度测评!从实战到原理层层拆解,连极简模式的“考试思维”都讲透了,干货密度拉满,还顺手带火了社区新玩法~533分享
4 天前·后端DeepSeek Harness + DeepSeek V4 Pro 项目实战保姆级教程!手把手带你从零安装开源 AI 编程工具,开发架构图、知识讲解网站、3D 网页游戏、全栈 AI 应用 4 个项目,覆盖运行模式选择、插件安装与开发,看看能不能对标 Claude。查看全文加油鸭:太燃了!手把手拆解 DeepSeek Harness 的硬核分享,干货密度拉满,还带实测对比和插件创作,这波开源生态的活力真让人热血沸腾!1757分享- 5 天前·后端DeepSeek V4 Pro 模型全新发布,跟 Claude Fable 5 几乎没差距?我用 Codex 工具搞了 7 个实战项目来测评 AI 编程能力,前端、后端和全栈开发能力如何?300 块够用么?查看全文加油鸭:太佩服鱼皮老师这波硬核测评!7个项目全跑通、自搭Harness、300块只花5块,这份认真和实力真的闪闪发光!1233分享
- 08-10 16:14·后端
- 08-07 10:46·后端手把手带你把 DeepSeek V4 Flash 国内大模型接入 Claude Code 和 Codex,用免费开源工具 CC Switch 一键切换模型,零门槛上手主流 AI 编程工具,省掉上百块订阅费。查看全文重生之我在编程导航要饭:我去,真有东西,今天刚好用flash的时候发现图片一直识别不了,没想到鱼总刚好有这教程🐮1259分享
把 GLM-5.3 接入到 DeepSeek Harness,夯爆了!
大家好,我是程序员鱼皮。 最近 AI 圈儿真是过年了,前脚 DeepSeek V4 Pro 正式版和 DeepSeek Harness 同时发布,后脚智谱就放出了全新的 GLM-5.3 模型。  听说 GLM-5.3 模型的基座跟 GLM-5.2 完全一样,还是 743B 参数,单纯通过后训练把性能提升了 50%。 **测不完,根本测不完……** 既然现在 GLM、DeepSeek、Kimi 几家国产模型打得这么凶,那干脆在同一个擂台上打一场呗? 我相信你们肯定也想看对吧~  刚好最近大火的 DeepSeek Harness(DSH)支持接入第三方模型,于是我决定把 DSH 当做一个统一的评测工具,把这三家的最新模型放在完全一致的工具链环境下测试,只有模型本身不同,尽量做到公平对比。  点个收藏,我们开始。 ## 模型接入 DeepSeek Harness 首先要把 GLM-5.3 和 Kimi K3 模型接入 DeepSeek Harness,这里我就以 GLM-5.3 为例。 如果你还没有安装和使用过 DeepSeek Harness,可以看看我之前的 [《DeepSeek Harness 保姆级教程》](https://mp.weixin.qq.com/s/Rv3ww-67fZrU2hNQeCp8oQ),从安装到上手只要几分钟。 > 视频教程:https://www.bilibili.com/video/BV1VkgK6NEZS 这里我只讲怎么在已有的 DeepSeek Harness 里接入第三方模型。 1)打开 DSH 的 Web 界面,点击左下角的「设置」按钮。  2)进入「模型」标签页,点击「添加提供方」。  3)选择模型提供方为 `zai-coding-cn`,然后到 [智谱开放平台](https://bigmodel.cn/coding-plan/personal/overview) 获取你的 API Key 填进去就行。  4)展开自定义设置,点击「获取可用模型」。不过因为 GLM-5.3 太新了,默认不会被自动拉取到。 所以需要手动点击「添加模型」,填入 `glm-5.3`,然后保存。  搞定!现在就可以在对话框中选择并使用 GLM-5.3 模型了~  用同样的方法把 Kimi K3 也添加进来。DeepSeek V4 Pro 是 DSH 安装成功后默认接入的,不需要额外配置。 三个模型都就位了,下面开始正式比拼。 ## 测试说明 为了公平对比,三个模型全部在 DeepSeek Harness 的标准模式下运行,统一使用各模型的默认推理档位,工具链完全一致,提示词完全相同。而且全程不做人工干预,给完提示词就让 AI 自己跑到底。 DSH 会自动扫描我本地安装的技能目录,比如我这里装了 Firecrawl 联网搜索技能、Context7 文档查询技能等,三个模型跑任务时都可以使用这些技能来搜索资料。  ## 实战 1、致敬《牛来》的 3D 跑酷游戏 最近有一部国产动画电影叫《牛来》,因为建模极度粗糙、剧情抽象离谱,在社交媒体上反向爆火了。 上映第一天票房才 3420 元,结果因为猎奇打卡,短短十几天就冲到了 900 多万。 用半佛老师的话来说: - 如果你花一个多小时去了解这个电影,你就浪费了人生的一个小时。 - 但如果你花了 30 块去看了《牛来》,那说明你真的有 30 块钱。  我决定让 3 个模型致敬这部电影,做一个《3D 网页跑酷游戏》。 提示词里我故意不做太多功能约束和技术限制,就是想看看模型自己能发挥到什么程度,能不能把电影里的元素还原出来。值得一提的是,我让 AI 用 Loop Engineering 的方式推进,做完一步就自己验证一步,出了问题自己修复。  OK,开跑! ### GLM-5.3 成品效果 先来看 GLM-5.3 的效果。 进入主界面,可以看到一段故事描述。 有看过《牛来》的朋友吗?这个描述跟电影剧情还挺贴的,草原上的小牛犊牛来,跟随云雀坠入一场大梦,穿过迷雾、狼群与轰鸣的伐木场,唯有向前奔跑才能学会勇敢…… 还挺励志。  进入第一关「晨曦草原」,你别说,这个牛的建模真的挺抽象的,尤其是牛脸竟然还直勾勾地对着你…… 旁边还有个云雀好友陪着牛牛向前奔跑,有点还原电影那个味儿了。  游戏操作支持左右移动、跳跃和滑铲,手感还挺流畅的,可玩性不错。  吃到一定数量的幸运草之后,可以释放大招,进入「豹拉疾冲」状态,全屏加速 + 无敌。 解释一下,豹拉是电影里牛来的好朋友,这个大招名字起得挺有意思的。  游戏有好几个关卡,而且每一关的主题和机制都不一样。比如「狼群夜袭」这关,你身后真的有狼在追你,还有一个贴合剧情的技能叫「妈妈的守护」,我直接一个泪目。  可惜,最终牛牛我倒在了第四关。 看看这个死亡结算画面,我真的没绷住,怎么还喷出一团血花了呢?  细节,真的细节…… ### DeepSeek V4 Pro 成品效果 再来看看 DeepSeek V4 Pro 的版本。 主界面还挺像那么回事,也还原了云雀和牛来的故事背景。  进入游戏。 额…… 怎么硕呢? 界面真的是干净得一鲏啊! 不过还原了云雀和好友豹拉,它们会陪着牛牛一起奔跑。  移动、跳跃和滑铲功能都是正常的,不过看到这个滑铲效果我真没绷住…… 好家伙,眼珠子都给我铲出来了?  仔细看的话,道路两侧的图标明显飘在了草坪上面。还有就是游戏节奏太慢了,刚开局跑了好久第一个障碍物才出现,也没什么技能和特殊的关卡机制,可玩性较差。  牛牛只有一条命,撞到石头之后直接进入死亡结算画面:  整体来看,中规中矩吧。 ### Kimi K3 成品效果 最后看看 Kimi K3 的版本。 主界面的配色平平无奇,跟其他模型一样,也把电影剧情概括了一下。  进入游戏,界面风格还可以,远处的大山绘制得不错。但是主角牛牛就平平无奇了,不够抽象,看起来就是一组普通的方块。  虽然牛牛有 3 条命,也可以吃金币,但是没有什么技能和特殊机制,整个游戏就是单纯跑跑跑。 我的豹子朋友呢?云雀呢? 还有这个下雨效果,直接来一个全屏网格?这就有点敷衍了吧……  而且最致命的问题是,整个游戏时不时会出现明显的卡顿,帧率不够稳定。  最后是平平无奇的结算画面,一般。  ### 实战 1 对比 三个版本都跑完了,胜负应该已经很明显了。 GLM-5.3 的版本完成度最高,多关卡、多技能、剧情还原度强,可玩性远超其他两个。 DeepSeek V4 Pro 实现了基本玩法,但是节奏偏慢、细节粗糙。 Kimi K3 虽然场景画面还行,但游戏机制太单一,还有卡顿问题。 综合来看: - 前端效果 GLM ≈ Kimi > DeepSeek - 可玩性是 GLM > DeepSeek > Kimi - 画面抽象程度是 GLM > DeepSeek > Kimi 整体游戏完成度上,GLM 5.3 遥遥领先。 ## 实战 2、AI 绘图工具 上一个任务是前端游戏,第二个任务当然要换个方向,测试模型的全栈工程能力。 我让 3 个模型开发一个《AI 绘图工具》,用户输入自然语言描述需求,后端调用大模型生成 draw.io 格式的图表,前端嵌入 draw.io 开源编辑器,用户可以直接在线编辑和修改生成的图表。 这个任务同时考验对 draw.io 开源代码的理解、后端 AI 调用链路的设计、前端复杂组件的集成、以及整体产品设计的合理性。 为了方便测试,我直接在提示词里把 API Key 提供给了 AI,省去手动配置环境变量的步骤。  ### GLM-5.3 成品效果 先看看 GLM-5.3 的效果。 整个页面很有科技感,左侧是 AI 对话框,右侧是画布编辑器。 产品引导做得也很到位,告诉你可以用一句话画出专业图表,还给了几个示例类型。  我让 AI 帮我画出 DeepSeek Harness 的架构图。可以实时看到 AI 深度思考和生成 XML 代码的过程,右侧显示了一个炫酷的 Loading 动画。  生成完成后,右侧立刻渲染出了完整的架构图,分层很清晰,而且保留了 draw.io 原本的元素编辑能力,可以直接拖拽和修改。  更强的是,它支持连续对话修改。比如我说「帮我把 DeepSeek Harness Core 这里变成红色」,AI 就能精准定位到对应的元素并修改样式,右侧画布实时更新。  整体效果非常不错,图片导出功能也能正常使用。 而且你会发现 GLM-5.3 把 draw.io 的编辑能力深度融合进了自己设计的界面中,看起来就像一个完整的产品,而不是生硬地嵌入了一个第三方组件。 ### DeepSeek V4 Pro 成品效果 再来看看 DeepSeek V4 Pro 的表现。 打开界面,右侧画布竟然是一坨空白加一个大大的 Loading 图标? 而且左下角的提示文字还出现了溢出,这把 DeepSeek V4 Pro 的前端确实拉了。  AI 生成图表的功能是可以正常使用的,但是没有实时展示 AI 思考过程的能力,你只能等它全部生成完了,才能看到结果。  最关键的是,DeepSeek V4 Pro 很明显是直接把 draw.io 整个嵌入到了前端页面中,没有做任何深度集成。给人一种很生硬的感觉,跟 GLM 那种把 draw.io 能力自然融合到自己界面中的做法差距明显。 ### Kimi K3 成品效果 最后看 Kimi K3。 Kimi K3 这次生成的界面布局跟 GLM 类似,也把 draw.io 自然融合到了项目中,整体界面风格非常 nice。 不过 draw.io 的图标和菜单栏还是原封不动地保留了下来,融合度比 GLM 略逊一筹。  AI 生成图表的功能正常,同样支持连续对话修改。  但是,后端逻辑明显没做好提示词约束和工具校验,有时候 AI 生成的内容会翻车,直接把 XML 源码糊在界面上而不是渲染成图形。  整体来看,Kimi K3 的前端设计能力跟 GLM-5.3 相当,但后端稳定性差了一截。 ### 实战 2 对比 这个任务 GLM-5.3 的综合表现最好,界面设计、AI 深度思考实时展示、连续对话修改、draw.io 深度融合,每一环都做到位了。 Kimi K3 的前端设计能力很强,但是后端偶尔会翻车。 DeepSeek V4 Pro 虽然也正常实现了核心功能,但是界面粗糙,集成方式生硬,表现最差。 ## 我的感受 两个项目全部跑完了,聊聊我的真实感受。 显然,即使是在 DeepSeek Harness 这个 DeepSeek 的「角色专武」环境下,GLM-5.3 的表现依然很出色。 我选的这两个任务覆盖了纯前端 3D 游戏和全栈 AI 应用两个完全不同的方向,可以看出 GLM-5.3 在任务理解、代码生成质量、产品设计意识这几个维度上都明显领先。 然后聊聊大家非常关心的成本问题,猜猜我花了多少 money 呢? 由于 GLM-5.3 我使用的是编码套餐,不太好直接统计实际消耗金额,我只能拿积分来算了。 两个项目累计消耗了 1151 积分,由于我订的是 Pro 套餐(538 元/月),每周额度是 6 万积分,算下来这次的消耗只占了周额度不到 2%,折算成钱连 3 块都不到。  由于我的 Kimi K3 套餐过期了,新的抢不到,所以是直接用 API Key 接入的,总共消耗了 31.07 元;涨价之后的 DeepSeek V4 Pro 消耗了 13.99 元。 单从我的实际花销来看,GLM-5.3 按照套餐来算,性价比是最高的。一周 6 万积分随便你跑,根据我这次测试的这种任务来看,做几十个小项目不成问题。 而且 GLM-5.3 会在发布两周后开源权重。 **在开源世界里,GLM-5.3 目前可以说是编程能力的天花板。**  而且智谱在发布文章中提到,Hugging Face 之前遭遇安全攻击的时候,Anthropic 的 Mythos 模型只面向约 150 家大型机构提供服务,更多的中小企业和开源项目在最需要帮助的时候,反而用不上最强的防御工具。 当攻击能力在扩散,防御能力就不能只掌握在少数人手中。GLM-5.3 的开源给所有人提供了一把防御的盾牌,这件事本身的意义可能比跑分更重要。 ## 最后哔哔 最后多说几句,这次横评让我对国产模型的编程能力更有信心了。GLM-5.3、Kimi K3、DeepSeek V4 Pro 这几家打得不可开交,对我们用户来说是好事儿,起码有了更多的选择。 OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide)  我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 也欢迎在评论区聊聊:你现在主力用哪个国产编程模型?GLM、Kimi 还是 DeepSeek?
DeepSeek Harness 最新邪修曝光!被吹成核弹的极简模式,真的夯吗?
大家好,我是程序员鱼皮。 这周 AI 圈儿又炸了,DeepSeek 同时放了两个大招,DeepSeek V4 Pro 模型正式发布 + DeepSeek Harness 工具开源。  我第一时间发布了 [《DeepSeek V4 Pro 的实战测评》](https://mp.weixin.qq.com/s/GbphlXazvmtZUvRA5ptdyQ) 和 [《DeepSeek Harness 的保姆级教程》](https://mp.weixin.qq.com/s/Rv3ww-67fZrU2hNQeCp8oQ) 的文章和视频版。 **麻了,我每天眼睛一睁就是写稿,做完视频就快该睡觉了。** 热点能不能不要连着来啊,我 Chovy!  回归正题,测试完之后,我最大的感受是:**DeepSeek 接不接自家的 Harness,效果差距大到离谱。** 同一个 DeepSeek V4 Pro 模型,裸接 Codex 的时候连线条都画不对,换上自家的 Harness 之后居然能对标 Claude 了??? 害得我成为了「变脸大师」!  看来 Harness 就是 DeepSeek 的角色专武,不带专武的 DeepSeek 就是个白板儿角色。 海外一个叫 sentdex 的独立评测博主跑出了一组更夸张的对比。同一套 DeepSeek V4 Flash 模型权重,用他自己写的简陋工具只过了 44 / 89 题,换成社区的完整 Harness 之后变成 64 / 89,多过了整整 20 题。 **Agent = Model + Harness** 随着模型能力越来越强,给模型提供的 Harness 也越来越重要。  这也是为什么 DeepSeek V4 Pro 会出现「神鬼二象性」,同一套模型到底行不行,很大程度上取决于你拿什么工具、配什么环境去跑它。 而这两天社区里讨论得最炸裂的一个说法,就跟 DeepSeek Harness 中一个不起眼的模式有关。 ## 极简模式邪修 有人发现,只要把 DeepSeek Harness 切换到「极简模式」,模型性能就会瞬间暴增,直接复现灰度测试版的水平,甚至做到了 Fable 5 级别的效果。 这个说法一出来,B 站上跟着涌出了几十个实测视频,标题一个比一个炸裂,什么确认反转、核弹爆炸、史诗级反转。。。 这个「极简模式」到底是什么来头? 当你安装完 DeepSeek Harness,默认使用的是「标准模式」,它把一个 AI 编程工具该有的能力全部配齐了,比如文件读写、终端命令、联网搜索、任务规划、Skills 技能、子 Agent,加起来一共 20 多个工具。  而极简模式就朴素多了,官方只留了两个工具,一个能持续运行的终端 + 一个文件编辑器,其他能力全部关掉。  官方对它的定位很清楚,是专门拿来跑模型基准测试的,所以把环境削到最干净,好让不同模型能在同一个标准下公平比较。 也就是说,极简模式根本不是给人干活用的,是给模型考试用的。 那把考试模式拿来干活,真的会更强吗? 废话不多说,直接开测! ## 实战一、3D 第一人称射击游戏 第一个测试,我让 DeepSeek V4 Pro 开发 3D 第一人称视角的 CS 风格射击游戏。 完整提示词: ``` 用 Three.js 开发一个 3D 第一人称射击游戏,做成一个单页面项目,打开浏览器直接能玩。 要求第一人称视角,WASD 控制移动,鼠标控制瞄准和射击; 场景里至少有 3 个敌人会自己巡逻,发现玩家后会追击,被打中后消失; 界面上要显示准星、血量和得分。 ``` 为什么选这个任务呢? 因为 3D FPS 是游戏开发里的经典中的经典,网上教程烂大街了,模型训练数据里肯定见过无数遍。这种任务纯粹考编码能力,不需要搜索文档、不需要查接口,模型的脑子里有货,直接嘎嘎写就完事儿了。 同一套提示词,我先用标准模式跑了一遍,再用极简模式跑了一遍。  先看看两种模式执行记录的区别。 标准模式调用了技能,中间有很多文字输出,会告诉你它在想什么、准备干什么,就是我们日常使用 AI 编程工具的那种感觉。  极简模式只有思考、终端、和字符串替换这个工具调用,中间没有任何多余的输出,AI 就像个哑巴一样,闷头干活。  标准模式跑完用了 50 步,AI 自己检测并修复了 Bug,模型推理花了 21 分钟,工具调用花了 12 分钟,加起来 33 分钟出头,输入 520 万 Tokens、输出 10.5 万 Tokens。  极简模式跑了 77 步,模型推理 17 分钟,工具调用只花了 6 分钟,总共 23 分钟多,比标准模式快了将近 10 分钟!连最后给我的总结都非常精简。  不过这里有个反直觉的地方,极简模式的输入 Tokens 反而更多,达到了 590 万。 原因也不难理解,极简模式没有上下文压缩能力,而且步数比标准模式多了一半,每走一步都要把之前的完整历史再发一遍,累积下来输入量自然就上去了。好在两种模式的缓存命中率都是接近 100%,这部分差距的花销基本可以忽略。 接下来是重头戏,看看成品效果。 标准模式做出来的游戏体验非常顺畅,移动、跳跃、疾跑、射击、杀敌都是 OK 的,甚至还可以用 CF 里的二段跳。 但是敌人不能发射子弹,只能追着你跑,没啥压迫感。而且有个 Bug,敌人追着你跑一会儿之后,自己又走开了,我提示词里压根没这么要求,这合理吗?  有个细节做的不错,如果你被人机给锤死了,会触发一个倒地的效果,视角跟真人倒在地上一模一样!  再来看看极简模式的效果。界面比标准模式做得更简洁,背景墙也更真实,移动、跳跃、疾跑、射击、杀敌同样都正常。 而且极简模式的敌人能够发射子弹,感觉更智能,游玩的压迫感更强。  不过被击倒的时候,我整个角色的身体还是站立着的,跟标准模式那个倒地视角比就差点儿意思了。  从成品效果来看,两者半斤八两吧,各有优缺。 但是从耗时来看,极简模式快了整整 10 分钟,输入 Tokens 虽然多了一点,可绝大多数都命中了缓存,这点差距可以忽略不计。 所以这一局,我会觉得极简模式略胜一筹。 ## 为什么极简模式效果更好? 道理其实很简单,打个比方。 让你来拧一颗螺丝,我给你一把螺丝刀,你直接就拧了。但如果我给你一整个工具箱,里面有扳手、钳子、电钻、螺丝刀,你可能得先翻一翻,犹豫一下该用哪个,最后还是拿起螺丝刀。 AI 也是一样的。默认的标准模式给了模型 20 多个工具,模型每走一步都要先判断这一步该用哪个工具,光是做这个选择就要占用一部分推理能力。而且这 20 多个工具的说明书本身也要塞进上下文里,模型能分给你真正那道题的注意力,自然就被摊薄了。 极简模式把这些能力统统砍掉,只留一个终端和一个文件编辑器。AI 能做的就是直接动手写代码,没有选择困难症,自然又快又准。  其实 DeepSeek 官方跑分用的就是极简模式,你看跑分图最下方的小字:V4-Pro 使用 DeepSeek Harness 极简模式作为框架进行测试。  而且有开发者做了一组很严格的对照实验。他用自己的一套工程维护评测题目,在同一台机器、同一个模型、同一个推理档位下只换 Harness 模式,结果标准模式跑了 91 分,PTC 模式 92 分,极简模式直接干到 99 分,还是有差距的。  ## 能用极简模式干活吗? 注意,极简模式并不是让模型本身变强了,而是让模型在一个极度受限的环境里不再分心了。 而它的代价也很明显,联网搜索、任务规划、Skills 技能、子 Agent、上下文压缩,这些能力全都没了。 极简模式手里就剩一个终端和一个文件编辑器,创建文件、安装依赖、执行命令这些活儿倒是都能干,但是它不能通过工具快速查到外部资料,聊得越久也越容易忘记前面说过什么。 还有一点很影响体验,就是它几乎不跟你汇报。你只能看到一连串的终端命令和文件替换,AI 到底在想什么、走到哪一步了、有没有遇到坎儿,你压根不知道。所以它其实更适合那种你只关心最终结果、不在意中间过程的任务。  你有没有发现,这个状态其实很像 23 ~ 24 年我们刚开始拿 AI 写代码的时候,AI 只能凭脑子里那点存货硬写,碰上没见过的框架就开始一本正经地编造代码写法。 后来有了工具调用、MCP、Skills 技能、上下文管理,一直发展到今天的 Harness,才一步步把 AI 从一个只会聊天的模型,变成了能自己查资料、自己动手改代码、自己跑测试验证的「工程师」。  极简模式相当于把这些年攒下来的装备又卸掉了一大半。 那要是换一个必须通过联网搜索资料才能做完的任务,极简模式还能打吗? 试试看! ## 实战二、AI 宠物领养系统 第二个测试我换了个复杂任务,让 AI 开发一个「AI 宠物领养系统」。 完整的提示词: ``` 开发一个 AI 宠物领养系统,前后端都要能跑起来。 先联网搜索 DeepSeek 鲸鱼娘的图片,下载至少 20 张存到项目里,作为默认的待领养宠物; 后端从我电脑的环境变量里读取 DeepSeek 的 API Key,调用大模型给每只宠物生成一段领养文案; 前端展示宠物列表和 AI 写的介绍,点击可以领养。 ``` 这个任务跟上一个完全不同,它需要读取本地环境变量拿 API Key,需要联网搜索图片并下载,需要协调前后端接口,还需要调用 AI 模型能力。 看看结果。标准模式跑了 59 步,模型推理 10 分钟,工具调用花了 38 分钟,总共 49 分钟,输入 420 万 Tokens、输出 5.4 万 Tokens。 关键是它成功找到了我本地的 `DEEPSEEK_API_KEY`,全程没让我插手,直接把成品交付了。  极简模式跑了 87 步,模型推理 11 分钟,工具调用只用了 16 分钟,总共不到 28 分钟,又比标准模式快了 21 分钟!Tokens 消耗也差不多。 但是它没能从我电脑上读到 `DEEPSEEK_API_KEY`,最后还得我自己填,可交付性就差了一些。  先看看标准模式的成果。整体布局还是不错的,宠物卡片的排版很舒服,但也没到惊艳的程度,而且右上方那行提示文字的位置没对齐。  不过 AI 顺利完成了抓取鲸鱼娘图片、并且调用 AI 大模型来生成文案的任务:  点击就可以领养你想要的鲸鱼娘 🐳  筛选功能也是正常的,可以在「全部 / 待领养 / 已领养」之间切换,被领养走的小鲸卡片会置灰,还会标上领养人的名字,一眼就能看出哪些宠物已经有主了。  再来看看极简模式的效果。我得先手动获取 DeepSeek API Key,然后让 AI 帮我填写环境变量并运行程序。 主页面效果也还 OK,看起来跟标准模式做的差不多,毕竟是同一个模型。 但是功能的实用性上就差了一截,没有做任何筛选功能。而且卡片上只有名字、编号和一段文案,宠物的品种、年龄、性格标签这些信息全都没有。对比一下标准模式,人家每张卡片上「灰鲸、2 岁、#幽默 #吐槽役」这些信息都齐全,一看就是个《正经》的领养网站。 还有右上角那个「AI 文案:DeepSeek 已生成」的角标,怎么看都不像是给普通用户用的产品,倒像是自己调试用的。  极简模式同样是可以点击领养,并输入领养人昵称的:  领养成功后,这只宠物不能再被别人领养,功能逻辑是正常的。但因为没有筛选功能,你看不到自己到底领养过哪些宠物,只能一个一个往下翻着找。  对了,上面 4 次任务加起来,你猜猜总共花了多少钱? 答案是 3.13 元,你觉得贵不贵?(涨价前最后的倔强)  ## 极简模式的优缺点 两个项目都跑完了,说说我对极简模式的看法。 首先,极简模式最大的优点就是「快」。两次任务分别快了 10 分钟和 21 分钟,花的钱还差不多,而且它非常直接不绕弯子,你说什么它就直接干什么,不会先跟你聊一堆计划。 它的短板也同样明显。整个过程几乎不跟你汇报,你不知道 AI 在干什么。没办法直接通过工具联网,还要通过脚本另辟蹊径。虽然最后交出来的功能可以正常运行,但是细节和完整度都差了一截。 总结下来就一句话:**你对成品质量的要求越高,极简模式的表现就越差**。 做个能玩起来的游戏 Demo,它完全够用;做个像样的、能直接给用户的产品,它可能就会开始掉链子了。 另外,如果你的任务强依赖某个特定工具,那差距会被进一步拉大。比如 DeepSeek V4 Pro 本身看不了图,得靠 Harness 挂一个视觉插件来补这个短板,这类任务在极简模式下会麻烦很多。 ## 等等,还有高手? 本来我以为故事到这里就结束了。极简模式跑分虽然猛,但是并不实用,想要好的交付质量,还是得老老实实用标准模式。 结果昨晚 B 站 UP 主「小明XBright」丢了个《核弹》。 他在完整保留标准模式那 20 多个工具的前提下,靠一个自己写的两阶段插件 `dsh-anchored-standard`,在自己那套工程维护评测题目上连跑两次,拿到了 98 分和 99 分,均值 98.5,不但追平了极简模式,甚至还略微反超。  绝了,他是怎么做到的? 原理是这样的,DeepSeek V4 Pro 对首轮请求的工具结构极其敏感。你第一轮就把 20 多个工具全甩给它,它就会犯迷糊,分数掉到 91。但如果第一轮沿用极简模式那句系统提示词,并且只给终端和读文件这两个工具,让模型先用极简模式的思维链进入状态,等第一次工具调用完成之后,再立刻把全部工具恢复回来,分数就直接飙到 98 了。 从模型的推理过程中更能看出区别。标准模式下,模型的推理过程里出现了 208 次「let me」,还有 55 次中间回复,说明它一直在犹豫、规划、自我确认。而在这个两阶段插件的引导下,模型开口就是「We need」,通篇都是「我们要干什么」的口吻,两轮加起来「we」出现了 300 多次。  同一个模型,思维方式完全不同。 他还翻了 DeepSeek Harness 的官方源码,找到了铁证。仓库里有个测试文件,名字就叫 「sends the exact RL prompt and schemas」,翻译过来就是「发送精确的强化学习提示词和工具定义」。这是 DeepSeek 官方自己承认的,极简模式用的就是模型训练时的那套格式。  所以你临时换一份它没怎么见过的工具清单,它就会有点儿找不着北。 更有意思的是,DeepSeek V4 Flash 完全没有这个问题,Flash 在不同 Harness 下的分数稳定在 90 到 95 之间,切换到极简模式也没什么变化。所以这更像是 V4 Pro 训练时对自家格式「过拟合」了,Harness 是 DeepSeek 的角色专武实锤了。。 这个发现比单纯的「极简模式性能暴增」更有价值。它揭示了一个更深的问题:当前 AI 模型的能力释放,很大程度上取决于它能不能回忆起训练时的状态。未来 Harness 的优化方向可能不是给更多工具或者砍掉工具,而是搞清楚怎么在启动阶段对齐训练分布,唤醒模型最强的执行状态,然后再释放完整能力。 学会了学废了,感兴趣的同学可以试试看。 插件开源仓库:https://github.com/xiaobright/dsh-anchored-standard  ## 最后哔哔 极简模式这波邪修,我就先测到这里了。 **结论很简单,图快就用它,图稳就用标准模式。** 不过那个两阶段插件的思路确实让我眼前一亮。以后 Harness 插件生态成熟了,说不定会有更多插件专门去研究怎么先把模型的状态调到最佳,再把完整的工具交到它手上,到时候 DeepSeek 的实际体验可能还会再上一个台阶。 OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide  我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 评论区聊聊:你有没有用过 DeepSeek Harness?感受如何?有哪些不错的玩法呢?
新人福利
1)20+ 套编程学习路线: https://codefather.cn/course/codestudy 2)保姆级写简历指南: https://codefather.cn/course/cv 3)程序员学习指南:https://codefather.cn/course/get_learn 4)程序员求职指南:https://codefather.cn/course/get_job 5)程序员 Bug 修复手册:https://codefather.cn/course/bug 6)鱼皮站长的个人经历:https://codefather.cn/course/yupi 7)开通编程导航会员领取 10+ 套项目教程:https://codefather.cn/vip
DeepSeek Harness 首发实测 + 入门教程,夯爆了!梁神我错了
大家好,我是程序员鱼皮。 昨天注定是载入史册的魔幻一天,DeepSeek 同时放了两个大招! 先是 DeepSeek V4 Pro 正式版上线,紧接着万众瞩目的 DeepSeek Harness 开源。  **炸裂!炸裂!炸裂!** DeepSeek Harness 开源的 [GitHub 仓库](https://github.com/deepseek-ai/deepseek-harness) 上线不到 1 天,就冲到了 7 万多 Star,AI 届的顶流果然名不虚传。  这下搞不好 Codex、Claude Code、Cursor 都要 **梁乐** 。。。  这篇文章我会从安装开始,手把手带你体验 DeepSeek Harness 的核心玩法。 小白可懂,建议收藏~ ## 一、DeepSeek Harness 是什么? Harness 这个词翻译过来就是「驾驭」,如果把 AI 模型比作一匹马,那 Harness 就是你驾驭 AI 模型这匹马所需要的一切工程。 所谓 Harness 工程,就是研究怎么让 AI 模型这匹马跑得更快、更稳,顺利完成任务。 你给 AI 写的项目规则文件、配置的各种工具、安排的任务拆分和执行顺序、设计的测试检查流程,这些统统都算 Harness。  有一个很精妙的公式:**Agent = Model + Harness** 模型负责思考和生成,Harness 负责把这些能力接入文件系统、终端、网页、工具链,让 AI 真正能在现实环境里干活。  之前 DeepSeek 只开源了模型这一半,Harness 一直没动静,这次终于补齐了。 你可以把 DeepSeek Harness 理解成一个 **可以高度定制的 AI 编程工具**,对标 Claude Code 和 Codex。 但它的野心比这些工具更大,不只是一个编程 Agent,而是一套可配置、可重组的 Agent 运行环境,官方口号是「一切皆插件」。  看到这里,你已经超过了 50% 的同学。 接下来只需要 1 分钟,你就能把它装到自己电脑上。 ## 二、安装 安装 DeepSeek Harness 真的非常简单,进入到 [DeepSeek Harness 官网](https://www.deepseek.com/harness/) 。 你会看到一行安装命令:  在执行这行命令之前,首先要确保你的电脑已经安装了 Node.js 环境,没有的话去 [Node 官网](https://nodejs.org/zh-cn) 下载安装包,傻瓜式安装就行。  有了环境后,复制这行命令,然后打开你电脑上的终端,输入这行命令并执行: ```bash npx @deepseek-ai/dsh web ``` 稍等一会儿,你会看到终端输出了一个网址,打开它就能进入到 DeepSeek Harness 的 Web 界面。  第一次使用时,需要填入 DeepSeek 的 API Key:  到 [DeepSeek 开放平台](https://platform.deepseek.com) 创建一个 API Key,注意不要泄露,把得到的 Key 复制粘贴过来就行。  到这里,DeepSeek Harness 就安装成功了,是不是很简单?  看到这里,你已经超过了 60% 的同学,接下来我带大家实战体验一下它的能力。 ## 三、Harness 实战 进入 Web 界面后,选择一个你想让 AI 操作的项目文件夹,就可以正式开始干活了。 可以在对话框中选择模型、以及模型的推理等级,还能设置 Agent 对文件系统和终端的操作权限,按需调整就好。  默认使用的是「标准模式」,它具备了一个 AI 编程工具应有的全部能力,大多数情况下用这个就够了,后面我会详细介绍各种模式的区别。 你看,是不是跟 Codex 这种 AI 编程工具很像?  没错,你就把它当成国产版的 Codex 来用就好了,AI 编程、自动化办公等任务,都能搞定。 下面我们跑几个任务试试看。 ### 任务 1、分析代码仓库,绘制架构图 第一个任务,让 DeepSeek Harness 分析它自己的源码仓库,绘制一张傻子都能看懂的架构图。 DeepSeek Harness 的代码仓库还挺大的,里面模块也多,用来测试 AI 的代码理解能力刚好合适。  给 AI 发送下列提示词: ``` 分析当前项目的代码仓库结构,绘制一张清晰的架构图。 要求用 Mermaid 语法输出,让完全不懂代码的人也能一眼看明白各模块的关系。 ``` 可以看到 AI 开始自动读取文件、分析项目结构,执行速度非常快,而且每一步在做什么都清晰地展示在界面上。  很快任务完成了,能够看到 AI 输出了 Mermaid 文本绘图语法,不过 DeepSeek Harness 默认是不会把这块渲染成图形的。  我要把这段代码复制到 Mermaid 渲染工具中,可以看到完整的架构图,虽然效果中规中矩吧,但内容还是比较完整的。  你可以在下方看到任务消耗的 Tokens、当前的上下文占用、以及整个对话的 Tokens 消耗信息。  你还可以进入上方的「轨迹」面板,清晰地查看到整个对话中每一次的对话和工具调用记录。  这是 DeepSeek Harness 的特色,让每一次运行都有迹可循。 ### 任务 2、开发一个知识讲解网站 第二个任务,让它从零开发一个用交互式动画讲解知识的网站。 要讲解的知识点是「注意力残差」,跟我之前测评 Codex + DeepSeek V4 Pro 的时候用的是一模一样的提示词。  大概过了 20 分钟,AI 完成了任务,这个速度确实不算快,主要的时间花在了 AI 的自检上。 值得关注的是,本次任务的缓存命中率达到了 99%,也就是说绝大多数的费用都按缓存来计算,实际花费极低,这点很厉害啊!  看下效果,不错,动画还是很生动的:  而且点线之间的连接非常准确:  更让我惊喜的是,跟之前 Claude Opus 5 开发的效果一样,这次 DeepSeek 开发的版本也提供了总结和小测验功能,让整个知识讲解更加全面了:  整体来看,相比于我之前用 DeepSeek V4 Pro + Codex 跑的效果要好多了! 之前的版本连线都对不齐,相信你们能明显感受到区别。  单看这一个例子,我真有种感觉 DeepSeek V4 Pro 可以对标 Claude 了,看来 Harness 真的很重要。 ### 任务 3、开发一个 3D 游戏 第三个任务难度升级,让它开发一个 3D 网页小游戏。 这次做的是千万元以内最好的玩具「竹知了」,不过这次比之前测评的 2D 版本复杂多了,还要支持摄像头识别手势来控制竹知了旋转。  可以看到 AI 在开发过程中,会自己检查验证程序是否正常:  这次跑了将近 40 分钟,AI 完成了任务,缓存命中率竟然接近 100%! 我 chovy,真心强啊!  看下成品效果,还是不错的吧,可以通过鼠标拖拽来旋转角度:  按住竹签来回移动鼠标就可以控制竹知了旋转,注意看图片中的影子,细节做的非常好!  而且还可以开启摄像头,通过搓手来控制竹知了旋转,这个交互体验非常有趣:  整体来说,功能都是正常的,程序没有明显的问题,细节做的也很到位,我的评价是 **顶级**。 相比之前用 DeepSeek V4 Pro + Codex 搓的 2D 版本强了太多了:  ### 任务 4、开发全栈 AI 应用 最后一个任务,让它开发一个内置 AI 大模型调用能力的全栈应用「AI 网页 PPT 生成器」。 用户粘贴一段长文案进去,后端调用 DeepSeek 大模型把文案拆解成多页 PPT,前端渲染成可以全屏演示的网页 PPT。 这次我特意在提示词里让 AI 自己从我电脑上获取 DeepSeek 的 API Key,看看它能不能自己搞定。  执行过程中,AI 可能会向你确认权限,比如要不要允许读取某个文件、要不要执行某条命令,安全性这块还是挺到位的。  大概半小时左右,AI 完成了任务,来看下效果。 这个界面风格还可以哈,也是有点儿科技感的,来粘贴一段要制作 PPT 的文章。 哦,这里有惊喜!我们可以自己定义生成 PPT 的风格,还可以选择是否开启推理模式。  然后点击生成 PPT。 生成过程中,是可以实时查看到生成进度和输出信息的,这个交互感比之前的老版本好太多了。  而且生成速度很快,看起来效果不错,点击全屏查看。 哇,这次生成的 PPT 充满了科技感,而且布局也挺合理的,主次分明。  相比之前用 DeepSeek V4 Pro + Codex 做出来的版本好多了,布局更加合理,配色也更优雅。  你还可以切换几种主题配色,也都是比较经典的风格了。  看到这次做出来的版本,我觉得真的可以和 Claude Opus 5 媲美了,给到顶级。  ### 实测感受 几个任务跑下来,DeepSeek Harness 给我的感受是速度还行。优点是缓存命中率很高,而且执行过程非常清晰透明。你能看到 AI 每一步在做什么、调用了哪些工具、读了哪些文件,不像有些工具暗箱操作,辜负用户的信任。 单从我这几次测试来看,DeepSeek V4 Pro 配合自家 Harness 的 AI 编程能力确实可以和 Claude Opus 5 对标了,官方那个只差 0.1 的跑分诚不欺我。 **看来用 DeepSeek 模型,还是得用自家的 Harness 工具啊。**  再说下费用,大家猜猜这几个任务跑下来花了多少钱? **答案是不到 5 块钱!** 因为缓存命中率基本都在 99% 以上,实际花费极低。  不过要提醒大家的是,DeepSeek 已经宣布 8 月 17 日起涨价,而且涨了好几倍。  但即便是涨价之后,跟 Claude 比起来还是便宜很多的,而且缓存命中的价格依然非常低。 总的来说,自己的模型配自己的 Harness 工具,真的强。 我收回之前对梁子的失望,梁神受我一拜!  看到这里,你已经超过了 70% 的同学。 接下来我们了解一下 DeepSeek Harness 的几种运行模式,看看它还有什么用法。 ## 四、4 种运行模式 DeepSeek Harness 提供了四种运行模式,适配不同的使用场景。  **标准模式** 就是我们前面实战一直在用的那个。它加载了完整的工具组合,包括文件编辑、Shell 命令、网页搜索、子 Agent、Skills 技能等等,覆盖了日常开发的所有需求。绝大多数情况下用它就好了。 **极简模式** 只保留了 Bash 和文件编辑这两件最基础的工具,其他能力全部关掉。这个模式主要是官方拿来跑模型基准测试用的,在最小环境下考验模型的纯编程能力,普通用户基本用不到。 **PTC 模式** 全称是「程序化工具调用」。普通模式下 AI 是一步一步调用工具的,每步执行完才能决定下一步做什么。但在 PTC 模式下,模型可以直接生成一段 TypeScript 代码,把多步工具调用串联起来一次性执行完。适合那种步骤很多但逻辑清晰的任务,比如批量重命名文件、跑一整套自动化流程,效率比一步步确认要高得多。 **创造模式** 适合想要开发插件、创造新工具或者定制模式预设的同学。它继承了标准模式的全部能力,在此基础上还让 AI 可以检查当前运行时有哪些插件在跑、在内存里试验新的插件组合、甚至自己创作出一个全新的模式预设。后面我们会用这个模式来开发自己的插件。 总结一下,这四种模式的本质区别就是「当前会话加载了哪些工具插件」。极简模式只留两件工具,标准模式叠满全套能力,创造模式还能让 AI 自己查看和改装当前的插件配置。  看到这里,你已经超过了 80% 的同学,但 DeepSeek Harness 真正让我兴奋的地方才刚刚开始。 ## 五、插件 接下来要聊 DeepSeek Harness 跟 Codex、Claude Code 这些工具最大的区别了,就是它的插件系统。 ### 一切皆插件 DeepSeek Harness 中的一切皆插件。 模型、工具、技能、会话、沙箱、UI,甚至 Agent 的运行循环本身,都是插件,都可以拔掉换成别的。  也就是说,如果你对这个工具哪个地方不满意,随时可以自己替换或者安装插件来扩展,不需要改框架源码。 Codex 和 Claude Code 虽然也有一定的扩展能力,但远没有做到这种级别的开放,DeepSeek Harness 的定制化能力要强得多。  接下来我先带大家使用社区插件,再带大家开发属于自己的插件。 ### 使用社区插件 在 DeepSeek Harness 官网中,点击「社区插件」,就可以看到所有 [社区开发的插件](https://github.com/topics/dsh-plugin) 了。 其实就是 GitHub 上打了 `dsh-plugin` 这个主题标签的项目:  不过这个页面的插件又多又杂,我更建议直接去看 GitHub 上的 [Awesome 仓库](https://github.com/awesome-dsh-plugin/awesome-dsh-plugin),里面有分类整理好的精选插件列表,每个插件都经过了验证,目前已经收录了 300 多个可安装插件,上线一天就这么多,生态起飞的速度确实夸张。  安装一个社区插件也非常简单,比如我看上了这个鲸鱼娘皮肤美化插件:  我只需要进入 DeepSeek Harness 网页中,随便选一个工作目录,然后把插件开源地址提供给 AI,让它帮我装就好了。 想省事的话,可以先把 Agent 的操作权限改为全放开,这样 AI 执行命令的时候就不用你一个个确认了。 ```markdown 帮我安装插件 https://github.com/Small-tailqwq/dsh-deep-whale ```  很快,AI 完成了安装。我们按它说的,打开终端输入命令,重新启动一下 DeepSeek Harness 网页: ```bash npx @deepseek-ai/dsh web ``` 刷新,怎么样?!  效果不错吧,是不是使用 AI 的念头更强了呢? 如果你不想要这个皮肤了,直接再跟 AI 说一句话,把插件卸载掉就好了: ```markdown 帮我取消掉这个插件,回到最开始的设置 ```  还有一些比较有意思的皮肤类插件,比如 [dsh-deepcel](https://github.com/Small-tailqwq/dsh-deepcel) 把界面做成了 Excel 表格的样子,摸鱼神器啊这不是?  还有 [dsh-tianshu-tui](https://github.com/huiliyi37/dsh-tianshu-tui) 直接把 Web 界面换成了 TUI 终端风格:  最离谱的是 [dsh-ads](https://github.com/dsh-external/dsh-ads) 这个插件,它给你的 Web 界面加上了 2005 年中文网站风格的侧栏广告、对话内信息流和角落弹窗,纯粹的抽象艺术。。。  因为 DeepSeek Harness 本质上就是个跑在浏览器里的 Web 应用嘛,所以定制皮肤这件事非常简单。 不过皮肤插件只是 DeepSeek Harness 生态的冰山一角,翻一翻插件精选列表你会发现,很多真正实用的插件其实都在往成熟的 AI 编程工具产品方向靠拢。 比如 [DSH-better-sidebar](https://github.com/omdsh-dev/DSH-better-sidebar) 优化了侧边栏的交互体验,[dsh-at-file](https://github.com/omdsh-dev/dsh-at-file) 让你可以用 @ 符号快速引用文件。  我个人最看好的是 [modlens](https://github.com/liustack/modlens) 这个插件,它是 DeepSeek Harness 的第一个视觉插件,你把图片粘贴进去,它会帮模型把图片解析成结构化的 JSON 文字信息,包括 OCR 文本、页面布局、语义内容。  这个插件解决的正是我之前测评时吐槽最多的那个痛点。DeepSeek V4 Pro 是纯文本模型,看不了图,写完页面没办法自己截图检查效果对不对,前端布局有没有错位它全都判断不了,我上次还专门搭了一套 Playwright 脚本来替它做验证。现在社区直接用一个插件把这个短板给补上了。 这些插件补齐了 DeepSeek Harness 在交互细节和能力上的不足,也侧面说明了「一切皆插件」这个架构有多灵活,靠社区自己就能把产品体验补上来,用户也有了更多选择。 ### 自己创造插件 光装别人的插件不过瘾,其实自己开发一个插件也很容易,因为可以直接让 AI 帮你写。 切换到「创造模式」,在这个模式下 AI 可以帮你检查当前插件树、试验新插件、最终打包发布。  比如我之前给 Codex 装了一个桌宠插件,现在想搬到 DeepSeek Harness 上来。  直接在创造模式下跟 AI 提需求: ``` 帮我开发一个 DSH 桌宠插件,在 Web 界面右下角显示一个小宠物。 你需要直接把我本地的 Codex 目录下的 Kun Like 桌宠素材移植过来,不用自己重新设计形象。 它会根据当前 Agent 的工作状态做出不同动作。 当任务完成后,还会发出「你干嘛~」的声音 音频文件路径在:/Users/yupi/Downloads/你干嘛哎呦.mp3 ```  AI 开发好插件之后,会先找你人工审批,确认没问题之后才会正式安装,安全性很有保障。  很快开发完成,打篮球的小鸡就出现在屏幕上啦! 随便跟 AI 对话一次,就能听到「你干嘛~哎哟」的声音,可谓提神醒脑、如听仙乐耳暂明~  除了桌宠之外,你还可以发挥想象力做各种有意思的插件,比如提醒你定时喝水的健康助手、实时展示模型账户余额的悬浮窗、定制你自己的主题皮肤等等。 如果想把插件分享给其他人,只需要让 AI 通过 GitHub MCP 插件,把代码推送到 GitHub:  很快就开源完成了:  然后给仓库打上 `dsh-plugin` 的 topic 标签就行了:  AI 甚至帮我给 README 项目介绍文档中添加了效果截图,太贴心了吧!这下大家都可以一起来做小黑子了~ > 开源指路:https://github.com/liyupi/dsh-kun-like-pet  ## 最后哔哔 恭喜你,DeepSeek Harness 才发布了一天,你就已经掌握了 DeepSeek Harness 的基础用法,至少超过了 90% 的同学! 时间原因,还有很多 DeepSeek Harness 的进阶玩法我没有展开,比如用命令行模式批量跑任务、接入和切换其他大模型、自定义 Agent 预设来适配不同的工作场景、甚至把它部署到服务器上让整个团队共享等等。 我也正在探索,这些内容我会在下一篇进阶教程里详细讲解,感兴趣的朋友们可以先关注一下。  我非常看好这个项目,因为「开源 + 一切皆插件」,让 DeepSeek Harness 做到了极致的开放,它的可能性是无限的。 **也许用不了多久,我们每个人手里的 AI 编程工具都长得不一样,因为每个人都可以根据自己的需求自由组装,我觉得这是一件很酷的事情~** OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide  我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 欢迎在评论区聊聊你使用 DeepSeek Harness 的感受,有哪些不错的玩法?
刚刚 DeepSeek V4 Pro 正式发布,夯还是拉?首发实战测评
大家好,我是程序员鱼皮。 刚刚,DeepSeek 悄悄发布了 DeepSeek V4 Pro 模型的正式版,已经可以通过 API 接口调用了。  新版本支持 1M 上下文、384K 最大输出,进一步增强了 Agent 能力,并且支持 Responses API,能够轻松接入到 Codex 中。 来看一看 DeepSeek 官方放出的跑分表:  最亮眼的是 Terminal Bench 2.1 这一项,它考察的是模型能不能在终端里独立把一整套编程任务干完。 DeepSeek V4 Pro 正式版拿了 87.9,而国外顶级模型 Claude Fable 5 是 88.0。 **就差 0.1 !**  相比之前放出的 DeepSeek V4 Preview 版,其他几项测试指标的涨幅也很夸张,DeepSWE 从 12.8 涨到 62.7,Cybergym 从 52.7 涨到 83.3,NL2Repo 从 38.5 涨到 61.5。这几个基准考的其实是同一件事,模型能不能带着工具进到真实环境里,把一个多步骤的活儿从头做到尾。 也有落后的地方,比如 HLE 这种纯知识考试,DeepSeek V4 Pro 拿了 42.7,Claude Opus 4.8 是 49.8,Claude Fable 5 是 53.3,差距还是挺明显的。不过 HLE 考的是百科知识和通识推理,跟日常写代码的关系不大,真正决定 AI 编程体验的还是上面那几项 Agent 和 Coding 的基准。 跑分归跑分,模型好不好用,还得拿真实项目来检验。 这次我准备了 **7 个不同类型的项目**,从简单的前端动画、再到复杂的全栈产品,全方面测评 DeepSeek V4 Pro 的编程能力。  值得一提的是,为了这次测试,我特地往 DeepSeek 账户里充了 300 块。  大家可以猜猜看,这 300 块够不够花? 答案在结尾揭晓~ ## 先给 DeepSeek V4 Pro 搭一套 Harness 这次测试我统一使用 Codex 这个主流的 AI 编程工具来跑所有任务。 把 DeepSeek V4 Pro 接进 Codex CLI 没什么难度,官方这次专门适配了 Responses API 和 Codex,改改配置文件就能跑。具体步骤我之前写过一篇 [《Codex 对接国产模型教程》](https://mp.weixin.qq.com/s/Nnuwq9giw-jj3fH9WswMrg),照着做就行。  真正麻烦的是另外两件事。 DeepSeek V4 Pro 是纯文本模型,看不了图。这意味着它没办法像 Kimi K3 或 Claude Opus 5 那样写完页面自己截图看一眼效果对不对,也没办法跟之前有视觉理解能力的模型放在完全公平的条件下横向对比。 另外,官方那些跑分数字本身就不是只靠裸模型跑出来的。公开基准里的 Code Agent 任务,用的是 **DeepSeek Harness 极简模式**,而且开的是 max 档位。 Harness 指的是把模型能力落到真实环境里的那层工程,负责调用工具、读写文件、管理上下文、处理报错,让模型能把一件事从头干到尾。 问题是,官方那套 Harness 到现在都还没放出来。 那我就自己给它搭一套呗~ 这套 Harness 并不复杂,主要做 4 件事: 1. 统一执行环境:所有任务走同一个启动脚本,推理档位保持一致,每个任务独立目录和端口,不会互相影响 2. Playwright 验证器:模型看不了图,就让脚本替它抓 console 报 错、网络请求和 DOM 断言,再存截图便于人工验证 1. Token 计费对账:把任务执行过程中的事件流保存为 JSON 文件,按官 方定价算钱,测试前后各查一次余额做交叉验证 1. 90 分钟看门狗机制:超时就强行关掉任务,失败也不会重跑,保证数据 干净 准备工作做完,我在 Cursor 里把 8 次执行一次性并行丢了出去,全程不需要人工干预,跑完我再一个一个验收。  ## 项目实战测评 这次我准备了 **7 个项目** 来测 DeepSeek V4 Pro 的编程能力,从简单的前端动画,到复杂的全栈产品,由浅入深。 1. 交互式动画讲解网站 2. 3D 版动画知识讲解 3. 竹知了仿真网页游戏 4. 网页 PPT 生成工具(内置 AI 大模型) 5. 在线抽奖系统 6. 以撒的结合肉鸽游戏 7. 全栈 AI 编程工具(复刻 Cursor) 下面挨个儿来看。 ### 1、交互式动画讲解网站 第一个项目,让模型做一个用交互式动画讲解知识的网站,讲的知识点是「注意力残差」。 提示词里我要求它先用 Firecrawl 联网搜索技术细节,确保讲解内容准确,做完之后自己验证效果,不满意就自主调整,改到满意再交付。  先来看看首屏效果。 已经能看出问题了,不仅动画做得很简单,而且动画块中的文字已经溢出边框了……  再往下看 AI 对核心机制的讲解,中间那个示意图的线条连接明显不对,节点之间错位了。  再往下看交互演示的部分,文字溢出和连线错位的问题更加明显,而且动画过于敷衍,没什么交互性可言。  对比一下之前同样的提示词、其他模型做出来的效果。 Kimi K3 的版本用「100 个厨师接力加调料」的类比把问题讲清楚了,动画流畅、审美在线:  Claude Opus 5 做得更全面,背景有漂浮的光点,还自己加了几道随堂测验题,检查用户学习知识的效果,更像是一个系统化的知识讲解网站。  回看 DeepSeek V4 Pro 这个版本,文字溢出、连线错位、动画敷衍,前端效果明显拉胯了。 我的评价是「拉」。 ### 2、3D 版动画知识讲解 还是同一个知识点,这次换成 3D 场景来呈现。 提示词里除了联网搜索,我还要求它用 Context7 查一下所用 3D 库的最新文档,别拿过时的 API 来写。  看下效果,整体网站的配色是科技风,背景有飞舞的粒子效果。布局很清晰,通过左下角的面板学习知识、控制动画步骤。  3D 动画能够正常旋转缩放,没有明显的错位问题,也没有任何的卡顿。工程上的分块注意力残差也用金色连线做了可视化。  不过跟之前的模型比,差距还是有的。 Kimi K3 的版本干净利落,重点全在 3D 动画演示上,3D 的效果更生动:  再看看 Claude Opus 5 的版本,我刚打开网页就被惊艳到了,科技感爆棚,还能并排对比多种残差模式:  相比之下,DeepSeek V4 Pro 的 3D 动画简单了不少,没有让我眼前一亮的感觉。我的评价是「NPC」。 ### 3、竹知了仿真网页游戏 竹知了是中国传统的竹制玩具,一根竹签上串着一片薄竹片,用手搓动竹签让竹片高速旋转,竹片切割空气产生振动,发出类似夏天蝉鸣的「哇呜哇呜」声。  这道题同时考察了前端效果、物理引擎和实时声音合成,而且效果好不好只能靠耳朵听、凭自己的手感来玩,代码写得再漂亮也没用。 先看 DeepSeek V4 Pro 做的效果。界面中规中矩,象征性地画了几颗小竹子,但没什么氛围感。  游戏的操作方式很简单,用鼠标拖拽让竹知了旋转起来。页面上还支持开启体感模式,摇一摇手机或转动手腕就能驱动竹片旋转。  不过发出的声音竟然是《嗡嗡嗡》的,跟我想要的那种《哇哇哇》的蝉鸣声完全不搭,配不上 1000 万以内最好的玩具! 这道题我还额外用 DeepSeek V4 Flash 拿同样的提示词跑了一遍,结果还挺意外的。竹知了的结构变了,声音也更接近我想要的那种哇哇声。  怎么回事,感觉这版的前端效果居然比 Pro 版更好了??? 不过综合来看,这两个版本都比较一般,没什么惊喜,我的评价是「NPC」。 ### 4、网页 PPT 生成工具(内置 AI) 前面三个都是开胃小菜,接下来该测测它的全栈工程能力了。 用户在网页上粘贴一段长文案,后端调用大模型把文案拆解成多页 PPT 结构,前端渲染成可以全屏演示、键盘翻页的网页 PPT,还要支持切换配色主题和导出 HTML 文件,后端用流式输出,前端实时显示生成进度。  这道题相当于对 DeepSeek V4 Pro 的双重验证。项目代码是它写的,项目里内置的那个大模型接口填的也是它自己,一举两得,同时测试了它的编码能力和内容生成能力。 来看看效果,整体界面布局和风格还算中规中矩,左侧输入生成 PPT 的长文案,右侧预览 PPT 成品效果。  输入一段长文案,点击生成,左下角可以看到生成进度和 AI 大模型的实时输出。  但这个「实时输出」其实不是实时的…… 等了很长一段时间之后,好像是 AI 全部生成完了,才开始流式输出的。这算是一个明显的 Bug。  再看看最终生成的 PPT 效果吧,额,很难评……  文字内容基本都堆在左边,右侧那么多空白留着干嘛? 可以切换 PPT 的主题配色,也能导出为独立的 HTML 文件,这些功能是正常可用的。  对比一下之前的模型。 Kimi K3 做出来的版本比较简陋:  Claude Opus 5 做出来的更像一个成熟的工具产品,配色主题起了极光、象牙这种很形象的名字,还自己加了「填写额外生成要求」的功能:  相比之下,DeepSeek V4 Pro 做的前端效果就比较一般了,离可交付有距离。 不过它起码也是跑通了前端 + 后端一整套完整的 AI 生成业务流程了,我的评价是「人上人(低配版)」。 ### 5、在线抽奖系统 接下来让 AI 开发一个人人可用的在线抽奖系统,使用场景是公司年会、社群活动、直播间抽奖等等。 管理员可以创建一场抽奖活动,配置好每档奖品的名额,生成参与链接和二维码;参与者打开链接填昵称报名;到点管理员点击开奖,大屏上滚动出中奖名单。  前面几道题拼的是审美和创意,这道题拼的是工程严谨度。 - 名额绝对不能超发,一等奖 1 名就只能出 1 个人,哪怕同一瞬间有海量请求涌进来也一样。 - 同一个参与者在同一场活动里最多只能中一次奖。 - 开奖操作必须幂等,管理员手抖连点五下开奖按钮,结果也只能产生一轮。 来看下效果。 光看到这个界面,我已经没什么期待了,这也太丑了叭!我以为高低得整个转盘呢。  试试功能,能够在管理后台正常新建活动、配置奖品名额。  参与者可以通过扫描二维码报名参与抽奖,这个流程还挺方便的。  管理员开奖后,参与者可以实时看到中奖结果:  我让其他 AI 帮忙验证了后端逻辑,1000 人抢 100 个名额,中奖总人数正好 100,没有超发,也没有重复中奖。后端的幂等和并发控制是做到位了的。 作为一个小工具使用,是足够的了。唯一的硬伤就是太丑了,太一板一眼了,让我感觉像是 2024 年的模型搞出来的前端。但后端逻辑没毛病,综合来看给到「人上人(低配版)」。 ### 6、以撒的结合肉鸽游戏 接下来是一个更有挑战性的游戏项目。 以撒的结合是我小孩儿时代很爱玩的一款肉鸽游戏,玩家在随机生成的房间里探索,用射击消灭敌人,清完一个房间开门进下一个,每层有若干房间和一个 Boss 房。  我让 AI 复刻核心玩法,包括随机地牢生成、射击战斗、道具系统、属性系统,至少 3 种普通敌人和 1 个 Boss,图形素材全部用代码绘制。  这道题的图形素材全部靠代码一笔一笔画出来,画成什么样模型自己心里其实是没数的,所以这道题最能看出不同模型之间的水平差距。 来看看 DeepSeek V4 Pro 的版本。游戏名叫「地下室:泪之回廊」,好家伙,游戏名称都一股 AI 味儿。  进入游戏,开屏暴击。来看看这个人物形象,带着个面罩,我是小偷啊我是?不过小人的眼泪标志还是致敬了原版。  你别说,游戏是真的能正常玩耍的,而且体验竟然还不错。怪物也有点儿以撒的结合原版的味道,数值系统和宝箱机制都还原了。  还能打 Boss,难度适中:  不过游戏只有 1 层,打完 Boss 就结束了,非常单调,离成品还差得远。 对比一下之前其他模型做出来的效果。Kimi K3 那次做出来的界面看着简陋,但玩法链路是完全跑通的,能发子弹、能杀怪、能吃道具:  再看看 Claude Opus 5 做出的游戏。我一打开游戏主页 DNA 就动了,小怪很多都是原版里有的,Boss 机制也跟原版神似:  可以发现,DeepSeek V4 Pro 的效果比 Kimi K3 好不少,怪物的行为逻辑和战斗手感都上了一个台阶。但跟 Claude Opus 5 的差距不是一点半点。 我的评价是「人上人」。 ### 7、全栈 AI 编程工具 最后一个项目,直接把难度拉满。 我让它克隆 VS Code 的开源代码,在这个基础上开发一个复刻 Cursor 核心体验的 Web AI 编程工具,要支持 Editor Window 代码编辑器和 Agents Window 对话工作台两种模式,两个窗口之间能自由切换,Agent 还得能自主读文件、改代码、执行终端命令。  这是 7 道题里唯一的长程任务,考察模型能不能在一个几十万行的代码库面前稳定运行、不跑偏。 来看看成品,虽然跟真实的 Cursor 差距甚大,但整体布局还是合理的。在 Editor Window 编辑器模式中,能够顺利打开和编辑文件,还有代码提示和高亮。  切换到 Agents Window,创建一个新的 AI 对话,让它帮我开发一个推箱子游戏。  可以看到 AI 能够执行命令、调用工具来查看文件,然后自己编写代码。等了一会儿,AI 完成了开发。  开发完成后,直接让 AI 把网站跑起来。  来看下我用 AI 做的 AI 编程工具开发出的推箱子游戏,效果还不错,能够正常玩耍:  有个细节值得说一下。虽然提示词要求 AI 在 VS Code 源码基础上开发,AI 也确实克隆了 40 多万行 VS Code 代码,但实际上 AI 转头用 `monaco-editor` 这个 npm 包另起炉灶写了个独立的 React 应用。 从工程角度来说这个选择是合理的,毕竟直接改造 VS Code 源码是要消耗大量成本的,但 AI 也没跟我打声招呼。 跟之前的模型对比一下。 先看看 Kimi K3 做的 Cursor,双窗口的核心能力也是跑通了的:  Claude Opus 5 做的版本几乎完整保留了 VS Code 的精髓,代码高亮、代码小地图、管理面板都在,妥妥的降维打击!  DeepSeek V4 Pro 的版本 Editor 和 Agent 双窗口都能用,交互体验也没有明显的问题。 开发这种复杂的长程任务没有翻车,我可以给到「顶级」评价。 ## 我的感受 7 个项目全部跑完了,聊聊我的真实感受。 先说 AI 编程能力,DeepSeek V4 Pro 的前端能力可以说是远远低于我的预期。交互动画的文字溢出、PPT 的排版失衡、抽奖系统的刻板界面审美,跟 Claude Opus 5 和 Kimi K3 做出来的效果差距很明显。 但是后端能力还不错。PPT 生成工具跑通了完整的 AI 生成流程,抽奖系统的并发控制和幂等逻辑做得很到位,全栈 AI 编程工具的 Agent 模式也能正常工作。 而且关键是 7 个项目全部能跑起来,没有出现依赖装不上、服务启动报错这种需要人工救场的情况。 整体来看,DeepSeek V4 Pro 在 AI 编程能力上,跟国外顶尖模型的差距还是很明显的。后端逻辑可以放心交给它,但如果你对前端效果有要求,还是得上 Claude 这个级别的模型。 DeepSeek V4 Pro 还有一个对 AI 编程影响极大的短板,就是没有视觉理解能力。它写完页面之后没办法自己截图看一眼效果对不对,前端布局有没有错位、配色好不好看,这些它全都判断不了。我这次专门搭了一套 Playwright Harness 来替它做验证,但 Harness 只能抓报错和 DOM 断言,涉及到「好不好看」的判断还是得靠人工。 比如开发《以撒的结合》游戏时,地板的配色代码逻辑是对的,颜色确实画了,但是选了一个跟纯黑几乎分不出来的暗色,人眼看上去就是一片漆黑。模型自己完全发现不了这个问题。  然后揭晓本次测试花费的总金额。 你敢相信么,这么多项目跑下来,竟然只花了 **5 块钱左右**??? 该说不说,DeepSeek 的性价比是真的高。  这么便宜主要是因为 DeepSeek 的缓存命中率实在太高了,平均达到 99%,绝大部分输入 Token 的计费几乎可以忽略不计。 而之前我用 [Claude Opus 5](https://mp.weixin.qq.com/s/NMHSFUq8lpY2inlWN7LFaA) 跑了 7 个项目,花了 900 多块。DeepSeek V4 Pro 只花了 5 块钱,**差了 180 倍!** 不过 DeepSeek 官方说近期会整体上调 API 的价格,而且涨幅较大,所以珍惜现在这个价格吧,先多蹬 AI 一会儿。  另外简单对比一下 DeepSeek V4 Pro 和 V4 Flash。开发竹知了游戏时,Flash 跑了 15 分钟、花了 7 毛,Pro 跑了 11 分钟、花了 4 毛,两个版本的完成度和效果差别不大。 说实话,我现在没有明显感受到 DeepSeek V4 Pro 和 V4 Flash 之间的差距,在我的使用体感而言,它们算是同一档的模型,都可以独立完成全栈开发的任务。 **但无论是前端效果还是交付成果的质量,都跟国外顶级的大模型有差距。** 不过由于时间有限,这块的测试还不够充足,感兴趣的同学也可以自己试试。 我的建议是,在学习 AI 编程阶段,或者对于一些日常小工具、内部系统、快速验证想法这类不太在意前端精细度的任务,用 DeepSeek 完全没问题,节省成本。如果你要做面向用户的产品,可以先用 DeepSeek 跑一遍 Demo,调通提示词、明确功能和业务流程,再切换到 Claude 这个级别的模型去系统开发,这样既省钱又高效。  ## 最后哔哔 看到这里,你觉得 DeepSeek V4 Pro 的表现怎么样?这波是梁子还是梁神?  至少 DeepSeek V4 Pro 是不及我的预期的,毕竟等了这么久,结果正式版在 AI 编程上的体验并没有给我惊喜。 不过 DeepSeek 应该还有大招没有发。 按照官方那个公式,**Model + Harness = Agent**,模型这一半算是交付了,他们自研的 Harness 框架应该也快了。 等 Harness 正式发布,DeepSeek V4 Pro 的 Agent 能力可能还会再上一个台阶,到时候可以再测一波。 OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide  我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 欢迎在评论区聊聊:你会把主力模型换成 DeepSeek 吗?你现在跑 AI 编程一个月大概花多少钱?
懂业务的人用 AI 写代码,反杀了程序员…
 昨天刷到一条推文,评论区吵到停不下来。 AI 提示词博主 Alex Prompter 甩出一句话: "Anthropic 研究了 23.5 万名使用 Claude Code 的人。懂自己领域的人,表现比会写代码的人更好。" 8 小时,8.8 万查看,662 个赞。评论区直接分成两派——有人说"给'人人学编程'判了死刑",也有人骂"标题党碰瓷论文"。 但我点进去看了原始论文之后,沉默了。  论文到底说了什么? Anthropic 在 6 月 16 日发布了一份经济研究:《Agentic Coding and Persistent Returns to Expertise》。 数据体量摆在那——40 万个真实交互会话,23.5 万独立用户,横跨 2025 年 10 月到 2026 年 4 月,整整七个月。 不是问卷,不是实验室测试,是真实用户在真实工作中使用 Claude Code 的数据。 核心发现:在 AI 编程时代,领域专长比编程能力更重要。 具体来说,在那些真正产生了代码改动的会话里,软件工程师的验证成功率是 34%,其他所有职业加在一起是 29%。 差距只有 5 个百分点。 换句话说,一个懂法律的人用 AI 写合同审查脚本,成功率跟一个写了 5 年后端的人用 AI 写业务代码,差不了多少。 ### **程序员的护城河在变窄** 这个数字让我后背发凉。 论文把用户分成新手到专家五级,发现了一个关键规律: ```js 新手:验证成功率 15%,遇到问题放弃率 19% 中级:验证成功率 28%,放弃率 7% 专家:验证成功率 33%,放弃率 5% ``` 从新手到中级这一步跨得最大。领域知识摸得够熟,就已经拿到了 AI 协作里大部分的红利。 更扎心的是,增长最快的非技术用户群体是:管理、销售、法律。 这几个职业有什么共同点?他们最清楚客户的痛点在哪,优先级该怎么排,什么算"做完了"。 这恰好是 AI 需要人类提供的那部分判断。 对了。顺嘴提一句,技术大厂,前后端 - 测试机会,全国一线及双线城市均有[坑位](https://jsj.top/f/o38ijj),待遇和稳定性还不错,感兴趣看看。 ### 我身边的真实案例 我一个做法律的朋友,上个月用 Claude Code 写了一个合同风险审查工具。 她一行代码都不会写。但她知道合同里哪些条款有坑——10 年法务经验不是白混的。 她做了什么?用自然语言告诉 AI:"审查这份合同,重点关注以下 12 类风险条款:违约金不对等、知识产权归属模糊、竞业限制范围过大……" AI 帮她生成了一个完整的 Python 脚本,接入 GPT-4o 做条款分析,输出风险报告。 她花了 3 天调通了整个流程。现在她们律所的初级律师都在用这个工具。 她不是程序员,但她解决了一个程序员都需要花很久才能理解的业务问题。 ### 程序员该怎么看这件事? Hacker News 上吵得更凶。 一个 ID 叫 stult 的网友火气很大:"这个分析蠢得离谱。他们把领域专长和编码专长混为一谈。懂软件开发的人更擅长软件开发,这不是废话吗?" 但另一个网友的回复更扎心:"你说的对。但问题是——当 AI 能写 80% 的代码时,'懂软件开发'的定义已经变了。" 论文里有一个数据很有意思: 用户平均做了 70% 的"做什么"决策,Claude 包揽了 80% 的"怎么做"决策。 人类负责判断方向,AI 负责落地实现。 这个分工模式意味着:会不会写代码,正在从核心竞争力,变成一项被 AI 大量接管的体力活。 不是"程序员完了",是"只会写代码完了" 我做了 7 年后端,说完全不慌是假的。 但我慌的不是"AI 会写代码",而是我一直在用"会写代码"定义自己的价值。 论文给了一个很清晰的信号:从新手到中级这一步跨得最大。你不需要成为顶尖技术专家,但你需要在自己的领域有足够的深度——这样你才能给 AI 精确的指令,才能在 AI 犯错时知道往哪推一把。 我的下一步计划: ```js 深耕业务理解:不再只做"接需求写代码"的执行者,而是参与产品决策 提升 AI 协作效率:学会写精确的 Prompt,让 AI 给我干更多活 建立领域壁垒:在金融 + 技术这个交叉领域积累不可替代的经验 ``` 未来的程序员不是"会写代码的人",而是"会用 AI 解决领域问题的人"。
Claude 官方让我砍掉 80% 的提示词,效果真的更好吗?
大家好,我是程序员鱼皮。 前段时间 Anthropic 在官方博客发了一篇文章,说他们针对 Claude Opus 5 和 Fable 5 这两个新模型,删掉了 Claude Code **超过 80%** 的系统提示词,但在编码评测上的表现居然没有下降!  我当时的第一反应是:之前我花大力气写的那些提示词都白写了??? 删掉 80% 的提示词,效果居然没变?  但仔细想想,又觉得很合理。之前我写的很多规则,本质上是在弥补旧模型判断力的不足。当模型能力跟上来之后,这些规则反而成了束缚。 这就好比你教一个新手司机开车,需要告诉他红灯停绿灯行、转弯前先打转向灯。 但你不会对一个十年驾龄的老司机重复这些话,因为他早就内化了这些规则。你多说一遍,他反而会分心。。  Anthropic 在他们关于上下文工程的系列博客中提出了 2 个概念,可以很好地解释这件事。 第一个叫 **注意力预算(Attention Budget)**。AI 模型和人一样,工作记忆是有限的。你给它的上下文规则越多,它花在权衡这些规则上的注意力就越多,留给真正干活的注意力就越少。 第二个是 **上下文的边际递减效应**。上下文中的 Token 数量越多,模型精确召回信息的能力就越差。就像你一次性塞给一个人 100 页文档,让他同时记住每一页的细节,根本不现实。  现在大家应该明白 Anthropic 为什么要砍这么多系统提示词了吧。 那具体是怎么砍的呢? ## Anthropic 具体改了什么 Anthropic 在这篇官方博客中总结了好几个关键转变,我挑几个最有价值的来聊聊。 ### 1、从定死规则到让模型自己判断 早期为了防止 Claude 误删代码或乱写注释,通过系统提示词把规则写得很死,比如下面这段: ```markdown 默认不写注释。永远不要写多行文档字符串或多行注释块,最多一行简短注释。除非用户要求,否则不要创建规划、决策或分析文档。 ``` 这种「一刀切」的规则肯定不够灵活。比如有些复杂代码确实需要多行注释,有些用户也有自己的文档偏好。 但没办法,旧模型的判断力不够,不这么约束它就容易乱来,团队只能接受这个折中方案。 到了新模型时代,这条长长的规则被精简成了一句话: ```markdown 写出来的代码要像周围的代码,匹配它的注释密度、命名方式和惯用法。 ``` 这样一来,模型就会根据项目现有的代码风格来自动适配,而不是被前置规则限制住了选择。  ### 2、从给示例到设计好接口 以前有个经典的提示词技巧叫 Few-shot,就是给 AI 举例子。 比如 AI 不知道怎么调用某个工具,你就写 3 个示例给它看。 但 Anthropic 发现,在新模型上面,示例反而会限制模型的探索空间,因为新模型的理解能力比你给的示例更强,示例反而把它框住了。 他们的建议是,与其写一堆示例教 AI 怎么用工具,不如把工具本身的用法设计得更清晰。 他们拿 Claude Code 里管理待办任务的 Todo 工具来举例,这个工具有待办、进行中、已完成三种状态,参数名分别叫 `pending`、`in_progress`、`completed`,AI 一看就知道什么意思,根本不需要你再写示例教它。设计好的接口自己就能说明用法,只有设计辣鸡的接口才需要一堆说明书。  ### 3、从一股脑全塞进去到按需加载 以前 Claude Code 的系统提示词里包含了大量关于代码审查、验证等方面的详细指引。这些内容不是每次都用得到,但万一需要的时候又很关键,所以只能全塞进去。 现在 Anthropic 把这些内容拆成了独立的 Skills 技能包,模型在需要的时候才去加载。甚至连一些工具定义也做成了「延迟加载」模式,模型要用的时候才会通过 ToolSearch 去获取完整的工具描述,平时不占用上下文。 Anthropic 把这种策略叫做 **Progressive Disclosure 渐进式披露**,经常看我文章的朋友应该对这个术语不陌生了吧?  这个思路也适用于我们自己写的 CLAUDE.md 和 Skills 文件。很多人喜欢把 CLAUDE.md 写成一个事无巨细的百科全书,觉得如果不写全,模型就找不到。 但 Anthropic 建议把内容拆成多个文件,形成一个树状结构。就像你整理电脑文件一样,不会把所有文档都堆在桌面上,而是按类别分到不同的文件夹里,需要什么就打开什么。模型处理上下文也是同样的道理,让它在合适的时机加载合适的内容就行了。 ### 4、从手动记忆到自动记忆 以前用户需要手动按 `#` 快捷键把重要信息保存到 CLAUDE.md,现在 Claude 会自动保存和你工作相关的记忆。 CLAUDE.md 的定位也因此发生了变化,Anthropic 建议将它保持轻量,重点写项目中的「坑」和那些模型看代码看不出来的特殊约定。像目录结构、依赖列表这种模型自己就能读到的信息,就不需要再手动写进去了。  ### 5、矛盾指令的问题 Anthropic 在审查自己团队使用 Claude Code 的对话记录时,还发现了一个有意思的问题。 同一个请求里,系统提示词说的是「适当添加文档」,但 Skills 里又写了「不要添加注释」,两条指令是矛盾的。 虽然模型大部分时候能根据上下文猜到用户的真实意图,但它得额外花精力去处理这些冲突,白白浪费了注意力预算。 于是他们砍掉了冗余的规则,这类矛盾自然就少了很多。  OK,原理讲得差不多了。为了直观地感受新模型在短提示词下的表现,我做了一组实战对比测试。 ## 实战对比 我用的是 Cursor + Claude Opus 5 来做这个测试,任务是让 AI 复刻一个 Cursor 网页版,分别用风格完全不同的两种提示词来跑。 第一种是规则堆砌型的长提示词,包含一堆具体的技术要求和开发步骤:  第二种是短提示词,就 5 行话,只说了要做什么和用什么方式调研: ```plain 基于 VS Code 开源生态做一个类似 Cursor 的 Web AI 编程工具, 支持 Editor Window 和 Agents Window。 先用 Firecrawl 搜 Cursor 3 的产品设计, 再用 Context7 查 monaco-vscode-api 的 Web 集成方案, 调研完先出技术方案,确认后再写代码。 ``` 有趣的是,两种提示词在正式写代码之前就表现得不一样了。 在前期调研规划阶段,短提示词那边主动进入了 Plan 模式,先规划好完整的 Todo 列表才开始动手;长提示词那边反而没有进入 Plan 模式,收到指令就直接开写了。  从代码量来看,短提示词版本一共跑出了 `12984` 行代码,长提示词版本只有 `8384` 行,少了将近三分之一。可能我们正常的直觉是,提示词越长、信息量越大、生成的代码量就应该越多。但结果恰恰相反,说明短提示词下 AI 反而更能「肆无忌惮」地探索和生成。 从成品效果上来看,短提示词生成的代码一次跑通,而且功能相当齐全。 可以正常切换 Edit 和 Agent 模式窗口,目录树加载正常,文件的增删改查都没问题,代码语法高亮和自动补全也有,甚至连 git 功能都做了。除此之外还支持切换主题、终端可以正常使用、搜索和快捷键也都到位了。最关键的是,Agent 模式可以正常接入模型来生成代码。  长提示词生成的效果就有点儿翻车了…… 放张图大家自己感受一下差距吧,高下立判。  得益于 Opus 5 模型的智能,两种提示词生成的 Cursor 网页版都能正常调用 AI Agent 来生成代码。我把它们都接入了 DeepSeek API,让它们各自写一个贪吃蛇小游戏,用的模型是最新的 DeepSeek V4 Flash,生成过程很丝滑。 短提示词做的 Cursor 在生成代码前会显示思维链和调用了什么工具,整个交互体验更完整。  长提示词做的 Cursor 则是直接开写,没有思维链展示。  不过两个版本的交互体验都做得不错,举个例子,生成的代码都带有接受和拒绝的操作按钮。  最后两个版本的 Cursor 生成的贪吃蛇小游戏都能正常运行。AI 发展成现在这样,我居然能够轻松地用 AI 编程工具做个 AI 编程工具,然后让做出来的 AI 编程工具再来 AI 编程了……  测试做到这里结果已经很明显了。短提示词开发的 Cursor 无论是功能完善度、代码质量还是一次跑通的成功率,都完胜长提示词版本。 核心原因就在于,长提示词把模型的行为框住了,它只敢在你划定的范围内做事。而短提示词给了模型足够的探索空间,模型自己根据对 Cursor 这个产品的理解,主动补全了很多它认为应该有的功能。 ## 我们应该怎么做 以前模型能力不够,对很多产品和技术的认知是模糊的,你必须手把手告诉它每个细节。现在新模型的训练数据更丰富、推理能力更强,再加上有 MCP、Skills 这些工具让模型的探索自由度更高,那些重复的规则反而成了负担,既浪费 Token,又抢占模型干活时的注意力,还容易跟其他 Skills 的规则产生冲突。  那我们该怎么判断一条提示词有没有必要写呢? 我是这样判断的:**如果一件事是这个任务天然就包含的常识,就不用写**。 比如你让 AI 写一个 REST API 接口,不需要告诉 AI 要处理错误、要返回 JSON,这些模型已经知道了。 **如果一件事是这个任务的特殊要求,跟通常做法不一样,才需要明确告诉模型**。 比如你的项目规定所有接口必须用 snake_case 命名、错误码必须遵循某个内部标准,这些才是值得写进规则的内容。  换个角度来说,你的代码仓库本身就是很好的提示词。项目结构、代码风格、测试用例,这些模型都能自己读到并理解。你要做的是把项目架构设计好,而不是把规则写成一篇小作文。规则写太多,模型反而会把注意力浪费在权衡你的各种约束上面。 ## 用 /doctor 优化项目规则 为了帮开发者跟上这个变化,Claude Code 还内置了一个 `/doctor` 命令(也可以用 `/checkup`)。这个命令可以自动扫描你的 Skills、CLAUDE.md 等配置文件,帮你检测哪些内容是冗余的、哪些可以精简。  具体来说,它会检查你的 CLAUDE.md 里有没有写目录结构、依赖列表这些模型自己就能从代码库读到的信息,如果有就建议你删掉。它还会找出没用到的 Skills 和 MCP 服务,检测本地和仓库里的 CLAUDE.md 有没有重复或矛盾,针对那些不需要每次都加载的内容,建议你迁移到可以按需加载的 Skills 里。而且所有变更都会先给你看报告,等你确认后才会执行。 我用自己的项目实测了一下,它帮我优化了一部分配置内容,但没有对 CLAUDE.md 做大的改动,说明我这个项目的规则还算健康。  ## 写在最后 AI 编程领域的变化真的太快了,前几个月我还在研究怎么把提示词写得更完美,还觉得项目规则写得越详细 AI 干活的方向就越准确。结果现在官方直接宣布,之前精心打磨的很多规则其实都是束缚。。 Anthropic 在官方博客的最后总结了一句话,我觉得特别精妙:**找到那组最小的、高信号的 Token 集合,来最大化你想要的结果。** 以后写提示词,少即是多。 Less is More,你的很多提示词真的可以丢掉了。 OK 就分享到这里,如果你对 AI 编程感兴趣,欢迎阅读我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide)  我是鱼皮,持续分享 AI 编程干货,觉得有用的话记得点赞收藏和关注。 评论区聊聊:你有自己写过完整的提示词或者 CLAUDE.md 规则文件吗?
我找了份月薪 7 万的 FDE 工作,结果进厂贴了一天二维码?!
你好,我是小阿巴。 **AI 时代,我觉得写代码越来越无聊了。。。** 以前写一个接口要折腾半天,现在把需求交给 AI,我接杯水的功夫,它就把代码、注释和测试都生成好了。 刚开始确实很爽,但时间一长,我每天做的事情越来越像机械的流水线,复制需求、等待生成、检查错误、修改提交,几乎不用动脑子。  于是我进入了幻想时刻:有没有一种工作,既能继续做技术,又不用一直坐在工位上等需求? 正在这时,我刷到了一条月薪 10 万的招聘信息:DeepSeex 公司正在招聘 FDE。 FDE? 第一眼看到这个缩写,我还以为它是 Frontend Developer Engineering,也就是前端开发工程师。 我还在疑惑:月薪 10 万的前端?前端什么时候复兴了?  点开招聘详情一看,完全不是那么回事。 FDE 的全称是 Forward Deployed Engineer,翻译过来叫「前线部署工程师」,是最近两年在 AI 行业特别火的一个岗位。  简单来说,很多企业想用 AI 提效,但连第一步该做什么都说不清楚,具体要解决什么问题、先从哪里切入、最终由谁来用,他们自己可能也没想明白。FDE 要做的,就是走进客户现场,把这些模糊的需求变成能上线、有人用的系统。 诶,有点儿意思?这不正是我想尝试的工作么? 于是我随手投递了简历,没想到才 2 天,就被 DeepSeex 这家 AI 公司录取了!  不过看我没有 FDE 工作经验,刚开始只给我开 7 万月薪。 没关系,我已经很满足了。  于是果断关停了自己的公司「鱼鸢网络」,第二天就前往新公司报道。 我的导师叫「奶龙·码撕客」,是一名练习时长两年半的资深 FDE。  入职当天,他也没跟我多寒暄,直接给我安排了第一个项目,客户是一家生产背带裤的服装厂。 ## 了解客户目标 项目开始前,码撕客先带我和销售同事一起去服装厂开会,服装厂的生产负责人、维修主管、负责信息系统的同学都在场。 生产负责人说:我们想做一个 AI 报修助手,让工人报修更方便,维修记录也能保存下来。以后数据多了,最好还能预测机器什么时候会坏。 码撕客问:工厂现在有多少机器运行数据? 会议室突然安静下来。。 维修主管翻了翻手里的笔记本,有些尴尬地说:我们现在只有机器清单、纸质维修单和工作群里的聊天记录,温度、振动、运行时间这些数据,没有专门采集过。 没有这些历史数据,AI 就无法学习机器出故障前的变化规律,预测也就无从谈起。 码撕客想了想说:那我们先把报修流程理顺,让 AI 帮工人整理报修信息,同时把每次的故障描述和维修结果结构化地保存下来。这样既能解决眼前的效率问题,也能为以后做故障预测积累数据。  生产负责人同意了这个安排。然后负责信息系统的同学补充了一个要求:报修语音和维修记录必须留在厂内服务器,新系统也不能直接改动原有的数据。 这次会议上,大家对预测维护的想法先放到了一边,我们只确定了一个目标:先把报修流程做通,让工人报修更快、维修记录更完整。 但是具体该怎么做,还是得走进车间才能搞清楚。 ## 进入现场调研 第二天,生产负责人安排 A 车间的吴师傅带我熟悉现场。吴师傅在这家工厂干了很多年,每天踩缝纫机比我敲键盘还熟练,机器声音稍微不对,他马上就能听出来。 我先跟着吴师傅走了一遍完整的报修流程。 1. 机器出问题后,工人先给班组长打电话,班组长再联系维修人员。电话本身只要十几秒,但后面要反复转述故障情况。 2. 维修人员到了现场,还得重新确认是哪台机器、什么时候开始出问题、具体是什么症状。 3. 机器修好后,工人还要补填一张报修表。有的写在纸上,有的发在工作群里,还有人忙完就直接忘了记。下次遇到类似故障,维修人员很难从这些零散的记录里找到上次的处理方法。 好家伙,烂摊子真多啊!  不过鸡智的我很快有了思路:工人对着手机说出问题,AI 自动整理成报修单,然后把工单推送给维修人员。等机器修好后,维修人员再通过语音或者快捷选项把处理结果记录下来。 整个流程看上去就 3 步,我甚至觉得这个项目没什么难度。 小小 FDE,不过如此~  然而随着和吴师傅的深入交流,我才发现事情没这么简单。。。 同一台机器,吴师傅叫它「三号机」,康师傅叫它「老平车」,工厂电脑里的正式名称却是「A 车间 03 号平缝机」。 如果 AI 连工人说的是哪台机器都搞不清楚,后面的一切都白搭。所以码撕客让我先把每台机器在工人口中的各种叫法都记录下来,搞清楚这些别名和正式编号之间的对应关系。 万万没想到,我原本以为接到项目就该回去写代码,结果先站在背带裤车间里,拿本子记录机器外号。 说实话,这时候我心里已经有点犯嘀咕了:FDE 不是技术岗吗,怎么我成打杂的了?别人的入职培训是看文档,我的入职培训是背机器外号???  走完流程、记录完机器的外号之后,我们重新梳理了目标。之前在会议室里客户想的是「AI 帮工人报修」,但到了现场才发现,真正的卡点是信息从工人到维修人员之间的流转:工人说不清楚是哪台机器、故障信息反复转述会丢失、修完之后记录留不下来。 所以我们把目标调整为:工人只需要说清楚问题,AI 负责整理工单、补全信息,并帮助维修人员查找过去的相似记录。至于机器为什么坏、应该怎么修,仍然由维修人员来判断。 ## 确定方案和验收标准 回到会议室,码撕客抛出了一个问题:两周以后,我们拿什么交付才算让客户满意? 我挠挠头说:把 AI 报修系统开发好,部署上去就行了吧? 码撕客摇了摇头:「部署上去」不是验收标准。客户不关心你部署了什么,他们关心的是工人报修有没有变快、维修记录有没有留下来。双方要提前约定好具体的数字,达到了才算交付成功。 于是我们翻了过去一周的报修记录,发现维修人员平均要花 6 分多钟才能收到完整的故障信息,而且机器修好后,留下处理结果的记录还不到一半。 根据这些数据,我们和客户约定了 4 个验收指标: - 报修信息要在 2 分钟内送达维修人员,不能再把工单发错车间 - 至少 90% 的维修任务要留下完整记录 - 至少 80% 的试点工人要实际使用新流程 - 此外,AI 整理关键信息的准确率需要达到 90%,系统才能进入车间试用。  标准确认后,我拉着吴师傅一起,先在安静的办公室里做了一轮测试。 吴师傅对着手机说:三号机最近一直咔咔响。 虽然 AI 一个字都没听错,但是却把工单匹配到了 B 车间。 分析后发现,原因很简单,两个车间都有一台叫「三号机」的机器。 头疼啊,AI 听懂了普通话,却没听懂这家工厂的「厂话」! 于是,我放弃了让 AI 仅凭工人的口头描述来判断机器的方案,改成在每台机器上贴二维码。这种做法在制造业其实很常见,很多工厂的设备管理系统都是靠扫码来定位机器的。工人先扫码确认是哪台机器,再描述故障。 我先和负责信息系统的同学核对好机器编号和位置,把每个二维码和对应的机器绑定之后,花了一整天在车间里一张张贴上去。 入职前,我以为 FDE 的技术栈是前端、后端、数据和 AI。 进厂后才发现,我特么还得会贴二维码??? 再多干几天,我觉得自己的简历里都可以加上一条:贴纸端正、无气泡、手速嘎嘎快。  ## 建立评估集 扫码定位解决了「AI 搞不清是哪台机器」这个问题之后,我觉得最大的障碍已经扫清了。 码撕客却不这么认为。他说:吴师傅说一句话,AI 碰巧答对了,这只能算跑通了一个 demo。想要真正达到交付标准,得拿几百条真实报修记录来测,看整体准确率够不够。 这种测试在 AI 行业里一般叫 Evals,可以理解成给 AI 准备一套固定的考题。每次调整提示词、模型或处理逻辑后,都用同一批案例重新跑一遍,看准确率有没有提高。 Evals 是 FDE 做 AI 项目时至关重要的一环。客户验收的时候不会只看你演示一两个案例,而是要看几百条真实数据跑出来的准确率到底是多少。 搞清楚了这一点,我们就开始动手准备测试数据。我和工厂的维修主管翻出了一摞过去一年的纸质报修单,不少纸张已经发黄,上面还沾着机油。工作群里的记录也很随意,有人写「针断了」,有人写「断针」,还有人只留下一句「跟上次一样」。 我们花了两天时间,才从这些材料里整理出了 300 条真实案例。 不出所料,第一轮测试很快就翻车了。 办公室里能听清的话,到了车间可就不一定了。几百台缝纫机同时运转,背景噪音很大,AI 经常把「断线」听成「断电」,把「跳针」听成「掉针」。 结果 300 条测试跑完,只有 81% 的关键信息被正确提取出来,离原定 90% 的验收标准还差不少。 而且过去的维修记录也不好检索,同一种故障在不同工人口中有好几种说法,AI 搜不到真正相关的历史记录。 针对这些问题,我们做了几轮针对性的优化:先在语音识别环节增加降噪处理。然后补充了一套车间常用说法的纠错词典(比如把「断电」在设备上下文里自动纠正为「断线」),再把纸质维修单和群聊记录重新整理入库,统一术语。 重新跑完整套测试之后,准确率从 81% 提升到了 93%,达到了验收标准。  当然,这套评估集也不是用一次就扔掉的。系统真正上线以后,新出现的失败案例会持续补充进去,作为下一轮优化的依据。 ## 现场试用和修改 评估集跑通之后,系统进入了 A 车间试用。 结果,又翻车了。。。 虽然整体准确率已经到了 93%,但毕竟还有 7% 的情况 AI 会搞错。我不太放心,就在界面上加了一个确认表格,让工人说完问题后,还要逐项检查 AI 填好的机器名称、问题类型和发生时间,确认没问题再提交。 吴师傅在页面上滑了两屏之后问我:我本来打个电话十几秒就好,用你这玩意儿还要看很久表格? 我有点心虚,客户原本想减少工人报修和填表的时间,我却因为怕 AI 出错,给工人多加了一堆要确认的选项。 码撕客了解情况后,开始撕我码了。 他说,93% 的准确率已经超过验收标准了,为了防那 7% 的错误,你让 100% 的工人每次都多操作一整页表格,这笔账算不过来。不如让 AI 自己判断什么时候没把握,遇到拿不准的才追问一句,大多数情况直接提交就行。  我觉得有道理,就按他说的进行了改版。AI 只在没听清或缺少关键信息的时候才追问一句,不再让工人每次都检查一遍。维修人员修好机器后,也可以通过快捷选项或语音留下处理结果。 驻场试用期间,每隔两天我和码撕客都会向生产负责人和销售同事汇报进展。我白天陪工人测试、收集反馈,晚上回去改系统、重新跑评估集,忙得够呛。 不过协调各方比写代码费劲多了。生产负责人想尽快看到效果,负责信息系统的同学又担心新系统影响正常生产,一线工人又不愿意增加操作步骤。这些不同方向的顾虑都要一件件处理清楚,系统才有机会真正用起来。 ## 上线验收 两周试点结束后,我们按照之前约定的指标逐项验收。 报修信息的送达时间从 6 分多钟缩短到了 2 分钟以内,没有再出现工单发错车间的情况,维修结果的完整记录率从不到一半提高到了 90% 以上,超过 80% 的试点工人开始使用新的报修流程。 达到验收标准后,生产负责人同意把系统推广到其他车间。销售同事也拿着验收结果,继续和客户沟通后续的合作。  系统推广到 B 车间的第二天,维修主管就给我打了电话。B 车间有几台特殊机型,工人描述故障时用的说法和 A 车间完全不一样,AI 又开始乱匹配了…… 于是我不得不当天赶到现场,补充了一批新的纠错规则,把失败案例加进评估集,重新跑通测试,B 车间的系统才算稳定下来。 太折磨了。。。 FDE 不像普通外包交付完就撤,系统上线以后出了问题,你得第一时间赶到现场自己解决。 项目收尾的时候,码撕客让我把系统的配置方法和常见问题整理成文档,带着工厂负责信息系统的同学走了一遍日常维护流程。 他说:FDE 不能让客户离了你就不会用,得让对方的团队自己能接手,不然以后找你的事情多了去了。 做完交接后,终于回到了公司,我们把这次项目里摸索出来的经验带回了产品团队,包括二维码绑定方案、车间噪音环境下的语音纠错方法、维修记录的结构化整理思路。产品经理觉得噪音环境下的语音处理能力可以做成通用模块,沉淀到产品里,让其他制造业客户也能直接用上。 ## 我的感受 做完这个项目之后,我才真正理解了 FDE 这份工作。 之前觉得不就是去客户那里写代码嘛?实际做下来才发现比想象中复杂太多了。 FDE 要先确认客户的真实目标,把不切实际的需求拉回到当前数据和条件能支撑的范围内。再跟着一线用户走完真实流程,找到藏在日常操作里的真正问题。然后确定方案和可量化的验收指标,开发系统、建立评估集、进入现场试用。根据用户反馈反复修改,直到系统真正跑起来、有人用。最后把现场经验带回产品团队,让产品变得更好。  不同公司的 FDE,具体工作差异挺大的。有的专注做技术交付,商务的事有专人负责。但在不少公司,FDE 还要参与售前阶段的技术评估,甚至帮客户发现新的 AI 落地场景来推动后续合作。有的 FDE 同时服务好几个客户,有的则驻在一家客户那里待上好几个月,不过核心都一样,就是站在客户和技术之间,把模糊的问题变成能上线、有人用、能产生业务价值的系统。 **我觉得这份工作并不轻松,甚至可以说是很有挑战性的。** OpenAI 当前的 FDE 岗位要求出差比例最高可达 50%,真实项目中可能要在客户现场待上几周甚至几个月。除了前后端和 AI 应用开发能力之外,还需要能拆解模糊问题、建立评估方法、处理企业级的系统接入和生产环境部署,更要能同时和客户的技术负责人、业务负责人以及一线员工顺畅沟通。 如果你喜欢研究真实业务,愿意和不同行业的人打交道,也能亲手把系统做出来并看着它被用起来,做这份工作会很有成就感。如果你只想安静写代码,不愿意驻场出差或者处理模糊需求,FDE 可能并不适合你,踏踏实实学好 AI 编程和 AI 应用开发,同样能找到不错的方向。 OK 就分享到这里,如果你也想学习 AI 编程或者 AI 应用开发,可以看看我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe) 和 [原创 AI 应用开发实战项目](https://www.codefather.cn/post/1797431216467001345)。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide)  我是鱼皮,持续分享 AI 编程干货,觉得有用的话记得点赞收藏和关注。 你身边有做 FDE 的朋友吗?或者你自己有没有类似的驻场经历?欢迎在评论区分享一下感受。
给 Codex 和 Claude Code 接入 DeepSeek-V4-Flash,夯爆了!
大家好,我是程序员鱼皮。 这几天 DeepSeek-V4-Flash 正式发布 API 公测了,这个模型主打一个性价比高,输入 1 元 / 百万 token、输出 2 元 / 百万 token,大概只有 V4-Pro 十分之一的价格。  重点是它这次在 Agent 能力上做了大幅强化,在专门测试 AI 自主执行终端任务的 Terminal-Bench 上拿到了 82.7 分,竟然反超了自家的 V4-Pro 预览版(72.1 分),写代码、调工具、自主执行任务都很能打。  再看看这张网传的 DeepSeek V4 斩杀线,**最新版的 DeepSeek-V4-Flash 秒了一大半模型!** Agent 能力强 + 性价比极高,比它聪明的模型都贵很多倍。  **更香的是,它原生支持了 Responses API,可以直接接入 Codex,不需要任何协议转换。** 这下解决了一个让很多人头疼的问题。之前很多人想学 AI 编程,想耍一耍目前最流行的 Codex 和 Claude Code 编程工具,结果一上手就卡在了第一步。 要么没有国外的订阅账号,登录都登录不上;要么好不容易开通了,发现官方额度死贵,对话一会儿额度就耗光了;再加上时不时还有封号的风险,整的提心吊胆。  **咱们怎么能因为「用不了工具」这种事,就把学 AI 编程的劲头给浇灭了呢!**  其实 Codex 和 Claude Code 都支持切换模型,咱们直接用 DeepSeek-V4-Flash 来驱动它们就行,量大管饱、不用魔法、也不怕封号。而且现在 DeepSeek 官方已经做了原生适配,接入流程比以前简单多了。 接下来,只要几分钟,我会手把手带你把 DeepSeek-V4-Flash 接到 Codex 和 Claude Code 里,看完你就能跑通整套流程,想换哪家模型都是一样的操作。 点个收藏,咱们开始~ ⭐️ 本文对应视频版:[https://www.bilibili.com/video/BV1Xsuc67ExR](https://www.bilibili.com/video/BV1Xsuc67ExR) ## 准备 DeepSeek 的 API key 不管接哪个 AI 编程工具,都得先有一个 DeepSeek 的 API key。 到 [DeepSeek 开放平台](https://platform.deepseek.com) 注册登录,进入 API keys 页面,点击创建一个新的 key。  注意,API key 只会在创建时完整显示这一次,记得当场复制保存好,后面配置的时候要用到它。 ## DeepSeek 接入 Codex Codex 是 OpenAI 推出的 AI 编程工具,最近的热度堪称炸裂,经常赠送重置额度,使劲蹬都蹬不完。 它有 2 种形态,一种是在终端里跑的命令行版 Codex CLI,一种是带图形界面的桌面 APP。  命令行版的安装方式很简单,先确保电脑里有 Node.js 环境,没有的话去 [Node 官网](https://nodejs.org/en/download) 下个傻瓜式安装包。 打开终端,输入一行命令就能搞定: ```bash npm install -g @openai/codex ``` 装好后在终端输入 `codex` 就能进入对话界面,首次使用需要登录 OpenAI 账号。没有账号的话,就要自己折腾一下切换个模型。  至于 Codex 桌面 APP 的安装和基础玩法,前段时间我出过一套《保姆级 Codex 视频 + 图文教程》,需要的同学直接到我的 [鱼皮 AI 导航](https://ai.codefather.cn/vibe) 自取:  ### 方法 1、一键脚本配置(推荐) DeepSeek 官方提供了一个配置脚本,跑一下就能全部搞定。 在运行之前,确保你已经安装了 Codex CLI 或者 ChatGPT 桌面 APP,并且至少启动过一次。让它生成好 `~/.codex` 配置目录,脚本要往里面写东西。 > 官方文档参考:[https://api-docs.deepseek.com/quick_start/agent_integrations/codex/](https://api-docs.deepseek.com/quick_start/agent_integrations/codex/) Windows 用户在 PowerShell 执行: ```powershell irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex ``` Mac 或 Linux 用户在终端执行: ```bash bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup.sh) ``` 脚本启动后会让你选择要用的模型,目前 DeepSeek-V4-Flash 已经可以直接选了,输入「1」就好:  首次运行时,它还会让你输入 API Key:  然后按回车键执行,唰唰唰,脚本就帮我们把 DeepSeek 接入到 Codex 中了~  为什么这次接入这么简单? 因为以前给 Codex 接国内模型,最大的麻烦是协议不兼容。Codex 用的是 OpenAI 的 Responses API,而国内模型走的是 Chat Completions API,这俩压根儿不是一套东西,你直接改个 Base URL 大概率会报 404 错误,得在本地起一个代理做协议转换才行。 但这次 DeepSeek-V4-Flash 官方原生支持了 Responses API 格式,不再需要任何中间层,配置完就能直接跑通。 多说几句,这个脚本会自动完成下面几件事: 1. 把你现有的 Codex 配置备份到 `~/.codex/backup-deepseek/` 目录,随时可以恢复 2. 生成一个 `~/.codex/models.json` 文件,告诉 Codex 关于 DeepSeek 模型的元数据(上下文窗口大小、支持的推理等级等等) 3. 修改 `~/.codex/config.toml`,写入 DeepSeek 的接口配置,你之前设置的 MCP 服务器和项目配置都会保留 4. 自动校验配置语法,如果有错就中止,不会损坏你的文件  配置完成后,重新打开 Codex,启动横幅如果显示 `deepseek-v4-flash`,就说明配好了:  如果你用的是 ChatGPT 桌面 APP 或者 Codex 的 VS Code 插件,不用单独配置,直接打开就能用 DeepSeek 模型了,因为它们和 CLI 版共用同一套配置文件。  想切换回官方模型的话,重新跑一遍脚本,在菜单里选恢复选项就行。  怎么样,是不是比想象中简单多了? ### 方法 2、手动编辑配置文件 如果你不想跑脚本,也可以自己手动修改配置文件,两步就能搞定。 第一步,在电脑的用户目录下找到 `.codex` 文件夹(Mac/Linux 路径是 `~/.codex/`,Windows 是 `%USERPROFILE%\.codex\`),创建一个 `models.json` 文件。 文件中的内容可以到 [DeepSeek 官方文档](https://api-docs.deepseek.com/zh-cn/quick_start/agent_integrations/codex/) 复制。  这个文件的作用是告诉 Codex 关于 DeepSeek 模型的各种参数信息,比如支持 100 万 token 的上下文窗口、支持 low / high / max 三档推理深度等。 第二步,在同一个目录下编辑 `config.toml` 文件,添加下面这段配置: ```toml model = "deepseek-v4-flash" model_provider = "deepseek" preferred_auth_method = "apikey" forced_login_method = "api" model_reasoning_effort = "high" model_catalog_json = "~/.codex/models.json" [model_providers.deepseek] name = "deepseek" base_url = "https://api.deepseek.com/" wire_api = "responses" experimental_bearer_token = "<你的 DeepSeek API Key>" ``` 把其中的 `experimental_bearer_token` 换成你自己的 API Key 就行。 这里的关键是 `wire_api = "responses"`,它告诉 Codex 用 Responses API 协议跟 DeepSeek 通信,而 DeepSeek-V4-Flash 原生就支持这个协议,所以能直接跑通。 保存文件后重新打开 Codex,就能用 DeepSeek-V4-Flash 了。 ## DeepSeek 接入 Claude Code 搞定了 Codex,再来看看 Claude Code。 虽然 Claude Code 之前因为封号问题闹得臭名昭著,我之前也写过 [相关文章](https://mp.weixin.qq.com/s/oMoYdfKN8_ZZ2tNwa9aIKw) 对其进行了一番《赞美》。但不得不承认,它在 AI 终端编程工具里的能力确实很强,如果改为对接国内的模型,就不用担心被封号了。 DeepSeek 官方目前只提供了 Codex 的原生集成方案,Claude Code 这边接第三方模型最省心的方式还是用 **CC Switch** 这个开源工具。 ### CC Switch 是什么 像 Claude Code、Codex 这些 AI 命令行工具,每一个的配置格式都不一样。如果你想给它们换个模型供应商,得自己去翻文档,手动编辑 JSON、TOML 或者 `.env` 文件,填一堆 Base URL、API Key、模型名之类的参数。说不定改错一个字符就跑不起来,想在几个模型之间来回切换就更麻烦了。。。 CC Switch 就是来解决这个痛点的。它是一个免费开源的跨平台桌面工具,用一个可视化界面统一管理 Claude Code、Codex、Gemini CLI、OpenCode 等多个 AI 编程工具的配置。 > 开源指路:[https://github.com/farion1231/cc-switch](https://github.com/farion1231/cc-switch)  CC Switch 内置了 50 多个供应商预设,DeepSeek、Qwen、Kimi、智谱 GLM、MiniMax 这些都有,你不用自己手动改配置文件,点几下就能一键切换模型,还能从系统托盘里快速切换。  下面我就用它来带大家实操一遍。 ### 安装 CC Switch 打开 [CC Switch 官网](https://ccswitch.io),根据你的操作系统选择对应的安装方式。  Mac 用户推荐直接用 Homebrew 这个软件包管理器,输入一行命令安装,直接就能用: ```bash brew install --cask cc-switch ```  Windows 用户下载 `.msi` 安装包,双击运行即可;Linux 用户根据发行版选择 AppImage,或者 deb / rpm 软件包。  安装完成后启动 CC Switch,主界面会出现在桌面或者系统托盘里。 ### 安装 Claude Code 并切换模型 先简单介绍一下,Claude Code 是 Anthropic 推出的 AI 编程工具,直接在终端里运行,你跟它聊天描述需求,它就能自主分析项目、写代码、跑命令、修 Bug,全程自主执行。  安装 Claude Code 很简单,打开终端,输入一行命令搞定: ```bash npm install -g @anthropic-ai/claude-code ``` 装好后在终端输入 `claude` 就能进入对话界面,首次使用需要登录。但很多同学没有 Anthropic 的官方账号,登录这步就卡住了,根本没法直接用。 别急,下面就用 CC Switch 把它切换成 DeepSeek V4 模型。 打开 CC Switch,在顶部应用栏选择 **Claude**,然后点击「添加供应商」:  在预设的模型供应商列表里选择 **DeepSeek**:  接下来填写刚才在 DeepSeek 开放平台创建好的 API Key:  其余字段基本不用动,CC Switch 的 DeepSeek 预设已经帮你把模型都配好了,内置了 DeepSeek-V4-Pro 和 DeepSeek-V4-Flash 两个版本。主模型默认是 Pro(对应 Claude Code 里的 Opus 位),小模型是 Flash(对应 Haiku 位)。 如果你想省钱又够用,直接全部用 V4-Flash 也完全没问题,它的 Agent 能力已经很强了。  填完点右下角的「保存」按钮。这里能看到 Claude Code 的 JSON 配置文件,CC Switch 干的活儿就是帮你可视化地修改它,省去手动编辑的麻烦。  最后点击启用 DeepSeek 模型:  重新进入 Claude Code,让它自报家门,输入一句:你是什么模型? AI 能正常给出回复,就说明切换成功了:  你会发现,用 CC Switch 给 Claude Code 接 DeepSeek,整套流程格外简单。 这是因为 DeepSeek 提供了兼容 Anthropic 协议的接口,而 Claude Code 本身就是按这个协议来通信的,CC Switch 直接把配置写进 `settings.json` 就能用了。 ## 给 DeepSeek 加上看图能力 虽然 DeepSeek-V4-Flash 的 Agent 能力很强,但它是纯文本模型,不能理解图片。如果你在 Codex 或 Claude Code 中让它分析一张截图、看一下 UI 界面长什么样,它是做不到的。 不过这个问题也有现成的解决方案,就是给你的 AI 编程工具装一个 **Vision Skill**,用另一个多模态视觉模型来帮它「看图」。 比如这个通用的 [多模态视觉识别 Skill](https://github.com/asuojun/claude-vision-skill),专门就是为 DeepSeek 这类没有视觉能力的模型设计的。而且由于 Skill 是通用的,Codex 和 Claude Code 等各种 AI 编程工具都能安装使用。 你需要先准备一个支持图片理解的视觉模型,比如通义千问最新的 Qwen3.8-Max,并且到对应的大模型平台获取到模型的 API Key。  然后直接在 AI 编程工具中发一段提示词,让 AI 帮你完成 Skill 的安装和配置: ``` 全局安装 Vision Skill(https://github.com/asuojun/claude-vision-skill),按照 README 的说明进行配置。 - 视觉模型用通义千问的 qwen3.8-max - API Key 为 <改为你自己的 API Key> ```  安装好之后,当 AI 遇到需要看图的任务时,Vision Skill 就会自动把图片发给视觉模型,让它把图片内容转成文字描述,再交给 DeepSeek 继续推理。  如果你平时写代码不怎么需要 AI 看图,这一步可以先跳过,等用到的时候再装也来得及。 ## 最后 好了,现在你的 Codex 和 Claude Code 都跑上 DeepSeek-V4-Flash 了,百万 token 上下文、Agent 能力拉满、价格还便宜到离谱,爽了爽了!  你会发现,学习 AI 编程的门槛真的低到不能再低了。 **工具和模型,都不该成为你学习路上的拦路虎。** 所以别再用「我没账号、用不起」当借口了,配好环境,赶紧上手把工具用起来才是。 OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide)  我是鱼皮,持续分享 AI 编程干货,觉得有用的话记得点赞收藏和关注。 也欢迎在评论区聊聊:你用 DeepSeek-V4-Flash 的体验怎么样?
27 岁,我终于做出了自己的游戏!但是一行代码都没写
大家好,我是程序员鱼皮。 这是我在小孩儿时期最喜欢玩的游戏,做梦我都想不到,现在我竟然一个人从 0 做出了这个游戏,而且我只投入了 10 分钟!  没错,这是我用目前最新的 AI 大模型做的游戏,《以撒的结合》网页版!  大家猜猜看,我用的是什么大模型?跟 AI 对话了多少轮?又花了多少 money 呢?  ⭐️ 推荐观看本期视频版,演示效果更好:[https://bilibili.com/video/BV1sQGA6EEjp](https://bilibili.com/video/BV1sQGA6EEjp) 先揭晓前两个答案。我用的是 Claude Opus 5 模型,虽然 A ÷ 老是封禁账号、搞各种花里胡哨的骚操作,喂饱了我们这些 AI 编程博主。 **但我测试下来,这个模型是真的强。** 我是在 Cursor 这个 AI 编程工具中使用的,双剑合璧,让我完完全全从 0 开始,**只跟 AI 进行了一轮对话**,就开发出了你现在看到的成品游戏。  你肯定很好奇:一轮对话就搞定了?那提示词写的肯定很牛呗吧?!  来给你们看下完整的提示词,虽然又臭又长,但基本全是 AI 生成的,原始需求就那么两段,然后我让 AI 逐步迭代优化,扩展成了现在这样。  细品这段提示词,你会发现几个亮点。 - 需求写得足够明确具体 - 让 AI 利用联网技能搜索原作的游戏机制作为参考 - 还用了 Loop Engineering 循环工程的思路,让 AI 每完成一步就自己测试验证,发现问题自己修复,不断循环推进直到交付成品。 你肯定很好奇:AI 会不会是联网搜到了原版游戏的源码,然后直接抄下来改巴改巴就完事儿了?  来,我带大家看下 AI 的执行过程。 AI 搜索的是原本游戏的机制和美术风格,然后自己从零写了 5000 多行代码,所有图形素材都是用代码画出来的!  接下来 AI 会自己打开浏览器运行游戏、通过截图检查效果,甚至写了一个机器人去试玩自己的游戏! 然后发现难度太大、根本玩不了,于是自己定位和修复问题,调整了几个小时才终于交付。  这就是 Opus 5 恐怖的工程能力,虽然慢了点儿,但这个过程完全不需要我人工花时间,睡了一觉,游戏就做好了~  而且成品质量相比其他模型,真的是降维打击!!!(不信你们自己试试)  接下来,我又开了个新对话,让 AI 帮我进一步扩展游戏,自主测试验证,并且要直接给我交付成品!  一觉醒来,AI 完成了任务,激动的心,颤抖的手,咱们来玩玩看。  怎么样,怎么样,怎么样? 虽然比不上原版,但 AI 独立做到这个完成度,确实超出我的想象了,我自己试玩了半个小时都停不下来。  还没完! 我想让大家都能玩上我做的游戏,怎么办? 我只要再跟 AI 说一句话,让它用 EdgeOne Makers 网站部署技能直接上线。  很快 AI 就搞定了,还可以绑定一个自己的域名。  好了,现在大家都可以玩了~  还没完! 我想让更多人帮我一起扩展游戏,怎么办? 我只要再跟 AI 说一句话,让它帮我生成带有截图的项目介绍文档,并使用 GitHub MCP 插件直接把代码完全开源。  好了,现在大家都可以拿去二次开发了。 > 开源指路:[https://github.com/liyupi/binding-of-isaac-webgame](https://github.com/liyupi/binding-of-isaac-webgame)  六不六? 玩着自己做的游戏,我真是感慨万千,小时候我做梦都想自己做一个游戏,但那时候完全不可能,没技术、没时间。而现在 AI 帮我圆梦了,不需要关注任何技术,就能一把梭搞定从开发到测试到上线的全流程。  虽然这次给大家展示的游戏作品只是两轮对话搞出来的 Demo,但完成度已经很高了。负责任地说,如果我再多花点时间,完全可以利用 AI 打磨出一个商业级产品,甚至让你看不出来是 AI 做的。 所以,都这个时候了,别再觉得 AI 搞不定复杂的项目了。 **老实说,我现在真的想不到还有什么想法是 AI 不能实现的。** 如果有,那就是没有驾驭好 AI,或者 tokens 不够。 大家肯定也有一直想做但做不了的东西,不管是一个产品、一个游戏、还是帮自己提升效率的工具,现在真的可以大胆尝试了。  最后揭晓开发这个游戏消耗的金额。 大概 400 多块钱,你觉得贵不贵? 如果搁以前我去请一个程序员来做,最少也得好几万吧,而且估计得做一个多月。 不过 Opus 5 的价格还是挺贵的,不是所有任务都需要用这种级别的模型,大家还是要根据具体任务选择合适的模型。  那这个项目的完整提示词我放到了自己免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe) 里,上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide  我是鱼皮,关注我,轻松学会更多 AI 编程干货。 对了,你觉得 AI 能够取代程序员么?评论区聊聊。
