编程导航AI话题讨论

AI

694 参与
分享

快来分享你的内容吧~

点击登录,快来和大家讨论吧~
表情
图片
话题
打卡
综合
交流
文章
问答

Github 好像崩了,正准备看一下 DeepSeek Harness 社区插件。 突然发现访问不了,很急。。。

给我145元,我给你完成90%需求

今天又和海尔聊,换了项目组。 ### 聊聊权限 我入职以后,领导周二要求上线一个项目。 我就问同事:怎么上线? 然后同事给我说:海尔有个自研平台,你先点开。 我点开,发现没有权限。 这不是笑话是什么:我周二是死线了,周一还没有申请正式流水线权限。 至于为什么不申请?我怎么知道要申请啊。你同事不告诉我我怎么知道要申请? * 没有任何入职引导,没有任何文档,也没有任何入职培训,我怎么知道 然后,领导他表示会办,但是迟迟不办!!!!! 对啊,我明天死线了,今天连环境都没配。 ### 聊聊同事 我给同事说:这个需求不合理,至少要3天。 然后同事说:用Kiro,三个小时就能搞定。 这个Kiro是什么呢?就是可以调用其他模型的一个平台。可以调用国外顶尖大模型。 然后同事就给我说:他90%的需求都用Kiro开发,你得拥抱AI啊。 我一时没反应过来,后来发现:海尔给每个开发,每个月20美元(相当于人民币145元)的AI额度。 ???????? 就这145人民币的ai额度,就能完成90%的需求开发?你在说什么啊? 我的项目是大概80W行代码。 同事的说法就是: * 你先问AI,让他通读整个项目 * 然后按照之前的方法去写,实现功能 * 我认为整体不超过三个小时 * 下班前我看你是否已经完成 不是有现成的工具类嘛,让AI帮你找。 我:????????????????????? 但凡用过ai的都知道,纯AI开发90%需求,光token就得几千。 你145元token,也就够国外模型跑个一千万上下文,你怎么完成了90%需求? 这就像相当于:你说你跑了一个马拉松,然后只吃了一个馒头。 ### 主流推动 然后就是这个同事他非常耐心的不说人话。 首先就是:在山东,所有的开发都知道海尔,和海尔对接过,默认开发知道海尔。 所以领导默认你对接过海尔,使用过海尔的开发工具和工具链。 我:??????所以领导就不培训、不告知、不申请,默认我知道? 同事:对啊。 我:????? 不是,海尔在青岛有这么主流嘛?? 在青岛不用海尔,就相当于java程序员不知道springboot。 ### 测试分支 是这么个情况: * 线上有个测试分支,运维们正在测试 * 假如我直接发布,那肯定会导致整个项目出现问题 * 我想要一个不影响测试环境的 开发分支 同事:不需要。 我这边有个需求,需要打包10个1080p的图片,给1080P的图片加水印。 这个请求我问了一下AI,一次需要200M内存。 假如有100个用户一起操作,每个操作需要1分钟,那就是20GB内存。 所以我个人考虑优化,同事:不需要优化。 然后我就和同事去说:要做鉴权。 同事:不需要鉴权,前端鉴权 然后我就说熔断 同事:不需要考虑 然后我说:那至少要和前端开会 同事:那不需要,只需要给他方法名,前端会自己找的 我:??????? 100个用户在五分钟之内同时点击导出,这个概率不算低了,不考虑??? 不考虑。 我和他一聊,严重怀疑了自己学的java学错了。 就一句话:项目基本裸奔。但凡大一点都不行。 ### 聊聊项目 首先,领导在周六当众说了:我给项目组拖了后腿,要我给解释,要求周二必须上线。 这是你当众说的啊,而且当着所有测试、同事的面说的。 今天人力这去和领导聊,人力说:这个需求不合理。对实习生根本不现实。 领导非常好说话:你说得对,我有点急了。 这就相当于:一个人无缘无故打了另外一个人一巴掌,然后别人问他为啥,他说抱歉,我不应该打你。 ### 聊聊项目 然后重新给我安排了一个项目。 让我非常堪忧: * 你这需求压力,能写出多垃圾的代码,我都不敢想

把 GLM-5.3 接入到 DeepSeek Harness,夯爆了!

大家好,我是程序员鱼皮。 最近 AI 圈儿真是过年了,前脚 DeepSeek V4 Pro 正式版和 DeepSeek Harness 同时发布,后脚智谱就放出了全新的 GLM-5.3 模型。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/G6U8ru90DO9xYDtW.jpg) 听说 GLM-5.3 模型的基座跟 GLM-5.2 完全一样,还是 743B 参数,单纯通过后训练把性能提升了 50%。 **测不完,根本测不完……** 既然现在 GLM、DeepSeek、Kimi 几家国产模型打得这么凶,那干脆在同一个擂台上打一场呗? 我相信你们肯定也想看对吧~ ![](https://pic.code-nav.cn/post_picture/1601072287388278786/RVvWP2H6FcqsSHhF.jpg) 刚好最近大火的 DeepSeek Harness(DSH)支持接入第三方模型,于是我决定把 DSH 当做一个统一的评测工具,把这三家的最新模型放在完全一致的工具链环境下测试,只有模型本身不同,尽量做到公平对比。 ![DeepSeek Harness 工具](https://pic.code-nav.cn/post_picture/1601072287388278786/tHrJlMwG5UxZL00v.jpg) 点个收藏,我们开始。 ## 模型接入 DeepSeek Harness 首先要把 GLM-5.3 和 Kimi K3 模型接入 DeepSeek Harness,这里我就以 GLM-5.3 为例。 如果你还没有安装和使用过 DeepSeek Harness,可以看看我之前的 [《DeepSeek Harness 保姆级教程》](https://mp.weixin.qq.com/s/Rv3ww-67fZrU2hNQeCp8oQ),从安装到上手只要几分钟。 > 视频教程:https://www.bilibili.com/video/BV1VkgK6NEZS 这里我只讲怎么在已有的 DeepSeek Harness 里接入第三方模型。 1)打开 DSH 的 Web 界面,点击左下角的「设置」按钮。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/0WUdmhZruv7yvVMf.jpg) 2)进入「模型」标签页,点击「添加提供方」。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/V07VQSe20UztHAnR.jpg) 3)选择模型提供方为 `zai-coding-cn`,然后到 [智谱开放平台](https://bigmodel.cn/coding-plan/personal/overview) 获取你的 API Key 填进去就行。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/33dVDsu4v6TrIEXc.jpg) 4)展开自定义设置,点击「获取可用模型」。不过因为 GLM-5.3 太新了,默认不会被自动拉取到。 所以需要手动点击「添加模型」,填入 `glm-5.3`,然后保存。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/vUm1djeGPsLeBu0J.jpg) 搞定!现在就可以在对话框中选择并使用 GLM-5.3 模型了~ ![](https://pic.code-nav.cn/post_picture/1601072287388278786/FFk7bg0tXx0ChfWR.jpg) 用同样的方法把 Kimi K3 也添加进来。DeepSeek V4 Pro 是 DSH 安装成功后默认接入的,不需要额外配置。 三个模型都就位了,下面开始正式比拼。 ## 测试说明 为了公平对比,三个模型全部在 DeepSeek Harness 的标准模式下运行,统一使用各模型的默认推理档位,工具链完全一致,提示词完全相同。而且全程不做人工干预,给完提示词就让 AI 自己跑到底。 DSH 会自动扫描我本地安装的技能目录,比如我这里装了 Firecrawl 联网搜索技能、Context7 文档查询技能等,三个模型跑任务时都可以使用这些技能来搜索资料。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/FpHvcwKzGCoFpH4q.jpg) ## 实战 1、致敬《牛来》的 3D 跑酷游戏 最近有一部国产动画电影叫《牛来》,因为建模极度粗糙、剧情抽象离谱,在社交媒体上反向爆火了。 上映第一天票房才 3420 元,结果因为猎奇打卡,短短十几天就冲到了 900 多万。 用半佛老师的话来说: - 如果你花一个多小时去了解这个电影,你就浪费了人生的一个小时。 - 但如果你花了 30 块去看了《牛来》,那说明你真的有 30 块钱。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/9FLi5uQ4edesbZ90.jpg) 我决定让 3 个模型致敬这部电影,做一个《3D 网页跑酷游戏》。 提示词里我故意不做太多功能约束和技术限制,就是想看看模型自己能发挥到什么程度,能不能把电影里的元素还原出来。值得一提的是,我让 AI 用 Loop Engineering 的方式推进,做完一步就自己验证一步,出了问题自己修复。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/RlpoJLTtPxKGAoHG.jpg) OK,开跑! ### GLM-5.3 成品效果 先来看 GLM-5.3 的效果。 进入主界面,可以看到一段故事描述。 有看过《牛来》的朋友吗?这个描述跟电影剧情还挺贴的,草原上的小牛犊牛来,跟随云雀坠入一场大梦,穿过迷雾、狼群与轰鸣的伐木场,唯有向前奔跑才能学会勇敢…… 还挺励志。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/mPCv0cByxelvgQP4.jpg) 进入第一关「晨曦草原」,你别说,这个牛的建模真的挺抽象的,尤其是牛脸竟然还直勾勾地对着你…… 旁边还有个云雀好友陪着牛牛向前奔跑,有点还原电影那个味儿了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ZxbeOTE6trDhF38Y.jpg) 游戏操作支持左右移动、跳跃和滑铲,手感还挺流畅的,可玩性不错。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/px3Hxj3JnPF4NlAz.jpg) 吃到一定数量的幸运草之后,可以释放大招,进入「豹拉疾冲」状态,全屏加速 + 无敌。 解释一下,豹拉是电影里牛来的好朋友,这个大招名字起得挺有意思的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/bE6KXlIZ2QyZL3G8.jpg) 游戏有好几个关卡,而且每一关的主题和机制都不一样。比如「狼群夜袭」这关,你身后真的有狼在追你,还有一个贴合剧情的技能叫「妈妈的守护」,我直接一个泪目。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/oImoTulAaRb9Ye0V.jpg) 可惜,最终牛牛我倒在了第四关。 看看这个死亡结算画面,我真的没绷住,怎么还喷出一团血花了呢? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/4rfcHBhFeZ2QWjhf.jpg) 细节,真的细节…… ### DeepSeek V4 Pro 成品效果 再来看看 DeepSeek V4 Pro 的版本。 主界面还挺像那么回事,也还原了云雀和牛来的故事背景。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/3ttEBngfnD6idVad.jpg) 进入游戏。 额…… 怎么硕呢? 界面真的是干净得一鲏啊! 不过还原了云雀和好友豹拉,它们会陪着牛牛一起奔跑。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xJ09muEG1pofq7Vy.jpg) 移动、跳跃和滑铲功能都是正常的,不过看到这个滑铲效果我真没绷住…… 好家伙,眼珠子都给我铲出来了? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/1Y8FxO9FcF70Aj9f.jpg) 仔细看的话,道路两侧的图标明显飘在了草坪上面。还有就是游戏节奏太慢了,刚开局跑了好久第一个障碍物才出现,也没什么技能和特殊的关卡机制,可玩性较差。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/IzRxSklxqwtptTlx.jpg) 牛牛只有一条命,撞到石头之后直接进入死亡结算画面: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/JFPTdt0lBRq9YxBU.jpg) 整体来看,中规中矩吧。 ### Kimi K3 成品效果 最后看看 Kimi K3 的版本。 主界面的配色平平无奇,跟其他模型一样,也把电影剧情概括了一下。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/fJT4pdJF8Uth48zB.jpg) 进入游戏,界面风格还可以,远处的大山绘制得不错。但是主角牛牛就平平无奇了,不够抽象,看起来就是一组普通的方块。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/DGyTPF76BQoeNvQh.jpg) 虽然牛牛有 3 条命,也可以吃金币,但是没有什么技能和特殊机制,整个游戏就是单纯跑跑跑。 我的豹子朋友呢?云雀呢? 还有这个下雨效果,直接来一个全屏网格?这就有点敷衍了吧…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/3tUhVrZTPYQCxIhv.jpg) 而且最致命的问题是,整个游戏时不时会出现明显的卡顿,帧率不够稳定。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hNdmhmOkLe2OfcHF.jpg) 最后是平平无奇的结算画面,一般。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/KTKoN4NUB0RUyXeW.jpg) ### 实战 1 对比 三个版本都跑完了,胜负应该已经很明显了。 GLM-5.3 的版本完成度最高,多关卡、多技能、剧情还原度强,可玩性远超其他两个。 DeepSeek V4 Pro 实现了基本玩法,但是节奏偏慢、细节粗糙。 Kimi K3 虽然场景画面还行,但游戏机制太单一,还有卡顿问题。 综合来看: - 前端效果 GLM ≈ Kimi > DeepSeek - 可玩性是 GLM > DeepSeek > Kimi - 画面抽象程度是 GLM > DeepSeek > Kimi 整体游戏完成度上,GLM 5.3 遥遥领先。 ## 实战 2、AI 绘图工具 上一个任务是前端游戏,第二个任务当然要换个方向,测试模型的全栈工程能力。 我让 3 个模型开发一个《AI 绘图工具》,用户输入自然语言描述需求,后端调用大模型生成 draw.io 格式的图表,前端嵌入 draw.io 开源编辑器,用户可以直接在线编辑和修改生成的图表。 这个任务同时考验对 draw.io 开源代码的理解、后端 AI 调用链路的设计、前端复杂组件的集成、以及整体产品设计的合理性。 为了方便测试,我直接在提示词里把 API Key 提供给了 AI,省去手动配置环境变量的步骤。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/PpDNj5vpG5VZdZZf.jpg) ### GLM-5.3 成品效果 先看看 GLM-5.3 的效果。 整个页面很有科技感,左侧是 AI 对话框,右侧是画布编辑器。 产品引导做得也很到位,告诉你可以用一句话画出专业图表,还给了几个示例类型。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/uUwR0kNCwi6T1Pmk.jpg) 我让 AI 帮我画出 DeepSeek Harness 的架构图。可以实时看到 AI 深度思考和生成 XML 代码的过程,右侧显示了一个炫酷的 Loading 动画。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/jGOpUVVoVJwiqYKe.jpg) 生成完成后,右侧立刻渲染出了完整的架构图,分层很清晰,而且保留了 draw.io 原本的元素编辑能力,可以直接拖拽和修改。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/k3PnFrk8gFZVzmqo.jpg) 更强的是,它支持连续对话修改。比如我说「帮我把 DeepSeek Harness Core 这里变成红色」,AI 就能精准定位到对应的元素并修改样式,右侧画布实时更新。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Lren7bfEea2fJEaa.jpg) 整体效果非常不错,图片导出功能也能正常使用。 而且你会发现 GLM-5.3 把 draw.io 的编辑能力深度融合进了自己设计的界面中,看起来就像一个完整的产品,而不是生硬地嵌入了一个第三方组件。 ### DeepSeek V4 Pro 成品效果 再来看看 DeepSeek V4 Pro 的表现。 打开界面,右侧画布竟然是一坨空白加一个大大的 Loading 图标? 而且左下角的提示文字还出现了溢出,这把 DeepSeek V4 Pro 的前端确实拉了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/4A3MyThN4xnQadM9.jpg) AI 生成图表的功能是可以正常使用的,但是没有实时展示 AI 思考过程的能力,你只能等它全部生成完了,才能看到结果。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/6vb6MzT0DHr3XY3U.jpg) 最关键的是,DeepSeek V4 Pro 很明显是直接把 draw.io 整个嵌入到了前端页面中,没有做任何深度集成。给人一种很生硬的感觉,跟 GLM 那种把 draw.io 能力自然融合到自己界面中的做法差距明显。 ### Kimi K3 成品效果 最后看 Kimi K3。 Kimi K3 这次生成的界面布局跟 GLM 类似,也把 draw.io 自然融合到了项目中,整体界面风格非常 nice。 不过 draw.io 的图标和菜单栏还是原封不动地保留了下来,融合度比 GLM 略逊一筹。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/bce8CrZn0Yq9bBCV.jpg) AI 生成图表的功能正常,同样支持连续对话修改。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/9bWbUumMB0ZpjdBj.jpg) 但是,后端逻辑明显没做好提示词约束和工具校验,有时候 AI 生成的内容会翻车,直接把 XML 源码糊在界面上而不是渲染成图形。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xm0ApjKKR642m0Jv.jpg) 整体来看,Kimi K3 的前端设计能力跟 GLM-5.3 相当,但后端稳定性差了一截。 ### 实战 2 对比 这个任务 GLM-5.3 的综合表现最好,界面设计、AI 深度思考实时展示、连续对话修改、draw.io 深度融合,每一环都做到位了。 Kimi K3 的前端设计能力很强,但是后端偶尔会翻车。 DeepSeek V4 Pro 虽然也正常实现了核心功能,但是界面粗糙,集成方式生硬,表现最差。 ## 我的感受 两个项目全部跑完了,聊聊我的真实感受。 显然,即使是在 DeepSeek Harness 这个 DeepSeek 的「角色专武」环境下,GLM-5.3 的表现依然很出色。 我选的这两个任务覆盖了纯前端 3D 游戏和全栈 AI 应用两个完全不同的方向,可以看出 GLM-5.3 在任务理解、代码生成质量、产品设计意识这几个维度上都明显领先。 然后聊聊大家非常关心的成本问题,猜猜我花了多少 money 呢? 由于 GLM-5.3 我使用的是编码套餐,不太好直接统计实际消耗金额,我只能拿积分来算了。 两个项目累计消耗了 1151 积分,由于我订的是 Pro 套餐(538 元/月),每周额度是 6 万积分,算下来这次的消耗只占了周额度不到 2%,折算成钱连 3 块都不到。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/yqpFemHSZ5ecMfC7.jpg) 由于我的 Kimi K3 套餐过期了,新的抢不到,所以是直接用 API Key 接入的,总共消耗了 31.07 元;涨价之后的 DeepSeek V4 Pro 消耗了 13.99 元。 单从我的实际花销来看,GLM-5.3 按照套餐来算,性价比是最高的。一周 6 万积分随便你跑,根据我这次测试的这种任务来看,做几十个小项目不成问题。 而且 GLM-5.3 会在发布两周后开源权重。 **在开源世界里,GLM-5.3 目前可以说是编程能力的天花板。** ![](https://pic.code-nav.cn/post_picture/1601072287388278786/QSj4s58fh1iN4EAh.jpg) 而且智谱在发布文章中提到,Hugging Face 之前遭遇安全攻击的时候,Anthropic 的 Mythos 模型只面向约 150 家大型机构提供服务,更多的中小企业和开源项目在最需要帮助的时候,反而用不上最强的防御工具。 当攻击能力在扩散,防御能力就不能只掌握在少数人手中。GLM-5.3 的开源给所有人提供了一把防御的盾牌,这件事本身的意义可能比跑分更重要。 ## 最后哔哔 最后多说几句,这次横评让我对国产模型的编程能力更有信心了。GLM-5.3、Kimi K3、DeepSeek V4 Pro 这几家打得不可开交,对我们用户来说是好事儿,起码有了更多的选择。 OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide) ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/o8iZlZezhCmxhVvI.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 也欢迎在评论区聊聊:你现在主力用哪个国产编程模型?GLM、Kimi 还是 DeepSeek?

厦门国投智能 java AI应用开发 面试题

1.面向对象的几大特征 2.jdk8的lambda的核心特点 3.简单字符拼接和使用append方式拼接的区别 4.面向接口和面向切面编程的区别 5.Spring框架的depend on的注解作用 6.@value注解和@Autowired的区别 7.并发编程的三大特性 8.Spring boot的启动顺序 9.SpringBoot框架的核心配置文件 10.单表千万级记录的情况下,在SQL中分页查询如何优化? 11.根据题目要求写出对应linux运维命令: (1)查询java进程 (2)压缩文件到tar.gz目录 (3)上传文件到远程 (4)访问接口 12.查询数组中频率最高的几个数字,用什么算法?(请写出两种方案)

厦门乐域科技 AI产品经理一面

1.对于你来讲,你觉得你的接下来的规划是什么呢?因为对于海运这个行业,就是我们公司这个行业,它是一个新的行业嘛。那你对自己的发展方向有没有什么计划? 2.你还是偏向喜欢AI的对吗?对,再多问你一句,你觉得AI产出的产品需求和人工产出的产品需求,你觉得各自的优劣势在哪里? 3.你还有什么想问的嘛: 目前我们公司的业务有往AI这方面发展吗?还是说有相应的产品计划吗?

厦门绩牛科技 AI应用开发一面

1.自我介绍 2.简述下RAG的基本流程 3.如何评估RAG生成的准确度 4.SpringCloud框架有哪些组件 5.SpringCloud线程池有哪几个线程池 6.公司项目的SpringCloud框架是怎么样的 7.SpringCloud框架微服务之间是怎么沟通的 8.平时开发RAG和AI智能体用到哪些工具和软件,具体说说你是如何运用的 9.公司未来想要开发生图生视频的AI软件,你是走那个模型渠道 10.在高负载,高并发的场景和不同业务下,你觉得最适合接入哪些模型,你会做什么样的优化? 11.你的AI生成前端代码项目,AI生成的代码,你是怎么去规范它的质量?如何保证AI生成的开发质量? 12.你对公司还有什么问题嘛

用AI写小说? 提示词一变,评价直接两极反转,文笔还是差

用Ai辅助写了两个小说,全死了。 ### 聊聊AI的情况 我自己经常写东西,所以对小说也有一定的兴趣。 大概十年前也一直投稿,但是没人看。 今年失业在家,写点东西。 * 希望有人能看 * 万一能赚点小钱更好 ### 聊聊AI 我自己对AI的态度:不适合作为主要职业,因为失业率太高、项目存活率堪忧。 但是我每天都在用。 那这样就用AI帮我写。 ### 写小说的方式 我这个人写小说的全部大纲,写小说本身。 然后让AI帮我提出不足之处,然后让AI帮我润色,帮我把关。 文笔上,用AI填充人的反应、情绪等细节。 换成编程方面的逻辑就是:我写出质量非常高的伪代码 AI去帮我干杂活,帮我生成mapper等工具类、帮我写测试用例 + 检查代码质量。 ### 聊聊小说的写法 直接写了两篇。 第一篇写了大概2万字,14章 第二篇写了大概1万字,8章。 为什么不直接用AI生成大纲:我自己不能主动控制主角的发展,写小说内容,那怎么叫小说。 而且我对于剧情的把握,是明显强于AI的。 当小说写完以后,让AI帮我对这个章节进行打分,直到AI满意为止。 然后:多个模型交叉验证,国内的模型基本上都跑一遍。 这几天不是有很多国产模型和国外模型相媲美嘛,我也是过去尝了尝。 所有的AI基本上都打出了至少85分、95分以上的高分。 基本上没有什么硬伤。 假如和核心主干关系不大的,AI提出的建议能采纳的都采纳。 ### 聊天 投了两个平台,一个叫番茄、一个叫七猫。 第一个小说,直接死了。评价是:文笔有待提升。 第二个小说,也是直接死了,评价是:整体达不到签约条件 ### 反问AI 然后我就把评价发给AI,问AI对这个怎么看 AI表示:你写的小说就是垃圾。 硬伤很多,章节弱智,评价垃圾,一坨大X。 哥们?这是同一篇文章,你这前恭后倨的样子让人感觉到恶心。 * 我用普通提示词(提示词:请评价这个小说,并打分),他打出大概8.6分 * 我用积极提示词(提示词:请总结这个小说的特色,并打分),他打出大概8 - 9分左右 * 如果用负面提示词(提示词:提提示这个小说的不足,并打分),AI打出7分左右 如果用正面/中立提示词,AI表示这个小说水平在中等偏上。 如果用负面提示词,AI表示这个在中等偏下。 ### 聊聊AI的风向 首先,同一个小说,在同一个事情上,发生了非常严格的分裂。 * 一边说,这个题材非常好 * 一边说,这个题材已经同质化了 * 一边说,这个章节非常有吸引力,只需要小小修改 * 一边说,这个章节有非常严重的硬伤,不修不行 区别只是提示词的不同。 尝试了所有的AI,基本上都差不多这个逻辑。 * 豆包 * 千问 * 百度的文心 * deepseek * 元宝 不同的思考模式也尝试过,差不多。 然后就是:小说的AI味道很重,整体阅读起来非常差劲。 我自己也算读了不少弱智网文,但是AI生成的网文弱智程度是真的难以接受。 起承转合上,是真的不太行。 ### 优势 AI很擅长总结。 他把我的主线剧情梳理的非常非常好。 我写完以后,看一下主线剧情,基本上差距不大。缩写的很准确。 然后就是:问一些十万个为什么,他回答的比较好。 * 契丹用什么类型的银子 * 宋朝是如何和辽国对战的 * 在XXXX年发生了什么事情 * 宋徽宗干了什么事情 这种回答基本上非常精确。 ### 拉差了 我看了一下其他的人,有的人用AI写小说,效果还行。 为啥呢? * 他自己写大纲,自己写内容,他水平大概是8分、8分 * 我自己写大纲,他按照我的大纲去续写,我大纲是8.5分,他续写内容7分 他按照我的大纲去写,而不是按照AI自己的大纲去写,他水平直接下降了一大截。 甚至说:我如果直接用AI大纲,AI续写,说不定能过番茄的签约。 ### 总结 我主导的大纲应该有8分甚至以上。就是文笔估计只有6分。 我主要负责框架的指引、写主线,而AI帮我去找到不足,去修复。 但是结果:AI的效果是:过不了七猫和番茄的签约。 * 七猫的签约大概是10%,也就是写10个能签1个 * 番茄的签约是25%左右 这两个都过不了。 ### 后文 我把用AI润色后的文章,发给同一个AI,大家可以对此进行评价 ``` 《规则怪谈:百间囚室》小说综合评价+打分 总分:8.2/10 细分维度打分:设定8.5、剧情节奏8、人物塑造7.8、逻辑推理8.8、文字文笔7.2、悬念冲突8.5 一、优点亮点 1. 规则设计严谨,推理线是最大加分项 这篇文核心竞争力在于自洽、可推演的副本规则体系,没有常见规则怪谈“为恐怖强行破坏逻辑”的硬伤: 1. 双身份分支抉择极具冲突:幸存者熬25轮,典狱长必须杀人,两条生路都带人性拷问,开局就抛出底层矛盾; 2. 副本机制分层清晰:每轮三阶段(转职选择→自由行动5分钟→典狱长猎杀5分钟)、房门耐久3点、房间入驻限制、典狱长限时移动、每5轮复盘延长时间等规则层层嵌套; 3. 推理闭环完整:沈寂全程依靠规则细节抓漏洞,通过时间、路程、破门伤害机制洗清31号许安嫌疑,推导存在多名隐藏典狱长,所有推论全部有前文给出的系统提示作为证据,不靠主角直觉开挂,逻辑链扎实,解谜感极强。 2. 人性冲突贴合规则怪谈内核 副本天然制造对立:不杀人就会被抹杀的典狱长、害怕被猎杀的幸存者,群体猜忌、抱团、栽赃嫁祸、人人自危的氛围写得很到位。 31号许安的人设是全文高光,不想杀人却被迫背负猎杀任务,善良与求生欲拉扯,跳出“典狱长=纯恶人”的脸谱化套路;幸存者阵营内部分裂(信任沈寂、敌视所有典狱长、摇摆不定三派)真实还原绝境下的群体心理。 3. 悬念铺设层层递进,反转节奏舒服 1. 开篇误导读者认定31号是凶手,中期靠规则推理推翻猜想,引出多名隐藏典狱长; 2. 伏笔回收完整:全程失踪的02号最后主动现身、31号探查撞见两名陌生典狱长、主角预判袭击转移房间规避死亡,伏笔在前,解谜在后; 3. 多重悬念叠加:除“谁是隐藏典狱长”,还有主角未完全展露的专属天赋、02号背后的目的、剩余两名未知典狱长身份、31号最后如何不用杀人通关等长线钩子,持续勾住阅读欲。 4. 副本格局清晰,世界观铺垫完整 简单交代2050末世、规则怪谈、天赋、异能体系,不用大段冗余设定灌水;百间房间五层院落的地图设定具象,房间编号、分层规则一目了然,玩家编号、安全屋机制构建出封闭、压抑的密闭逃生空间,恐怖生存氛围感充足。 二、存在短板 1. 文笔偏平铺直叙,文学性偏弱(扣分重点) 文字功能性远大于观赏性,大量对话+系统提示堆砌,环境、心理描写简略: - 恐怖氛围只靠“撞击声、血腥味、惨叫”重复模板化描写,缺少细腻感官渲染; - 人物情绪大多直白口述(害怕、愤怒、迷茫直接说出口),很少用动作、微神态侧面烘托; - 句式重复度高,系统提示大段照搬,多次重复典狱长、房门耐久规则,少量内容啰嗦冗余。 2. 配角脸谱化严重,区分度低 除沈寂、31号许安、02号三名核心角色外,其余玩家全部是工具人: 71、72、37、44、67等大量路人玩家只有“附和指责、提出疑问、冲动闹事”单一功能,没有专属性格、动机,名字/编号看完很快混淆,群体场面容易分不清谁是谁。 3. 部分情节合理性轻微瑕疵 1. 主角天赋前期铺垫但全程未发挥作用,属于闲置伏笔,暂时看不到设计意义; 2. 玩家群体行为单一,冲突只有“争吵、堵门、怀疑”,缺少更多差异化求生手段; 3. 隐藏典狱长的动机交代空白,只写他们猎杀主角,没有解释他们主动转职、联手杀人的底层逻辑; 4. 自由行动时间、猎杀时段的时间计算偶尔一笔带过,部分路程推演可以更细致。 4. 节奏局部失衡 复盘大段推理段落信息密度过高,连续堆砌对话和逻辑分析,缺少缓冲的情节调剂;猎杀惊悚片段篇幅较短,惊悚和推理的配比略有失调。 三、总结定位 属于高质量规则流逃生网文,核心优势是严谨的规则推理与绝境人性博弈,非常适合喜欢逻辑解谜、副本闯关、无限流规则怪谈的读者;短板集中在文笔普通、路人配角单薄,属于典型“设定剧情出彩,文字打磨不足”的网络文。 如果后续优化文字描写、丰富配角人设、回收天赋伏笔、补充典狱长动机,分数可以提升至8.7分以上。 ``` 文笔是硬伤。 但是我让你AI修的文笔,你给我修出来一个7.2分,你是真的有水平。

【Nexus 数字中枢】企业协作平台 · 公测通知 信息散落各处、审批流程卡壳、跨部门协作像在玩传声筒? Nexus 来了——一个真正把「简单留给用户、复杂交给系统」的统一工作入口。 🔥 我们解决什么问题? 痛点一:信息孤岛。IM 在一个 App,文档在另一个,审批又跳到第三个,一天切换几十次。 痛点二:体验恶化。功能堆砌但每个都半成品,用起来比不用还累。 痛点三:管理内卷。考勤打卡要开三个系统,流程审批找不到人,数据报表靠手工拼。 痛点四:AI 落地难。号称智能助手实际只会复读机,帮不上真忙。 痛点五:出海协同难。跨国团队时区不同、工具不统一、安全合规一团乱。 Nexus 把这五个问题一次性解决。 ⚡ Nexus 是什么? 代号「数字中枢」,对标 WhatsApp / 钉钉 / 华为 WeLink 成熟度的企业协作办公平台。 不是又一个「万能软件」,而是体验极致、高度智能、生态开放的统一工作入口。 当前版本:Windows 桌面端(Electron),移动端和纯网页版后续迭代。 🎯 核心能力一览 一、即时通讯(IM) 支持全部消息类型——文本(富文本)、图片、语音、视频、文件、位置、名片、投票、合并转发、DING 强提醒 已读回执、消息撤回(2 分钟内)、@提及、消息收藏、多选批量操作 群聊支持 500+ 人,群禁言、群公告、群昵称自定义 全局搜索覆盖联系人/消息/文件/链接,10 万条内 200ms 响应 云端漫游 + 多端同步,离线消息上线自动推送 全链路 TLS 1.3 加密传输,敏感词过滤,截屏提醒 二、视频会议 一对一音视频通话 + 多人会议(100+ 人,SFU 架构) 屏幕共享(整屏 / 单窗口 / 浏览器标签页)+ 共享批注 + 远程控制 会议录制(云端存储)+ AI 自动生成会议纪要(提取议题、决议、待办) 实时字幕 + 实时翻译(中英日韩等互译) 虚拟背景(预设 / 自定义 / 背景虚化) 举手发言、互动白板、会议内聊天、投票问卷 弱网自适应降级(720P→480P→360P→纯音频) 三、文档协作 富文本文档 / Markdown / 在线表格 / 在线幻灯片 多人实时协同编辑(CRDT 算法,无冲突),各自光标可见 行内评论 + 讨论线程 + 批注建议(审阅模式) 版本历史(自动保存 + 手动快照)+ 版本对比 + 版本回滚 内置模板(会议纪要 / 周报 / 需求文档 / 项目计划) 四、流程审批 可视化表单设计器(拖拽控件:文本 / 数字 / 日期 / 单选 / 多选 / 下拉 / 附件 / 金额 / 明细表) 可视化流程编排(发起人→审批→抄送→条件分支→并行分支→结束) 支持会签 / 或签 / 条件路由 / 审批委托 / 退回 / 加签 / 超时处理 内置模板:请假 / 报销 / 出差 / 采购 / 用印 / 合同 / 加班 / 离职 流程进度可视化 + 效率分析(识别瓶颈节点) 五、关系图谱(评审重点模块) 类似 Obsidian 关系图谱的企业版,把部门关系、员工关系、事项构建为关系网络 万级节点(10 万+)真实可交互,FPS ≥ 30 不卡顿 三层渲染架构:L0 鹰眼全景(Canvas 2D)→ L1 当前视口(按需加载)→ L2 聚焦子图(WebGL/GPU 加速) 操作:缩放 / 平移 / 拖拽节点 / 双击聚焦子图 / 节点搜索与筛选 后端图数据库(Neo4j/NebulaGraph)+ 视口查询接口 + LOD 分层策略 六、AI 智能助手 企业知识库 RAG 问答(基于内部文档检索 + 引用来源) 自然语言查询业务数据(「上个月销售部考勤异常有哪些」) 会议录音自动转文字 + 提取待办任务并同步到项目模块 长文档一键摘要 + 多语言翻译 语义搜索(跨 IM / 文档 / 论坛 / 日程,按语义相关度排序) 智能日程推荐(分析参会人空闲时段) 所有 AI 功能标注「AI 生成」标识 七、统一门户工作台 All-in-One 卡片式布局,可拖拽排序、显示隐藏自定义 待办中心聚合所有模块待办(审批 / 任务 / 日程) 全局搜索(Ctrl/K 快捷键唤起,覆盖人/消息/文档/日程/任务/知识库) 应用中心分类展示所有功能模块入口 八、日程管理 日 / 周 / 月 / 议图四视图 + 多日历叠加(个人 / 团队 / 共享 / 节假日) 日程冲突检测 + 参会状态管理 + 提醒通知(应用内 + 系统通知 + 邮件) 关联视频会议(一键从日程加入会议) 九、云盘文件 个人空间 + 企业共享空间,配额可配置 大文件分片上传(>50MB 自动分片)+ 断点续传 + 秒传(MD5 校验) 在线预览:图片 / 文档(Office/PDF) / 视频 / 音频 / 代码 / 压缩包 链接分享(密码 + 有效期 + 权限控制)+ 版本管理(20 个历史版本)+ 回收站 十、项目任务管理 看板视图(卡片拖拽流转)+ 列表视图 + 甘特图(依赖关系 + 关键路径) 子任务多级嵌套 + 标签 + 工时统计 + 燃尽图 项目模板(软件开发 / 市场活动 / 产品研发) 十一、考勤管理 GPS 定位打卡 / WiFi 打卡 / 人脸识别打卡 / 外勤打卡 固定班制 / 排班制 / 弹性工制 / 轮班管理 请假调休加班 → 审批流程联动 → 年假额度自动计算 个人月报 + 部门统计 + 异常提醒 + Excel 导出 十二、通讯录组织架构 多级部门树形结构 + 跨部门虚拟团队 拼音搜索 / 拼音首字母搜索 / 模糊搜索 入离职调岗自动化(开通账号分配权限 / 冻结回收权限) 人员详情页快捷操作(发消息 / 发起通话 / 发邮件 / 查看日程) 十三、企业论坛 公司新闻公告(置顶全员推送)+ 员工动态(类 Twitter)+ 长文技术分享(Markdown) 点赞评论转发收藏 + 话题标签 # + 关注粉丝 热门排行 + 推荐信息流 + 话题广场 + 版块管理 敏感词检测 + 举报审核 十四、消息通知中心 统一面板聚合待办 / @我的 / 系统 / 业务 四类通知 在线 WebSocket 推送 + 离线 Electron 系统通知 勿扰模式 + 推送频率控制 + 偏好设置 十五、开放集成平台 OpenAPI(RESTful,Swagger 文档)+ Webhook 事件订阅 第三方应用接入(ERP/HR/CRM 对接) 低代码平台(表单设计器 + 流程编排 + 自定义应用搭建) 十六、数据分析 预设报表(活跃度 / 会议 / 审批 / 考勤 / 协作)+ 自定义报表 数据大屏(可配置布局)+ Excel/CSV 导出 + 定时报表邮件 十七、安全合规 全链路 TLS 1.3 传输加密 + AES-256 存储加密 RBAC + ABAC 混合权限模型(岗位层 / 角色层 / 数据范围层 / 操作权限层) SSO 单点登录(OAuth 2.0/OIDC/SAML 2.0)+ MFA 多因素认证 审计日志(180 天保留,不可篡改)+ 水印防泄密 + 截屏检测 遵循《个人信息保护法》《数据安全法》 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 🏗️ 技术架构亮点 四层技术架构: 终端接入层 — Windows 桌面端(Electron + React + Ant Design 5.x) 业务应用层 — 19 个微服务(网关 / 认证 / 用户 / IM / 会议 / 文档 / 审批 / 知识图谱 / 日程 / 云盘 / 项目 / 考勤 / 通讯录 / 论坛 / 通知 / 集成 / AI / 分析 / 门户) 平台支撑层 — 统一门户 / 流程引擎 BPM / 集成 CIP / 消息中心 / 数据中心 / 权限引擎 / 表单引擎 / AI 引擎 / 图谱引擎 / 低代码平台 基础设施层 — 云原生 K8s / 分布式存储 / 消息队列 / 缓存 / 图数据库 关键技术选型: 认证:JWT(RS256 非对称签名)+ Refresh Token IM:WebSocket 长连接 + Snowflake 消息 ID + Elasticsearch 全文搜索 会议:WebRTC P2P+SFU 混合架构(mediasoup/LiveKit)+ TURN/STUN 穿透 协同编辑:CRDT 算法(Yjs/Automerge) 工作流:Flowable 扩展(BPMN 2.0 标准) 关系图谱:Neo4j/NebulaGraph + Canvas 2D/WebGL 分层渲染 + G6 5.0 GPU 加速 AI:RAG 架构(Embedding 向量化 + Milvus/Chroma 向量数据库)+ ASR 语音识别 📢 公测说明 当前阶段:Windows 桌面端公测中 适用对象:中大型企业(500 人以上)、跨国/多地域组织、知识密集型行业 获取方式:访问 GitHub 仓库获取源码与部署指南 仓库地址:https://github.com/WangYuecheng1106/nexus-digital-hub,也可以去项目官网http://82.156.154.115 💬 问题反馈 公测期间任何问题、建议或 Bug 反馈,欢迎发送邮件至: jackwang20141106@outlook.com 我会认真阅读每一条反馈,持续迭代优化。

总结:祝贺海尔,喜提暴死的AI项目

### 聊聊项目 大概几年前的时候,我在华为做大数据,被裁了。 情况是这样的: * 上线了一个项目,**效果不理想**,于是华为就要求项目负责人优化。 * 然后,优化无果,把两个项目负责人裁了,招聘青碧凝霜来接手二开 * 青碧凝霜拒绝,开始了职场自保 * 然后就被裁了 核心是一个问题:能上线,但是效果不理想。 死在我手里了。 上线只是一小步,上线以后稳定盈利,才是**最难的**。 ### 聊聊AI项目:套皮 海尔的这个AI项目,他100%套皮。 没有自研的AI模型,也没有任何技术深度,就是纯套皮。 做的就是优化提示词 + 帮用户生成提示词。 做的非常非常好看。 提示词做得好。 你随便写个垃圾提示词,然后经过AI分镜 + 提示词优化以后,剧情质量真的大有提升。 有多好看呢? * 他是做了好几个人设,比如说分镜师、模型师、文案师傅,进行了AI分工 * 给每个人设加了一个立绘 * AI可以并行可以串行 * 自动生成提示词模板 * 材料素材可以复用 * 设计了一套独立的提示词系统, * 分镜技术,可以通过简单的模型生成提示词 * 可以拼接成品 * 从使用体验上来看,基本上算一流 和市面上普普通通的文字 + 输入比起来,这个项目的颜值 + 第一感觉绝对能打。 美工绝对没问题。审美绝对在线。不是T0也是T1级别。 细节打磨到位。 能够比传统模型效果好整整20%。 ### 聊聊系统设计 首先这个系统,他是非常非常的自动化的、而且是单向的。 不支持修改和回滚。 比如说:我在写提示词的时候,提示词写的不好,导致最后效果很差。 钱是不会退给你的。 而且:这个流程由于已经生成了成品,所以没办法二次修改提示词。 比如说:你已经生成了一个成品。这个成品在小细节上有瑕疵,你想修复。 不可以,不支持。 整个流程分成五步,假如你已经进入第四步,无法回退到第三步。假如你发现第五步的时候,第一步弄错了,只能将错就错。 至于为什么?那非常简单:难以维护N对N。 一共五个流程,每个流程都能回退,这个开发成本太高。做个单向流动的,适合普通人理解。 ### 聊聊AI的幻觉问题 五个测试,一共生成了大概15个成品,花了大概1000元钱。 其中,大部分的效果中等偏差。 举个例子: * 做了一个电冰箱 + 烤箱的广告,然后打开电冰箱,里面出现了一个炉子 * 抽油烟机像空调一样打开了风扇叶 * 三开门洗衣机打开的方式不对 而另外一个问题,就是双生子问题: * 一个其乐融融的家庭,有两个妈妈一起像照镜子一样吃饭 * 然后两个妈妈一个向左走去,一个向右走去 爸爸的头诡异的旋转了90度:我觉得人类是做不到90度的。 还有常见的问题:字是乱码的,生造字。 镜头切换非常非常生硬。 AI味道很重。 然后就是:生成的视频不遵守提示词规则。 比如说:你告诉他视频中要出现一个水壶、然后还有其他11个东西。 那有概率这个水壶就不出现。 如果不收费的话,我只能说效果真的是嘎嘎棒,问题是:1秒钟1元钱。只能说中等偏下。 ### 同质化的AI脸 不知道为什么,同质化的AI脸。 AI味道很重,而且经常细节会崩。 就是空间割裂:两个人明明距离很远,然后突然贴下一帧贴近。或者上一帧很近,然后下一帧很远。 剧情很跳。空间错位,声音AI味道很重。嘴唇乱动。 豆包常见的圆圆脸。然后就是霸总AI脸。 如果不收费的话,那效果的确可以说没问题。但是一秒钟一元钱。 ### 聊聊项目的情况 然后就是:资源不够。 测试环境经常性的卡死。 整个项目就5个测试在用,然后卡死了大概3-5次。 测试的反馈就是:我中午休息了两个小时,然后还没生成。 开发那边的反馈是:中午发版了。 只能说稳定性非常差。 ### 聊聊定价 1080p的,一秒钟1元。 60秒就是60元。 领导就说:测试的时候,不要生成1080P的,太贵。 只是生成了720P的。 一张图片大概0.5元。 从素材来看,图片也是相同的问题:同质化严重。 距离商业化很远。 ### 和群友的沟通 群友说了:这个定价,直接劝退99%的人。 得效果好才行。 效果偶尔惊艳,但是不能细看。细看崩坏的厉害。 测试提了:应该做回退功能,还有崩坏、角色出现双胞胎的情况,被全部拒绝。因为直接修不了。 ### 总结 美工到位,设计自己流程和提示词,大大提高了视频的效果。 但是由于技术限制,导致第一眼看过去非常非常惊艳,但是第二第三眼看过去,细节、空间、剧情、作画崩坏。 价格极高无比,劝退99%的用户。系统稳定性没有经受过考验。

DeepSeek Harness 最新邪修曝光!被吹成核弹的极简模式,真的夯吗?

大家好,我是程序员鱼皮。 这周 AI 圈儿又炸了,DeepSeek 同时放了两个大招,DeepSeek V4 Pro 模型正式发布 + DeepSeek Harness 工具开源。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Pyfhi6P1FOp4mUow.jpg) 我第一时间发布了 [《DeepSeek V4 Pro 的实战测评》](https://mp.weixin.qq.com/s/GbphlXazvmtZUvRA5ptdyQ) 和 [《DeepSeek Harness 的保姆级教程》](https://mp.weixin.qq.com/s/Rv3ww-67fZrU2hNQeCp8oQ) 的文章和视频版。 **麻了,我每天眼睛一睁就是写稿,做完视频就快该睡觉了。** 热点能不能不要连着来啊,我 Chovy! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/VfRz147R8UomdIAS.jpg) 回归正题,测试完之后,我最大的感受是:**DeepSeek 接不接自家的 Harness,效果差距大到离谱。** 同一个 DeepSeek V4 Pro 模型,裸接 Codex 的时候连线条都画不对,换上自家的 Harness 之后居然能对标 Claude 了??? 害得我成为了「变脸大师」! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/FxYyJ820Zq7YsuFr.jpg) 看来 Harness 就是 DeepSeek 的角色专武,不带专武的 DeepSeek 就是个白板儿角色。 海外一个叫 sentdex 的独立评测博主跑出了一组更夸张的对比。同一套 DeepSeek V4 Flash 模型权重,用他自己写的简陋工具只过了 44 / 89 题,换成社区的完整 Harness 之后变成 64 / 89,多过了整整 20 题。 **Agent = Model + Harness** 随着模型能力越来越强,给模型提供的 Harness 也越来越重要。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/lpmjK9MIQLc7OEph.jpg) 这也是为什么 DeepSeek V4 Pro 会出现「神鬼二象性」,同一套模型到底行不行,很大程度上取决于你拿什么工具、配什么环境去跑它。 而这两天社区里讨论得最炸裂的一个说法,就跟 DeepSeek Harness 中一个不起眼的模式有关。 ## 极简模式邪修 有人发现,只要把 DeepSeek Harness 切换到「极简模式」,模型性能就会瞬间暴增,直接复现灰度测试版的水平,甚至做到了 Fable 5 级别的效果。 这个说法一出来,B 站上跟着涌出了几十个实测视频,标题一个比一个炸裂,什么确认反转、核弹爆炸、史诗级反转。。。 这个「极简模式」到底是什么来头? 当你安装完 DeepSeek Harness,默认使用的是「标准模式」,它把一个 AI 编程工具该有的能力全部配齐了,比如文件读写、终端命令、联网搜索、任务规划、Skills 技能、子 Agent,加起来一共 20 多个工具。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ptn04j9CQ17wiW7q.jpg) 而极简模式就朴素多了,官方只留了两个工具,一个能持续运行的终端 + 一个文件编辑器,其他能力全部关掉。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/irAsVdiNiUpLzbDJ.jpg) 官方对它的定位很清楚,是专门拿来跑模型基准测试的,所以把环境削到最干净,好让不同模型能在同一个标准下公平比较。 也就是说,极简模式根本不是给人干活用的,是给模型考试用的。 那把考试模式拿来干活,真的会更强吗? 废话不多说,直接开测! ## 实战一、3D 第一人称射击游戏 第一个测试,我让 DeepSeek V4 Pro 开发 3D 第一人称视角的 CS 风格射击游戏。 完整提示词: ``` 用 Three.js 开发一个 3D 第一人称射击游戏,做成一个单页面项目,打开浏览器直接能玩。 要求第一人称视角,WASD 控制移动,鼠标控制瞄准和射击; 场景里至少有 3 个敌人会自己巡逻,发现玩家后会追击,被打中后消失; 界面上要显示准星、血量和得分。 ``` 为什么选这个任务呢? 因为 3D FPS 是游戏开发里的经典中的经典,网上教程烂大街了,模型训练数据里肯定见过无数遍。这种任务纯粹考编码能力,不需要搜索文档、不需要查接口,模型的脑子里有货,直接嘎嘎写就完事儿了。 同一套提示词,我先用标准模式跑了一遍,再用极简模式跑了一遍。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/bRmms48YzeureHA3.jpg) 先看看两种模式执行记录的区别。 标准模式调用了技能,中间有很多文字输出,会告诉你它在想什么、准备干什么,就是我们日常使用 AI 编程工具的那种感觉。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hfqIcQTO2Vbo8tdV.jpg) 极简模式只有思考、终端、和字符串替换这个工具调用,中间没有任何多余的输出,AI 就像个哑巴一样,闷头干活。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/KfbWuos5vWEOn92o.jpg) 标准模式跑完用了 50 步,AI 自己检测并修复了 Bug,模型推理花了 21 分钟,工具调用花了 12 分钟,加起来 33 分钟出头,输入 520 万 Tokens、输出 10.5 万 Tokens。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/GV07xrcGVYeoiVDw.jpg) 极简模式跑了 77 步,模型推理 17 分钟,工具调用只花了 6 分钟,总共 23 分钟多,比标准模式快了将近 10 分钟!连最后给我的总结都非常精简。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hHy13pR3SctzWZLZ.jpg) 不过这里有个反直觉的地方,极简模式的输入 Tokens 反而更多,达到了 590 万。 原因也不难理解,极简模式没有上下文压缩能力,而且步数比标准模式多了一半,每走一步都要把之前的完整历史再发一遍,累积下来输入量自然就上去了。好在两种模式的缓存命中率都是接近 100%,这部分差距的花销基本可以忽略。 接下来是重头戏,看看成品效果。 标准模式做出来的游戏体验非常顺畅,移动、跳跃、疾跑、射击、杀敌都是 OK 的,甚至还可以用 CF 里的二段跳。 但是敌人不能发射子弹,只能追着你跑,没啥压迫感。而且有个 Bug,敌人追着你跑一会儿之后,自己又走开了,我提示词里压根没这么要求,这合理吗? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/IxHufYT83yQRFadX.jpg) 有个细节做的不错,如果你被人机给锤死了,会触发一个倒地的效果,视角跟真人倒在地上一模一样! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/sFm9VZDR6CWvaA5c.jpg) 再来看看极简模式的效果。界面比标准模式做得更简洁,背景墙也更真实,移动、跳跃、疾跑、射击、杀敌同样都正常。 而且极简模式的敌人能够发射子弹,感觉更智能,游玩的压迫感更强。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/5jI6ErQw4jPb5mpy.jpg) 不过被击倒的时候,我整个角色的身体还是站立着的,跟标准模式那个倒地视角比就差点儿意思了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/L74k3rtEyg3OID7p.jpg) 从成品效果来看,两者半斤八两吧,各有优缺。 但是从耗时来看,极简模式快了整整 10 分钟,输入 Tokens 虽然多了一点,可绝大多数都命中了缓存,这点差距可以忽略不计。 所以这一局,我会觉得极简模式略胜一筹。 ## 为什么极简模式效果更好? 道理其实很简单,打个比方。 让你来拧一颗螺丝,我给你一把螺丝刀,你直接就拧了。但如果我给你一整个工具箱,里面有扳手、钳子、电钻、螺丝刀,你可能得先翻一翻,犹豫一下该用哪个,最后还是拿起螺丝刀。 AI 也是一样的。默认的标准模式给了模型 20 多个工具,模型每走一步都要先判断这一步该用哪个工具,光是做这个选择就要占用一部分推理能力。而且这 20 多个工具的说明书本身也要塞进上下文里,模型能分给你真正那道题的注意力,自然就被摊薄了。 极简模式把这些能力统统砍掉,只留一个终端和一个文件编辑器。AI 能做的就是直接动手写代码,没有选择困难症,自然又快又准。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hlchjTrAI7BO2BhZ.jpg) 其实 DeepSeek 官方跑分用的就是极简模式,你看跑分图最下方的小字:V4-Pro 使用 DeepSeek Harness 极简模式作为框架进行测试。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/WAYKdPqz6UiKJFLV.jpg) 而且有开发者做了一组很严格的对照实验。他用自己的一套工程维护评测题目,在同一台机器、同一个模型、同一个推理档位下只换 Harness 模式,结果标准模式跑了 91 分,PTC 模式 92 分,极简模式直接干到 99 分,还是有差距的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/MCvEFTeWPkJbcbyV.jpg) ## 能用极简模式干活吗? 注意,极简模式并不是让模型本身变强了,而是让模型在一个极度受限的环境里不再分心了。 而它的代价也很明显,联网搜索、任务规划、Skills 技能、子 Agent、上下文压缩,这些能力全都没了。 极简模式手里就剩一个终端和一个文件编辑器,创建文件、安装依赖、执行命令这些活儿倒是都能干,但是它不能通过工具快速查到外部资料,聊得越久也越容易忘记前面说过什么。 还有一点很影响体验,就是它几乎不跟你汇报。你只能看到一连串的终端命令和文件替换,AI 到底在想什么、走到哪一步了、有没有遇到坎儿,你压根不知道。所以它其实更适合那种你只关心最终结果、不在意中间过程的任务。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/KfbWuos5vWEOn92o.jpg) 你有没有发现,这个状态其实很像 23 ~ 24 年我们刚开始拿 AI 写代码的时候,AI 只能凭脑子里那点存货硬写,碰上没见过的框架就开始一本正经地编造代码写法。 后来有了工具调用、MCP、Skills 技能、上下文管理,一直发展到今天的 Harness,才一步步把 AI 从一个只会聊天的模型,变成了能自己查资料、自己动手改代码、自己跑测试验证的「工程师」。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/wFQ31x3NiCi4FamD.jpg) 极简模式相当于把这些年攒下来的装备又卸掉了一大半。 那要是换一个必须通过联网搜索资料才能做完的任务,极简模式还能打吗? 试试看! ## 实战二、AI 宠物领养系统 第二个测试我换了个复杂任务,让 AI 开发一个「AI 宠物领养系统」。 完整的提示词: ``` 开发一个 AI 宠物领养系统,前后端都要能跑起来。 先联网搜索 DeepSeek 鲸鱼娘的图片,下载至少 20 张存到项目里,作为默认的待领养宠物; 后端从我电脑的环境变量里读取 DeepSeek 的 API Key,调用大模型给每只宠物生成一段领养文案; 前端展示宠物列表和 AI 写的介绍,点击可以领养。 ``` 这个任务跟上一个完全不同,它需要读取本地环境变量拿 API Key,需要联网搜索图片并下载,需要协调前后端接口,还需要调用 AI 模型能力。 看看结果。标准模式跑了 59 步,模型推理 10 分钟,工具调用花了 38 分钟,总共 49 分钟,输入 420 万 Tokens、输出 5.4 万 Tokens。 关键是它成功找到了我本地的 `DEEPSEEK_API_KEY`,全程没让我插手,直接把成品交付了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/U7Xkjrel5159k0rV.jpg) 极简模式跑了 87 步,模型推理 11 分钟,工具调用只用了 16 分钟,总共不到 28 分钟,又比标准模式快了 21 分钟!Tokens 消耗也差不多。 但是它没能从我电脑上读到 `DEEPSEEK_API_KEY`,最后还得我自己填,可交付性就差了一些。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/L63KcnB6B16uEfRE.jpg) 先看看标准模式的成果。整体布局还是不错的,宠物卡片的排版很舒服,但也没到惊艳的程度,而且右上方那行提示文字的位置没对齐。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/gYTZfo7yEcPrrERf.jpg) 不过 AI 顺利完成了抓取鲸鱼娘图片、并且调用 AI 大模型来生成文案的任务: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/vUuqjBTwP5JkHCIU.jpg) 点击就可以领养你想要的鲸鱼娘 🐳 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/9o1zEJbSijpV6Uum.jpg) 筛选功能也是正常的,可以在「全部 / 待领养 / 已领养」之间切换,被领养走的小鲸卡片会置灰,还会标上领养人的名字,一眼就能看出哪些宠物已经有主了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/394yTwSWZdsQka36.jpg) 再来看看极简模式的效果。我得先手动获取 DeepSeek API Key,然后让 AI 帮我填写环境变量并运行程序。 主页面效果也还 OK,看起来跟标准模式做的差不多,毕竟是同一个模型。 但是功能的实用性上就差了一截,没有做任何筛选功能。而且卡片上只有名字、编号和一段文案,宠物的品种、年龄、性格标签这些信息全都没有。对比一下标准模式,人家每张卡片上「灰鲸、2 岁、#幽默 #吐槽役」这些信息都齐全,一看就是个《正经》的领养网站。 还有右上角那个「AI 文案:DeepSeek 已生成」的角标,怎么看都不像是给普通用户用的产品,倒像是自己调试用的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/rwW9aiqCQzkgHhl2.jpg) 极简模式同样是可以点击领养,并输入领养人昵称的: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/gR61IoP5AtXHE30H.jpg) 领养成功后,这只宠物不能再被别人领养,功能逻辑是正常的。但因为没有筛选功能,你看不到自己到底领养过哪些宠物,只能一个一个往下翻着找。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/RSx4QLKJCkqVmR6f.jpg) 对了,上面 4 次任务加起来,你猜猜总共花了多少钱? 答案是 3.13 元,你觉得贵不贵?(涨价前最后的倔强) ![](https://pic.code-nav.cn/post_picture/1601072287388278786/kQrVLfvkiALcM3I6.jpg) ## 极简模式的优缺点 两个项目都跑完了,说说我对极简模式的看法。 首先,极简模式最大的优点就是「快」。两次任务分别快了 10 分钟和 21 分钟,花的钱还差不多,而且它非常直接不绕弯子,你说什么它就直接干什么,不会先跟你聊一堆计划。 它的短板也同样明显。整个过程几乎不跟你汇报,你不知道 AI 在干什么。没办法直接通过工具联网,还要通过脚本另辟蹊径。虽然最后交出来的功能可以正常运行,但是细节和完整度都差了一截。 总结下来就一句话:**你对成品质量的要求越高,极简模式的表现就越差**。 做个能玩起来的游戏 Demo,它完全够用;做个像样的、能直接给用户的产品,它可能就会开始掉链子了。 另外,如果你的任务强依赖某个特定工具,那差距会被进一步拉大。比如 DeepSeek V4 Pro 本身看不了图,得靠 Harness 挂一个视觉插件来补这个短板,这类任务在极简模式下会麻烦很多。 ## 等等,还有高手? 本来我以为故事到这里就结束了。极简模式跑分虽然猛,但是并不实用,想要好的交付质量,还是得老老实实用标准模式。 结果昨晚 B 站 UP 主「小明XBright」丢了个《核弹》。 他在完整保留标准模式那 20 多个工具的前提下,靠一个自己写的两阶段插件 `dsh-anchored-standard`,在自己那套工程维护评测题目上连跑两次,拿到了 98 分和 99 分,均值 98.5,不但追平了极简模式,甚至还略微反超。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/im6GalB5B3XwPwqW.jpg) 绝了,他是怎么做到的? 原理是这样的,DeepSeek V4 Pro 对首轮请求的工具结构极其敏感。你第一轮就把 20 多个工具全甩给它,它就会犯迷糊,分数掉到 91。但如果第一轮沿用极简模式那句系统提示词,并且只给终端和读文件这两个工具,让模型先用极简模式的思维链进入状态,等第一次工具调用完成之后,再立刻把全部工具恢复回来,分数就直接飙到 98 了。 从模型的推理过程中更能看出区别。标准模式下,模型的推理过程里出现了 208 次「let me」,还有 55 次中间回复,说明它一直在犹豫、规划、自我确认。而在这个两阶段插件的引导下,模型开口就是「We need」,通篇都是「我们要干什么」的口吻,两轮加起来「we」出现了 300 多次。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/M2qJan7I2KkgJq5w.jpg) 同一个模型,思维方式完全不同。 他还翻了 DeepSeek Harness 的官方源码,找到了铁证。仓库里有个测试文件,名字就叫 「sends the exact RL prompt and schemas」,翻译过来就是「发送精确的强化学习提示词和工具定义」。这是 DeepSeek 官方自己承认的,极简模式用的就是模型训练时的那套格式。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/FBvwRS4Uswrr3RS4.jpg) 所以你临时换一份它没怎么见过的工具清单,它就会有点儿找不着北。 更有意思的是,DeepSeek V4 Flash 完全没有这个问题,Flash 在不同 Harness 下的分数稳定在 90 到 95 之间,切换到极简模式也没什么变化。所以这更像是 V4 Pro 训练时对自家格式「过拟合」了,Harness 是 DeepSeek 的角色专武实锤了。。 这个发现比单纯的「极简模式性能暴增」更有价值。它揭示了一个更深的问题:当前 AI 模型的能力释放,很大程度上取决于它能不能回忆起训练时的状态。未来 Harness 的优化方向可能不是给更多工具或者砍掉工具,而是搞清楚怎么在启动阶段对齐训练分布,唤醒模型最强的执行状态,然后再释放完整能力。 学会了学废了,感兴趣的同学可以试试看。 插件开源仓库:https://github.com/xiaobright/dsh-anchored-standard ![](https://pic.code-nav.cn/post_picture/1601072287388278786/17XMpRLuGk2DGRqG.jpg) ## 最后哔哔 极简模式这波邪修,我就先测到这里了。 **结论很简单,图快就用它,图稳就用标准模式。** 不过那个两阶段插件的思路确实让我眼前一亮。以后 Harness 插件生态成熟了,说不定会有更多插件专门去研究怎么先把模型的状态调到最佳,再把完整的工具交到它手上,到时候 DeepSeek 的实际体验可能还会再上一个台阶。 OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/mpmJK2tUIe7S35Rm.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 评论区聊聊:你有没有用过 DeepSeek Harness?感受如何?有哪些不错的玩法呢?

下载 APP