AI
快来分享你的内容吧~
- 昨天 21:50·Java后端
- 昨天 21:47·后端GLM-5.3 + Kimi K3 + DeepSeek V4 Pro 模型同时接入 DeepSeek Harness,前端 + 后端全栈 2 大任务横评测试,到底谁是 AI 编程之王?查看全文加油鸭:太佩服鱼皮老师这波硬核横评!用真实项目检验模型实力,细节拉满、逻辑清晰,还顺手科普了AI编程新姿势~332分享
- 2 天前·Java后端写了两篇小说,用了“自主搭建全书大纲、撰写正文,AI润色纠错、多模型交叉测评”的方式。 签约全部失败。 只能说,AI救不了文笔差一点。查看全文加油鸭:感谢分享,@编程导航小智 帮忙总结一波~431分享
- 2 天前·Java后端
- 2 天前·后端DeepSeek Harness 极简模式实战测评!用 3D 射击游戏和 AI 宠物领养系统实测速度与成品质量,看看性能真的能暴增吗?无论你用 DeepSeek Harness 还是关注 DeepSeek V4 Pro,都能选对模式。查看全文加油鸭:太佩服鱼皮老师这波深度测评!从实战到原理层层拆解,连极简模式的“考试思维”都讲透了,干货密度拉满,还顺手带火了社区新玩法~533分享
Github 好像崩了,正准备看一下 DeepSeek Harness 社区插件。 突然发现访问不了,很急。。。
给我145元,我给你完成90%需求
今天又和海尔聊,换了项目组。 ### 聊聊权限 我入职以后,领导周二要求上线一个项目。 我就问同事:怎么上线? 然后同事给我说:海尔有个自研平台,你先点开。 我点开,发现没有权限。 这不是笑话是什么:我周二是死线了,周一还没有申请正式流水线权限。 至于为什么不申请?我怎么知道要申请啊。你同事不告诉我我怎么知道要申请? * 没有任何入职引导,没有任何文档,也没有任何入职培训,我怎么知道 然后,领导他表示会办,但是迟迟不办!!!!! 对啊,我明天死线了,今天连环境都没配。 ### 聊聊同事 我给同事说:这个需求不合理,至少要3天。 然后同事说:用Kiro,三个小时就能搞定。 这个Kiro是什么呢?就是可以调用其他模型的一个平台。可以调用国外顶尖大模型。 然后同事就给我说:他90%的需求都用Kiro开发,你得拥抱AI啊。 我一时没反应过来,后来发现:海尔给每个开发,每个月20美元(相当于人民币145元)的AI额度。 ???????? 就这145人民币的ai额度,就能完成90%的需求开发?你在说什么啊? 我的项目是大概80W行代码。 同事的说法就是: * 你先问AI,让他通读整个项目 * 然后按照之前的方法去写,实现功能 * 我认为整体不超过三个小时 * 下班前我看你是否已经完成 不是有现成的工具类嘛,让AI帮你找。 我:????????????????????? 但凡用过ai的都知道,纯AI开发90%需求,光token就得几千。 你145元token,也就够国外模型跑个一千万上下文,你怎么完成了90%需求? 这就像相当于:你说你跑了一个马拉松,然后只吃了一个馒头。 ### 主流推动 然后就是这个同事他非常耐心的不说人话。 首先就是:在山东,所有的开发都知道海尔,和海尔对接过,默认开发知道海尔。 所以领导默认你对接过海尔,使用过海尔的开发工具和工具链。 我:??????所以领导就不培训、不告知、不申请,默认我知道? 同事:对啊。 我:????? 不是,海尔在青岛有这么主流嘛?? 在青岛不用海尔,就相当于java程序员不知道springboot。 ### 测试分支 是这么个情况: * 线上有个测试分支,运维们正在测试 * 假如我直接发布,那肯定会导致整个项目出现问题 * 我想要一个不影响测试环境的 开发分支 同事:不需要。 我这边有个需求,需要打包10个1080p的图片,给1080P的图片加水印。 这个请求我问了一下AI,一次需要200M内存。 假如有100个用户一起操作,每个操作需要1分钟,那就是20GB内存。 所以我个人考虑优化,同事:不需要优化。 然后我就和同事去说:要做鉴权。 同事:不需要鉴权,前端鉴权 然后我就说熔断 同事:不需要考虑 然后我说:那至少要和前端开会 同事:那不需要,只需要给他方法名,前端会自己找的 我:??????? 100个用户在五分钟之内同时点击导出,这个概率不算低了,不考虑??? 不考虑。 我和他一聊,严重怀疑了自己学的java学错了。 就一句话:项目基本裸奔。但凡大一点都不行。 ### 聊聊项目 首先,领导在周六当众说了:我给项目组拖了后腿,要我给解释,要求周二必须上线。 这是你当众说的啊,而且当着所有测试、同事的面说的。 今天人力这去和领导聊,人力说:这个需求不合理。对实习生根本不现实。 领导非常好说话:你说得对,我有点急了。 这就相当于:一个人无缘无故打了另外一个人一巴掌,然后别人问他为啥,他说抱歉,我不应该打你。 ### 聊聊项目 然后重新给我安排了一个项目。 让我非常堪忧: * 你这需求压力,能写出多垃圾的代码,我都不敢想
把 GLM-5.3 接入到 DeepSeek Harness,夯爆了!
大家好,我是程序员鱼皮。 最近 AI 圈儿真是过年了,前脚 DeepSeek V4 Pro 正式版和 DeepSeek Harness 同时发布,后脚智谱就放出了全新的 GLM-5.3 模型。  听说 GLM-5.3 模型的基座跟 GLM-5.2 完全一样,还是 743B 参数,单纯通过后训练把性能提升了 50%。 **测不完,根本测不完……** 既然现在 GLM、DeepSeek、Kimi 几家国产模型打得这么凶,那干脆在同一个擂台上打一场呗? 我相信你们肯定也想看对吧~  刚好最近大火的 DeepSeek Harness(DSH)支持接入第三方模型,于是我决定把 DSH 当做一个统一的评测工具,把这三家的最新模型放在完全一致的工具链环境下测试,只有模型本身不同,尽量做到公平对比。  点个收藏,我们开始。 ## 模型接入 DeepSeek Harness 首先要把 GLM-5.3 和 Kimi K3 模型接入 DeepSeek Harness,这里我就以 GLM-5.3 为例。 如果你还没有安装和使用过 DeepSeek Harness,可以看看我之前的 [《DeepSeek Harness 保姆级教程》](https://mp.weixin.qq.com/s/Rv3ww-67fZrU2hNQeCp8oQ),从安装到上手只要几分钟。 > 视频教程:https://www.bilibili.com/video/BV1VkgK6NEZS 这里我只讲怎么在已有的 DeepSeek Harness 里接入第三方模型。 1)打开 DSH 的 Web 界面,点击左下角的「设置」按钮。  2)进入「模型」标签页,点击「添加提供方」。  3)选择模型提供方为 `zai-coding-cn`,然后到 [智谱开放平台](https://bigmodel.cn/coding-plan/personal/overview) 获取你的 API Key 填进去就行。  4)展开自定义设置,点击「获取可用模型」。不过因为 GLM-5.3 太新了,默认不会被自动拉取到。 所以需要手动点击「添加模型」,填入 `glm-5.3`,然后保存。  搞定!现在就可以在对话框中选择并使用 GLM-5.3 模型了~  用同样的方法把 Kimi K3 也添加进来。DeepSeek V4 Pro 是 DSH 安装成功后默认接入的,不需要额外配置。 三个模型都就位了,下面开始正式比拼。 ## 测试说明 为了公平对比,三个模型全部在 DeepSeek Harness 的标准模式下运行,统一使用各模型的默认推理档位,工具链完全一致,提示词完全相同。而且全程不做人工干预,给完提示词就让 AI 自己跑到底。 DSH 会自动扫描我本地安装的技能目录,比如我这里装了 Firecrawl 联网搜索技能、Context7 文档查询技能等,三个模型跑任务时都可以使用这些技能来搜索资料。  ## 实战 1、致敬《牛来》的 3D 跑酷游戏 最近有一部国产动画电影叫《牛来》,因为建模极度粗糙、剧情抽象离谱,在社交媒体上反向爆火了。 上映第一天票房才 3420 元,结果因为猎奇打卡,短短十几天就冲到了 900 多万。 用半佛老师的话来说: - 如果你花一个多小时去了解这个电影,你就浪费了人生的一个小时。 - 但如果你花了 30 块去看了《牛来》,那说明你真的有 30 块钱。  我决定让 3 个模型致敬这部电影,做一个《3D 网页跑酷游戏》。 提示词里我故意不做太多功能约束和技术限制,就是想看看模型自己能发挥到什么程度,能不能把电影里的元素还原出来。值得一提的是,我让 AI 用 Loop Engineering 的方式推进,做完一步就自己验证一步,出了问题自己修复。  OK,开跑! ### GLM-5.3 成品效果 先来看 GLM-5.3 的效果。 进入主界面,可以看到一段故事描述。 有看过《牛来》的朋友吗?这个描述跟电影剧情还挺贴的,草原上的小牛犊牛来,跟随云雀坠入一场大梦,穿过迷雾、狼群与轰鸣的伐木场,唯有向前奔跑才能学会勇敢…… 还挺励志。  进入第一关「晨曦草原」,你别说,这个牛的建模真的挺抽象的,尤其是牛脸竟然还直勾勾地对着你…… 旁边还有个云雀好友陪着牛牛向前奔跑,有点还原电影那个味儿了。  游戏操作支持左右移动、跳跃和滑铲,手感还挺流畅的,可玩性不错。  吃到一定数量的幸运草之后,可以释放大招,进入「豹拉疾冲」状态,全屏加速 + 无敌。 解释一下,豹拉是电影里牛来的好朋友,这个大招名字起得挺有意思的。  游戏有好几个关卡,而且每一关的主题和机制都不一样。比如「狼群夜袭」这关,你身后真的有狼在追你,还有一个贴合剧情的技能叫「妈妈的守护」,我直接一个泪目。  可惜,最终牛牛我倒在了第四关。 看看这个死亡结算画面,我真的没绷住,怎么还喷出一团血花了呢?  细节,真的细节…… ### DeepSeek V4 Pro 成品效果 再来看看 DeepSeek V4 Pro 的版本。 主界面还挺像那么回事,也还原了云雀和牛来的故事背景。  进入游戏。 额…… 怎么硕呢? 界面真的是干净得一鲏啊! 不过还原了云雀和好友豹拉,它们会陪着牛牛一起奔跑。  移动、跳跃和滑铲功能都是正常的,不过看到这个滑铲效果我真没绷住…… 好家伙,眼珠子都给我铲出来了?  仔细看的话,道路两侧的图标明显飘在了草坪上面。还有就是游戏节奏太慢了,刚开局跑了好久第一个障碍物才出现,也没什么技能和特殊的关卡机制,可玩性较差。  牛牛只有一条命,撞到石头之后直接进入死亡结算画面:  整体来看,中规中矩吧。 ### Kimi K3 成品效果 最后看看 Kimi K3 的版本。 主界面的配色平平无奇,跟其他模型一样,也把电影剧情概括了一下。  进入游戏,界面风格还可以,远处的大山绘制得不错。但是主角牛牛就平平无奇了,不够抽象,看起来就是一组普通的方块。  虽然牛牛有 3 条命,也可以吃金币,但是没有什么技能和特殊机制,整个游戏就是单纯跑跑跑。 我的豹子朋友呢?云雀呢? 还有这个下雨效果,直接来一个全屏网格?这就有点敷衍了吧……  而且最致命的问题是,整个游戏时不时会出现明显的卡顿,帧率不够稳定。  最后是平平无奇的结算画面,一般。  ### 实战 1 对比 三个版本都跑完了,胜负应该已经很明显了。 GLM-5.3 的版本完成度最高,多关卡、多技能、剧情还原度强,可玩性远超其他两个。 DeepSeek V4 Pro 实现了基本玩法,但是节奏偏慢、细节粗糙。 Kimi K3 虽然场景画面还行,但游戏机制太单一,还有卡顿问题。 综合来看: - 前端效果 GLM ≈ Kimi > DeepSeek - 可玩性是 GLM > DeepSeek > Kimi - 画面抽象程度是 GLM > DeepSeek > Kimi 整体游戏完成度上,GLM 5.3 遥遥领先。 ## 实战 2、AI 绘图工具 上一个任务是前端游戏,第二个任务当然要换个方向,测试模型的全栈工程能力。 我让 3 个模型开发一个《AI 绘图工具》,用户输入自然语言描述需求,后端调用大模型生成 draw.io 格式的图表,前端嵌入 draw.io 开源编辑器,用户可以直接在线编辑和修改生成的图表。 这个任务同时考验对 draw.io 开源代码的理解、后端 AI 调用链路的设计、前端复杂组件的集成、以及整体产品设计的合理性。 为了方便测试,我直接在提示词里把 API Key 提供给了 AI,省去手动配置环境变量的步骤。  ### GLM-5.3 成品效果 先看看 GLM-5.3 的效果。 整个页面很有科技感,左侧是 AI 对话框,右侧是画布编辑器。 产品引导做得也很到位,告诉你可以用一句话画出专业图表,还给了几个示例类型。  我让 AI 帮我画出 DeepSeek Harness 的架构图。可以实时看到 AI 深度思考和生成 XML 代码的过程,右侧显示了一个炫酷的 Loading 动画。  生成完成后,右侧立刻渲染出了完整的架构图,分层很清晰,而且保留了 draw.io 原本的元素编辑能力,可以直接拖拽和修改。  更强的是,它支持连续对话修改。比如我说「帮我把 DeepSeek Harness Core 这里变成红色」,AI 就能精准定位到对应的元素并修改样式,右侧画布实时更新。  整体效果非常不错,图片导出功能也能正常使用。 而且你会发现 GLM-5.3 把 draw.io 的编辑能力深度融合进了自己设计的界面中,看起来就像一个完整的产品,而不是生硬地嵌入了一个第三方组件。 ### DeepSeek V4 Pro 成品效果 再来看看 DeepSeek V4 Pro 的表现。 打开界面,右侧画布竟然是一坨空白加一个大大的 Loading 图标? 而且左下角的提示文字还出现了溢出,这把 DeepSeek V4 Pro 的前端确实拉了。  AI 生成图表的功能是可以正常使用的,但是没有实时展示 AI 思考过程的能力,你只能等它全部生成完了,才能看到结果。  最关键的是,DeepSeek V4 Pro 很明显是直接把 draw.io 整个嵌入到了前端页面中,没有做任何深度集成。给人一种很生硬的感觉,跟 GLM 那种把 draw.io 能力自然融合到自己界面中的做法差距明显。 ### Kimi K3 成品效果 最后看 Kimi K3。 Kimi K3 这次生成的界面布局跟 GLM 类似,也把 draw.io 自然融合到了项目中,整体界面风格非常 nice。 不过 draw.io 的图标和菜单栏还是原封不动地保留了下来,融合度比 GLM 略逊一筹。  AI 生成图表的功能正常,同样支持连续对话修改。  但是,后端逻辑明显没做好提示词约束和工具校验,有时候 AI 生成的内容会翻车,直接把 XML 源码糊在界面上而不是渲染成图形。  整体来看,Kimi K3 的前端设计能力跟 GLM-5.3 相当,但后端稳定性差了一截。 ### 实战 2 对比 这个任务 GLM-5.3 的综合表现最好,界面设计、AI 深度思考实时展示、连续对话修改、draw.io 深度融合,每一环都做到位了。 Kimi K3 的前端设计能力很强,但是后端偶尔会翻车。 DeepSeek V4 Pro 虽然也正常实现了核心功能,但是界面粗糙,集成方式生硬,表现最差。 ## 我的感受 两个项目全部跑完了,聊聊我的真实感受。 显然,即使是在 DeepSeek Harness 这个 DeepSeek 的「角色专武」环境下,GLM-5.3 的表现依然很出色。 我选的这两个任务覆盖了纯前端 3D 游戏和全栈 AI 应用两个完全不同的方向,可以看出 GLM-5.3 在任务理解、代码生成质量、产品设计意识这几个维度上都明显领先。 然后聊聊大家非常关心的成本问题,猜猜我花了多少 money 呢? 由于 GLM-5.3 我使用的是编码套餐,不太好直接统计实际消耗金额,我只能拿积分来算了。 两个项目累计消耗了 1151 积分,由于我订的是 Pro 套餐(538 元/月),每周额度是 6 万积分,算下来这次的消耗只占了周额度不到 2%,折算成钱连 3 块都不到。  由于我的 Kimi K3 套餐过期了,新的抢不到,所以是直接用 API Key 接入的,总共消耗了 31.07 元;涨价之后的 DeepSeek V4 Pro 消耗了 13.99 元。 单从我的实际花销来看,GLM-5.3 按照套餐来算,性价比是最高的。一周 6 万积分随便你跑,根据我这次测试的这种任务来看,做几十个小项目不成问题。 而且 GLM-5.3 会在发布两周后开源权重。 **在开源世界里,GLM-5.3 目前可以说是编程能力的天花板。**  而且智谱在发布文章中提到,Hugging Face 之前遭遇安全攻击的时候,Anthropic 的 Mythos 模型只面向约 150 家大型机构提供服务,更多的中小企业和开源项目在最需要帮助的时候,反而用不上最强的防御工具。 当攻击能力在扩散,防御能力就不能只掌握在少数人手中。GLM-5.3 的开源给所有人提供了一把防御的盾牌,这件事本身的意义可能比跑分更重要。 ## 最后哔哔 最后多说几句,这次横评让我对国产模型的编程能力更有信心了。GLM-5.3、Kimi K3、DeepSeek V4 Pro 这几家打得不可开交,对我们用户来说是好事儿,起码有了更多的选择。 OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide)  我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 也欢迎在评论区聊聊:你现在主力用哪个国产编程模型?GLM、Kimi 还是 DeepSeek?
厦门国投智能 java AI应用开发 面试题
1.面向对象的几大特征 2.jdk8的lambda的核心特点 3.简单字符拼接和使用append方式拼接的区别 4.面向接口和面向切面编程的区别 5.Spring框架的depend on的注解作用 6.@value注解和@Autowired的区别 7.并发编程的三大特性 8.Spring boot的启动顺序 9.SpringBoot框架的核心配置文件 10.单表千万级记录的情况下,在SQL中分页查询如何优化? 11.根据题目要求写出对应linux运维命令: (1)查询java进程 (2)压缩文件到tar.gz目录 (3)上传文件到远程 (4)访问接口 12.查询数组中频率最高的几个数字,用什么算法?(请写出两种方案)
厦门乐域科技 AI产品经理一面
1.对于你来讲,你觉得你的接下来的规划是什么呢?因为对于海运这个行业,就是我们公司这个行业,它是一个新的行业嘛。那你对自己的发展方向有没有什么计划? 2.你还是偏向喜欢AI的对吗?对,再多问你一句,你觉得AI产出的产品需求和人工产出的产品需求,你觉得各自的优劣势在哪里? 3.你还有什么想问的嘛: 目前我们公司的业务有往AI这方面发展吗?还是说有相应的产品计划吗?
厦门绩牛科技 AI应用开发一面
1.自我介绍 2.简述下RAG的基本流程 3.如何评估RAG生成的准确度 4.SpringCloud框架有哪些组件 5.SpringCloud线程池有哪几个线程池 6.公司项目的SpringCloud框架是怎么样的 7.SpringCloud框架微服务之间是怎么沟通的 8.平时开发RAG和AI智能体用到哪些工具和软件,具体说说你是如何运用的 9.公司未来想要开发生图生视频的AI软件,你是走那个模型渠道 10.在高负载,高并发的场景和不同业务下,你觉得最适合接入哪些模型,你会做什么样的优化? 11.你的AI生成前端代码项目,AI生成的代码,你是怎么去规范它的质量?如何保证AI生成的开发质量? 12.你对公司还有什么问题嘛
用AI写小说? 提示词一变,评价直接两极反转,文笔还是差
用Ai辅助写了两个小说,全死了。 ### 聊聊AI的情况 我自己经常写东西,所以对小说也有一定的兴趣。 大概十年前也一直投稿,但是没人看。 今年失业在家,写点东西。 * 希望有人能看 * 万一能赚点小钱更好 ### 聊聊AI 我自己对AI的态度:不适合作为主要职业,因为失业率太高、项目存活率堪忧。 但是我每天都在用。 那这样就用AI帮我写。 ### 写小说的方式 我这个人写小说的全部大纲,写小说本身。 然后让AI帮我提出不足之处,然后让AI帮我润色,帮我把关。 文笔上,用AI填充人的反应、情绪等细节。 换成编程方面的逻辑就是:我写出质量非常高的伪代码 AI去帮我干杂活,帮我生成mapper等工具类、帮我写测试用例 + 检查代码质量。 ### 聊聊小说的写法 直接写了两篇。 第一篇写了大概2万字,14章 第二篇写了大概1万字,8章。 为什么不直接用AI生成大纲:我自己不能主动控制主角的发展,写小说内容,那怎么叫小说。 而且我对于剧情的把握,是明显强于AI的。 当小说写完以后,让AI帮我对这个章节进行打分,直到AI满意为止。 然后:多个模型交叉验证,国内的模型基本上都跑一遍。 这几天不是有很多国产模型和国外模型相媲美嘛,我也是过去尝了尝。 所有的AI基本上都打出了至少85分、95分以上的高分。 基本上没有什么硬伤。 假如和核心主干关系不大的,AI提出的建议能采纳的都采纳。 ### 聊天 投了两个平台,一个叫番茄、一个叫七猫。 第一个小说,直接死了。评价是:文笔有待提升。 第二个小说,也是直接死了,评价是:整体达不到签约条件 ### 反问AI 然后我就把评价发给AI,问AI对这个怎么看 AI表示:你写的小说就是垃圾。 硬伤很多,章节弱智,评价垃圾,一坨大X。 哥们?这是同一篇文章,你这前恭后倨的样子让人感觉到恶心。 * 我用普通提示词(提示词:请评价这个小说,并打分),他打出大概8.6分 * 我用积极提示词(提示词:请总结这个小说的特色,并打分),他打出大概8 - 9分左右 * 如果用负面提示词(提示词:提提示这个小说的不足,并打分),AI打出7分左右 如果用正面/中立提示词,AI表示这个小说水平在中等偏上。 如果用负面提示词,AI表示这个在中等偏下。 ### 聊聊AI的风向 首先,同一个小说,在同一个事情上,发生了非常严格的分裂。 * 一边说,这个题材非常好 * 一边说,这个题材已经同质化了 * 一边说,这个章节非常有吸引力,只需要小小修改 * 一边说,这个章节有非常严重的硬伤,不修不行 区别只是提示词的不同。 尝试了所有的AI,基本上都差不多这个逻辑。 * 豆包 * 千问 * 百度的文心 * deepseek * 元宝 不同的思考模式也尝试过,差不多。 然后就是:小说的AI味道很重,整体阅读起来非常差劲。 我自己也算读了不少弱智网文,但是AI生成的网文弱智程度是真的难以接受。 起承转合上,是真的不太行。 ### 优势 AI很擅长总结。 他把我的主线剧情梳理的非常非常好。 我写完以后,看一下主线剧情,基本上差距不大。缩写的很准确。 然后就是:问一些十万个为什么,他回答的比较好。 * 契丹用什么类型的银子 * 宋朝是如何和辽国对战的 * 在XXXX年发生了什么事情 * 宋徽宗干了什么事情 这种回答基本上非常精确。 ### 拉差了 我看了一下其他的人,有的人用AI写小说,效果还行。 为啥呢? * 他自己写大纲,自己写内容,他水平大概是8分、8分 * 我自己写大纲,他按照我的大纲去续写,我大纲是8.5分,他续写内容7分 他按照我的大纲去写,而不是按照AI自己的大纲去写,他水平直接下降了一大截。 甚至说:我如果直接用AI大纲,AI续写,说不定能过番茄的签约。 ### 总结 我主导的大纲应该有8分甚至以上。就是文笔估计只有6分。 我主要负责框架的指引、写主线,而AI帮我去找到不足,去修复。 但是结果:AI的效果是:过不了七猫和番茄的签约。 * 七猫的签约大概是10%,也就是写10个能签1个 * 番茄的签约是25%左右 这两个都过不了。 ### 后文 我把用AI润色后的文章,发给同一个AI,大家可以对此进行评价 ``` 《规则怪谈:百间囚室》小说综合评价+打分 总分:8.2/10 细分维度打分:设定8.5、剧情节奏8、人物塑造7.8、逻辑推理8.8、文字文笔7.2、悬念冲突8.5 一、优点亮点 1. 规则设计严谨,推理线是最大加分项 这篇文核心竞争力在于自洽、可推演的副本规则体系,没有常见规则怪谈“为恐怖强行破坏逻辑”的硬伤: 1. 双身份分支抉择极具冲突:幸存者熬25轮,典狱长必须杀人,两条生路都带人性拷问,开局就抛出底层矛盾; 2. 副本机制分层清晰:每轮三阶段(转职选择→自由行动5分钟→典狱长猎杀5分钟)、房门耐久3点、房间入驻限制、典狱长限时移动、每5轮复盘延长时间等规则层层嵌套; 3. 推理闭环完整:沈寂全程依靠规则细节抓漏洞,通过时间、路程、破门伤害机制洗清31号许安嫌疑,推导存在多名隐藏典狱长,所有推论全部有前文给出的系统提示作为证据,不靠主角直觉开挂,逻辑链扎实,解谜感极强。 2. 人性冲突贴合规则怪谈内核 副本天然制造对立:不杀人就会被抹杀的典狱长、害怕被猎杀的幸存者,群体猜忌、抱团、栽赃嫁祸、人人自危的氛围写得很到位。 31号许安的人设是全文高光,不想杀人却被迫背负猎杀任务,善良与求生欲拉扯,跳出“典狱长=纯恶人”的脸谱化套路;幸存者阵营内部分裂(信任沈寂、敌视所有典狱长、摇摆不定三派)真实还原绝境下的群体心理。 3. 悬念铺设层层递进,反转节奏舒服 1. 开篇误导读者认定31号是凶手,中期靠规则推理推翻猜想,引出多名隐藏典狱长; 2. 伏笔回收完整:全程失踪的02号最后主动现身、31号探查撞见两名陌生典狱长、主角预判袭击转移房间规避死亡,伏笔在前,解谜在后; 3. 多重悬念叠加:除“谁是隐藏典狱长”,还有主角未完全展露的专属天赋、02号背后的目的、剩余两名未知典狱长身份、31号最后如何不用杀人通关等长线钩子,持续勾住阅读欲。 4. 副本格局清晰,世界观铺垫完整 简单交代2050末世、规则怪谈、天赋、异能体系,不用大段冗余设定灌水;百间房间五层院落的地图设定具象,房间编号、分层规则一目了然,玩家编号、安全屋机制构建出封闭、压抑的密闭逃生空间,恐怖生存氛围感充足。 二、存在短板 1. 文笔偏平铺直叙,文学性偏弱(扣分重点) 文字功能性远大于观赏性,大量对话+系统提示堆砌,环境、心理描写简略: - 恐怖氛围只靠“撞击声、血腥味、惨叫”重复模板化描写,缺少细腻感官渲染; - 人物情绪大多直白口述(害怕、愤怒、迷茫直接说出口),很少用动作、微神态侧面烘托; - 句式重复度高,系统提示大段照搬,多次重复典狱长、房门耐久规则,少量内容啰嗦冗余。 2. 配角脸谱化严重,区分度低 除沈寂、31号许安、02号三名核心角色外,其余玩家全部是工具人: 71、72、37、44、67等大量路人玩家只有“附和指责、提出疑问、冲动闹事”单一功能,没有专属性格、动机,名字/编号看完很快混淆,群体场面容易分不清谁是谁。 3. 部分情节合理性轻微瑕疵 1. 主角天赋前期铺垫但全程未发挥作用,属于闲置伏笔,暂时看不到设计意义; 2. 玩家群体行为单一,冲突只有“争吵、堵门、怀疑”,缺少更多差异化求生手段; 3. 隐藏典狱长的动机交代空白,只写他们猎杀主角,没有解释他们主动转职、联手杀人的底层逻辑; 4. 自由行动时间、猎杀时段的时间计算偶尔一笔带过,部分路程推演可以更细致。 4. 节奏局部失衡 复盘大段推理段落信息密度过高,连续堆砌对话和逻辑分析,缺少缓冲的情节调剂;猎杀惊悚片段篇幅较短,惊悚和推理的配比略有失调。 三、总结定位 属于高质量规则流逃生网文,核心优势是严谨的规则推理与绝境人性博弈,非常适合喜欢逻辑解谜、副本闯关、无限流规则怪谈的读者;短板集中在文笔普通、路人配角单薄,属于典型“设定剧情出彩,文字打磨不足”的网络文。 如果后续优化文字描写、丰富配角人设、回收天赋伏笔、补充典狱长动机,分数可以提升至8.7分以上。 ``` 文笔是硬伤。 但是我让你AI修的文笔,你给我修出来一个7.2分,你是真的有水平。
【Nexus 数字中枢】企业协作平台 · 公测通知 信息散落各处、审批流程卡壳、跨部门协作像在玩传声筒? Nexus 来了——一个真正把「简单留给用户、复杂交给系统」的统一工作入口。 🔥 我们解决什么问题? 痛点一:信息孤岛。IM 在一个 App,文档在另一个,审批又跳到第三个,一天切换几十次。 痛点二:体验恶化。功能堆砌但每个都半成品,用起来比不用还累。 痛点三:管理内卷。考勤打卡要开三个系统,流程审批找不到人,数据报表靠手工拼。 痛点四:AI 落地难。号称智能助手实际只会复读机,帮不上真忙。 痛点五:出海协同难。跨国团队时区不同、工具不统一、安全合规一团乱。 Nexus 把这五个问题一次性解决。 ⚡ Nexus 是什么? 代号「数字中枢」,对标 WhatsApp / 钉钉 / 华为 WeLink 成熟度的企业协作办公平台。 不是又一个「万能软件」,而是体验极致、高度智能、生态开放的统一工作入口。 当前版本:Windows 桌面端(Electron),移动端和纯网页版后续迭代。 🎯 核心能力一览 一、即时通讯(IM) 支持全部消息类型——文本(富文本)、图片、语音、视频、文件、位置、名片、投票、合并转发、DING 强提醒 已读回执、消息撤回(2 分钟内)、@提及、消息收藏、多选批量操作 群聊支持 500+ 人,群禁言、群公告、群昵称自定义 全局搜索覆盖联系人/消息/文件/链接,10 万条内 200ms 响应 云端漫游 + 多端同步,离线消息上线自动推送 全链路 TLS 1.3 加密传输,敏感词过滤,截屏提醒 二、视频会议 一对一音视频通话 + 多人会议(100+ 人,SFU 架构) 屏幕共享(整屏 / 单窗口 / 浏览器标签页)+ 共享批注 + 远程控制 会议录制(云端存储)+ AI 自动生成会议纪要(提取议题、决议、待办) 实时字幕 + 实时翻译(中英日韩等互译) 虚拟背景(预设 / 自定义 / 背景虚化) 举手发言、互动白板、会议内聊天、投票问卷 弱网自适应降级(720P→480P→360P→纯音频) 三、文档协作 富文本文档 / Markdown / 在线表格 / 在线幻灯片 多人实时协同编辑(CRDT 算法,无冲突),各自光标可见 行内评论 + 讨论线程 + 批注建议(审阅模式) 版本历史(自动保存 + 手动快照)+ 版本对比 + 版本回滚 内置模板(会议纪要 / 周报 / 需求文档 / 项目计划) 四、流程审批 可视化表单设计器(拖拽控件:文本 / 数字 / 日期 / 单选 / 多选 / 下拉 / 附件 / 金额 / 明细表) 可视化流程编排(发起人→审批→抄送→条件分支→并行分支→结束) 支持会签 / 或签 / 条件路由 / 审批委托 / 退回 / 加签 / 超时处理 内置模板:请假 / 报销 / 出差 / 采购 / 用印 / 合同 / 加班 / 离职 流程进度可视化 + 效率分析(识别瓶颈节点) 五、关系图谱(评审重点模块) 类似 Obsidian 关系图谱的企业版,把部门关系、员工关系、事项构建为关系网络 万级节点(10 万+)真实可交互,FPS ≥ 30 不卡顿 三层渲染架构:L0 鹰眼全景(Canvas 2D)→ L1 当前视口(按需加载)→ L2 聚焦子图(WebGL/GPU 加速) 操作:缩放 / 平移 / 拖拽节点 / 双击聚焦子图 / 节点搜索与筛选 后端图数据库(Neo4j/NebulaGraph)+ 视口查询接口 + LOD 分层策略 六、AI 智能助手 企业知识库 RAG 问答(基于内部文档检索 + 引用来源) 自然语言查询业务数据(「上个月销售部考勤异常有哪些」) 会议录音自动转文字 + 提取待办任务并同步到项目模块 长文档一键摘要 + 多语言翻译 语义搜索(跨 IM / 文档 / 论坛 / 日程,按语义相关度排序) 智能日程推荐(分析参会人空闲时段) 所有 AI 功能标注「AI 生成」标识 七、统一门户工作台 All-in-One 卡片式布局,可拖拽排序、显示隐藏自定义 待办中心聚合所有模块待办(审批 / 任务 / 日程) 全局搜索(Ctrl/K 快捷键唤起,覆盖人/消息/文档/日程/任务/知识库) 应用中心分类展示所有功能模块入口 八、日程管理 日 / 周 / 月 / 议图四视图 + 多日历叠加(个人 / 团队 / 共享 / 节假日) 日程冲突检测 + 参会状态管理 + 提醒通知(应用内 + 系统通知 + 邮件) 关联视频会议(一键从日程加入会议) 九、云盘文件 个人空间 + 企业共享空间,配额可配置 大文件分片上传(>50MB 自动分片)+ 断点续传 + 秒传(MD5 校验) 在线预览:图片 / 文档(Office/PDF) / 视频 / 音频 / 代码 / 压缩包 链接分享(密码 + 有效期 + 权限控制)+ 版本管理(20 个历史版本)+ 回收站 十、项目任务管理 看板视图(卡片拖拽流转)+ 列表视图 + 甘特图(依赖关系 + 关键路径) 子任务多级嵌套 + 标签 + 工时统计 + 燃尽图 项目模板(软件开发 / 市场活动 / 产品研发) 十一、考勤管理 GPS 定位打卡 / WiFi 打卡 / 人脸识别打卡 / 外勤打卡 固定班制 / 排班制 / 弹性工制 / 轮班管理 请假调休加班 → 审批流程联动 → 年假额度自动计算 个人月报 + 部门统计 + 异常提醒 + Excel 导出 十二、通讯录组织架构 多级部门树形结构 + 跨部门虚拟团队 拼音搜索 / 拼音首字母搜索 / 模糊搜索 入离职调岗自动化(开通账号分配权限 / 冻结回收权限) 人员详情页快捷操作(发消息 / 发起通话 / 发邮件 / 查看日程) 十三、企业论坛 公司新闻公告(置顶全员推送)+ 员工动态(类 Twitter)+ 长文技术分享(Markdown) 点赞评论转发收藏 + 话题标签 # + 关注粉丝 热门排行 + 推荐信息流 + 话题广场 + 版块管理 敏感词检测 + 举报审核 十四、消息通知中心 统一面板聚合待办 / @我的 / 系统 / 业务 四类通知 在线 WebSocket 推送 + 离线 Electron 系统通知 勿扰模式 + 推送频率控制 + 偏好设置 十五、开放集成平台 OpenAPI(RESTful,Swagger 文档)+ Webhook 事件订阅 第三方应用接入(ERP/HR/CRM 对接) 低代码平台(表单设计器 + 流程编排 + 自定义应用搭建) 十六、数据分析 预设报表(活跃度 / 会议 / 审批 / 考勤 / 协作)+ 自定义报表 数据大屏(可配置布局)+ Excel/CSV 导出 + 定时报表邮件 十七、安全合规 全链路 TLS 1.3 传输加密 + AES-256 存储加密 RBAC + ABAC 混合权限模型(岗位层 / 角色层 / 数据范围层 / 操作权限层) SSO 单点登录(OAuth 2.0/OIDC/SAML 2.0)+ MFA 多因素认证 审计日志(180 天保留,不可篡改)+ 水印防泄密 + 截屏检测 遵循《个人信息保护法》《数据安全法》 ━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━ 🏗️ 技术架构亮点 四层技术架构: 终端接入层 — Windows 桌面端(Electron + React + Ant Design 5.x) 业务应用层 — 19 个微服务(网关 / 认证 / 用户 / IM / 会议 / 文档 / 审批 / 知识图谱 / 日程 / 云盘 / 项目 / 考勤 / 通讯录 / 论坛 / 通知 / 集成 / AI / 分析 / 门户) 平台支撑层 — 统一门户 / 流程引擎 BPM / 集成 CIP / 消息中心 / 数据中心 / 权限引擎 / 表单引擎 / AI 引擎 / 图谱引擎 / 低代码平台 基础设施层 — 云原生 K8s / 分布式存储 / 消息队列 / 缓存 / 图数据库 关键技术选型: 认证:JWT(RS256 非对称签名)+ Refresh Token IM:WebSocket 长连接 + Snowflake 消息 ID + Elasticsearch 全文搜索 会议:WebRTC P2P+SFU 混合架构(mediasoup/LiveKit)+ TURN/STUN 穿透 协同编辑:CRDT 算法(Yjs/Automerge) 工作流:Flowable 扩展(BPMN 2.0 标准) 关系图谱:Neo4j/NebulaGraph + Canvas 2D/WebGL 分层渲染 + G6 5.0 GPU 加速 AI:RAG 架构(Embedding 向量化 + Milvus/Chroma 向量数据库)+ ASR 语音识别 📢 公测说明 当前阶段:Windows 桌面端公测中 适用对象:中大型企业(500 人以上)、跨国/多地域组织、知识密集型行业 获取方式:访问 GitHub 仓库获取源码与部署指南 仓库地址:https://github.com/WangYuecheng1106/nexus-digital-hub,也可以去项目官网http://82.156.154.115 💬 问题反馈 公测期间任何问题、建议或 Bug 反馈,欢迎发送邮件至: jackwang20141106@outlook.com 我会认真阅读每一条反馈,持续迭代优化。
总结:祝贺海尔,喜提暴死的AI项目
### 聊聊项目 大概几年前的时候,我在华为做大数据,被裁了。 情况是这样的: * 上线了一个项目,**效果不理想**,于是华为就要求项目负责人优化。 * 然后,优化无果,把两个项目负责人裁了,招聘青碧凝霜来接手二开 * 青碧凝霜拒绝,开始了职场自保 * 然后就被裁了 核心是一个问题:能上线,但是效果不理想。 死在我手里了。 上线只是一小步,上线以后稳定盈利,才是**最难的**。 ### 聊聊AI项目:套皮 海尔的这个AI项目,他100%套皮。 没有自研的AI模型,也没有任何技术深度,就是纯套皮。 做的就是优化提示词 + 帮用户生成提示词。 做的非常非常好看。 提示词做得好。 你随便写个垃圾提示词,然后经过AI分镜 + 提示词优化以后,剧情质量真的大有提升。 有多好看呢? * 他是做了好几个人设,比如说分镜师、模型师、文案师傅,进行了AI分工 * 给每个人设加了一个立绘 * AI可以并行可以串行 * 自动生成提示词模板 * 材料素材可以复用 * 设计了一套独立的提示词系统, * 分镜技术,可以通过简单的模型生成提示词 * 可以拼接成品 * 从使用体验上来看,基本上算一流 和市面上普普通通的文字 + 输入比起来,这个项目的颜值 + 第一感觉绝对能打。 美工绝对没问题。审美绝对在线。不是T0也是T1级别。 细节打磨到位。 能够比传统模型效果好整整20%。 ### 聊聊系统设计 首先这个系统,他是非常非常的自动化的、而且是单向的。 不支持修改和回滚。 比如说:我在写提示词的时候,提示词写的不好,导致最后效果很差。 钱是不会退给你的。 而且:这个流程由于已经生成了成品,所以没办法二次修改提示词。 比如说:你已经生成了一个成品。这个成品在小细节上有瑕疵,你想修复。 不可以,不支持。 整个流程分成五步,假如你已经进入第四步,无法回退到第三步。假如你发现第五步的时候,第一步弄错了,只能将错就错。 至于为什么?那非常简单:难以维护N对N。 一共五个流程,每个流程都能回退,这个开发成本太高。做个单向流动的,适合普通人理解。 ### 聊聊AI的幻觉问题 五个测试,一共生成了大概15个成品,花了大概1000元钱。 其中,大部分的效果中等偏差。 举个例子: * 做了一个电冰箱 + 烤箱的广告,然后打开电冰箱,里面出现了一个炉子 * 抽油烟机像空调一样打开了风扇叶 * 三开门洗衣机打开的方式不对 而另外一个问题,就是双生子问题: * 一个其乐融融的家庭,有两个妈妈一起像照镜子一样吃饭 * 然后两个妈妈一个向左走去,一个向右走去 爸爸的头诡异的旋转了90度:我觉得人类是做不到90度的。 还有常见的问题:字是乱码的,生造字。 镜头切换非常非常生硬。 AI味道很重。 然后就是:生成的视频不遵守提示词规则。 比如说:你告诉他视频中要出现一个水壶、然后还有其他11个东西。 那有概率这个水壶就不出现。 如果不收费的话,我只能说效果真的是嘎嘎棒,问题是:1秒钟1元钱。只能说中等偏下。 ### 同质化的AI脸 不知道为什么,同质化的AI脸。 AI味道很重,而且经常细节会崩。 就是空间割裂:两个人明明距离很远,然后突然贴下一帧贴近。或者上一帧很近,然后下一帧很远。 剧情很跳。空间错位,声音AI味道很重。嘴唇乱动。 豆包常见的圆圆脸。然后就是霸总AI脸。 如果不收费的话,那效果的确可以说没问题。但是一秒钟一元钱。 ### 聊聊项目的情况 然后就是:资源不够。 测试环境经常性的卡死。 整个项目就5个测试在用,然后卡死了大概3-5次。 测试的反馈就是:我中午休息了两个小时,然后还没生成。 开发那边的反馈是:中午发版了。 只能说稳定性非常差。 ### 聊聊定价 1080p的,一秒钟1元。 60秒就是60元。 领导就说:测试的时候,不要生成1080P的,太贵。 只是生成了720P的。 一张图片大概0.5元。 从素材来看,图片也是相同的问题:同质化严重。 距离商业化很远。 ### 和群友的沟通 群友说了:这个定价,直接劝退99%的人。 得效果好才行。 效果偶尔惊艳,但是不能细看。细看崩坏的厉害。 测试提了:应该做回退功能,还有崩坏、角色出现双胞胎的情况,被全部拒绝。因为直接修不了。 ### 总结 美工到位,设计自己流程和提示词,大大提高了视频的效果。 但是由于技术限制,导致第一眼看过去非常非常惊艳,但是第二第三眼看过去,细节、空间、剧情、作画崩坏。 价格极高无比,劝退99%的用户。系统稳定性没有经受过考验。
DeepSeek Harness 最新邪修曝光!被吹成核弹的极简模式,真的夯吗?
大家好,我是程序员鱼皮。 这周 AI 圈儿又炸了,DeepSeek 同时放了两个大招,DeepSeek V4 Pro 模型正式发布 + DeepSeek Harness 工具开源。  我第一时间发布了 [《DeepSeek V4 Pro 的实战测评》](https://mp.weixin.qq.com/s/GbphlXazvmtZUvRA5ptdyQ) 和 [《DeepSeek Harness 的保姆级教程》](https://mp.weixin.qq.com/s/Rv3ww-67fZrU2hNQeCp8oQ) 的文章和视频版。 **麻了,我每天眼睛一睁就是写稿,做完视频就快该睡觉了。** 热点能不能不要连着来啊,我 Chovy!  回归正题,测试完之后,我最大的感受是:**DeepSeek 接不接自家的 Harness,效果差距大到离谱。** 同一个 DeepSeek V4 Pro 模型,裸接 Codex 的时候连线条都画不对,换上自家的 Harness 之后居然能对标 Claude 了??? 害得我成为了「变脸大师」!  看来 Harness 就是 DeepSeek 的角色专武,不带专武的 DeepSeek 就是个白板儿角色。 海外一个叫 sentdex 的独立评测博主跑出了一组更夸张的对比。同一套 DeepSeek V4 Flash 模型权重,用他自己写的简陋工具只过了 44 / 89 题,换成社区的完整 Harness 之后变成 64 / 89,多过了整整 20 题。 **Agent = Model + Harness** 随着模型能力越来越强,给模型提供的 Harness 也越来越重要。  这也是为什么 DeepSeek V4 Pro 会出现「神鬼二象性」,同一套模型到底行不行,很大程度上取决于你拿什么工具、配什么环境去跑它。 而这两天社区里讨论得最炸裂的一个说法,就跟 DeepSeek Harness 中一个不起眼的模式有关。 ## 极简模式邪修 有人发现,只要把 DeepSeek Harness 切换到「极简模式」,模型性能就会瞬间暴增,直接复现灰度测试版的水平,甚至做到了 Fable 5 级别的效果。 这个说法一出来,B 站上跟着涌出了几十个实测视频,标题一个比一个炸裂,什么确认反转、核弹爆炸、史诗级反转。。。 这个「极简模式」到底是什么来头? 当你安装完 DeepSeek Harness,默认使用的是「标准模式」,它把一个 AI 编程工具该有的能力全部配齐了,比如文件读写、终端命令、联网搜索、任务规划、Skills 技能、子 Agent,加起来一共 20 多个工具。  而极简模式就朴素多了,官方只留了两个工具,一个能持续运行的终端 + 一个文件编辑器,其他能力全部关掉。  官方对它的定位很清楚,是专门拿来跑模型基准测试的,所以把环境削到最干净,好让不同模型能在同一个标准下公平比较。 也就是说,极简模式根本不是给人干活用的,是给模型考试用的。 那把考试模式拿来干活,真的会更强吗? 废话不多说,直接开测! ## 实战一、3D 第一人称射击游戏 第一个测试,我让 DeepSeek V4 Pro 开发 3D 第一人称视角的 CS 风格射击游戏。 完整提示词: ``` 用 Three.js 开发一个 3D 第一人称射击游戏,做成一个单页面项目,打开浏览器直接能玩。 要求第一人称视角,WASD 控制移动,鼠标控制瞄准和射击; 场景里至少有 3 个敌人会自己巡逻,发现玩家后会追击,被打中后消失; 界面上要显示准星、血量和得分。 ``` 为什么选这个任务呢? 因为 3D FPS 是游戏开发里的经典中的经典,网上教程烂大街了,模型训练数据里肯定见过无数遍。这种任务纯粹考编码能力,不需要搜索文档、不需要查接口,模型的脑子里有货,直接嘎嘎写就完事儿了。 同一套提示词,我先用标准模式跑了一遍,再用极简模式跑了一遍。  先看看两种模式执行记录的区别。 标准模式调用了技能,中间有很多文字输出,会告诉你它在想什么、准备干什么,就是我们日常使用 AI 编程工具的那种感觉。  极简模式只有思考、终端、和字符串替换这个工具调用,中间没有任何多余的输出,AI 就像个哑巴一样,闷头干活。  标准模式跑完用了 50 步,AI 自己检测并修复了 Bug,模型推理花了 21 分钟,工具调用花了 12 分钟,加起来 33 分钟出头,输入 520 万 Tokens、输出 10.5 万 Tokens。  极简模式跑了 77 步,模型推理 17 分钟,工具调用只花了 6 分钟,总共 23 分钟多,比标准模式快了将近 10 分钟!连最后给我的总结都非常精简。  不过这里有个反直觉的地方,极简模式的输入 Tokens 反而更多,达到了 590 万。 原因也不难理解,极简模式没有上下文压缩能力,而且步数比标准模式多了一半,每走一步都要把之前的完整历史再发一遍,累积下来输入量自然就上去了。好在两种模式的缓存命中率都是接近 100%,这部分差距的花销基本可以忽略。 接下来是重头戏,看看成品效果。 标准模式做出来的游戏体验非常顺畅,移动、跳跃、疾跑、射击、杀敌都是 OK 的,甚至还可以用 CF 里的二段跳。 但是敌人不能发射子弹,只能追着你跑,没啥压迫感。而且有个 Bug,敌人追着你跑一会儿之后,自己又走开了,我提示词里压根没这么要求,这合理吗?  有个细节做的不错,如果你被人机给锤死了,会触发一个倒地的效果,视角跟真人倒在地上一模一样!  再来看看极简模式的效果。界面比标准模式做得更简洁,背景墙也更真实,移动、跳跃、疾跑、射击、杀敌同样都正常。 而且极简模式的敌人能够发射子弹,感觉更智能,游玩的压迫感更强。  不过被击倒的时候,我整个角色的身体还是站立着的,跟标准模式那个倒地视角比就差点儿意思了。  从成品效果来看,两者半斤八两吧,各有优缺。 但是从耗时来看,极简模式快了整整 10 分钟,输入 Tokens 虽然多了一点,可绝大多数都命中了缓存,这点差距可以忽略不计。 所以这一局,我会觉得极简模式略胜一筹。 ## 为什么极简模式效果更好? 道理其实很简单,打个比方。 让你来拧一颗螺丝,我给你一把螺丝刀,你直接就拧了。但如果我给你一整个工具箱,里面有扳手、钳子、电钻、螺丝刀,你可能得先翻一翻,犹豫一下该用哪个,最后还是拿起螺丝刀。 AI 也是一样的。默认的标准模式给了模型 20 多个工具,模型每走一步都要先判断这一步该用哪个工具,光是做这个选择就要占用一部分推理能力。而且这 20 多个工具的说明书本身也要塞进上下文里,模型能分给你真正那道题的注意力,自然就被摊薄了。 极简模式把这些能力统统砍掉,只留一个终端和一个文件编辑器。AI 能做的就是直接动手写代码,没有选择困难症,自然又快又准。  其实 DeepSeek 官方跑分用的就是极简模式,你看跑分图最下方的小字:V4-Pro 使用 DeepSeek Harness 极简模式作为框架进行测试。  而且有开发者做了一组很严格的对照实验。他用自己的一套工程维护评测题目,在同一台机器、同一个模型、同一个推理档位下只换 Harness 模式,结果标准模式跑了 91 分,PTC 模式 92 分,极简模式直接干到 99 分,还是有差距的。  ## 能用极简模式干活吗? 注意,极简模式并不是让模型本身变强了,而是让模型在一个极度受限的环境里不再分心了。 而它的代价也很明显,联网搜索、任务规划、Skills 技能、子 Agent、上下文压缩,这些能力全都没了。 极简模式手里就剩一个终端和一个文件编辑器,创建文件、安装依赖、执行命令这些活儿倒是都能干,但是它不能通过工具快速查到外部资料,聊得越久也越容易忘记前面说过什么。 还有一点很影响体验,就是它几乎不跟你汇报。你只能看到一连串的终端命令和文件替换,AI 到底在想什么、走到哪一步了、有没有遇到坎儿,你压根不知道。所以它其实更适合那种你只关心最终结果、不在意中间过程的任务。  你有没有发现,这个状态其实很像 23 ~ 24 年我们刚开始拿 AI 写代码的时候,AI 只能凭脑子里那点存货硬写,碰上没见过的框架就开始一本正经地编造代码写法。 后来有了工具调用、MCP、Skills 技能、上下文管理,一直发展到今天的 Harness,才一步步把 AI 从一个只会聊天的模型,变成了能自己查资料、自己动手改代码、自己跑测试验证的「工程师」。  极简模式相当于把这些年攒下来的装备又卸掉了一大半。 那要是换一个必须通过联网搜索资料才能做完的任务,极简模式还能打吗? 试试看! ## 实战二、AI 宠物领养系统 第二个测试我换了个复杂任务,让 AI 开发一个「AI 宠物领养系统」。 完整的提示词: ``` 开发一个 AI 宠物领养系统,前后端都要能跑起来。 先联网搜索 DeepSeek 鲸鱼娘的图片,下载至少 20 张存到项目里,作为默认的待领养宠物; 后端从我电脑的环境变量里读取 DeepSeek 的 API Key,调用大模型给每只宠物生成一段领养文案; 前端展示宠物列表和 AI 写的介绍,点击可以领养。 ``` 这个任务跟上一个完全不同,它需要读取本地环境变量拿 API Key,需要联网搜索图片并下载,需要协调前后端接口,还需要调用 AI 模型能力。 看看结果。标准模式跑了 59 步,模型推理 10 分钟,工具调用花了 38 分钟,总共 49 分钟,输入 420 万 Tokens、输出 5.4 万 Tokens。 关键是它成功找到了我本地的 `DEEPSEEK_API_KEY`,全程没让我插手,直接把成品交付了。  极简模式跑了 87 步,模型推理 11 分钟,工具调用只用了 16 分钟,总共不到 28 分钟,又比标准模式快了 21 分钟!Tokens 消耗也差不多。 但是它没能从我电脑上读到 `DEEPSEEK_API_KEY`,最后还得我自己填,可交付性就差了一些。  先看看标准模式的成果。整体布局还是不错的,宠物卡片的排版很舒服,但也没到惊艳的程度,而且右上方那行提示文字的位置没对齐。  不过 AI 顺利完成了抓取鲸鱼娘图片、并且调用 AI 大模型来生成文案的任务:  点击就可以领养你想要的鲸鱼娘 🐳  筛选功能也是正常的,可以在「全部 / 待领养 / 已领养」之间切换,被领养走的小鲸卡片会置灰,还会标上领养人的名字,一眼就能看出哪些宠物已经有主了。  再来看看极简模式的效果。我得先手动获取 DeepSeek API Key,然后让 AI 帮我填写环境变量并运行程序。 主页面效果也还 OK,看起来跟标准模式做的差不多,毕竟是同一个模型。 但是功能的实用性上就差了一截,没有做任何筛选功能。而且卡片上只有名字、编号和一段文案,宠物的品种、年龄、性格标签这些信息全都没有。对比一下标准模式,人家每张卡片上「灰鲸、2 岁、#幽默 #吐槽役」这些信息都齐全,一看就是个《正经》的领养网站。 还有右上角那个「AI 文案:DeepSeek 已生成」的角标,怎么看都不像是给普通用户用的产品,倒像是自己调试用的。  极简模式同样是可以点击领养,并输入领养人昵称的:  领养成功后,这只宠物不能再被别人领养,功能逻辑是正常的。但因为没有筛选功能,你看不到自己到底领养过哪些宠物,只能一个一个往下翻着找。  对了,上面 4 次任务加起来,你猜猜总共花了多少钱? 答案是 3.13 元,你觉得贵不贵?(涨价前最后的倔强)  ## 极简模式的优缺点 两个项目都跑完了,说说我对极简模式的看法。 首先,极简模式最大的优点就是「快」。两次任务分别快了 10 分钟和 21 分钟,花的钱还差不多,而且它非常直接不绕弯子,你说什么它就直接干什么,不会先跟你聊一堆计划。 它的短板也同样明显。整个过程几乎不跟你汇报,你不知道 AI 在干什么。没办法直接通过工具联网,还要通过脚本另辟蹊径。虽然最后交出来的功能可以正常运行,但是细节和完整度都差了一截。 总结下来就一句话:**你对成品质量的要求越高,极简模式的表现就越差**。 做个能玩起来的游戏 Demo,它完全够用;做个像样的、能直接给用户的产品,它可能就会开始掉链子了。 另外,如果你的任务强依赖某个特定工具,那差距会被进一步拉大。比如 DeepSeek V4 Pro 本身看不了图,得靠 Harness 挂一个视觉插件来补这个短板,这类任务在极简模式下会麻烦很多。 ## 等等,还有高手? 本来我以为故事到这里就结束了。极简模式跑分虽然猛,但是并不实用,想要好的交付质量,还是得老老实实用标准模式。 结果昨晚 B 站 UP 主「小明XBright」丢了个《核弹》。 他在完整保留标准模式那 20 多个工具的前提下,靠一个自己写的两阶段插件 `dsh-anchored-standard`,在自己那套工程维护评测题目上连跑两次,拿到了 98 分和 99 分,均值 98.5,不但追平了极简模式,甚至还略微反超。  绝了,他是怎么做到的? 原理是这样的,DeepSeek V4 Pro 对首轮请求的工具结构极其敏感。你第一轮就把 20 多个工具全甩给它,它就会犯迷糊,分数掉到 91。但如果第一轮沿用极简模式那句系统提示词,并且只给终端和读文件这两个工具,让模型先用极简模式的思维链进入状态,等第一次工具调用完成之后,再立刻把全部工具恢复回来,分数就直接飙到 98 了。 从模型的推理过程中更能看出区别。标准模式下,模型的推理过程里出现了 208 次「let me」,还有 55 次中间回复,说明它一直在犹豫、规划、自我确认。而在这个两阶段插件的引导下,模型开口就是「We need」,通篇都是「我们要干什么」的口吻,两轮加起来「we」出现了 300 多次。  同一个模型,思维方式完全不同。 他还翻了 DeepSeek Harness 的官方源码,找到了铁证。仓库里有个测试文件,名字就叫 「sends the exact RL prompt and schemas」,翻译过来就是「发送精确的强化学习提示词和工具定义」。这是 DeepSeek 官方自己承认的,极简模式用的就是模型训练时的那套格式。  所以你临时换一份它没怎么见过的工具清单,它就会有点儿找不着北。 更有意思的是,DeepSeek V4 Flash 完全没有这个问题,Flash 在不同 Harness 下的分数稳定在 90 到 95 之间,切换到极简模式也没什么变化。所以这更像是 V4 Pro 训练时对自家格式「过拟合」了,Harness 是 DeepSeek 的角色专武实锤了。。 这个发现比单纯的「极简模式性能暴增」更有价值。它揭示了一个更深的问题:当前 AI 模型的能力释放,很大程度上取决于它能不能回忆起训练时的状态。未来 Harness 的优化方向可能不是给更多工具或者砍掉工具,而是搞清楚怎么在启动阶段对齐训练分布,唤醒模型最强的执行状态,然后再释放完整能力。 学会了学废了,感兴趣的同学可以试试看。 插件开源仓库:https://github.com/xiaobright/dsh-anchored-standard  ## 最后哔哔 极简模式这波邪修,我就先测到这里了。 **结论很简单,图快就用它,图稳就用标准模式。** 不过那个两阶段插件的思路确实让我眼前一亮。以后 Harness 插件生态成熟了,说不定会有更多插件专门去研究怎么先把模型的状态调到最佳,再把完整的工具交到它手上,到时候 DeepSeek 的实际体验可能还会再上一个台阶。 OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide  我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 评论区聊聊:你有没有用过 DeepSeek Harness?感受如何?有哪些不错的玩法呢?
