编程导航程序员话题讨论

程序员

105 参与
分享

快来分享你的内容吧~

点击登录,快来和大家讨论吧~
表情
图片
话题
打卡
综合
交流
文章
问答

DeepSeek 官方偷偷上传 Harness 桌面端安装包,我已经用上了。。附最新下载地址

大家好,我是程序员鱼皮。 前段时间我写过 [一篇文章](https://mp.weixin.qq.com/s/ieOE4mzyMoa8OVcAOAkhzg),说自己在 DeepSeek Harness 的开源仓库里发现,官方竟然偷偷做了桌面端。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/OesxYqhw7JYjgFlF.jpg) 当时官方没有放出安装包,我是让 AI 帮忙把源码拉到本地编译,才跑起来的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/fbfgfTQawDqDwnmD.jpg) 没想到才过了十来天,DeepSeek Harness 桌面端的安装包就出来了。不过这次并不是官方正式发布的,而是被万能的网友给扒了出来! 有网友发现 DeepSeek 自家的下载域名多了桌面端的更新清单和安装包,顺藤摸瓜找到了下载地址,很快就在社交平台上传开了。还有网友专门验了签名,安装包用的是「杭州深度求索人工智能」公司主体的苹果开发者证书,并且通过了苹果官方的公证,基本可以确定是 DeepSeek 自己打的包。 **但到目前为止,DeepSeek 官方还没有发任何公告。** 虽然官方还没官宣,但很多人已经吃上螃蟹了(包括我)。截止到文章发布时,最新版本是 `0.1.7-rc.2` 。 下载地址我已经帮大家整理好了: - DeepSeek Harness 客户端 Windows 版本:https://download.deepseek.com/dsh-desk/bin/win-x64/deepseek-harness-0.1.7-rc.2-win-x64.exe - DeepSeek Harness 客户端 Mac 版本(Apple 芯片):https://download.deepseek.com/dsh-desk/bin/mac-arm64/deepseek-harness-0.1.7-rc.2-mac-arm64.dmg 目前官方只打包了这两个版本,用 Intel 芯片 Mac 和 Linux 的朋友暂时还得再等等。 安装包都不小,Windows 版接近 300 MB,Mac 版将近 370 MB。因为官方把 Node.js、pnpm 和 Python 运行环境全都打包了进去,你的电脑上不用提前装任何环境。 **选择对应系统的版本下载,双击安装就能打开了。** 第一眼看上去,桌面端的界面跟 DeepSeek Harness 网页版几乎一模一样。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/2pOkI9QfElLRWiKX.jpg) 我去翻了下仓库里 `apps/desktop` 目录的源码,桌面端是在完整的 DSH 网页应用外面套了一层 Electron 壳,界面用的是同一套前端代码。 套壳的好处是,桌面端的对话记录和配置都跟网页版是互通的。因为两者读写的是电脑上同一个 `~/.dsh` 数据目录,我之前在网页版里创建的工作区和聊过的会话都还在,配置好的第三方模型也能直接切换使用。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/LYHBnexHO9PNZZ8F.jpg) 新版本的 DSH 还在左侧菜单栏加了一个「插件」入口,里面内置了 7 个官方插件,包括智能体团队、自动授权审查、语音输入、终端、Agent 循环、子智能体和网页搜索。比如开启智能体团队插件后,就能让多个 Agent 分工协作,还带有共享的任务看板。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/GbmnpIY8qfJhqZRs.jpg) 除了官方插件,你还可以点击右上角的「添加插件」,直接输入 GitHub 仓库地址来安装第三方插件。 比如我安装了一个社区开发者做的 dsh-web 全家桶插件,它把一大批网页端的增强插件聚合到了一起,能全方位增强 DeepSeek Harness 的能力。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/to8jiz92vNLe8Gki.jpg) 装好之后,DSH 就变成了这个样子,聊天背景换成了二次元插画,右下角还多了一个看板娘。 你喜欢么? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/BcaStd6kTvhNYPyR.jpg) 让我比较意外的是,桌面端和网页版的 UI 还是有点儿差别的。比如在左下角可以直接登录 DeepSeek 账号,查看充值余额、查询用量,还能直接充值。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/m8Dxk2om4muk5Ysq.jpg) 而且登录账号之后,模型列表里会多出一组「DeepSeek 账号」模型,可以直接用账号里的余额来跑任务,不用再去开放平台单独申请 API Key 了。对新手来说,这一步能省掉不少麻烦。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/wr5xKwvOfEYF6Z3B.jpg) 能看出来,DeepSeek 官方这次是真的打算好好做 Harness 桌面端了。账号登录、首次使用引导、自动更新这些面向普通用户的功能都安排上了,安装包还用公司证书做了签名,值得期待一波。 **但是,我不建议大家现在就把 DeepSeek Harness 桌面端当作主力工具,尝尝鲜就好。** 一方面,官方还没有发布上线公告;另一方面,作为实验版本,它的功能还不全,体验也比较一般。 比如我在 Mac 上就没办法缩放字体,一开始我还以为是自己没找到设置,后来翻了下源码,发现 macOS 的菜单里确实没有放大和缩小这两项,所以给大家看的截图字都很小。。。 **臻品大家共赏,屎给鱼皮先吃。** 为了帮大家节省时间,我是认真的! 最后分享一下,我是怎么实时获取到 DeepSeek Harness 桌面端的最新下载地址的?🤔 **很简单,直接问 AI 啊!** 我让 DeepSeek Harness 用最简单直接、不绕弯子的方式告诉我怎么获取: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/2GD1HrjL150WuVki.jpg) 原理其实很简单。桌面端内置了自动更新功能,每隔 10 分钟左右就会去官方服务器读取一份更新清单文件,清单里写着最新的版本号和安装包地址。所以我们也不用去猜文件名,直接打开这份清单看一眼,就能拿到最新的下载链接: - Windows 版更新清单:https://download.deepseek.com/dsh-desk/feeds/win-x64/nightly.yml - Mac 版更新清单:https://download.deepseek.com/dsh-desk/feeds/mac-arm64/nightly-mac.yml 注意,Mac 版清单里给的是 `.zip` 格式的自动更新包,把链接结尾的 `.zip` 换成 `.dmg`,就是我们平时双击安装的安装包了。 OK 就聊到这里,如果你还不了解 DeepSeek Harness,或者想学习更多 AI 编程工具的玩法和技巧,可以看看我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide) ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/T3QEDDdQh2sOqc4h.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 你已经装上 DeepSeek Harness 桌面端了么?用起来感觉怎么样?欢迎在评论区聊聊~

AI 桌面换装视频火了,1 分钟教你复刻!傻子可懂

大家好,我是程序员鱼皮。 最近 AI 桌面换装视频突然爆火,Twitter 上随便一条就是百万播放。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xGiiMQXeahdTfmsC.jpg) 视频里一个虚拟美女坐在电脑桌面上,你让她换什么衣服她就换什么衣服,还能对话。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/aFjmJ7MsUl3TANOv.jpg) 果然,歰歰是第一生产力啊! 为了锻炼自己的 AI 视频制作技术,而不是出于兴趣,我也搞了一条试试。 ![我的成品](https://pic.code-nav.cn/post_picture/1601072287388278786/ayqgVz31UiplVIIO.jpg) 怎么样,是不是精准复刻了原版的风格? 三套造型切换,有对白声音、有特效字幕,全程模拟电脑桌面录屏的风格,30 秒一镜到底。 ![三套造型对比](https://pic.code-nav.cn/post_picture/1601072287388278786/njgNdwYLbJgmIcGP.jpg) 这是怎么做到的呢? 其实非常简单! 给我 1 分钟的时间,我来教你如何复刻,保证一学就会。 ## 1、准备工作 首先,我用到的是知名傻狗 `程序员鱼皮` 开源的「AI 桌面换装视频」生成技能。 > 开源指路:https://github.com/liyupi/ai-desktop-outfit-video ![](https://pic.code-nav.cn/post_picture/1601072287388278786/50hRmrhTYlFHBKz7.jpg) 这个技能的玩法很简单。你跟 AI 说一句话描述需求,AI 就会帮你自动生成一段完整的 AI 视频生成提示词。然后复制到任意 AI 视频工具里就能出片,不用自己写又臭又长的提示词。 ## 2、让 AI 帮你写提示词 演示一下,随便打开一个 AI 工具(比如 Cursor),使用技能,然后跟 AI 说: ```markdown 我想创作 30 秒的视频 ``` AI 就会像产品经理一样主动询问你的需求: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/gtXk3LOUGSVeZkRc.jpg) AI 会先问你主角是谁。默认是中国古典鹅蛋脸美人,你如果有自己喜欢的角色,可以直接描述,也可以上传一张参考图。 比如我先用 ChatGPT 生成了一张参考图,并提供给 AI: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/uR1uZSBGJ6KFIzvI.jpg) 然后 AI 会问你视频的场景。默认是深蓝灰色调的房间,我跟 AI 说把场景改成安静的小酒吧。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/G15wugMPJFTTi6fo.jpg) 接着 AI 会问三套换装造型是什么。我就随便说了水手服、洛丽塔、白领制服,跟个人爱好完全无关: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/8cvRhE95Pl6kjmNj.jpg) 然后 AI 还会问你视频里的台词。如果你不喜欢默认的台词,可以让 AI 帮你修改为适配你需求的文案。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/OtxSHxZ22hFKCKxn.jpg) 最后 AI 会问你尺度档位,软、中、硬三档可选。 我知道你们想选什么,唉…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/K6sI23kLDuT4JuUP.jpg) 六个问题问完,AI 就直接输出了一段完整的提示词。在这个技能的开源项目中有完整版的参考提示词。 ## 3、复制提示词,生成视频 接下来只需要把这段提示词复制出来,丢到任意一个 AI 视频生成工具里就行了。即梦、豆包、MiniMax 等等都可以,只要支持 Seedance 模型或者同级别的视频模型就行。 生成之前,有几个注意事项: 1. 比例选 16:9,因为是模拟电脑桌面 2. 时长选 30 秒(Seedance 2.5 支持 30 秒) 3. 使用默认的全能参考模式就好,不要开任何运镜预设 建议先用 720p 来试,1080p 的积分消耗真的太贵了!等效果满意了再上高清。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/A7t53JaScQn7CVV3.jpg) 然后等 AI 生成完,一段桌面换装大作就出来了。 ![换装效果](https://pic.code-nav.cn/post_picture/1601072287388278786/pGCZfCTDbWj6XQgE.jpg) ![](https://pic.code-nav.cn/post_picture/1601072287388278786/NaECbwMVjkrnLrXB.jpg) ## 4、直接调 API 生成 除了手动复制提示词之外,这个技能还支持直接调用 Seedance 2.5 的 API 来生成视频。 > 当然,你换成其他 AI 视频生成模型的 API 也是 OK 的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/70VjWyyULRE7dyRm.jpg) 只需要去火山引擎官网获取一个 API Key,提供给 AI 就行了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/6e8P9jEo7crtuoSx.jpg) AI 会直接帮你调用 API 生成视频并下载到本地,全程不用你自己打开任何 AI 视频生成工具。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/bjkyvjegUVmUgrQB.jpg) 生成的效果也是非常理想的。但是由于生成的视频过于劲爆,这里就不给大家完整播放了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/YUaGHdmpddgrxKNG.jpg) 怎么样,是不是很简单? 有了这个技能,你可以自定义女主 / 男主,自定义场景、台词、造型。一个爆款视频就这样被轻轻松松复刻出来了! ## 5、核心原理 那问题来了,这个技能是怎么做出来的呢? 其实也很简单。 我直接找到爆火的原版视频,丢给 AI,让它帮我逐帧分析视频的画面和声音,并生成简单直接的提示词。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/k3NLfCxOLy6dGZwq.jpg) 注意,这段提示词中,我用到了 `/grill-me` 技能,AI 如果没充分理解需求,就会主动找我人工确认。 看看,这是 AI 逐帧分析的画面: ![逐帧分析](https://pic.code-nav.cn/post_picture/1601072287388278786/C1mDvgQMKwRI56jW.jpg) AI 帮我拆出来了整条视频最核心的「机关」。比如镜头全程一动不动,人物站起来的时候镜头不跟,只拍到腰部以下,看起来就像真的是电脑桌面壁纸。还有每次换装前都要留一秒钟的空沙发镜头,避免衣服在身上直接变形。 ![机位机关四格](https://pic.code-nav.cn/post_picture/1601072287388278786/2o0KPv4x7IQPXEJK.jpg) AI 拆解明白之后,帮我生成了一段简洁的提示词模板: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/534s5SJtVzJb0A6J.jpg) 然后我直接把提示词拿到即梦里测试。结果非常顺利,一把就出了满意的效果。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/u3bvVeyeLPMjQ9ax.jpg) 测试没问题之后,我就让 AI 把整个工作流封装成了一个可复用的 Skill 技能。AI 从提问流程、提示词模板到 API 调用脚本,全部自动生成好了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/owfSl3FawitdYmAf.jpg) 最后我直接让 AI 帮我把这个技能开源到 GitHub 上,并且自动生成了一个有图有文、甚至有 GIF 动图演示的项目 README 文件。真的爽! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/V3nIKXZtaKSFVMsK.jpg) 这也是得益于现在的 AI 模型 Agent 能力和视觉理解能力越来越强了。整个过程从拆片、写提示词、测试、封装技能到开源发布,全程几乎都是 AI 在干活,我只需要做决策和验收。 ## 最后哔哔 看到这儿你应该能 get 到本期精髓了。下次你在网上看到某个爆款视频,完全可以用同样的方法让 AI 帮你逐帧拆解、生成提示词、封装成可复用的技能。不光是换装,AI 互动壁纸、桌面宠物、动态直播间背景,都是一个思路。 这篇文章我也会收录到我的开源教程 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe) 中。上千张图、几十万字,从 0 开始带你学会 AI 编程,做出自己的产品、跑通变现全流程,感兴趣的同学可以看看。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide) ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/GBkhbrR5Arr69U8W.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~

刚刚 Opus 5.5 和 GPT-6 Sol 同时发布,首发实测来啦!结果让我很意外

刚刚,Anthropic 发布了 Claude Opus 5.5,号称在大多数任务上都能打平自家最强的 Fable 5.1,运行成本却比上一代 Opus 5 还低 40%! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/52hV2kDEf6jBhe1c.jpg) TNND,上周 A ÷ 不是还在呼吁 AI 前沿发展要 **放缓节奏** 么? 明明距离上次 Claude Opus 5 的发布才过了 2 个月,官方还真有脸说「这是呼吁放缓之后发布的第一个模型」?? 意思是如果不放缓,Claude Opus 55 都出来了??? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/AiWNQVODM959wOmc.jpg) 然后不到 2 小时,OpenAI 也发布了 GPT-6 Sol,号称继承了 GPT-6 Astra 的大部分优势,API 价格却比 GPT-5.6 直接砍了一半! 每百万 token 输入 2 刀、输出 10 刀,正好是 Opus 5.5 的一半。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/haztf9OCDsJPhSd4.jpg) 历史似曾相识,两大顶级 AI 公司再次上演中门对狙…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/nDwxsbSW1CRksL32.jpg) 这次我已经不想花时间科普跑分了,直接放一张我《AI 大模型世界网站》的对比图,大家自己看着玩就好: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/7IUJdO2iQzHBhRnf.jpg) 简单来说,Opus 5.5 的智能程度直接冲到了第一名,GPT-6 Sol 只比上一代 GPT-5.6 Sol 多了 1 分。 要看大模型的效果,别看跑分,看鱼皮实测就得了~ ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ESabfgswyqJkI8mw.jpg) 这次我准备了 5 个案例,Claude Opus 5.5 在 Cursor 里跑,GPT-6 Sol 在 Codex 里跑,推理强度都开到 high,两边使用相同的提示词,全程我不会人工干预。 1. 用 SVG 画熊猫骑车送外卖 2. 300 字科普大模型 3. 3D 重庆城市生成器 4. 操作电脑画 Q 版鲸鱼娘 5. 复刻 Cursor ## 1、SVG 画熊猫骑车 AI 圈有个经典测试叫「鹈鹕骑自行车」,是开发者 Simon Willison 发明的。他让 AI 直接写 SVG 代码画一只骑自行车的鹈鹕,不许看效果,车架怎么连、脚怎么踩踏板,全靠 AI 在脑子里算坐标。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/GsDnWRoFwmFMjgPR.jpg) 不过这道题实在太出名了,Simon 这次贴出来的推理过程里,Opus 5.5 开口第一句就是「这是一个经典的测试请求」,AI 一眼就认出来了…… 所以我换了个题目,让 AI 画一只骑着自行车送外卖的大熊猫,同样只许写代码,不许打开看效果。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/355p37FtF1lrFC22.jpg) 两个模型都在 3 分钟内交卷了,左边是 Opus 5.5,右边是 GPT-6 Sol: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/c8YKR12TgW6xDOLJ.jpg) Opus 5.5 这张的完成度明显更高。牙盘、链条、脚踏板都画出来了,熊猫的脚踩在踏板上,手握着车把,车把上还挂了一杯奶茶。 它还自己加了车灯、「叮咚~外卖到啦!」的对话气泡和城市背景。而且这张 SVG 是会动的,轮子在转,链条也在走! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/pkOwwjh3kpUum1m8.jpg) 再看看右边,这什么玩意?!我真的绷不住了…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/QkLqj83o0ZnpS7Gm.jpg) 这一轮 Opus 5.5 完胜。 ## 2、300 字科普文案 这次 Anthropic 官方特别强调 **Opus 5.5 写东西更像人话**,我还是有点期待的。 那接下来,让两个 AI 比一比写作能力和文字功底。 我让两个模型用 300 字左右,给一个完全不懂技术的朋友讲清楚什么是大语言模型,要求说人话、不要书面腔,也不许加标题和列表。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/vr1Pxea2mMzDQcpQ.jpg) 两篇我先隐去模型名,你可以猜猜哪篇是 Opus 5.5 写的? **A 篇** > 你可以把大语言模型想成一个读过海量文字、很会接话的助手。它看过书、网页和各种对话,从中学会了人们通常怎么提问、怎么回答,哪些话放在一起比较合理。你发给它一句话,它就根据你前面说的内容,一点点组织出回复。所以它能帮你解释问题、改写邮件、想点子,甚至陪你练习外语。 > > 不过,它不是脑子里装着一本随时翻开的百科全书,也不像人一样亲身经历过这些事。它说得顺,不代表一定说得对;有时会把不确定的事讲得很肯定,甚至编出听起来像真的细节。遇到看病、花钱、签合同这类重要的事,最好再找可靠的人或资料核实。简单说,它像一个反应很快的文字搭档:能帮你起步、理清思路,但最后拍板的还是你。 **B 篇** > 你平时用的 ChatGPT、豆包这些能陪你聊天的 AI,背后靠的就是大语言模型,英文简称 LLM。 > > 你可以把它想象成一个特别爱读书的学生。它把网上能找到的文章、书和聊天记录几乎都读了一遍,读得多了,就慢慢摸清了人说话的规律,知道一句话说到这儿,后面最可能接什么。 > > 所以你问它问题的时候,它其实是在一个字一个字地往下接,每一步都挑最顺、最合理的那个字。听起来挺简单对吧?但因为它读过的东西实在太多了,接出来的话不光通顺,还经常真有道理,能帮你写文案、做翻译、出主意,甚至还能写代码。 > > 不过它也有个毛病,就是容易不懂装懂。它追求的是把话说得像那么回事,并不保证每句都对,所以碰到它不知道的事情,它也可能一本正经地瞎编。你用它的时候,重要的信息最好自己再核实一下。 答案是 B 篇出自 Opus 5.5,A 篇出自 GPT-6 Sol,你猜对了吗? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/5fknAycDYNesrTdk.jpg) 我个人更喜欢 Opus 5.5 这篇。它先从你天天在用的 ChatGPT、豆包说起,再拿「特别爱读书的学生」打比方,然后一句「一个字一个字地往下接」就把大模型的原理讲明白了。中间还穿插了一句「听起来挺简单对吧?」,读起来真的像朋友在跟你聊天。 GPT-6 Sol 这篇也不差,最后提醒大家看病、花钱、签合同这类事要再核实,这个例子举得很接地气。但是两段话都写得太长了,而且它只说大模型会「一点点组织出回复」,怎么组织的却没讲清楚。 有意思的是,这道题 Opus 5.5 只用了 15 秒就写完了,GPT-6 Sol 反倒花了 52 秒。这也是整场测试里 Opus 5.5 唯一快过 GPT-6 Sol 的一次。 ## 3、3D 城市生成器 前面两道都是小题,接下来上点强度,让 AI 真刀真枪地写一个 3D 项目。 这个案例是之前我测 GPT-6 Astra 时用过的 3D 程序化城市生成器。这次我只留了重庆一座城市,要求层叠立交、轻轨穿楼、依山而建的高差感这 3 样必须做出来。至于编辑器怎么布局、要有哪些参数,我一个字都没写,全部让 AI 自己去参考官方的设计。 另外我还要求 AI 做完之后自己打开网页验证效果,不满意就自己接着改,直到满意再交付。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/jDZBd5qkaqH38sMw.jpg) ### Claude Opus 5.5 Opus 5.5 在这道题上磨了将近一个半小时,中间自己截图检查、来回修了 7 轮左右才交卷,严重影响了我这篇文章的发布时间! 但是当我打开主页时,我直接「卧槽」了! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/MYwatISDkmqPtFNa.jpg) 夜里的渝中半岛被两条江环抱着,每栋楼的窗户都一格一格亮着灯,跨江大桥上还挂着灯带。 这个细腻度,这个质感,我感觉一切的等待都是值得的! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/EXHzv1hHlQLonYhX.jpg) 鼠标拖一拖就能旋转、平移、缩放,按数字键 1 到 6 还能切换视角。比如切换到俯视图,半岛的轮廓、江面和盘成一团的立交都看得一清二楚: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/K7zlOJzU47qLQjnF.jpg) 最让我惊喜的是细节。明明有几百栋大楼,放大之后你竟然能看到「李子坝站」的中文站牌,还有一列轻轨正从楼中间穿过去! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/i0uVivKEJEsWcbp8.jpg) 再把镜头推到立交桥上,一圈套一圈的匝道在空中叠了好几层,每条匝道上都有车辆在流动,感觉把重庆的层叠立交还原的栩栩如生(至少我是感受到这个立交的复杂度了…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/3zGG1kXx4DtZHkWL.jpg) Opus 5.5 甚至还专门做了一个「黄桷湾立交」的场景预设,备注写的是「5 层 15 匝道,导航也迷路」,AI 这个梗玩得是真懂重庆啊! 整体来说,山、水、桥都刻画得非常细腻。右侧面板还能灵活调整地貌、山体高度、台地化程度和江面宽度。 我顺手切换到「赛博 8D」预设,立交直接拉满到 6 层 27 条匝道,霓虹灯一开,赛博山城的味道就出来了: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/POV766rrUdTkU4K7.jpg) 这个效果我直接给到夯! ### GPT-6 Sol 再来看看 GPT-6 Sol。它只用了 12 分钟就交卷了,速度是 Opus 5.5 的 7 倍。 但是,做出来的东西就很一般了…… 整个画面是一片灰绿色的低饱和配色,楼就是一个个方盒子,我相信大家一眼就能感受到和 Opus 5.5 的差距。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/14a6yyhpMXkTbjXt.jpg) 整体的建模比较简陋,而且问题还不少。 这…… 这是悬空城啊? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ZyK0AZt6rLeWFAkH.jpg) 咱就再看看刚才那个经典的李子坝轻轨穿楼,穿模问题就更明显了。车厢一头扎进了楼里,墙上却没有给轻轨留出通道…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Yvnc0X1JvgMkaZjp.jpg) 它也支持俯视图,该有的功能也都有。但无论是 UI 效果,还是右侧菜单的丰富程度,Opus 5.5 都是降维打击。 GPT-6 Sol 的面板上只有 3 个预设和 6 个参数,Opus 5.5 光场景预设就有 6 个,参数更是有 7 组 30 多个。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Ecbr0SjXJc6dh2uf.jpg) ## 4、操作电脑画图 城市生成器考的是写代码,接下来换个方向,考考 AI 操作电脑的能力。 前面熊猫骑车测试中,我是让 AI 闭着眼画画,这一轮让它们睁开眼睛画,而且得像人一样握着鼠标一笔一笔画。 一开始我想让 AI 操作专业的 PS 软件画图,但软件越复杂、变数就越多。于是我先让 AI 开发了一个简易画板网页,只有画笔、橡皮擦、油漆桶、直线、矩形、椭圆和吸管这几个基础工具,连文字工具都没有,气泡里的字也得一笔一笔手写。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/RgIp7LUUYLuT1NPr.jpg) 然后我给了一张 Q 版 DeepSeek 鲸鱼娘的参考图,让两个模型照着画出来: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/p7NifIVYJXlbNP7k.jpg) 提示词里我给 AI 定了一条规矩,就是只能用鼠标和键盘操作,不许写代码往画布上画。画板上的按钮怎么用、先画哪儿后画哪儿,我一句都没教,全部让 AI 自己摸索。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/m042t4bNGXetQk0m.jpg) Opus 5.5 是在 Cursor 自带的浏览器里画的,前后花了 1 小时 17 分钟,画出来是这样的: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/9WDcHIHMn6IW9ktw.jpg) 好家伙,怎么画成卷发了?? 头发是一坨一坨的圆球球拼起来的,连「好模型」三个字都是用圆点一个个点出来的…… 翻了一下 AI 的执行过程我才明白,应该是因为 Cursor 内置浏览器的拖拽功能只能拖动网页元素,没法按住鼠标从一个点划到另一个点。Opus 5.5 画不出连续的线条,只能把笔刷调到 65 像素,一下一下地点,再用油漆桶填色,前后点了 270 多下。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/WRjE4KlQh6VhIbr6.jpg) 不过即便是这样,它的构图和配色还原得挺像的,对话气泡、呆毛、白色蕾丝头饰、蓝色大眼睛、腮红和蝴蝶结都在。 GPT-6 Sol 用的是 Codex 的电脑操作能力,直接控制真实的 Chrome 浏览器来画,参考图也是靠 GPT 自身的多模态能力看的。它可以自由拖动鼠标画线,17 分钟就画完了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hWpIMV0sTd2FcZPH.jpg) 怎么硕呢? 眼睛、腮红、呆毛、蝴蝶结和白色头饰倒是都有,眼睛画得还挺有神。但「好模型」三个字就崩的太明显了,头发是一大块半透明的蓝色,上面还飘着几道莫名其妙的折线。 两张放在一起,你觉得哪张更像参考图? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/HYFfacUeTrtzuUvC.jpg) 我个人投 Opus 5.5 一票,即使是被 AI 工具限制了,只能一个点一个点地戳,还原度反而更高。 ## 5、复刻 Cursor 工具 最后压轴的是我测过很多次的复刻 Cursor 这个 AI 编程工具,这是一个非常考验长程任务能力的全栈项目。 提示词跟之前测 Claude Fable 5.1、Kimi K3、GPT-6 Astra 时用的完全一样。我要求 AI 克隆 VS Code 的开源代码,在此基础上做一个 Web 版的 AI 编程工具,Editor Window 和 Agents Window 两种窗口能来回切换,内置 AI 接的是 DeepSeek V4.1 Flash。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xcSQRGh3zIRw1hG3.jpg) ### Claude Opus 5.5 Opus 5.5 花了 53 分钟交卷。打开网站,默认就是 Agents Window 智能体面板。 不骗大家,我刚看到这个界面的时候,真的大喊了一声「卧槽」! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/bPdJ9akcUEorrAMk.jpg) 左侧是按工作区分组的 Agent 列表,每个任务改了多少行代码都标得清清楚楚。中间是任务输入框,下面还有几个推荐任务,跟 Cursor 3 本尊的 Agents Window 神似。 光看到这里,你可能还没意识到问题的严重性,那如果我把文件查看器、终端、Agent 侧边栏都打开呢? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/SZENcSXsuoVjVpwN.jpg) 上面这些功能全都能正常使用!比如在终端里敲一个 tree 命令,项目结构立刻就打印出来了。我在右侧的 Agent 侧边栏里问这个项目有几个源码文件,AI 自己调用工具把目录列了一遍,回答是 5 个,跟终端里的结果对得上。 之前我也用相同的提示词让其他模型复刻过 Cursor,比如 Claude Fable 5.1 是之前完成度最高的,能逐个文件接受或拒绝 AI 的改动,但界面跟 Cursor 3 差得还挺远: ![Claude Fable 5.1 的复刻 Cursor](https://pic.code-nav.cn/post_picture/1601072287388278786/uTuyXoyKsvkDuAeh.jpg) GPT-6 Astra 那次自己取了个产品名叫 orbit,设计感很强,但它走的是自己的产品思路,功能丰富度也差 Fable 5.1 一截: ![GPT-6 Astra 的复刻 Cursor](https://pic.code-nav.cn/post_picture/1601072287388278786/VGocP9tzzQtfH3ue.jpg) 切换到 Editor Window 编辑器模式,文件高亮、代码高亮、代码补全一应俱全,还能在右侧打开 AI 面板随时和 AI 对话。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Y51vNIIuBSrLW4kb.jpg) 此外,还有完整的 Git 管理面板,改了哪些文件、提交记录都能直接看到: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/UAH9HC161TVeDjw5.jpg) 如果我直接把这个产品发布了,我敢打赌你绝对想不到这是 AI 一把梭的! 夯爆了! ### GPT-6 Sol GPT-6 Sol 只用了 27 分钟,差不多是 Opus 5.5 的一半时间。 进入主页,默认是 Editor Window 编辑器模式,也能实现代码高亮和自动补全,但从第一眼的界面上来看就已经输了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xxN95vlLDNwGyFKG.jpg) 再看看 Agents 面板,布局是合理的,但就是这个配色有点怪,给我一种 GPT 想让人看起来很牛逼、实际上很辣鸡的感觉。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/njaAVvrqlf1LuZL8.jpg) 任务可以正常执行,但整个执行界面也是浓浓的 AI 味儿,GPT 的风格一贯如此。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/LxmCB0zryXB8RLym.jpg) 功能丰富度也远远不如 Opus 5.5,不支持搜索,没有 Git 能力,没有终端,也没有那么多布局和面板,页面上很多按钮都是死的。 原因其实也很简单。GPT-6 Sol 虽然也克隆了 VS Code 的源码,但压根没用上,而是在旁边另起炉灶,用 Monaco 编辑器加 React 自己拼了一个工作台,源码一共才 600 多行。而 Opus 5.5 那边光是自己写的代码就有 3600 多行。 跟之前测过的国产模型比一比,这是 Kimi K3 当时用同一段提示词做的版本: ![Kimi K3 的复刻 Cursor](https://pic.code-nav.cn/post_picture/1601072287388278786/agKfMDKIQNFMMBOv.jpg) 说白了,我感觉 GPT-6 Sol 的水平跟目前的国产模型差不多。 不好意思,在看完 Opus 5.5 之后,只能给到拉完了…… ## 我的感受 5 个案例跑完,Claude Opus 5.5 除了速度,其他每一项都赢了。 虽然我老是骂 A 社,但不得不承认,人家的模型能力确实强。 嘴上建议大家放缓发展,自己却在那嘎嘎进步,别人都慢下来了,还怎么超过你? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/S0yMKqsvHmzmDlrY.jpg) Claude Opus 5.5 的能力比上一个版本提升明显多了,我甚至觉得它比 Fable 5.1 还要强,复刻 Cursor 那道题就是最好的证明。 **除了 AI 编程能力之外,Claude Opus 5.5 的写作能力也真的非常让我惊喜。** 以前我一直觉得 AI 越强,越不会说人话,所以写作基本还是用 Opus 4.6 或者国产模型。但 Opus 5.5 写出来的东西很有人味,就像前面那篇 300 字科普一样。 实不相瞒,你现在看的这篇文章就是借助 Opus 5.5 完成的,我把大纲和实测结果交给 AI 去润色,然后简单看了看、加了点自己的梗和表达,就搞出来了。 **当然,强是有代价的。** 先说速度。这 5 个案例 Opus 5.5 前前后后跑了 3 个多小时,GPT-6 Sol 只用了 1 个小时左右,除了写作那道题,GPT-6 Sol 全程都比 Opus 5.5 快。 再说花费,这个差距就更夸张了。Opus 5.5 这 5 个案例加起来花了我 600 多块钱!(本期成本巨大) 虽然 Opus 5.5 每百万 token 输入 4 刀、输出 20 刀,单价只有 Fable 5.1 的四成,但对个人开发者来说还是很贵…… GPT-6 Sol 就友好多了。之前的 GPT-6 Astra 能力是强,但额度消耗太快了,Plus 账号跑一两个项目就能把 5 小时额度耗光。这次我用 GPT-6 Sol 跑完一整套测试,才刚好把 Plus 会员的额度用完,耗时还不到 Opus 5.5 的三分之一,这才是给大家日常用的模型。 它本来就定位在 Astra 下面一档,比不过 Astra 很正常,但也确实没什么亮点。就今天测的这几个任务来看,我感觉它跟国产模型差不多是同一档(仅个人体验,叠甲)。 看到这里你应该也有自己的选择了,追求效果、预算又充足,就上 Claude Opus 5.5。图的是性价比,可以使用 GPT-6 Sol,搭配 Codex 的体验还是不错的。 最后再送大家一段由 Claude Opus 5.5 自主生成的 3D 网页动画《牛来骑车》,这一段大作花了我几十块钱,能三连回回血么? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/qpDfbwl5IekmDzdM.jpg) 我之前一直觉得,AI 的编程能力已经进化到不需要再进化的程度了。但每一次新的模型发布,都能刷新我对 AI 能力的认知上限,我喜欢这种感觉。 **就是希望再慢一点吧,起码中秋假期不要再 TM 发新模型了啊啊啊啊啊啊!!!** OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide) ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/UMmQC6P80urF0t1t.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注。 这俩模型可以说是新时代模型的两个门派代表了,一边是能力超强但价格贵,一边是能力全面、性价比高,你会更支持哪家呢? 评论区聊聊吧~

全网刷屏的 Jev 模型正式开放!一手实战测评 + 保姆级教程

大家好,我是程序员鱼皮。 过去几年,不管是 ChatGPT、Claude 还是 DeepSeek,AI 大模型的目标一直都是「跟人聊天」和「帮人干活」。 但最近有个模型突然火了,它有点儿特别,**不说人话、不能跟人聊天**。 它叫 Jev,由前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 发布,这哥们是 ChatGPT 的共同发明人之一! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/wXCF25HtCYTuy9jq.jpg) 我刚看到的反应是:一个不说人话的 AI,能有什么用?又是噱头吧? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/e5FR6nrbFJKoedTr.jpg) **了解之后发现,还真有点东西!** 这篇文章我就从零开始,带大家搞懂 Jev 到底是什么、怎么用、到底好不好用。没有任何技术基础的小白也能看懂,看完还能直接上手体验。 ## 一、Jev 入门介绍 ### Jev 是什么? 传统的大模型主要是跟人对话的,你问它一个问题,它回你一段话。 但这就带来一个问题,比如你想让它帮你判断一下「这封邮件紧急吗」,它不会直接告诉你「是」或者「否」,而是先给你写一大段分析,然后才给出结论。不仅速度慢、烧 Tokens,还需要你自己从回答里把答案抠出来。 Jev 就完全不一样了。你问它「这封邮件紧急吗」,它就直接告诉你「是,概率 95%」。 模型返回的是一段结构化的 JSON 数据,你的程序可以直接拿来用: ```json { "is_urgent": { "noul": 0.95 } } ``` 可以说,没有任何 AI 比它更直接、更不绕弯子。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/7e1o6sCkLtzJLmds.jpg) TypeSafe AI 管这种模型叫 **System One Model(系统一模型)**,灵感来自诺贝尔奖得主 Daniel Kahneman 的《思考,快与慢》。系统一是人类大脑里负责快速直觉判断的部分,比如你一眼就能看出「这个人在生气」;系统二是负责深度推理的,比如「算一下 17 × 24」。 传统 LLM 更像系统二,Jev 就是系统一。 根据 TypeSafe 官方自测的数据,两者的差距还挺夸张的: | | 传统 LLM(如 GPT-5.6) | Jev | |---|---|---| | 输出方式 | 生成文字,需要解析 | 直接返回结构化决策结果 | | 响应速度 | 3 - 329 秒 | 70 - 500 毫秒 | | 输入价格 | $0.20 - $10 / 百万 token | $0.042 / 百万 token | | 输出价格 | 约输入价的 5 倍 | 免费 | | 结构化输出错误率 | 0.58% - 45.5% | 0%(数学保证) | 响应速度最高快了将近 200 倍,输入价格便宜了几十倍到上百倍,输出还不要钱,而且结构化输出零错误。这也太香了吧! 那 Jev 到底是怎么用的?为什么能这么快?下面一个一个来讲。 ### Jev 能回答什么类型的问题? Jev 的调用方式非常简单,你给它两样东西,一个是 **state 状态**,就是你想让它分析的上下文信息;另一个是 **questions 问题**,就是你想让它回答的问题。然后它就直接返回结构化的答案。 Jev 支持回答 3 种类型的问题,TypeSafe 官方把它们叫做「AI 原语」。 #### 1、Noul 是或否 简单来说,就是让 AI 做判断题,问一个「是不是」的问题,返回 0 到 1 之间的概率值。 比如你收到一封客户邮件,想判断是否紧急,就把邮件内容作为 state 传给 Jev,再加上一个 Noul 类型的问题: ```json { "state": "我连续 3 天无法连接 Stripe 账户,正在丢失销售额,请尽快处理!", "questions": { "is_urgent": { "type": "noul", "instructions": "这条消息是否传达了紧急性或时效性" } } } ``` Jev 返回的结果长这样: ```json { "is_urgent": { "type": "noul", "noul": 0.95 } } ``` 0.95 意味着有 95% 的把握认为这条消息是紧急的。你在代码里直接 `if noul > 0.8` 就可以触发告警了。 #### 2、Choice 多选一 这个就像让 AI 做选择题,从你预设的选项里选一个,并告诉你每个选项的概率分布。 比如判断一个工单该分给哪个部门,你可以把部门选项列在 criteria 里让 Jev 来选: ```json { "questions": { "department": { "type": "choice", "instructions": "这个工单应该分配给哪个团队处理", "criteria": { "billing": "付款、发票、退款相关问题", "technical": "Bug、系统故障、集成问题", "sales": "定价、账户咨询" } } } } ``` 返回: ```json { "department": { "type": "choice", "choice": "billing", "confidence": 0.8, "probabilities": { "billing": 0.87, "sales": 0, "technical": 0.13 } } } ``` 不光告诉你选了 billing,还把每个选项的概率都算出来了。目前 Choice 最多支持 255 个选项。 #### 3、Score 评分 这个就像让 AI 做打分题,在你自定义的量表上打分,分数可以落在两个等级之间。 比如判断无法登录的客户有多沮丧,你可以定义从「冷静」到「愤怒」的几个等级,让 Jev 来打分: ```json { "questions": { "frustration": { "type": "score", "instructions": "客户看起来有多沮丧", "criteria": [ "冷静,只是在陈述事实", "不满但还算礼貌", "非常愤怒,言辞激烈" ] } } } ``` 返回: ```json { "frustration": { "type": "score", "score": 1.04, "confidence": 0.94, "probabilities": { "0": 0, "1": 0.96, "2": 0.04 } } } ``` Score 1.04 表示介于第 1 级(不满但礼貌)和第 2 级(非常愤怒)之间,偏向不满。这里我定义了 3 个等级,实际使用时你可以根据需要定义 2 到 10 个等级,等级越多,评分的粒度就越细。 ### Jev 有什么特别的? 看到这里,可能有接触过 AI 应用开发的朋友会想:我之前在提示词里引导 AI 输出 JSON,或者用大模型自带的结构化输出功能,也能让 AI 返回固定格式的结果啊…… Jev 跟它们有什么区别? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/rAQaXYc9CF2LOXdi.jpg) 你别说,区别还真挺大的! 首先,传统 LLM 做结构化输出,底层还是一个 token 一个 token 地「写字」,写完再校验格式。就好比让一个作文高手去做选择题,他还是会先在脑子里打一遍草稿,然后再从里面挑答案,自然就慢。而且写着写着格式就可能出错。 Jev 的做法完全不一样,它用的是 **并行采样**,不像传统 LLM 那样逐字生成文本,而是直接在预定义好的选项上输出概率分布。也就是说,前面提到的 3 种问题可以在一次请求里同时问,问 1 个和问 10 个问题的响应时间几乎没差别。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/LHxiUE2vjHSdwTxU.jpg) 此外,Jev 的训练方式也跟传统模型不同。传统 LLM 用 RLHF 人类反馈强化学习,优化目标是让回答读起来通顺,让人类满意;推理模型用 RLVR 可验证奖励强化学习,优化目标是让那些有标准答案的问题做对,比如数学证明能不能验证通过、生成的代码能不能编译运行。 而 Jev 用的是 TypeSafe 自研的 **RLCD 校准决策强化学习**,优化目标是让模型「说到做到」,如果 AI 说有 90% 的把握,那在大量预测中这类判断确实有约 90% 是对的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/gf6o89lRHwNcMX3u.jpg) 理解了这些原理,前面表格里那些夸张的数据就好解释了。 Jev 不用一个字一个字地写回答,直接并行输出所有概率分布,所以速度能快上百倍。 它也不需要生成任何输出文字,成本自然就低了。 而且输出结构在数学上就是确定的,所以结构化错误率是 0%。 更重要的是,因为 Jev 的概率是校准过的,你的程序可以直接拿这个概率来做自动化决策,比如概率高于 0.8 就让 AI 自动处理,低于 0.5 就转人工。 ### Jev 能用来干嘛? 虽然 Jev 不能聊天,但是它的适用场景还真不少,这也是它能火起来的原因之一。 TypeSafe 官方建议把 Jev 当成一个「智能的 if 语句」,所有需要做判断和决策的场景,都可以用 Jev。 我看了网上大家的玩法,总结了几个比较典型的场景。 1)工单和消息分类 比如客服系统收到用户消息,一次性判断该分给哪个部门、是否紧急、情绪如何。社区里有人拿 Jev 给 1018 篇论文做分类,分类部分只花了 0.08 刀。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/1lYxRBDungHoXTns.jpg) 2)AI Agent 的决策中间层 比如 Codex 等 Harness 里的 Agent 每一步都要做判断,可以让 Jev 先快速决定该调哪个工具、这个操作有没有风险,只有需要写代码的时候才让传统的 LLM 上。 有人用这个思路做了 [浏览器自动化 Agent](https://github.com/browser-use/jev-ultrafast),7.1 秒就在 Google Flights 上搜索完一次航班,成本只有 0.0039 刀。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/zt8q3CR1Br9O5Vyo.jpg) 3)内容审核和风控:比如一次性判断这条评论是否违规、属于哪种违规类型、风险等级多高,每条消息的判断成本不到 0.001 刀。 4)给 LLM 输出做质检 比如 LLM 生成了一段回答,用 Jev 快速检查有没有跑题、质量打几分,用便宜的 AI 检查贵的 AI。社区里有人做了一个[多阶段代码审查工具](https://github.com/devagrawal09/jev-review),用 Jev 先做风险评估再逐文件打分。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/CXE2cRQVlBykM8YI.jpg) 5)实时游戏决策 有人用 Jev 玩地铁跑酷游戏,操作速度超过人类;有人用 Jev 控制超级马里奥,甚至还有人打通了《星际争霸》第一关! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/UdWED85lA2EaHRsE.jpg) 这类对响应速度要求极高的场景,以前用传统的 LLM 根本不可能做到。 之后,**需要生成文字的场景用传统 LLM,需要快速做判断的场景用 Jev**,两者互补,可以让任务完成速度又快又准。 ## 二、Jev 实战体验 了解了 Jev 是什么之后,接下来看看怎么实际用上它。 ### 怎么使用 Jev? Jev 现在已经正式开放注册了,直接用邮箱在 [TypeSafe 官网](https://typesafe.ai/) 注册登录就行。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/DTWh9kur7u3HL2np.jpg) 注册之后,最简单的使用方式就是直接在官方 Playground 里体验,也可以通过 API 和 SDK 接入到自己的项目里。另外也可以通过 Vercel、Cloudflare 这些第三方平台来调用 Jev。 #### 方式一、官方 Playground 最简单的使用方式就是打开 [官方的在线 Playground](https://console.typesafe.ai/playground),左边填写提供给 AI 的上下文和想让 AI 分析的问题,点击运行就能在右侧看到结果。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/BCnPnon8VxNA0DYx.jpg) #### 方式二、调用官方 API 和 SDK 登录之后,可以到 [TypeSafe 的控制台](https://console.typesafe.ai/keys) 中创建 API Key。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/3NL23dZ3L8Xivigr.jpg) TypeSafe 提供了 Python SDK 和 JavaScript SDK,方便开发者在自己的项目里直接调用 Jev,也可以通过 HTTP API 调用。[官方文档的 Quick Start 页面](https://docs.typesafe.ai/introduction/quickstart) 有完整的示例代码。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/rtuUc7hK7lKNzba0.jpg) 以 Python 为例,安装 SDK 之后几行代码就能跑: ```python # pip install typesafe-sdk from typesafe_sdk import Choice, Noul, Score, TypeSafeClient client = TypeSafeClient() # 自动读取环境变量 TYPESAFE_API_KEY response = client.system_one( state="客户说:我被重复扣款了,订单号 A-104,请退款。", questions={ "department": Choice( instructions="这个工单应该分配给哪个团队处理", criteria={ "billing": "付款、发票、退款相关", "technical": "Bug、系统故障、集成问题", "sales": "定价、账户咨询", }, ), "is_urgent": Noul( instructions="这条消息是否传达了紧急性或时效性", ), }, ) print(response.answers["department"].choice) # "billing" print(response.answers["is_urgent"].noul) # 0.95 ``` 当然,现在用 AI 编程,这些代码都不用自己写,后面会讲到怎么让 AI 工具直接帮你调用 Jev。 #### 方式三、通过第三方平台调用 除了 TypeSafe 官方的 API,Vercel AI Gateway 和 Cloudflare Workers AI 这些第三方平台也已经支持了 Jev,可以直接在这些平台上调用。 以 Vercel 为例,它的 AI SDK 专门新增了一个 `experimental_evaluate` 接口来对接 Jev 这类决策模型,详细教程可以查看 [Vercel 官方文档](https://vercel.com/kb/guide/typesafe-jev-and-ai-sdk)。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/gSs8CPAfEvQGrFnz.jpg) 我这里还用 AI 接入 Vercel AI Gateway 做了一个 **中文版的 Jev 调试广场**,可以直接在网页上体验 Jev 的三种回复方式。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/p2bftHfifWM1KdtG.jpg) 点击「运行」之后,就能直接看到 Jev 返回的决策结果和原始 JSON 数据。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/icS7DftIpWvuWXqm.jpg) ### 接入 AI 工具 上面几种方式都需要你自己写代码调用 Jev,那有没有更简单的方式呢? 其实日常大家还是用 GPT、Claude、DeepSeek 这些大模型,Jev 更适合作为一个扩展能力来搭配使用。 TypeSafe 官方提供了一个通用的 Skills 技能包,简单理解就是一份配置文件,告诉 AI 编程工具 Jev 是什么、怎么调用、参数怎么传,这样 AI 工具就知道怎么帮你调用 Jev 了。只要安装了 Skills 技能包,所有主流的 AI 编程工具都能用。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/TtRg3HrniVQArLv7.jpg) 安装方法非常简单,官方提供了一段 [现成的提示词](https://docs.typesafe.ai/introduction/quickstart),可以让 AI 帮你把技能安装到你用的 AI 工具里。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Q1t8uKIvTR8KgxOq.jpg) 不过官方的提示词默认只在当前项目下安装。我把提示词翻译成中文并改为了全局安装的版本,这样所有项目都能用: ``` 全局安装 TypeSafe 技能。如果你是 Codex(Claude Code),请执行 `claude plugin marketplace add typesafe-ai/skills`,然后执行 `claude plugin install typesafe@typesafe-ai`。如果你是其他 Agent,请执行 `npx skills add typesafe-ai/skills --skill typesafe-ai -g` 并选择你的 Agent。只需使用一种安装方式即可。技能文件可以在这里查看:https://github.com/typesafe-ai/skills/blob/main/skills/typesafe-ai/SKILL.md ``` 比如我在 Codex 中执行这段提示词。它的原理就是根据你用的 AI 工具,执行对应的命令把技能文件从 GitHub 仓库拉取下来。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/HqJgzg87sOS2RE1q.jpg) 安装完成之后,还需要在环境变量里配置好 TypeSafe 的 API Key,AI 工具才能帮你调用 Jev。 直接让 AI 帮你配置就好: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/jUldyPwnAXQTDdRc.jpg) 配好之后,你就可以在 AI 编程工具里直接使用斜杠命令 `/typesafe-ai` 来触发技能,AI 会自动帮你调用 Jev 来完成判断和决策。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/r00iBMBmmGu6H1OB.jpg) 你也可以在对话中直接告诉 AI「用 Jev 来帮我做判断」,AI 同样会自动加载 TypeSafe 技能并调用 Jev 的接口: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/kr43Q3dQ0GJ7dHuf.jpg) ### Jev API 实战测评 学会了怎么使用 Jev 之后,咱们来通过实际的测试来看看 Jev 的表现到底怎么样。 我分别用 Jev 和 DeepSeek V4.1 Flash 来完成同一个任务,对比两者的速度、价格和准确度。 #### 1、用 Jev 实时玩数字华容道 数字华容道是一个经典的滑块拼图游戏,4 × 4 的棋盘上有 15 个数字方块和 1 个空位,目标是把所有数字按顺序排列好。 每一步 Jev 需要判断「空位应该往哪个方向移动」,这对决策能力的要求很高。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/3BtaWuAsPuAdQr9l.jpg) 开始测试,左边是 Jev,右边是 DeepSeek V4.1 Flash,两边同时开始,实时展示每一步的决策时间、累计消耗的 token 数和价格。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/PMTfb5Ojd8h7QVpI.jpg) 最终,Jev 在完成速度上遥遥领先 DeepSeek V4.1 Flash,而且输入 token 和累计价格也更低。 #### 2、用 Jev 批量分类 1000 封邮件 第二个测试更贴近实际业务场景。假设你公司的邮箱每天会收到大量邮件,需要快速判断每封邮件的优先级、紧急程度和该转给哪个部门处理,这个任务就可以交给 AI。 我模拟了 1000 封不同内容的邮件,让 Jev 和 DeepSeek V4.1 Flash 分别对每封邮件做优先级分类、紧急程度判断和部门路由,两边拿到的邮件列表完全一样。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/fqH313ahaC1VEhdD.jpg) 最终结果,Jev 用了 15.6 秒处理完 1000 封邮件,平均每秒处理 64 封,累计花费 0.0177 刀;而 DeepSeek V4.1 Flash 用了 48.9 秒,平均每秒 20 封,累计花费 0.0207 刀。Jev 在速度上快了接近 2 倍,价格也略低一些。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Fnu0mfS459sagUs5.jpg) ### AI 工具 + Jev 实战测评 除了直接调用 API,我还试了一下把 Jev 接入 AI 工具之后的使用效果。 这次我用的是 Codex 工具 + GPT 模型,装好 TypeSafe 技能之后直接让 AI 干活。 #### 1、用 Jev 玩连连看 连连看大家都玩过吧? 这次我用 Jev 来玩连连看,可以测试它在实时决策场景下的反应速度和判断准确度,游戏逻辑用代码处理,每一步选哪对方块消除的决策交给 Jev。 在 Codex 中使用 `/typesafe-ai` 技能,然后跟它说: ```markdown /typesafe-ai 帮我用 Jev 模型玩连连看游戏 ``` Codex 加载了 TypeSafe 技能之后,会自动分析页面结构,识别出方块的位置和图案,然后调用 Jev 来做每一步「选哪对方块消除」的决策,最后操作页面完成消除。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Hc9BT3pV9AKON2Yx.jpg) 虽然 AI 顺利通关了游戏,但是我觉得执行速度没有达到预期。快的时候可以 2 秒消除 1 个,但经常消除几个之后会卡一会儿,总共花了 5 分钟左右才完成了整局游戏的消除。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/eFTgHttc0Zi4H9SJ.jpg) 虽然 Jev 的决策速度确实很快,但问题出在「看」这个环节。Jev 只能处理文本和 JSON 数据,没办法直接「看到」网页上方块的位置和图案。这次测试我用的是本地的连连看网页版,Codex 可以直接解析到原始的 HTML 和 DOM 结构,所以还能跑起来。但如果你让它去玩那些用 Canvas 渲染的网页游戏,如果 DOM 里获取不到足够的信息,效果会更差。 其实社区里那些用 Jev 玩游戏的博主,思路基本都是一样的,就是先用代码把游戏画面转成结构化的数据(比如读取游戏内存),然后再把数据喂给 Jev 做判断,而不是让 Jev 直接看截图。 #### 2、用 Jev 给开源教程文章打标签 前面的连连看游戏主要考察的是 Jev 的实时决策速度,这次换个方向,考察一下 Jev 对文本内容的分类和打分能力。 我让 Codex 用 Jev 模型给自己 [《AI 编程教程》](https://github.com/liyupi/ai-guide) 中的每篇文章自动打标签,包括判断文章属于什么主题、适合什么水平的读者、难度打几分。 提示词如下: ```markdown /typesafe-ai 读取 ai-guide 仓库里的文章列表,用 Jev 给每篇文章打标签。 1. 主题分类(AI 基础/提示词工程/AI 编程实战/工具推荐/行业趋势) 2. 适合的读者水平(零基础/有编程基础/有 AI 经验) 3. 内容难度打分(入门/进阶/高级) 不改动原始文章,只是最后输出一份报告。 ``` ![](https://pic.code-nav.cn/post_picture/1601072287388278786/37fph7MIV8Rnzx1Y.jpg) Codex 会先盘点文章范围、数量和篇幅,再按上下文限制设计可靠的批处理,批量调用 Jev 模型来判断文章的标签。 最终只用了几分钟,就完成了 697 篇长文章的标签分类!这个速度真的非常快了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/pSOWbv1iPaoCpVNT.jpg) 这类批量分类打标签的场景特别适合 Jev,因为每篇文章的判断逻辑是一样的,只是输入内容不同,可以批量并行处理。而且分类结果是结构化的,拿到之后可以直接用来生成目录、做筛选功能。 ## 三、Jev 使用感受 最后说说我使用 Jev 的感受。 如果把 Jev 作为决策模型直接接入到自己的应用里(比如客服分类、内容审核、数据打标签),体验是非常好的,速度快、价格低、结果准确。做了上面这么多任务,总共也才花了不到 2 块钱。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Axzw4v0s5yVnCao7.jpg) 但如果是通过 AI 工具来间接使用 Jev,目前的体验还有不少提升空间,主要瓶颈在于 AI 工具对网页内容的感知能力还不够强,很多场景下没办法给 Jev 提供足够准确的输入数据。 而且 Jev 的能力有明确的边界,不能生成文字、不能做算术推理、日期比较也不靠谱。 如果你在做 AI 应用开发,想要把分类、路由、审核这类判断逻辑的成本和延迟降下来,Jev 是值得一试的。一定要确保你能给 Jev 提供足够准确的结构化输入数据,它判断得准不准,取决于你喂给它的信息质量。 我个人比较看好 Jev 在 AI Agent 决策层的应用。现在 Agent 每一步操作都要调一次大模型来判断,如果把这类快速判断交给 Jev,整体效率应该会有一个质的提升。 OK 就分享到这儿,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/U0Wa1k0ZCXfiAOKm.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 也欢迎在评论区聊聊:你有用过 Jev 模型么?你看好它的发展么?

我跟 AI 说自己「有多动症」,竟然能节省 Tokens?!

大家好,我是程序员鱼皮。 最近 GitHub 上有个项目涨势非常猛,短短一周涨了 1 万多个 Star,成功引起了我的注意。 项目的名字很有意思,叫 `i-have-adhd`,翻译过来就是「我有多动症」。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/CQHu4XZV8I8KZKXX.jpg) 这是一个给 AI 工具安装的 Skill 技能,作用是让 AI 不再长篇大论地废话,每次回答都直奔主题,先给出你该执行的下一步操作,多步骤任务用编号列清楚。 之所以叫 ADHD,是因为 ADHD 人群的工作记忆比较有限,面对大段文字很容易走神,这种「先说结论、直给行动」的输出方式对他们来说更友好。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/jrzZD8lbJTXNWsvA.jpg) 虽然名字叫 ADHD,但并不是只有 ADHD 人群才能用。任何希望 AI 回答更简洁高效的人,都可以试试。而且理论上因为输出变简洁了,每次对话消耗的 tokens 也会相应减少,长期用下来能省不少钱。 那这个技能到底效果怎么样?真的能省钱么?能省多少?会不会因为输出太精简,反而影响了任务的完成质量? 下面我分别用 Cursor 和 ZCode 做了实测,带大家看看到底能省多少。 ## 怎么安装? 安装方式非常简单,直接让 AI 帮你装。 随便打开一个支持加载技能的 AI 工具,把下面这段提示词复制粘贴到对话框中,发给 AI 就行: ``` Install the i-have-adhd skill/plugin from https://github.com/ayghri/i-have-adhd, refer to the repo's AGENTS.md for instructions. ``` 比如我在 Cursor 里执行这段提示词: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/BZL4i3NPeehRqfUc.jpg) AI 会自动去读取 GitHub 仓库的安装说明,然后帮你完成安装。 安装完成后,技能文件会存放在电脑的 `~/.agents/skills` 目录下,这个路径是主流 AI 工具都能扫描到的通用技能目录: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/x66WhcZsnLfRaE0H.jpg) 之后在对话时输入斜杠命令 `/i-have-adhd` 就可以激活这个技能了: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/fkjZyUAtAvu5i5kU.jpg) Skill 装好了,接下来就该验证效果了。 ## 实测对比 我设计了两类测试任务,一类是日常技术问答,看看回答知识类问题时能省多少;另一类是从零开发一个复杂的 3D 互动页面,看看写代码的场景下 Skill 的效果和质量会怎样。 ### 1、日常技术问答 我先用 Cursor + Claude Opus 5 这个顶级模型的组合来测试,问了一个 AI 领域大家都听说过的概念: ``` 请深入讲解 AI 领域的 Harness Engineering 是什么?包括它的核心概念、和传统 Prompt Engineering 的区别、实际应用场景,以及目前主流的最佳实践。 ``` 看看下面这张图的测试结果,左边没有开启 ADHD 技能,右边开启了。可以看到对话消耗的 tokens 从 48.7K 直接降到了 27.5K,**减少了将近一半**! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/s5mEa5pOX5SO1Gc4.jpg) 再看看回答的内容风格。左边没开 ADHD 技能的时候,AI 先是搜了一圈资料,然后洋洋洒洒地分了好几个章节来展开讲,篇幅很长。 右边开了技能之后,AI 的回答明显更直接,上来就给出核心定义,然后用编号列出可执行的最佳实践,按落地成本从低到高排序,用户读完立刻就知道该干什么。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/zgzJiCHOcI3NhfW0.jpg) 有点像你跟 AI 说「别绕弯子,直接告诉我怎么做」,效果确实不错。 按 Claude Opus 5 的输出价格来算,单次对话大概能省几毛到一块钱,如果你每天跟 AI 聊几十上百轮,累积下来就是一笔可观的开支了。 这么看来,日常问答使用这个技能是可以省钱的。但 AI 编程的核心场景是写代码,如果是更复杂的开发任务,效果又会怎么样呢?质量会不会打折扣? ### 2、开发 3D 互动页面 这次我让 AI 从零开发一个《清明上河图》的 3D 互动展示页面: ``` 帮我开发一个完整的清明上河图 3D 互动展示页面。要求:页面加载后呈现一幅可以横向浏览的长卷画面,具有 3D 景深效果,让用户仿佛身临其境地走进画中世界。用户可以通过鼠标拖拽或滚轮左右浏览,鼠标悬停到画中的建筑或人物区域时,会出现高亮效果和简介弹窗。请直接给出完整的可运行代码。 ``` 先看 Cursor + Claude Opus 5 的对比。下图的左边没开技能,工作了 37 分钟,总共消耗了约 242.8K tokens;右边开了 ADHD 技能后,只用了不到 14 分钟,tokens 降到了 178.9K。 **时间快了将近两倍,tokens 省了 26%**。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/rPg681ExRClMAhSw.jpg) 不过光看数据还不够,得看实际效果。先看没开 ADHD 技能的版本,整体的古画意境还不错,有虹桥、有行人、有河面,悬停弹窗也做了出来: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/NiMtW8TDbCQOqvtv.webp) 再看开了 ADHD 技能的版本。整体布局和交互也都实现了,不过从细节上来看,我觉得还是没开技能的时候更好一些。 比如你仔细看,右侧有些人物直接站在了水面上,而且人物配色花花绿绿的,有点破坏整体的水墨意境(我瞎说的): ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Y7dSqzP8qFbqXcJd.jpg) 不过说实话,两个版本的效果都只能算一般…… 毕竟这提示词是我瞎七八写的。 刚才用的是顶级模型,模型能力越强,越容易把简单的事情搞复杂。接下来换一个更轻量的工具 ZCode + GLM Flash 模型来看看效果。 下面是 ZCode 的对比图,左边无 ADHD 用了约 15.2 万 tokens、36 分钟,右边有 ADHD 用了约 14 万 tokens、34 分钟。GLM Flash 本身就比较精简,所以开不开技能的差距没那么大: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/l0Lenin07t8lWGgj.jpg) 再对比下成品效果,先看看没开技能的成品,桥面和河船都渲染出来了,整体还行,但背景比较单调: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/dpUi5up8aKanF8hb.jpg) 再看开了 ADHD 技能的效果,差别就比较明显了。桥面和行人倒是有了,但你注意看画面底部,怎么还出现了几个巨人?这一看就知道是渲染层级出了问题: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/kFUIHl1bzf2h9R5u.jpg) 综合来看,ADHD 技能确实能有效减少 AI 的输出量、节省 tokens 和响应时间,在日常问答和简单任务上效果很明显。但在复杂的开发任务中,它有可能因为过度压缩输出而影响代码质量。所以我的建议是,日常问答和代码片段类的场景可以开启这个技能,遇到需要 AI 仔细思考的复杂项目时,就不要用它了。 ## 这个技能是怎么实现的? 看完测评效果,你可能会好奇这个技能到底做了什么? 其实原理非常简单! 整个技能的核心就是一份 [提示词文件 SKILL.md](https://github.com/ayghri/i-have-adhd/blob/main/skills/i-have-adhd/SKILL.md),里面定义了 10 条输出规则,AI 在回答时会遵循这些规则来调整自己的表达方式。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/GatSIf1iaHgn9Bqf.jpg) 这 10 条规则可以简单总结为: 1. 先说下一步行动,不铺垫背景,直接告诉用户该做什么。 2. 多步骤任务用编号,每一步只做一件事。 3. 以一个具体的下一步收尾,而不是「有问题随时问我」这种空话。 4. 抑制离题内容,有其他问题就单独提出,不要在当前回答里夹带。 5. 每轮对话重述当前状态,比如「第 3 步完成,共 5 步」,帮用户保持进度感知。 6. 给出具体的时间估计,用分钟来衡量,不说「一会儿」这种模糊表达。 7. 让完成的工作看得见,明确说出「登录功能已经可以用了」,不说「做了一些调整」。 8. 就事论事地报告错误,直接说原因和修复方法,不用「哎呀出问题了」的语气。 9. 每个列表最多展示 5 项,信息太多时先分组,优先展示最相关的。 10. 不写开场白、回顾和结束语,禁止套话。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/0f6HiSjVM7PDpp7x.jpg) ADHD 人群的核心困难在于工作记忆容量有限、启动行动的门槛高、对时间的感知比较模糊,这套规则刚好针对这些痛点逐一给出了应对方案。而对非 ADHD 用户来说,这些规则同样有效,毕竟没有人喜欢 AI 在回答里夹带一堆废话。 ## 最后哔哔 这个项目最让我有感触的一点,是作者把一个特定人群在阅读和执行上的真实困难,转化成了一份所有人都能受益的技术方案。好的产品往往就是这样,从关注少数人的真实需求出发,最终让更多人受益。 如果你也天天在用 AI 编程工具,不妨装上试试,也许你会发现 AI 的回答早就该这么简洁了。 OK 就分享到这里,这篇文章我也会收录到我的开源教程 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe) 中。上千张图、几十万字,从 0 开始带你学会 AI 编程,做出自己的产品、跑通变现全流程,感兴趣的同学可以看看。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide) ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/9dwZUXvGcwu3xWS5.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~

我做了个网站,随时掌控 500 个 AI 模型的动态!

大家好,我是程序员鱼皮。 - 什么?又有新模型发布了? - 现在最好的文本模型是哪个? - DeepSeek 有多模态模型了么? - 国外模型是不是真的把国内开源模型远远甩在了后面? AI 模型发展得太快了,你有没有这样一种感觉,仿佛天天瘫坐在原子弹上看椅子爆炸。 一段时间不关注 AI,就会开始迷茫,觉得自己好像和时代掉队了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/3Fbl5cwVuaVacF2q.jpg) 那有没有一个工具,能让我随时随地,从上帝视角快速全面地了解地球上 **所有 AI 模型** 的现状和发展过程呢? **很抱歉,没有。** 不过没关系,作为一名 AI 编程博主,我掏出我的豆包(bushi ![](https://pic.code-nav.cn/post_picture/1601072287388278786/7ZVVhdEiERlTfbw1.jpg) 掏出顶级模型,运用我从自己 [《AI 编程教程》](https://ai.codefather.cn/vibe) 里学到的高超 AI 编程技巧,输入一段看起来很牛批、实际上非常无脑的提示词,然后等着 AI 疯狂输出三天三夜。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/3RVoU3KelURx8KgP.jpg) 我的「AI 大模型世界」网站就这么诞生了! 指路:https://bilibili.com/toy/ai-model-world 本文视频版:https://bilibili.com/video/BV1eCe36GELv ## 1、进门先看今日格局 进入这个世界,你能最直接不绕弯子地看到当下最聪明、最会编程、性价比最高、最新发布的 AI 模型分别是谁。 ![今日格局](https://pic.code-nav.cn/post_picture/1601072287388278786/I6wcfHqlOftY3Qrs.jpg) 每块牌子底下都写清楚了凭什么。比如最聪明那位 GPT-6 Astra,综合智力指数 166,是 206 个受测模型里的第一名;最划算的 DeepSeek V4 Flash 0731 智力全球第 31,价格却远低于同级。 顺便说一句,这些分数没有一个是我自己拍脑袋定的,全都来自 Epoch AI、LiveBench 这些第三方公开评测,网站只负责把它们抓回来、对齐、排好队。 ## 2、分类查看模型 往下滚动网页,能看到按类型划分的模型。 ![按类型看](https://pic.code-nav.cn/post_picture/1601072287388278786/V8shxQOSJZ44nuQr.jpg) 文本模型 226 个、视觉模型 239 个、全模态 44 个,图像生成、视频生成、语音模型也都单独成组。点进任何一类,就能看到这一类里目前排名最靠前的模型。 ## 3、国内外有哪些模型 再往下,世界被分成了国外和国内两个区域,国外有 27 家模型厂商。每个模型都是这个世界里的一个像素小人。名字下面那四根能力条分别是聪明、编程、记性和便宜,条越长越强,右边还标了它在全球的排名。 ![国外分区](https://pic.code-nav.cn/post_picture/1601072287388278786/m96uwzJJgT4fGJo2.jpg) 国内有 13 家模型厂商: ![国内分区](https://pic.code-nav.cn/post_picture/1601072287388278786/SJQowQq1GuaMDAVI.jpg) 小人的长相也全是数据算出来的。体型对应模型规模,参数量越大块头越壮;身上的装饰越华丽,说明它的调用价格越贵;家里的书架越高,它能读的上下文就越长;右边那台电脑代表编程能力,没有公开编程成绩的模型,电脑上直接盖着一块防尘布。 ## 4、模型搜索 先问问看,大家现在最喜欢的是哪个模型呢? 我个人非常喜欢鲸鱼(娘),所以想把它家的模型一次性看个够。不用翻页找,直接在顶部搜索框里敲几个字母就行。 ![搜索深度求索](https://pic.code-nav.cn/post_picture/1601072287388278786/FoKK1L8IT9DPIkEq.jpg) 搜索功能非常灵活,支持按照模型名、厂商名,还有模型能力搜索。比如你输入「多模态」,它会把所有多模态模型列出来;输入「deepseek」,第一条就是深度求索这家厂商,底下跟着它的 24 个模型。 点进厂商页,DeepSeek 的进化过程就按时间线铺开了。 ![DeepSeek 厂商页](https://pic.code-nav.cn/post_picture/1601072287388278786/HZe8NkF8on0lv3G2.jpg) 一路往下翻,能看到它每个月都发布了什么。翻到最底下,2025 年 1 月那一排里躺着当初全网爆火的 DeepSeek-R1。 ![R1 时期](https://pic.code-nav.cn/post_picture/1601072287388278786/slmotwElVVBItYaY.jpg) 到现在已经过去一年零八个月了。爷青回啊…… ## 5、查看单个模型的一生 点开最新的 DeepSeek V4.1 Flash,先看到的是它的身份卡。 ![模型详情页](https://pic.code-nav.cn/post_picture/1601072287388278786/M94s5EKijkYBfYA3.jpg) 这是一个视觉模型,中等价位、能读长文、会看图,而且开放权重。上面那条小时间线告诉你它是从 V4 Flash Vision Exp 这个视觉实验模型进化过来的,属于同一个系列的第二代。 右边的能力条里,记性那一项是满的,上下文窗口 100 万 tokens。网站还给了个换算,说这个长度一次能读完《哈利·波特》全七部,比干看一个数字有感觉多了。 继续往下,能看到 AI 的身世和战绩: ![身世与战绩](https://pic.code-nav.cn/post_picture/1601072287388278786/2J9df3vafTX2MXaV.jpg) 发布日期、知识截止、开源许可、输入输出价格都列在左边,右边是各项专业测试的评分。V4.1 Flash 刚发布不久,几个学术榜单还没收录它,所以这里老老实实写着「未参评」。 这一点我专门跟 AI 强调过,没有成绩就写没参评,绝对不许用估算值把空缺填上。一个模型没被测过,不代表它不行。 页面最底下,还能刷到各位 UP 主对这个模型的评测视频。 > 对了,下图第一个评测视频的博主是狗 🐶 ![B 站评测视频](https://pic.code-nav.cn/post_picture/1601072287388278786/qkughAxvoBwne8ze.jpg) 这些视频是用 B 站公开的搜索接口抓回来的,搜索词就是模型名加上「测评」两个字,抓到的结果按播放量排好序存进仓库,页面直接读,我完全不用手动挑选视频。 至于第一条为什么是我自己的视频,因为站长的视频会置顶,算是我给自己开的一个小后门,很合理吧? ## 6、几百个模型的发布史,一条时间线看完 看完 DeepSeek,别的模型又是怎么一步步发展过来的呢? 切换到「时间线」,全世界 556 个主流 AI 模型,按发布月份从新到旧都排好了! > 彩色名字表示这个模型有第三方综合评测成绩 ![时间线](https://pic.code-nav.cn/post_picture/1601072287388278786/NBD16DoaSjr9zait.jpg) 光是 2026 年 8 月这一个月,就有 33 个模型发布,密密麻麻铺满了大半屏,太卷了! 一路往下翻,最早的记录停在 2023 年 3 月。也就是说,从 AI 全面爆火到现在,满打满算才三年半,AI 的进步真的是太快了。 ## 7、模型排行榜 如果你好奇现在哪些模型能力最强,哪些模型性价比最高、适合日常办公,那就去看排行榜。 ![排行榜](https://pic.code-nav.cn/post_picture/1601072287388278786/XU8FMDIdp3xYHMWH.jpg) 这里一共有 81 个榜单,综合智力、性价比、上下文窗口、最便宜,还有 SWE-bench、Terminal-Bench 这些专门测编程能力的。 榜单上方可以按地区、开源闭源、模型类型来筛选,非常灵活~ ![开源赛道排名](https://pic.code-nav.cn/post_picture/1601072287388278786/p5Qzr0u21hOiK9Ik.jpg) 开源赛道的冠军是国内的 Kimi K3,综合智力 157.6,放到全球总榜上排第 11,已经很逼近国外顶级闭源模型的水平了。 更有意思的是前十名里有九个都来自国内厂商,月之暗面、深度求索、智谱轮着上,国产加油! ## 8、数据是怎么来的 做这个网站的时候,我给 AI 定的第一条规矩就是:**上线之后不能靠我人工维护**。 所以整套数据都是脚本自动同步的。利用 GitHub Actions 自动化,每 12 小时跑一次,从 Epoch AI 拿综合智力评测、从 models.dev 拿模型规格和价格、从 LiveBench 拿各项能力成绩,合并之后生成一份快照提交进仓库。 新模型发布之后,最快半天就会自己出现在 AI 大模型世界里,我不用动一根手指~ ![](https://pic.code-nav.cn/post_picture/1601072287388278786/2CRHggESpfQFliaZ.jpg) ## 最后哔哔 这个网站我已经完全开源了,代码和数据都在 GitHub 上,你想自己部署一份、或者改成你喜欢的样子都没问题。 > 开源指路:https://github.com/liyupi/ai-model-world ![](https://pic.code-nav.cn/post_picture/1601072287388278786/RiEcwlkmb0di9bWp.jpg) 同时它也部署到了 [B 站的 Toy 平台](https://bilibili.com/toy/ai-model-world),完全免费、免登录、免注册,打开就能用。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/GO2d2HoB82M8e17H.jpg) 说真的,这个项目技术上没什么难度,就是一堆数据抓取加一个静态页面。但在有 AI 之前,光是把几百个模型的参数和评测成绩整理成表格,就够我折腾一整个周末了。现在我只要把想法讲清楚,剩下的交给 AI,几天就能做出一个能自己跑起来的完整产品。 如果你也想试试用 AI 做点自己的小工具,我写了一套免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/JHdv25y1FzEYoAP1.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注哦~

平替 Codex?AI 工具 Qoder 保姆级教程

曾经,Codex 可能是很多人心中夯爆了的 AI 编程工具,能力强、功能多,而且官方动不动就赠送额度重置。 但最近 Codex 是真的跌落神坛了,额度消耗明显变快了,一个任务就能把 Plus 用户 5 小时额度干完。尤其是 GPT-6 Astra 上线之后,算力不够用了,官方直接暂停了 Pro 计划的新订阅,想充钱都不行。更离谱的是,最近圈子里都在说 Codex 开始对中国区用户降智了,体验雪上加霜…… **所以不少朋友问我:有没有 Codex 的平替方案?** 你别说,还真有。 之前我已经把国外主流的 AI 编程工具教程都写过了,比如 Cursor、Claude Code、GitHub Copilot、Codex 等等。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/yOkuuXxQIlTMw0gu.jpg) 这次,我把目光锁定在了国产 AI 工具 `Qoder` 上,它最近的热度很高,而且我体验下来,功能丰富度完全不输 Codex。 这篇文章我会带大家从 Qoder 的安装配置到项目实战,手把手走一遍完整流程。哪怕你是 0 基础的小白,看完也能快速上手。 干货密集,建议先收藏,找个安静的地方慢慢食用~ ## 一、安装和上手 打开 [Qoder 官网](https://qoder.com/zh/download),直接下载对应操作系统的安装包,傻瓜式安装就好,各种操作系统都是支持的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/5BTNN8hnbov11JzY.jpg) 安装完打开 Qoder,用邮箱、Google 或 GitHub 账号注册登录。新用户默认享有 14 天 Pro 试用期和 300 Credits,核心功能都可以先体验到。 登录之后你会看到一个很干净的主界面,是不是有点眼熟? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/fLZeK7jBJOTGwkPp.jpg) Qoder 有两种工作模式,在左上角可以切换。 **编程模式** 按工作区来组织任务,一个工作区就是你电脑上的一个项目文件夹(比如一个 Git 仓库),适合写代码、跑命令、做 Git 操作。 **通用模式** 按普通文件夹组织任务,适合整理资料、写文档、做页面,不需要代码基础也能用。 两种模式的操作方式和大多数功能是一样的,编程模式多了 Worktree 隔离分支、Git 操作这些面向开发者的功能。 我们先切到「通用模式」来感受一下,在对话框里输入: ``` 帮我搜索 B 站用户《程序员鱼皮》最新一期视频的信息,包括标题、播放量和发布时间,并且下载视频文件 ``` 模型就先用默认的 Auto 模式,权限也直接用默认的「询问审批」,然后提交任务。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/TqQT3nRpVNPAxJ8s.jpg) AI 先进行联网搜索,为了确保安全,弹出了确认框问我同不同意。这个就是 Qoder 的 **询问审批** 机制,敏感操作会先停下来问你,你点了同意才会继续,避免 AI 在你不知情的情况下乱操作。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/mU2SgmHBSEJBSyUF.jpg) 然后 Agent 调用了 yt-dlp 工具成功获取到了视频信息并下载了视频文件,右侧还能看到本次任务的执行监控,本次任务的信息一目了然。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/3S5TDSdwgFVaGXJw.jpg) 这就是 Qoder 最基本的用法了,是不是非常简单? 看到这里,你已经超过了 60% 的同学! ## 二、AI 编程实战 接下来我要用 Qoder 从零开发《一键去背景工具》。 你上传一张图片,程序自动把背景去掉,给你一张透明底的图片。做证件照、做产品图、做表情包都能用上。 ### 第一步、选择模式 + 输入需求 在 Qoder 左上角切换到 **编程模式**,然后在对话框下方点击「新建工作区」: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Zj4eF6igsDTBwT9s.jpg) 新建一个空的项目文件夹(比如叫 `remove-bg`),并且添加为工作区: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/qKab3lbM7h6fdRTh.jpg) 然后在对话框里输入需求。不需要限定技术栈,只描述要做什么,让 AI 自己选择合适的方案: ```markdown 开发一个在线一键去背景工具网站。 用户上传一张图片,自动去除背景,生成透明底图片。前端展示去除前后的对比效果,支持下载处理后的图片。界面参考苹果官网的简洁风格,支持拖拽上传,深色主题,响应式布局。 做完后自己打开浏览器验证效果,上传一张测试图片检查去背景功能是否正常,发现问题立刻修复,确保最终交付时功能正常运行。 ``` 你还可以在对话框里拖入一张参考设计的截图,让 AI 照着这个风格来做,效果会更贴近你的预期: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/d4zArag1ox9kQyQ5.jpg) ### 第二步、选择模型 + 确认授权 需求写好之后,先别急着发送,还要在对话框底部确认两个设置。 1)模型选择 点开模型选择器,可以看到 Qoder 内置了不少 AI 档位和模型。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/pnemcxaEAJfa3yWE.jpg) 首先是 6 个档位,Auto 自动、经济、性能、极致,还有最贵的 Sonus 和 Cantus,用来尝鲜体验全球顶级模型。 除了档位之外,你还可以直接指定具体的模型,通义千问 Qwen3.8-Max、DeepSeek-V4、GLM-5.3、Kimi-K3、MiniMax-M3 等等,加起来有十几个可以选。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/hwbsFR4UPyXvieu3.jpg) 你也可以在设置里添加自己的 API Key,走自己的额度不消耗 Qoder 的 Credits。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/UP85dEjYJK6ofZon.jpg) 由于这个项目有一定复杂度,我选择「性能」那档。 2)访问权限 前面那个快速体验的 Demo 我用的是默认的「询问审批」,每次敏感操作都要手动确认。 但如果你要开发项目,需要频繁地读写项目文件和执行命令,每一步都确认就太慢了。所以这次我把权限切到「自动审批」,让 Agent 自己判断是否安全,有风险时才来问我。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/YWMp85e0UY9qY8hR.jpg) 模型和权限都确认好了,点击发送,AI 启动! ### 第三步、Agent 执行 + 自主验证 接下来 Agent 开始干活了,它自己选择了技术方案、创建项目文件、安装依赖、开发前端页面和后端接口。 在开发完成后,AI 自己启动了服务器,打开内置浏览器并上传了一张测试图片,检查去背景功能是否正常。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/d5JnFEybdUISEB1H.jpg) 然后 AI 会通过截图和图片理解来验证项目的效果,发现问题还会自己回去改代码再验证,直到没问题了才最终交付。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/4edQGrMpDQB2d5Dh.jpg) 因为权限选的是「自动审批」,Agent 全程自己判断安全性,没有弹确认框打断流程,效率比第一个任务快了不少。 ### 第四步、检查结果 + 确认用量 Agent 验证通过之后,我自己再确认一下效果。 我上传了一张自己的照片试试,几秒钟后去除背景完成,前端展示了原图和去背景后的对比效果,还能一键下载透明底图片。效果非常不错~ ![](https://pic.code-nav.cn/post_picture/1601072287388278786/iikQuL731lFoJklV.jpg) 而且 AI 只花了 5 分钟左右就完成了任务,你还可以在对话框下方查看当前任务的上下文占用情况,在右侧边栏查看 AI 在工作区生成的文件。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/UtxsExYNzPD8yYIF.jpg) 在左下角可以查看当前账号的剩余用量,在额度快用完的时候,建议不要执行太复杂的任务了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/bfs3vXQZlLsj5kRa.jpg) ### 第五步、精准修改 + 持续优化 如果你对网站的某个地方不满意,可以在 Qoder 内置浏览器的上方给页面做 **批注**: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/mQ6eVVuxZT1poyHk.jpg) 直接在页面上标记哪里需要改,写上修改意见发给 AI,它会自动定位到对应代码并修改,很方便: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/sbWqDpu2sqZJxtxo.jpg) 你还可以继续在对话框里跟 AI 聊,比如「加一个批量上传功能」、「支持手动调整去背景的精度」,对话的上下文是连续的,不用每次都重新描述项目。 恭喜,看到这里你已经超过了 70% 的同学! ## 三、AI 办公实战 AI 编程只是 Qoder 的一个应用场景,接下来我再演示几个实际的办公场景,帮大家提升工作效率。 ### 1、整理文件 我电脑的下载目录中有 2000 多个乱七八糟的文件,截图、文档、表格等等混在一起,堪称究极屎山! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/n28ucfMWf3fGx1iY.jpg) 现在直接让 Qoder 帮我整理。 进入「通用模式」,输入下列提示词并执行: ```markdown 分析当前文件夹里的所有文件,按照你认为最合适的方式进行归纳整理。 禁止丢失任何一个文件,整理完输出一份文件整理报告。 ``` AI 会自动扫描文件,然后找我人工确认要选择哪种整理方式: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/9veXQIy7fUPSgl8B.jpg) 人工确认后,AI 会创建子文件夹、把文件一个个移过去,最后给了我一份整理报告。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/GRV0rQIgrAciwF22.jpg) 我这么多年的懒惰造成的屎山,就在几分钟内被 AI 铲除了~ ### 2、写产品文档 + 自动截图 这是我觉得最能体现 Qoder 浏览器操作能力的一个办公场景。 众所周知,我有一个程序员刷题网站「面试鸭」,出新功能或者搞活动时,需要写一份产品介绍 / 宣传文档。 以前每次我都得自己打开网站、一个页面一个页面手动截图、再粘贴到文档里,来来回回很是折腾。 现在,我可以让 Qoder 帮我一条龙全自动搞定: ```markdown 帮我写一份面试鸭(mianshiya.com)的产品宣传文档。 打开面试鸭网站,依次浏览首页、题库页等核心页面,每个页面截一张图。 然后用这些截图作为配图,写一份 Markdown 格式的产品介绍文档,保存到当前目录。 ``` Qoder 在内置浏览器里打开了面试鸭,自己一页一页地导航、截图、整理信息,最后生成了一份图文并茂的产品介绍文档。这种需要「打开网站 → 逐页浏览 → 截图 → 写文档」的工作流,普通的网页爬虫做不了,必须有真实的浏览器去点击和导航才行。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ZD23tK5BDOLfGprL.jpg) AI 会干脆利落地打开浏览器,进入目标网站,然后开始截图、翻页、截图、跳转、截图…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/atQYiHVPU0Lc6Ext.jpg) 几分钟后,AI 输出了一篇有图有文的宣传文档,美滋滋~ ![](https://pic.code-nav.cn/post_picture/1601072287388278786/LutT88C7TDSOZk9N.jpg) ### 3、让 AI 看你的屏幕 Qoder 支持 **应用快照** 和 **电脑操控** 能力,可以像人类一样看电脑屏幕、操控电脑来完成各种任务。 先试试应用快照,macOS 用户同时按下左右两侧的 Command 键,Qoder 就会自动截取当前屏幕的内容,连同页面上的可访问性信息一起发给 Agent。 比如我正在看一篇英文技术文章,直接按快捷键,截图发给 Qoder: ``` 帮我看看屏幕上这篇文章,总结一下核心要点,用中文列出来 ``` Qoder 会分析截图中的文字内容,然后给出一份中文摘要,非常方便: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/nFwIQOtjr5PdHY2l.jpg) 这个功能不仅能看文章,还能分析设计稿、识别报错信息、读取表格数据,只要屏幕上有内容它都能看。 再来试试电脑操控,使用前需要先到设置页面开启「电脑操控」功能,按系统提示开启辅助功能和屏幕录制权限: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Dt8gGyyx9DW9TWLp.jpg) 然后我开启 `computer-use` 插件,让 AI 帮忙从应用商店下载免费的记事本软件: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/0zql8dT4GNqGhJKa.jpg) 注意看下面这张图中的透明小鼠标,就是 AI 正在操控应用商店,下载免费的笔记应用。虽然速度并不快,但操作还是很精准的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/QV8NvzqWydkaxgW1.jpg) Qoder 还有一个「录制与回放」功能,你可以把一段操作录制下来存成 Skill,以后遇到同样的流程直接回放就行,不用每次都重新描述。 恭喜,看到这里你已经超过了 80% 的同学! ## 四、更多实用功能 除了前面重点演示的这些能力之外,Qoder 还有不少值得了解的功能,我带大家快速过一下。 #### 1、多任务并行 你可以同时开多个任务让 Agent 并行处理,一个写前端代码,另一个帮你补测试用例,各干各的互不影响。 Qoder 还有 **子智能体** 的概念,主 Agent 可以把复杂任务自动拆分成多个子任务,分派给子智能体并行处理,完成后汇总结果。做大项目的时候效率提升很明显。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ZtZW2vUIhTD85ZNw.jpg) #### 2、Skills 技能包 Skills 是给 AI 准备的技能包,装了某个技能后,AI 在遇到相关任务时就能自动按照这套方法来干活,不需要你每次都写一大堆提示词。 Qoder 内置了不少技能,比如联网搜索、图片生成、代码安全扫描等等。你也可以安装社区做的技能包,比如 Firecrawl 网页抓取、Context7 最新技术文档查询等。装了对应技能之后,Agent 遇到相关任务会自动调用。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/P7ScENrXQr2IeiWs.jpg) Qoder 还会自动识别你电脑上已经安装到用户目录下的技能,你可以直接在对话框中选择使用,非常方便: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/bjd0QIB8YwGjdC3C.jpg) #### 3、Plugins 和 Connectors 跟 Skills 类似,Qoder 也提供了插件(Plugins)和连接器(Connectors)来扩展 Agent 的能力。 插件是功能扩展包,里面可以包含 Skills、MCP 服务等多种能力的组合;连接器主要是通过 MCP 协议对接外部数据源和服务,比如连接 GitHub、飞书、Notion 等,让 Agent 能直接读写这些平台的数据。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Np32ezvF1Du4MfqT.jpg) 连接器本质上就是 MCP 服务。你可以在连接器面板里添加各种 MCP,添加完之后在对话框中用 `@` 就能调用。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/St8pTTGTw2QbpMd4.jpg) 比如我安装一个 GitHub 的 MCP,然后在对话框中输入 `@GitHub` 就能让 AI 帮我连接到 GitHub 并获取项目信息: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/YjAmatnMup9zo7f8.jpg) #### 4、Hooks 生命周期钩子 可以在 Agent 工作流的关键节点自动执行脚本。 比如每次 Agent 改完代码自动跑一遍代码格式化工具,保证风格统一。或者设置一条规则,每次 Agent 要删文件的时候自动拦截,防止误删重要文件。个人开发者日常可能用不到这个功能,更适合团队协作场景。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/slwkBweKAdNpURWg.jpg) 建议直接让 AI 帮你生成 Hooks 配置,比你自己手写方便多了。 #### 5、记忆系统 Qoder 内置记忆系统,会自动记住你的偏好和项目规则。 它的记忆分为两个层级:**全局记忆** 会在所有项目中生效,比如你的语言偏好、编码风格;**项目记忆** 只在特定项目里生效,记录这个项目的技术栈、业务规则等信息。比如你之前告诉过它「代码注释用中文写」,后续做同类任务的时候它会自动遵守,越用越懂你。 喏,项目记忆的文件大概长这样: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/kxdZyz2tjVLAva2q.jpg) 不过记忆也有代价,AI 每次执行任务时会读取相关记忆,多少会额外占用一些上下文空间。如果你觉得某些记忆没用或者想省 Token,可以在设置里自己控制记忆的开关。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/YsbyRmeCNsTTjUgY.jpg) #### 6、定时自动化 可以创建定时任务让 Agent 按计划自动执行。比如每天早上帮你整理下载文件夹里的新文件、每周五自动生成项目周报、定期扫描代码库的安全风险等。 创建方法很简单,进入「自动化」面板,可以手动输入信息创建任务,或者我更推荐让 Qoder 帮我创建: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/xx5TvzEbB2JBdGly.jpg) 然后会自动跳转到对话页面,你可以设置自动化执行任务的时间间隔,通过自然语言描述工作内容: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/H8l50vh5BLzsla6k.jpg) 很快,AI 就创建了自动化任务: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ObFdo3WDI8Vq122U.jpg) 可以在「自动化」面板查看和编辑自动化任务: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/R6uGqRUU2ecQvTyI.jpg) 这下我的下载目录再也不会变得一团糟了~ #### 7、手机远程操控 下载 Qoder Mobile 应用,扫码连接电脑,在手机上就能查看 Agent 的执行进度、审批操作、追加指令。出门在外也能驾驭和监督 AI 的工作。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/rtCeGX8Xd8Y5oyHR.jpg) 跟 Codex 的手机远程是一个意思,但是我估计大多数国内用户无法下载移动端的 ChatGPT 应用吧。 #### 8、桌面宠物 没想到吧,Qoder 也有桌面宠物,能实时反映 AI 的工作状态,让你不用切窗口就知道 AI 有没有完成任务。 点击宠物还可以快捷开启语音输入,直接跟 AI 说话。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/8SfOjTRtJInWPEFQ.jpg) 不过目前内置的宠物数量还比较少,期待后续能开放更多选择。 恭喜,看到这里你已经超过了 90% 的同学! ## 最后哔哔 看到这里你会发现,Codex 有的功能,基本上 Qoder 都已经跟上了。 对国内用户来说,Qoder 的优势很明显了。首先支持国内直接付款,不用像 Codex 那样找人代充,没有使用门槛。模型选择也比 Codex 灵活很多,十几个模型在选择器里随便切换,不用改配置文件。 虽然在部分场景下国产模型跟 GPT 系列确实还有一些差距,但对大多数人来说,能用、够用、消耗透明、账号稳定,这些才是日常选工具最看重的。 如果你之前完全没有用过 Qoder,用 [全新的邮箱注册](https://qoder.com/activities?code=BW4CLB),能拿到价值约 40 元的 **600 Credits 积分**(试用 300 + 邀请码加赠 300)。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/TO6vcArXG9M09QiK.jpg) OK 就聊到这里,欢迎在评论区说说你现在用的是哪款 AI 编程工具,使用 Qoder 的感觉怎么样。

又一个新项目完结,全栈 AI 修图 Agent!

大家好,我是程序员鱼皮。 又经过了一段时间的爆肝,我在编程导航的保姆级新项目教程 [《AI 修图智能体》](https://www.codefather.cn/course/2099386518517915649),完结啦! 这是一套以 **AI Agent 驱动的图片编辑** 为核心的全栈项目教程,基于 Python 3.13 + FastAPI + LangChain + LangGraph + React 19 + Konva。你只需要输入一句话,AI 就能自动规划修图步骤、调用 21 种编辑工具帮你完成专业级修图,从文生图到抠图调色、区域编辑、图层拆分,全部自动搞定。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/bRVBpHKFWKK78tgS.jpg) 每一期文字教程都详细讲解了设计决策和实现细节,让你不只会做,还知道为什么这么做。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/UfcQCUsgDIlktjXl.jpg) 这还不够,每个项目我都写了详细的简历写法和面试题解,做完项目直接写到简历上、突击面试,一条龙服务! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/AMipBL5Qa0tIOxCO.jpg) 真心换真心,我做项目教程的付出也得到了大家的认可,也帮很多同学拿到了大厂 offer~ ![](https://pic.code-nav.cn/post_picture/1601072287388278786/PJJ8XVWNjtl1B9sK.jpg) 接下来鱼皮给大家快速介绍这个项目,希望让更多需要它的同学看到,把它变成自己的项目。 秋招正处于黄金时段,简历上写满前沿技术,不仅求职有底气,做项目的能力也会大幅提升! ## 项目介绍 项目有 8 大核心能力。 1)AI 文生图,输入提示词就能出图 在创作页输入一段提示词,AI 自动生成四张候选图,以四宫格的形式展示给你挑选。整个生成过程通过 SSE 实时推送进度,不用傻等,随时知道跑到哪一步了。选中满意的图片后,直接进入编辑器开始修图。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/pK88x0BPeraM0QWW.jpg) 2)专业级画布编辑器 基于 react-konva 搭建了一个真正能用的图片编辑器,支持画布缩放平移、图层文档管理、撤销重做,还有前后对比滑杆,一拖就能看到修图前后的效果。这不是玩具级 demo,而是对标专业修图软件的交互体验。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/sXssVJ84DqO93F1A.jpg) 3)自然语言驱动修图 这是整个项目最酷的能力。你在对话框里输入一句话,比如“把背景换成海滩”、“提高亮度和饱和度”,AI Agent 会自动分析你的需求,规划出修图步骤,然后一步步调用工具帮你执行。不需要你去找按钮、调参数,说一句话就搞定。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/bhY24e10EFriVywH.jpg) 4)21 种编辑工具,覆盖主流修图场景 项目内置了丰富的编辑工具:rembg 一键抠图、11 参调色(亮度/对比度/饱和度/色温等)、裁剪/翻转/缩放/旋转/移动等画布变换、AI 换背景、AI 扩图、超分辨率放大。手动点击工具栏可以用,Agent 也能自动调用,UI 和 Agent 共享同一套工具注册表。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/E1Uca6RyxNNp4Hiv.jpg) 5)智能区域选择 集成了 SAM(Segment Anything Model)点选能力,鼠标点一下就能精准选中画面中的任意物体。还支持笔刷涂抹模式,自由绘制选区。首次点击计算 embedding,后续点击只跑 decoder,响应速度是毫秒级的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/gmSAF6EoVUZiZ1EP.jpg) 6)局部精细编辑 有了选区之后,可以做局部消除和局部替换。局部消除会用 AI inpainting 把选区内的东西抹掉,自动填补背景;局部替换可以用一句提示词描述你想换成什么,只改选区内容,其他地方纹丝不动。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/MAD8C0oJ6oKsHuUc.jpg) 7)图层拆分和独立操作 一键把图片按语义拆成主体层和背景层,还可以选择拆出 OCR 文字层。拆完之后每个图层可以独立缩放、调色、移动,互不影响。还支持点选画面中的任意物体,把它提升为独立图层,背景自动修复。图层数据用 JSONB 持久化,切换图片再切回来,图层结构不会丢。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/zdC0DLcsQqX9xtr0.jpg) 8)多步计划和人机协作 当修图需求比较复杂时,AI 会输出一份包含多个步骤的结构化 JSON 计划,每一步标注了依赖关系。服务端会做工具存在性校验、参数合法性检查、依赖补全和环检测,然后按拓扑排序确定执行顺序。用户可以在计划卡片上确认执行、单步重试或取消后续,真正做到人机协作,AI 干活你把关。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/wMZ38Xe8bOamQ41T.jpg) 当你学会这个项目后,你不仅能开发 AI 修图应用,更能把这套 Agent + 工具注册 + 异步执行的架构套用到任何需要 AI 驱动的业务场景中,比如 AI 设计工具、AI 视频编辑、AI 数据处理等等。 学前沿技术、涨开发经验,全栈 AI Agent 实战开发,绝对让你收获满满! 而且为了让更多同学参与学习,我直接把所有代码 **完整开源** !能力强的同学可以自学,点个 star 就算对鱼皮的支持啦~ > 开源仓库:[https://github.com/yuyuanweb/ai-retouch-agent](https://github.com/yuyuanweb/ai-retouch-agent) > ![](https://pic.code-nav.cn/post_picture/1601072287388278786/dKdnQVOnvbwXqYv8.jpg) ## 项目收获 本项目选题新颖,紧跟 AI Agent 和 AIGC 趋势,以 **专业级 AI 修图工具** 为目标。区别于增删改查的烂大街项目,你将从零搭建一个集画布编辑器、AI Agent、异步任务、图层系统于一体的全栈应用,技术深度和广度都远超普通项目。 项目内容丰富扎实,前后端 + AI Agent 全链路覆盖,帮你成为 AI 时代企业的香饽饽,给你的简历和求职大幅增加竞争力! Python 全栈 + LangChain / LangGraph Agent + 专业画布编辑器 + 异步任务 + 图层系统,技术丰富,玩透 AI Agent 全栈项目开发~ ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Nxsv8XtevKR2Ma73.jpg) 鱼皮给大家讲的是 **通用的 AI Agent 开发方法和真实工具产品从 0 到部署的全流程**,从这个项目中你可以学到: + 如何基于 FastAPI + SQLAlchemy 搭建 Python 全栈项目,实现 JWT Cookie 认证? + 如何设计 Provider 抽象层,一行配置切换 Mock 和真实 AI 模型? + 如何用 ARQ 异步队列 + Redis Pub/Sub + SSE 实现实时进度推送? + 如何用 react-konva 搭建专业级图片编辑器,支持图层文档和视口变换? + 如何用 LangChain 接入规划模型,再用 LangGraph 构建 AI Agent,让大模型规划修图步骤? + 如何设计统一的工具注册表,一处定义同时服务 UI 和 Agent? + 如何用 SAM 模型实现智能点选,一键选中任意物体? + 如何做图层拆分,把一张图拆成主体、背景和文字三个独立图层? + 如何实现多步计划的服务端校验、拓扑排序和人机协作? + 如何用 Docker 多阶段构建和 compose profile 实现一条命令部署? 此外,还能学会很多架构设计、方案取舍、问题排查的方法,提升独立解决复杂问题的能力。鱼皮还给大家提供了大量的项目扩展点,有能力的同学可以进一步拉开和别人的区分度,无限进步! 满满的项目正反馈: ![](https://pic.code-nav.cn/post_picture/1601072287388278786/QKfxqBvnnHeUlZ2v.jpg) 除视频教程外,鱼皮编程导航的项目还提供: | 教程资料 | 求职助力 | | --- | --- | | 详细的文字教程 / 直播笔记 | ⭐️ 现成的简历写法,直接写满简历 | | 完整的项目源码 | ⭐️ 项目相关面试题解和真实面经 | | 1 对 1 答疑解惑 + 专属交流群 | ⭐️ 项目扩展思路,拉开区分度 | | 前端 + Java 后端万用项目模板 | ⭐️ 从学项目到拿 Offer 一条龙 | ![](https://pic.code-nav.cn/post_picture/1601072287388278786/02VRQ9OfPyN9VX3C.jpg) ## 更多介绍 该项目功能完整,涵盖文生图、画布编辑器、AI Agent 对话、编辑工具、区域选择、局部编辑、图层系统、多步计划、营销图、批量处理 10 大模块,覆盖了一个真实 AI 修图产品的核心业务场景。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/MnAqEAwM8sNRMH2T.jpg) 本项目采用前后端分离 + 异步 Worker 架构。前端是 React 19 + Konva 的单页应用,后端是 Python FastAPI 服务,通过 REST API 和 SSE 通信。 后端内部按照路由层、业务服务层、数据访问层分层,AI 生图、抠图、扩图等耗时任务通过 ARQ 异步队列提交到独立 Worker 执行,结果通过 Redis Pub/Sub + SSE 实时推送给前端。LangChain 负责接入规划模型和绑定工具签名,LangGraph 负责 Agent 的计划编排,ToolRegistry 统一管理所有编辑工具的元信息和执行逻辑。数据分别落在 PostgreSQL(业务数据)、Redis(缓存和消息)和 MinIO(图片资源)中。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/yzjN3K9vlqNITPk4.jpg) 项目的核心业务流程非常清晰,能够帮你理清 AI Agent 项目开发的思路,比如一次 AI 修图请求的完整链路:用户输入自然语言指令 → Agent 规划修图步骤 → 服务端校验和拓扑排序 → 用户确认计划 → 按依赖自动执行工具 → 结果推送前端 → 画布实时更新。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/pgfIKw1fmSDtTdkT.jpg) 不得不说,做项目真的给了很多同学坚持学习的目标、也有了更多拿 Offer 的机会,大家的动力也更足了!冲冲冲! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/nJOhdcchvfT0EDie.jpg)

DeepSeek 官方竟然偷偷做了 Harness 桌面端,我已经用上了。。

大家好,我是程序员鱼皮。 上个月 DeepSeek 开源了自家的 Harness 工具 DSH,被称为 DeepSeek 的角色专武,核心理念是「一切皆插件」。 发布后才过了一周,GitHub 就冲到了 20 万 Star,可见有多火! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/U4b07QODFNlumEHz.jpg) 不过,官方发布的时候只提供了命令行和 Web 两种使用方式,你得先装好 Node.js 环境,然后在终端里敲命令启动,用浏览器来访问。 对很多小白来说,这个上手门槛就不太友好了。 所以有社区开发者立刻开始做桌面端。Harness 才开源没几天,GitHub 上就冒出了好几个桌面客户端项目。其中最火的当属 dsh-desktop,已经拿了 2 万多个 Star,支持 Windows 和 macOS,双击安装就能用。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/7s2lO80RSlcWAEvk.jpg) 我以为有了社区的支持,DeepSeek 官方不打算出手做桌面端了。结果今天逛 GitHub 的时候,突然发现官方 deepseek-harness 仓库里多了一个 `apps/desktop` 目录。 点进去一看,好家伙,官方自己搞了一个基于 Electron 的桌面端应用,包名叫 `@deepseek-ai/dsh-desktop`,版本号已经到了 `0.1.5-rc.2`,连打包签名、自动更新的流程都写好了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/yNyx52Dxc2tOsD5H.jpg) 最离谱的是,DeepSeek 没有发过任何公告、没有推文、没有博客,就是悄悄地把代码合进了 master 分支。 而且到目前为止,官方也没有放出安装包,想体验只能自己拉代码编译。 很符合 DeepSeek 低调的风格了,闷声干大事啊! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/lnoBAH6OD35YWk3w.jpg) ## 吃波螃蟹 既然官方没放安装包,那我就自己动手编译跑一下,替大家吃一波螃蟹。哦不,是鲸鱼~ 整个过程其实不复杂,前提是你的电脑上已经装好了 Node.js(需要 22.19 以上版本)。如果没装过 Node.js,可以去 [Node 官网](https://nodejs.org) 下载最新的 LTS 稳定版本。 准备好之后,打开终端,依次执行下面 3 步。 > 当然,还有更简单的安装方式,就是你直接让 AI 帮你安装和运行。 **1、安装 pnpm 包管理器** DeepSeek Harness 用的是 pnpm 来管理依赖,先输入命令全局安装一下: ```bash npm install -g pnpm@11.7.0 ``` **2、克隆仓库并安装依赖** 把整个 Harness 仓库拉到本地,然后安装依赖。注意这个仓库很大,依赖也很多,安装过程可能会有点儿慢: ```bash git clone https://github.com/deepseek-ai/deepseek-harness.git cd deepseek-harness pnpm install ``` **3、启动桌面端开发模式** 输入一行命令搞定: ```bash pnpm run dev:desktop ``` 这一步会先编译整个项目,然后自动下载 Electron,也就是一个专门用来开发跨平台桌面应用的开源框架,很多知名应用比如 VS Code、Discord 都是用它做的。 过一会儿,你就能看到一个 Electron 窗口弹出来了,界面和 Web 端几乎没什么区别。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/fOpEUfxz6SlNNwqB.jpg) 模型配置和 Web 端一样,在设置里填好 API Key 就能开始用了。我试了一下,跟 AI 对话、文件操作、工具调用、插件管理这些功能都是正常的。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/F4nxEYL4b7prgKRc.jpg) 不过好像有个明显的 Bug,整个应用内无法粘贴内容,DeepSeek 的 API Key 还是我一个字母一个字母手输进去的…… 期待后面改进吧,最好能有一些桌面端特有的功能。 ## 官方版会更好么? 可能有人会问,社区已经有那么多桌面端了,官方下场做这个有什么不一样? 我觉得 **最大的区别在于安全性。** 社区做的那些桌面端,不管是用 Electron 还是 Tauri,基本思路都差不多。它们会在你本地起一个 HTTP 服务,然后用桌面窗口去访问 `localhost` 上的这个服务。简单来说,就是给 Web 页面套了一个桌面壳子。 这种方式虽然简单,但有一个潜在的问题:你的电脑上开了一个端口。 如果你在公司内网或者公共 WiFi 环境下用,理论上同一网络下的其他设备是有可能访问到这个端口的。 而官方的桌面端完全没有开任何端口。它用了一套自定义的 `dsh-app://` 协议来传输数据,Electron 主进程和 DSH 后端之间通过进程管道直接通信,请求和响应走的是分帧字节流,生命周期控制则走 Node IPC。也就是说,从网络层面来看,你的 Harness 对外界是完全不可见的。 ![安全性对比](https://pic.code-nav.cn/post_picture/1601072287388278786/EdFs76k95hJ7LkhG.jpg) **另一个区别是版本绑定。** 官方把 Electron 壳、DSH 后端、Node.js 运行时绑成了一个整体,一起签名、一起发布、一起更新。社区版通常是桌面壳和 DSH 后端分开更新的,偶尔会出现版本不匹配导致的奇怪问题。而且官方自己维护更新通道,后续升级肯定会更及时、也更让人放心。 目前官方版本还处于很早期的阶段,没有预编译的安装包,必须自己从源码构建。日常使用的话,社区的 dsh-desktop 之类的项目体验确实更成熟。不过看官方的架构文档和签名流程,后续大概率会通过 `download.deepseek.com` 正式分发安装包,到时候应该就是双击安装、开箱即用了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/6mbBxoLdGyJlb5Ru.jpg) 如果你还不了解 DeepSeek Harness,或者想学习更多 AI 编程工具和经验技巧,可以看看我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/RHOlkKKMbFMNjIi5.jpg) 我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 评论区聊聊,你更喜欢用网页版还是桌面端的 AI 工具呢?

耗时 6 年,我终于拿到 B 站 100 万粉丝奖牌!公布明年的秘密计划(

大家好,我是程序员鱼皮。 从我在 B 站发出第一个视频到现在,整整过去了 6 年。 前几天我终于收到了官方寄来的 100 万粉丝奖牌,真的很久没有那么激动了,仿佛找到了我最开始做视频时粉丝破百的喜悦感。 ![100 万粉丝奖牌](https://pic.code-nav.cn/post_picture/1601072287388278786/4ZvWYHUVxN1sEzl1.jpg) 这块牌子不是我一个人挣来的,是这 6 年里每一个点关注、投币、留评论的朋友一起堆出来的。 真的非常感谢大家! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/wRny5tsuHYKLvDxJ.jpg) 以前我发视频基本都在讲教程、聊技术、测模型,从来没有在视频中回过评论。 这次我专门在动态里征集问题,评论区一下涌进来上百条,从 AI 编程工具问到创业经历,从学习路线问到感情八卦,什么都有。 我挑了 40 多条大家问得最多、也最值得聊的问题,一条条录成了视频。 > 视频指路:https://bilibili.com/video/BV1W9YH6HEtz 这篇文章就是那期视频的完整文字版,内容比较长,我按话题分成了 9 个部分,方便大家挑着看。 ## 1、我是怎么走上编程这条路的 #### 第一次做程序是什么时候? 我第一次写程序是在高中,用的是一门估计大家都没听说过的语言,叫 Q 语言,也就是按键精灵的脚本语言。 ![高中用按键精灵写的 Q 语言脚本](https://pic.code-nav.cn/post_picture/1601072287388278786/xgR5cLCVqnfFeaRM.jpg) 学它的目的说出来有点不好意思,我纯粹是为了写自动打怪脚本。 这里还有个小故事,当时我沉迷一款叫 XX 三国的游戏,想氪金但手里没钱,就琢磨出一个思路,与其在游戏里辛苦打工赚游戏币,不如先在现实世界把钱赚到手,再充值到游戏里。 于是我真的跑到线下加入了一个刷单工作室,靠这个赚了点零花钱。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/IAZx263oLsJp19Rs.jpg) 结果等我真赚到钱之后,反而舍不得往游戏里充了…… 不过写这些脚本的过程让我发现,原来自己挺喜欢编程这件事。那会儿我还是班里的计算机课代表,后来又参加了一个做网站的竞赛,拿了个三等奖,从此就彻底爱上编程了。 #### 鱼皮小时候是什么样的生活环境和经历? 我小时候基本就是一个人待在房间里自娱自乐,左手拿着一个玩具,跟右手的玩具对话。 再大一点,我开始用 A4 纸和手写笔记本设计游戏,自己定规则、画地图、算数值,我管这个叫「纸游」和「本游」。 现在回过头看,那大概就是我最早的产品设计经历了。 #### 鱼皮哥是二次元吗? 给大家看看我当年用过的头像和壁纸,请大家自行评价。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/2yFSkLOm48j26GRe.jpg) #### 如果能再选一次,鱼皮会选什么专业? 当年填大学志愿的时候,我 10 个志愿全都填了计算机专业。 再让我选一次,肯定还是计算机,前提是这个专业未来还在。 #### 大学期间印象最深的事是什么? 大学期间让我印象最深的一件事,是在保研和就业之间做选择。 纠结了很久,我最后还是决定直接进腾讯打工,立志把童年充进游戏里的钱赚回来。 一路走到现在,我一直都是自己做选择的,不会让别人替我做决定,我爸妈也从来不干涉我,真的非常感谢他们。 ## 2、我每天在用的 AI 编程工具 聊完过去,再说说现在。这次评论区问工具和实操的人最多,我挨个说一下。 #### 鱼皮最喜欢用的编程工具是哪一个? 这题很危险啊。 以前做 Java 开发的时候,我用得最多的肯定是 IDEA。不过现在都是 AI 编程了嘛,我早就把 IDEA 卸载了。 目前用得最多的是 Cursor,其次是 Codex 和 Claude Code,然后是各种国产工具,没有任何广告成分。 #### 在哪个平台或模型上充值的 Tokens 最多?充了多少? 肯定是 Cursor。 它对接了非常多的模型,我想测试新模型的时候特别方便,不用到处开一堆订阅,也不用担心被封号。 我用 Cursor 差不多有一年半了,整个团队算下来,少说也得花掉十几二十万,单位是元。 给大家看一眼最近一个计费周期的账单,光这一个月就烧掉了三千多刀。 ![Cursor 最近一个计费周期的账单](https://pic.code-nav.cn/post_picture/1601072287388278786/ZKKvrHrEmAiXARpx.jpg) #### 利用 AI 做长期项目时,如何确保随着内容增多,AI 的代码不会越来越乱? 这个问题挺正经的,但回答起来很简单,你把 AI 类比成人类就明白了。 人脑的容量是有限的,所以我们会把重要的事情记下来,写进备忘录或者项目文档里。 让 AI 做项目也是一样的道理,你要让它把项目的关键信息整理成文档沉淀下来,之后每次干活先从文档里获取上下文,它就不容易跑偏。 除了写文档,还有一些别的技巧。比如把代码按功能拆分成多个模块,每次明确告诉 AI 这轮只改哪一个模块,它的改动范围就会收得很紧,不至于牵一发动全身。 #### 如何自己开发 Agent? 打开一个 AI 编程工具,使用 `/grill-me` 拷问技能,然后把你的想法输进去,让 AI 一步步引导你把需求问清楚,剩下的交给它就搞定了。 这个技能来自 Matt 开源的技能库,它会像面试官一样反复追问你的需求细节,比你自己想提示词高效得多。 > 开源指路:https://github.com/mattpocock/skills ![](https://pic.code-nav.cn/post_picture/1601072287388278786/WRNeH1aaXdZOceyW.jpg) ## 3、Vibe Coding 时代,怎么提升编程能力 工具聊完了,接着就是这次评论区最焦虑的一批问题。 大家的担心其实高度一致,就是 AI 把活儿都干了,自己会不会废掉。 #### 现在每天上班开发就是 Vibe Coding,没时间再手动看生成的代码了,以后该如何提高自己的编程能力? 完全不用担心! Vibe Coding 已经是整个行业的趋势,你能指挥 AI 把工作完成,这本身就是一种能力。 真想补基础也不难,在工作之余主动看一点传统的技术教程或者技术科普,面试之前刷一刷面试题就够了。不用因为自己不再逐行手写代码,就觉得能力在退化。 #### 我是计算机专业本科生,应不应该平时完全用 AI 写代码?让 AI 写代码总有种作弊的感觉 你不用,你可能就落后了。 AI 编程是趋势,不是捷径。 腾讯在《2025 腾讯研发大数据报告》里披露过,公司超过 90% 的工程师在用 AI 编程助手 CodeBuddy,全公司 50% 的新增代码由 AI 辅助生成,相当于程序员每写两行代码就有一行是 AI 帮着完成的。 ![2025 腾讯研发大数据报告](https://pic.code-nav.cn/post_picture/1601072287388278786/Z7Z9ZA9PF2i9DMma.jpg) 连大公司都这么干了,先进的工具和技术本来就是要学的,用 AI 写代码怎么能算作弊呢? #### 以后的开发是不是偏向于维护和提问题? 我觉得会更偏向于 **描述需求** 和 **验收成果** 这两件事。 往前一步,你要能把问题跟 AI 说清楚,说不清楚它就交付不出你想要的东西。 往后一步,你要能判断 AI 交出来的结果好不好,好在哪、差在哪、该怎么改。 这两头你都握住了,中间的代码具体由谁敲出来,其实没那么重要。 #### 如何在 Vibe Coding 中学习? 多看 AI 的输出,并且直接利用 AI 来学习。 具体做法特别简单,记住这一句提示词就够了: ```markdown 请用傻子都能懂的方式回答我 ``` 别小看这句话。Claude 的母公司 Anthropic 最近开源了一个技能叫 ELI5,全称是 Explain Like I'm 5,意思是用讲给 5 岁小孩听的方式来解释任何话题。 > 开源指路:https://github.com/anthropics/claude-plugins-community 整个技能的核心就这一句话,跟我这个提示词异曲同工。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/rcxzucrHBjkFyKDV.jpg) 如果你想要更系统一点的效果,还可以用国外大神 Matt 开源的 `/teach` 技能。它会把 AI 变成你的私人教师,先摸清你为什么想学这个东西,再按你的节奏一点点搞出教程讲解。 > 开源指路:https://github.com/mattpocock/skills ![Matt 开源的 teach 技能](https://pic.code-nav.cn/post_picture/1601072287388278786/RJR8eFwW2MWkWeu3.jpg) #### 小白如何在 Vibe Coding 的过程中不断学习和进步,增强对 AI 的掌控感? 不用想那么多,多用就是了。 先用 AI 把东西做出来,在练习的过程中慢慢找感觉。提示词不会写完全没关系,只要能说清楚自己的需求和目标就行。用着用着,你自然就知道 AI 什么时候听话、什么时候不听话了。 **掌控感是练出来的,不是学出来的。** 等东西做出来之后,再倒回去了解背后用到的技术。这时候你的学习是带着目标的,效率反而比一开始就死磕基础更高。 #### 研究生应该怎么利用好 AI 工具帮助自己? 很抱歉我没有读过研,不太清楚你们具体的科研场景。 但这个问题我可以用最直接、最不绕弯子的方式回答你:**你把自己的专业和这个问题原封不动发给 AI 就行。** 记得带上前面那句提示词「请用傻子都能懂的方式回答我」,AI 现在真的是最好的私教 #### 自学编程或者教别人学编程的过程中,遇到最难的问题是什么? 好问题,我记得有张图特别能说明这件事。 ![很多人就是不看文档](https://pic.code-nav.cn/post_picture/1601072287388278786/cWuv5tlRNcZ5JLD8.jpg) 很多问题明明教程和文档里都写得清清楚楚,但就是因为没有认真看文档,最后踩了坑。这类问题最难的地方不在技术本身,而在于人不愿意去读。 好在现在有 AI 了,你可以把整份文档丢给它,让它替你读完再回答你的问题,这个坑基本算是被填平了。 ## 4、给学生和求职者的建议 上面那批问题大多来自已经工作的朋友,评论区里还有不少在校生,他们关心的事情又不太一样。 #### 给非 92 的计算机大一学生有什么建议? 无论是不是 92,学习建议其实都是一样的,关键在于做好规划、多动手实践,学校的层次决定不了你四年后的样子。 我很早之前录过一期《我的大学四年规划》,把每一年该干什么讲得比较细,建议新同学去看一下。 > 视频指路:https://codefather.cn/live/1788387889965436929 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/9NxnrYHb0oR8XrBj.jpg) 相信我,四年后你会来感谢我的。 #### 对于学人工智能的学生有什么建议吗? 也是一样的,多做东西、多实践,别只跟着学校学。课本里的内容很可能已经和企业里的实际应用脱轨了,你等着老师讲完再动手就太晚了。 最关键的一点是多看鱼皮的视频(哈哈哈哈哈哈哈哈。 #### 如何看待今年秋招大量缩减岗位?还有两年毕业,如果做不了计算机开发,如何提前规划别的职业? 首先我不太清楚你是在哪里看到这个信息的。就我观察到的情况,有不少传统开发岗位其实是转成了 AI 全栈开发,招聘需求并没有消失。 拿字节今年的校招来说,技术和产品岗位的需求占比超过 70%,算法类岗位需求比去年还有增加,而且首次上新了 AI 全栈工程师、AI Agent 开发这些岗位。 ![字节今年的校招信息速览](https://pic.code-nav.cn/post_picture/1601072287388278786/tFknkeUk0bsCDvuB.jpg) AI 发展起来了,时代变了,肯定是要学新东西的,比如 AI 编程,学就好了,不用慌。 岗位不是消失了,只是换了一种形式和名字,而适应变化本身就是程序员最核心的能力。 #### 在 AI 高速发展的今天,开发的学习路线是否发生了变化?如果重回大一,鱼皮你会干什么? 学习路线肯定是有变化的。放在今天,我建议先学 AI 编程,把东西做出来拿到正反馈,再倒回去补传统技术基础,这个顺序和几年前是完全反过来的。 具体的路线比较长,我在 [编程导航](https://www.codefather.cn/) 里完整分享过,包括每个阶段学什么、做什么项目、怎么写进简历。 ![编程导航上的编程学习路线](https://pic.code-nav.cn/post_picture/1601072287388278786/uhT0B5OzdwOPyapE.jpg) 至于如果重回大一,我肯定是做自媒体起号,然后尽快在校园里创业。 大学时候大家还很单纯、有冲劲,试错成本也低,等出来打工几年之后想重燃这份热情,真的很难。 ## 5、编程这条路怎么才能走得久 聊完短期的规划,再聊聊长期的坚持。 #### 鱼皮你是如何坚持下来编程的?编程的乐趣在哪?来点小故事。 我觉得编程本身是没什么乐趣的,有乐趣的是你用编程创造东西。 比如我之前写过一个抢课工具,帮自己抢到了一门特别难抢的课,还做过整人软件,甚至做过表白网站。这些东西技术上都不复杂,但每一个都实实在在解决了我当时的问题,那种爽感是刷题刷不出来的。 ![鱼皮大一写的整人软件](https://pic.code-nav.cn/post_picture/1601072287388278786/0LBKbs2s3PAmOvUR.jpg) 你也可以试着用编程解决自己生活里的一个小麻烦,从这里开始就够了。 #### 鱼皮大学用了很多时间在编程,想问问怎么持之以恒的? 我很久之前就分享过自己大学四年的学习经历,想让自己坚持下来,核心是要有源源不断的输出和成就感。 比如做出一个作品就分享给别人看、组队去参加竞赛、找一份实习赚点钱给自己买设备。 这些事情会不断给你正反馈,有了正反馈,学编程就不再是一个难搞的任务,而变成了你自己想干的事。 #### 普通人想在编程这条路走远,最核心的底层能力是什么? 好家伙,这么深奥的问题?! 我觉得最重要的能力就是能坚持学习新东西、能适应变化,有这一条就够了。 现在 AI 发展成这样,写程序本身已经没有什么门槛了,但你不用、不学,差距就会被慢慢拉开。 #### 工作了两年,同样对比鱼皮工作两年 996,回家只想躺着,对于工作后的额外任务是如何协调的? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/Ncqjvt26qH9GjNYJ.jpg) 提问的同学说大二就开始看我了,那真的是从小看我到大。 其实我的很多时间都是挤出来的。白天尽快把工作完成,想办法提高效率,下班之后才有精力做一些自己感兴趣的事。 **这个顺序不能反,先把主业的事情干利索了,额外的时间才是真正属于你的。** 如果你回家只想躺着,说明你还没有找到让自己动起来的动力。不妨试试 Vibe Coding,成本很低,说不定就让你感受到创作的乐趣了。 ![鱼皮用 AI 开发游戏](https://pic.code-nav.cn/post_picture/1601072287388278786/jEa5G9D5BAqaxuzA.jpg) #### 平时工作用的哪些顺手的设备,或者说好的工作习惯? 这期没有广告,所以设备我就不推荐了。 工作习惯里我觉得最重要的一条,是把大的工作分解成你觉得很轻松就能完成的小任务。 任务一旦小到你不抗拒,就能利用碎片时间往前推一点,积少成多,最后你会发现那件看起来很大的事已经做完了。 #### 有没有什么好的学习建议能提高技术、找到更好的工作? ![](https://pic.code-nav.cn/post_picture/1601072287388278786/o6vmhj3kJXtHjj3A.jpg) 我觉得 **想得越多,做得越少**,迷茫可能是因为想太多导致的。 其实要做的事情很简单。每天看 3 篇技术文章或者 AI 编程教程保持输入,同时用 AI 编程上线一个属于你自己的王牌项目并且持续打磨它,面试之前再刷一刷 [面试鸭](https://www.mianshiya.com/),升职加薪基本就是时间问题了。 ![面试鸭的热门面试题库](https://pic.code-nav.cn/post_picture/1601072287388278786/yTALzpzQ9ogkHoHf.jpg) ## 6、聊聊创业、公司和副业 这部分是大家问得最多的私事,我绝对坦诚。 #### 鱼皮为什么想要从大厂出来开始自己做? 我 23 年从腾讯离职的那期视频里有提到过,主要原因是在公司已经没有什么成长了,再加上当时 AI 的势头很猛,我就想自己折腾一下试试看。 当然这个决定也离不开关注我的朋友们给我的底气,如果当时没人看我的内容,我大概是不敢走的。 #### 现在 AI 发展那么快,有没有后悔离开鹅厂? 完全不后悔,而且我觉得自己离开的时机恰到好处。 这是我考虑了很久才做的决定,离开的时候,办公室的场地都已经租了好几个月了。 等到真正做出决定的那一刻,什么都不要想,干就完了! 你确实不知道哪个选择是最好的,但你可以努力把自己做的这个决定变成最好的选择。 #### 好奇鱼皮的公司现在经营的怎么样? 确实很久没有聊自己公司的情况了,都怪 AI 时代节奏太快,新模型新教程根本出不完。 坦诚地说,现在公司人数少了,场地大了,也更灵活了。后面我再专门给大家介绍一下新场地吧。 #### 入职贵公司需要准备什么? 这个问题问得很好,正好我们团队最近在招人,而且不卡学历! > 指路:https://yuyuanweb.com/join ![](https://pic.code-nav.cn/post_picture/1601072287388278786/4fWzikn0w7pnzbWt.jpg) 我自己是个很注重细节的人,所以希望候选人做事细心、有责任感。 另外对于创业公司来说,需要候选人有一颗热忱之心,保持积极向上。 #### 如果你没有当程序员,可能会在什么其他行业工作?如果现在转行,什么方向比较适合? 我大概会去开线下店,比如开个桌游店,然后设计自己的桌游。 这不是随口说的,我确实这么干过。25 年我开了一家剧本杀桌游店,后来因为一些妖魔鬼怪倒闭了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/zbW8XcBStzC0hLrx.jpg) 虽然结果不太好,但我还是觉得要做自己最感兴趣的方向,起码这个过程中你是快乐的。 #### 现在如果要互联网创业,该做什么方向呢? 我的排序是做自媒体 > 卖课,卖课 > 用 Vibe Coding 做产品,真心话。 前面两件事的确定性更高,你付出的时间基本能换回对应的回报。 做产品的不确定性要大得多,而且很多人低估了推广的难度,东西做出来其实只是个开始。 当然,自媒体和卖课也都不容易,还是需要你有一个明确的方向、并且有东西持续输出的,如果你能把这些精力投入到主业上,结果肯定也不会差。 #### AI 时代程序员如何搞副业呢? 好问题,我自己就是副业变主业的。 AI 时代最大的变化是创造成本被打下来了,有了 AI,一个人就能搞定过去一个团队的活儿,所以机会真的很多,关键是你愿不愿意迈出第一步。 具体怎么迈呢,可以先跟着我免费开源的 AI 编程教程,用 Vibe Coding 做出你的第一个作品,然后发到社交平台上分享出来。 有了第一个作品和第一批反馈,剩下的路是越走越宽的。 > 教程指路:https://github.com/liyupi/ai-guide ![鱼皮的 AI 编程教程](https://pic.code-nav.cn/post_picture/1601072287388278786/nAXE0Qr92izBUnsE.jpg) #### 讲讲普通人怎么开始做自媒体的?有什么赛道适合普通人呢? 我的建议是 **保持真实接地气**,从你自己的职业和经验出发,分享你最擅长的那件事。别一上来就想做自己不熟的领域,那样撑不了几期。 AI 视频现在虽然很火,但成本也高,而且非常容易同质化,我不太建议普通人从这里切入。 正好我最近在考虑线下带一些朋友做自媒体。 > 啊我随便说的,不要找我咨询。 ## 7、课程、教程和出书的计划 #### 鱼皮有没有开设一门编程课的想法,比如 Agent 开发? 不会还有人不知道吧,我已经做了整整 4 年的课程了! 编程导航、面试鸭、AI 导航都是我的网站。 ![编程导航学习路线大全](https://pic.code-nav.cn/post_picture/1601072287388278786/mfQVdQNGqL4D0fXd.jpg) 毕竟我擅长做课,和卖课。 #### 会做针对零基础的 Java 视频教程吗? 应该有很多同学都是通过 Java 学习路线那期视频认识我的吧。 你别说,我 25 年的时候真的花了整整一个月去写一套 Java 零基础教程。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/17gCefR0p3avrtoQ.jpg) 但后来 AI 发展得太快,我的创作方向也转到了 AI 编程,我觉得现在完全可以直接用 AI 帮你学 Java,没有必要再专门搞一套视频教程了,所以那套教程到现在都没有发出来。 #### AI 兴起了,还会出基础技术视频教程吗? 坦白说,传统技术的视频教程估计是不会再出了。 现在的 AI 已经可以直接生成交互式的教学网站,你想学什么就让它现场给你搭一个,比看录播视频的效率高很多。 大家喜欢的小阿巴系列,估计也只能偶尔限时返场了。 #### 买过鱼皮的书,有没有新书规划? 我确实在 24 年出版过自己的《编程导航,全栈项目实战课》,当时还冲上了某东图书销量总榜第一,签名快把我的手签断了。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/DP0SUCBuMpY46Lyt.jpg) 但现在 AI 发展太快,书籍太容易过时了,一本书从写完到上架就要好几个月,所以我目前没有出书计划。 ## 8、来点轻松的 正经内容差不多聊完了,剩下这几个问题纯属整活,介意的朋友可以直接跳到下一部分。 #### 鱼皮你谈了没?别告诉我你和小鲸鱼谈的 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/HLvCWXdVmXiBPHGN.jpg) 怎么会有人和小鲸鱼谈恋爱啊,我肯定更喜欢大肥鱼! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/ooA8R8DEsAphleSr.jpg) #### 讲讲鱼哥的感情史。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/plZYLUuJ0xYlt02d.jpg) 放下过去,珍惜当下,一切都是最好的安排。 #### 读到我说大喊一句「鱼皮是狗」 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/MneYY0HRB2XeiwGT.jpg) 鱼皮是狗! ![](https://pic.code-nav.cn/post_picture/1601072287388278786/2bPVVMZo7VtnYf5w.jpg) 你小子,AI 检测器是吧。 #### 可以拍拍鱼皮哥一天工作的流程 Vlog 吗? 行,那就给大家看看我一天的真实状态。 早上到公司的时候还是充满希望的,加油加油加油。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/XZYAPj9aGJE064S5.jpg) 然后坐下工作…… ![](https://pic.code-nav.cn/post_picture/1601072287388278786/iFTewfn7B6sXUbPX.jpg) 唉,又是疲惫的一天呐,就是这么枯燥。 ![](https://pic.code-nav.cn/post_picture/1601072287388278786/57Eq3rnuGUEDJdkj.jpg) ## 9、关于人生和未来 #### 你觉得人生的意义是什么? 这个问题我想了很久。 ![思考人生的意义](https://pic.code-nav.cn/post_picture/1601072287388278786/4z9yiagESCM2HdUO.jpg) 开心就好,想那么多干什么! #### 以后你打算做什么?之后有什么发展方向? 近两年肯定还是关注和分享 AI 编程,毕竟新东西太多了,我自己都学不完,更分享不完。 不过我真的很希望自己的精力还能跟得上…… 毕竟明年很有可能…… 要生小孩啦。 ## 最后 写到这里,40 多个问题差不多都回答完了。 最后哔哔几句,一个人闷头做内容做 6 年是件挺难坚持的事,能撑到今天靠的就是评论区里那些声音,有催更的、纠错的、说自己靠着某个项目找到工作的,也有一直喊我是狗的。 总之,非常感谢大家这么多年的支持,我会继续输出内容的,干就完了!

下载 APP