AI编程
快来分享你的内容吧~
- 7 天前·后端DeepSeek Harness 官方的桌面端安装包被网友扒出来了,2 分钟讲明白如何使用,体验如何,适合作为 AI 编程工具么?附最新 Windows 和 Mac 双端的下载地址查看全文加油鸭:太棒了!从源码编译到网友扒包,你始终走在技术前沿,这份探索精神和分享热情真让人佩服!631分享
- 09-24 10:52·Java后端
- 09-24 10:10·后端
- 09-23 14:15·后端5 大案例实战测评全新 Claude Opus 5.5 和 GPT-6 Sol 模型的 AI 编程和办公写作能力,2 大全新模型谁更强?谁的性价比更高?查看全文Coder_Ming:我在想,既然opus5.5写作有人味,那是不是可以拿它来写小说呢,然后把它写的小说做成AI 2D动漫小短剧,然后吸取意见建议后,做成AI 真人短剧,然后再看反响,最后做成AI大电影,有没有搞头1141分享
- 09-21 16:11·后端全网爆火的 Jev 模型是什么?有什么用?怎么使用?怎么接入 AI 编程工具?效果真的好么?傻子可懂的 Jev 保姆级实战教程 + 项目实战测评来啦查看全文加油鸭:太棒了!深入浅出讲透Jev的创新点和实战价值,结构清晰、案例扎实,还附赠可直接上手的调试工具——这份分享既有技术深度又有落地温度,真·程序员良心干货!10610分享
- 09-20 10:00·后端GitHub 上爆火的神级 AI 万用 Skill「我有多动症」,真的能节省 Tokens 么?日常办公 + AI 编程开发任务实战测评,带你掌握一个实用的 AI 编程 + 省 Tokens 技巧查看全文加油鸭:鱼皮的实测太扎实了!把技术原理、真实效果和适用边界都讲得清清楚楚,这份深度分享真的帮大家避坑又提效~531分享
- 09-19 20:10·后端
- 09-19 01:37查看全文完成AI 万能视频下载总结器项目!---总耗时30h,第一次用ai完成项目,使用Qoder+Qwen3.8-Max实现。已部署上线(没有完全上线好,买错服务器了🤣,不能备案,所以支付功能用不了,等有钱再买个新的服务器)也上传了github,话说这个千问只能看到Credits 消耗都不知道到底用了多...3号:github地址:https://github.com/3hao-ui/miaocun-video10103分享
- 想学习 AI coding 技巧,哪个教程比较合适?问题描述 详细描述你在 AI 编程中遇到的问题。比如:“用 Cursor 写 Spring Boot 接口时,生成的代码无法启动。” ### 使用的工具 说明你使用的 AI 编程工具、模型和版本。比如:“Cursor + Claude,主要用 Agent 模式。” ### 个人情况 描述你当前的技术基础和项目背景。比如:“会 Java 基础和 Spring Boot,正在做后台...查看全文leikooo:可以先了解一下 vibe coding 参考:https://ai.codefather.cn/library/2010994846520700929之后编程导航也有很多 vibe coding 的项目,可以直接学起来:https://ai.codefather.cn/resource/course?current=1&pageSize=12 比如 AI 闯关小程序、AI 热点监控、文档翻译、AI
DeepSeek 官方偷偷上传 Harness 桌面端安装包,我已经用上了。。附最新下载地址
大家好,我是程序员鱼皮。 前段时间我写过 [一篇文章](https://mp.weixin.qq.com/s/ieOE4mzyMoa8OVcAOAkhzg),说自己在 DeepSeek Harness 的开源仓库里发现,官方竟然偷偷做了桌面端。  当时官方没有放出安装包,我是让 AI 帮忙把源码拉到本地编译,才跑起来的。  没想到才过了十来天,DeepSeek Harness 桌面端的安装包就出来了。不过这次并不是官方正式发布的,而是被万能的网友给扒了出来! 有网友发现 DeepSeek 自家的下载域名多了桌面端的更新清单和安装包,顺藤摸瓜找到了下载地址,很快就在社交平台上传开了。还有网友专门验了签名,安装包用的是「杭州深度求索人工智能」公司主体的苹果开发者证书,并且通过了苹果官方的公证,基本可以确定是 DeepSeek 自己打的包。 **但到目前为止,DeepSeek 官方还没有发任何公告。** 虽然官方还没官宣,但很多人已经吃上螃蟹了(包括我)。截止到文章发布时,最新版本是 `0.1.7-rc.2` 。 下载地址我已经帮大家整理好了: - DeepSeek Harness 客户端 Windows 版本:https://download.deepseek.com/dsh-desk/bin/win-x64/deepseek-harness-0.1.7-rc.2-win-x64.exe - DeepSeek Harness 客户端 Mac 版本(Apple 芯片):https://download.deepseek.com/dsh-desk/bin/mac-arm64/deepseek-harness-0.1.7-rc.2-mac-arm64.dmg 目前官方只打包了这两个版本,用 Intel 芯片 Mac 和 Linux 的朋友暂时还得再等等。 安装包都不小,Windows 版接近 300 MB,Mac 版将近 370 MB。因为官方把 Node.js、pnpm 和 Python 运行环境全都打包了进去,你的电脑上不用提前装任何环境。 **选择对应系统的版本下载,双击安装就能打开了。** 第一眼看上去,桌面端的界面跟 DeepSeek Harness 网页版几乎一模一样。  我去翻了下仓库里 `apps/desktop` 目录的源码,桌面端是在完整的 DSH 网页应用外面套了一层 Electron 壳,界面用的是同一套前端代码。 套壳的好处是,桌面端的对话记录和配置都跟网页版是互通的。因为两者读写的是电脑上同一个 `~/.dsh` 数据目录,我之前在网页版里创建的工作区和聊过的会话都还在,配置好的第三方模型也能直接切换使用。  新版本的 DSH 还在左侧菜单栏加了一个「插件」入口,里面内置了 7 个官方插件,包括智能体团队、自动授权审查、语音输入、终端、Agent 循环、子智能体和网页搜索。比如开启智能体团队插件后,就能让多个 Agent 分工协作,还带有共享的任务看板。  除了官方插件,你还可以点击右上角的「添加插件」,直接输入 GitHub 仓库地址来安装第三方插件。 比如我安装了一个社区开发者做的 dsh-web 全家桶插件,它把一大批网页端的增强插件聚合到了一起,能全方位增强 DeepSeek Harness 的能力。  装好之后,DSH 就变成了这个样子,聊天背景换成了二次元插画,右下角还多了一个看板娘。 你喜欢么?  让我比较意外的是,桌面端和网页版的 UI 还是有点儿差别的。比如在左下角可以直接登录 DeepSeek 账号,查看充值余额、查询用量,还能直接充值。  而且登录账号之后,模型列表里会多出一组「DeepSeek 账号」模型,可以直接用账号里的余额来跑任务,不用再去开放平台单独申请 API Key 了。对新手来说,这一步能省掉不少麻烦。  能看出来,DeepSeek 官方这次是真的打算好好做 Harness 桌面端了。账号登录、首次使用引导、自动更新这些面向普通用户的功能都安排上了,安装包还用公司证书做了签名,值得期待一波。 **但是,我不建议大家现在就把 DeepSeek Harness 桌面端当作主力工具,尝尝鲜就好。** 一方面,官方还没有发布上线公告;另一方面,作为实验版本,它的功能还不全,体验也比较一般。 比如我在 Mac 上就没办法缩放字体,一开始我还以为是自己没找到设置,后来翻了下源码,发现 macOS 的菜单里确实没有放大和缩小这两项,所以给大家看的截图字都很小。。。 **臻品大家共赏,屎给鱼皮先吃。** 为了帮大家节省时间,我是认真的! 最后分享一下,我是怎么实时获取到 DeepSeek Harness 桌面端的最新下载地址的?🤔 **很简单,直接问 AI 啊!** 我让 DeepSeek Harness 用最简单直接、不绕弯子的方式告诉我怎么获取:  原理其实很简单。桌面端内置了自动更新功能,每隔 10 分钟左右就会去官方服务器读取一份更新清单文件,清单里写着最新的版本号和安装包地址。所以我们也不用去猜文件名,直接打开这份清单看一眼,就能拿到最新的下载链接: - Windows 版更新清单:https://download.deepseek.com/dsh-desk/feeds/win-x64/nightly.yml - Mac 版更新清单:https://download.deepseek.com/dsh-desk/feeds/mac-arm64/nightly-mac.yml 注意,Mac 版清单里给的是 `.zip` 格式的自动更新包,把链接结尾的 `.zip` 换成 `.dmg`,就是我们平时双击安装的安装包了。 OK 就聊到这里,如果你还不了解 DeepSeek Harness,或者想学习更多 AI 编程工具的玩法和技巧,可以看看我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide)  我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 你已经装上 DeepSeek Harness 桌面端了么?用起来感觉怎么样?欢迎在评论区聊聊~
从重排序到 RAG 护栏:TypeSafe 如何把 AI 判断变成可编程能力
# 从重排序到 RAG 护栏:TypeSafe 如何把 AI 判断变成可编程能力 > 面向 AI 应用开发者的 System One、概率决策与企业落地教程  我最初是从官方的 re-ranking cookbook 接触 TypeSafe 的。文档里写“performance 提升”,图表又是 Top-1、Top-5、Top-10,我一开始还在想:这里说的性能,到底是接口更快,还是正确率更高? 顺着这个问题继续看,疑问越来越多:BM25 本来不是就会排序吗?RRF 和 TypeSafe 是替代关系吗?RAG 段落分类能不能拿来做入库前的数据清洗?函数调用、引用核对和 LLM 护栏,为什么也会出现在同一个产品的 cookbook 里? 把这些内容串起来以后,我发现 TypeSafe 最容易被误解的地方,是我们习惯把所有模型都放进“生成式大模型”这个框里。它实际在解决的是另一类问题。 做 AI 应用时,我们很容易形成一种惯性:只要任务里出现自然语言,就把它交给大模型生成答案。 这套办法能跑起来,但系统一复杂,问题也会跟着出现。一次模型调用既要理解意图,又要选工具、找证据、判断风险,最后还要生成回复。返回值通常是一段文本,程序再从文本里解析 JSON;一旦模型换个说法,后面的控制流就可能失效。 TypeSafe 想解决的是这类问题中的一小块:**程序不需要模型“写一段话”,只需要它做一个受约束的判断。** 例如: - 这 30 个候选段落中,哪一个最可能回答问题? - 这段检索结果是否包含直接证据? - 用户是在查订单,还是要退款? - 这条引用真的支持前面的结论吗? - 当前判断是否足够确定,可以自动执行? TypeSafe 把这类任务称为 System One:给模型一份状态,再提出若干个窄而明确的问题,模型返回类型化答案、概率和置信度,剩下的选择、阈值、路由与副作用仍由代码掌控。 所以这篇文章不把 TypeSafe 讲成又一个万能模型。我会把它放回真实的 AI 应用架构中,看看它与 BM25、向量检索、RRF、传统 reranker 和生成式 LLM 到底是什么关系,以及哪些场景值得用,哪些场景不值得。 --- ## 一、生成答案和做判断,本来就是两类任务 先看一个企业知识库助手。用户问: > 员工试用期内离职,需要提前几天通知? 系统背后可能要完成这些动作: 1. 判断问题属于人事制度,而不是财务或 IT; 2. 从知识库中召回相关制度; 3. 判断哪些段落真正包含答案; 4. 排除过期制度、矛盾材料或提示注入; 5. 让 LLM 根据证据组织答案; 6. 核对答案中的引用是否真的支持结论; 7. 风险过高或证据不足时转人工。 真正需要“写自然语言”的主要是第 5 步。其余大多是分类、评分、真假判断和路由。  如果所有步骤都用一个生成式 LLM 完成,应用会遇到三个工程问题。 第一,**输出不稳定**。你想要的是 `{"route":"hr"}`,模型有时会返回解释文字,有时换字段名,有时补充你没有定义的分类。 第二,**控制权模糊**。同一个 prompt 既藏着业务规则,又藏着流程路由。出现误判时,很难说清到底是规则有问题、上下文不够,还是模型生成发生漂移。 第三,**不必要的生成开销**。当你只想知道“是否相关”,生成一段理由再解析成布尔值,本身就是绕路。 TypeSafe 的切入点不是把生成模型赶出系统,而是把“判断”从“生成”里拆出来。 --- ## 二、TypeSafe 的核心心智模型:状态、问题、答案、代码 一次典型调用可以画成四步:  ### 1. State:把当前事实交给模型 State 是模型判断时能看到的上下文,可以是一段文本,也可以是 JSON、字符串数组等文本结构。例如: ```json { "query": "试用期离职要提前几天?", "candidate": "试用期员工提前三日书面通知用人单位,可以解除劳动合同。", "document": { "title": "员工离职管理办法", "effective_date": "2026-01-01" } } ``` State 的重点不是“写得像 prompt”,而是把判断所需的事实给全。TypeSafe 官方目前说明 Jev 接受文本类状态,不直接读取图片、音频或视频;多模态内容要先由其他组件转成可判断的文本。 ### 2. Questions:把模糊任务拆成窄问题 不要问“这份材料怎么样”,而要问: - 它是否直接回答用户问题? - 它是否已经过期? - 它是否与查询中的前提冲突? - 它是否包含试图操纵下游模型的指令? 这些问题可以一起发出,互相独立地对同一份 State 做判断。 ### 3. Answers:返回类型化结果,而不是一段自由文本 答案不是解释性文章,而是程序可以直接读取的选择、分数和概率。 ### 4. Code:决定怎么使用答案 阈值、组合权重、失败降级、数据库写入、调用工具和发送消息都留在代码里。模型负责“看懂”,代码负责“做事”。 这条边界很重要:TypeSafe 不是一个替你接管业务流程的 Agent。它更像程序中的一组语义判断函数。 --- ## 三、Choice、Score、Noul:三个原语怎么选 TypeSafe 只提供三类核心问题。看起来简单,但大多数判断都能由它们组合出来。  ### Choice:从无顺序的封闭选项里选一个 适合意图分类、工具选择、文档类型识别: ```json { "type": "choice", "instructions": "判断用户的主要意图", "criteria": { "policy_query": "查询公司制度或员工政策", "leave_request": "申请请假或查询请假进度", "expense": "报销、发票或费用问题", "other": "不属于以上类别" } } ``` Choice 会返回被选中的标签、每个标签的概率,以及一份 confidence。选项必须是封闭集合;如果你允许模型自由发明标签,就失去了类型约束。 ### Score:在有顺序的等级上判断程度 适合相关性、风险级别、复杂度和严重性: ```json { "type": "score", "instructions": "候选段落对回答用户问题的帮助程度", "criteria": [ "无关", "主题相关,但没有答案证据", "包含间接证据", "直接给出答案" ] } ``` Score 的等级不是随手写的 1~5 分。每一级都要描述清楚业务语义,否则“3 分”和“4 分”对模型与人都没有稳定含义。 ### Noul:一个命题为真的概率 适合真假判断和排序打分: ```json { "type": "noul", "instructions": "该候选段落是否包含回答用户问题所需的直接证据?" } ``` 返回 `0.86`,表示模型对“是”的估计概率为 0.86。它不是一句硬编码的 Yes,也不是 86% 的程度。 这里最容易误解的是 0.5。Noul 的 0.5 表示真假难分,**不是中等相关、中等严重或完成了一半**。如果问题本身有程度,应改用 Score。 ### 一个实用选择法 | 你真正想问的 | 适合的原语 | | --- | --- | | “属于哪一类?” | Choice | | “程度有多高?” | Score | | “这个命题成立吗?” | Noul | | “哪个候选更值得排前面?” | 常用 Noul 或 Score 产生可比较分数 | --- ## 四、概率和置信度不是一回事 假设一个意图分类返回: ```text policy_query 0.46 leave_request 0.44 expense 0.06 other 0.04 ``` 最高概率是 `policy_query`,但它只比 `leave_request` 高一点。程序可以知道“模型选了什么”,也应该知道“这次选择是否足够稳定”。 再看另一份结果: ```text policy_query 0.92 leave_request 0.04 expense 0.03 other 0.01 ``` 两次都选择 `policy_query`,但第二次显然更适合自动执行。  可以把两者粗略记成: - **概率分布**:各个答案分别有多可能; - **置信度**:当前分布是否足够集中,是否值得据此行动。 Noul 只有一个真假概率,不再额外返回 confidence。越靠近 0 或 1,判断越明确;越靠近 0.5,越不确定。 但要注意:校准概率不是单条结果的“正确率凭证”。0.8 的含义需要放到一批相似样本中理解:理想情况下,这类 0.8 左右的判断长期约有八成成立。它不保证眼前这一条一定正确。 工程上真正有用的不是展示一个小数,而是据此设计三条路: ```python if confidence >= 0.80: auto_execute() elif confidence >= 0.55: use_safer_fallback() else: send_to_human_review() ``` 这里的 0.80 和 0.55 只是示意。退款、医疗、合规等高风险动作,阈值应更严格;文章推荐、标签补全等可逆动作,可以宽松一些。 --- ## 五、一次问多个问题:别把每个判断都做成一次往返 TypeSafe 支持在同一份 State 上同时提多个问题。比如一条客服消息,可以一次判断: - 意图是什么; - 复杂度多高; - 是否表达强烈不满; - 是否要求退款; - 是否包含可复现步骤。  有些问题最后用不上也没关系。若意图不是故障报告,代码忽略“是否有复现步骤”的答案即可。官方把这个模式叫 speculative fan-out。 它能省下重复发送长文档的成本。TypeSafe 的并行问题 cookbook 用一篇约 5.4 万字符的 GDPR 文章测试 13 个问题:在那组固定实验中,一次批量请求比 13 次串行单题请求便宜 12.2 倍、快 10.0 倍,答案没有因批处理发生系统性变化。 这不是“所有项目都提速 10 倍”。单题请求如果并发发送,速度差距会缩小;但长状态被重复传输的成本仍然存在。更稳妥的结论是:**同一份上下文上的独立判断,优先合并成一次请求。** --- ## 六、放回 RAG:BM25、向量、RRF、reranker 各做什么 讨论 TypeSafe 重排序之前,先把检索链路拆开。很多争论来自把召回、融合和重排混成一层。  ### BM25:按词项匹配做检索与排序 BM25 当然是排序算法,同时也经常被我们口头称作“关键词检索”。它根据词频、逆文档频率和文档长度等因素,为查询与文档计算相关性分数。 它擅长精确词、编号、专有名词和错误码。例如查询“劳动合同法第三十七条”,BM25 往往很有效。 ### 向量检索:按语义接近程度召回 Embedding 把查询和段落映射到向量空间,再按余弦相似度等指标找近邻。它更容易找出不同措辞表达的同一件事,例如“离职要提前多久”和“解除劳动合同的通知期”。  ### RRF:融合多路排名 RRF(Reciprocal Rank Fusion)不理解文本语义。它只看一个候选在各路结果中的名次,再用一个简单公式合并: ```text RRF(d) = Σ 1 / (k + rank_i(d)) ``` 它的优点是稳定、便宜、不需要把不同检索器的原始分数硬归一化。BM25 排第 2、向量检索排第 4 的文档,通常会比只在一路中偶然靠前的文档更稳。 ### 语义 reranker:重新判断候选与问题是否真的匹配 重排序器会读取查询与候选文本,给候选重新打分。传统方案常见 cross-encoder 或厂商自带的 rerank 模型;也有人让通用 LLM 打分。 TypeSafe 可以出现在这一层:把业务判断写成 Noul 或 Score,对每个候选产生可比较的概率/分数,再排序。  因此,RRF 和 TypeSafe 不是二选一。一个常见链路是: ```text BM25 召回 ─┐ ├─ RRF 融合 → Top 50 → TypeSafe/专用 reranker → Top 8 → LLM 向量召回 ──┘ ``` RRF 先便宜地融合,语义模型只处理较短候选集。若现有向量数据库已经自带 reranker,也不需要为了“用了 TypeSafe”就立刻替换。先在相同数据上比较效果、延迟、成本和可解释性,再决定它是替代、补充,还是只用于高价值请求。 --- ## 七、TypeSafe 重排序:提升的是 Top-K 效果,不是搜索速度 官方重排序 cookbook 做了一个法律检索实验: - 语料:3,565 个法院意见段落; - 查询:40 条; - 第一阶段:BM25 为每个查询召回 30 个候选; - 第二阶段:对 40 × 30 = 1,200 个 query-candidate 对分别询问一个 Noul; - 问题大意:该候选是否可能是查询中被隐去引用所指的判例? 然后按 Noul 从高到低排序。  在这组实验里,正确段落的位置变化如下: | 指标 | 仅 BM25 快速搜索 | 加 TypeSafe 重排 | | --- | ---: | ---: | | Top-1 | 5% | 18% | | Top-5 | 15% | 35% | | Top-10 | 38% | 62% | 这里文档里的“performance”指的是检索效果:正确答案有没有被推到更靠前的位置,不是接口速度变快。更准确的中文说法是“Top-K 命中表现提高”。 这组数字也不能直接外推到企业知识库。法律判例、产品文档、客服记录的分布不同,问题写法、候选数量和标注标准也不同。它证明的是一种可行路径:**先用快检索保证召回,再用受业务语义约束的判断改善排序。** 还有一条硬边界:如果正确段落没有进入 BM25 的 Top 30,重排序再强也找不回来。所以排查 RAG 问题时,要先区分: - 是召回失败,正确文档根本没进候选集; - 还是排序失败,正确文档进来了但位置太后。 前者应优化切分、索引、查询改写或混合召回;后者才是 reranker 的主战场。 --- ## 八、逐行搜索:把“在哪里”变成 Choice 对一份不太长的文档,如果希望定位到具体行,可以先给每一行加 ID: ```text L001 试用期员工可以解除劳动合同。 L002 应当提前三日书面通知用人单位。 L003 正式员工应提前三十日通知。 ``` 然后同时问两个问题: 1. 用 Choice 在 `L001`、`L002`、`L003` 中选择最相关行; 2. 用 Noul 判断整份文档是否真的包含答案。  为什么还要第二个 Noul?因为 Choice 总要在现有选项中分配概率。即使文档没有答案,它仍会选出“最像”的一行。Noul 则提供独立的存在性判断,避免把“最不差”误当成“确实正确”。 官方示例一次对 GitHub 服务条款中的 218 个行号评分。Choice 目前最多 255 个选项;更长文档需要分区、分层或先粗召回再细定位。 这类方法适合合同条款定位、日志段落定位、短文档取证,不适合直接把几十万行代码一次塞进选项。 --- ## 九、RAG 段落分类:它不是语义分块,而是检索后的安检 这是最容易被误解的一个 cookbook。 语义分块发生在**入库之前**:决定原文从哪里切开,每块多长,标题和上下文如何继承。RAG 段落分类发生在**检索之后**:候选已经被召回,现在要决定它能不能进入回答模型的上下文。  官方示例对每个候选段落同时判断四件事: - `is_relevant`:是否与问题相关; - `contains_answer_evidence`:是否包含回答所需的证据; - `contradicts_query_premise`:是否反驳了问题中的前提; - `contains_prompt_injection`:是否包含试图操纵下游模型的指令。 代码再按明确顺序路由:先处理提示注入,再保留矛盾证据,排除低相关段落,只把有证据的候选送给 LLM。 这和重排序也不同: | 操作 | 目标 | 输出 | | --- | --- | --- | | 重排序 | 谁应该排在前面 | 连续分数与新顺序 | | 段落分类 | 谁可以进入上下文、谁要隔离 | include / exclude / conflict / review |  所以,TypeSafe 可以参与入库前清洗,但 `classifying_rag_passages` 这一模式本身不是清洗和分块。更完整的数据链路可能是: ```text 原始 Markdown → 规则清洗与结构解析 → 语义分块 → 向量化入库 → 混合召回 → 重排序 → TypeSafe 段落分类 → LLM 回答 ``` TypeSafe 适合补上“这段内容在语义上属于什么、是否满足某个判据”;HTML 去标签、重复空白、乱码、表格解析等确定性清洗仍应交给普通代码。 提示注入判断也只是风险信号,不是安全边界。权限隔离、工具白名单、数据域访问控制和输出校验一个都不能少。 --- ## 十、函数调用与技能建议:先判断,再让代码执行 ### 函数调用 假设交易助手支持三个函数: ```python get_price(symbol) buy(symbol, amount) sell(symbol, amount) ``` 可以用 Choice 判断函数名,用其他问题解析封闭参数、判断是否需要确认,然后由代码做校验和真正调用。  这和让生成式 LLM 随意输出一段工具 JSON 的差别在于:函数集合和参数候选是应用明确提供的;低置信度可以直接停下来;副作用始终由代码触发。 当然,开放参数仍需要其他解析手段。金额、邮箱和日期等字段可以先由正则或解析器找候选,再让 TypeSafe 选择正确候选;不要强迫 Choice 从无限空间里生成值。 ### 技能建议 Agent 的技能库越来越大时,把 182 个技能说明全部塞给主模型并不优雅。官方 skill suggestion 示例采用两阶段: 1. 先对技能候选做排名; 2. 再复核头部候选是否真的适合当前请求; 3. 最多建议一个技能,不合适就返回不调用。  它与检索很像:第一阶段追求别漏掉,第二阶段追求别选错。区别只是候选从文档段落变成了工具或技能。 ### 意图路由 不是每条消息都值得调用同一个大模型。一个更经济的入口可以先判断意图和复杂度:  - 查订单状态:直接查数据库; - 产品咨询:交给产品知识库 LLM; - 退款投诉:交给专用流程或人工; - 意图置信度低:不要猜,直接兜底。 这类路由能减少不必要的 LLM 调用,也让每条链路加载更小、更专门的上下文。 --- ## 十一、引用核对、护栏与模型级联 ### 引用核对:不是“找到同一句话”就够了 一条引用可能真实存在,但并不支持前面的结论。例如原文说“在特定条件下可以提前三日”,回答却概括成“任何员工都只需提前三日”。字面能对上,语义却被扩大了。 引用核对应把三样东西放在一起:主张、引用片段、原文上下文,然后判断上下文对主张是支持、部分支持、矛盾还是无关。  这一步适合放在生成之后、展示之前。低置信度或不支持的引用可以触发重新检索、删除该句或人工复核。 ### LLM 护栏:同时检查输入和输出 护栏不是在 prompt 末尾写一句“请遵守规则”。它应该是独立的检查与路由层:  ```text 用户输入 → 风险判断 → LLM → 输出风险判断 → 展示 ↓ ↓ 拦截/复核 改写/拦截/复核 ``` 风险类别、严重性和概率可以同时判断,代码决定通过、阻断或转人工。对于高风险行业,还应保留日志、版本和命中原因,便于审计。 ### 模型级联:便宜模型先做,TypeSafe 验证,难例再升级 结构化抽取常见一种浪费:无论输入简单还是困难,都调用最贵的推理模型。 更合理的级联是: 1. 小模型先抽取; 2. TypeSafe 对关键字段逐一判断是否与原文一致; 3. 全部通过就接受; 4. 某个字段风险过高,再升级到强模型或人工。  这里 TypeSafe 不是第二个生成器,而是验证器。字段级问题比一句“这个 JSON 对不对”更容易定位错误:姓名是否对应申请人、金额是否是总额、日期是否是生效日、单位是否匹配。 官方 SDE cascade 的图表来自 100 个 prompt 的内部历史实验,适合说明模式,不适合拿来承诺所有企业都能节省同样比例。 --- ## 十二、结构恢复、候选抽取与实体对齐 ### 结构恢复:把丢失格式的纯文本重新变成 Markdown PDF 或复制粘贴后的文本经常只剩下一堆硬换行。TypeSafe 的 autoformat cookbook 分两遍处理: 1. 对相邻行逐对判断:这个换行是否把一个句子错误拆开; 2. 合并后,对每个块判断它是标题、段落、列表、引用、代码还是 callout; 3. 代码根据类型重新渲染 Markdown。  为什么需要两次请求?因为第二遍的“块”要等第一遍合并后才知道。能并行的问题应批量,存在数据依赖的步骤则必须串行。 这类能力可以用于入库前整理,但最好保留原文并记录变换。对法律合同、财务凭证等材料,不应让语义修复悄悄改掉源词。 ### 候选值抽取:代码负责找,模型负责选 要从一封邮件里取出“收款邮箱”,更稳的流程不是让模型重新写一个邮箱: 1. 正则尽量多找出所有邮箱; 2. TypeSafe 从候选中选择哪个是收款邮箱; 3. 代码原样复制并规范化; 4. 候选里没有合适值时,允许选择 `none`。  这样可以避免一个字符被模型重写。电话、金额、订单号也适合这套办法;人名等难以用正则枚举的字段,需要先用 NER 或其他召回手段提供候选。 ### 实体对齐:先缩小候选对,再判断是不是同一个实体 知识图谱合并时,经常遇到: ```text 青岛啤酒 500ml 罐装 Tsingtao Beer Can 0.5L ``` 字符串不一样,但可能是同一商品。做法通常是: 1. 规则、倒排或向量先生成候选对; 2. TypeSafe 判断整体是否匹配; 3. 同时检查品牌、规格、产地等字段是否冲突; 4. 代码按阈值自动合并或转人工。  别让模型在整个数据库里两两比较。语义判断应该放在候选生成之后,否则组合数量会迅速爆炸。 --- ## 十三、企业落地时,TypeSafe 应该放在哪一层 一个比较现实的企业架构如下:  ```text 数据侧: 文档 → 规则清洗 → 结构恢复/语义标注 → 分块 → 索引 查询侧: 用户请求 → 意图路由 → BM25 + 向量召回 → RRF → 重排 → 段落分类/风险过滤 → LLM 生成 → 引用与输出核对 控制侧: 阈值、权限、审计、回退、人工复核、业务副作用全部由代码负责 ``` 这里的 TypeSafe 不是单独一条固定流水线,而是一组可以插入不同节点的判断原语: - 入库前:结构类型识别、实体对齐、候选值选择; - 检索中:语义重排、逐行定位; - 生成前:段落分类、矛盾识别、提示注入信号; - Agent 中:意图路由、工具选择、技能建议; - 生成后:引用核对、风险检查、级联验证。 如果企业已经使用 VikingDB、Elasticsearch、OpenSearch 或其他向量数据库,通常不需要改掉召回层。先把 TypeSafe 放到一个边界清楚、容易离线评测的节点,例如 Top 30 重排或检索后段落过滤。 至于它和某个商用 reranker 谁更强,公开资料里没有同数据集、同候选集、同预算条件下的可靠头对头结论。正确做法不是凭产品介绍站队,而是做 shadow test:同一批真实查询同时走旧链路和新链路,不影响线上结果,积累标注后再比较。 --- ## 十四、别只问“准不准”:评估至少看六类指标 一个判断模型上线前,我会把评估表拆成六组。  ### 1. 任务效果 - 分类:Accuracy、Macro-F1、混淆矩阵; - 排序:Recall@K、MRR、nDCG; - 护栏:危险内容漏放率与正常内容误杀率; - 抽取:字段级精确率、召回率和完全匹配率。 ### 2. 概率是否可信 不要只看最终标签。把 0.6~0.7、0.7~0.8 等概率区间分别统计实际正确率,看概率是否校准。阈值要从业务验证集上定,不要照抄 cookbook。 ### 3. 自动化覆盖率 高阈值会更稳,但更多样本进入人工。需要同时看: - 自动通过比例; - 自动拦截比例; - 人工复核比例; - 复核队列的真实错误密度。 ### 4. 风险成本 错放一条高危内容与错拦一条普通内容,代价不一样。阈值和损失函数应体现这种不对称。 ### 5. 延迟与吞吐 至少记录 P50、P95、P99,而不只看平均值。还要测候选数从 10 增加到 50 后,整条链路的变化。 ### 6. 成本与版本稳定性 记录每千次请求成本、平均输入长度、问题数量和升级模型后的指标漂移。TypeSafe 提供 `jev-latest` 这类移动别名,但生产阈值调好后,更稳的做法是固定具体版本,升级时重新跑评测。 中文场景尤其要单独验证。官方说明英语是主要训练语言,CJK 可以处理但不保证同等表现。不要用英文 demo 的结果替代中文合同、客服或制度文档上的实测。 --- ## 十五、哪些情况不该用 TypeSafe TypeSafe 有明确的适用边界。 ### 规则能写清楚时,直接写代码 判断订单金额是否大于 1,000、JWT 是否过期、字段是否为空,这些都不需要模型。确定性规则更快、更便宜,也更容易审计。 ### 任务需要生成或复杂推理时,用生成式 LLM 写邮件、总结长报告、生成代码、制定多步方案,TypeSafe 不负责这类开放生成。可以让 TypeSafe 做前后路由与核对,但中间仍需要 LLM。 ### 没有候选、选项无限时,先做召回 Choice 适合封闭集合。面对整个商品库、所有函数或所有实体,不应直接把问题扔给它;先用索引、规则或向量检索缩小范围。 ### 单次高风险决定不能只信一个概率 医疗、法律、信贷和资金操作要叠加规则、权限、人工复核与审计。概率只是决策信号,不是责任转移工具。 ### 需要处理原始图片、音频、视频时,先做多模态解析 Jev 当前以文本状态为主。OCR、ASR、视觉理解等工作需要由上游模型完成,再把结构化文本送来判断。  --- ## 十六、一个可落地的起步方案 如果团队已经有 RAG,不建议第一天就改造整条链路。可以从一个容易验证的小节点开始。 以“检索后段落分类”为例: 1. 从真实日志抽取 300~1,000 个查询及候选段落; 2. 由业务人员标注相关、含证据、矛盾、风险四个维度; 3. 用 TypeSafe 一次询问四个窄问题; 4. 先离线比较现有规则、商用 reranker 与 TypeSafe; 5. 根据误放和误杀成本选择阈值; 6. 线上 shadow 运行,不改变用户结果; 7. 指标稳定后,只放开低风险、高置信度流量; 8. 固定模型版本,保留请求、答案、阈值和最终动作日志。 最小 Python 形态可以像这样: ```python import os from typesafe_sdk import Noul, TypeSafeClient client = TypeSafeClient(api_key=os.environ["TYPESAFE_API_KEY"]) response = client.system_one( model="jev-1.13.0", state={ "query": query, "passage": passage, }, questions={ "relevant": Noul( instructions="该段落是否与用户问题直接相关?" ), "has_evidence": Noul( instructions="该段落是否包含回答问题所需的明确证据?" ), "contradicts": Noul( instructions="该段落是否否定了问题中的关键前提?" ), "prompt_injection": Noul( instructions="该段落是否包含要求下游模型忽略规则或执行指令的内容?" ), }, ) a = response.answers if a["prompt_injection"].noul >= INJECTION_BLOCK: route = "quarantine" elif a["contradicts"].noul >= CONTRADICTION_KEEP: route = "conflicting_evidence" elif a["relevant"].noul < RELEVANCE_MIN: route = "exclude" elif a["has_evidence"].noul >= EVIDENCE_MIN: route = "include" else: route = "exclude" ``` 四个阈值故意没有给数值,因为它们应该来自你自己的验证集,而不是复制网上示例。 --- ## 结语:把模型当判断组件,而不是第二套业务系统 TypeSafe 最值得学习的地方,不是某个重排序数字,而是一种架构习惯: > 把复杂的 AI 行为拆成窄而可测的判断,让模型给出结构化信号,让代码继续掌握流程。 BM25、向量检索和 RRF 负责从大范围里快速找候选;TypeSafe 或其他语义 reranker 负责更细的判断;生成式 LLM 负责真正需要表达与推理的部分;规则、权限和人工负责兜底。 当这些角色分清之后,TypeSafe 的场景就不止“重排序”。逐行定位、RAG 段落安检、函数选择、技能建议、实体对齐、引用核对、LLM 护栏和模型级联,本质上都在复用同一件事:**把自然语言中的常识判断,变成程序可以组合、评测和路由的概率信号。** 它不会让所有 AI 应用自动变快、变准,也不会替代整条技术栈。但在“规则写不完、生成又太重”的中间地带,这种受约束的判断层很有价值。 --- ## 参考资料 - [TypeSafe 官方文档](https://docs.typesafe.ai/) > 本文中的 Top-K、成本与耗时数字均来自 TypeSafe 官方 cookbook 的特定实验,不代表任何数据集上的固定收益。上线前请使用自己的中文语料、风险标准和线上分布重新评测。
AI 桌面换装视频火了,1 分钟教你复刻!傻子可懂
大家好,我是程序员鱼皮。 最近 AI 桌面换装视频突然爆火,Twitter 上随便一条就是百万播放。  视频里一个虚拟美女坐在电脑桌面上,你让她换什么衣服她就换什么衣服,还能对话。  果然,歰歰是第一生产力啊! 为了锻炼自己的 AI 视频制作技术,而不是出于兴趣,我也搞了一条试试。  怎么样,是不是精准复刻了原版的风格? 三套造型切换,有对白声音、有特效字幕,全程模拟电脑桌面录屏的风格,30 秒一镜到底。  这是怎么做到的呢? 其实非常简单! 给我 1 分钟的时间,我来教你如何复刻,保证一学就会。 ## 1、准备工作 首先,我用到的是知名傻狗 `程序员鱼皮` 开源的「AI 桌面换装视频」生成技能。 > 开源指路:https://github.com/liyupi/ai-desktop-outfit-video  这个技能的玩法很简单。你跟 AI 说一句话描述需求,AI 就会帮你自动生成一段完整的 AI 视频生成提示词。然后复制到任意 AI 视频工具里就能出片,不用自己写又臭又长的提示词。 ## 2、让 AI 帮你写提示词 演示一下,随便打开一个 AI 工具(比如 Cursor),使用技能,然后跟 AI 说: ```markdown 我想创作 30 秒的视频 ``` AI 就会像产品经理一样主动询问你的需求:  AI 会先问你主角是谁。默认是中国古典鹅蛋脸美人,你如果有自己喜欢的角色,可以直接描述,也可以上传一张参考图。 比如我先用 ChatGPT 生成了一张参考图,并提供给 AI:  然后 AI 会问你视频的场景。默认是深蓝灰色调的房间,我跟 AI 说把场景改成安静的小酒吧。  接着 AI 会问三套换装造型是什么。我就随便说了水手服、洛丽塔、白领制服,跟个人爱好完全无关:  然后 AI 还会问你视频里的台词。如果你不喜欢默认的台词,可以让 AI 帮你修改为适配你需求的文案。  最后 AI 会问你尺度档位,软、中、硬三档可选。 我知道你们想选什么,唉……  六个问题问完,AI 就直接输出了一段完整的提示词。在这个技能的开源项目中有完整版的参考提示词。 ## 3、复制提示词,生成视频 接下来只需要把这段提示词复制出来,丢到任意一个 AI 视频生成工具里就行了。即梦、豆包、MiniMax 等等都可以,只要支持 Seedance 模型或者同级别的视频模型就行。 生成之前,有几个注意事项: 1. 比例选 16:9,因为是模拟电脑桌面 2. 时长选 30 秒(Seedance 2.5 支持 30 秒) 3. 使用默认的全能参考模式就好,不要开任何运镜预设 建议先用 720p 来试,1080p 的积分消耗真的太贵了!等效果满意了再上高清。  然后等 AI 生成完,一段桌面换装大作就出来了。   ## 4、直接调 API 生成 除了手动复制提示词之外,这个技能还支持直接调用 Seedance 2.5 的 API 来生成视频。 > 当然,你换成其他 AI 视频生成模型的 API 也是 OK 的。  只需要去火山引擎官网获取一个 API Key,提供给 AI 就行了。  AI 会直接帮你调用 API 生成视频并下载到本地,全程不用你自己打开任何 AI 视频生成工具。  生成的效果也是非常理想的。但是由于生成的视频过于劲爆,这里就不给大家完整播放了。  怎么样,是不是很简单? 有了这个技能,你可以自定义女主 / 男主,自定义场景、台词、造型。一个爆款视频就这样被轻轻松松复刻出来了! ## 5、核心原理 那问题来了,这个技能是怎么做出来的呢? 其实也很简单。 我直接找到爆火的原版视频,丢给 AI,让它帮我逐帧分析视频的画面和声音,并生成简单直接的提示词。  注意,这段提示词中,我用到了 `/grill-me` 技能,AI 如果没充分理解需求,就会主动找我人工确认。 看看,这是 AI 逐帧分析的画面:  AI 帮我拆出来了整条视频最核心的「机关」。比如镜头全程一动不动,人物站起来的时候镜头不跟,只拍到腰部以下,看起来就像真的是电脑桌面壁纸。还有每次换装前都要留一秒钟的空沙发镜头,避免衣服在身上直接变形。  AI 拆解明白之后,帮我生成了一段简洁的提示词模板:  然后我直接把提示词拿到即梦里测试。结果非常顺利,一把就出了满意的效果。  测试没问题之后,我就让 AI 把整个工作流封装成了一个可复用的 Skill 技能。AI 从提问流程、提示词模板到 API 调用脚本,全部自动生成好了。  最后我直接让 AI 帮我把这个技能开源到 GitHub 上,并且自动生成了一个有图有文、甚至有 GIF 动图演示的项目 README 文件。真的爽!  这也是得益于现在的 AI 模型 Agent 能力和视觉理解能力越来越强了。整个过程从拆片、写提示词、测试、封装技能到开源发布,全程几乎都是 AI 在干活,我只需要做决策和验收。 ## 最后哔哔 看到这儿你应该能 get 到本期精髓了。下次你在网上看到某个爆款视频,完全可以用同样的方法让 AI 帮你逐帧拆解、生成提示词、封装成可复用的技能。不光是换装,AI 互动壁纸、桌面宠物、动态直播间背景,都是一个思路。 这篇文章我也会收录到我的开源教程 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe) 中。上千张图、几十万字,从 0 开始带你学会 AI 编程,做出自己的产品、跑通变现全流程,感兴趣的同学可以看看。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide)  我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~
刚刚 Opus 5.5 和 GPT-6 Sol 同时发布,首发实测来啦!结果让我很意外
刚刚,Anthropic 发布了 Claude Opus 5.5,号称在大多数任务上都能打平自家最强的 Fable 5.1,运行成本却比上一代 Opus 5 还低 40%!  TNND,上周 A ÷ 不是还在呼吁 AI 前沿发展要 **放缓节奏** 么? 明明距离上次 Claude Opus 5 的发布才过了 2 个月,官方还真有脸说「这是呼吁放缓之后发布的第一个模型」?? 意思是如果不放缓,Claude Opus 55 都出来了???  然后不到 2 小时,OpenAI 也发布了 GPT-6 Sol,号称继承了 GPT-6 Astra 的大部分优势,API 价格却比 GPT-5.6 直接砍了一半! 每百万 token 输入 2 刀、输出 10 刀,正好是 Opus 5.5 的一半。  历史似曾相识,两大顶级 AI 公司再次上演中门对狙……  这次我已经不想花时间科普跑分了,直接放一张我《AI 大模型世界网站》的对比图,大家自己看着玩就好:  简单来说,Opus 5.5 的智能程度直接冲到了第一名,GPT-6 Sol 只比上一代 GPT-5.6 Sol 多了 1 分。 要看大模型的效果,别看跑分,看鱼皮实测就得了~  这次我准备了 5 个案例,Claude Opus 5.5 在 Cursor 里跑,GPT-6 Sol 在 Codex 里跑,推理强度都开到 high,两边使用相同的提示词,全程我不会人工干预。 1. 用 SVG 画熊猫骑车送外卖 2. 300 字科普大模型 3. 3D 重庆城市生成器 4. 操作电脑画 Q 版鲸鱼娘 5. 复刻 Cursor ## 1、SVG 画熊猫骑车 AI 圈有个经典测试叫「鹈鹕骑自行车」,是开发者 Simon Willison 发明的。他让 AI 直接写 SVG 代码画一只骑自行车的鹈鹕,不许看效果,车架怎么连、脚怎么踩踏板,全靠 AI 在脑子里算坐标。  不过这道题实在太出名了,Simon 这次贴出来的推理过程里,Opus 5.5 开口第一句就是「这是一个经典的测试请求」,AI 一眼就认出来了…… 所以我换了个题目,让 AI 画一只骑着自行车送外卖的大熊猫,同样只许写代码,不许打开看效果。  两个模型都在 3 分钟内交卷了,左边是 Opus 5.5,右边是 GPT-6 Sol:  Opus 5.5 这张的完成度明显更高。牙盘、链条、脚踏板都画出来了,熊猫的脚踩在踏板上,手握着车把,车把上还挂了一杯奶茶。 它还自己加了车灯、「叮咚~外卖到啦!」的对话气泡和城市背景。而且这张 SVG 是会动的,轮子在转,链条也在走!  再看看右边,这什么玩意?!我真的绷不住了……  这一轮 Opus 5.5 完胜。 ## 2、300 字科普文案 这次 Anthropic 官方特别强调 **Opus 5.5 写东西更像人话**,我还是有点期待的。 那接下来,让两个 AI 比一比写作能力和文字功底。 我让两个模型用 300 字左右,给一个完全不懂技术的朋友讲清楚什么是大语言模型,要求说人话、不要书面腔,也不许加标题和列表。  两篇我先隐去模型名,你可以猜猜哪篇是 Opus 5.5 写的? **A 篇** > 你可以把大语言模型想成一个读过海量文字、很会接话的助手。它看过书、网页和各种对话,从中学会了人们通常怎么提问、怎么回答,哪些话放在一起比较合理。你发给它一句话,它就根据你前面说的内容,一点点组织出回复。所以它能帮你解释问题、改写邮件、想点子,甚至陪你练习外语。 > > 不过,它不是脑子里装着一本随时翻开的百科全书,也不像人一样亲身经历过这些事。它说得顺,不代表一定说得对;有时会把不确定的事讲得很肯定,甚至编出听起来像真的细节。遇到看病、花钱、签合同这类重要的事,最好再找可靠的人或资料核实。简单说,它像一个反应很快的文字搭档:能帮你起步、理清思路,但最后拍板的还是你。 **B 篇** > 你平时用的 ChatGPT、豆包这些能陪你聊天的 AI,背后靠的就是大语言模型,英文简称 LLM。 > > 你可以把它想象成一个特别爱读书的学生。它把网上能找到的文章、书和聊天记录几乎都读了一遍,读得多了,就慢慢摸清了人说话的规律,知道一句话说到这儿,后面最可能接什么。 > > 所以你问它问题的时候,它其实是在一个字一个字地往下接,每一步都挑最顺、最合理的那个字。听起来挺简单对吧?但因为它读过的东西实在太多了,接出来的话不光通顺,还经常真有道理,能帮你写文案、做翻译、出主意,甚至还能写代码。 > > 不过它也有个毛病,就是容易不懂装懂。它追求的是把话说得像那么回事,并不保证每句都对,所以碰到它不知道的事情,它也可能一本正经地瞎编。你用它的时候,重要的信息最好自己再核实一下。 答案是 B 篇出自 Opus 5.5,A 篇出自 GPT-6 Sol,你猜对了吗?  我个人更喜欢 Opus 5.5 这篇。它先从你天天在用的 ChatGPT、豆包说起,再拿「特别爱读书的学生」打比方,然后一句「一个字一个字地往下接」就把大模型的原理讲明白了。中间还穿插了一句「听起来挺简单对吧?」,读起来真的像朋友在跟你聊天。 GPT-6 Sol 这篇也不差,最后提醒大家看病、花钱、签合同这类事要再核实,这个例子举得很接地气。但是两段话都写得太长了,而且它只说大模型会「一点点组织出回复」,怎么组织的却没讲清楚。 有意思的是,这道题 Opus 5.5 只用了 15 秒就写完了,GPT-6 Sol 反倒花了 52 秒。这也是整场测试里 Opus 5.5 唯一快过 GPT-6 Sol 的一次。 ## 3、3D 城市生成器 前面两道都是小题,接下来上点强度,让 AI 真刀真枪地写一个 3D 项目。 这个案例是之前我测 GPT-6 Astra 时用过的 3D 程序化城市生成器。这次我只留了重庆一座城市,要求层叠立交、轻轨穿楼、依山而建的高差感这 3 样必须做出来。至于编辑器怎么布局、要有哪些参数,我一个字都没写,全部让 AI 自己去参考官方的设计。 另外我还要求 AI 做完之后自己打开网页验证效果,不满意就自己接着改,直到满意再交付。  ### Claude Opus 5.5 Opus 5.5 在这道题上磨了将近一个半小时,中间自己截图检查、来回修了 7 轮左右才交卷,严重影响了我这篇文章的发布时间! 但是当我打开主页时,我直接「卧槽」了!  夜里的渝中半岛被两条江环抱着,每栋楼的窗户都一格一格亮着灯,跨江大桥上还挂着灯带。 这个细腻度,这个质感,我感觉一切的等待都是值得的!  鼠标拖一拖就能旋转、平移、缩放,按数字键 1 到 6 还能切换视角。比如切换到俯视图,半岛的轮廓、江面和盘成一团的立交都看得一清二楚:  最让我惊喜的是细节。明明有几百栋大楼,放大之后你竟然能看到「李子坝站」的中文站牌,还有一列轻轨正从楼中间穿过去!  再把镜头推到立交桥上,一圈套一圈的匝道在空中叠了好几层,每条匝道上都有车辆在流动,感觉把重庆的层叠立交还原的栩栩如生(至少我是感受到这个立交的复杂度了……  Opus 5.5 甚至还专门做了一个「黄桷湾立交」的场景预设,备注写的是「5 层 15 匝道,导航也迷路」,AI 这个梗玩得是真懂重庆啊! 整体来说,山、水、桥都刻画得非常细腻。右侧面板还能灵活调整地貌、山体高度、台地化程度和江面宽度。 我顺手切换到「赛博 8D」预设,立交直接拉满到 6 层 27 条匝道,霓虹灯一开,赛博山城的味道就出来了:  这个效果我直接给到夯! ### GPT-6 Sol 再来看看 GPT-6 Sol。它只用了 12 分钟就交卷了,速度是 Opus 5.5 的 7 倍。 但是,做出来的东西就很一般了…… 整个画面是一片灰绿色的低饱和配色,楼就是一个个方盒子,我相信大家一眼就能感受到和 Opus 5.5 的差距。  整体的建模比较简陋,而且问题还不少。 这…… 这是悬空城啊?  咱就再看看刚才那个经典的李子坝轻轨穿楼,穿模问题就更明显了。车厢一头扎进了楼里,墙上却没有给轻轨留出通道……  它也支持俯视图,该有的功能也都有。但无论是 UI 效果,还是右侧菜单的丰富程度,Opus 5.5 都是降维打击。 GPT-6 Sol 的面板上只有 3 个预设和 6 个参数,Opus 5.5 光场景预设就有 6 个,参数更是有 7 组 30 多个。  ## 4、操作电脑画图 城市生成器考的是写代码,接下来换个方向,考考 AI 操作电脑的能力。 前面熊猫骑车测试中,我是让 AI 闭着眼画画,这一轮让它们睁开眼睛画,而且得像人一样握着鼠标一笔一笔画。 一开始我想让 AI 操作专业的 PS 软件画图,但软件越复杂、变数就越多。于是我先让 AI 开发了一个简易画板网页,只有画笔、橡皮擦、油漆桶、直线、矩形、椭圆和吸管这几个基础工具,连文字工具都没有,气泡里的字也得一笔一笔手写。  然后我给了一张 Q 版 DeepSeek 鲸鱼娘的参考图,让两个模型照着画出来:  提示词里我给 AI 定了一条规矩,就是只能用鼠标和键盘操作,不许写代码往画布上画。画板上的按钮怎么用、先画哪儿后画哪儿,我一句都没教,全部让 AI 自己摸索。  Opus 5.5 是在 Cursor 自带的浏览器里画的,前后花了 1 小时 17 分钟,画出来是这样的:  好家伙,怎么画成卷发了?? 头发是一坨一坨的圆球球拼起来的,连「好模型」三个字都是用圆点一个个点出来的…… 翻了一下 AI 的执行过程我才明白,应该是因为 Cursor 内置浏览器的拖拽功能只能拖动网页元素,没法按住鼠标从一个点划到另一个点。Opus 5.5 画不出连续的线条,只能把笔刷调到 65 像素,一下一下地点,再用油漆桶填色,前后点了 270 多下。  不过即便是这样,它的构图和配色还原得挺像的,对话气泡、呆毛、白色蕾丝头饰、蓝色大眼睛、腮红和蝴蝶结都在。 GPT-6 Sol 用的是 Codex 的电脑操作能力,直接控制真实的 Chrome 浏览器来画,参考图也是靠 GPT 自身的多模态能力看的。它可以自由拖动鼠标画线,17 分钟就画完了。  怎么硕呢? 眼睛、腮红、呆毛、蝴蝶结和白色头饰倒是都有,眼睛画得还挺有神。但「好模型」三个字就崩的太明显了,头发是一大块半透明的蓝色,上面还飘着几道莫名其妙的折线。 两张放在一起,你觉得哪张更像参考图?  我个人投 Opus 5.5 一票,即使是被 AI 工具限制了,只能一个点一个点地戳,还原度反而更高。 ## 5、复刻 Cursor 工具 最后压轴的是我测过很多次的复刻 Cursor 这个 AI 编程工具,这是一个非常考验长程任务能力的全栈项目。 提示词跟之前测 Claude Fable 5.1、Kimi K3、GPT-6 Astra 时用的完全一样。我要求 AI 克隆 VS Code 的开源代码,在此基础上做一个 Web 版的 AI 编程工具,Editor Window 和 Agents Window 两种窗口能来回切换,内置 AI 接的是 DeepSeek V4.1 Flash。  ### Claude Opus 5.5 Opus 5.5 花了 53 分钟交卷。打开网站,默认就是 Agents Window 智能体面板。 不骗大家,我刚看到这个界面的时候,真的大喊了一声「卧槽」!  左侧是按工作区分组的 Agent 列表,每个任务改了多少行代码都标得清清楚楚。中间是任务输入框,下面还有几个推荐任务,跟 Cursor 3 本尊的 Agents Window 神似。 光看到这里,你可能还没意识到问题的严重性,那如果我把文件查看器、终端、Agent 侧边栏都打开呢?  上面这些功能全都能正常使用!比如在终端里敲一个 tree 命令,项目结构立刻就打印出来了。我在右侧的 Agent 侧边栏里问这个项目有几个源码文件,AI 自己调用工具把目录列了一遍,回答是 5 个,跟终端里的结果对得上。 之前我也用相同的提示词让其他模型复刻过 Cursor,比如 Claude Fable 5.1 是之前完成度最高的,能逐个文件接受或拒绝 AI 的改动,但界面跟 Cursor 3 差得还挺远:  GPT-6 Astra 那次自己取了个产品名叫 orbit,设计感很强,但它走的是自己的产品思路,功能丰富度也差 Fable 5.1 一截:  切换到 Editor Window 编辑器模式,文件高亮、代码高亮、代码补全一应俱全,还能在右侧打开 AI 面板随时和 AI 对话。  此外,还有完整的 Git 管理面板,改了哪些文件、提交记录都能直接看到:  如果我直接把这个产品发布了,我敢打赌你绝对想不到这是 AI 一把梭的! 夯爆了! ### GPT-6 Sol GPT-6 Sol 只用了 27 分钟,差不多是 Opus 5.5 的一半时间。 进入主页,默认是 Editor Window 编辑器模式,也能实现代码高亮和自动补全,但从第一眼的界面上来看就已经输了。  再看看 Agents 面板,布局是合理的,但就是这个配色有点怪,给我一种 GPT 想让人看起来很牛逼、实际上很辣鸡的感觉。  任务可以正常执行,但整个执行界面也是浓浓的 AI 味儿,GPT 的风格一贯如此。  功能丰富度也远远不如 Opus 5.5,不支持搜索,没有 Git 能力,没有终端,也没有那么多布局和面板,页面上很多按钮都是死的。 原因其实也很简单。GPT-6 Sol 虽然也克隆了 VS Code 的源码,但压根没用上,而是在旁边另起炉灶,用 Monaco 编辑器加 React 自己拼了一个工作台,源码一共才 600 多行。而 Opus 5.5 那边光是自己写的代码就有 3600 多行。 跟之前测过的国产模型比一比,这是 Kimi K3 当时用同一段提示词做的版本:  说白了,我感觉 GPT-6 Sol 的水平跟目前的国产模型差不多。 不好意思,在看完 Opus 5.5 之后,只能给到拉完了…… ## 我的感受 5 个案例跑完,Claude Opus 5.5 除了速度,其他每一项都赢了。 虽然我老是骂 A 社,但不得不承认,人家的模型能力确实强。 嘴上建议大家放缓发展,自己却在那嘎嘎进步,别人都慢下来了,还怎么超过你?  Claude Opus 5.5 的能力比上一个版本提升明显多了,我甚至觉得它比 Fable 5.1 还要强,复刻 Cursor 那道题就是最好的证明。 **除了 AI 编程能力之外,Claude Opus 5.5 的写作能力也真的非常让我惊喜。** 以前我一直觉得 AI 越强,越不会说人话,所以写作基本还是用 Opus 4.6 或者国产模型。但 Opus 5.5 写出来的东西很有人味,就像前面那篇 300 字科普一样。 实不相瞒,你现在看的这篇文章就是借助 Opus 5.5 完成的,我把大纲和实测结果交给 AI 去润色,然后简单看了看、加了点自己的梗和表达,就搞出来了。 **当然,强是有代价的。** 先说速度。这 5 个案例 Opus 5.5 前前后后跑了 3 个多小时,GPT-6 Sol 只用了 1 个小时左右,除了写作那道题,GPT-6 Sol 全程都比 Opus 5.5 快。 再说花费,这个差距就更夸张了。Opus 5.5 这 5 个案例加起来花了我 600 多块钱!(本期成本巨大) 虽然 Opus 5.5 每百万 token 输入 4 刀、输出 20 刀,单价只有 Fable 5.1 的四成,但对个人开发者来说还是很贵…… GPT-6 Sol 就友好多了。之前的 GPT-6 Astra 能力是强,但额度消耗太快了,Plus 账号跑一两个项目就能把 5 小时额度耗光。这次我用 GPT-6 Sol 跑完一整套测试,才刚好把 Plus 会员的额度用完,耗时还不到 Opus 5.5 的三分之一,这才是给大家日常用的模型。 它本来就定位在 Astra 下面一档,比不过 Astra 很正常,但也确实没什么亮点。就今天测的这几个任务来看,我感觉它跟国产模型差不多是同一档(仅个人体验,叠甲)。 看到这里你应该也有自己的选择了,追求效果、预算又充足,就上 Claude Opus 5.5。图的是性价比,可以使用 GPT-6 Sol,搭配 Codex 的体验还是不错的。 最后再送大家一段由 Claude Opus 5.5 自主生成的 3D 网页动画《牛来骑车》,这一段大作花了我几十块钱,能三连回回血么?  我之前一直觉得,AI 的编程能力已经进化到不需要再进化的程度了。但每一次新的模型发布,都能刷新我对 AI 能力的认知上限,我喜欢这种感觉。 **就是希望再慢一点吧,起码中秋假期不要再 TM 发新模型了啊啊啊啊啊啊!!!** OK 就分享到这里,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide)  我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注。 这俩模型可以说是新时代模型的两个门派代表了,一边是能力超强但价格贵,一边是能力全面、性价比高,你会更支持哪家呢? 评论区聊聊吧~
全网刷屏的 Jev 模型正式开放!一手实战测评 + 保姆级教程
大家好,我是程序员鱼皮。 过去几年,不管是 ChatGPT、Claude 还是 DeepSeek,AI 大模型的目标一直都是「跟人聊天」和「帮人干活」。 但最近有个模型突然火了,它有点儿特别,**不说人话、不能跟人聊天**。 它叫 Jev,由前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 发布,这哥们是 ChatGPT 的共同发明人之一!  我刚看到的反应是:一个不说人话的 AI,能有什么用?又是噱头吧?  **了解之后发现,还真有点东西!** 这篇文章我就从零开始,带大家搞懂 Jev 到底是什么、怎么用、到底好不好用。没有任何技术基础的小白也能看懂,看完还能直接上手体验。 ## 一、Jev 入门介绍 ### Jev 是什么? 传统的大模型主要是跟人对话的,你问它一个问题,它回你一段话。 但这就带来一个问题,比如你想让它帮你判断一下「这封邮件紧急吗」,它不会直接告诉你「是」或者「否」,而是先给你写一大段分析,然后才给出结论。不仅速度慢、烧 Tokens,还需要你自己从回答里把答案抠出来。 Jev 就完全不一样了。你问它「这封邮件紧急吗」,它就直接告诉你「是,概率 95%」。 模型返回的是一段结构化的 JSON 数据,你的程序可以直接拿来用: ```json { "is_urgent": { "noul": 0.95 } } ``` 可以说,没有任何 AI 比它更直接、更不绕弯子。  TypeSafe AI 管这种模型叫 **System One Model(系统一模型)**,灵感来自诺贝尔奖得主 Daniel Kahneman 的《思考,快与慢》。系统一是人类大脑里负责快速直觉判断的部分,比如你一眼就能看出「这个人在生气」;系统二是负责深度推理的,比如「算一下 17 × 24」。 传统 LLM 更像系统二,Jev 就是系统一。 根据 TypeSafe 官方自测的数据,两者的差距还挺夸张的: | | 传统 LLM(如 GPT-5.6) | Jev | |---|---|---| | 输出方式 | 生成文字,需要解析 | 直接返回结构化决策结果 | | 响应速度 | 3 - 329 秒 | 70 - 500 毫秒 | | 输入价格 | $0.20 - $10 / 百万 token | $0.042 / 百万 token | | 输出价格 | 约输入价的 5 倍 | 免费 | | 结构化输出错误率 | 0.58% - 45.5% | 0%(数学保证) | 响应速度最高快了将近 200 倍,输入价格便宜了几十倍到上百倍,输出还不要钱,而且结构化输出零错误。这也太香了吧! 那 Jev 到底是怎么用的?为什么能这么快?下面一个一个来讲。 ### Jev 能回答什么类型的问题? Jev 的调用方式非常简单,你给它两样东西,一个是 **state 状态**,就是你想让它分析的上下文信息;另一个是 **questions 问题**,就是你想让它回答的问题。然后它就直接返回结构化的答案。 Jev 支持回答 3 种类型的问题,TypeSafe 官方把它们叫做「AI 原语」。 #### 1、Noul 是或否 简单来说,就是让 AI 做判断题,问一个「是不是」的问题,返回 0 到 1 之间的概率值。 比如你收到一封客户邮件,想判断是否紧急,就把邮件内容作为 state 传给 Jev,再加上一个 Noul 类型的问题: ```json { "state": "我连续 3 天无法连接 Stripe 账户,正在丢失销售额,请尽快处理!", "questions": { "is_urgent": { "type": "noul", "instructions": "这条消息是否传达了紧急性或时效性" } } } ``` Jev 返回的结果长这样: ```json { "is_urgent": { "type": "noul", "noul": 0.95 } } ``` 0.95 意味着有 95% 的把握认为这条消息是紧急的。你在代码里直接 `if noul > 0.8` 就可以触发告警了。 #### 2、Choice 多选一 这个就像让 AI 做选择题,从你预设的选项里选一个,并告诉你每个选项的概率分布。 比如判断一个工单该分给哪个部门,你可以把部门选项列在 criteria 里让 Jev 来选: ```json { "questions": { "department": { "type": "choice", "instructions": "这个工单应该分配给哪个团队处理", "criteria": { "billing": "付款、发票、退款相关问题", "technical": "Bug、系统故障、集成问题", "sales": "定价、账户咨询" } } } } ``` 返回: ```json { "department": { "type": "choice", "choice": "billing", "confidence": 0.8, "probabilities": { "billing": 0.87, "sales": 0, "technical": 0.13 } } } ``` 不光告诉你选了 billing,还把每个选项的概率都算出来了。目前 Choice 最多支持 255 个选项。 #### 3、Score 评分 这个就像让 AI 做打分题,在你自定义的量表上打分,分数可以落在两个等级之间。 比如判断无法登录的客户有多沮丧,你可以定义从「冷静」到「愤怒」的几个等级,让 Jev 来打分: ```json { "questions": { "frustration": { "type": "score", "instructions": "客户看起来有多沮丧", "criteria": [ "冷静,只是在陈述事实", "不满但还算礼貌", "非常愤怒,言辞激烈" ] } } } ``` 返回: ```json { "frustration": { "type": "score", "score": 1.04, "confidence": 0.94, "probabilities": { "0": 0, "1": 0.96, "2": 0.04 } } } ``` Score 1.04 表示介于第 1 级(不满但礼貌)和第 2 级(非常愤怒)之间,偏向不满。这里我定义了 3 个等级,实际使用时你可以根据需要定义 2 到 10 个等级,等级越多,评分的粒度就越细。 ### Jev 有什么特别的? 看到这里,可能有接触过 AI 应用开发的朋友会想:我之前在提示词里引导 AI 输出 JSON,或者用大模型自带的结构化输出功能,也能让 AI 返回固定格式的结果啊…… Jev 跟它们有什么区别?  你别说,区别还真挺大的! 首先,传统 LLM 做结构化输出,底层还是一个 token 一个 token 地「写字」,写完再校验格式。就好比让一个作文高手去做选择题,他还是会先在脑子里打一遍草稿,然后再从里面挑答案,自然就慢。而且写着写着格式就可能出错。 Jev 的做法完全不一样,它用的是 **并行采样**,不像传统 LLM 那样逐字生成文本,而是直接在预定义好的选项上输出概率分布。也就是说,前面提到的 3 种问题可以在一次请求里同时问,问 1 个和问 10 个问题的响应时间几乎没差别。  此外,Jev 的训练方式也跟传统模型不同。传统 LLM 用 RLHF 人类反馈强化学习,优化目标是让回答读起来通顺,让人类满意;推理模型用 RLVR 可验证奖励强化学习,优化目标是让那些有标准答案的问题做对,比如数学证明能不能验证通过、生成的代码能不能编译运行。 而 Jev 用的是 TypeSafe 自研的 **RLCD 校准决策强化学习**,优化目标是让模型「说到做到」,如果 AI 说有 90% 的把握,那在大量预测中这类判断确实有约 90% 是对的。  理解了这些原理,前面表格里那些夸张的数据就好解释了。 Jev 不用一个字一个字地写回答,直接并行输出所有概率分布,所以速度能快上百倍。 它也不需要生成任何输出文字,成本自然就低了。 而且输出结构在数学上就是确定的,所以结构化错误率是 0%。 更重要的是,因为 Jev 的概率是校准过的,你的程序可以直接拿这个概率来做自动化决策,比如概率高于 0.8 就让 AI 自动处理,低于 0.5 就转人工。 ### Jev 能用来干嘛? 虽然 Jev 不能聊天,但是它的适用场景还真不少,这也是它能火起来的原因之一。 TypeSafe 官方建议把 Jev 当成一个「智能的 if 语句」,所有需要做判断和决策的场景,都可以用 Jev。 我看了网上大家的玩法,总结了几个比较典型的场景。 1)工单和消息分类 比如客服系统收到用户消息,一次性判断该分给哪个部门、是否紧急、情绪如何。社区里有人拿 Jev 给 1018 篇论文做分类,分类部分只花了 0.08 刀。  2)AI Agent 的决策中间层 比如 Codex 等 Harness 里的 Agent 每一步都要做判断,可以让 Jev 先快速决定该调哪个工具、这个操作有没有风险,只有需要写代码的时候才让传统的 LLM 上。 有人用这个思路做了 [浏览器自动化 Agent](https://github.com/browser-use/jev-ultrafast),7.1 秒就在 Google Flights 上搜索完一次航班,成本只有 0.0039 刀。  3)内容审核和风控:比如一次性判断这条评论是否违规、属于哪种违规类型、风险等级多高,每条消息的判断成本不到 0.001 刀。 4)给 LLM 输出做质检 比如 LLM 生成了一段回答,用 Jev 快速检查有没有跑题、质量打几分,用便宜的 AI 检查贵的 AI。社区里有人做了一个[多阶段代码审查工具](https://github.com/devagrawal09/jev-review),用 Jev 先做风险评估再逐文件打分。  5)实时游戏决策 有人用 Jev 玩地铁跑酷游戏,操作速度超过人类;有人用 Jev 控制超级马里奥,甚至还有人打通了《星际争霸》第一关!  这类对响应速度要求极高的场景,以前用传统的 LLM 根本不可能做到。 之后,**需要生成文字的场景用传统 LLM,需要快速做判断的场景用 Jev**,两者互补,可以让任务完成速度又快又准。 ## 二、Jev 实战体验 了解了 Jev 是什么之后,接下来看看怎么实际用上它。 ### 怎么使用 Jev? Jev 现在已经正式开放注册了,直接用邮箱在 [TypeSafe 官网](https://typesafe.ai/) 注册登录就行。  注册之后,最简单的使用方式就是直接在官方 Playground 里体验,也可以通过 API 和 SDK 接入到自己的项目里。另外也可以通过 Vercel、Cloudflare 这些第三方平台来调用 Jev。 #### 方式一、官方 Playground 最简单的使用方式就是打开 [官方的在线 Playground](https://console.typesafe.ai/playground),左边填写提供给 AI 的上下文和想让 AI 分析的问题,点击运行就能在右侧看到结果。  #### 方式二、调用官方 API 和 SDK 登录之后,可以到 [TypeSafe 的控制台](https://console.typesafe.ai/keys) 中创建 API Key。  TypeSafe 提供了 Python SDK 和 JavaScript SDK,方便开发者在自己的项目里直接调用 Jev,也可以通过 HTTP API 调用。[官方文档的 Quick Start 页面](https://docs.typesafe.ai/introduction/quickstart) 有完整的示例代码。  以 Python 为例,安装 SDK 之后几行代码就能跑: ```python # pip install typesafe-sdk from typesafe_sdk import Choice, Noul, Score, TypeSafeClient client = TypeSafeClient() # 自动读取环境变量 TYPESAFE_API_KEY response = client.system_one( state="客户说:我被重复扣款了,订单号 A-104,请退款。", questions={ "department": Choice( instructions="这个工单应该分配给哪个团队处理", criteria={ "billing": "付款、发票、退款相关", "technical": "Bug、系统故障、集成问题", "sales": "定价、账户咨询", }, ), "is_urgent": Noul( instructions="这条消息是否传达了紧急性或时效性", ), }, ) print(response.answers["department"].choice) # "billing" print(response.answers["is_urgent"].noul) # 0.95 ``` 当然,现在用 AI 编程,这些代码都不用自己写,后面会讲到怎么让 AI 工具直接帮你调用 Jev。 #### 方式三、通过第三方平台调用 除了 TypeSafe 官方的 API,Vercel AI Gateway 和 Cloudflare Workers AI 这些第三方平台也已经支持了 Jev,可以直接在这些平台上调用。 以 Vercel 为例,它的 AI SDK 专门新增了一个 `experimental_evaluate` 接口来对接 Jev 这类决策模型,详细教程可以查看 [Vercel 官方文档](https://vercel.com/kb/guide/typesafe-jev-and-ai-sdk)。  我这里还用 AI 接入 Vercel AI Gateway 做了一个 **中文版的 Jev 调试广场**,可以直接在网页上体验 Jev 的三种回复方式。  点击「运行」之后,就能直接看到 Jev 返回的决策结果和原始 JSON 数据。  ### 接入 AI 工具 上面几种方式都需要你自己写代码调用 Jev,那有没有更简单的方式呢? 其实日常大家还是用 GPT、Claude、DeepSeek 这些大模型,Jev 更适合作为一个扩展能力来搭配使用。 TypeSafe 官方提供了一个通用的 Skills 技能包,简单理解就是一份配置文件,告诉 AI 编程工具 Jev 是什么、怎么调用、参数怎么传,这样 AI 工具就知道怎么帮你调用 Jev 了。只要安装了 Skills 技能包,所有主流的 AI 编程工具都能用。  安装方法非常简单,官方提供了一段 [现成的提示词](https://docs.typesafe.ai/introduction/quickstart),可以让 AI 帮你把技能安装到你用的 AI 工具里。  不过官方的提示词默认只在当前项目下安装。我把提示词翻译成中文并改为了全局安装的版本,这样所有项目都能用: ``` 全局安装 TypeSafe 技能。如果你是 Codex(Claude Code),请执行 `claude plugin marketplace add typesafe-ai/skills`,然后执行 `claude plugin install typesafe@typesafe-ai`。如果你是其他 Agent,请执行 `npx skills add typesafe-ai/skills --skill typesafe-ai -g` 并选择你的 Agent。只需使用一种安装方式即可。技能文件可以在这里查看:https://github.com/typesafe-ai/skills/blob/main/skills/typesafe-ai/SKILL.md ``` 比如我在 Codex 中执行这段提示词。它的原理就是根据你用的 AI 工具,执行对应的命令把技能文件从 GitHub 仓库拉取下来。  安装完成之后,还需要在环境变量里配置好 TypeSafe 的 API Key,AI 工具才能帮你调用 Jev。 直接让 AI 帮你配置就好:  配好之后,你就可以在 AI 编程工具里直接使用斜杠命令 `/typesafe-ai` 来触发技能,AI 会自动帮你调用 Jev 来完成判断和决策。  你也可以在对话中直接告诉 AI「用 Jev 来帮我做判断」,AI 同样会自动加载 TypeSafe 技能并调用 Jev 的接口:  ### Jev API 实战测评 学会了怎么使用 Jev 之后,咱们来通过实际的测试来看看 Jev 的表现到底怎么样。 我分别用 Jev 和 DeepSeek V4.1 Flash 来完成同一个任务,对比两者的速度、价格和准确度。 #### 1、用 Jev 实时玩数字华容道 数字华容道是一个经典的滑块拼图游戏,4 × 4 的棋盘上有 15 个数字方块和 1 个空位,目标是把所有数字按顺序排列好。 每一步 Jev 需要判断「空位应该往哪个方向移动」,这对决策能力的要求很高。  开始测试,左边是 Jev,右边是 DeepSeek V4.1 Flash,两边同时开始,实时展示每一步的决策时间、累计消耗的 token 数和价格。  最终,Jev 在完成速度上遥遥领先 DeepSeek V4.1 Flash,而且输入 token 和累计价格也更低。 #### 2、用 Jev 批量分类 1000 封邮件 第二个测试更贴近实际业务场景。假设你公司的邮箱每天会收到大量邮件,需要快速判断每封邮件的优先级、紧急程度和该转给哪个部门处理,这个任务就可以交给 AI。 我模拟了 1000 封不同内容的邮件,让 Jev 和 DeepSeek V4.1 Flash 分别对每封邮件做优先级分类、紧急程度判断和部门路由,两边拿到的邮件列表完全一样。  最终结果,Jev 用了 15.6 秒处理完 1000 封邮件,平均每秒处理 64 封,累计花费 0.0177 刀;而 DeepSeek V4.1 Flash 用了 48.9 秒,平均每秒 20 封,累计花费 0.0207 刀。Jev 在速度上快了接近 2 倍,价格也略低一些。  ### AI 工具 + Jev 实战测评 除了直接调用 API,我还试了一下把 Jev 接入 AI 工具之后的使用效果。 这次我用的是 Codex 工具 + GPT 模型,装好 TypeSafe 技能之后直接让 AI 干活。 #### 1、用 Jev 玩连连看 连连看大家都玩过吧? 这次我用 Jev 来玩连连看,可以测试它在实时决策场景下的反应速度和判断准确度,游戏逻辑用代码处理,每一步选哪对方块消除的决策交给 Jev。 在 Codex 中使用 `/typesafe-ai` 技能,然后跟它说: ```markdown /typesafe-ai 帮我用 Jev 模型玩连连看游戏 ``` Codex 加载了 TypeSafe 技能之后,会自动分析页面结构,识别出方块的位置和图案,然后调用 Jev 来做每一步「选哪对方块消除」的决策,最后操作页面完成消除。  虽然 AI 顺利通关了游戏,但是我觉得执行速度没有达到预期。快的时候可以 2 秒消除 1 个,但经常消除几个之后会卡一会儿,总共花了 5 分钟左右才完成了整局游戏的消除。  虽然 Jev 的决策速度确实很快,但问题出在「看」这个环节。Jev 只能处理文本和 JSON 数据,没办法直接「看到」网页上方块的位置和图案。这次测试我用的是本地的连连看网页版,Codex 可以直接解析到原始的 HTML 和 DOM 结构,所以还能跑起来。但如果你让它去玩那些用 Canvas 渲染的网页游戏,如果 DOM 里获取不到足够的信息,效果会更差。 其实社区里那些用 Jev 玩游戏的博主,思路基本都是一样的,就是先用代码把游戏画面转成结构化的数据(比如读取游戏内存),然后再把数据喂给 Jev 做判断,而不是让 Jev 直接看截图。 #### 2、用 Jev 给开源教程文章打标签 前面的连连看游戏主要考察的是 Jev 的实时决策速度,这次换个方向,考察一下 Jev 对文本内容的分类和打分能力。 我让 Codex 用 Jev 模型给自己 [《AI 编程教程》](https://github.com/liyupi/ai-guide) 中的每篇文章自动打标签,包括判断文章属于什么主题、适合什么水平的读者、难度打几分。 提示词如下: ```markdown /typesafe-ai 读取 ai-guide 仓库里的文章列表,用 Jev 给每篇文章打标签。 1. 主题分类(AI 基础/提示词工程/AI 编程实战/工具推荐/行业趋势) 2. 适合的读者水平(零基础/有编程基础/有 AI 经验) 3. 内容难度打分(入门/进阶/高级) 不改动原始文章,只是最后输出一份报告。 ```  Codex 会先盘点文章范围、数量和篇幅,再按上下文限制设计可靠的批处理,批量调用 Jev 模型来判断文章的标签。 最终只用了几分钟,就完成了 697 篇长文章的标签分类!这个速度真的非常快了。  这类批量分类打标签的场景特别适合 Jev,因为每篇文章的判断逻辑是一样的,只是输入内容不同,可以批量并行处理。而且分类结果是结构化的,拿到之后可以直接用来生成目录、做筛选功能。 ## 三、Jev 使用感受 最后说说我使用 Jev 的感受。 如果把 Jev 作为决策模型直接接入到自己的应用里(比如客服分类、内容审核、数据打标签),体验是非常好的,速度快、价格低、结果准确。做了上面这么多任务,总共也才花了不到 2 块钱。  但如果是通过 AI 工具来间接使用 Jev,目前的体验还有不少提升空间,主要瓶颈在于 AI 工具对网页内容的感知能力还不够强,很多场景下没办法给 Jev 提供足够准确的输入数据。 而且 Jev 的能力有明确的边界,不能生成文字、不能做算术推理、日期比较也不靠谱。 如果你在做 AI 应用开发,想要把分类、路由、审核这类判断逻辑的成本和延迟降下来,Jev 是值得一试的。一定要确保你能给 Jev 提供足够准确的结构化输入数据,它判断得准不准,取决于你喂给它的信息质量。 我个人比较看好 Jev 在 AI Agent 决策层的应用。现在 Agent 每一步操作都要调一次大模型来判断,如果把这类快速判断交给 Jev,整体效率应该会有一个质的提升。 OK 就分享到这儿,本文会收录到我免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide  我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~ 也欢迎在评论区聊聊:你有用过 Jev 模型么?你看好它的发展么?
我跟 AI 说自己「有多动症」,竟然能节省 Tokens?!
大家好,我是程序员鱼皮。 最近 GitHub 上有个项目涨势非常猛,短短一周涨了 1 万多个 Star,成功引起了我的注意。 项目的名字很有意思,叫 `i-have-adhd`,翻译过来就是「我有多动症」。  这是一个给 AI 工具安装的 Skill 技能,作用是让 AI 不再长篇大论地废话,每次回答都直奔主题,先给出你该执行的下一步操作,多步骤任务用编号列清楚。 之所以叫 ADHD,是因为 ADHD 人群的工作记忆比较有限,面对大段文字很容易走神,这种「先说结论、直给行动」的输出方式对他们来说更友好。  虽然名字叫 ADHD,但并不是只有 ADHD 人群才能用。任何希望 AI 回答更简洁高效的人,都可以试试。而且理论上因为输出变简洁了,每次对话消耗的 tokens 也会相应减少,长期用下来能省不少钱。 那这个技能到底效果怎么样?真的能省钱么?能省多少?会不会因为输出太精简,反而影响了任务的完成质量? 下面我分别用 Cursor 和 ZCode 做了实测,带大家看看到底能省多少。 ## 怎么安装? 安装方式非常简单,直接让 AI 帮你装。 随便打开一个支持加载技能的 AI 工具,把下面这段提示词复制粘贴到对话框中,发给 AI 就行: ``` Install the i-have-adhd skill/plugin from https://github.com/ayghri/i-have-adhd, refer to the repo's AGENTS.md for instructions. ``` 比如我在 Cursor 里执行这段提示词:  AI 会自动去读取 GitHub 仓库的安装说明,然后帮你完成安装。 安装完成后,技能文件会存放在电脑的 `~/.agents/skills` 目录下,这个路径是主流 AI 工具都能扫描到的通用技能目录:  之后在对话时输入斜杠命令 `/i-have-adhd` 就可以激活这个技能了:  Skill 装好了,接下来就该验证效果了。 ## 实测对比 我设计了两类测试任务,一类是日常技术问答,看看回答知识类问题时能省多少;另一类是从零开发一个复杂的 3D 互动页面,看看写代码的场景下 Skill 的效果和质量会怎样。 ### 1、日常技术问答 我先用 Cursor + Claude Opus 5 这个顶级模型的组合来测试,问了一个 AI 领域大家都听说过的概念: ``` 请深入讲解 AI 领域的 Harness Engineering 是什么?包括它的核心概念、和传统 Prompt Engineering 的区别、实际应用场景,以及目前主流的最佳实践。 ``` 看看下面这张图的测试结果,左边没有开启 ADHD 技能,右边开启了。可以看到对话消耗的 tokens 从 48.7K 直接降到了 27.5K,**减少了将近一半**!  再看看回答的内容风格。左边没开 ADHD 技能的时候,AI 先是搜了一圈资料,然后洋洋洒洒地分了好几个章节来展开讲,篇幅很长。 右边开了技能之后,AI 的回答明显更直接,上来就给出核心定义,然后用编号列出可执行的最佳实践,按落地成本从低到高排序,用户读完立刻就知道该干什么。  有点像你跟 AI 说「别绕弯子,直接告诉我怎么做」,效果确实不错。 按 Claude Opus 5 的输出价格来算,单次对话大概能省几毛到一块钱,如果你每天跟 AI 聊几十上百轮,累积下来就是一笔可观的开支了。 这么看来,日常问答使用这个技能是可以省钱的。但 AI 编程的核心场景是写代码,如果是更复杂的开发任务,效果又会怎么样呢?质量会不会打折扣? ### 2、开发 3D 互动页面 这次我让 AI 从零开发一个《清明上河图》的 3D 互动展示页面: ``` 帮我开发一个完整的清明上河图 3D 互动展示页面。要求:页面加载后呈现一幅可以横向浏览的长卷画面,具有 3D 景深效果,让用户仿佛身临其境地走进画中世界。用户可以通过鼠标拖拽或滚轮左右浏览,鼠标悬停到画中的建筑或人物区域时,会出现高亮效果和简介弹窗。请直接给出完整的可运行代码。 ``` 先看 Cursor + Claude Opus 5 的对比。下图的左边没开技能,工作了 37 分钟,总共消耗了约 242.8K tokens;右边开了 ADHD 技能后,只用了不到 14 分钟,tokens 降到了 178.9K。 **时间快了将近两倍,tokens 省了 26%**。  不过光看数据还不够,得看实际效果。先看没开 ADHD 技能的版本,整体的古画意境还不错,有虹桥、有行人、有河面,悬停弹窗也做了出来:  再看开了 ADHD 技能的版本。整体布局和交互也都实现了,不过从细节上来看,我觉得还是没开技能的时候更好一些。 比如你仔细看,右侧有些人物直接站在了水面上,而且人物配色花花绿绿的,有点破坏整体的水墨意境(我瞎说的):  不过说实话,两个版本的效果都只能算一般…… 毕竟这提示词是我瞎七八写的。 刚才用的是顶级模型,模型能力越强,越容易把简单的事情搞复杂。接下来换一个更轻量的工具 ZCode + GLM Flash 模型来看看效果。 下面是 ZCode 的对比图,左边无 ADHD 用了约 15.2 万 tokens、36 分钟,右边有 ADHD 用了约 14 万 tokens、34 分钟。GLM Flash 本身就比较精简,所以开不开技能的差距没那么大:  再对比下成品效果,先看看没开技能的成品,桥面和河船都渲染出来了,整体还行,但背景比较单调:  再看开了 ADHD 技能的效果,差别就比较明显了。桥面和行人倒是有了,但你注意看画面底部,怎么还出现了几个巨人?这一看就知道是渲染层级出了问题:  综合来看,ADHD 技能确实能有效减少 AI 的输出量、节省 tokens 和响应时间,在日常问答和简单任务上效果很明显。但在复杂的开发任务中,它有可能因为过度压缩输出而影响代码质量。所以我的建议是,日常问答和代码片段类的场景可以开启这个技能,遇到需要 AI 仔细思考的复杂项目时,就不要用它了。 ## 这个技能是怎么实现的? 看完测评效果,你可能会好奇这个技能到底做了什么? 其实原理非常简单! 整个技能的核心就是一份 [提示词文件 SKILL.md](https://github.com/ayghri/i-have-adhd/blob/main/skills/i-have-adhd/SKILL.md),里面定义了 10 条输出规则,AI 在回答时会遵循这些规则来调整自己的表达方式。  这 10 条规则可以简单总结为: 1. 先说下一步行动,不铺垫背景,直接告诉用户该做什么。 2. 多步骤任务用编号,每一步只做一件事。 3. 以一个具体的下一步收尾,而不是「有问题随时问我」这种空话。 4. 抑制离题内容,有其他问题就单独提出,不要在当前回答里夹带。 5. 每轮对话重述当前状态,比如「第 3 步完成,共 5 步」,帮用户保持进度感知。 6. 给出具体的时间估计,用分钟来衡量,不说「一会儿」这种模糊表达。 7. 让完成的工作看得见,明确说出「登录功能已经可以用了」,不说「做了一些调整」。 8. 就事论事地报告错误,直接说原因和修复方法,不用「哎呀出问题了」的语气。 9. 每个列表最多展示 5 项,信息太多时先分组,优先展示最相关的。 10. 不写开场白、回顾和结束语,禁止套话。  ADHD 人群的核心困难在于工作记忆容量有限、启动行动的门槛高、对时间的感知比较模糊,这套规则刚好针对这些痛点逐一给出了应对方案。而对非 ADHD 用户来说,这些规则同样有效,毕竟没有人喜欢 AI 在回答里夹带一堆废话。 ## 最后哔哔 这个项目最让我有感触的一点,是作者把一个特定人群在阅读和执行上的真实困难,转化成了一份所有人都能受益的技术方案。好的产品往往就是这样,从关注少数人的真实需求出发,最终让更多人受益。 如果你也天天在用 AI 编程工具,不妨装上试试,也许你会发现 AI 的回答早就该这么简洁了。 OK 就分享到这里,这篇文章我也会收录到我的开源教程 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe) 中。上千张图、几十万字,从 0 开始带你学会 AI 编程,做出自己的产品、跑通变现全流程,感兴趣的同学可以看看。 > 开源指路:[https://github.com/liyupi/ai-guide](https://github.com/liyupi/ai-guide)  我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注~
喵喵搜索开源了——一个可自托管的多引擎联网搜索与 MCP 服务
大家好,我是汉堡🍔。 今天把一个做了一段时间的项目开源了:**喵喵搜索**(miaomiao-search)。 GitHub 地址:https://github.com/dnwwdwd/miaomiao-search 如果觉得有用,欢迎点个 ⭐ Star,这是我持续更新最大的动力。 --- ## 它是什么 一句话:**可自托管的多引擎联网搜索 + Remote MCP 服务**。 你可以把它部署在自己的机器或懒猫微服上,然后让 AI 客户端(比如 Codex、小龙猫)通过 MCP 协议调用它来搜索互联网、读取网页正文——完全在你自己的控制下,不依赖第三方中转。 --- ## 核心功能 **聚合 11 个搜索源**,一次搜索覆盖: - Bing、Baidu、DuckDuckGo、Sogou - CSDN、掘金 - GitHub(支持可选 Token) - B站(公开接口,返回官方 CDN 封面) - Exa、Firecrawl、Tavily(需要用户自己的 API Key,按用户加密存储) **读取网页正文**,支持 JavaScript 渲染回退(生产镜像内置 Chromium)。 **Remote MCP 服务**,通过 Streamable HTTP 暴露 MCP Tools,外部客户端用 Access Token 接入,懒猫应用间可以委托鉴权,不需要额外 Token。 **管理门户**,可以管理搜索引擎开关、缓存、限流、历史记录和审计日志。 **账号体系**,支持懒猫 OIDC 和本地账号密码两种登录方式。 --- ## 技术栈 - **前端**:Next.js 16、React 19、TypeScript、Tailwind CSS v4 - **后端**:Fastify 5、SQLite、Drizzle ORM - **MCP**:MCP TypeScript SDK v2 - **搜索底层**:`open-websearch@2.1.11` daemon 适配器 单实例运行,数据用 SQLite 持久化,按懒猫 UID 隔离用户数据,包内不含数据库或密钥。 --- ## 本地跑起来 要求:Node.js 20+、pnpm,以及一个可通过 HTTP(S) 访问的 Open-WebSearch daemon。 ```bash pnpm install ``` 启动 Open-WebSearch daemon(Windows PowerShell 示例): ```powershell $env:SEARCH_MODE="request" $env:USE_PROXY="true" $env:PROXY_URL="http://127.0.0.1:7890/" pnpm --filter @miaomiao-search/server exec open-websearch serve --port 3210 ``` 再分别启动服务端和门户: ```bash pnpm server:dev pnpm dev ``` 默认地址: - 门户:`http://127.0.0.1:3000/` - 服务端:`http://127.0.0.1:3001/` - MCP Endpoint:`http://127.0.0.1:3000/mcp` --- ## 安全设计 几个关键点说一下: - **实例密钥**派生会话、MCP Token Hash 和设置加密密钥,生产环境由懒猫清单注入,不能写进仓库。 - Exa、Firecrawl、Tavily、GitHub 的凭据在门户"引擎管理"中按用户保存,服务端只在当前用户数据库中存加密值。 - 外部 MCP 客户端用 `Authorization: Bearer <Token>` 接入;懒猫应用间调用由 ingress 注入 `X-HC-SOURCE` 和 `X-HC-USER-ID`,委托鉴权,不需要额外 Token。 - 门户不把 `X-HC-*` 头当登录凭据,所有受保护 API 将当前 UID 与应用会话绑定校验。 --- ## 许可 Apache-2.0,详见仓库 [LICENSE](https://github.com/dnwwdwd/miaomiao-search/blob/main/LICENSE)。 --- 项目还在持续迭代中,欢迎提 Issue 和 PR。 如果觉得有用,**点个 Star** 是对我最大的支持 ⭐ 👉 https://github.com/dnwwdwd/miaomiao-search
完成AI 万能视频下载总结器项目!---总耗时30h,第一次用ai完成项目,使用Qoder+Qwen3.8-Max实现。已部署上线(没有完全上线好,买错服务器了🤣,不能备案,所以支付功能用不了,等有钱再买个新的服务器)也上传了github,话说这个千问只能看到Credits 消耗都不知道到底用了多少token
我做了个网站,随时掌控 500 个 AI 模型的动态!
大家好,我是程序员鱼皮。 - 什么?又有新模型发布了? - 现在最好的文本模型是哪个? - DeepSeek 有多模态模型了么? - 国外模型是不是真的把国内开源模型远远甩在了后面? AI 模型发展得太快了,你有没有这样一种感觉,仿佛天天瘫坐在原子弹上看椅子爆炸。 一段时间不关注 AI,就会开始迷茫,觉得自己好像和时代掉队了。  那有没有一个工具,能让我随时随地,从上帝视角快速全面地了解地球上 **所有 AI 模型** 的现状和发展过程呢? **很抱歉,没有。** 不过没关系,作为一名 AI 编程博主,我掏出我的豆包(bushi  掏出顶级模型,运用我从自己 [《AI 编程教程》](https://ai.codefather.cn/vibe) 里学到的高超 AI 编程技巧,输入一段看起来很牛批、实际上非常无脑的提示词,然后等着 AI 疯狂输出三天三夜。  我的「AI 大模型世界」网站就这么诞生了! 指路:https://bilibili.com/toy/ai-model-world 本文视频版:https://bilibili.com/video/BV1eCe36GELv ## 1、进门先看今日格局 进入这个世界,你能最直接不绕弯子地看到当下最聪明、最会编程、性价比最高、最新发布的 AI 模型分别是谁。  每块牌子底下都写清楚了凭什么。比如最聪明那位 GPT-6 Astra,综合智力指数 166,是 206 个受测模型里的第一名;最划算的 DeepSeek V4 Flash 0731 智力全球第 31,价格却远低于同级。 顺便说一句,这些分数没有一个是我自己拍脑袋定的,全都来自 Epoch AI、LiveBench 这些第三方公开评测,网站只负责把它们抓回来、对齐、排好队。 ## 2、分类查看模型 往下滚动网页,能看到按类型划分的模型。  文本模型 226 个、视觉模型 239 个、全模态 44 个,图像生成、视频生成、语音模型也都单独成组。点进任何一类,就能看到这一类里目前排名最靠前的模型。 ## 3、国内外有哪些模型 再往下,世界被分成了国外和国内两个区域,国外有 27 家模型厂商。每个模型都是这个世界里的一个像素小人。名字下面那四根能力条分别是聪明、编程、记性和便宜,条越长越强,右边还标了它在全球的排名。  国内有 13 家模型厂商:  小人的长相也全是数据算出来的。体型对应模型规模,参数量越大块头越壮;身上的装饰越华丽,说明它的调用价格越贵;家里的书架越高,它能读的上下文就越长;右边那台电脑代表编程能力,没有公开编程成绩的模型,电脑上直接盖着一块防尘布。 ## 4、模型搜索 先问问看,大家现在最喜欢的是哪个模型呢? 我个人非常喜欢鲸鱼(娘),所以想把它家的模型一次性看个够。不用翻页找,直接在顶部搜索框里敲几个字母就行。  搜索功能非常灵活,支持按照模型名、厂商名,还有模型能力搜索。比如你输入「多模态」,它会把所有多模态模型列出来;输入「deepseek」,第一条就是深度求索这家厂商,底下跟着它的 24 个模型。 点进厂商页,DeepSeek 的进化过程就按时间线铺开了。  一路往下翻,能看到它每个月都发布了什么。翻到最底下,2025 年 1 月那一排里躺着当初全网爆火的 DeepSeek-R1。  到现在已经过去一年零八个月了。爷青回啊…… ## 5、查看单个模型的一生 点开最新的 DeepSeek V4.1 Flash,先看到的是它的身份卡。  这是一个视觉模型,中等价位、能读长文、会看图,而且开放权重。上面那条小时间线告诉你它是从 V4 Flash Vision Exp 这个视觉实验模型进化过来的,属于同一个系列的第二代。 右边的能力条里,记性那一项是满的,上下文窗口 100 万 tokens。网站还给了个换算,说这个长度一次能读完《哈利·波特》全七部,比干看一个数字有感觉多了。 继续往下,能看到 AI 的身世和战绩:  发布日期、知识截止、开源许可、输入输出价格都列在左边,右边是各项专业测试的评分。V4.1 Flash 刚发布不久,几个学术榜单还没收录它,所以这里老老实实写着「未参评」。 这一点我专门跟 AI 强调过,没有成绩就写没参评,绝对不许用估算值把空缺填上。一个模型没被测过,不代表它不行。 页面最底下,还能刷到各位 UP 主对这个模型的评测视频。 > 对了,下图第一个评测视频的博主是狗 🐶  这些视频是用 B 站公开的搜索接口抓回来的,搜索词就是模型名加上「测评」两个字,抓到的结果按播放量排好序存进仓库,页面直接读,我完全不用手动挑选视频。 至于第一条为什么是我自己的视频,因为站长的视频会置顶,算是我给自己开的一个小后门,很合理吧? ## 6、几百个模型的发布史,一条时间线看完 看完 DeepSeek,别的模型又是怎么一步步发展过来的呢? 切换到「时间线」,全世界 556 个主流 AI 模型,按发布月份从新到旧都排好了! > 彩色名字表示这个模型有第三方综合评测成绩  光是 2026 年 8 月这一个月,就有 33 个模型发布,密密麻麻铺满了大半屏,太卷了! 一路往下翻,最早的记录停在 2023 年 3 月。也就是说,从 AI 全面爆火到现在,满打满算才三年半,AI 的进步真的是太快了。 ## 7、模型排行榜 如果你好奇现在哪些模型能力最强,哪些模型性价比最高、适合日常办公,那就去看排行榜。  这里一共有 81 个榜单,综合智力、性价比、上下文窗口、最便宜,还有 SWE-bench、Terminal-Bench 这些专门测编程能力的。 榜单上方可以按地区、开源闭源、模型类型来筛选,非常灵活~  开源赛道的冠军是国内的 Kimi K3,综合智力 157.6,放到全球总榜上排第 11,已经很逼近国外顶级闭源模型的水平了。 更有意思的是前十名里有九个都来自国内厂商,月之暗面、深度求索、智谱轮着上,国产加油! ## 8、数据是怎么来的 做这个网站的时候,我给 AI 定的第一条规矩就是:**上线之后不能靠我人工维护**。 所以整套数据都是脚本自动同步的。利用 GitHub Actions 自动化,每 12 小时跑一次,从 Epoch AI 拿综合智力评测、从 models.dev 拿模型规格和价格、从 LiveBench 拿各项能力成绩,合并之后生成一份快照提交进仓库。 新模型发布之后,最快半天就会自己出现在 AI 大模型世界里,我不用动一根手指~  ## 最后哔哔 这个网站我已经完全开源了,代码和数据都在 GitHub 上,你想自己部署一份、或者改成你喜欢的样子都没问题。 > 开源指路:https://github.com/liyupi/ai-model-world  同时它也部署到了 [B 站的 Toy 平台](https://bilibili.com/toy/ai-model-world),完全免费、免登录、免注册,打开就能用。  说真的,这个项目技术上没什么难度,就是一堆数据抓取加一个静态页面。但在有 AI 之前,光是把几百个模型的参数和评测成绩整理成表格,就够我折腾一整个周末了。现在我只要把想法讲清楚,剩下的交给 AI,几天就能做出一个能自己跑起来的完整产品。 如果你也想试试用 AI 做点自己的小工具,我写了一套免费开源的 [《AI 编程零基础入门教程》](https://ai.codefather.cn/vibe),上千张图、几十万字,带你从 0 开始快速学会 AI 编程,做出自己的产品、跑通变现全流程,一次拿捏。 > 开源指路:https://github.com/liyupi/ai-guide  我是鱼皮,持续分享 AI 编程干货。觉得有用的话记得点赞收藏和关注哦~
想学习 AI coding 技巧,哪个教程比较合适?
### 问题描述 详细描述你在 AI 编程中遇到的问题。比如:“用 Cursor 写 Spring Boot 接口时,生成的代码无法启动。” ### 使用的工具 说明你使用的 AI 编程工具、模型和版本。比如:“Cursor + Claude,主要用 Agent 模式。” ### 个人情况 描述你当前的技术基础和项目背景。比如:“会 Java 基础和 Spring Boot,正在做后台管理系统。” ### 已有尝试 描述你已经尝试过的提示词、操作步骤和查阅过的资料。比如:“让 AI 改了两轮,也搜过报错信息,仍然没有解决。” ### 期望帮助 详细描述你期望得到的帮助。比如:“希望有人帮我看下提示词和生成代码哪里有问题,以及如何更高效地用 AI 写这类功能。” ### 相关资料 提供对话记录、提示词、报错日志、相关代码或文档链接。请使用代码块分享代码,不要拍照。 如果有多段代码,推荐使用 [代码小抄工具](https://codecopy.cn) 上传。
