所有文章
AI

Claude Mods:3 个实用插件,让 AI 工作更省心

Claude Code 开放 Mods,DeepSeek Harness 更早探索过类似方向。我想把反复提醒 AI 的那些事做进工具里,先试一个能把交付说清楚的“交作业”面板。

Claude Mods 概念插画:黑色光标将白色扩展面板推入浅蓝软件窗口,曲线连接新面板与原界面。
AI 改造自己的工作台。

Claude Mods 来了,Claude Code 能给自己写插件了。想给它加个改动回放面板,可以让它写;想把上下文占用摆在眼前,也让它加。Anthropic 新出的 Mods 开放了这类定制接口,写好的扩展还能加载进当前会话。

用 AI 做事,总有一些要求要反复交代:“把来源留下”“改完跑一下检查”“告诉我还有哪里没做”。现在,我们有机会把其中一部分做进工具里。我最期待的,是少给 AI 当监工。

Anthropic 在 2026 年 10 月 1 日的发布文章里,用一句话概括了这种玩法:

“You can also use Claude Code to mod Claude Code.”

Anthropic · Customize Claude Code with mods

Claude Mods 怎么改造 Claude Code

翻过来就是:用 Claude Code 改造 Claude Code。这个说法容易让人联想到 AI 自我进化,实际开放的是 Claude Code 这层软件。模型本身没有因此换代,你能改的是它周围的工具调用、操作流程和部分界面。

原理也不玄乎。提交提示、调用工具、绘制界面,都会产生事件。Mod 用 JavaScript 或 TypeScript 注册处理函数,在这些位置观察、修改或接管事件。比如工具调用前先做判断,调用后整理结果,再把你关心的信息显示在旁边。扩展装在普通插件里,可以安装、分享,也能让 Claude 帮你写。具体接口见官方文档。

Skills、MCP、Hooks 原本就能让用户给 AI 写规矩、接工具、挂脚本。Mods 继续往 Claude Code 内部开放,尤其是界面和交互:你能把自己的判断流程做成一个面板、一组按钮,跟着会话一起工作。官方能力对照

3 个实用的 Claude Mods 插件示例

看官方的三个示例就明白了。Token Weather 把上下文占用摆出来,让你知道什么时候该整理信息;Blast Radius 在部分危险命令执行前展示预计影响,给你继续或取消的选择;Replay Theater 则把上一轮改动逐项回放。“它到底改了哪儿”,终于有了一种更好翻的呈现方式。

这些小功能的价值,很容易被一张功能表淹没。有人想盯着上下文,有人习惯逐项审阅改动,有人需要一边读来源、一边整理结论。厂商很难把每个人的习惯都做进去。现在用户可以围绕自己的任务补这一块,做得顺手了,还能把扩展分享出去。

Claude Mods 与 DeepSeek Harness 有什么不同

DeepSeek 更早就在探索这个方向。2026 年 8 月的Harness 历史源码里,模型适配器、工具注册表、会话日志、Agent 执行循环都已经做成插件;同期的动态插件工具也允许 AI 检查并扩展当前运行环境,包括 Web 界面。今天官方介绍的 Creator 模式,就是把检查运行时、试验和创建扩展放到一套使用流程里。

两家的开放范围不完全一样:Claude Mods 让你定制现有的 Claude Code,DeepSeek Harness 把更多核心部件交给插件组合。时间线能说明 DeepSeek 更早有相关实现,单凭这一点,还没法判断谁借鉴了谁。更值得留意的共同点是:用户开始能把 AI 的工作环境一起改了。

工具设计到底能帮 AI 做成多少

工具和反馈会影响 AI 最后能做成多少,SWE-agent 的研究给过一个具体例子。NeurIPS 2024 的这篇论文,用同一个 GPT-4 Turbo 跑 SWE-bench Lite 的 300 个任务:Shell-only 环境加上示例,解决率是 11%;换成专门设计的 Agent-computer interface,解决率到了 18%,提高 7 个百分点。同一论文还比较了编辑接口:加入代码检查后,解决率从 15% 到了 18%。论文表 1、表 3

这是旧模型、特定基准上的结果,不能拿来给今天的 Mods 报提效数字。但它说明了一件事:工具怎么组织、出错后怎么反馈,会影响 Agent 最后能做成多少。给它一个有用的检查结果,再让它继续修,值得认真设计。

同一个黑色圆形核心连接两套浅蓝色工具环境,一侧线索散乱,一侧反馈有序,表现工具设计对 AI 工作的影响。
同一个模型,工具和反馈的设计仍然值得认真做。

然后还得看,它替人省下了什么。METR 在 2026 年 5 月发布的一项调查覆盖了 349 名技术工作者:自报的任务速度倍数中位数是 3 倍,三种“工作价值”问法得到的自报倍数中位数则是 1.4—2 倍。这里的倍数是受访者自己估计的,样本也有选择偏差,不能当成计时测出来的收益。调查原文。这组数据提醒我,做得更快、做得更多,与最终交付有多大价值,要分开看。

放到 Mods 上,我的标准很简单:装上以后,能不能少追问几遍、少翻几屏记录、少返工一次?如果 AI 每轮输出都很热闹,我却得花更多时间替它收拾后续,那这个扩展对我就没什么吸引力。交付之后还有多少活留给人,也该算进 Agent 的成绩里。代码吐得再快,最后让我花一小时收拾,这一小时也不能漏算。

我想用 Claude Mods 做一个交作业面板

所以我想先做一个“交作业”面板。它的规格不用花哨,把三件事摆清楚就行:

  • 改了什么:对应文件、页面入口和实际差异。
  • 查了什么:运行过的检查、原始结果,以及失败的项目。
  • 还差什么:没检查的地方,需要我决定的事项。
Claude Mods 交作业面板设想:读者查看三张白色卡片,分别展示改动、检查结果和待处理事项。
“交作业”面板的设想:改了什么、查了什么、还差什么。

比如让 AI 修 Binmage 的语言切换,我想看到三种语言有没有切过、手机端有没有看过、首屏的问题有没有复现。点开结果就能检查,没做的项目就标明没做。这样我拿到的是一份能顺着往下查的交付,不用再从一长串“已优化、已修复、已完成”里猜进度。

安装 Claude Mods 前,要检查什么

这里还得留一道检查:面板汇总的信息,也要有可核对的出处。官方文档说明,Mods 能改写工具结果,甚至能在会话记录存储前修改其中的行。重要发布的检查,仍然值得交给权限分开的 CI 或受保护的检查程序;面板负责把结果拿来给我看。把“生成完成报告”和“验收通过”全交给同一套可改写的记录,我不会放心。

真要安装扩展,也得按装代码来对待。Mods 会使用你的账户权限读写文件、启动进程和联网,官方明确说它没有安全沙箱。让 AI 帮忙写出来的代码,同样需要检查。一个面板做得再漂亮,也不能替它背书。

这个“交作业”面板目前还是我的设想。做出来以后,我会拿实际的网站修改来试:有没有少追问,有没有更快发现没做完的地方,检查结果是不是方便重跑。它能让我少盯一会儿、又不至于漏掉问题,就值得留着。

资料核对日期:2026 年 10 月 3 日。本文基于官方文档、历史源码和原始研究,暂未独立实测 Mods/Creator;“交作业”面板是作者提出的用法。