一个模型已经会写代码、读表格、画图。现在让它解释一条产线昨晚为什么出现异常,它却可能把两台设备的曲线对错时间,把停机维护当成故障,再围绕这些误读写出一篇漂亮报告。它有许多通用能力,眼前的工作仍然缺了几块东西:这里的数据怎样理解,过去的人怎样排查,以及哪些操作能取得可靠的证据。
最顺手的补救,是把设备说明、维护日志、排查经验全塞进提示。材料少时,这确实有效;任务越来越多,提示就成了一本不断加页的操作手册。每次排查都要带着所有设备的背景,眼前真正有关的条件反而被淹没。于是我们开始寻找别的组织方式:知识库、长期记忆、工作流、专用工具,都在试着补上这份工作的某一部分。
已有办法各自补上了什么?
知识库与检索首先解决“资料太多,不能每次全读”的问题。模型可以按设备、现象和时间找到相关材料,知道字段单位、维护安排和以往记录。这一步让它有了依据,却未必让它知道怎样使用依据。找到了校准记录,也还要意识到:校准时间与曲线台阶重合,是应该优先检查的一条关系。知识进入窗口,判断方法仍可能缺席。
长期记忆进一步保存做过的事。上次为什么误判、后来找到了什么证据,都有机会帮助下一次工作。但把完整对话当作记忆库,又会把试探、误解和偶然成功一同保存。下一次需要的是这个案例的适用条件与关键转折:什么现象值得联想到它,哪一步验证改变了结论。记忆开始有用,往往发生在一段经历被整理成可以迁移的经验之后。
工作流把经验再往执行方向推一步,规定先查数据、再找异常、最后验证解释。它能避免漏项,也能让几个角色按固定顺序合作。代价是场景一变,分支就开始增多:这台设备有没有校准记录,那个传感器是否换过型号,某种异常是否需要另走一条路。流程越想包办所有判断,图就越接近重新写一遍业务程序。适合固定的是明确的依赖和必须履行的条件,现场判断则需要保留给模型。
专用工具则把某些动作直接做熟。时间对齐、缺失值处理、统一单位,都可以交给验证过的程序。可工具变多后,又出现一个选择问题:模型如何知道眼前该用哪一个、结果有什么限制、失败时该查什么?孤零零的一组工具名称,也缺少工作的上下文。走到这里就能发现,知识库、记忆、流程和工具各自有用,真正缺的往往是把它们围绕同一份工作组织起来的方式。
把一份工作拆成可以积累的四种东西
-
知识保存事实与关系。 字段的单位、设备编号的含义、时间戳使用的时区,以及昨晚什么时候停过机。知道振动如何产生,推不出这家工厂把哪个字段叫作“振幅”。这类信息需要有可查的来源,变化以后也要更新。把说明和记录接进来,模型才有条件把通用理解落到眼前的对象上。
-
经验保存情境与判断。 一个工程师可能知道,传感器校准后出现的台阶变化,应该先核对校准记录,再怀疑机器状态。经验里保存着线索与行动的关系:看到什么现象,优先检查什么,什么证据足以排除一个解释。保留适用条件和当时的结果,这段经历才能帮助下一次排查;只记一句“曲线突变通常没问题”,就把有用的判断压成了误导。
-
流程保存方法与依赖。 先确认数据是否可用,再定位异常区间,随后比较候选解释,最后把结论与证据一同交付。它保存的是工作之间的依赖关系。模型可能每一步都会做,却在一次长任务里漏掉其中一步;一个流程就能先替它维持这些关系。必须满足的交付条件可以由系统检查,其余步骤则可以作为参考,让模型根据现场情况调整。
-
工具保存已经做熟的动作。 知道两条曲线需要对齐,还要真正处理缺失值、采样间隔和时钟偏差。模型可以临时写程序,也可以调用已经验证过的处理函数。后者把反复需要的精确操作变成稳定入口,省下重复实现的工作,也让输入、输出和错误有了明确的含义。领域智能体由此能够借用现成软件的能力,而不必每次都从文字重新造出它们。
下面可以逐项接入这四种支持。模型始终是同一个,任务也没有变化,变化的是它能够依据什么、借助什么去完成工作。留意每次补充消除了哪一种盲区;把四个开关全部打开,也只是配齐了这里展示的工作条件,最终报告仍要经得起数据与业务事实的检验。
已接入的支持: 0 / 4
单位、时区与停机时间缺少已确认的来源。
查阅字段定义与记录,确定观察到的数据代表什么。
缺少能够提示优先排查方向的相关案例。
校准后曲线跳变时,先核对校准记录。
需要在本次任务中实现并检查时间对齐。
按接口说明调用对齐函数,再检查处理结果。
没有提供工作顺序与交付检查项。
检查数据质量、定位区间、比较解释,并附上证据。
这些东西,为什么看起来像人的记忆?
有趣的是,知识、经验和流程,在认知科学里都能找到熟悉的对应:语义记忆保存关于世界的事实,情景记忆保存特定处境中的经历,程序性记忆支持学会的技能与做法。Squire 与 Dede 对记忆系统的梳理讨论了这些不同功能。它给工程带来的启发很朴素:一个能持续做事的系统,既要知道世界是什么样,也要记得遇到过什么,还要积累事情怎样做。只建一个“资料都能搜到”的知识库,自然覆盖不完这些需求。
那么,工具放在哪里?我喜欢把它看作系统的“肌肉记忆”。刚学一项动作时,人要留意每一步;熟练之后,许多细节可以连贯地完成。智能体也可以把反复推导、反复生成的精确操作固化为程序,下次直接调用。认知科学通常把这类运动技能放在程序性记忆一侧;在工程上,我们又能把“可读的方法”与“已经可执行的动作”拆开。流程告诉模型如何组织工作,工具让其中一段工作可以直接发生。
这四种支持也会相互转化。一次排查先留下一段经历;我们从中提炼“曲线突变时核对校准”的经验,再把它放进排查流程;其中反复出现的时间对齐,被做成一个工具。工具产生的新结果又补充知识与案例。于是,一份工作的方法可以在外部逐渐变得熟练,而不必等到每一个细节都进入模型参数。
原来,一个技能文件夹就能把它们放在一起
现在再看 Skills,会发现它的形式恰好贴着这些需求:入口是一段自然语言,能够说明任务、方法与适用条件;旁边可以放知识文档、案例、模板和脚本。一个产线排查技能里,入口告诉模型何时使用、先确认什么,参考文件解释字段,案例说明常见误判,脚本完成精确处理。同一份工作需要的东西终于有了共同入口,各自又能保持适合自己的形式。
Agent Skills 的渐进式加载还把这个入口做得很轻:先让模型看见名称与描述,选中后再读取正文,具体参考与程序继续按需使用。技能库可以很大,当前窗口只需要展开眼前的工作。描述负责帮助找到方法,正文负责指导使用,外部文件负责承载细节;索引与内容的层次,就顺着使用过程自然形成了。
例如,这个技能可以保持很普通的目录结构:
line-diagnosis/
├── SKILL.md # 适用场景、工作方法、材料入口
├── references/fields.md # 字段含义、单位和数据来源
├── cases/calibration.md # 现象、调查过程、适用条件
└── scripts/align_series.py # 时间序列对齐与结果校验
模型读完入口之后,可以按现场情况选择材料和动作。哪些步骤适合写成建议,哪些检查值得做成程序,都能独立调整。
这种组织方式保留了前面几种方案的长处。知识库仍可以负责检索,历史记录仍可以保存原始经历,确定的依赖仍可以由工作流执行,专用工具也继续承担计算。技能把“这份工作该怎样借用它们”放在一个可读、可修改的位置。它特别适合承载还在变化的方法:人能编辑,模型能阅读,做完一次任务之后还可以提出下一次修订。
文件夹的朴素也意味着维护责任仍然很具体。描述含糊,技能就可能选错;案例只记录结论,经验就可能套错;脚本依赖失效,动作就无法完成。必须履行的权限和验收条件仍由运行设施执行,技能说明负责把使用方法讲清。判断一份技能是否变好,要看它是否帮助新任务减少同类错误,而不只是入口文件看起来更加完整。
沿着这个方向,Harness 就成了工作方法可以先行生长的地方。今天需要提醒模型核对校准记录,明天这条经验已经能被主动取用;后续训练又可能让它学会,在类似现象出现时自己寻找对应的环境变化。一个案例先进入经验,经验组织成技能,技能帮助产生更好的轨迹,轨迹再参与训练。Skills 最吸引我的地方,就是它让这条路上的改进都有一个足够自然、足够具体的落点。