从RSI到ROI:Pyromind如何把持续学习做成一门平台生意?
9月12日,Anthropic CEO Dario Amodei发文呼吁放慢AI能力提升的节奏。他担心,AI参与构建下一代AI所推动的RSI(Recursive Self-Improvement,递归自我改进),可能超出人类理解和控制的能力。模型进步的同时,也需要为安全对齐和第三方评估留出时间。
这一呼吁很快得到回应。OpenAI CEO Sam Altman表示认同,并承诺同样向独立评估者开放;马斯克也直接回复“Dario is right”。
这场讨论让RSI从技术愿景,走进了更现实的产业议题。前沿实验室关注AI如何参与下一代模型的研发;对已经开始使用Agent的企业而言,眼前的问题则是,AI能否从自己的业务中继续学习。
一家工厂的验收标准、一套软件的操作流程、一项任务失败后的人工修正,都可以成为模型改进的依据。但这些经验却无法直接提升基础模型和Agent能力。它们需要被整理、评价,转成训练材料,通过持续训练提升模型能力,再通过新一轮任务检验效果。
面对这样的市场需求,Pyromind正在建设一套面向企业Agent的持续学习基础设施。平台通过AutoRL(自动强化学习),把数据处理、模型后训练、效果评估和版本更新连接成可反复运行的流程。Pyromind将这种由人和Agent协同推进的模型改进机制,视为RSI走向产业的一种早期实践。
图1:AutoRL演进与产品体系
安全与收益并非两道可以替换的考题。企业既要确认更新仍在业务边界内,也要判断改进是否值得投入。对Pyromind而言,真正的考验是如何让这种持续改进,不只服务于某一个项目,而能成为更多企业用得起、愿意长期使用的能力。
1、把通用模型放进专业场景
谈起客户的付费意愿,Pyromind创始人Kevin告诉《智能涌现》,“客户对Agent产品最愿意掏钱的,是现有模型搞不定的地方。”
他认为,基础模型越强,后训练的起点就越高。Pyromind要做的,是在通用能力的基础上,进一步满足企业的专业要求。
通用模型可以认识屏幕上的按钮,却未必熟悉一款电视App在不同页面里的遥控器路径;可以理解电子元器件,却未必知道一家企业要求怎样的输出格式,以及哪些错误会影响后续工程。决定产品能否交付的,往往正是这些需要从业务现场获得的经验。
欢网与Pyromind合作的AITV方案,就是这样一个场景。
用户对电视说一句想看某部剧,Agent要完成的远不止打开播放器。它得进入视频App、找到搜索入口、输入片名、定位结果,再处理途中出现的广告和弹窗,直到影片开始播放。遥控器主要依靠方向键和确认键,模型每走一步,都要先认准当前选中了哪个元素。
一次看错焦点,下一次确认就可能进入另一个页面。团队开发时还遇到过,截图刚交给模型,屏幕上便弹出广告,原本用于打开影片的一次按键,点进了会员充值页面。单张截图里的理解正确,并不能保证连续操作中的任务成功。
在这项合作中,欢网提供业务环境与任务数据,Pyromind负责训练动作执行模型,让Agent依次学会识别焦点、定位目标、选择按键路径,再与理解需求、规划步骤的模块配合。
(实际使用投屏效果展示)
据公司披露,在Android TV测试环境中,后训练的4B(约40亿参数)动作模型焦点识别准确率达到99.6%,整套系统的跨页面搜播成功率超过90%。前者检验每一步能否站对位置,后者检验用户的指令能否被执行到底。
华秋的难题,则藏在电子工程软件的输入端。
一张元器件符号图,人可以直接看懂,要交给KiCAD这类电子设计自动化软件继续编辑,却还需要转换成软件能解析的结构化描述。图中的线条、坐标、引脚与电气属性,都必须对应起来,否则工程人员仍要对照原图重新搭建。
图2:元器件示意图
在这类任务中,“看懂”和“做对”的差别,有时只在一个箭头上。基线测试里,模型能用文字分析箭头的构造,生成的描述重新渲染成图,箭头却朝向了相反的方向。类似的比例错误、引脚缺漏,都会影响结果能否用于后续工程工作。
Pyromind为此训练了专门的转换模型,把华秋的符号样本、输出格式和电气规则纳入后训练,再将生成结果还原成图,逐项核对。在公司披露的阶段性验证中,模型已经能在简单符号上识别标准图元,生成相应的结构化代码,初步完成从图片到工程描述的转换。让工程师少做一遍照图重建的工作,由此有了实现的基础。
图3:符号样本、输出格式和电气规则纳入后训练,再将生成结果还原成图过程(示意图)
据公司披露,阶段性验证中的渲染相似度IoU,也就是重绘图与目标图的区域重合程度,由0.2提升至0.65。细小组件和引脚位置仍需优化,但专业规则已经能够进入模型的学习过程,而不只停留在工程师的人工检查中。
在这些专业任务里,客户既能说清为什么值得做,也能判断怎样才算做好。影片有没有播放,符号有没有画对,都有比通用榜单更贴近业务的答案。Pyromind所说的企业私域,正包含这些来自具体业务的任务、过程和评价,而不只是把一份内部资料交给模型阅读。
这也为产业RSI提供了一个具体起点:把企业已有的任务目标和验收标准,转成模型可以学习和验证的依据,再让新一轮业务持续提供改进的材料。一次训练的效果,说明了方法在当前任务上的价值;能否接住下一次变化,才开始检验持续学习。
2、把业务经验变成可交付能力
欢网团队曾遇到过一次App调整。过去点开视频,还要手动切换全屏;更新之后,播放即全屏。用户的观看目标没有变,完成它的操作路径却变了。
模型已经学会的动作,不一定还能原样沿用。即便更换一个更强的通用模型,是否适应了新的操作路径,也仍需要验证。
Pyromind为这项合作搭建的,不只有某一版动作模型。系统会把任务中的截图、按键、规划和执行结果记在一起,将成功示范、错误操作及修正后的路径整理成训练数据。新版本经过评估后,再回到任务中运行,继续留下新的轨迹。
这个过程并不是把所有日志直接送进训练。一次任务失败,只能说明结果不对,还要分清是焦点识别错误、目标没有找到,还是按键路径走偏。不同问题回到不同的训练环节,失败经历才可能成为有效经验。欢网案例中的这些数据仍需抽检和修正,也不是Agent每执行一次任务,模型参数就立即改变。
在App改为播放即全屏后,新的界面和操作轨迹沿着已有流程积累下来,模型通过后续训练适应新的路径。上一次交付留下的数据处理方法、训练配置和评估记录,成为这次更新的基础。
Pyromind将围绕任务评价持续积累训练材料的机制称为Continuous Learning Flywheel。它让任务执行和模型改进相互衔接:模型参与更多任务,产生新的经验;经过筛选、训练和验证的经验,再影响模型下一次如何执行。
图4:Continuous Learning Flywheel示意图
但重复运行一套训练脚本,还不是这里全部的目标。RSI所指向的进一步变化,是让AI也参与“怎样改进AI”的工作。按Pyromind披露,其AutoRL体系正在让Agent协助筛选轨迹、分析失败原因、提出评测建议和创建训练流程。过去每轮都要由算法专家重新组织的部分工作,开始交给系统承担;业务目标、复杂判断与模型发布,仍需要人来把关。这种按环节推进的自动化,并不意味着整套流程已经能够无人值守。
这种探索也不只有一条技术路线。Salesforce在今年7月讨论自我改进Agent时,重点放在模型权重不变的情况下,优化提示词、工具和工作流;Pyromind则选择通过模型后训练,将业务反馈转化为模型自身的能力更新。两者都需要回答,哪些改动真的有用,以及怎样让有效经验进入下一轮。
对企业来说,当前更有价值的进展,是更新流程能够持续运行,并逐步减少重复的专家劳动。业务仍在变化,人也仍在决策,但维护一个Agent,不必永远等同于重新组织一次模型研发。这正是Pyromind把当前实践视为产业RSI早期形态的原因。
一套系统能够持续训练,不意味着客户就愿意一直支付训练费。客户关心的是,下一轮投入能否继续改善自己的业务。对于流程稳定、异常有限的任务,提示词、固定工作流或一次性微调可能已经足够,反复训练未必是更经济的选择。
持续需求首先来自变化本身。欢网需要适应新的App界面和操作路径;工业客户则会遇到新的产品、订单和验收要求。即使某个版本已经达到标准,维持这个标准也可能需要继续更新。另一些需求来自应用范围扩大。华秋与Pyromind的合作,已经从元器件符号转换向电路图任务延伸,尺寸标注缺漏、照片变形等更复杂的输入,带来了新的适配工作。
从关键任务建立合作,再沿新任务、新设备和新数据扩展,最终形成Land-and-Expand。它的前提是前一阶段的工作确实有用,客户才有理由把更多业务交给这套机制。
在工业质检中,这笔账更加直观。
一个合格产品被误判为疑似缺陷,往往就要增加一次人工复检。据Kevin此前披露,团队曾在约1万张历史样本上,将一个质检任务的误报率从23%降至8%。客户可以结合检测量、单次复检耗时和人力成本,评估这类改善的价值,再与训练及维护费用比较。与此同时,漏掉真实缺陷的风险也必须受到控制。
反馈在这里同时发挥了两种作用。对训练系统,它告诉模型什么结果更好;对客户,它提供了判断投入产出比的依据。技术循环和商业回报因此落在了同一项业务指标上。
除了减少人工复检,企业还要考虑Agent本身的使用成本。按Kevin介绍,华秋从调用Gemini转向后训练的4B模型,欢网则在动作执行环节使用4B模型。经过针对性训练,较小的模型可以承担其中的专业任务,为降低高频调用的资源消耗提供空间。
Pyromind的独立研究PyroDash,还把模型之间的分工纳入了训练。小模型通过后训练学会判断何时需要调用大模型。实际推理时,请求先交给小模型,它在生成过程中决定是否交接;一旦交接,就由大模型接续完成。训练目标同时考虑准确率和推理成本。据公司披露,在五项数学推理测试中,PyroDash高精度模式的平均准确率达到64.04%,比单独使用GLM-5.2-FP8高出6.36个百分点,估算推理成本同时降低20.4%。不必把每一步都交给尤为昂贵的能力,系统也可以学会怎样分配能力。
图5:过去的优化 vs PyroDash
对企业而言,是否值得训练,最终仍要算总账。一次更新的训练、部署和维护投入,能否被后续调用中的节省、人工复核的减少或业务质量的改善覆盖,决定了它有没有继续投入的理由。
据Kevin此前在公开对谈中披露,在ROI明确的较大企业场景中,单体客户付费已达到百万元至千万元人民币区间。这个量级说明,持续学习已经存在具体的商业需求,而非只有技术讨论;它不代表所有客户的付费水平,也不等同于公司整体收入。
而Pyromind的收费方式,也对应着客户希望承担多少更新工作。使用训练平台Studio,客户自己维护训练流程和奖励,平台按算力、存储等资源计费;使用持续学习服务EchoMind,则由Pyromind进一步承担奖励设计和更新维护,按包含训练资源与奖励服务价值的用量单元计价。两者都可以随持续训练产生收入,区别在服务边界,而不是“一次性收费”和“长期收费”。
客户买的是相应的训练资源和服务,而持续付费的理由,是模型更新依旧能带来业务价值。模型改善支持更广的业务使用,更多使用又产生新任务和反馈,这才有机会形成商业上的正循环。收入本身不能证明RSI已经实现,但可衡量的回报,让持续学习具备了长期运行的经济基础。
3、把定制需求做成平台级生意
有了持续更新的需求,下一道难题落在Pyromind自己身上。如果每增加一个客户,都要重新投入一整支算法团队,持续学习依然可能是一门人力密集的项目生意。
企业的任务越具体,这个问题越突出。电视遥控器和电子工程显然没有同一套验收标准。把一个客户的模型和规则直接交给另一个客户,既不能保证效果,也不是横向平台的意义。
Pyromind希望复用的,是把业务经验变成模型能力的方法与工具。首次进入一个场景时,团队需要理解数据格式、任务目标和评价基准,再适配训练反馈;其中共通的数据处理、奖励方法、训练节点和评估流程,则继续沉淀进产品。相似场景再接入时,已有积累可以减少重复搭建,而行业规则与关键判断仍要重新校验。
据公司介绍,在通用产品团队支持下,两名负责需求接入与适配的FDE,也就是前线部署工程师,支撑了十几个B端客户。这个分工的重点,不是用两个人替代全部研发和交付,而是把现场适配与通用产品建设分开,让后者能够服务多个项目。
图6:场景适配与产品复用
客户一侧同样会留下积累。除了更新后的模型,任务轨迹、奖励定义、评价标准、训练配置和历史版本,都能成为后续改进的依据。一项业务要求曾经怎样被转成训练目标,哪种调整有效,下一次更新可以接着往下做。
基模越快迭代,这些积累就越需要被妥善保留。Kevin在此前访谈中强调,Pyromind不希望依附于某一家基础模型公司,也不下场包揽客户应用,而是为不同模型与业务提供持续学习能力。企业可以继续选择更合适的模型,同时尽可能延续已有的业务判断和训练经验。
这也解释了平台复用与产业RSI的关系。前者不只是多卖几份软件,而是让更多Agent可以接入学习机制,不必各自重建一套训练与维护体系。若每个Agent都需要长期配备专门的算法团队,持续学习就很难成为企业的常规能力。
从现有实践看,欢网和华秋提供了专业任务经后训练取得改进的样本;任务反馈回流与更新流程,让改进能够在后续业务中继续发生;收费与交付分工,则开始回答这套机制如何被客户采用、由谁长期维护。这些结果共同构成了Pyromind探索产业RSI的早期证据,而不是把某一次分数提升直接等同于完整的自我进化。
接下来,更有分量的验证将来自更长时间的客户使用。更新能否持续产生收益,接入相似场景时专家投入能否下降,自动化程度提高后效果是否依然可靠,都需要在后续交付中继续回答。
Pyromind的长期愿景,是“让每一个Agent都拥有自进化能力”。眼下,这个愿景有了一条可执行的路径:让客户的业务经验进入模型,也让服务客户的经验进入平台。
当下一轮改进不再从头开始,下一次交付也能沿用已有积累,持续学习才可能同时成为客户愿意付费的能力,以及一家基础设施公司可以扩展的长期生意。















