MIT推出SEAL框架:让大语言模型自主编辑权重
麻省理工学院研究人员发布新框架SEAL(Self-Adapting LLMs),使大语言模型能通过强化学习生成‘自我编辑’(self-edits)并据此更新自身参数。该方法不依赖外部训练数据,而是基于上下文自产合成数据,在知识整合与少样本学习任务中验证有效。论文强调其为通向真正自进化AI的重要一步。
SEAL:让大模型学会‘自我编辑’
麻省理工学院(MIT)最新发布的论文《Self-Adapting Language Models》提出SEAL(Self-Adapting LLMs)框架,旨在推动大语言模型(LLM)向‘自适应进化’迈出实质性一步。与传统微调依赖人工标注数据或外部语料库不同,SEAL赋予模型一种新型能力:在面对新任务输入时,自主生成用于参数更新的‘自我编辑’(self-edits, SEs),并基于下游任务表现反馈进行迭代优化。
SEAL的核心机制包含两个嵌套循环:外层为强化学习(RL)循环,负责训练模型生成高质量的SE;内层为参数更新循环,将生成的SE作为监督信号,通过监督式微调(SFT)实时调整模型权重θ→θ′。整个过程无需人工干预的数据标注或外部训练集,仅需任务相关上下文C(如一段待整合的知识文本)和下游评估目标τ(如一组相关问答)。
强化学习驱动的自我编辑生成
SEAL将‘生成自我编辑’建模为一个策略学习问题。模型在给定上下文C下输出SE,随后用该SE执行SFT更新得到新模型LMθ′,再在τ上评估其性能以获得奖励r。RL的目标是最大化该奖励的期望值。研究团队发现,标准在线策略优化方法(如GRPO、PPO)在该设定下易出现训练不稳定问题,最终采用DeepMind提出的ReST^EM方法——一种基于过滤的行为克隆(behavioral cloning)策略。该方法分两步:E步从当前策略采样多个候选SE;M步仅对其中能使下游性能提升的SE,通过SFT强化其生成概率,形式上等价于期望最大化(EM)过程。
值得注意的是,当前实现由单一模型同时承担SE生成与参数更新角色,但论文明确指出,该架构可自然扩展为‘教师-学生’分离结构,即由更强大的教师模型生成SE,指导轻量级学生模型更新,为未来规模化部署预留接口。
在知识整合与少样本学习中的实证
MIT团队在两个典型场景中实例化SEAL:知识整合(Knowledge Integration)与少样本学习(Few-Shot Learning)。在知识整合任务中,模型需将一段新文本C(如科学发现摘要)动态融入自身知识体系,并回答后续问题τ;SEAL通过生成针对该文本的参数修正指令,显著提升了问答准确率,且效果优于标准提示工程与一次性微调。在少样本学习中,模型仅见极少量示例即需泛化至新任务,SEAL借助自我编辑快速适配分布偏移,在多个基准上展现出更强的鲁棒性与泛化效率。
置身自进化AI浪潮的前沿节点
SEAL的发布恰逢全球AI自进化研究密集爆发期:Sakana AI与英属哥伦比亚大学联合提出‘达尔文-哥德尔机’(DGM);卡内基梅隆大学推出‘自奖励训练’(SRT);上海交通大学开发面向多模态大模型的MM-UPT框架;香港中文大学与vivo合作发布UI-Genie。与此同时,OpenAI CEO Sam Altman在博客《The Gentle Singularity》中描绘了机器人通过自我复制重构全球供应链的远景,并引发关于‘递归式自改进AI是否已在内部运行’的广泛讨论。SEAL虽未宣称实现通用自进化,但首次以可复现、模块化、任务驱动的方式,展示了LLM在无外部训练数据条件下持续自我优化的技术路径。
> 编者观点:SEAL代表AI研发范式从‘人类主导训练’向‘模型参与训练设计’的关键迁移。对中国企业而言,其价值不仅在于算法创新,更在于提示构建‘轻量化自适应能力’的新路径——尤其适用于垂类模型在数据受限、领域高频演进场景下的低成本持续进化。
本文为企业智脑(优秘智能)编译整理自公开资讯,信息与观点以原文为准,仅供参考。阅读原文(Synced) →