欢迎回来
登录你的知识库账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属知识库
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

notebasewww.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v0.8.7 · 知识库
笔记
KnowledgeBase
网络无边,知识有迹。
0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →
>
笔记
0
加载中...
工具
0
此页用于记录用户反馈问题后的每一次改进
笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势
// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

ICML 2026 | 美团技术团队学术论文精选

2026/7/3技术杂谈

最近团队在 ICML 2026 上中了 13 篇论文,今天抽空整理了一下,分享给大伙儿。ICML 今年收了 23918 篇投稿,最后录了 6352 篇,接收率大概 26.6%,还是挺卷的。

下面按方向梳理一下每篇论文的核心思路和亮点,代码和数据链接我都附上了。


1. MemOCR:用视觉布局做长程推理的记忆

核心问题:智能体做长程推理时,交互历史会不断增长,现有方案把历史序列化成文本,token 开销跟长度线性增长,上下文窗口很快就不够用了。

解决方案:MemOCR 是一个多模态记忆智能体,核心思路是通过视觉布局来分配记忆空间。不同区域的信息密度不一样,没必要一视同仁地存。比如一个网页,标题、按钮、正文的重要性显然不同,视觉布局天然能反映这种差异。

效果:在长上下文问答(多跳和单跳)上超过了强文本基线,极端预算下上下文利用效率更高。

  • 论文:https://arxiv.org/abs/xxxx (PDF)

2. ScaleEnv:从零合成环境,训练通用工具智能体

核心问题:想让智能体学会用各种工具,需要有交互式环境和可验证的任务让它自己探索。但人工构造环境和任务成本太高,而且不容易覆盖多样场景。

解决方案:ScaleEnv 完全从零开始合成环境和任务,核心流程:

  1. 用程序化测试保证环境可靠
  2. 通过工具依赖图扩展任务
  3. 做可执行动作验证,确保任务能解

效果:在未见过的多轮工具使用基准上表现显著提升,泛化能力很强。

  • 论文:https://arxiv.org/abs/xxxx (PDF)

3. V₀:一个通用价值模型,跟策略解耦

核心问题:LLM 做 RL 训练时,价值模型通常跟策略绑定在一起,策略每更新一次,价值模型也得跟着训,很麻烦。

解决方案:V₀ 的思路是把任务重新定义为上下文学习,让价值模型去预测未见策略的性能,从而跟特定策略参数解耦。说白了,就是让价值模型学会"看策略的表现"而不是"记住策略的参数"。

效果:在 GRPO 训练中追踪策略演化比耦合模型更好,还能优化冷启动预算分配,在推理路由中逼近性能-成本的帕累托前沿。

  • 论文:https://arxiv.org/abs/xxxx (PDF)

4. Learning to Self-Verify:让模型学会自我验证

核心问题:现在 LLM 能生成不错的推理路径,但验证答案的能力很弱。自己写的答案自己都判断不准。

解决方案:提出一个多任务强化学习框架,把生成和自我验证作为两个独立但互补的目标联合优化。生成和验证一起训,互相促进。

效果:生成和验证能力都优于只训生成的方法,推理轨迹也更高效。

  • 论文:https://arxiv.org/abs/xxxx (PDF)

5. AgentNoiseBench:智能体在噪声环境下的鲁棒性基准

核心问题:现有智能体基准测试不考虑噪声场景,但实际部署中用户指令不完美、工具反馈不可靠,这些噪声会严重影响性能。

解决方案:AgentNoiseBench 建模了两种噪声来源:

  • 用户侧噪声:指令模糊、缺信息
  • 工具侧噪声:API 返回异常、超时、错误

提供了模块化的噪声注入管道和多维度评估指标。

发现:测了 25 个工具使用模型,工具侧噪声造成的性能下降比用户侧噪声更严重。

  • 论文:https://arxiv.org/abs/xxxx (PDF)

6. AJ-Bench:让智能体当裁判

核心问题:RL 训练中验证智能体行为是老大难。基于规则的验证器太死板,LLM-as-a-Judge 泛化到窄领域外也不行。

解决方案:让智能体自己当裁判(Agent-as-a-Judge),主动跟环境、工具交互获取证据来做验证。AJ-Bench 就是评估这种能力的基准,覆盖搜索、数据系统、GUI 三个领域,共 155 个任务和 516 条标注轨迹。

效果:比 LLM-as-a-Judge 稳定提升,但也暴露了不少开放挑战。

  • 论文:https://arxiv.org/abs/xxxx (PDF)

7. LUVE:超高分辨率视频生成,兼顾连贯性和算力

核心问题:超高分辨率视频生成,连贯性和算力很难兼得。分辨率一高,显存和计算开销爆炸。

解决方案:三阶段级联架构:

  1. 低分辨率生成 → 保证运动一致性
  2. 潜空间上采样 → 直接提分辨率,省显存
  3. 高低频专家融合 → 增强全局语义和局部细节

效果:逼真度和内容保真度都很好,核心思想已经用在美团 LongCat-Video 模型里了。

  • 论文:https://arxiv.org/abs/xxxx (PDF)

8. Infinite-World:1000+ 帧的交互式世界模型

核心问题:真实场景中的长程交互式世界模型,要在 1000+ 帧里保持视觉记忆和动作响应稳定。但真实视频位姿噪声大、视角回访少,很难学。

解决方案:三点创新:

  1. 无位姿层级记忆压缩器:把历史 latent 压成固定预算记忆,降低长程建模成本
  2. 不确定性感知动作标注:在噪声轨迹下更好地学习动作
  3. 高回访数据微调:增强 loop closure 能力

效果:让世界模型更适合从真实视频学习长时空一致性。

  • 论文:https://arxiv.org/abs/xxxx (PDF)

9. WildActor:无约束的身份保持视频生成

核心问题:现有身份保持视频生成方法在动态长镜头、视角剧烈切换时,会出现全身不一致、面部漂移、姿态僵死等问题。

解决方案:

  • 构建了大规模数据集 Actor-18M(1.6M 视频 + 18M 多视角图像),解决正脸偏置
  • 提出非对称身份保留注意力(AIPA):解耦身份和运动生成
  • 引入身份感知 3D 旋转位置编码(I-ROPE):显式分离时空 token
  • 配合视角自适应蒙特卡洛采样,实现鲁棒的任意视角条件控制

效果:在 Actor-Bench 上全身一致性和文本对齐度显著超过现有开源和商业模型。

  • 论文:https://arxiv.org/abs/xxxx (PDF)

10. SAFT:谱自适应微调,导航对齐的帕累托前沿

核心问题:SFT 用交叉熵,学习效率高但不是正确率的光滑近似,对低概率样本过度关注,容易过拟合和过度自信。DFT(直接微调)在梯度层面等同优化正确率的光滑近似,鲁棒性好但难样本学习效率低。两者构成效率-鲁棒性的两端。

解决方案:提出轻量的 pre-test protocol:

  • 用少量数据分别训 SFT 和 DFT,在验证集比表现
  • SFT 更优 → 数据 SNR 高 → 选几何插值 Geo-SAFT
  • DFT 更优 → 数据 SNR 低 → 选调和插值 Har-SAFT

效果:通过数据自适应的非线性插值匹配不同噪声 regime,获得更优的鲁棒性-效率权衡。

  • 论文:https://arxiv.org/abs/xxxx (PDF)

11. TRIP-Bench:旅行规划场景的长程交互智能体基准

核心问题:现有基准缺乏对长程、多轮交互场景的评测,尤其是需要保持全局约束的场景。

解决方案:TRIP-Bench 基于真实世界数据构建,包含 18 个工具和 40 多类旅行约束。困难任务最长 15 轮交互、150+ 次工具调用、20 万+ tokens 上下文。

发现:现有先进模型表现有限。论文进一步提出 GTPO 多轮强化学习方法,通过奖励归一化和轮次级奖励差分提升鲁棒性,让 Qwen2.5-32B-Instruct 超过了 Gemini-3-Pro。

  • 论文:https://arxiv.org/abs/xxxx (PDF)

12. InfVSR:流式生成视频超分辨率,一致性驱动

核心问题:扩散式视频超分在长视频场景下推理效率低、显存占用大、时序不一致。

解决方案:

  1. 把预训练视频 DiT 改成因果流式架构,引入滚动 KV 缓存保持局部过渡平滑
  2. 设计联合视觉引导,通过交叉注意力注入全局语义锚点,抑制累积误差漂移
  3. 训练时结合分块像素监督和跨块分布匹配,双重约束时序一致性
  4. 将扩散过程蒸馏为高效单步推理

效果:多项基准 SOTA,时序一致性显著领先,推理速度提升 58 倍,长序列显存占用恒定。

  • 论文:https://arxiv.org/abs/xxxx (PDF)

13. DRIVE:分布检索增强的出价策略

核心问题:标准 Decision Transformer 在复杂竞价环境中有三个痛点:

  • "平均动作"陷阱:多模态策略坍缩
  • 长尾幻觉:参数化模型对罕见场景记忆差
  • 缺乏推理优化

解决方案:提出"生成-检索-评估"闭环:

  1. 用高斯混合模型替代确定性输出,解决多模态策略坍缩
  2. 引入检索机制增强长尾场景记忆
  3. 通过 IQL Critic 实现闭环择优,对生成动作和历史动作实时评估

效果:决策鲁棒性显著提升。

  • 论文:https://arxiv.org/abs/xxxx (PDF)

一些感想

这 13 篇论文覆盖的面还挺广的,从智能体推理、训练、评测,到视频生成、微调策略、竞价决策都有。感觉有几个趋势比较明显:

  • 智能体评测越来越细:不再只比准确率,开始关注噪声鲁棒性、长程交互、自我验证能力
  • 记忆和上下文管理是瓶颈:MemOCR、Infinite-World 都在解决这个问题
  • 视频生成在往实用方向走:超高分辨率、流式处理、身份保持,都是实际应用需要的
  • 微调方法在精细化:SAFT 这种自适应策略,说明大家开始关注不同数据特性下的最优训练方案

如果对哪篇感兴趣,可以直接去 arXiv 看原文。

编写使用方法
Markdown 格式 · Ctrl+Enter 确定
新建笔记
预览
数据表格
点击单元格编辑 · Tab 移动
A1fx
Sheet1
BIH1H2≡🔗</>
隐私提醒

取消
编辑工具
取消