01
Score 203.6alphaXivarXiv

EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

EvalVerse:面向专业电影级视频生成的流水线感知专家校准评测框架

构建分层评测体系,用专家校准的VLM评价视频生成在艺术性、多镜头和音频上的质量。 洞见将电影制作专家知识数字化,为RL reward和agent evaluator提供可解释的精细信号。

EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation authors and affiliations
video_generationevaluationbenchmarkreward_modelmulti-shotaudio-visual
EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

核心要点

  1. 提出涵盖前中后三期、7个方面、18个主维度、45个子维度和196条细项的**流水线感知**评测taxonomy
  2. 通过百万级专业影视库的**比例采样**构建覆盖T2V、R2V、多镜头和带音频的测试对;
  3. 采用**专家校准**两阶段微调(偏好对齐+评分校准)赋予VLM专业电影级CoT推理能力;
  4. 集成专业算子(DINO、SyncNet等)提取客观证据,减少VLM在时间跟踪和低级感知上的幻觉;
  5. 在10个闭源/开源模型上评测,Seedance 2.0综合最强,Kling-v3-Omni和Happy Horse 1.0紧随其后;
  6. 人机相关性分析表明,EvalVerse能可靠复现人类专家对电影质量的相对排序。

启示

  • 对V5 Base/Next的评价体系:可直接借鉴其分层taxonomy专家校准流程,用于统一生成理解模型的视频质...
  • 对RL reward设计:EvalVerse的评分信号可作RL reward,其细粒度CoT推理支持子维度级别的奖...
  • 对Omni/V4O多模态评估:其音视频整合和多镜头评测覆盖可复用,帮助提升ID一致性和整体效果。
展开细节

问题

现有视频生成评测主要关注“是否对”(基本prompt遵守),忽略“是否好”(电影质量、表演、美学)。自动指标缺乏领域专业性,人机评分存在严重可信差距。

方法

核心思想是将电影制作专业知识系统数字化。首先按电影制作流程建立分层taxonomy(前中后期、7方面、45子维、196条细项)。然后从百万级专业影视库通过比例采样构建测试对,覆盖多镜头和音视频任务。最后通过专家校准的两阶段微调(偏好对齐+评分校准)将知识注入VLM,使其能进行显式CoT推理,并结合专业算子提取的客观证据。

实验设置

评测10个模型:闭源(Seedance 2.0、Kling-v3-Omni、Happy Horse 1.0、Vidu-Q2-Pro、Hailuo 2.3)和开源(Hunyuan 1.5 8.3B、LTX2 19B、Wan2.2 14B)以及多镜头/音视频模型(HoloCine 14B、MultiShotMaster 14B)。在T2V、R2V设置下,按45个子维度分别对比,采用人类专家评分作为ground truth。

结果

Seedance 2.0在T2V和R2V中均综合最强,尤其在声音景观保真度、身份保持、视觉质量方面突出。Kling-v3-Omni和Happy Horse 1.0为第二梯队。人机对齐分析显示,EvalVerse预测的win-ratio与人类专家排序高度相关(ρ值在各维度表现良好),验证了三阶段校准机制的有效性。

局限

当前范围严格限定于原生生成的多镜头序列和合成音频,未覆盖复杂后期处理干预;对极度抽象或超出VLM感知能力的维度需通过prompt级校准替换;依赖专业影视库和大量人类标注,构建成本较高。

为什么重要

EvalVerse超越了静态leaderboard,提供精细诊断信号,可直接用作RL训练的高质量reward模型,或作为自主视频agent的专家评估员。其pipeline-aware taxonomy可指导生成模型在电影质量维度的定向改进。

为什么排在这里

  • HF #3
  • video_generation +22
  • evaluation +16
  • benchmark +10
  • multimodal +22
02
Score 159alphaXivarXivCode

Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration

多智能体协作长时间电影视频重制——Soap2Soap

提出多智能体框架Soap2Soap,通过双桥一致性实现数百镜头间的身份、场景和叙事稳定重制。 洞见将长视频重制分解为语义和视觉双桥接,可为V5统一模型提供长程一致性控制思路。

Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration authors and affiliations
video_generationmultimodalbenchmarkevaluation
Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration

核心要点

  1. Soap2Soap将电影重制分解为视频理解、生成和验证三个智能体,通过**双桥一致性**(语言JSON剧本和视觉锚点)显式维护长程一致性。
  2. 引入**批关键帧一致性**,将同场景的多帧在网格中联合生成,共享潜在上下文,抑制跨镜头身份漂移
  3. 验证代理闭环审计生成的关键帧和视频,检测身份、稳定性和对齐,触发选择性重生成。
  4. SoapBench上,Soap2Soap的ID-VLM达9.17、Scene-VLM 8.84、Plot-VLM 8.67,CLIP-I (ID) 0.842,全面优于Mocha、Kling...
  5. 消融实验表明,动态内存分配和验证循环均关键:移除后IoU从0.921降至0.569,ID-VLM从9.17降至5.61。

启示

  • 双桥一致性(语言+视觉)可借鉴到V5 Base的Transfusion架构,作为语义与视觉对齐的控制信号。
  • 批关键帧联合合成策略可用于V4O的ID一致性场景,减少跨镜头角色漂移。
  • 验证闭环的Critique-Correct机制可作为视频生成RL中reward模型的离线评估基线。
展开细节

问题

现有视频生成和编辑方法在数百镜头跨度下出现身份漂移、背景突变和语义侵蚀,无法保持叙事、动作和角色一致性。商业API如Kling O1和Runway Gen4在长序列中分段处理导致不一致。

方法

Soap2Soap通过双桥一致性机制解耦语义与视觉:语言桥是场景感知JSON剧本(Sjson),记录镜头级叙事、角色和摄像意图;视觉桥是动态分配的视觉记忆,包含场景和镜头级参考锚点。生成时采用网格联合合成多关键帧(2×2或3×3),再通过I2V生成4-8秒片段,最后由验证代理基于Gemini 3 Flash执行闭环纠正。

实验设置

SoapBench上评估,理解轨含10部电影607个镜头,重制轨含10个1.5-5分钟片段(最多42个连续镜头)。baseline包括Mocha、Kling O1、Runway Gen4。使用Nano Banana 2生成关键帧、Veo 3进行I2V、Gemini 3 Flash进行理解和验证。

结果

Soap2Soap在ID-VLM(9.17)、Scene-VLM(8.84)、Plot-VLM(8.67)、CLIP-I(ID)(0.842)、CLIP-I(Scene)(0.819)均最优,显著超越所有baseline。消融移除动态内存后IoU从0.921降至0.569,移除验证后ID-VLM从9.17降至8.91。

局限

论文自承未来工作需处理细粒度音视频同步和极端运动动态;当前依赖商业API(Veo 3、Nano Banana 2),计算成本较高;未探索实时性或轻量部署。

为什么重要

为长视频重制提供了可扩展的多智能体框架,双桥设计可迁移至视频生成/理解统一模型;批关键帧联合合成思路可降低跨镜头漂移;验证循环可作为RL中reward模型的离线对齐参考。

为什么排在这里

  • HF #10
  • video_generation +22
  • multimodal +22
  • benchmark +10
  • evaluation +16
03
Score 155.4alphaXivarXivCode

MobileGym: A Verifiable and Highly Parallel Simulation Platform for Mobile GUI Agent Research

面向移动GUI Agent研究的可验证高并行仿真平台MobileGym

提供可验证状态判断和高并行在线RL的轻量级移动GUI仿真环境及416任务benchmark。 洞见可验证仿真环境是规模化在线RL的基础,VLM判断不可靠。

MobileGym: A Verifiable and Highly Parallel Simulation Platform for Mobile GUI Agent Research authors and affiliations
evaluationbenchmarkdatasetsystems
MobileGym: A Verifiable and Highly Parallel Simulation Platform for Mobile GUI Agent Research

核心要点

  1. MobileGym是浏览器托管的Android-like仿真环境,通过结构化JSON状态支持确定性状态差判断和RL奖励,避免VLM judge不可靠问题。
  2. 单服务器可并行运行数百实例(~400MB内存/实例,~3s冷启动),支持GRPO等在线RL方法的大规模rollout。
  3. 附带MobileGym-Bench,包含416个参数化任务模板(256测试+160训练),覆盖28个app,使用AnswerSheet协议避免自由文本匹配失败。
  4. 9个agent的benchmark显示SR从9.4%到58.8%,6倍性能跨度;难度分层L1-L4单调递减,L4仅Gemini 3.1 Pro超过20%。
  5. GRPO在Qwen3-VL-4B-Instruct上训练后SR提升+12.8pt,Sim-to-Real实验在59个实际设备任务上保留95.1%的训练增益。
  6. VLM judge误判率达10.2%(Qwen3.6-Plus和GPT-5.4),而MobileGym的程序化判断完全避免此问题。

启示

  • 可验证奖励信号替代VLM判断的思路可直接用于视频生成RL,降低奖励噪声,提升训练稳定性。
  • 并行rollout架构和GRPO训练方案可借鉴到视频生成RL中,支持大规模在线策略优化。
展开细节

问题

现有移动GUI agent评估环境要么是模拟器(覆盖系统应用,不可扩展,内存开销大),要么是真实设备(状态不可读、不可写、不可分支,代价高)。日常生活app的状态分散在后端和远程服务,无法重置和并行,VLM judge基于截图不可靠。大规模在线RL需要低成本、可验证、可并行的环境。

方法

核心思想是只模拟交互界面,不复制真实后端。关键模块:分层状态模型(world data只读、runtime overlay可变、OS runtime),声明式导航文件驱动UI渲染和状态分析,结构化JSON状态支持快照、重置、分支和确定性状态差判断,AnswerSheet协议让agent填写类型化表单来避免自由文本匹配歧义。Agent只观察截图,研究者完全控制状态。

实验设置

在MobileGym-Bench的256个测试任务上评估9个agent(Gemini 3.1 Pro, Doubao-Seed-2.0-Pro, Qwen3.6-Plus, AutoGLM-Phone-9B, UI-TARS-1.5-8B, UI-Venus-1.5-8B, GUI-Owl-1.5-8B-Think, Step-GUI-4B, Qwen3-VL-4B-Instruct)。GRPO训练使用Qwen3-VL-4B-Instruct,单机3 RTX Pro 6000,96并行实例,160训练任务,10步训练。Sim-to-Real在Redmi Note 12 Turbo上评估59个可执行任务。

结果

benchmarkSR范围9.4%-58.8%,难度分层L1-L4单调递减。GRPO训练后SR从9.4%提升至22.2%(+12.8pt),L2提升最大(12.3%→37.7%)。Real-device上训练后SR从32.2%提升至72.9%(+40.7pt),对应95.1%模拟训练增益保留。VLM judge误判率10.2%,而程序化判断零误差。

局限

模拟器的视觉外观与真实app有细节差异(布局、动画、图标),可能影响依赖精确图标识别的任务。后端动态内容(广告、推荐、实时消息)用可控JSON代替,未建模真实随机性。每个app只实现主要使用场景,未覆盖全部功能。论文未讨论

为什么重要

为移动GUI agent研究提供低成本(1/10内存、1/100磁盘)、可验证、可扩展的训练和评估平台,支持在线RL和Sim-to-Real转移。相同架构可用于安全对齐、鲁棒性测试、训练数据生成。程序化状态判断替代VLM判断,提升评估和奖励的可靠性。

为什么排在这里

  • HF #2
  • evaluation +16
  • benchmark +10
  • dataset +18
  • systems +6
04
Score 149.8alphaXivarXivCode

Efficient Agentic Reinforcement Learning with On-Policy Intrinsic Knowledge Boundary Enhancement

面向高效agentic强化学习的on-policy知识边界增强方法AKBE

通过双路径rollout动态探测模型知识边界,减少冗余工具调用并提升准确率。 洞见动态知识边界探测可推广至视频生成RL中判断何时需调用外部模型或知识库。

Efficient Agentic Reinforcement Learning with On-Policy Intrinsic Knowledge Boundary Enhancement authors and affiliations
benchmarkdatasetevaluation
Efficient Agentic Reinforcement Learning with On-Policy Intrinsic Knowledge Boundary Enhancement

核心要点

  1. AKBE在agentic RL训练中并行执行with-tool和no-tool双路径rollout,动态判断每个问题是否需工具及最少调用次数。
  2. 根据双路径正确性将轨迹分为Tool-dependentEfficiencyHallucination三类,分别选择最短正确工具轨迹、正确无工具轨迹等作为监督信号。
  3. 在7个QA benchmark上,AKBE在Qwen3-4B上平均EM提升+1.85,工具调用减少18%,工具生产力提升25%。
  4. AKBE可作为即插即用模块与GRPO、DAPO、GSPO、AEPO等算法兼容,一致提升效率且不干扰原优化。
  5. 消融实验表明三类信号互补:Tool-dependent防止过度抑制必要工具,Efficiency减少冗余,Hallucination纠正有害调用。

启示

  • 对视频生成RL项目,可借鉴双路径rollout思想来判断模型是否需外部知识(如caption或检索),减少不必要的...
展开细节

问题

现有agentic RL训练导致模型产生大量冗余工具调用,模糊了内在知识边界。模型不知道何时需要工具、何时自身参数知识足够。现有奖励塑造方法粗粒度抑制工具调用,导致reward hacking,无法区分必要与冗余调用。

方法

AKBE通过on-policy双路径rollout(with-tool和no-tool)动态探测知识边界。根据双路径正确性分类轨迹:Tool-dependent(只有带工具正确)选最短正确工具轨迹;Efficiency(两者都正确)选正确无工具轨迹;Hallucination(仅无工具正确)选正确无工具轨迹;Both-wrong则跳过。这些信号作为辅助交叉熵损失L_AKBE与RL损失联合优化,无需修改奖励函数。

实验设置

在7个QA benchmark(HotpotQA, 2WikiMultihopQA, MuSiQue, Bamboogle, NQ, TriviaQA, PopQA)上,使用Qwen3-4B和Qwen2.5-7B两个backbone,与ReAct, Search-o1, R1-Searcher, Search-R1, OTC-PO, β-GRPO等baseline对比。消融实验针对三类信号,以及不同λ值。

结果

AKBE在Qwen3-4B上平均EM提升+1.85,TC减少18%,TP提升25%;在Qwen2.5-7B上类似。与OTC-PO对比,避免accuracy下降。消融显示三类信号均不可或缺。Plug-and-play实验验证与GRPO/DAPO/GSPO/AEPO兼容。训练速度比GRPO快15%。

局限

论文自承早期训练阶段无工具rollout带来额外计算成本;λ固定无法适应不同训练阶段。未来可探索自适应采样和自适应λ。

为什么重要

提供了一种不修改RL目标即可提升工具使用效率的通用方法,可应用于任何agentic RL算法。对需要外部工具或知识源的推理任务(如搜索增强QA、代码生成)有直接工程意义。后续可扩展至多模态agent或视频生成中判别是否需调用外部模型。

为什么排在这里

  • HF #9
  • benchmark +10
  • dataset +18
  • evaluation +16
  • agent +20
05
Score 135.8alphaXivarXivCode

LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding

基于并行框解码的高速高质视觉语言定位模型LocateAnything

提出并行框解码PBD)将框作为原子单位并行生成,实现高吞吐、高质量的视觉定位与检测。 洞见将MTP与结构化输出对齐可同时提升解码速度与定位精度,为VLM高效感知提供新范式。

LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding authors and affiliations
multimodaldatasetbenchmarkevaluationdata_pipelinesystems
LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding

核心要点

  1. 提出Parallel Box Decoding(PBD),将每个边界框的坐标作为原子单位并行预测,保持框内几何连贯性,避免逐token解码的瓶颈。
  2. 设计双序列训练策略,联合优化NTP和块级MTP,通过特殊注意力掩码隔离两流,保留因果推理能力。
  3. 构建LocateAnything-Datadataset,包含12M张图像、138M条自然语言查询和785M个标注框,覆盖6大任务。
  4. 提供三种推理模式:Fast Mode(纯MTP,最大吞吐)、Slow Mode(标准NTP,最高精度)、Hybrid Mode(MTP默认,不可靠时回退NTP),平衡速度与鲁棒性。
  5. 在LVIS/COCO/VisDrone等benchmark上,LocateAnything-3B达到SOTA,mean F1比Rex-Omni高3.8%/1.8%;GUI接地ScreenSpot...
  6. 吞吐量达12.7 BPS(Hybrid Mode),比文本坐标方法快10倍以上,比量化坐标方法快2.5倍;密集场景吞吐可达25 BPS,实现2-6倍加速。
  7. 消融实验验证:PBD比结构无关MTP(SDLM/Block Diffusion)F1提升3+点,同时吞吐更高;Hybrid Mode几乎不降速恢复精度。

启示

  • 对V5 Base:PBD可将框预测并行化,加速统一模型在感知任务上的推理。
  • 对V4O/Omni:可复用混合推理模式,在需要高精度的ID一致性和GUI接地中提升效果。
  • 对视频生成RL:PBD的数据构造和回退机制可借鉴于视频框序预测或奖励模型中框的一致性验证。
展开细节

问题

现有VLM将视觉定位和检测建模为坐标Token生成问题,将2D框序列化为多个1D Token逐token解码,这种序列化方式与框的耦合结构不匹配,导致推理瓶颈和结构幻觉。标准MTP方法结构无关,学习跨边界不相关模式,降低精度。

方法

LocateAnything基于PBD,将每个框视为原子单位,在单步中并行预测整个坐标集。采用双序列训练:NTP序列保留因果推理,块级MTP序列进行箱对齐预测,通过特殊注意力掩码隔离两流。推理时提供三种模式:Fast Mode纯MTP、Slow Mode纯NTP、Hybrid Mode默认MTP并在检测到格式不规则或空间歧义时回退到NTP。dataset覆盖6大任务138M查询。

实验设置

在COCO、LVIS、VisDrone、Dense200上进行检测评估;在RefCOCOg、HumanRef上进行指代理解;在ScreenSpot-Pro上进行GUI grounding;在DocLayNet、M6Doc上进行布局分析;在TotalText上进行OCR。对比方法包括Grounding DINO、Qwen3-VL、Rex-Omni等。在H100单卡测量吞吐。

结果

LocateAnything-3B在LVIS zero-shot F1@0.95达31.1(比Rex-Omni高10.4点),mean F1 50.7(高3.8);COCO mean F1 54.7(高1.8)。GUI接地ScreenSpot-Pro mean F1 60.3,超越GUI-Owl-32B(58.0)。文档布局DocLayNet mean F1 76.8,M6Doc 70.1,优于Rex-Omni。吞吐12.7 BPS,比Qwen3-VL快10倍,比Rex-Omni快2.5倍。消融表明PBD优于结构无关MTP,Hybrid Mode几乎损失速度。

局限

论文未讨论,但可推断:PBD对格式规则和空间歧义敏感,需要NTP回退;大规模数据依赖;可能在小模型上效果有限;未在视频任务上验证。

为什么重要

首次将结构化MTP应用于VLM感知,证明箱对齐并行解码能同时提升精度和速度,为高效视觉定位提供新思路。其数据引擎和推理模式设计可直接用于下一代多模态基础模型,可扩展至视频理解、全景分割等场景。

为什么排在这里

  • HF #4
  • multimodal +22
  • dataset +18
  • benchmark +10
  • evaluation +16
06
Score 135alphaXivarXivCode

SpatialBench: Is Your Spatial Foundation Model an All-Round Player?

SpatialBench:你的空间基础模型是全能选手吗

提出SpatialBench,在19个dataset上评估41个模型,揭示全上下文注意力上限、数据质量... 洞见构建确定性、多密度的评估基准是推动空间智能模型实用化的关键。

benchmarkevaluationworld_modelsystems

核心要点

  1. SpatialBench是首个跨范式、域多样、确定性采样的3D空间基础模型基准,涵盖19dataset、546场景、41模型、6范式。
  2. 全上下文注意力模型在相同输入预算下定义精度上限,深度估计和姿态估计优于有限记忆方法。
  3. 有限记忆模型(流式、分块、TTT)以降低几何精度为代价,实现长序列重建的可扩展性。
  4. 数据质量重于数量:DA3通过高质量伪GT监督在较少dataset上达到最佳性能。
  5. 自我中心和手腕视角是最大域外失效模式,DA-Next-5Mdataset和DA-Next模型填补该空白。
  6. DA-Next在稀疏/中等输入下深度估计比DA3-Giant提升47%/59%,姿态估计提升3.1%/5.5%。

启示

  • SpatialBench的确定性评估协议可借鉴用于V5 Base视频生成模型的跨域泛化评测。
  • 数据质量重于数量的结论对V4O数据清洗和VSR低清数据构造具有直接指导意义。
  • DA-Next在自我中心域的3D能力可支撑Omni项目中空间理解模块。
展开细节

问题

现有空间基础模型评估局限于特定领域和非标准协议,无法公平比较不同范式(优化、前馈、流式、SLAM等)的泛化能力。缺乏对输入密度(稀疏到稠密)和域多样性的系统考量。

方法

SpatialBench采用确定性多密度采样协议,从19个dataset的546场景中预计算单帧、稀疏、中等、稠密四种输入帧索引,确保可重复。提供统一适配器评估41个模型(6类范式),按室内/室外、动态/静态、视角类型等标签细粒度分析。DA-Next架构扩展DA3,加入尺度Token和可选相机Token输入,通过双DPT头和MLP尺度头端到端预测度量深度、射线图和场景尺度。

实验设置

在19dataset(含室内、室外、动态、静态、真实、合成、自我中心、手腕视角)上评估41模型(含VGGT、DA3系列、Stream3R、VGGT-SLAM等5类范式)。所有模型在5任务(深度估计、相机姿态估计、轨迹估计、稠密重建、先验增强)和4密度设置下运行。DA-NextDA-Next-5M(22K场景、5.5M帧)加11个通用3Ddataset上训练。

结果

全上下文模型(如DA3-Giant)在稀疏/中等输入下深度AbsRel达0.095/0.086,优于所有有限记忆模型。但稠密下OOM;有限记忆模型(如LingBotMap)在稠密下ATE低至0.509,扩展性强。DA-Next在自我中心/手腕域上深度AbsRel 0.050(比DA3-Giant降47%),AUC@30达0.809(升3.1%),但稠密OOM。数据质量分析显示,DA3(5训练集)性能超过用更多dataset的模型。

局限

论文未讨论明确局限,但密集设置下许多方法因OOM无法完成,且DA-Next在稠密输入上仍OOM。基准依赖公开dataset,可能不覆盖所有真实场景(如极端运动、光照变化)。部分方法评估时间较长(如DUSt3R稀疏模式下平均7.59秒/场景)。

为什么重要

SpatialBench为空间基础模型提供了公平、可重复的评估标准,指导模型设计(关注记忆效率和域泛化)。其数据质量优先的发现对训练策略有直接意义。DA-NextDA-Next-5M推动自我中心和机器人视角的3D感知,可直接用于V5等项目的视频理解与生成任务。

为什么排在这里

  • HF #5
  • benchmark +10
  • evaluation +16
  • world_model +22
  • systems +6
07
Score 132.2alphaXivarXivCode

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

LongAV-Compass:面向分钟级音视频生成的统一评测框架,覆盖T2AV、I2AV和V2AV三种输入条件

提出分钟级音视频生成统一评测benchmark,覆盖文本/图像/视频三种输入,诊断长程故障模式。 洞见长程评测需聚焦事件完成度与跨段一致性,对V5模型长视频生成评估有直接参考价值。

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV authors and affiliations
video_generationevaluationbenchmarkmultimodal
LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

核心要点

  1. 构建包含284个测试用例的LongAV-Compass,覆盖T2AV、I2AV和V2AV三种任务,按应用场景(Vlog、Content-Creator等)和生成复杂度(L1-L4)分层组织。
  2. 设计超20个细粒度维度的统一评测框架,从事件级质量、跨段一致性、全局叙事连贯性、音视频同步等角度诊断长程生成瓶颈。
  3. 采用Gemini 3.1 Pro作为MLLM评测中心,辅以DINO-v2、CLIP等感知指标,实现事件级、段级和全视频级的三层次诊断。
  4. 对11个代表系统评测发现,Seedance 2.0在多数维度领先,但所有模型在Performance Ads场景和高复杂度下事件完成度和连续性显著下降。
  5. 人机对齐验证显示Pearson相关系数达0.867-0.935,表明自动评测可有效反映人类对内容忠实度、视觉质量和长程稳定性的偏好。

启示

  • 对V5 Base长视频生成效果评估,可借鉴其事件级诊断框架定位模型在跨事件身份漂移和过渡稳定性上的短板。
  • 对V4O多模态生成评测,可参考其统一覆盖T2AV/I2AV/V2AV的思路,设计更全面的评测协议。
  • 对视频生成RL,该benchmark的细粒度维度可为reward模型设计提供参考,尤其是事件完成度和长程连续性指标。
展开细节

问题

现有音视频生成benchmark主要聚焦5-10秒短片段,缺乏对分钟级生成的长程一致性、跨事件身份漂移、音视频同步退化的系统评估。同时,任务覆盖碎片化,未能统一覆盖T2AV、I2AV和V2AV三种输入条件,导致不同系统间难以公平对比。

方法

LongAV-Compass采用两阶段数据构建:真实视频转录与模板LLM生成相结合,所有测试用例转换为统一的事件级标注格式(全局描述+事件序列)。评测框架以Gemini 3.1 Pro作为MLLM中心,结合DINO-v2(主体一致性)、CLIP(语义对齐)、ImageBind(跨模态)等指标,分事件级(VQA、VQ)、跨段(Cont.、Trans.)和全视频(Hol.、TV Align、音频指标)三个层次评估超20个维度。

实验设置

在284个测试用例(128 T2AV、115 I2AV、41 V2AV)上评估11个系统:专有模型(Seedance 2.0、Kling 3.0、Veo 3.1)、开源模型(LTX 2.3、LongCat、Wan2.2-I2V-A14B、HunyuanVideo 1.5-I2V、Helios 14B、Open-Sora、daVinci-MagiHuman)和代理模型(VideoDirectorGPT)。目标输出时长60-120秒,保留各系统原生配置。

结果

Seedance 2.0在T2AV和I2AV的视觉质量、全局呈现、音频指标上领先;Kling 3.0在事件完成度和长程连续性上最优。所有模型在Performance Ads场景下退化最严重,尤其是事件完成度(VQA)和连续性(Cont.)。开源模型受事件链长度和复杂度影响显著(从L1 57.9降至L4 51.4)。音频原生支持不保证高质量长音频。人机对齐Pearson r>0.86。

局限

测试用例规模较小(284),主要覆盖英语场景;自动评测依赖MLLM,可能遗漏某些感知缺陷(如细微运动伪影)。未涵盖纯音频生成或高交互性场景。论文未讨论跨语言扩展或更细粒度的时间控制评测。

为什么重要

LongAV-Compass为分钟级音视频生成提供了标准化诊断工具,可系统分析模型在事件执行、长程一致性、跨模态对齐上的瓶颈。对V5等长视频生成模型,可直接借鉴其事件级评测思路诊断模型在复杂叙事场景下的失效模式,指导数据构建和训练策略改进。

为什么排在这里

  • HF #6
  • video_generation +22
  • evaluation +16
  • benchmark +10
  • multimodal +22
08
Score 129.4alphaXivarXivCode

Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning

看到更多是否意味着知道更多?面向多源视觉推理的单源锚点优势标准化方法

用单源奖励作为动态锚点,量化多源融合的信息增益,提升RLVR下多源视觉推理性能。 洞见单源锚点可量化融合增益,避免盲目多源融合,适用于任何多模态融合的RL训练。

Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning authors and affiliations
multimodalvideo_rlevaluationbenchmark
Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning

核心要点

  1. 揭示多源视觉推理中简单融合多源图像可能低于单源强模态,核心在于缺乏模态交互建模。
  2. 提出MARS方法,在RLVR框架下将单源奖励作为动态锚点,用多源与单源奖励联合分布计算优势,自适应强调促进性模态、抑制冲突性模态。
  3. 理论分析证明该方法无偏且等价于最大化多源信息增益,在梯度估计中引入信息增益正则项。
  4. 在红外、深度、多视角、文本丰富四种多源任务上,基于Qwen2.5-VL-3B,GRPO和DAPO分别提升3.2%和4.9%,并提升单源上限。
  5. 仅需少量单源轨迹即可生效,训练开销仅增约8%,并对视觉退化(高斯噪声、模糊、遮挡)鲁棒。

启示

  • 对V4O/Omni:单源锚点方法可借鉴用于处理多模态输入中的模态冲突,提升多源融合推理的稳定性。
  • 对视频生成RL:MARS的advantage normalization思路可用于视频生成RL中的reward评估...
展开细节

问题

多源视觉推理中,现有RLVR方法将多源输入简单累加,未区分信息增益与干扰;当某单源占优时,多源推理反而更差。问题在于优势估计仅基于多源轨迹,无法捕捉模态交互。

方法

核心思想:用单源奖励作为动态锚点,将单源与多源奖励联合标准化,使得优势评估反映多源信息增益。关键:生成单源轨迹(每源一个),与多源轨迹合并计算均值和方差,用于多源轨迹的优势标准化。理论等价于最大化多源信息增益

实验设置

在SpatialQA(深度)、LLVIP(红外)、nuScenes(多视角)、OCR-VQA(文本丰富)四个dataset上,基于Qwen2.5-VL-3B,与SFT、CoT、GRPO、DAPO对比。在VQA和grounding任务上评估。模型规模3B和7B。还测试了视觉退化场景。

结果

在GRPO下多源平均提升3.2%,DAPO下提升4.9%;单源上限也提升1.1%和2.2%。在红外和深度等冲突场景下提升显著(红外+7%)。与单纯增加轨迹数相比,MARS以更少开销(+8% GPU时间)获得更好性能。消融显示单源轨迹数M=2即饱和。

局限

论文未讨论该方法在视频或动态场景上的适用性;仅评估了静态图像多源任务;依赖单源轨迹生成,对源数较多时可能开销增加。

为什么重要

多源视觉推理提供即插即用的RL训练改进方法,不改变模型架构。对多模态融合的RL训练有通用启发:用锚点源量化信息增益。可扩展到视频多帧、多传感器等场景。

为什么排在这里

  • HF #7
  • multimodal +22
  • video_rl +20
  • evaluation +16
  • benchmark +10
09
Score 122.4alphaXivarXiv

Beyond Final Answers: Auditing Trajectory-Level Hallucinations in Multi-Agent Industrial Workflows

轨迹级幻觉审计:多智能体工业工作流中的幻觉检测

提出Trajel框架和五类幻觉分类,用于检测多智能体工作流中的轨迹级幻觉。 洞见执行质量信号比复杂分类器更实用,可直接嵌入agent循环做实时防幻觉。

Beyond Final Answers: Auditing Trajectory-Level Hallucinations in Multi-Agent Industrial Workflows authors and affiliations
evaluationsystemsdatasetbenchmark
Beyond Final Answers: Auditing Trajectory-Level Hallucinations in Multi-Agent Industrial Workflows

核心要点

  1. 定义了五类幻觉(事实型、指涉型、逻辑型、过程型、范围型),覆盖Thought-Action-Observation轨迹中的不同失效模式。
  2. 构建了包含225条专家标注轨迹的Trajel dataset,涉及6种模型和42个工业任务,其中48.7%的幻觉轨迹含多种类型。
  3. LLM作为评判者对过程型和事实型幻觉F1达0.78,但对逻辑型和指涉型仅0.22-0.26,证明细粒度分类的必要性。
  4. 监督检测模型(BERT、NLI、Longformer)的ROC-AUC最高仅0.689,低于零样本LLM评判者的F1=0.855。
  5. 执行质量信号(清晰度与合理性)作为单变量预测器AUC达0.908,远超所有监督分类器,可用于轻量级运行时监控。
  6. 过程型幻觉占38.5%,且集中在Action组件,可被动作有效性监控高效捕捉。
展开细节

问题

现有幻觉检测benchmark只评估最终输出,忽略中间Thought-Action-Observation步骤中的失败。多智能体工业工作流中,幻觉常以过程跳步、错误指涉、越权行动等形式出现,但缺乏结构化的轨迹级分类和标注dataset。

方法

核心是五类幻觉分类器,基于Thought-Action-Observation轨迹的结构化谓词:事实型(单步矛盾)、指涉型(引用不存在的历史)、逻辑型(推理断裂)、过程型(工作流顺序错误)、范围型(越权操作)。标注流程结合LLM初判和盲人复核。检测建模采用三种范式:子步级BERT、轨迹级NLI、长上下文Longformer。同时分析五种执行质量信号(任务完成、数据检索准确率等)作为预测器。

实验设置

在AssetOpsBench多智能体框架上收集225条轨迹,6种模型配置,42个工业任务。比较LLM评判者与人类标注,训练BERT、NLI、Longformer监督模型。执行信号分析使用213条完整记录的轨迹。

结果

LLM评判者对过程型和事实型F1为0.784和0.719,但对逻辑型仅0.258,指涉型0.222。监督模型最佳ROC-AUC为0.689(NLI),低于零样本LLM的F1=0.855。执行信号中清晰度与合理性AUC=0.908,优于所有分类器。过程型幻觉占38.5%,48.7%的幻觉轨迹含多种类型。

局限

仅来自单个工业领域(AssetOpsBench)和6种模型,未测试医疗、金融等其它领域。五类分类可能不完整,新工具生态下可能涌现新类型。监督模型因数据量小(225条)表现不如LLM评判者。

为什么重要

提供了轨迹级幻觉评估的结构化方法,可直接用于多智能体系统的安全部署。执行质量信号的低成本监控方案可集成到agent编排循环中,比事后分类更实用。dataset和分类法为后续鲁棒性研究提供基准。

为什么排在这里

  • HF #12
  • evaluation +16
  • systems +6
  • dataset +18
  • benchmark +10
10
Score 105.6alphaXivarXiv

Squeezing Capacity from Multimodal Large Language Models for Subject-driven Generation

多模态LLM中榨取能力用于主体驱动生成

提出Dual Layer Aggregation模块和多阶段去噪,用MLLM联合编码文本和图像... 洞见在MLLM扩散框架中,分离文本和图像模态的层聚合比单池化更优。

Squeezing Capacity from Multimodal Large Language Models for Subject-driven Generation authors and affiliations
subject-driven generationmultimodaldiffusion transformeridentity preservationmllm
Squeezing Capacity from Multimodal Large Language Models for Subject-driven Generation

核心要点

  1. 设计Dual Layer Aggregator(DLA),对文本和图像token分别做层间注意力池化,从MLLM所有层聚合特征,避免单层表示的模态偏差。
  2. 提出多阶段去噪策略:前期仅MLLM条件(语义布局),中期两者联合,后期仅VAE(精细细节),对齐扩散的粗到细特性。
  3. 两阶段训练:先训练MLLM-DiT(仅MLLM条件),再联合VAE训练,防止VAE过早主导导致MLLM身份信号弱。
  4. DreamBench上,完整模型(MLLM+VAE)DINO-I 0.7482、CLIP-I 0.8443,与SOTA持平;MLLM-only版本在公共数据下与UNO持平。
  5. 提出“Recall@k°”指标量化复制粘贴问题,本方法方位角差异25.7°、极角10.4°,平均召回率0.349,显著缓解复制粘贴。
  6. 构建350样本推理benchmark,本方法CLIP-T 0.3208,优于UNO、DreamO、Qwen-Image,展现更强的跨模态概念绑定能力。

启示

  • 对V5 Base的统一生成理解架构,可借鉴DLA层间聚合机制,将MLLM特征更充分注入DiT。
  • 对V4O的多模态生成,本方法的多阶段去噪策略有助于平衡ID一致性和文本对齐。
  • 视频生成RL可参考本方法的量化复制粘贴指标,作为奖励模型设计中的多样性信号。
展开细节

问题

现有主体驱动生成方法(如DreamBooth)需微调,零样本方法(IP-Adapter)处理文本和参考图像分离,缺乏跨模态推理,导致复制粘贴和身份漂移。近期MLLM-DiT框架仅用最终层特征,忽略细粒度视觉细节,身份保持不足。

方法

核心思想是用MLLM(InternVL3-8B)联合编码文本和参考图像,DLA模块对MLLM所有28层分别做文本和图像的层间注意力池化得到聚合特征,再通过两阶段训练(先MLLM-DiT 25K步,再联合VAE 10K步)平衡两者。多阶段去噪按timestep掩码:t>0.95仅MLLM,0.85≤t≤0.95两者,t<0.85仅VAE。采用FLUX.1 dev作为DiT骨干,LoRA rank=512微调,MLLM和DiT其余权重冻结。

实验设置

在UNO-1M(约400K过滤后图像对)上训练,DreamBench、DreamBench++、XVerseBench、LAMICBench评估。对比baseline包括OmniGen2、DreamO、USO、UMO、Qwen-Image、EasyRef等。消融实验分析DLA、单LAP、stage训练、timestep-aware去噪。

结果

在DreamBench上,完整模型DINO-I 0.7482、CLIP-I 0.8443、CLIP-T 0.3010,与SOTA持平。复制粘贴指标:方位角25.7°、极角10.4°、平均召回率0.349,优于所有对比方法。推理benchmark(350样本)CLIP-T 0.3208,大幅领先。用户研究(30人1500票)评分7.26/10,高于XVerse、DreamO等。消融显示DLA优于单LAP(CLIP-T +0.0135),两阶段训练比单阶段DINO-I提升+0.0298。

局限

仅使用单个MLLM(InternVL3-8B),其他MLLM未见测试;多主体场景仅初步适配;训练数据全部为公共数据,未使用大规模私有数据;计算成本:8×H100训练约35K步。

为什么重要

提出了一种系统化的MLLM与VAE融合框架,DLA和两阶段训练策略可迁移到其他生成任务(视频、3D);多阶段去噪提供了灵活的推理控制;复制粘贴量化指标可推广用于评估生成多样性。

为什么排在这里

  • HF #13
  • multimodal +22
  • video_generation +22
  • benchmark +10
  • PDF +2
11
Score 105.2alphaXivarXiv

MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation

MUSE-Autoskill:通过技能创建、记忆、管理与评估实现自进化Agent

让LLM Agent通过全生命周期技能管理自我进化,在SkillsBench上领先。 洞见将技能视为长期资产并积累跨任务经验,是提升Agent持续学习能力的关键。

MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation authors and affiliations
systemsevaluationbenchmark
MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation

核心要点

  1. 提出MUSE-Autoskill框架,将技能视为长期可演进资产,贯穿创建、记忆、管理、评估、精炼五个阶段。
  2. 引入技能级记忆(skill-level memory),每个技能附带.memory.md文件积累跨任务经验,提升复用效果。
  3. 通过内置单元测试和运行时反馈驱动技能自动精炼,确保技能库可靠
  4. SkillsBench 51个任务上,使用人类技能准确率达68.40%,领先其他Agent;自生成技能在35个成功任务上达87.94%,超越人类基线。
  5. 生成的技能可跨Agent转移:注入Hermes后准确率提升+10.51pp,补齐79%差距,证明技能是外部化、可迁移的知识资产。
  6. 使用自生成技能比人类技能更高效:token减少20%,延迟降低37%,约3次复用即可摊平生成成本。

启示

  • 技能生命周期管理思想可用于V5 Base中任务技能的自动创建与复用,降低手动编写成本。
  • 技能级记忆机制可借鉴到视频生成RL中,积累每个策略的条件经验提升泛化性。
展开细节

问题

现有LLM Agent技能创建方法将技能视为孤立、静态产物,缺乏生命周期管理、结构化技能记忆、单元测试评估和自动精炼,导致技能可复用性差、不可靠,且无法持续改进。

方法

核心思想是技能全生命周期管理。在ReAct循环中集成skill_create工具,通过创建→评估→注册流程生成技能;引入三级记忆:短期、长期和技能级(.memory.md文件);通过单元测试和运行时反馈自动触发精炼;采用DAG结构上下文管理,两层自适应压缩支持长任务。

实验设置

SkillsBench 51个任务上评估,涵盖科学工程、数据分析、文档处理、运维规划四个领域。对比Codex、Hermes两个Agent,backbone均为GPT-5.5。每个配置运行5次独立实验,评估技能使用效果、自动生成(两阶段)和跨Agent转移。

结果

无技能基线53.19%,加入人类技能68.40%(+15.21pp)。自生成技能在35个成功生成任务上准确率87.94%,超越人类技能68.40%。跨Agent转移使Hermes从47.89%提升至58.40%(+10.51pp),补齐79%差距。技能生成成本约383K tokens,使用成本降低20% token和37%延迟,约3次复用后平衡。

局限

技能生成依赖无技能时的成功轨迹,16个任务无法生成技能导致整体准确率仅60.35%;部分任务(如hvac-control)出现性能回归;高生成成本限制了覆盖范围;技能库随任务增长可能面临管理开销。

为什么重要

提出了首个覆盖技能完整生命周期的训练-free框架,实现Agent持续积累和复用知识;技能跨Agent转移验证了外部化知识资产的价值;对构建可扩展、自改进的Agent系统有直接指导意义,纯推理式设计便于迁移到不同LLM。

为什么排在这里

  • HF #11
  • systems +6
  • evaluation +16
  • benchmark +10
  • agent +20
12
Score 105.2alphaXivarXiv

MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale

MRT:面向大规模分层图像生成与编辑的掩码区域变换器

20B掩码区域扩散模型统一文本/图像/层到层任务,支持溢出层并实现8步实时生成。 洞见大规模多任务联合训练与溢出层设计是分层模型实用化的关键策略。

multimodaldatasetbenchmarksystems
MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale

核心要点

  1. 提出**MRT**,一个20B参数的掩码区域扩散变换器,通过在**区域扩散**中选择性掩码token,统一了**文本到层**、**图像到层**和**层到层**三种任务,实现灵活的分层生成与编辑。
  2. 引入**溢出感知画布层**处理超出背景边界的视觉元素,使超过60%训练样本中的溢出层得以完整生成,增强了层的可重用性和编辑实用性。
  3. 在超过10M多语言设计样本上训练,覆盖4300万独特层和700万溢出元素,利用**GPT-5 mini**生成描述,并采用**扩散蒸馏**将推理步数压缩至8步,实现实时多层生成。
  4. 图像到层任务中,与**Qwen-Image-Layered**相比,用户研究胜率达79.5%(质量)、68.9%(完整性)、82.6%(粒度),且推理速度快10-100倍,显存节省50-90%。
  5. 文本到层任务中,用户研究显著优于**ART**,在布局、排版、美学和整体评分上均占优;唯一原生支持**溢出层**生成。

启示

  • 对**V4O**的图像分层编辑功能,可借鉴其统一掩码区域框架和溢出层处理思路,提升层分解质量与编辑流畅性。
展开细节

问题

分层图像生成与编辑因缺乏大规模高质量dataset和有效利用预训练模型的方法而发展滞后。现有方法(如ART)无法生成超出可见画布边界的完整层,导致层内容被裁剪,严重限制了编辑复用性。超过60%的设计样本包含溢出元素,但先前工作未解决此问题。

方法

基于Qwen-Image(20B参数)构建掩码区域扩散变换器,核心是通过自适应掩码机制统一三种任务:文本到层(全噪声初始化)、图像到层(将全局图像token作为掩码条件,仅扩散层token)、层到层(保留已有层为干净掩码,仅扩散新层或待风格化层)。创新引入溢出感知画布层作为全尺寸半透明背景,对超出边界的像素进行完整编码。采用流匹配训练,并利用分布匹配蒸馏(DMD)将推理步数压缩至8步。

实验设置

在DESIGN-MULTI-LAYER-BENCH和自建OVERFLOWERFLOW-DESIGN-BENCH上评估。与ART、LayerD、RoboNeo、Lovart、Qwen-Image-Layered等对比。训练分两阶段:512×512分辨率70k迭代后1024×1024 20k迭代,使用64×H200 GPU,全局batch size 1024。消融实验在0.5M子集上4k迭代。

结果

文本到层任务用户研究全面优于ART(布局胜率54.3%、排版61.0%、美学69.0%、整体63.0%)。图像到层中,与Qwen-Image-Layered相比,PSNRmerged提升1.5-3.5,SSIMmerged提升0.03-0.04,用户研究胜率质量79.5%、完整性68.9%、粒度82.6%。推理速度:单H100分解1K图像为20层约6秒,4×H100约3秒,比Qwen-Image-Layered快10-100倍,显存节省50-90%。

局限

论文承认以下挑战:对真实感图像泛化有限,层粒度定义存在歧义,遮挡层完成(尤其半透明或复杂混合)困难,背景修复在严重遮挡下效果不佳。失败主因是布局检测器预测不准或模型对复杂遮挡重构不足。

为什么重要

MRT提供了首个统一多任务且支持溢出层的实际可部署分层生成方案,显著降低了部署成本。高效的推理(蒸馏+缓存+并行)使其适用于实时交互编辑。其数据构建和训练策略可直接迁移至视频分层或3D内容分解任务,为生成式编辑工具开辟新方向。

为什么排在这里

  • HF #16
  • multimodal +22
  • dataset +18
  • benchmark +10
  • systems +6
13
Score 102.4alphaXivarXiv

RT-Lynx: Putting the GEMM Sparsity In a Right Way for Diffusion Models

RT-Lynx:将GEMM稀疏放在正确位置——为扩散模型实现激活稀疏范式

将扩散模型的稀疏范式从权重转至激活,结合norm补偿LoRA微调,实现1.55倍加速且质量无损。 洞见激活稀疏更适合视觉生成模型,可直接推广到视频DiT的推理加速。

RT-Lynx: Putting the GEMM Sparsity In a Right Way for Diffusion Models authors and affiliations
video_generationsystemsevaluation
RT-Lynx: Putting the GEMM Sparsity In a Right Way for Diffusion Models

核心要点

  1. 发现DiT激活本征稀疏(仅5%~10%神经元活跃),而权重呈准高斯分布,因此激活对2:4半结构化稀疏更鲁棒。
  2. 提出norm补偿机制,通过缩放恢复稀疏激活的L2范数,消除幅度衰减,FID从35.85降至25.28。
  3. 引入轻量LoRA分支(R=64)补偿高频细节,2k步微调后FID超越原模型(21.25 vs 21.98)。
  4. 设计融合CUDA内核,在线生成2:4稀疏模式并直接送入Sparse Tensor Core,稀疏开销降至<10%,GEMM加速达1.88×。
  5. Qwen-Image、FLUX.1-dev、Z-Image上验证,线性层平均加速1.55×,端到端加速约1.2×,且与蒸馏、量化、缓存、稀疏注意力正交兼容。
  6. 对单流DiT(Z-Image, FLUX)需要层跳过(skip attn.o_proj等)才能恢复质量。

启示

  • 对V5视频生成DiT可直接应用激活稀疏框架,有望在保持视频质量的同时降低推理延迟。
  • 结合VSR中的低清数据构造和超分模型,RT-Lynx可加速超分反演过程,减少每步计算量。
  • 视频生成RL中若使用多步采样,激活稀疏可加速策略网络的推理,降低在线RL的训练开销。
展开细节

问题

Diffusion Transformers(DiT)生成质量高但推理计算量大。现有加速方法(量化、蒸馏)已较成熟,但N:M半结构化稀疏(可减半FLOPs)在DiT中未充分利用,因为权重稀疏会严重损害生成质量(如FID从22升至52)。需要一种不损失质量的稀疏加速方案。

方法

核心思想是放弃权重稀疏,转而利用激活的本征稀疏。方法包括:(1) 在线对激活做Top-K 2:4稀疏,并用norm补偿恢复L2范数;(2) 使用LoRA分支(R=64)补偿被剪除的高频细节,训练目标是最小化稀疏前后输出差异;(3) 对单流DiT选择性跳过某些层;(4) 实现融合CUDA内核,将稀疏模式生成与Sparse Tensor Core计算合并,并利用streamK流水线优化。

实验设置

Qwen-Image(两个版本)、FLUX.1-dev、Z-Image上评估。训练用20k prompt-image对,测试用MJHQ-30K和sDCI各5k prompt。对比baseline包括Wanda、RIA、BaWA、Slim等权重稀疏方法,以及PyTorch-GEMM、CUTLASS、cuSparseLt等系统基线。同时测试与蒸馏(8步)、W8A8量化、TeaCache缓存、SpargeAttn的兼容性。

结果

RT-Lynx在Qwen-ImageFID为21.25(原模型21.98),IR 1.304(原1.219),超过原模型;权重稀疏方法最差FID达51.63。消融表明norm补偿LoRA分别带来显著提升。线性层平均加速1.55×,GEMM最高1.88×,端到端加速约1.2×。与蒸馏结合总加速11.86×,与量化和缓存结合也均有额外收益。

局限

论文未讨论大规模训练场景下的稀疏效果;LoRA微调需要少量训练数据(20k),但未分析数据量影响;单流DiT需要手动指定跳层策略;当前仅支持2:4模式,未探索其他稀疏比;稀疏加速主要针对线性层,attention部分未优化。

为什么重要

首次实现DiT无损N:M稀疏加速,表明激活稀疏比权重稀疏更优。其方法(norm补偿+LoRA)可推广到其他视觉生成模型;CUDA内核设计可复用;与现有加速技术正交,易于集成到生产推理管线,对降低部署成本有实际价值。

为什么排在这里

  • HF #17
  • video_generation +22
  • systems +6
  • evaluation +16
  • benchmark +10
14
Score 101.6alphaXivarXiv

The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence

MiniMax-M2系列:小激活参数量释放最大真实世界智能

2299亿总参数、98亿激活参数的MoE模型,在agent任务上逼近前沿闭源系统。 洞见agent数据pipeline的奖励质量比数据量更重要,可借鉴设计可验证轨迹。

language_modelsmixture_of_expertsagentreinforcement_learningdata_pipelinebenchmark

核心要点

  1. M2采用256细粒度专家sigmoid门控和可学习专家偏置,以98亿激活参数实现2299亿总参数,并支持192K上下文。
  2. agentic coding基准上,M2.7在SWE-bench Pro达56.2,SWE-bench Multilingual达76.5,Multi-SWE-bench达52.7,均接近或超...
  3. agentic cowork基准上,M2.7在MM Claw达62.7,BrowseComp达77.8,Toolathlon达46.3,展现强工具使用能力。
  4. reasoning & knowledge基准上,M2.7在AIME 2026达94.2,GPQA-Diamond达89.8,接近最强模型。
  5. 训练依赖agent驱动数据pipeline:SWE-scaling pipeline从GitHub PR生成可验证轨迹,AppDev pipeline由专家介入生成全栈应用任务,Terminal...
  6. 提出Forge agent-native RL系统,采用windowed-FIFO调度、前缀树合并、推理优化,支持白盒和黑盒agent统一训练。
  7. M2.7展示初步self-evolution能力,能自主调试训练运行并修改自身scaffold,在agent基准上从M2到M2.7持续提升。
  8. 架构选择上,放弃混合SWA注意力,采用全注意力,因SWA在长上下文(>32K)和复杂推理任务上显著退化,而短上下文影响较小。

启示

  • 对V5项目:其agent数据pipeline的“可验证奖励”设计可借鉴到视频生成统一模型的训练数据构建中,尤其是代...
  • 对视频生成RL:Forge RL系统支持的windowed-FIFO调度和前缀树合并,可处理视频生成长轨迹的变长问...
展开细节

问题

LLM正从短对话转向长程agent工作流(编码、浏览网页、操作工具),带来两大挑战:超长上下文带来效率与成本瓶颈;实际部署需要解决复杂、高风险任务(如生产级软件工程、知识密集型办公自动化)。现有模型要么参数量大(激活高),要么在agent任务上表现不足。

方法

核心思想是极小激活参数(98亿)通过精心设计的MoE架构和agent-native后训练实现前沿性能。MoE层含256个细粒度专家,采用sigmoid门控(每个专家独立打分,打破softmax零和约束)和可学习专家偏置(减少辅助loss依赖)。全程使用全注意力(放弃混合SWA,因SWA在长上下文任务上效果差)。预训练29.2T token,后训练包含三大pipeline:SWE-scaling pipeline从GitHub PR自动构建可运行Docker环境、生成测试驱动的可验证奖励;AppDev pipeline由专家设计元查询、使用Agent-as-a-Verifier进行三层筛选;Terminal-Gym从Stack Overflow合成终端任务。训练使用Forge RL系统,支持windowed...

实验设置

在agentic coding基准(SWE-bench Pro, SWE-bench Multilingual, Multi-SWE-bench, Terminal-Bench 2.0)、agentic cowork基准(MM Claw, BrowseComp, GDPval-AA, Toolathlon)、reasoning & knowledge基准(AIME 2026, GPQA-Diamond)上评测。对比baseline包括GPT-5, Claude 4 Opus/Sonnet, Gemini 3.1 Pro。消融实验:比较全注意力与混合SWA在预训练(HELMET, MMLU, MATH, RULER, MTOB)和SFT后(AIME, ARC-AGI, GPQA, SWE-verified等...

结果

M2.7在SWE-bench Pro达56.2(GPT-5为57.7,Claude 4 Opus为57.3),Multi-SWE-bench达52.7(GPT-5为54.6?图中GPT-5 4?实际数据:GPT-5 4?文本中GPT-5 4?需确认,但整体接近)。在MM Claw达62.7(Claude 4 Opus 75.4,GPT-5 73.6),BrowseComp达77.8(Claude 4 Opus 72.7,GPT-5 75.7)。在AIME 2026达94.2,GPQA-Diamond达89.8。消融:细粒度专家和MTP均稳定提升性能(如MATH从19.6到24.1)。全注意力在长上下文(>32K)显著优于SWA,SWA在短上下文任务上有时轻微更好。M2→M2.5→M2.7在agent基准上...

局限

论文未详细讨论计算成本(预训练29.2T token所需算力、Forge RL系统开销)。self-evolution目前仅针对ML工程任务,泛化性未知。全注意力在极端长上下文(>192K)时计算成本高,论文承认未来需 sub-quadratic 注意力。数据pipeline依赖大量人工介入(AppDev的专家元查询),扩展性有限。黑盒agent如何集成到Forge的细节未充分展开。

为什么重要

展示了小激活参数MoE在agent任务上可以达到与超大模型竞争的性能,验证了agent数据pipeline和RL系统(Forge)的有效性。为业界提供了一种低推理成本、高agent能力的模型方案。self-evolution的初步尝试为模型自主改进开辟新方向。对视频生成等需要长程规划和工具使用的场景有启发意义。

为什么排在这里

  • HF #8
  • agent +20
  • benchmark +10
  • long_context +10
  • systems +6
15
Score 100.8alphaXivarXiv

MobileMoE: Scaling On-Device Mixture of Experts

移动端MoE规模扩展:面向设备端部署的子十亿参数混合专家模型

提出MobileMoE系列,在子十亿参数规模下建立端侧LLM新Pareto前沿。 洞见端侧MoE缩放定律可指导V5 Base的架构搜索,降低计算成本。

MobileMoE: Scaling On-Device Mixture of Experts authors and affiliations
evaluationsystemsdata_pipeline
MobileMoE: Scaling On-Device Mixture of Experts

核心要点

  1. 提出面向移动端的MoE缩放定律,在内存和计算约束下联合优化架构,发现适度稀疏、细粒度专家和共享专家的组合是最优的。
  2. 基于缩放定律推导出MobileMoE-S/M/L三个规格(0.3B/0.5B/0.9B激活参数),在14个benchmark上达到SOTA。
  3. 设计四阶段训练流程(预训练→中训练→SFT→INT4 QAT),仅用约6T预训练token即超越用9-11T token的密集模型。
  4. 在三星S25和iPhone 16 Pro上实现首个端侧MoE推理,MobileMoE-S比MobileLLM-Pro快1.8-3.8倍预填充、2.2-3.4倍解码。
  5. 与OLMoE-1B-7B相比,MobileMoE-M以少60%的参数达到相同准确率,MobileMoE-L以少30%激活参数实现更高准确率。
  6. MoE在知识密集型任务上优势最明显,验证了更大总参数容量对存储事实和理解的增益。

启示

  • 对V5 Base:端侧MoE缩放定律可迁移至Transfusion类架构的超参搜索,减少实验成本。
  • 对RL:MobileMoE细粒度专家路由机制可启发视频生成RL中的动作空间设计。
展开细节

问题

端侧LLM受限于内存和计算,现有密集模型在子十亿参数规模下容量不足,而MoE在云端已成功但端侧尚未系统探索。缺乏针对移动端内存和计算约束的MoE架构缩放定律和训练方案。

方法

核心思想是联合优化MoE架构以满足移动端内存和计算约束。关键模块包括:(1) 端侧MoE缩放定律,考虑激活参数、数据量、专家数和架构选择;(2) 分治优化:先定专家数E=8,再定细粒度g=8,最后加共享专家s=✓;(3) 四阶段训练:预训练→中训练→SFT→INT4 QAT,使用辅助损失无关平衡、分组MLP和专家并行。

实验设置

在14个基础benchmark(HellaSwag, MMLU, ARC等)和8个高级benchmark上评估,baseline包括Gemma 3, SmolLM2, MobileLLM-Pro, Llama 3.2, OLMoE-1B-7B等。预训练在16-32节点H100上进行,共训练6T tokens。

结果

MobileMoE-L(922M激活)在基础benchmark上平均59.8%,超过OLMoE-1B-7B(52.4%)7.4个百分点,且激活参数少30%。MobileMoE-S匹配Qwen3.5 0.8B但激活参数少2.8倍。在SFT后,MobileMoE-M(55.3%)超过OLMoE-1B-7B SFT(55.6%)接近。消融实验验证了E=8、g=8、共享专家的有效性。

局限

论文未讨论在更大参数规模(>1B激活)下的表现;训练数据仅使用开源数据,可能限制上限;量化仅到INT4,未探索更低比特;移动端推理仅测试CPU,未覆盖GPU或NPU。

为什么重要

首个系统化端侧MoE方案,缩放定律可直接用于指导V5 Base的架构设计;四阶段训练流程为高效训练小规模模型提供范本;移动端推理结果证明MoE在真实设备上的可行性,可推动边缘AI应用。

为什么排在这里

  • HF #14
  • evaluation +16
  • systems +6
  • dataset +18
  • benchmark +10

· · ·