共找到 1238条结果
01

Learning to Trace Seiberg Dualities

Jonathan J. Heckman, Shani Meynet, Alessandro Mininno, ...

对偶性在广泛物理系统中微观机制与涌现现象的建立过程中起着关键作用。然而在实际应用中,即便所有“游戏规则”均已明确,要判定两个系统是否互为对偶,往往在计算上极具挑战性。换言之,当我们面对两个系统时,如何高效地确认它们确实构成对偶关系?本文利用机器学习方法,针对超对称箭图规范理论的塞伯格对偶性(Seiberg dualities)来回答这一问题。从数学角度看,这等价于判定箭图的突变(mutations),而该问题本质上是“学习如何解结”(learning to unknot)这一经典任务的变体。一方面,该方法为我们提供了一种实用工具,可用于评估不同对偶性判定问题的计算复杂度;另一方面,它也使我们得以探究不同神经网络架构识别并追踪塞伯格对偶性的学习机制。我们发现:对于节点数量适中(约为10个)的箭图,基于Transformer和多层感知机(MLP)的不同网络架构,其性能普遍优于确定性算法。若进一步将网络与成熟可靠的路径查找算法(即专为箭图设计的“箭图版谷歌地图”)相结合,则可显著提升搜索策略的效率与准确率。我们预期,此类问题可作为前沿人工智能模型应用于理论物理研究时的一类重要基准测试任务。

PDFarXiv
更新于2026/07/30
02

ReToken: One Token to Improve Vision-Language Models for Visual Retrieval

Yao Xiao, Reuben Tan, Zhen Zhu, ...

长视觉上下文对视觉-语言模型构成了挑战:随着干扰项数量的增加,模型性能显著下降;同时,在GPU显存限制下,一次性处理全部视觉标记(tokens)在计算上并不可行。为此,我们提出ReToken——一种可学习的单一嵌入向量,其被显式地训练为检索目标,用于从预填充的视觉键值(KV)缓存中选取与查询高度相关的一组稀疏视觉标记。ReToken仅需在小型图像问答(image-QA)数据集上进行训练,即可在图像与视频基准测试中持续提升模型性能:在Visual Haystacks评测中,它使Qwen3VL-8B模型得分提升13.4分,InternVL3.5提升12.4分(相对提升超20%);在LVBench评测中,该方法可零样本迁移至长视频理解任务,为Qwen3VL-8B带来8.0分的显著增益。得益于其轻量级设计,ReToken的训练过程及长视频推理均可在单块NVIDIA H100 GPU上完成。代码已开源:https://github.com/avaxiao/ReToken

PDFarXiv
更新于2026/07/30
03

ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine

Yukang Cao, Haozhe Xie, Beichen Wen, ...

具身智能正面临一个根本性的数据瓶颈。模型必须能够捕捉人类在追求目标的过程中,第一人称视觉感知、全身运动、灵巧操作、物体状态变化、声音及触觉信号如何随时间协同演化。然而,现有数据集往往将这一完整体验割裂于不同视角、不同模态或不同空间尺度之间,致使完整的“感知—行动”闭环仅能被部分观测。为此,我们提出了“环境采集引擎”(Ambient Capture Engine, ACE),这是一种以人类为中心的数据采集系统,可将真实家庭环境转化为具备空间标定与时间同步能力的多模态录制工作室。ACE 在两个互补的空间尺度上运行:桌面尺度配置专注于手-物交互操作的精细捕捉;房间尺度配置则用于记录全身运动、位移行走以及人在布设齐全的家庭环境中与各类物体的交互行为。ACE 同步采集第一人称视频与多视角第三人称视频、全身及精细化手指关节运动数据、物体三维几何结构与六自由度(6-DoF)轨迹、音频信号以及触觉信号,构成统一的多感官数据流。基于 ACE,我们构建了 ACE-Data-0 数据集:涵盖 200 类任务、50 名参与者在 2 种家居环境中完成的共计 75,000 个交互片段,总计时长 150 小时、含 1,700 万帧视频画面。该数据集覆盖原子级操作任务、长时程的家庭活动链式任务,以及人与场景之间的复杂交互,且通过仅给出目标层级(而非逐步骤)的指令,保留了人类行为的自然变异性。此外,我们还设计了一套分层式基准测试框架,其评估难度由底层信号逐步递进至场景组成要素,最终上升至人-物-场景间的动态交互层面。对当前最先进方法的系统性评测表明,现有模型在接触建模、遮挡处理、自我运动估计以及长时序建模等方面仍存在显著性能缺口。ACE-Data-0 提供了高度同步的人类示范数据,并为感知信号、运动学参数及接触状态三者提供了精确对齐的监督标注,从而为模仿学习、世界模型、视觉-语言-动作联合系统以及具身人工智能研究奠定了可扩展的坚实基础。

PDFarXiv
更新于2026/07/30
04

PhiZero: A World Model Built Around Physical Language

Shuyao Shang, Yuqi Wang, Ruopeng Gao, ...

我们提出了PhiZero,一种以“物理语言”为核心的物理世界模型。“物理语言”是一种紧凑的离散化表征,用于刻画世界状态之间的演化关系。当前主流的物理世界模型通常直接在像素空间中预测未来视频,致使潜在的世界动力学隐含于高维视觉预测器之中,难以显式建模与解读。受人类能力启发——即人类能从视觉经验中抽象出可预测的结构,并将其组织为自然语言以支持显式推理——我们通过自监督方式,从真实世界采集的原始视频中学习物理语言,并利用该语言对物理世界的演化过程进行显式推理。因此,PhiZero采用“先推理、后渲染”(reason-then-render)范式:首先将未来世界演化推断为一段物理语言序列,再将该序列所描述的状态转移渲染生成对应视频。大量实验在生成与理解两类基准任务上均验证了PhiZero建模符合物理规律的世界演化的有效性。我们进一步展示了PhiZero在构建逼真且可交互的世界模型、实现细粒度动作条件下的仿真模拟,以及完成零样本运动迁移等方面的潜力。

PDFarXiv
更新于2026/07/30
05

PAC-MAN: Perception-Aware CBF-RL for Whole-Body Safety in Humanoid Dodgeball

Lizhi Yang, Junheng Li, Aaron D. Ames

我们提出了PAC-MAN——一种感知感知型CBF-RL(控制屏障函数-强化学习)框架,将控制屏障函数所保障的安全性与面向实际部署的机载感知能力相结合,实现人形机器人全身躲避球任务。该部署策略仅依赖于安装在机器人头部的摄像头所采集的、经语义分割掩膜处理后的深度图像来观测球体;训练阶段则通过控制屏障函数对机器人身体各连杆分别建模安全间隙,并引入对抗式运动先验(adversarial motion prior)以约束和正则化最终生成的避让反射行为。我们在一个受控的“任意连杆接触”基准测试中对其进行了评估,该测试包含两类预设投球场景:单次投球,以及一个闭环部署流程——机器人在每次投球后自主走回起始站位并完成姿态复位。在此基准上,该策略的性能已接近具备完全状态感知能力的“特权状态预言机”(privileged state oracle),表明仅靠固定安装的机载摄像头即足以支撑有效的躲避行为。我们发现,可用的屏障结构(barrier structure)高度依赖于感知系统的可观测性:当球的状态估计准确时,“关节级CBF”(Joint-CBF)表现最优;但在仅使用固定摄像头观测的条件下,若Joint-CBF仅作为训练阶段的引导信号,则其性能显著下降;而一旦引入球体跟踪云台或具备特权信息的运行时滤波器,其性能即可恢复。因此,我们最终在真实世界中,将轻量化的“连杆级CBF”(Link-CBF)策略以零样本迁移(zero-shot)方式直接部署至Unitree G1人形机器人平台:该策略对感知误差具备鲁棒性,在95%的投球中成功完成躲避,并利用语义分割技术区分并规避不同类型的球体。

PDFarXiv
更新于2026/07/30
06

AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis

Bing Yan, Gregory Wolfe, Stefano Martiniani, ...

化学文献综述往往需要从大量分散发表的论文中提取并整合特定的研究发现,但现有的文献检索系统主要仅返回按相关性排序的文献列表。因此,科研人员与人工智能代理均需人工定位相关信息、核实其出处,并跨论文手动整合答案。为此,我们提出AskChem——一种以“主张”(claim)为中心的跨论文化学检索基础设施。AskChem将检索的基本单元从整篇论文转变为携带出处信息的原子化主张:每篇论文被解析为若干细粒度、类型明确的主张,每个主张均严格锚定至原始文献的DOI,并附有原文引述或明确的证据定位标识。在此统一的主张知识库之上,AskChem构建了三类互补的结构,分别支持检索与综合任务:一是稳定化的分面式分类体系,支持层级化检索与浏览;二是证据图谱(evidence graph),通过语义关系将不同主张相互关联;三是动态演进的“活体”分类体系(exploratory living taxonomy),依据基础科学原理对已索引论文进行概念化组织。目前,AskChem已索引来自14.7万篇论文的240万个主张,并提供网页界面,以及面向AI代理的REST API、软件开发工具包(SDK)和MCP(Model Context Protocol)接入方式。在AskChem-Bench评测基准上,将GPT-5.5阅读器与AskChem进行出处 grounding(即出处绑定)后,其引用DOI的可解析率达100%,显著高于未使用检索时的88.3%;同时,在所测试的五个系统中,AskChem实现的文献引用密度最高。AskChem现已正式上线,访问地址为 https://askchem.org。

PDFarXiv
更新于2026/07/30
07

AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

Xiangning Lin, Shenzhe Zhu, Shu Yang, ...

系统提示词(system prompts)是由开发者配置的指令,用于规范基础模型在人工智能应用中的行为。这类提示词被广泛应用于各类商业化AI产品中,却极少向公众或监管机构公开,从而在AI系统的广泛应用中造成了严重的信任缺失与问责空白。本文提出了“人工智能系统提示词保障框架”(Artificial Intelligence System Prompt Assurance, AISPA),这是一个以用户为中心的系统性审计框架,旨在对AI系统中的系统提示词进行全面评估。AISPA聚焦于系统提示词的具体组成部分,并依据八个与用户切身利益密切相关的维度对其进行逐项评价。我们运用该框架,对88款商业化AI产品中系统提示词所含的3249条指令进行了审查,并将每条指令归类为“具有保护性”(即有利于用户)或“存在潜在问题”(即可能损害用户权益)。本次审计得出四项核心发现:第一,不同产品及开发方在系统提示词设计上差异显著——部分企业平均每款产品包含逾60条具保护性的指令,而另一些企业则平均不足5条;第二,具保护性的指令虽被普遍采用,但覆盖范围普遍狭窄:98.9%的产品至少包含一条此类指令,但仅有24%的产品在AISPA所定义的全部八个维度上均有所体现;第三,系统提示词整体呈现持续增长趋势,不仅长度逐年增加,其对用户的保护性也日益增强,表明用户权益保障正逐步成为商业化提示词设计中愈发凸显的关注重点;第四,尽管取得上述进展,存在问题的指令仍普遍存在:约40%的产品至少含有一条损害用户利益的指令,且具保护性与存在问题的指令往往共存于同一份系统提示词之中。我们的研究结果凸显出:亟需在商业化AI产品中提升系统提示词的透明度、推动标准化建设,并建立独立的第三方监督机制。

PDFarXiv
更新于2026/07/30
08

Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers

Chongjian Ge, Hanwen Jiang, Tianyu Wang, ...

视觉生成任务对高分辨率图像、长时长视频以及多模态上下文的需求日益增长,使得全注意力机制(full attention)所固有的平方级计算开销变得难以承受。为此,我们提出 Chimera——一种具备严谨可扩展性设计范式的混合式视觉扩散主干网络。Chimera 将文本、图像与视频 token 统一纳入单一的光栅扫描顺序(raster-ordered)序列中进行处理,且完全不依赖位置编码(positional embeddings)。其核心架构融合了三类关键组件:(1)Kimi Delta 注意力(KDA),用于以线性复杂度 O(N) 高效追踪长程上下文状态;(2)交错式多头潜在注意力(MLA),支持 token 间的直接全局交互;(3)模态感知的短卷积(modality-aware short convolutions),精准建模局部时空上下文。此外,稀疏混合专家(Sparse Mixture-of-Experts, MoE)层在显著提升模型容量的同时,有效控制了实际激活的计算量。 为实现该异构架构的系统性扩展,我们进一步提出 HeteroP——一种按模块精细化调控的缩放方案:它依据每个张量的功能性入度(functional fan-in)及所在模型深度,动态迁移超参数,在宽度(width)与深度(depth)两个维度上分别进行适配。HeteroP 由此生成一组参数高度协调一致的模型族,并据此拟合出符合 Chinchilla 风格的计算最优律(compute-optimal laws),涵盖三个关键维度:实际激活的模型参数量、训练所用 token 总数,以及图像与视频数据的配比。 基于上述规律指导,我们训练出一个总参数量为 110 亿(11B)、训练中实际激活参数量为 20 亿(2B)的 Chimera 模型。实验结果呈现三大发现: 第一,以预训练阶段的扩散损失(diffusion loss)为衡量标准,该模型的稠密主干网络(dense backbone)相较同等规模的全注意力基线模型 Wan-2.1(2B 参数),计算效率提升达 1.7 倍;而完整系统(含 MoE 等全部组件)的计算效率更高达基线的 7.3 倍。 第二,在未针对特定视频长度进行微调的前提下,Chimera 能够实现零样本外推(zero-shot extrapolation):从仅用 5 秒训练片段训练所得模型出发,直接生成长达 30 秒的视频,且在最后 5 秒内的 Fréchet Inception Distance(FID)指标仅下降 6.5%,展现出卓越的时序泛化能力。 第三,所拟合的计算最优律揭示出重要规律:对于图像预训练任务,计算资源在“激活模型规模”与“训练 token 总量”之间近乎均等分配即达最优;而对于视频预训练任务,在更高计算预算下,则适度倾向于将更多资源投入扩大模型规模。 上述成果为高效长上下文视觉扩散架构的设计与规模化扩展奠定了坚实基础。

PDFarXiv
更新于2026/07/30
09

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

Qiushi Sun, Kanzhi Cheng, Yian Wang, ...

面向计算机操作的智能体(CUA)正在数字世界中迅猛发展。一条CUA轨迹记录了该智能体所执行的动作、所处的状态及其推理过程。验证该轨迹是否真正完成了任务指令,是CUA评估、数据筛选与强化学习中的核心环节。然而,人工编写的验证器或人工标注员均无法在大规模场景下提供此类验证,因此学界正日益依赖视觉-语言模型(VLM)作为CUA轨迹的“裁判”。但一个根本性问题却长期未被系统考察:这些VLM裁判是否足够可靠?为对此展开系统性研究,我们提出了OSReward——一个贴近真实场景、高质量的基准测试集,专门用于评估VLM作为CUA轨迹裁判的性能。其中的CUA轨迹源自多种不同架构的智能体主干模型,在多个平台上执行经人工严格验证的任务指令;所有轨迹均通过多阶段人工标注流程,获得具有权威性的真值判定结果。在此基础上,我们进一步构建了OSReward-Hard挑战集,聚焦于真正具有判别难度的案例;以及OSReward-Multi细粒度评测子集,支持对效率与对齐程度进行精细化评分。这是迄今最全面的一次VLM裁判性能评估,结果表明:即便是当前最先进的VLM模型,其表现仍远未达到理想裁判的标准,普遍存在一种系统性的“宽松偏差”(leniency bias),即倾向于将失败的运行误判为成功。少数具备足够可靠性的模型,其运行成本又过高,难以支撑规模化部署;而成本可接受的开源模型,其性能则显著落后。为弥合这一关键差距,我们构建并公开发布了OS-Shepherd-100K——一个面向CUA社区开放的、包含10万条带推理过程标注的轨迹评判语料库。基于该语料库,我们训练出两款开源奖励模型OS-Shepherd(参数量分别为9B和35B),可提供低成本、高稳定性且高可靠性的奖励信号,其性能与商业级裁判模型相当,但推理成本却比前沿商用模型低30%–60%。大量深入分析进一步为构建大规模、高可靠性的CUA奖励机制提供了实践指导与设计依据。我们的全部代码、基准测试框架、数据集及模型检查点均已开源,详见:https://os-copilot.github.io/OSReward-Home/。

PDFarXiv
更新于2026/07/30
10

KAISEN: Reproducible Subgroup Fairness Auditing for Clinical Risk Models

Sparsh Roy, Samuel Girmachew, Nishita Chavan

临床风险预测模型通常在整体性能上表现优异,但在不同患者亚组间的错误率却存在显著差异。为此,学界已提出若干审计流程(audit pipelines)以识别此类问题,但这些流程的各个组成部分却鲜有经过严格的压力测试,因而尚不清楚其中哪些环节值得信赖,以及在何种条件下才可信赖。本文提出KAISEN——一个涵盖五个阶段的审计流程:亚组分层、差异性度量、机制诊断、事后校正及漂移监测。该流程在一项合成基准数据集上被推进至失效边界进行系统评估,该基准包含16种疾病任务、来自《健康人群2030》(Healthy People 2030)的15个社会决定因素维度,以及三个预先指定的交叉维度。研究得出以下四项主要发现: (i)统计显著性(significance)反映的是各维度实际差距与其自身最小可检测效应(minimum detectable effect)之间的关系:在全部15个维度上,显著性计数与原始均衡几率差(equalized-odds difference, EOD)之间的等级相关系数为ρ = 0.56;而当EOD按该最小可检测效应进行标准化后,相关系数提升至ρ = 0.78。 (ii)针对各亚组分别优化分类阈值,在全部48次留出验证(held-out)运行中均成功降低了EOD(配对差值Δ = −0.285,95%置信区间[−0.313, −0.252]);相比之下,虽能更好校准预测概率的“按组Platt缩放法”(group-wise Platt scaling)在EOD改善效果上却近乎随机(48次运行中仅19次取得改善,95%置信区间[0.26, 0.55]),其平均效应接近零——因此,审计报告应呈现的是该方法效果的方差,而非其均值。 (iii)机制诊断模块在全部144例受控实验案例中均准确分类,但在代理变量设定失当时,却未能识别出48例由模型本身驱动的偏差案例,且未给出任何失败信号。 (iv)CUSUM监测方法的失效(即漏报)与误报(false alarm)现象,更多取决于队列样本的随机实现(cohort realization),而非疾病类型本身:在参考阈值下,全部27次误报及8次漏报中的7次均源自不同随机种子生成的队列(卡方检验p = 0.002),表明在一个队列上校准所得的阈值无法泛化至其他队列。所有结果均基于合成数据,其真实标签(ground truth)已知,故不构成对临床有效性的验证。全部代码、中间产物(artifacts)及复现各数值结果的脚本均已开源发布。

PDFarXiv
更新于2026/07/30
继续下滑,发现更多