arXiv AI 每日精选

267 篇论文
🧠机器学习(88篇)
cs.LGcs.AI

#1CENDRe:基于自然域表示的概念提取

CENDRe: Concept Extraction with Natural Domain Representations

卷积神经网络(CNN)被广泛应用于时间序列分类任务,但要将其部署于关键领域,就需要理解支撑其预测结果的时域与频域模式。概念提取(CE)方法通过分析模型隐空间内的表征来识别这类模式。然而,现有的时间序列概念提取方法存在三点局限:仅在时域内操作而忽略频域特征、需预先定义概念数量、生成的定位结果与模型实际...

Antonia Holzapfel, Andres Felipe Posada Moreno 等 3 人
2026/07/31
cs.LGcs.AIstat.ML

#2同策略交互何时起效?基于值函数的模仿学习中的表征权衡

When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning

模仿学习(IL)——即训练智能体从演示中复刻专家行为——是从机器人学到语言模型训练等各类应用的基础。众所周知,行为克隆(BC)这类标准方法存在误差累积和性能停滞的问题,尤其是在学习者无法完美表征专家策略时(这一情况十分常见,例如在知识蒸馏场景中)。经验层面普遍认为有两种干预手段可以提升性能:沿着学习...

Luca Viano, Antoine Moulin 等 6 人
2026/07/31
cs.LGcs.AIcs.CV

#3可解释性-性能系数的以人为中心验证

A Human-Centered Validation of the Explainability-Performance Coefficient

深度学习模型在高风险领域的快速普及,使得业界对可信可解释人工智能(XAI)的需求愈发迫切。然而,客观评估解释保真度、让XAI指标与以人为中心的认知相契合,仍是亟待解决的关键开放性难题。在本研究中,我们提出一种与模型无关的指标——EPC得分,它是可解释性-性能系数(EPC)的扩展形式,通过明确权衡特征...

Christian Oliva, Luis F. Lago-Fernández
2026/07/31

还有 85 篇论文

🤖人工智能(综合)(86篇)
cs.AI

#1ExtractBench:面向模式引导型企业文档提取的基准测试集

ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

企业工作流日益依赖智能体完成**模式引导提取**:给定一份文档和用户定义的模式,智能体会严格遵循该模式生成正确输出,并附带来源依据作为锚定元数据。我们提出了ExtractBench这一针对模式引导提取的基准测试,据我们所知,它是首个同时对值准确率、大规模记录完整性、锚定效果及实测成本进行综合评分的基...

Boyang Zhang, Adrian Lyjak 等 5 人
2026/07/31
cs.AI

#2FDD-ON的开发:一种用于变风量暖通空调系统故障检测与诊断的本体

Development of FDD-ON: an Ontology for VAV HVAC System Fault Detection and Diagnostics

故障检测与诊断(FDD)技术对于提升暖通空调(HVAC)系统的可靠性、能效及维护成效至关重要。然而,在建筑中有效部署FDD解决方案需要系统化的领域知识,以衔接异构数据源、多样设备类型及差异化诊断输出。FDD领域内有限的数据可解释性与互用性已导致信息孤岛碎片化,阻碍了FDD及相关应用的落地,例如数字孪...

Yimin Chen, Brian Fricke 等 13 人
2026/07/31
cs.AI

#3AgentHPOBench:用于评估作为序列超参数优化器的大语言模型智能体的基准测试

AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers

随着大语言模型从代码补全系统演变为自主科学智能体,评估其开展实验的能力变得愈发重要。现有基准通常聚焦于静态代码生成、论文复现或最终答案的正确性,却未直接评估智能体是否能够解读实验证据,并以此指导后续的超参数决策。为填补这一空白,我们提出了AgentHPOBench,这是一个包含覆盖七个研究类别的30...

Tianyu Huai, Tingshuo Fan 等 8 人
2026/07/31

还有 83 篇论文

👁️计算机视觉(80篇)
cs.LGcs.AIcs.CV

#1可解释性-性能系数的以人为中心验证

A Human-Centered Validation of the Explainability-Performance Coefficient

深度学习模型在高风险领域的快速普及,使得业界对可信可解释人工智能(XAI)的需求愈发迫切。然而,客观评估解释保真度、让XAI指标与以人为中心的认知相契合,仍是亟待解决的关键开放性难题。在本研究中,我们提出一种与模型无关的指标——EPC得分,它是可解释性-性能系数(EPC)的扩展形式,通过明确权衡特征...

Christian Oliva, Luis F. Lago-Fernández
2026/07/31
cs.CLcs.AIcs.CV+1

#2FriendBench:人类与多模态大语言模型中的二元熟悉度推理基准测试

FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

解读社交情境往往依赖行为,而非仅靠言语。我们推出FriendBench这一基准测试,旨在从一段20秒的双人破冰对话片段中,推断出两人本就相识还是初次见面。每一组对话双方都回答同一类提示问题,因此答案只能通过互动方式来揭示。我们基于96组平衡的双人配对,在文本、音频、视频三类模态下,将来自七家公司的2...

Jeffrey M. Girard, Jason Z. Zheng 等 5 人
2026/07/31
cs.CVcs.AI

#3TraceViT:面向视觉抽象推理的基于锚定轨迹监督

TraceViT: Grounded Trace Supervision for Visual Abstract Reasoning

抽象与推理语料库(ARC)测试模型能否从少量输入输出示例中推断出未见过的变换,并将其应用于新网格。循环视觉推理器会在多次迭代中优化预测,但传统训练仅约束最终输出,使得中间优化过程不受约束。我们提出,这些优化反而应当逐步遵循该变换过程。我们推出TraceViT,这是一种采用语义单调变换链训练的循环视觉...

Binnan Liu, Yechi Ma 等 4 人
2026/07/31

还有 77 篇论文

💬计算语言学(39篇)
cs.CLcs.AIcs.CV+1

#1FriendBench:人类与多模态大语言模型中的二元熟悉度推理基准测试

FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

解读社交情境往往依赖行为,而非仅靠言语。我们推出FriendBench这一基准测试,旨在从一段20秒的双人破冰对话片段中,推断出两人本就相识还是初次见面。每一组对话双方都回答同一类提示问题,因此答案只能通过互动方式来揭示。我们基于96组平衡的双人配对,在文本、音频、视频三类模态下,将来自七家公司的2...

Jeffrey M. Girard, Jason Z. Zheng 等 5 人
2026/07/31
cs.CLcs.AI

#2ARB:面向AI文本检测器评估的匹配作者重写基准数据集

ARB: A Matched Authorship-Rewriting Benchmark Dataset for AI-Text Detector Evaluation

标准的AI文本检测基准会将人类撰写的文本与大型语言模型(LLM)直接生成的文本进行对比。尽管此前已有研究表明,重写和意译会降低检测器的性能,但目前尚不清楚,在这种传统基准上测得的性能能否预测当人类创作的内容被LLM重写时检测器的表现。为填补这一空白,我们提出了作者重写基准(ARB),该基准基于180...

Gaetano Perrone, Simon Pietro Romano
2026/07/31
cs.CLcs.AI

#3突厥语族语言机器翻译的跨语言迁移

Cross-Lingual Transfer for Machine Translation in Turkic Languages

跨语言迁移是低资源机器翻译的核心,但它在亲缘关系相近的语系内部的表现特征仍未得到充分阐释。我们使用成对迁移矩阵,研究土耳其语、阿塞拜疆语、乌兹别克语、哈萨克语和吉尔吉斯语这五种突厥语之间的迁移情况。在该设定下,每个模型仅使用一个迁移源进行微调,并在不同的迁移目标上进行评估,同时翻译目标保持不变。基于...

Omer Burak Cinar, Mehmet Mert Dalkilic 等 3 人
2026/07/31

还有 36 篇论文

🦾机器人学(26篇)
cs.AIcs.RO

#1LEMUR:基于偏好反馈的多目标强化学习对齐学习

LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback

强化学习(RL)系统通常采用单一、明确设定的标量奖励函数进行训练。但现实世界的决策任务往往涉及多个相互冲突的目标,例如性能与效率之间的权衡,而这类任务的真实奖励函数难以明确设定或无法获取。多目标强化学习(MORL)通过将奖励建模为向量来处理这类权衡问题,但现有方法通常假设可获取每个目标下明确设定的奖...

Manith Adikari, Bei Peng 等 4 人
2026/07/31
cs.ROcs.AIeess.SY

#2FBFM:世界动作模型执行中流匹配的无训练异步反馈机制

FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action Models Execution

尽管世界动作模型(WAM)通过在行动前预测视觉演化来提升长程机器人控制效果,但长程可靠性需要基于真实观测进行反复重新校准,而非递归展开。现有WAM通过在数据块之间用真实数据刷新历史或键值缓存来解决这一问题。然而,这种分块反馈的时间粒度较粗,无法纠正单个时间步长层面的预测误差。为解决该问题,我们提出反...

Peize Li, Ruimeng Zhang 等 6 人
2026/07/31
cs.ROcs.AI

#3CLIFT:通过非侵入式闭环迭代微调将Gemini机器人端侧能力转化为人形机器人专家

CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning

尽管机器人基础模型的能力日益增强,但性能最强的模型通常是基于专有数据训练且保持闭源,这限制了下游用户将其适配到新任务、新本体和新部署场景的能力。受大语言模型社区的启发,闭源权重机器人基础模型的一种新兴访问范式是托管式监督微调(SFT)API,用户提交训练数据后会收到调优后的策略,但无法访问模型权重、...

Yuxin Chen, Hari Srikanth 等 10 人
2026/07/31

还有 23 篇论文

📊统计机器学习(9篇)
cs.LGcs.AIstat.ML

#1同策略交互何时起效?基于值函数的模仿学习中的表征权衡

When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning

模仿学习(IL)——即训练智能体从演示中复刻专家行为——是从机器人学到语言模型训练等各类应用的基础。众所周知,行为克隆(BC)这类标准方法存在误差累积和性能停滞的问题,尤其是在学习者无法完美表征专家策略时(这一情况十分常见,例如在知识蒸馏场景中)。经验层面普遍认为有两种干预手段可以提升性能:沿着学习...

Luca Viano, Antoine Moulin 等 6 人
2026/07/31
cs.LGcs.AIcs.CY+2

#2TerraNova:人类世的基础模型

TerraNova: A Foundation Model for the Anthropocene

人类世的一个核心问题是将物理地球与人类社会建模为一个耦合系统,但目前尚无任何学习得到的表征能够覆盖二者的观测广度。我们认为这一障碍源于几何属性:物理地球的测量结果是无视政治边界的连续场,而社会数据则以行政单元为单位上报。现有地球系统基础模型适配第一种几何特征,若要将其与第二种几何特征耦合,则需要在边...

Carlos Rodriguez-Pardo, Massimo Tavoni
2026/07/31
cs.AIstat.ML

#3反事实解释的广义贝叶斯视角:基于后验的决策与评估

A Generalized-Bayes Perspective on Counterfactual Explanations: Posterior-Based Decision-Making and Evaluation

反事实解释(CE)通过确定使输入产生期望输出所需的最小变动,提升机器学习模型的可解释性。尽管反事实解释通常被构建为距离最小化问题,但这一构建方式的理论基础却鲜受关注。我们证明,基于距离最小化的反事实解释在数学上等价于广义贝叶斯框架内吉布斯后验的最大后验(MAP)估计——具体而言,是在采用基于距离的先...

Keita Kinjo
2026/07/31

还有 6 篇论文

🧬神经网络与进化计算(1篇)
cs.LGcs.NE

#1基于动态交互场的结构化隐层与向量吸引子式SILVA网络

SILVA Networks as Structured Implicit Layers and Vector Attractors via Dynamic Interaction Fields

许多学习问题需要能协调直接输入、邻近结构与更广上下文的表征。在隐式神经层中,这些影响通常被整合到单个定点更新中,导致难以区分哪些信息来自刺激、哪些在本地传播、哪些来自全局上下文,以及哪些由求解器动态过程产生。在此我们介绍SILVA网络,即通过动态交互场实现的结构化隐式层与向量吸引子网络。SILVA在...

Jose Luis Lima de Jesus Silva
2026/07/31
🎯博弈论与AI(1篇)
cs.LGcs.GTecon.TH

#1基于图神经网络的最优动态匹配学习

Learning Optimal Dynamic Matching via Graph Neural Networks

动态匹配市场需要就匹配对象与匹配时机做出决策:当下完成匹配可获取价值,但会移除那些可能在未来创造更好机遇的参与者。针对有限且不断演化的加权图上的该问题,我们开发了一套基于价值的强化学习框架。我们研究了一个包含随机到达、节点类型转换、边生成与外生退出的无限时域连续时间模型。我们证明了事件时间归约:在不...

Genta Okada, Shunya Noda 等 4 人
2026/07/31
⚙️系统与控制(0篇)
📄
暂无论文
arXiv AI 每日精选|梯度不陡