arXiv AI 每日精选
267 篇论文#1CENDRe:基于自然域表示的概念提取
CENDRe: Concept Extraction with Natural Domain Representations
卷积神经网络(CNN)被广泛应用于时间序列分类任务,但要将其部署于关键领域,就需要理解支撑其预测结果的时域与频域模式。概念提取(CE)方法通过分析模型隐空间内的表征来识别这类模式。然而,现有的时间序列概念提取方法存在三点局限:仅在时域内操作而忽略频域特征、需预先定义概念数量、生成的定位结果与模型实际使用的区域不对齐。针对上述局限,我们提出了面向卷积神经网络的概念提取方法CENDRe。该方法首先通过两阶段的逐时间步隐表征聚类来发现概念,其中轮廓系数引导的聚合操作可自动选定概念数量。随后,CENDRe通过存在性得分的梯度对每个概念进行定位——该得分将隐表征与其原型进行对比,生成聚焦于概念驱动区域的...
#2同策略交互何时起效?基于值函数的模仿学习中的表征权衡
When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning
模仿学习(IL)——即训练智能体从演示中复刻专家行为——是从机器人学到语言模型训练等各类应用的基础。众所周知,行为克隆(BC)这类标准方法存在误差累积和性能停滞的问题,尤其是在学习者无法完美表征专家策略时(这一情况十分常见,例如在知识蒸馏场景中)。经验层面普遍认为有两种干预手段可以提升性能:沿着学习者自身的轨迹交互式地向专家查询,以及在生成策略的过程中使用价值函数估计,而非直接拟合专家的完整动作分布。我们探究了这些性能提升的本质以及它们之间可能出人意料的相互作用。我们的核心发现是:与专家的交互能够放宽对学习者的表征要求——只需模型能够实现专家的价值函数即可,无需满足(通常更为严苛的)实现专家策...
#3可解释性-性能系数的以人为中心验证
A Human-Centered Validation of the Explainability-Performance Coefficient
深度学习模型在高风险领域的快速普及,使得业界对可信可解释人工智能(XAI)的需求愈发迫切。然而,客观评估解释保真度、让XAI指标与以人为中心的认知相契合,仍是亟待解决的关键开放性难题。在本研究中,我们提出一种与模型无关的指标——EPC得分,它是可解释性-性能系数(EPC)的扩展形式,通过明确权衡特征选择稀疏度与模型性能保留度之间的取舍关系,实现对解释质量的量化。通过在表格、文本及图像多模态数据上的实证验证,我们发现EPC得分能够有效揭示网络激活状态、数据维度与解释器性能之间的运行依赖关系。此外,我们基于独立的人工解释结果对EPC得分进行了验证,证明更高的EPC得分与人类的词汇情感判断、空间视觉...
#1CENDRe:基于自然域表示的概念提取
CENDRe: Concept Extraction with Natural Domain Representations
卷积神经网络(CNN)被广泛应用于时间序列分类任务,但要将其部署于关键领域,就需要理解支撑其预测结果的时域与频域模式。概念提取(CE)方法通过分析模型隐空间内的表征来识别这类模式。然而,现有的时间序列概念提取方法存在三点局限:仅在时域内操作而忽略频域特征、需预先定义概念数量、生成的定位结果与模型实际...
#2同策略交互何时起效?基于值函数的模仿学习中的表征权衡
When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning
模仿学习(IL)——即训练智能体从演示中复刻专家行为——是从机器人学到语言模型训练等各类应用的基础。众所周知,行为克隆(BC)这类标准方法存在误差累积和性能停滞的问题,尤其是在学习者无法完美表征专家策略时(这一情况十分常见,例如在知识蒸馏场景中)。经验层面普遍认为有两种干预手段可以提升性能:沿着学习...
#3可解释性-性能系数的以人为中心验证
A Human-Centered Validation of the Explainability-Performance Coefficient
深度学习模型在高风险领域的快速普及,使得业界对可信可解释人工智能(XAI)的需求愈发迫切。然而,客观评估解释保真度、让XAI指标与以人为中心的认知相契合,仍是亟待解决的关键开放性难题。在本研究中,我们提出一种与模型无关的指标——EPC得分,它是可解释性-性能系数(EPC)的扩展形式,通过明确权衡特征...
还有 85 篇论文
#1ExtractBench:面向模式引导型企业文档提取的基准测试集
ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
企业工作流日益依赖智能体完成**模式引导提取**:给定一份文档和用户定义的模式,智能体会严格遵循该模式生成正确输出,并附带来源依据作为锚定元数据。我们提出了ExtractBench这一针对模式引导提取的基准测试,据我们所知,它是首个同时对值准确率、大规模记录完整性、锚定效果及实测成本进行综合评分的基准。该评估体系涵盖370份企业文档中的4869页内容,涉及8个业务领域、67种文档类型,并带有明确标签区分不同挑战场景。可扩展的模式与真值标注流水线结合了真实文档的独立系统一致性校验、合成列表的已知值校验,以及表单的人工核验。我们采用不考虑顺序的值F1值衡量值准确率,同时使用两个锚定指标衡量来源可追...
#2FDD-ON的开发:一种用于变风量暖通空调系统故障检测与诊断的本体
Development of FDD-ON: an Ontology for VAV HVAC System Fault Detection and Diagnostics
故障检测与诊断(FDD)技术对于提升暖通空调(HVAC)系统的可靠性、能效及维护成效至关重要。然而,在建筑中有效部署FDD解决方案需要系统化的领域知识,以衔接异构数据源、多样设备类型及差异化诊断输出。FDD领域内有限的数据可解释性与互用性已导致信息孤岛碎片化,阻碍了FDD及相关应用的落地,例如数字孪生驱动的FDD框架、人工智能(AI)驱动的维护决策系统。本文提出一种FDD本体(FDD-ON),这是一种模块化、可扩展的本体,用于标准化表征变风量(VAV)暖通空调系统组件、故障类型、症状状态、故障影响及相关属性。FDD-ON整合了暖通空调系统FDD语义,依托定义明确的受控词汇表,实现对故障与症状属...
#3AgentHPOBench:用于评估作为序列超参数优化器的大语言模型智能体的基准测试
AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers
随着大语言模型从代码补全系统演变为自主科学智能体,评估其开展实验的能力变得愈发重要。现有基准通常聚焦于静态代码生成、论文复现或最终答案的正确性,却未直接评估智能体是否能够解读实验证据,并以此指导后续的超参数决策。为填补这一空白,我们提出了AgentHPOBench,这是一个包含覆盖七个研究类别的30项可执行机器学习任务的序列基准。每个任务均经验证的基线运行启动,之后由智能体执行若干序列干预操作。在每一步中,智能体先观测累计的配置、指标与日志,再提出下一个有效配置。我们在统一协议下对12种广泛使用的智能体与常规超参数优化基线进行了评估。结果显示,当前智能体在各领域展现出可衡量的实验优化能力,但在...
#1ExtractBench:面向模式引导型企业文档提取的基准测试集
ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
企业工作流日益依赖智能体完成**模式引导提取**:给定一份文档和用户定义的模式,智能体会严格遵循该模式生成正确输出,并附带来源依据作为锚定元数据。我们提出了ExtractBench这一针对模式引导提取的基准测试,据我们所知,它是首个同时对值准确率、大规模记录完整性、锚定效果及实测成本进行综合评分的基...
#2FDD-ON的开发:一种用于变风量暖通空调系统故障检测与诊断的本体
Development of FDD-ON: an Ontology for VAV HVAC System Fault Detection and Diagnostics
故障检测与诊断(FDD)技术对于提升暖通空调(HVAC)系统的可靠性、能效及维护成效至关重要。然而,在建筑中有效部署FDD解决方案需要系统化的领域知识,以衔接异构数据源、多样设备类型及差异化诊断输出。FDD领域内有限的数据可解释性与互用性已导致信息孤岛碎片化,阻碍了FDD及相关应用的落地,例如数字孪...
#3AgentHPOBench:用于评估作为序列超参数优化器的大语言模型智能体的基准测试
AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers
随着大语言模型从代码补全系统演变为自主科学智能体,评估其开展实验的能力变得愈发重要。现有基准通常聚焦于静态代码生成、论文复现或最终答案的正确性,却未直接评估智能体是否能够解读实验证据,并以此指导后续的超参数决策。为填补这一空白,我们提出了AgentHPOBench,这是一个包含覆盖七个研究类别的30...
还有 83 篇论文
#1可解释性-性能系数的以人为中心验证
A Human-Centered Validation of the Explainability-Performance Coefficient
深度学习模型在高风险领域的快速普及,使得业界对可信可解释人工智能(XAI)的需求愈发迫切。然而,客观评估解释保真度、让XAI指标与以人为中心的认知相契合,仍是亟待解决的关键开放性难题。在本研究中,我们提出一种与模型无关的指标——EPC得分,它是可解释性-性能系数(EPC)的扩展形式,通过明确权衡特征选择稀疏度与模型性能保留度之间的取舍关系,实现对解释质量的量化。通过在表格、文本及图像多模态数据上的实证验证,我们发现EPC得分能够有效揭示网络激活状态、数据维度与解释器性能之间的运行依赖关系。此外,我们基于独立的人工解释结果对EPC得分进行了验证,证明更高的EPC得分与人类的词汇情感判断、空间视觉...
#2FriendBench:人类与多模态大语言模型中的二元熟悉度推理基准测试
FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models
解读社交情境往往依赖行为,而非仅靠言语。我们推出FriendBench这一基准测试,旨在从一段20秒的双人破冰对话片段中,推断出两人本就相识还是初次见面。每一组对话双方都回答同一类提示问题,因此答案只能通过互动方式来揭示。我们基于96组平衡的双人配对,在文本、音频、视频三类模态下,将来自七家公司的26个模型与匹配的人类专家组进行了对比。最优模型与人类群体在所有模态下的准确率在统计层面无显著差异,但二者达成该结果的方式不同:人类在两种判断结果间保持均衡,而表现最强的模型倾向于判断为“陌生人”——这是有效先验的差异,而非辨别能力的差异。更丰富的信息渠道对二者的帮助并不均等,只有人类能在言语之外借助...
#3TraceViT:面向视觉抽象推理的基于锚定轨迹监督
TraceViT: Grounded Trace Supervision for Visual Abstract Reasoning
抽象与推理语料库(ARC)测试模型能否从少量输入输出示例中推断出未见过的变换,并将其应用于新网格。循环视觉推理器会在多次迭代中优化预测,但传统训练仅约束最终输出,使得中间优化过程不受约束。我们提出,这些优化反而应当逐步遵循该变换过程。我们推出TraceViT,这是一种采用语义单调变换链训练的循环视觉推理器。我们通过重写和验证程序化任务实现来获取这些链,将每个解决方案分解为中间网格状态。每次迭代都由基于少样本演示的任务参考和代表当前网格状态的对象工作区提供支撑。由于这些链的长度可能与循环不同,软轨迹对齐仅强制其顺序,让模型可以自由分配迭代次数。TraceViT在ARC-AGI-1上的pass@2...
#1可解释性-性能系数的以人为中心验证
A Human-Centered Validation of the Explainability-Performance Coefficient
深度学习模型在高风险领域的快速普及,使得业界对可信可解释人工智能(XAI)的需求愈发迫切。然而,客观评估解释保真度、让XAI指标与以人为中心的认知相契合,仍是亟待解决的关键开放性难题。在本研究中,我们提出一种与模型无关的指标——EPC得分,它是可解释性-性能系数(EPC)的扩展形式,通过明确权衡特征...
#2FriendBench:人类与多模态大语言模型中的二元熟悉度推理基准测试
FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models
解读社交情境往往依赖行为,而非仅靠言语。我们推出FriendBench这一基准测试,旨在从一段20秒的双人破冰对话片段中,推断出两人本就相识还是初次见面。每一组对话双方都回答同一类提示问题,因此答案只能通过互动方式来揭示。我们基于96组平衡的双人配对,在文本、音频、视频三类模态下,将来自七家公司的2...
#3TraceViT:面向视觉抽象推理的基于锚定轨迹监督
TraceViT: Grounded Trace Supervision for Visual Abstract Reasoning
抽象与推理语料库(ARC)测试模型能否从少量输入输出示例中推断出未见过的变换,并将其应用于新网格。循环视觉推理器会在多次迭代中优化预测,但传统训练仅约束最终输出,使得中间优化过程不受约束。我们提出,这些优化反而应当逐步遵循该变换过程。我们推出TraceViT,这是一种采用语义单调变换链训练的循环视觉...
还有 77 篇论文
#1FriendBench:人类与多模态大语言模型中的二元熟悉度推理基准测试
FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models
解读社交情境往往依赖行为,而非仅靠言语。我们推出FriendBench这一基准测试,旨在从一段20秒的双人破冰对话片段中,推断出两人本就相识还是初次见面。每一组对话双方都回答同一类提示问题,因此答案只能通过互动方式来揭示。我们基于96组平衡的双人配对,在文本、音频、视频三类模态下,将来自七家公司的26个模型与匹配的人类专家组进行了对比。最优模型与人类群体在所有模态下的准确率在统计层面无显著差异,但二者达成该结果的方式不同:人类在两种判断结果间保持均衡,而表现最强的模型倾向于判断为“陌生人”——这是有效先验的差异,而非辨别能力的差异。更丰富的信息渠道对二者的帮助并不均等,只有人类能在言语之外借助...
#2ARB:面向AI文本检测器评估的匹配作者重写基准数据集
ARB: A Matched Authorship-Rewriting Benchmark Dataset for AI-Text Detector Evaluation
标准的AI文本检测基准会将人类撰写的文本与大型语言模型(LLM)直接生成的文本进行对比。尽管此前已有研究表明,重写和意译会降低检测器的性能,但目前尚不清楚,在这种传统基准上测得的性能能否预测当人类创作的内容被LLM重写时检测器的表现。为填补这一空白,我们提出了作者重写基准(ARB),该基准基于1800条人类源文本(分别来自XSum、WritingPrompts和OpenWebText,各600条)以及四个开源权重生成器(Llama-3.2-3B、Qwen2.5-7B、Mistral-7B、Gemma-2-9B)构建。每个源条目会生成四个匹配变体:人类撰写(HUMAN)、LLM直接生成(Free...
#3突厥语族语言机器翻译的跨语言迁移
Cross-Lingual Transfer for Machine Translation in Turkic Languages
跨语言迁移是低资源机器翻译的核心,但它在亲缘关系相近的语系内部的表现特征仍未得到充分阐释。我们使用成对迁移矩阵,研究土耳其语、阿塞拜疆语、乌兹别克语、哈萨克语和吉尔吉斯语这五种突厥语之间的迁移情况。在该设定下,每个模型仅使用一个迁移源进行微调,并在不同的迁移目标上进行评估,同时翻译目标保持不变。基于mT5的实验结果显示,亲缘关系极近的突厥语配对之间迁移效果最强,其中尤以土耳其语-阿塞拜疆语、哈萨克语-吉尔吉斯语为甚。我们还发现迁移方向会产生影响,且当翻译目标发生变化时,相同的迁移源-迁移目标配对也可能呈现不同的表现。在若干书写系统不匹配的场景中,拉丁化处理可提升BLEU值与chrF值,但其对不...
#1FriendBench:人类与多模态大语言模型中的二元熟悉度推理基准测试
FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models
解读社交情境往往依赖行为,而非仅靠言语。我们推出FriendBench这一基准测试,旨在从一段20秒的双人破冰对话片段中,推断出两人本就相识还是初次见面。每一组对话双方都回答同一类提示问题,因此答案只能通过互动方式来揭示。我们基于96组平衡的双人配对,在文本、音频、视频三类模态下,将来自七家公司的2...
#2ARB:面向AI文本检测器评估的匹配作者重写基准数据集
ARB: A Matched Authorship-Rewriting Benchmark Dataset for AI-Text Detector Evaluation
标准的AI文本检测基准会将人类撰写的文本与大型语言模型(LLM)直接生成的文本进行对比。尽管此前已有研究表明,重写和意译会降低检测器的性能,但目前尚不清楚,在这种传统基准上测得的性能能否预测当人类创作的内容被LLM重写时检测器的表现。为填补这一空白,我们提出了作者重写基准(ARB),该基准基于180...
#3突厥语族语言机器翻译的跨语言迁移
Cross-Lingual Transfer for Machine Translation in Turkic Languages
跨语言迁移是低资源机器翻译的核心,但它在亲缘关系相近的语系内部的表现特征仍未得到充分阐释。我们使用成对迁移矩阵,研究土耳其语、阿塞拜疆语、乌兹别克语、哈萨克语和吉尔吉斯语这五种突厥语之间的迁移情况。在该设定下,每个模型仅使用一个迁移源进行微调,并在不同的迁移目标上进行评估,同时翻译目标保持不变。基于...
还有 36 篇论文
#1LEMUR:基于偏好反馈的多目标强化学习对齐学习
LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback
强化学习(RL)系统通常采用单一、明确设定的标量奖励函数进行训练。但现实世界的决策任务往往涉及多个相互冲突的目标,例如性能与效率之间的权衡,而这类任务的真实奖励函数难以明确设定或无法获取。多目标强化学习(MORL)通过将奖励建模为向量来处理这类权衡问题,但现有方法通常假设可获取每个目标下明确设定的奖励函数,因而继承了单目标强化学习面临的同样挑战。与此同时,基于偏好的强化学习(PbRL)通过从人类反馈中学习奖励,无需预定义奖励函数即可完成复杂任务,展现出巨大潜力,但相关研究大多针对单目标场景展开。本研究中,我们提出LEMUR来填补这一空白,即基于偏好反馈学习对齐多目标强化学习的框架,这一全新框架...
#2FBFM:世界动作模型执行中流匹配的无训练异步反馈机制
FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action Models Execution
尽管世界动作模型(WAM)通过在行动前预测视觉演化来提升长程机器人控制效果,但长程可靠性需要基于真实观测进行反复重新校准,而非递归展开。现有WAM通过在数据块之间用真实数据刷新历史或键值缓存来解决这一问题。然而,这种分块反馈的时间粒度较粗,无法纠正单个时间步长层面的预测误差。为解决该问题,我们提出反馈流匹配(FBFM),这是一种无需训练的推理机制,可将重新校准过程嵌入到主动生成的数据块内部。在流匹配过程中,FBFM对条件速度场施加掩码伪逆校正:它利用前一个动作块引导下一个动作块的生成,并借助执行前一个动作块后观测到的图像引导下一帧预测。这种跨块配对——即一个数据块的反馈能及时抵达并影响下一个数...
#3CLIFT:通过非侵入式闭环迭代微调将Gemini机器人端侧能力转化为人形机器人专家
CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning
尽管机器人基础模型的能力日益增强,但性能最强的模型通常是基于专有数据训练且保持闭源,这限制了下游用户将其适配到新任务、新本体和新部署场景的能力。受大语言模型社区的启发,闭源权重机器人基础模型的一种新兴访问范式是托管式监督微调(SFT)API,用户提交训练数据后会收到调优后的策略,但无法访问模型权重、梯度或训练内部细节。这类API虽能让下游用户利用强大的专有基础模型,却将策略改进限制在纯模仿范围内,排除了强化学习及其他依赖内部训练信号的闭环方法。这一局限在敏捷、富含接触的人形机器人操作场景中尤为突出:由于新状态、动作跟踪动态、延迟以及控制器特有的故障模式,策略输出与部署后实际表现之间存在较大差距...
#1LEMUR:基于偏好反馈的多目标强化学习对齐学习
LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback
强化学习(RL)系统通常采用单一、明确设定的标量奖励函数进行训练。但现实世界的决策任务往往涉及多个相互冲突的目标,例如性能与效率之间的权衡,而这类任务的真实奖励函数难以明确设定或无法获取。多目标强化学习(MORL)通过将奖励建模为向量来处理这类权衡问题,但现有方法通常假设可获取每个目标下明确设定的奖...
#2FBFM:世界动作模型执行中流匹配的无训练异步反馈机制
FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action Models Execution
尽管世界动作模型(WAM)通过在行动前预测视觉演化来提升长程机器人控制效果,但长程可靠性需要基于真实观测进行反复重新校准,而非递归展开。现有WAM通过在数据块之间用真实数据刷新历史或键值缓存来解决这一问题。然而,这种分块反馈的时间粒度较粗,无法纠正单个时间步长层面的预测误差。为解决该问题,我们提出反...
#3CLIFT:通过非侵入式闭环迭代微调将Gemini机器人端侧能力转化为人形机器人专家
CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning
尽管机器人基础模型的能力日益增强,但性能最强的模型通常是基于专有数据训练且保持闭源,这限制了下游用户将其适配到新任务、新本体和新部署场景的能力。受大语言模型社区的启发,闭源权重机器人基础模型的一种新兴访问范式是托管式监督微调(SFT)API,用户提交训练数据后会收到调优后的策略,但无法访问模型权重、...
还有 23 篇论文
#1同策略交互何时起效?基于值函数的模仿学习中的表征权衡
When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning
模仿学习(IL)——即训练智能体从演示中复刻专家行为——是从机器人学到语言模型训练等各类应用的基础。众所周知,行为克隆(BC)这类标准方法存在误差累积和性能停滞的问题,尤其是在学习者无法完美表征专家策略时(这一情况十分常见,例如在知识蒸馏场景中)。经验层面普遍认为有两种干预手段可以提升性能:沿着学习者自身的轨迹交互式地向专家查询,以及在生成策略的过程中使用价值函数估计,而非直接拟合专家的完整动作分布。我们探究了这些性能提升的本质以及它们之间可能出人意料的相互作用。我们的核心发现是:与专家的交互能够放宽对学习者的表征要求——只需模型能够实现专家的价值函数即可,无需满足(通常更为严苛的)实现专家策...
#2TerraNova:人类世的基础模型
TerraNova: A Foundation Model for the Anthropocene
人类世的一个核心问题是将物理地球与人类社会建模为一个耦合系统,但目前尚无任何学习得到的表征能够覆盖二者的观测广度。我们认为这一障碍源于几何属性:物理地球的测量结果是无视政治边界的连续场,而社会数据则以行政单元为单位上报。现有地球系统基础模型适配第一种几何特征,若要将其与第二种几何特征耦合,则需要在边界上进行有损平均。我们提出了TerraNova这一基础模型,它基于1024条物理与社会领域的原生几何记录训练:包括512个网格化地球系统场与512项国家指标。专用编码器对位置、国家、时间和任务进行表征,跨模态Transformer将这些信息融合为共享的时空状态,超网络会生成一个针对查询的解码器,其证...
#3反事实解释的广义贝叶斯视角:基于后验的决策与评估
A Generalized-Bayes Perspective on Counterfactual Explanations: Posterior-Based Decision-Making and Evaluation
反事实解释(CE)通过确定使输入产生期望输出所需的最小变动,提升机器学习模型的可解释性。尽管反事实解释通常被构建为距离最小化问题,但这一构建方式的理论基础却鲜受关注。我们证明,基于距离最小化的反事实解释在数学上等价于广义贝叶斯框架内吉布斯后验的最大后验(MAP)估计——具体而言,是在采用基于距离的先验时。我们将这一构建方式称为距离先验广义贝叶斯反事实解释(DP-GBCE)。基于这一后验视角,我们在统一框架下提出了两种超出最大后验范畴的决策规则:一种是最小化期望决策损失的贝叶斯决策,另一种是风险厌恶型决策规则CVaR-CE。我们还提出了一种扩展方案,利用贝叶斯模型权重混合多个模型的后验分布,从而...
#1同策略交互何时起效?基于值函数的模仿学习中的表征权衡
When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning
模仿学习(IL)——即训练智能体从演示中复刻专家行为——是从机器人学到语言模型训练等各类应用的基础。众所周知,行为克隆(BC)这类标准方法存在误差累积和性能停滞的问题,尤其是在学习者无法完美表征专家策略时(这一情况十分常见,例如在知识蒸馏场景中)。经验层面普遍认为有两种干预手段可以提升性能:沿着学习...
#2TerraNova:人类世的基础模型
TerraNova: A Foundation Model for the Anthropocene
人类世的一个核心问题是将物理地球与人类社会建模为一个耦合系统,但目前尚无任何学习得到的表征能够覆盖二者的观测广度。我们认为这一障碍源于几何属性:物理地球的测量结果是无视政治边界的连续场,而社会数据则以行政单元为单位上报。现有地球系统基础模型适配第一种几何特征,若要将其与第二种几何特征耦合,则需要在边...
#3反事实解释的广义贝叶斯视角:基于后验的决策与评估
A Generalized-Bayes Perspective on Counterfactual Explanations: Posterior-Based Decision-Making and Evaluation
反事实解释(CE)通过确定使输入产生期望输出所需的最小变动,提升机器学习模型的可解释性。尽管反事实解释通常被构建为距离最小化问题,但这一构建方式的理论基础却鲜受关注。我们证明,基于距离最小化的反事实解释在数学上等价于广义贝叶斯框架内吉布斯后验的最大后验(MAP)估计——具体而言,是在采用基于距离的先...
还有 6 篇论文
#1基于动态交互场的结构化隐层与向量吸引子式SILVA网络
SILVA Networks as Structured Implicit Layers and Vector Attractors via Dynamic Interaction Fields
许多学习问题需要能协调直接输入、邻近结构与更广上下文的表征。在隐式神经层中,这些影响通常被整合到单个定点更新中,导致难以区分哪些信息来自刺激、哪些在本地传播、哪些来自全局上下文,以及哪些由求解器动态过程产生。在此我们介绍SILVA网络,即通过动态交互场实现的结构化隐式层与向量吸引子网络。SILVA在同一个定点架构内分离了刺激、本地交互、全局交互、阻尼与读出环节。通过针对节点、邻域与全局摘要的领域专属定义,同一模板可被实例化用于图像、分子、引文网络以及长程图基准测试。实验与消融实验表明这些项具有任务依赖的作用:本地交互在图任务中承担核心作用,在测试的容量下MNIST几乎无法从循环中获益,而最显著...
#1基于动态交互场的结构化隐层与向量吸引子式SILVA网络
SILVA Networks as Structured Implicit Layers and Vector Attractors via Dynamic Interaction Fields
许多学习问题需要能协调直接输入、邻近结构与更广上下文的表征。在隐式神经层中,这些影响通常被整合到单个定点更新中,导致难以区分哪些信息来自刺激、哪些在本地传播、哪些来自全局上下文,以及哪些由求解器动态过程产生。在此我们介绍SILVA网络,即通过动态交互场实现的结构化隐式层与向量吸引子网络。SILVA在...
#1基于图神经网络的最优动态匹配学习
Learning Optimal Dynamic Matching via Graph Neural Networks
动态匹配市场需要就匹配对象与匹配时机做出决策:当下完成匹配可获取价值,但会移除那些可能在未来创造更好机遇的参与者。针对有限且不断演化的加权图上的该问题,我们开发了一套基于价值的强化学习框架。我们研究了一个包含随机到达、节点类型转换、边生成与外生退出的无限时域连续时间模型。我们证明了事件时间归约:在不损失最优性的前提下,规划者会在每一次外生事件发生后立即采取行动,随后等待下一次事件。我们进一步证明,最优的逐边Q函数可由决策后残差图上的单一延续价值函数刻画,从而将学习对象从状态-动作值简化为图值。精确动作选择仍需组合匹配优化;我们用图神经网络近似该价值,通过时间差分学习对其训练,并将其用于前向贪心...
#1基于图神经网络的最优动态匹配学习
Learning Optimal Dynamic Matching via Graph Neural Networks
动态匹配市场需要就匹配对象与匹配时机做出决策:当下完成匹配可获取价值,但会移除那些可能在未来创造更好机遇的参与者。针对有限且不断演化的加权图上的该问题,我们开发了一套基于价值的强化学习框架。我们研究了一个包含随机到达、节点类型转换、边生成与外生退出的无限时域连续时间模型。我们证明了事件时间归约:在不...