作者丨陆毅 陈淑瑜
编辑丨岑峰
“IJCAI/AAAI在推理、规划、知识方面是最顶级的,这几个方向也是AI当下急需的。”
2019年,南京大学俞扬教授在一场关于 AI 顶会评级的讨论中写下了这句话。
彼时大语言模型尚未爆发,“推理”一词在AI社区远不如今天这般炙手可热。七年过去,当 DeepSeek-R1 用强化学习激发推理链、当 AlphaGeometry 用符号引擎超越 IMO选手、当整个行业开始反思“大模型到底会不会推理”时,俞扬教授的判断反而显得更具前瞻性。
IJCAI 是否在推理、规划、知识方面是最顶级的呢?AI科技评论以IJCAI-ECAI 2026的最新论文阵容为证据,从宏观格局和具体论文两个层面,验证“IJCAI在推理、规划、知识方面是最顶级的”这一观点在当下是否仍然成立。
01
IJCAI-ECAI 2026将于8月15日至21日在德国不来梅举行,这届IJCAI将与第29届 ECAI 欧洲人工智能会议联合举办。
自1974年首届会议在英国布莱顿举办以来,ECAI一直是欧洲符号AI与知识工程研究的传统主场,ECAI 2024的 proceedings 描述中曾明确指出,ECAI 的覆盖领域明确包括"planning, search, constraints, satisfiability, knowledge representation"——这些正是符号主义AI的核心领地。
当IJCAI与欧洲符号 AI 的传统主场的 ECAI 联合举办时,“推理、规划、知识”在会议基因里的地位便被双重强化。这是学术传统自然汇流的结果。
而从数量上看,IJCAI对推理、规划、知识方向的投入是实打实的。
根据目前已有的IJCAI 2026公布情况,AI科技评论预估本次IJCAI 总投稿数超过5400篇,目前总录用论文数990篇,录用率约18%。
根据IJCAI 2026公开的main-track统计,"Knowledge Representation and Reasoning"共有67篇,"Planning and Scheduling"有32篇论文,换言之,仅这两个核心方向就占据了IJCAI-ECAI 2026 main-track录用论文的13.3%。
如果将"Constraint Satisfaction and Optimization"与"Search"这两个与推理/规划同源、同样隶属于符号AI传统的方向一并计入,则推理、规划、知识方向的论文集群合计达148篇,占比约20.8%。也就是说,每五篇IJCAI论文中,就有一篇属于符号推理这一谱系。
更重要的是,这些方向不仅数量稳定,而且质量突出。
翻看IJCAI近年的杰出论文奖名单,推理/规划/知识方向的论文反复出现:
注:IJCAI每年评选3篇杰出论文奖,上图仅选取与推理/规划/知识方向直接相关的获奖论文,未列出的其他获奖论文涉及优化、公平性、推荐等方向。
上表九篇论文全部直接涉及推理、规划或知识表示。如果说录用数量说明的是“广度”,那么杰出论文奖反复花落此领域,说明的是“深度”。
02
俞扬教授所说的“推理”指的是符号推理——基于逻辑规则、知识表示的演绎推理。到2026年,这一方向在IJCAI不仅没有萎缩,反而因为大语言模型的兴起获得了新的生命力。
以下三篇IJCAI-ECAI 2026录用论文勾勒了这一趋势。
▎神经决策传播:让ASP在连续域中“可微”
Answer Set Programming是知识表示与推理的核心形式化工具之一,但将其与神经网络集成时,长期面临一个工程瓶颈:现有方法(如NeurASP、SLASH)的推理流水线依赖经典ASP求解器,神经网络的连续输出必须先被“翻译”成离散的符号原子,再交给求解器处理。
这一连续-离散转换引入了组合爆炸问题,也使整个系统无法利用 GPU 的并行计算能力。维也纳理工大学的Thomas Eiter、日本国立信息学研究所的Katsumi Inoue与Sota Moriyama在IJCAI-ECAI 2026上提出的Neural Decision-Propagation方法,正是为打破这一瓶颈而生。
论文链接: https://arxiv.org/abs/2605.01797
代码:https://github.com/sotam2369/NDProp
NDProp架构——Decision-Propagation (DProp) 迭代管线与神经化扩展
他们首先设计了一种全新的稳定模型计算方法——Decision-Propagation ,其核心思想是在原子级别交替进行“假值决策”与“真值传播”:每一步选择一个尚未决定的原子,将其暂定为假,然后传播其逻辑后果,直到所有原子都被确定。论文严格证明了成功的DProp计算恰好捕获稳定模型语义。
在此基础上,NDProp将DProp扩展为可微版本,也就是用循环神经网络替代离散的假值决策,用模糊逻辑算子替代真值传播,使得整个ASP求解过程可以在连续域中进行端到端训练。当输出为二值时,NDProp的运算等价于DProp,这意味着用强制二值输出的损失函数训练NDProp,本质上就是迫使网络学会输出稳定模型,并且无需任何监督信号。
实验结果令人瞩目。在 MNIST 算术推理任务上,NDProp 准确率全面超越NeurASP 和 SLASH,平均推理速度比 NeurASP 快约42倍、比 SLASH 快约7倍。在不完整数据的视觉数独任务中,NDProp 在所有数据量设置下均优于纯ASP和纯神经方法,兼得了符号推理的精确性与神经网络的鲁棒性。
NDProp在MNIST算术推理与视觉数独任务上的实验结果对比
这篇论文的意义在于:它将ASP的求解过程本身“神经化”,为神经符号AI打开了一条真正端到端的技术路径,避免了简单地在ASP外部附加神经网络的做法。
▎LLM进化SAT求解器:大模型加速符号推理
SAT 求解是组合推理的核心基础设施,但现代 SAT 求解器已极其精密复杂,人类专家很难再手动实现显著改进。IJCAI-ECAI 2026录用的论文"Bridging LLMs and SAT Solving: Automated Evolution of High-Performance Heuristics"提出了一个大胆的思路:让大语言模型自动进化SAT求解器的启发式函数。
论文链接: https://2026.ijcai.org/accepted-papers?ijtrack=main-track
AESAT项目:https://github.com/FSQH-dh/AESAT
作者设计了AESAT框架,采用混合专家架构,让GPT-4.5负责创意生成,Claude 3.7负责代码实现,DeepSeek-R1负责逻辑分析与进化交叉,三者协同迭代优化 SAT 求解器的分支启发式。框架还具备自优化提示词的能力,能从历史性能数据中学习以避免重复错误。
衍生求解器AE-Kissat-MAB在2025年国际SAT竞赛主赛道以绝对优势夺冠,这是一个标志性的"LLM→Symbolic"案例:大语言模型扮演了符号推理引擎的“进化加速器”角色,在人类专家已接近瓶颈的领域实现了突破。
▎让AI学会“抽象”:ASP的泛化推理基础
在IJCAI-ECAI 2026的Early Career Spotlight环节,Zeynep G. Saribatur将带来题为"Towards Reasonable AI: Foundations for Abstraction and Generalized Reasoning"的报告。
来源:https://2026.ijcai.org/accepted-papers/?ijtrack=early-career-spotlight
Saribatur个人主页:https://www.dbai.tuwien.ac.at/user/saribat
她的研究聚焦于一个根本问题:人类推理依赖抽象和泛化,但AI系统如何获得这种能力?
Saribatur 选择在 ASP 这一符号AI核心形式化框架中发展形式化的抽象方法,既能简化推理表示又不丢失关键解的性质,同时支持计算效率的提升和人类对 AI 决策过程的理解。
这项工作在IJCAI 2026上同时以多篇论文形式出现,她与CRIL实验室合作的"Abstracting the Indistinguishable in ASP"也在主 track 录用,这样意味着抽象推理这一基础方向在IJCAI的版图中占据着不可忽视的位置。
03
规划是IJCAI的传统强项。从2019年到2026年,规划研究经历了一次范式拓展:经典PDDL式规划依然活跃,但LLM驱动的混合规划成为新的增长极。IJCAI-ECAI 2026的录用论文清晰地展现了这一趋势。
▎DUPLEX:让LLM做它擅长的,让符号规划器做它擅长的
大语言模型为机器人任务规划带来了语义灵活性,但其幻觉和逻辑不一致的弱点严重制约了在长时间域任务中的可靠性。
东北大学与美的集团联合在IJCAI-ECAI 2026上发表的论文"DUPLEX: Agentic Dual-System Planning via LLM-Driven Information Extraction"提出了一种精巧的分工策略:将LLM严格限制在结构化语义信息的提取上,避免让其承担端到端规划的职责。
来源:arXiv:2603.23909 https://arxiv.org/abs/2603.23909
DUPLEX采用双系统架构。快速系统中,轻量级LLM从自然语言指令中提取实体、关系等信息,确定性地映射为PDDL问题文件,再交给经典符号规划器求解。当规划失败时,例如提取的信息不完整或存在歧义,慢速系统激活,利用求解器返回的诊断信息驱动高容量LLM进行迭代反思和修复。
DUPLEX的双系统架构
这种设计背后的洞察十分清晰:将LLM限制在其擅长的部分,并将逻辑计划合成留给符号规划器。在12个经典和家庭规划领域上的广泛评估中,DUPLEX在成功率和可靠性方面显著优于现有的端到端和混合LLM基线,验证了“各司其职”比“全包大揽”更有效。
▎实时多机器人运动规划:经典搜索与机器学习的联姻
在工业场景中,多机器人在共享空间中的运动规划是一个计算挑战。Amazon的研究团队在IJCAI-ECAI 2026上发表了"Real-Time Multi-Robot Motion Planning with Safe-Interval Search and Learning-Guided Repair",提出了SIPP-PP-LNS框架。
来源: https://www.amazon.science/publications/real-time-multi-robot-motion-planning-with-safe-interval-search-and-learning-guided-repair
该框架采用两阶段算法:第一阶段使用优先级安全区间路径规划(SIPP-PP)快速生成初始无碰撞轨迹,并引入了一种新颖的有限目标预留策略来防止目标阻塞冲突;第二阶段利用XGBoost引导的大邻域搜索(LNS)在高度拥挤环境中智能选择冲突解决方案。
这种经典搜索与机器学习的结合产生了惊人的效率——相比最近先进的基于学习的方法,如扩散规划器,该规划器快了两到三个数量级,能在数十毫秒级别内为多个机器人生成无碰撞路径,满足仓储自动化等工业应用的严苛实时要求。
这项工作展示了一个重要趋势:在规划领域,经典搜索算法通过与机器学习的深度融合焕发新的活力。
… Trimmed for readability. Visit the source for the full article.
Extracted and lightly reformatted for readability. · Source: zh
