Skip to main content
Aggregate 雷锋网 人工智能 19 Aug 2026 - 14:30

纳须弥,于芥子:大模型之后,中国厂商正在把大模型塞进复杂系统 | IJCAI 2026 前瞻

RSS 官方收录 · 可信分层展示

关键摘要

小小模型容器和巨大的智能世界。…

  • 作者丨吴思梦 编辑丨岑 峰 1986年,MIT 教授,也是 MIT Artificial Intelligence Laboratory 的…
  • 四十年后的大模型已经拥有了工具调用、记忆、视觉理解和行动能力。
  • 产业界的热词从“涌现”变成“Agent”,从“对齐”走向“Computer Use”。

摘要引擎:抽取

正文提要

小小模型容器和巨大的智能世界。

    作者丨吴思梦

    编辑丨岑   峰

                                                                                                       

1986年,MIT 教授,也是 MIT Artificial Intelligence Laboratory 的重要创始人之一的Marvin Minsky 出版《The Society of Mind》,提出了一个后来影响深远的想法:所谓“智能”,并不一定来自某一个无所不能的“大脑”,而可能来自许多不同的 agents,通过分工、连接和协作共同产生。

四十年后的大模型已经拥有了工具调用、记忆、视觉理解和行动能力。产业界的热词从“涌现”变成“Agent”,从“对齐”走向“Computer Use”。但技术真正面对的问题并没有因此改变:当一个模型不再只是回答问题,而是需要规划任务、调用工具、获得反馈、调整策略,它最终还是要回答那个并不新鲜的问题——下一步做什么。

只是今天,我们似乎终于有了一个足够强的“通用组件”,可以把这些过去分散的问题重新组织起来。

今天,IJCAI 将在德国不来梅(Bremen)召开。如果观察今年大会的议程结构和重点活动,Agent、Multi-agent、Robotics、Reinforcement Learning 等关键词都格外醒目。

有意思的是,它们并不是大模型时代才出现的新问题。

规划、决策、多智能体协作、机器人控制,这些研究已经存在了几十年。过去,它们往往属于不同的研究传统,有自己的算法、数据和评价体系;而今天,一个拥有强大语言理解和推理能力的大模型,正在试图进入这些系统。

这恰好也是观察中国 AI 产业的一个窗口。过去两年,国内 AI 最激烈的竞争是“谁的模型更强”。但到了今年,真正值得观察的问题可能正在发生变化:当模型能力越来越接近底座,谁有能力把它放进一个足够复杂的系统里?

这里其实可以借用一个古老的意象。

在佛教典故中,“须弥山”是巨大之物,“芥子”则小到几乎可以忽略,于是有了“纳须弥于芥子”——在极小之中容纳巨大的世界。

今天的大模型正在做的事情,某种意义上也像这般。

过去,规划是规划系统的问题,知识是知识库的问题,工具是工具系统的问题,记忆是另一套系统的问题,决策又是另一套问题。今天,一个大模型开始成为这些能力重新组织的核心载体:它理解任务,决定调用什么工具,读取什么知识,记住什么信息,再根据环境反馈调整下一步行动。

这不是把整个 AI 塞进一个模型,而是把过去分散的智能能力,重新收束进一个可以理解、调用和协作的系统。

图片

01


阿里给 Agent 造技能,

字节给 Agent 制造经验

如果说过去两年国内 AI 企业竞争的是模型能力,那么今年更值得关注的是:它们正在如何补齐 Agent 的能力缺口。

阿里和字节正在走出两条不同路线。

阿里更像是在给 Agent 制造“技能”。Qwen-CUA 正在把模型推进到 Computer Use 阶段:模型不再依赖网页结构或专用接口,而是通过观察屏幕、操作鼠标和键盘完成任务。

与此同时,Qwen DianJin 则针对金融 Agent 场景,把能力拆解为 Process Reward Model、工具调用和 Skill Library 等模块。其中 Fin-PRM 已被 IJCAI 2026 接收。

这些工作背后体现的是一种工程思路:大模型能力不能只是一个黑盒,而需要被拆解、评价、训练和复用。换句话说,阿里正在尝试给 Agent 建立一套可以调用的“技能体系”。

字节则关注另一个问题:Agent 从哪里获得经验?

ByteDance Seed 团队在 IJCAI 2026 的 GUI-ReWalk 工作,关注如何大规模生成 GUI Agent 的训练轨迹。通过随机探索、意图推理、反思和错误恢复,让 Agent 获得更多真实操作经验。

这实际上触及了 Agent 发展的一个关键瓶颈:未来限制 Agent 能力的,可能不只是模型规模,而是高质量行动数据从哪里来。

阿里解决的是“Agent 会什么”。

字节探索的是“Agent 怎么学会”。

而这两条路线最终指向同一个问题:下一代 AI 的竞争,可能越来越依赖 trajectory data、environment interaction 和 reinforcement learning,而不仅仅是参数规模。

模型进入旧系统:百度、腾讯和华为的另一条路线

图片

02


模型进入旧系统:

百度、腾讯和华为的另一条路线

另一类企业并不是从模型向外寻找应用,而是把模型塞回已有业务系统。

百度是一个典型案例。过去十几年,搜索、地图、知识图谱构成了百度最大的基础设施。Agent 时代,这些能力正在重新变得重要。

MapAgent 展示了一个方向:它并不是简单给地图接入一个聊天机器人,而是把视觉模型、约束推理、Planner、工具调用和结果验证组合进地图生产流程。

与此同时,百度地图也正在尝试将地点检索、路线规划、实时路况等能力封装成可被 AI 调用的服务。

对于 Agent 来说,模型只是认知层。真正让它进入现实世界的,是背后的数据、知识和业务系统。

腾讯则代表另一种可能。推荐、搜索、用户关系、图学习、多智能体研究,这些是腾讯 AI 长期积累的基础。大模型并没有替代这些系统,反而可能重新吸收它们。

一个真正进入互联网产品的 Agent,需要的不只是语言能力,还需要理解用户、预测需求、连接信息和进行实时决策。

华为则更多出现在系统基础设施的一侧,AI 科技评论此前做过华为 IJCAI 2026 论文盘点:https://mp.weixin.qq.com/s/fsIU0oSOb-r233GO3WTcUA。华为研发人员参与组织 IJCAI-ECAI 2026 的 GenAIK-NORA Workshop,该 Workshop 聚焦知识图谱、Agent memory、planning、tool use 和 multi-agent coordination。

国产模型越来越多之后,模型、算力、终端和工业场景如何形成完整闭环,可能是华为需要回答的问题,也是国产 AI 产业链共同面对的问题。

另一方面,复旦团队参与的《Reward Hacking in the Era of Large Models》则关注另一个风险:当模型通过奖励机制学习行动策略时,如何避免它只优化指标,却偏离真正目标。

这对 Agent 尤其重要。聊天机器人回答错误,影响有限;但如果一个 Agent 在金融交易、代码开发或物流调度中连续行动,错误的奖励信号可能带来更复杂的问题。

清华大学 IJCAI Tutorial 讨论的 scalable intelligence under limited supervision,也指向类似方向:未来模型能力提升,不一定只是依靠更多数据和更大算力,还需要 interaction、experience reuse 和 adaptive learning。这与产业界正在探索的 Agent 技能和经验积累形成呼应。

推理和规划没有过时,它成了大模型的“系统零件”

图片

03


推理和规划没有过时,

它成了大模型的“系统零件”

“降级后的 IJCAI 依然是推理、规划类的主场”。如果从今年 IJCAI 的奖项和议程看,这个判断并不意外。

推理和规划确实从未离开过 AI 学术界的主舞台。IJCAI 2026 的 Research Excellence Award 颁给了 Nicholas Jennings,表彰他在 multi-agent coordination、human-agent teamwork 和 autonomous agents 方面的工作;John McCarthy Award 则授予 David Parkes,表彰他在 AI 与经济学交叉领域的机制设计研究,尤其关注多智能体环境中的效率、公平与激励一致性。

更有意思的是,Jennings 的获奖演讲本身就叫《The Past, Present and Future of Agentic AI》。在他看来,Agent 的下一阶段并不只是继续把单个 Agent 做得更强,而是合作、协调、谈判和集体决策。

这些研究议题的年龄,甚至比当下大多数大模型公司创始人的创业史长得多。

但变化在于:这些“老问题”正在被大模型重新激活。推理不再是独立的学术课题,而成了 Agent 调用工具时的一个模块;规划不再是搜索树上的算法竞赛,而成了大模型在复杂任务中分解目标的中间步骤。2025年 DeepSeek 把国内产业的注意力进一步推向 reasoning、RL 和 test-time compute,但如果说“让模型想得更久”只是起点,那么从 reasoning 到 planning,从 planning 到 tool use,从 tool use 到 environment interaction,再到 reward——这条技术链条的终点,与其说是一个更大的模型,不如形容为一个更完整的系统。

推理和规划没有过时。它们只是开始重新成为大模型的“系统零件”。

图片

04


模型之后,AI 开始进入真实世界

如果说 Agent 解决的是数字世界中的行动问题,那么 Physical AI 试图解决的,就是现实世界中的行动问题。两者看似不同,底层面对的其实是同一个问题:如何让 AI 不只是理解世界,而是在世界中采取行动。

今年 IJCAI 2026 的 Computers and Thought Award 颁给 Jiajun Wu,主题是“Building Visual and Physical Intelligence Through Code”。他的研究关注计算机视觉、生成式 AI 和机器人智能之间的结合。

Physical AI 并不是大模型时代突然出现的新赛道。感知、规划、控制、决策,本来就是 AI 研究几十年来一直试图解决的问题。变化在于,大模型提供了一层新的认知能力:它让机器人系统第一次拥有了更强的语义理解、任务分解和复杂推理能力。

这也是为什么今年 IJCAI 的多个重要议题都重新聚焦 Agent、多智能体和物理智能。这些并不是大模型创造的新问题,而是 AI 长期探索的问题,在今天重新获得了产业关注。

对于国内模型公司来说,类似的问题也正在出现:如果模型能力逐渐成为基础设施,下一步卖什么?

智谱正在探索从模型向 Agent 基础设施延伸,将模型、企业知识库、MCP、工具调用和行业场景结合。智源研究院则更关注开放生态,希望推动 Foundation Model、Agent、Embodied AI 和开源研究的发展。

而美团、滴滴这类拥有真实业务环境的平台企业,也值得关注。配送调度、路径规划、供需预测,本身就是优化、规划和强化学习长期研究的问题。

未来最早让 Agent 面对复杂环境的,未必是模型公司,而可能是拥有真实世界数据和反馈闭环的平台企业。

这背后对应的是一个更深层的变化:大模型正在推动 AI 从 prediction 走向 intervention。 Agent 时代需要回答:“接下来应该做什么?”

Judea Pearl 的因果推理长期强调 prediction 与 intervention 的区别。预测世界只是智能的一部分,真正的智能系统还需要理解行动带来的后果。

当模型开始调用工具、制定计划、操作电脑,甚至控制机器人时,它面对的已经不只是语言生成问题,而是现实世界中的连续决策问题。

今年 IJCAI 的议题正在重新连接过去几十年的 AI 研究方向:Agent、Multi-agent、Robotics、Reinforcement Learning、Neuro-symbolic AI。

它们之间新的连接点,就是大模型。如果过去两年中国 AI 的关键词是模型能力,那么接下来真正值得观察的,可能是系统能力。

模型越来越像底座。

竞争,正在向模型之外扩散。


雷峰网转载

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了 IJCAI 2026 参会群!进群你会解锁这些「福利」?

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

? 进群传送门: 扫码进群或添加微信Qvv0909777,备注:IJCAI + 单位/学校+姓名+方向

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

扫描上方二维码

或点击阅读原文关注专区。

打开官方原文 站点原文页 可信分区 本信源更多 今日简报 分享图 RSS 稍后再看列表