中国政策档案 Governance Archive HOLDINGS 234,771 · FONDS 122
Record · qbitai ACC. 900072400

Beijing Says Agents Can Already Build Worlds, Hangzhou Says It's Just a Newly Invented Light Bulb

北京说Agent已经能造世界,杭州却说它是刚发明的电灯泡

Issuer
Date
2026-07-25
Instrument
other
Cited by
0
A media report from QbitAI covering contrasting views on AI agent development presented at a technology festival, where industrial practitioners in Beijing highlight practical applications while academic experts in Hangzhou caution that agent technology is still in its early stages, akin to the invention of the light bulb.
Full text · 原文 7,359 字
金磊 发自 凹非寺<br> 量子位 | 公众号 QbitAI<br> 你敢相信么,现在的AI,已经把“横店”给直接搞到了线上了!<br> △图片由AI生成<br> 以后啊,人要进横店拍戏,可能就会出现两种方式了。<br> 一种是像以前一样,本人肉身进剧组;另一种,则变成了坐在电脑前,进入线上虚拟片场,在数字化的影棚中调度人物、道具和摄像机,完成影视创作。<br> 这便是在阿里硬核少年技术节5.0博见社北京工业场中,群核科技所分享出来的颇为有趣的案例。<br> 据介绍,相关团队将横店的部分线下片场扫描、重建,并放到线上作为3D影视基地,创作者可以直接进入这些虚拟片场,使用数字化影棚进行内容生产。<br> 毕竟之前我们还在聊的是AI生成视频,而现在,它已经开始把真实片场搬进电脑了。<br> 不过更有意思的,还在后面。<br> 今年,硬核少年技术节旗下的博见社首次设置了两场对话。一场是我们刚才提到的北京工业场,它的主题是“AI下一站:从生成内容到构建世界”,虎鲸文娱、美图、群核科技等企业带来了AI产业实践。<br> 而杭州学术场,则联合CCF人工智能与模式识别专业委员会,邀请来自清华大学、南京大学、上海交通大学、天津大学、山东大学和上海人工智能实验室等机构的学者,讨论“从生成式AI到智能体进化”。<br> 从北京这边的分享来看,AI已经开始进片场、组团队、搭建三维世界;但当麦克风给到杭州那边,却有人站出来“唱反调”。<br> 在杭州场的圆桌讨论中,有人用电力革命类比今天的Agent:<br> 当前的Agent大概只相当于电灯泡刚刚被发明出来,确实比蜡烛好了一些,但电力后来催生的电网、电机、家用电器,以及一系列过去从未出现过的新事物,我们今天还没有真正看到。<br> △硬核少年技术节5.0博见社杭州学术场<br> 相隔一千公里的北京和杭州、工业圈和学术圈,怎么会对Agent的观点如此南辕北辙?<br> △图片由AI生成<br> 杭州学术场:Agent发展像电灯泡<br> 我们先来看下杭州学术场这边。<br> 在正式进入讨论之前,南京大学教授高阳在致辞中提到,从早期的逻辑智能体、强化学习智能体,到今天的大模型智能体,AI正在把曾经的哲学设想一步步带入工程现实。智能体在底层能力、工程框架、可靠性与安全性上还有许多问题没有答案。此次博见社让学术前沿与产业真问题相遇,共同寻找智能体的下一步。<br> 而从现场来看,与会嘉宾们首先针对一个非常现实的问题展开了讨论——<br> Agent究竟发展到哪一步了?<br> 对于这个问题,有一说一,嘉宾们其实没有给出统一的答案。毕竟今天大家口中的Agent,本身就包含了完全不同的形态;如果观察维度不同,得到的判断自然也会不同。<br> 比如从应用能力看,天津大学教授、国家优青郝建业认为,Coding Agent已经很难再被简单划入初期。原因是,它们已经能够接手相当一部分过去由程序员完成的具体工作,这种替代并不只存在于演示视频里,而是在真实业务中逐渐发生。<br> △天津大学教授、国家优青,郝建业<br> 但如果把视角转向底层技术,郝建业给出的判断又会谨慎许多:<br> 今天Agent能力的提升,仍然高度依赖基座模型;至于agent架构设计的很多思想理念比如MAS、Loop Engineering等概念,学术界其实早已研究多年。只不过在强基模出现以后,这些过去无法发挥性能的技术路线,终于获得了进入大规模应用的机会<br> 换成具身智能,进度条又要往回拉。<br> 机器人进入现实世界后,需要同时处理视觉、空间、物体、动作以及环境中的各种突发变化。实验室里完成一次流畅演示,与进入工厂、家庭后长期稳定工作,完全是两个难度等级。<br> 再往前一步,真正能够像人和动物一样,在开放世界里不断学习、自己发现问题、自己设置目标的Agent,甚至被现场嘉宾判断为处在“比初期更早”的位置。<br> 这种Agent目前缺乏成熟的理论和方法。持续学习过程中,还会遇到灾难性遗忘、模型可塑性不足等问题。换句话说,模型可能学会了新的东西,却把旧能力忘掉;即便持续给它新的经验,它也未必能够无限吸收。<br> 这么看下来,Agent并没有一条统一的进度条。<br> 在代码、检索等数字空间中,它已经能够完成一些相当复杂的工作;到了现实世界,稳定性和泛化能力立刻成为难题;至于持续自主学习,很多最基础的问题还没有答案。<br> 在发展阶段之外,现场的第二个争论更加尖锐:<br> 从生成式AI走到Agent,究竟是量变,还是质变?<br> 多数嘉宾的判断偏向量变。<br> 在他们看来,今天Agent能够执行更长的任务,主要得益于基模能力增强、上下文窗口变长、工具调用更加稳定,以及Harness持续优化。能力确实在提升,但底层技术范式还没有发生明显变化。<br> 真正的质变,应该发生在Agent能够突破基座模型原有能力上限之后。<br> 与会嘉宾对此给出了比较清晰的标准:<br> Agent要能够判断自己的结果是否正确,发现问题后主动修正,并将任务执行过程中产生的经验沉淀下来,形成自我进化。只有跨过这一步,它才算从依赖人类数据和预设流程,走向真正的自主学习。<br> 不过,山东大学教授韩忠义从产品形态出发,给出了另一种观察。<br> 过去的生成式AI主要负责回答问题,而Agent已经开始规划任务、调用工具,甚至直接替人完成工作。从“告诉你该怎么做”,走到“它自己动手去做”,无论底层技术是否发生范式变化,用户感受到的产品形态确实已经不同。<br> 上海人工智能实验室青年研究员张航帆,则把这两种观点接到了一起。<br> 在他看来,技术进步通常是一小步一小步积累起来的,很难在某个精确时间点突然发生指数级跃迁;可当一项能力的成功率跨过临界点时,用户的体验会突然发生改变。<br> 比如一项任务,过去执行一百次只能成功一次,现在一百次只失败五次。站在技术演进角度看,这是持续量变;站在用户角度看,它已经从“不可用”变成了“可以交给它做”,这当然可以被理解为质变。<br> △上海人工智能实验室青年研究员,张航帆<br> 顺着这个逻辑,现场的第三个问题也就自然出现了:<br> Agent真正获得自我进化能力,到底还缺什么?<br> 杭州场的四场主题报告,刚好从不同角度拼出了答案。<br> 郝建业关注的是工具调用、长期任务、记忆和安全。工具让Agent从聊天框进入真实环境,记忆让它能够把一次任务中的经验带到下一次任务,而安全则决定它能否进入生产系统,承担真正有风险的工作。<br> 所以在郝建业看来,Agent的价值并不只体现在单次生成能力上,更重要的是,它能否持续调用工具、沉淀经验,并在安全边界内完成长时间协作。<br> 上海交通大学人工智能学院长聘教轨副教授温颖,则把问题放进了持续强化学习。<br> △上海交通大学人工智能学院长聘教轨副教授,温颖<br> 人工提供的高质量数据总会遇到上限,模型要继续进步,就需要形成“生成—评估—训练”的循环:自己产生新的经验,再从中筛选有效部分,用于下一轮更新。<br> 但大语言环境与传统强化学习有一个明显区别。传统强化学习通常把策略、环境和评价信号分开处理,而在大语言模型里,同一套参数可能同时参与行动、推理和评价。策略、环境模型和验证器彼此耦合,任何一处更新都有可能影响其他环节,训练自然也更容易产生波动。<br> 清华大学智能产业研究院副研究员周浩,则把大规模Agent系统所需的能力归纳成三项:<br> 第一是低时延基座模型,支撑高频搜索、决策和执行;第二是自演化强化学习,让Agent可以根据反馈持续优化;第三是可学习的长程记忆,让它在跨上下文、跨任务时维持状态,形成长期协作。<br> △清华大学智能产业研究院副研究员,周浩<br> 张航帆关注的,则是最近越来越频繁出现在Agent领域的另一个词——Harness。<br> 通俗理解,Harness是一套围绕大模型搭建的任务执行框架。它负责理解目标、拆解任务、管理上下文、调用工具,并根据环境反馈调整接下来的动作。<br> 如果把基座模型看作一个聪明的大脑,Harness更像负责组织工作的执行系统。没有这套系统,Agent可能知道很多,却很难稳定完成一项持续数小时甚至数天的复杂任务。<br> 而张航帆进一步研究的Self-Harness,则是希望Agent能够自动诊断和优化自己的运行框架。也就是说,未来Agent不仅要完成任务,还要逐渐学会改进自己完成任务的方式。<br> 把这些问题放到一起,会发现杭州学术场真正关心的,已经超出了“Agent能不能干活”。<br> 它还要知道自己干得对不对,哪里出了问题;一次任务结束后,哪些经验值得保留,哪些能力应该更新;更进一步,它要能够把执行过程产生的反馈,转化成下一轮能力增长。<br> 这才是所说的“电灯泡”背后,尚未完全建成的电网。<br> 点亮一盏灯,并不等于电力革命已经完成;长期供电、稳定运行,并将电力接入无数生产和生活场景,需要的是一整套系统。<br> 北京这边,已经开始给AI搭建真实世界<br> 如果说杭州学术场讨论的是Agent距离最终形态还缺哪些底层能力,那么北京工业场关心的,就是现有能力如何先进入真实生产。<br> 所以这里的问题要具体得多。<br> 比如一段视频到底能不能交付、人物会不会突然变脸、商品颜色会不会跑偏、AI做出来的东西最后到底有没有人愿意买单等等。<br> 虎鲸文娱集团CTO杜颜龙,先从文娱的本质谈起。<br> 在他看来,小说用文字构建世界,影视用镜头构建世界,游戏用代码构建世界,演唱会则用现场构建世界。媒介不同,但最终目的都指向同一件事:让观众相信这个世界、进入这个世界,并在其中产生情绪和共鸣。<br> 过去一百多年,影视行业用一整套工业流水线构建这个世界,并孜孜以求解决三个核心问题:成本、周期和品质。AI出现后,这套构建世界的方式迎来了系统性重写。而AI的价值,最终也要落到这三个核心问题上来回答。<br> 首先被提及的自然是成本和周期,但在杜颜龙看来,影视行业真正难啃的骨头,依旧是品质。降本增效不是目的,在越来越多的观看场景里以极致的视听语言讲好一个故事,才是行业真正的目标。<br> 一条Prompt生成几秒钟的惊艳画面,和完成一部真正能让观众坐下来看的影视作品,中间还隔着编剧、美术、导演、拍摄、剪辑和声音设计等大量专业环节。<br> 古装人物的对白需要符合时代语感,服装造型需要考虑人物身份、地域和场合;画面要有构图、材质和光影,镜头运动还要服务故事节奏。<br> AI不仅要能生成内容,还要理解什么样的故事成立、什么样的画面高级,以及什么样的镜头能够让观众进入剧情。杜颜龙因此把影视品质拆成了三类审美:编剧审美、美术审美和导演审美。<br> △虎鲸文娱集团CTO,杜颜龙<br> 沿着这个判断,虎鲸文娱给出了三个面向未来的观点。<br> 首先,AI不会取代真人。真人演员、导演和创作者依旧会参与影视内容生产,AI更可能与他们形成新的协作关系。在生产过程和内容交付上,人和AI的关系都值得研究。<br> 其次,AI一定会重写影视生产流程。只靠一个通用模型、一句话生成影视精品,在可见时间里仍然不现实;真正的产业落地,需要完整的模型、工具和生产技术栈,并把它们接进已有的影视流程。<br> 最后,当内容供给因AI而大幅增加后,精品内容会变得更加稀缺。那时真正值钱的,可能不再是“能不能生成”,而是“什么值得被生成”。<br> 这种价值转移,在美图公司技术副总裁兼美图影像研究院负责人刘洛麒的分享中,也有类似体现。<br> 刘洛麒先提出了一个现实问题:模型能力已经很强,但从一款强模型到普通用户低门槛使用,中间仍然存在巨大的产品鸿沟。<br> 过去做软件,通常围绕功能展开。功能越做越多,入口、菜单和参数也随之增加,用户需要自己判断该用什么工具、怎样组合这些工具。<br> Agent出现后,这套逻辑开始改变。越来越多的功能被藏到Agent后面,用户只需要表达目标,系统负责理解意图、拆解任务,并决定调用哪些模型和工具。<br> 刘洛麒将这种变化总结为,从功能堆叠走向智能决策,从交付功能走向交付成果。<br> △美图公司技术副总裁兼美图影像研究院(MT Lab)负责人,刘洛麒<br> 但美图很快发现,单个Agent依然难以完成复杂任务。<br> 原因在于,真实创作通常包含多个目标,而且每个目标都有自己的上下文。把所有事情都交给同一个Agent,它很容易顾此失彼。<br> 于是,美图开始把软件从Agent升级为Agent Teams,让不同Agent各自处理策划、设计、修图、调色和执行,再通过协作完成整条任务。<br> 比如在美图设计室中,用户真正需要的并不只是一张好看的商品图。从商业角度看,这张图还要符合目标用户偏好,适应不同平台的尺寸要求,投放后还得观察是否带来付费和增长。<br> 因此,美图设计室组织了4个专业Agent和70个Skill,从市场分析、内容生成、视觉创作,一直做到投放分析,最终交付一套可以直接使用的商业物料。<br> 这也意味着,AI产品的价值正在从“做出内容”,继续向“解决问题”转移。<br> 一张图够不够好看,只是最开始的一关;它能不能被用户直接使用,能不能进入业务流程,最终能不能带来收入,才决定这项AI能力究竟有没有价值。<br> 再回到开头那座被搬到网上的横店片场。这一次,我们可以把背后的逻辑说得更清楚一些。<br> 群核科技AI业务线高级总监龙天泽认为,当前视频生成模型主要在二维像素层面学习。它可以不断逼近三维世界,却很难真正理解空间结构。<br> △群核科技AI业务线高级总监,龙天泽<br> 比如把一张房间图片交给模型,让它补出另外几个视角,每张图片单独看可能都很逼真,但如果把它们放在一起对照,门窗、家具以及墙面的位置经常互相矛盾。<br> 这类问题在几秒钟的视频里或许还不明显,可一旦进入十几分钟甚至更长的影视内容,人物、道具和场景就很容易发生穿帮,难以进入严肃的生产流程。<br> 群核科技给出的解法,是在生成视频之前,先建立一个明确的3D空间。人物、道具、场地和摄像机的位置先在三维环境中固定,再将关键画面交给视频模型完成最终生成。<br> 龙天泽将这套分工概括为:<br> 视频模型负责审美和语言控制,3D模型负责一致性。<br> 这套思路还有一句非常形象的总结——一次搭建,全篇复用。<br> 一间客厅、一座宫殿或者一条街道,在3D空间中搭好以后,就可以被不同镜头反复调用;人物和摄像机也能够在其中调整,而不需要每生成一个镜头,就重新抽卡一次。<br> 横店线下片场被扫描、重建并搬到线上,正是这条路线的延伸。<br> 走到这一步,AI视频的竞争重点也开始变化。过去大家看的是单个镜头是否足够惊艳,现在则要考察人物和场景能否在长视频中保持一致,镜头能不能精确控制,以及整条生产链的效率是否足够高。<br> 为了解决效率问题,群核科技还将3D片场与视频Harness结合起来。3D片场负责提高一致性和品质,视频Harness则通过关键帧和预览流程,降低长视频制作中的重复生成成本。<br> 到了这里,北京工业场的三场主题分享,其实已经连成了一条非常清晰的线。<br> 虎鲸文娱讨论的是AI怎样进入影视工业流程,并理解专业审美;美图讨论的是软件怎样从提供工具,走向直接交付成果;群核科技则进一步把一次性的内容生成,推进到可复用、可控制的空间构建。<br> 而在随后举行的工业场圆桌中,嘉宾们也进一步讨论了“生成内容”和“构建世界”之间的区别。<br> 杜颜龙认为,生成内容更像一次单向交付,而构建世界意味着资产可以不断沉淀,人与内容之间也会产生持续互动;龙天泽则将构建世界理解为对现实世界的仿真,它可以成为短剧、游戏,甚至机器人训练的前置流程。<br> 刘洛麒所强调的,是世界应当具备因果规律、物理规律和可交互性。只有理解并维持这些规律,AI才真正开始从生成一个样本,走向构建一套系统。<br> 与此同时,工业落地还必须面对创意与精准之间的选择。<br> 节日滤镜、娱乐玩法可以容忍一定偏差,用户更在意好不好玩;但到了电商领域,商品颜色、材质和款式一旦发生变化,这张图就无法使用。<br> 流水线式生产更在意成本与效率,精品内容则需要大量人工参与和精细控制。同一种AI能力放进不同场景,验收标准可能完全不同。<br> 所以,当高质量内容越来越容易生成后,价值会继续向上转移:对用户的理解、对创意的判断,以及将内容分发给合适人群的能力,都会变得更加重要。<br> 学术圈和工业圈,其实在追同一个闭环<br> 现在我们再回头看开头的那组“冲突”,其实就不难理解了。<br> 北京工业场展示的是,AI已经能在具体行业里做到什么;杭州学术场追问的,则是这些局部能力什么时候才能连接起来,形成一个真正能够自主运转和持续进化的系统。<br> 两场讨论的重点不同,却指向了同一个闭环:<br> 执行、验证、反馈、更新。<br> 在学术场,Agent执行完任务后,需要判断结果是否正确,发现错误后进行修正,再把有效经验写入记忆、技能或者模型参数,逐渐形成持续学习能力。<br> 在工业场,AI生成的内容同样需要接受验证。一段视频要经过审美和逻辑检查,虚拟片场要保证人物与空间一致,商品图要准确还原材质和颜色,内容投入市场后,还要继续观察它是否带来了业务价值。<br> 杭州想解决的是“能力怎样不断增长”,北京关心的是“结果能不能稳定交付”。<br> 因此,横店片场已经被搬到线上,与Agent仍处在电灯泡时代,完全可以同时成立。<br> 工业界正在具体场景中补齐流程、数据、空间和行业规则,让一盏盏灯先亮起来;学术界则继续研究记忆、验证、Harness、强化学习和自主进化,试图搭建能够连接这些灯的完整电网。<br> One More Thing:<br> 博见社,还只是硬核少年技术节5.0的一部分。<br> 7月20日,这场横跨阿里巴巴ATH事业群和淘天集团的年度技术活动,在杭州、北京两地同步启动,并持续一周。<br> 开幕式上,淘天集团集中发布了AIGX技术体系的四项成果,包括拍立淘全模态实时Agent、全场景AI创作工作台if Studio、Coupella智惠引擎和Agentic推荐系统Dream。<br> 除此之外,技术市集集中展示了30余项AIGX技术成果;AI Hackathon首次设置业务创新和灵感脑洞双赛道,吸引百余支团队参加;Whoisspy趣味赛则把Agent放进桌游,让人类与AI直接同场对战。<br> 从首届技术展示,到后来引入AI Hackathon、模型挑战,再到如今将学术场和工业场放在同一场技术节中,硬核少年技术节已经连续办到第五届。<br> 而这一次,最有意思的可能恰恰是,北京和杭州没有给出一个整齐划一的答案。<br> 有人已经把横店剧场扫描进电脑,展示AI今天能把事情推进到什么程度;也有人提醒大家,电灯泡才刚刚亮起来,后面的电网还远没有建好。<br> 这大概也是AI当下最真实的状态。<br> 局部已经足够科幻,完整系统仍处于早期。