中国政策档案 Governance Archive HOLDINGS 234,771 · FONDS 122
Record · qbitai ACC. 900072402

Hefei Backs Another AI Unicorn: Multimodal Track, 2.1 Billion Yuan Raised in 3 Months

合肥又押中AI独角兽:多模态赛道,3个月融了21亿

Issuer
Date
2026-07-24
Instrument
other
Cited by
0
This news article reports that HiDream.ai (Zhixiang Weilai) completed a 1.5 billion yuan Series C round, bringing its total financing to over 2.1 billion yuan in three months and achieving unicorn status. The piece analyzes the investor lineup, including national and industry capital, and discusses the shift in AI investment focus from large language models to multimodal visual AI.
Full text · 原文 4,654 字
允中 发自 凹非寺<br> 量子位 | 公众号 QbitAI<br> 7月23日,智象未来(HiDream.ai)宣布完成15亿元C轮融资。<br> 这是这家多模态大模型公司在近三个月内完成的第三轮融资。<br> 三轮密集融资超21亿元后,智象未来估值超过10亿美金,正式跻身全球AI独角兽行列。<br> 但真正让人感兴趣的从来不是钱本身,而是谁在给钱,以及为什么给。<br> 这一轮的投资人名单,堪称“神仙打架”。<br> 公开信息显示,本轮融资由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投,厦门国贸资本、上影新视野基金、湖北长江产业投资集团、华策影视、航源资本、创云海资本、华福投资、余杭金控股份、交银资本、若松基金等多家机构跟投。<br> 老股东合肥产投、东方富海、金浦投资、金华金投、中哲创、财鑫资本持续加注。<br> 风格、布局逻辑截然不同的资本,罕见扎堆押注同一家创业公司。<br> 这不禁让人好奇,这些人在智象身上看到了怎样的未来?<br> LLM估值红利见顶,视觉模型的想象空间正在被打开<br> 智象C轮融资的这个时间点很微妙,恰好踩中了AI行业范式切换的关键拐点。<br> 此前,大语言模型凭借代码生成、文本交互能力,长期占据资本与市场的核心焦点,参数规模、推理速度成为核心竞争标尺。<br> 近期,随着新一代开源/开放权重模型密集发布,市场对大语言模型估值溢价的分歧明显加剧,部分已上市AI模型公司股价波动加大。<br> 过去,资本愿意为更大的参数规模、更高的Benchmark分数、更强的通用能力支付溢价;<br> 但当模型能力迭代越来越快、领先窗口越来越短,单纯“做大模型”已经不再是足够稳固的估值锚点。<br> 相比继续押注参数规模,资本的目光正在从AI“现在能做什么”,移向“未来能成为什么”。<br> 市场正在形成共识:大语言模型的领先优势极具短暂性,单纯依靠参数堆叠、文本能力领跑的模式,已逼近工程天花板。<br> 同一时间,AI视觉赛道却呈现出截然不同的景象,迎来资本集中爆发。<br> 据不完全统计,2026年国内AI视觉领域的融资总额已逼近300亿元。<br> 大厂背景的字节系Seedance、可灵ARR数据大幅增长,一众独立创业公司接连落地大额融资,赛道整体进入技术落地、商业兑现的黄金周期。<br> 可以说,多模态已经成为自AI Coding之后,AI商业化确定性最高的赛道之一。<br> 智象未来能在资本市场受到瞩目,当然离不开这个时代的“大气候”。<br> 多元资本共同押注了一个怎样的技术叙事?<br> 赛道升温,不代表所有人的机会均等,市场只会把筹码押给真正的头部玩家。<br> 而一家公司的投资方阵容,往往就是最直接的信任投票。<br> 翻看智象未来投资人名单,几个鲜明的特征跃然纸上:国家级资本站台、多元资本集结、以及“首次出手”的稀缺性。<br> 公开信息显示,这是社保基金作为LP首次投资多模态大模型方向的公司,更是工银资本第一次出手多模态大模型企业。<br> 跟投名单里,还站着来自安徽、上海、浙江、福建、湖南多地的国资。上影股份、华策影视两家头部影视上市公司并肩入局。<br> 此外,还有东方富海、弘颐资管、敦鸿资本这些顶级的市场化VC。<br> 这种多元化的投资人结构,在当下的一级市场中并不多见。<br> 通常情况下,一家AI创业公司的融资轮次越往后,股东构成会趋于收敛,集中在少数几类财务或产业资本手中。<br> 智象未来的情况——国资、产业方、市场化VC在同一轮次密集参与,至少说明一个问题:不同属性的资金,在这里看到了不同的价值锚点。<br> 对国家级资本而言,关注的是“路线”。<br> 全模态世界模型是否成立,目前尚无定论,但如果这一方向最终跑通,其战略意义将不止于单一商业场景,而可能成为下一代AI基础设施的重要组成部分。<br> 影视产业资本,此次投资是卡位内容产业革命的前置布局。<br> 因此,可以看到上影股份、华策影视与智象未来达成了多项合作,比如新型内容创制、院线场景升级、AI跨屏整合营销、AI大屏制片标准与工作流程制定等方向协同。这显然不是一次简单的财务布局,双方都志在长远。<br> 对地方国资而言,算的是产业账。<br> AI竞赛已进入贴身肉搏阶段,各地都在寻找自己的“标志性项目”。<br> 过去十年,合肥接连投资了长鑫科技、京东方等高科技企业,这座城市在过去反复证明了一件事:它擅长在行业黎明期下重注。如今,智象未来被摆在了相似的位置上。<br> 而敦鸿资本、弘颐资管、东方富海等市场化顶级机构集体入局,则是基于硬核技术落地价值的专业判断。<br> 多家机构更是首次布局视觉大模型赛道,这也从侧面印证了智象未来的技术路线、团队积淀与商业化能力,具备一定的行业稀缺性与差异化优势。<br> 不同背景的出资人,从各自坐标出发,看到了同一个方向上的不同切面。但这些切面最终拼出的那个完整图景,才是真正值得追问的问题——<br> 他们共同押注的,究竟是一个什么样的技术叙事?<br> 颠覆行业“缝合架构”,UiT跑出原生全模态新路径<br> 要回答这个问题,需要回到一个更底层的判断:大模型通往AGI的路径,正在发生一次根本性的路线分歧。<br> 过去两三年,AI行业的主流叙事是“规模法则”——参数越大、数据越多、算力越强,模型就越聪明。<br> 杨立昆对此立场鲜明,甚至近乎偏激,他曾多次表示,三到五年内,世界模型将取代LLM成为主流AI架构。<br> 这一判断是否准确另当别论,但它指向了一个大模型无法回避的先天缺陷:LLM本质上是“书斋里的思想家”,它的智能被局限在人类文明已编码的符号系统之内。<br> 世界模型试图解决的就是这个问题:让AI不仅仅处理符号,而是理解物理世界中的空间、时间、因果和交互。<br> 智象未来选择从视觉像素出发,构建原生全模态架构。<br> 这个选择的背后有一个核心判断:图像是信息密度极高的模态之一。<br> 一张图片定格的是某一时刻物理世界的完整状态,空间关系、光影变化、物体材质、色彩信息,所有这些都被压缩在像素矩阵中。<br> 传统的多模态模型,本质上是“缝合怪”,在语言模型之外挂一个图片理解模块,再补一个生成模块,各模态分别编码,最后在外层拼接。<br> 文字是主轴,其他模态是插件。信息在不同模块之间传递时,每一次转换都在损耗。<br> 智象的UiT架构试图颠覆这个范式。<br> 它将图像像素、文本Token、视频体素以及音频、动作、空间关系等原始信号,由同一套Transformer完成理解、生成和推理。<br> 不设独立的文本编码器,不用VAE作为模态间的传导介质,所有信号统一tokenization,端到端地在同一网络中完成多任务处理:文生图、长文本渲染、指令编辑、主体驱动、故事板生成,全部由同一个模型完成。<br> 全模态世界模型不是一个停留在论文里的学术概念。2026年5月,原生全模态架构迎来了第一个关键节点。<br> 智象旗下HiDream-O1-Image(8B参数开源版本)以「Peanut」匿名上榜全球知名独立AI模型评测平台Artificial Analysis、并登上文生图榜单开源模型第一,成为榜单前20名模型中参数最小的版本。<br> 随后,商用版HiDream-O1-Image-1.5再次成为该榜单排名最高的中国图像模型,位列全球前三,在光影、复杂构图、指令跟随和中英文字渲染上表现突出。<br> 当然,一次评测登顶不意味着终局。<br> 视觉大模型的竞争才刚刚进入深水区,榜单排名的变动周期正在从季度缩短到月度。<br> 但这件事的坐标意义在于:当行业还在争论“世界模型到底能不能work”的时候,至少有一条技术路线,已经在第三方评测体系里交出了可被验证的答卷。<br> 多路资本集体重仓,固然有赛道的热度使然,但更深层的驱动力,恐怕还要回到智象未来在底层架构上的差异化选择。<br> 这让智象未来在众多AI创业公司中,呈现出了一种不太一样的质地。<br> 这段“荒诞科幻片”,可能比SOTA更有说服力<br> 区别于多数重技术、轻落地的AI创业公司,智象未来早已搭建起成熟可落地的“1+1+3”商业化体系,实现底层技术、平台能力、场景应用的三级跳落地。<br> 体系第一层为HiDream全模态大模型底座,承载所有底层技术创新与算力支撑;<br> 第二层为HiHarness企业能力中台,对外输出标准化、可复用的模型能力,适配企业定制化需求;<br> 第三层聚焦商业营销、影视创作、社媒创作三大垂直场景,打造专属AI智能体产品,深度嵌入产业工作流。<br> 其中,本次WAIC重磅发布的vivago R1多模态创作智能体,成为技术落地的核心标杆产品。<br> 针对行业视频生成时长受限、画面跳变、人设错乱、可用性低等长期痛点,vivago R1实现了突破性革新,成为全球首款支持无限时长视频自主生成与编辑的创作智能体。<br> 产品搭载长链路叙事规划能力,摒弃传统“抽卡式”随机生成模式,先完成整体脚本与镜头规划,再分段落地生成、智能纠错,单段任务失败独立重试,不影响整体创作进度。<br> 依托这一架构革新,vivago R1将AI内容商用有效成功率提升至85%,跨过了企业规模化商用的核心门槛,让AI正式从辅助工具,升级为内容生产的核心生产力。<br> 这套技术参数落到实际创作中是什么效果?<br> 近期有一个来自用户的测试案例在创作者社群中流传甚广,有人在vivago R1上输入了一组相当刁钻的指令:<br> 生成一部“叶什尔查姆风格”的荒诞科幻短片。<br> 叶什尔查姆(Yeşilçam)是土耳其上世纪六七十年代为核心的商业电影黄金时代。<br> 它整体上类似“土耳其好莱坞”,以高产、明星制和类型片著称;其中一支后期低成本山寨片,因为粗粝道具、拼贴素材和夸张表演,后来在海外电影圈走红,《土耳其星战》就是最著名的代表——<br> 真人套着硬纸板喷银漆的怪兽服、泡沫塑料制作的石头道具、手绘的外星球背景、演员绑着石头在蹦床上模拟飞行、直接剪辑真实爆炸镜头入画。<br> 它的精髓是“廉价到极致,反而形成了一种独特的幽默感”。<br> 对于AI视频模型来说,这种风格真正的考验在于:它要求模型理解“不完美”,既要输出符合物理规则的画面,又要刻意保持低成本的质感,还要在“假”与“可笑”之间精确地踩中那个风格阈值。<br> 大多数模型在面对这类指令时,会倾向于输出“好看的画面”而非“对的风格”。<br> 而vivago R1的处理结果,至少在创作者社群的反馈中,被认为是“精准捕捉到了那种荒谬感”——硬纸板怪兽、手绘背景、廉价特效的质感都被复现,同时镜头之间的叙事逻辑保持了连贯。<br> 一个把“假”做到极致的风格,反而成了检验模型对“真实”理解深度的试金石。<br> 这个案例之所以值得被提及,不是因为它展示了多精美的画面,而是因为它指向了一个更本质的能力:一个真正可用的创作工具,必须能理解风格、执行意图、保持叙事连贯,而不只是生成漂亮的单帧画面。<br> 扎实的产品能力也收获了全球市场认可。<br> 目前vivago海外版已覆盖全球100多个国家和地区,累计服务超5000万用户,今年5月灰度版登顶Product Hunt日榜第一,被硅谷知名product hunter Chris Messina强力推荐,评价为“Think Claude Code,but for video”,商业化落地能力稳居行业第一梯队。<br> 如果说前两年的AI竞赛比的是谁更能“读懂”人类已有的知识,那么从现在开始,比的是谁更能“看懂”并“推演”这个物理世界。<br> 这是一场从文本智能到物理智能的范式跃迁,也是世界模型赛道最迷人的不确定性。<br> 沿着这条原生全模态技术路线,智象未来的演进节奏与落地效果,值得长期追踪。<br> 它不仅是国产AI在底层架构上的一次主动突围,更可能为“大模型如何跨越纸上谈兵、真正走进物理世界”这一命题,提供了一个值得挖掘的范本。<br> 随着这一轮融资尘埃落地,世界模型的牌桌摆开,真正的竞赛,才刚刚鸣枪。