SVTR AI 创投库 · AI 创投会第 007 期丨AI + 视频创作:第一波资本押在生成端,被忽略的缺口在理解端 · 2025 年 1 月 4 日

2025 年 1 月 4 日这个周末的下午,涌现 AI 创始人张雨飞把一句话打在屏幕上:「手机电脑排成队,好像塞车一样堵在街上。」同一句描述,喂给几款热门的文生视频工具,出来的画面各不相同:有人脑子里是高架桥,有人是老城小巷。据其现场表述,一个剧组里导演说「穿裙子的女孩站在道路中央」,服装、摄影、灯光各自想的也是不一样的画面。他想说的重点不在生成,而在一件更早发生的事:人们连「这句话对应哪个画面」都没法达成共识。
所有人涌向生成,他去做「看懂已有视频」
张雨飞在广告与内容传播行业做了二十多年,自己的广告公司在北京和深圳都有办公室,做过大量电视广告与短视频物料。他的判断从生产一线来:这一轮 AI 视频工具几乎都挤在输出端,Sora、可灵、Runway、Pika 负责把画面生成出来,但真实的制作流程里,输出之前还有一段更花时间的输入和思考。据其现场表述,用生成工具时你可能会「抽卡」,运气不好就得反复试,还得会写提示词,普通人根本描绘不出准确的镜头语言。他把涌现和李飞飞的空间智能摆到一起对照:后者用文本生成三维世界,涌现反过来做理解世界,先把碎片化的视频、图像、音频统一拆解成可检索的单一镜头,再谈检索、整合与生成。据其表述,一个镜头约一到两秒,是视频不可分割的最小单位。
这条判断值得记下来。SVTR AI 创投库的数据能给它一个坐标:过去两年,AI 加视频方向录得四十多起融资、总额超过 $15 亿、平均单笔约 $3600 万,资本的重心几乎全在「把画面生成出来」这一端。SVTR 此前也发文拆过这条赛道的竞争格局,预判过 Runway、Pika 的路线走向。张雨飞押的是另一半:当所有人涌向生成,能不能先把「看懂已有视频」这件事做扎实,把它做成从内容到电商的入口。
来的人本身就是信号
这场会吸引来的人,本身就是一条旁证。到场的既有大厂和几家大模型团队的人,也有正在一线找场景的从业者。一位在 Instagram 工作、常年在美国的技术人追问,各平台数据分享规则很严,跨平台视频信息到底怎么拿到;一位深耕大消费的操盘手连问三个问题,从「图片能不能拼成三十秒短视频」,到「能不能加一个跳转支付的按钮」,再到「品牌方不想被大平台绑住流量和用户忠诚度,怎么办」。
SVTR 联合创始人现场提的问题最直接:在国内,创业公司怎么跟大厂、跟融了很多钱的大模型公司竞争与共存。据其现场表述,张雨飞的答案是绕开正面比拼。AI 应用端的探索至今没被很好解决,大厂和大模型团队要真正落地,绕不过真实行业沉淀,而这正是一支有二十年行业经验的团队该站的位置。对于跨平台取数的质疑,他答得坦白:现阶段走离线,用户自己下载或收藏,工具只做识别与推理,长期要和正版内容平台合作,这更多是知识产权问题,不是 AI 能力问题。
同一套内容工业,中国先跑通再复制到海外
一位在美国的与会者把话题带向另一条线:短剧到底是中国特色,还是别处也在长。据其现场表述,张雨飞给的是一手观察:中国团队做的短剧在美国已经很火,有一款叫 ReelShort 的应用跑在前面,做法是把国内短剧剧本整个「洗」一遍,换外国演员重演,内核照搬霸总与强反转,观众是本地美国人,投放走专门平台加 TikTok 信息流。同一套内容工业,中国先跑通模式,再整体复制到海外,这是短剧这条线独有的中美路径,也解释了为什么「理解并再生产视频内容」的工具,在两个市场都有需求。
回到这场会的脊柱。把它收敛成一句:AI 视频的第一波资本几乎全押在生成端,真正被留白的是理解端。谁能把「看懂并检索已有视频」做成顺手工具,谁才握住了从内容到电商的那条变现链路。这是张雨飞 2025 年初下的注。
回看约十九个月,这注只兑现了一半。生成端继续狂奔,短剧出海如他所料成了确定性大生意。但「理解视频」这件事,很大程度上被基础模型自己吸收了:多模态长视频理解成了大模型标配能力。一个独立的「视频理解工具」要证明自己不会被大厂顺手做掉,比 2025 年初更难。这恰恰是 SVTR 坚持做一手现场记录的价值:把一个赛道判断在它还没被验证时原样留下,日后才能拿出来对表,看清它兑现在哪、又卡在哪。
这场分享的完整录播,归 SVTR 会员专区归档。想看更多一手现场判断、项目信息并直接对接创始人,可加入 SVTR 会员。