出品 | 网易智能
作者 | 小小
编辑 | 王凤枝
两年前,田柯宇因干扰模型训练被字节跳动解聘,并被起诉索赔800万元。
如今,他创办的公司还没有正式产品,就拿到了近3000万美元融资,估值达到2亿美元。
据彭博社10月7日报道,投资方包括五源资本、IDG资本等机构。两家机构均向该媒体确认参与投资,未透露更多细节。这家公司尚未公开名称,团队约10人,其中包括几名前字节员工。

这支十人团队瞄准的,是李飞飞也在押注的世界模型领域:让AI学习物体如何运动、环境如何随行动变化,用于机器人、自动驾驶和交互式视频等场景。
田柯宇准备从自己擅长的图像生成研究入手。他以第一作者身份发表的论文,曾获NeurIPS 2024最佳论文奖。据他介绍,团队如今已构建了一套约20万个符号的“视觉词典”,用于帮助AI处理视频信息。
01被起诉的实习生,也是最佳论文作者
田柯宇与字节跳动的纠纷,始于2024年夏天。
据第一财经此前援引字节内部通报的报道,当年6月至7月,田柯宇因对团队资源分配不满,通过编写、篡改代码干扰研究项目的模型训练任务。字节在8月将其辞退,并把相关情况告知其就读学校和行业联盟。
消息传到网上后,出现了“涉及8000多张GPU、损失上千万美元”等说法。字节随后澄清,受影响的是商业化技术团队某研究项目的模型训练,不涉及字节大模型等其他业务,也没有影响正式项目和线上业务,网传规模严重夸大。
到了11月,字节提起诉讼,要求田柯宇赔偿800万元、承担2万元合理支出,并公开道歉。
据彭博社查阅的判决书,法院后来判令田柯宇因违约赔偿50万元。
在此次接受彭博社采访时,田柯宇给出了自己的解释:他关闭了另一名实习生的程序,希望把计算资源腾出来,交给其他研究人员。他承认做法不当,同时将自己的行为形容为“以暴制暴”。
“如果能重来一次,我肯定会选更明智的做法。”他说。字节发言人没有回应彭博社就这次解聘提出的置评请求。
这场纠纷之外,田柯宇的研究也在同一年获得了关注。他作为第一作者发表的《Visual Autoregressive Modeling》获得NeurIPS 2024最佳论文奖,提出了一种更高效的图像生成方法。
他的职业行为争议也让这次授奖受到讨论。
NeurIPS在官方评奖说明中强调,委员会依据论文的科学价值独立作出决定,不单独考虑作者身份等因素。
当时,田柯宇正在北京大学求学,曾于2021年至2024年在字节跳动实习。
如今参与投资的机构中,还有钟鼎资本。该机构合伙人Vita Gu向彭博社表示,田柯宇能够把复杂的技术想法讲得足够清楚,这让他在众多创业者中给人留下了深刻印象。
X用户@Geet Govil则把这笔融资看成对未来的下注:获奖论文已经摆在那里,新公司仍像一张白纸。在他看来,如果视觉符号系统能把生成成本降低一个数量级,2亿美元的估值就有了想象空间;如果做不到,投资者买下的主要还是创始人的研究能力。

02 20万个符号,怎样帮助AI处理视频
田柯宇的创业项目,延续了他对视觉信息处理效率的关注。
在获奖的VAR研究中,模型生成图像的顺序发生了变化。此前的一类自回归方法,会按固定顺序逐个预测视觉token;VAR则采用由粗到细的多尺度预测,先得到低分辨率的图像表示,再逐级生成更高分辨率的结果。
可以把这个过程理解为:先确定画面的整体轮廓,再一层层补充细节。
逐个预测时,后面的token要等前面的生成完;VAR可以在同一尺度内并行生成token,减少逐个等待的步骤。
论文在ImageNet的256×256图像生成测试中报告,相比所选的自回归基线,VAR的推理速度约为其20倍,图像质量也有所提升。研究团队还展示了图像补全、扩图和编辑等能力。
这项成果出自合作研究。论文列有田柯宇等5位作者,署名机构包括北京大学和字节跳动,相关模型与代码已经公开。

现在,田柯宇想把研究推进到视频。相比一张静止的图,视频还要处理连续画面之间的变化:物体在移动,视角在改变,前后帧中的内容需要彼此衔接。
比如生成一段人物走过房间的视频,房间的布局要保持稳定,人物在转身、被遮挡之后也得对得上。每一帧单独看着漂亮,并不足以让整段动作连贯。模型还得处理这些画面之间的关系。
他把团队正在构建的系统称为一套供AI使用的“语言”。
其中约20万个符号并不是人类能够直接阅读的单词,而是帮助模型表示、处理视频信息的编码。
文字提示词告诉模型用户想要什么,画面本身则由专门的视觉表示来处理。现有视频模型已经在使用这类内部表示,田柯宇希望进一步提高它的效率。
“你永远不可能用人类语言完美地描述一段视频。”他向彭博社表示,团队先为AI建立这套语言,接下来计划用约1亿小时的视频进行训练。他希望借此降低视频生成的计算成本。
投资方五源资本也关注这一问题。据BigGo报道,五源在今年5月组织了一场世界模型讨论,强调视觉信息压缩和计算效率的重要性。压缩得更高效,意味着模型有机会用更少的计算处理同样多的视频信息。
从图像走向视频,还要进一步走向世界模型,任务也随之变化。
生成一段连贯的视频之外,模型还需要预测:机器人向左迈一步,眼前的环境会怎样改变;一个物体受到外力后,会向哪里移动。
这也是机器人和自动驾驶研究者关注世界模型的原因。假如模型能够较准确地预测不同动作的后果,智能体就有机会先在模拟环境里尝试,再选择下一步怎么做。
对交互式视频而言,观众一旦能控制方向,画面也要随新的操作继续变化。田柯宇此前的图像生成成果,为新项目提供了研究起点,后面这些能力还需要通过新的实验来展示。
03李飞飞、杨立昆已经入场
李飞飞创办的World Labs研究空间智能。按照AMD的介绍,其模型可以根据文字、图像和视频生成、重建与模拟可交互的三维环境,相关技术还面向机器人学习和仿真。
9月28日,AMD宣布签署收购World Labs的协议,拟以约82亿美元完成全股票交易。交易预计在2026年底前完成,仍需获得监管批准等。苏姿丰在公告中表示,World Labs的模型研究经验将帮助AMD更好地理解下一代AI对硬件、软件和系统的需求。
据彭博社报道,Meta前首席AI科学家杨立昆创办的AMI Labs已获得10亿美元种子融资。
从AMI Labs的种子轮到World Labs的收购协议,世界模型的研究团队已经成为投资机构和芯片公司的争夺对象。
谷歌DeepMind的Genie 3则展示了另一种产品形态:根据文字生成虚拟环境,用户可以在其中实时探索。据DeepMind发布时介绍,Genie 3能够以每秒24帧生成720p画面,并让环境在数分钟的交互中大体保持一致。
DeepMind特别提到,用户离开一个地方、一分钟后再回来,模型需要找回之前的相关信息。它既要记住已经生成的环境,又要响应眼下的新动作。
用户转身之后,不能一等就是几十秒;这让视觉信息处理的效率,直接关系到交互是否流畅。
国内的PixVerse和3D AI公司Vast,也在研究交互式世界模型。它们希望把视觉生成从观看一段预先生成的内容,推进到能够随用户操作持续变化的环境。
钟鼎资本的Vita Gu向彭博社表示,政策对物理智能的支持力度很大,市场资金也同样热切。
田柯宇获得融资时,同行已经开始展示各自的模型,但这支十人团队还没有发布完整模型。
04先把模型做出来
田柯宇给新方法定下的成本目标,是把生成一秒视频的费用降至原来的十分之一甚至更低。
目前,报道没有给出这项预期对应的测试结果;要比较节省了多少,还需要知道生成视频的画质、时长和分辨率。
围绕这笔融资,X用户@SmaeiliVahid提出了另一层关切。他更想知道的是,世界模型实验室获得资金之后,将用什么数据训练模型,又怎样把模型放到实际环境里检验。
这比单看估值多追问了一步:模型最终要模拟的那些变化,能否与现实对得上?

田柯宇披露的约1亿小时视频,是接下来的训练计划。报道没有展开数据来源、筛选方式和训练配置。
对这套视觉符号系统而言,训练之后能保留多少细节、能否连续生成合理的运动,将比“词典里有20万个符号”更直观。
田柯宇目前没有把精力放在消费级产品或商业模式上。他向彭博社表示,团队优先要做的是把技术交付出来。
田柯宇的X账号背景图选用了电影《降临》的画面:语言学家隔着防护罩举起一块白板,上面写着“HUMAN”。他的简介仍把“NeurIPS 2024最佳论文第一作者”放在最前面,下面写着“been in [lab mode]”,再下一行是“more soon”。

他准备先通过现场活动演示团队的技术。完整模型,则计划在2027年发布。
下单付款后十分钟内,您可以在商城众网的个人中心查看订单信息