栏目分类
你的位置:kai云体育app官方下载app最新版本-kai云体育app官方登录入口 > 新闻中心 >

李飞飞的天下模子创业开云kaiyun体育,最新效果来了!
刚刚,教母亲身告示对外推出全新模子RTFM(A Real-Time Frame Model),不仅具备及时初始、捏久性和 3D 一致性,更重要的是——
单张 H100 GPU 就能跑。
此外,RTFM 的规划盲从三大中枢原则:
效力:仅需单张 H100 GPU,RTFM 便能以交互级帧率及时完成推理运算。
可扩张性:该架构具备随数据量与算力增长而捏续扩张的能力。它通过端到端的通用架构从海量视频数据中自主学习,无需依赖显式 3D 表征即可构建三维天下模子。
捏久性:用户可无尽时长与 RTFM 交互,统共场景将弥远留存。该系统构建的捏久化 3D 天下不会因视角退换而消失。
底下具体来看。
天下模子需要普遍计较资源
渊博的天下模子偶然及时重建、生成并模拟具有捏久性、可交互且物理精准的天下。这类模子将透澈改造从媒体到机器东谈主本领等百行万企。
畴昔一年,生成式视频建模的施展已奏效利用于生成式天下建模限制。
跟着本领发展,一个事实愈发明晰:生成式天下模子对算力的需求将远超面前的大型话语模子。
若凯旋套用现存视频架构,生成 60 帧的 4K 交互视频流每秒需产生杰出 10 万个 token(约即是《弗兰肯斯坦》或首部《哈利 · 波特》的篇幅)。
而要看护一小时以上的捏续交互,需惩办的荆棘文 token 更将冲突 1 亿大关。基于现时计较基础设施,这既不成行也不具备经济性。
李飞飞团队校服"惨痛警戒"揭示的限定:
那些能随算力增长优雅扩张的浅显要领终将在 AI 限制占据主导,因为它们能享受数十年来鼓舞本领发展的算力资本指数级下跌红利。生成式天下模子正处在绝佳位置,必将从捏续裁减的算力资本中获益。
这也就引出一个重要问题:生成式天下模子是否会被现时硬件条目所适度?能否现在就预览这项本领的雏形?
于是,李飞飞团队设定了一个明确认识:规齐截款弥散高效、可立即部署,并能随算力普及捏续扩张的生成式天下模子。
他们的目的是打造仅需单张 H100 GPU 即可驱动的模子,在保捏交互帧率的同期,确保臆造天下永不用散。完毕这些本领方针,将让他们提前窥见将来——在当下硬件上体验明日模子可能达到的高度。
这一认识长远影响着他们从任务设定到模子架构的统共这个词系统规划。通过悉心优化推理堆栈的每个法子,交融架构规划、模子蒸馏与推理优化的前沿冲突,他们神敢于在面前硬件上呈现对将来模子最高保真度预览。
天下模子四肢学习渲染器
传统的 3D 图形管线接收显式 3D 表征(如三角网格、高斯泼溅)构建天下模子,再通过渲染生成 2D 图像。这些管线依赖东谈主工规划的数据结构与算法来模拟 3D 几何、材质、光照、暗影及反射等效果。
数十年来,这类要领长久是计较机图形学限制的架海金梁,但其难以随数据量与算力增长完毕线性扩张。
RTFM 则独辟门道。基于生成式视频建模的最新冲突,究诘团队通过老师单一神经收罗,输入场景的单张或多张 2D 图像,即可从全新视角生成该场景的 2D 图像,全程无需构建任何显式 3D 表征。
RTFM 还接收作用于帧序列的自追忆扩散变换器架构,通过海量视频数据进行端到端老师,完毕基于历史帧的后续帧瞻望。
RTFM 不错被视为一种可学习的渲染器(learned renderer)。它率先将输入的图像帧退换为神经收罗中的激活(即 KV cache),这些激活以隐式状貌暗示统共这个词天下,在生成新帧的经过中,收罗通过重目力机制从这种暗示中读取信息,从而把柄输入视角生成与之保捏一致的天下新视图。
从输入视图退换为天下暗示,以及再从该暗示中渲染新帧的机制,并不是通过手工规划的,而是通过端到端的数据老师自动学得的。
RTFM 只需在老师经过中不雅察到这些阵势,就偶然学会建模诸如反射、暗影等复杂效果。
不错说,RTFM 粗率了"重建"(在已有视角之间进行插值)与"生成"(创造输入视角中不成见的新内容)之间的范围,而这两者在计较机视觉中历史上一直被视为两个安逸的问题。
当 RTFM 被提供普遍输入视角时,由于任务箝制更强,它更倾向于扩充重建;当输入视角较少时,它则被动进行超出已有视角的外推生成。
将姿态帧四肢空间记挂
现实天下的一个重要特点是捏久性(persistence):当你移开视野时,天下不会消失或十足改造,不管你离开多万古分,你老是不错回到之前往过的地点。
这对自追忆帧模子来说一直是一个挑战。天下仅通过二维图像帧被隐式暗示,因此,完毕捏久性要求模子在用户探索天下的经过中,对络续增长的帧蚁合进行推理。这意味着每生成一帧的资本王人比前一帧更高,因此模子对天下的记挂实际上受到其计较资源预算的适度。
RTFM 通过将每一帧建模为在三维空间中具有一个姿态(位置和标的)来躲藏这一问题。他们通过向模子提供待生成帧的姿态来生成新帧。
模子对天下的记挂(包含在其帧中)具有空间结构。它将带有姿态的帧四肢空间记挂使用。这为模子提供了一个弱先验——即它所建模的天下是三维欧几里得空间——而无需强制模子显式瞻望该天下中物体的三维几何体式。
RTFM 的空间记挂使得捏久性不受适度。在生成新帧时,他们会从已姿态帧的空间记挂中检索隔壁帧,认为模子构建一个定制的荆棘文。
团队将这一本领称为荆棘文切换(context juggling):模子在不同空间区域生成内容时会使用不同的荆棘文帧。这使得 RTFM 偶然在万古分交互中保捏对大型天下的捏久记挂,而无需对络续增长的帧蚁合进行推理。
临了,该模子即日起以预览版时势怒放体验,现在就不错试起来了…
试完接待回来补个反映褒贬哦,笔芯~
参考流通:
[ 1 ] https://x.com/drfeifei/status/1978840835341914164
[ 2 ] https://x.com/theworldlabs/status/1978839175320186988
[ 3 ] https://www.worldlabs.ai/blog/rtfm
一键三连「点赞」「转发」「防御心」
接待在褒贬区留住你的念念法!
— 完 —
� � 年度科技风向标「2025 东谈主工智能年度榜单」评比报名开启啦!咱们正在寻找 AI+ 时期领航者 点击了解确定
❤️� � 企业、居品、东谈主物 3 大维度,共诞生了 5 类奖项,接待企业报名参与 � �
一键存眷 � � 点亮星标
科技前沿施展逐日见开云kaiyun体育
