a16z
a16z|2026年09月04日 14:34
世界实验室联合创始人李飞飞、贾斯汀·约翰逊、本·米尔登霍尔和a16z的马丁·卡萨多在空间智能世界模型Atlas上: LLM建立在下一个令牌预测的基础上。视频模型建立在下一帧预测的基础上。Atlas建立在新的视图预测之上,它是第一个将像素生成和像素重建统一起来的模型,这两个问题在计算机视觉中已经分开了半个世纪。 实际结果是,数字捕捉空间的3D表示所需的时间减少了50到100倍。以前,你需要100到300张单人房间的照片。Atlas只能从三个开始工作。 在这段对话中,他们谈到了《黑客帝国》中的慢动作镜头,该镜头拍摄了数百个摄像头,现在拍摄了三部iPhone,一夜之间的Slack消息让他们在五秒钟内押注该公司,为什么机器人技术在数据而非芯片上遇到瓶颈,以及新的视图预测是人工智能完成的情况。 00:00简介 01:50《黑客帝国》慢动作场景现在需要三部iPhone 02:48为什么新视图预测是原始的 07:10统一生成与重构 11:15高斯斑点成为瓶颈 14:17密集拍摄意味着300张照片 17:30为什么重建需要一代人来填补空白 18:44 LLM课程图像模型错过 23:39视频让他们都进去了 28:04 3D设计有95%的修改 30:50机器人的问题是数据,而不是芯片 32:48为什么机器人策略不能像图像模型那样训练 34:44当模拟器成为规划者时 36:45冻结时间需要充满运动的镜头 40:57为什么新视图预测是AI完成的 42:43大自然给动物眼睛,却不给树木 油管https://www.youtube.com/观看?v=qn1QDDBnTA0 @德菲菲@jcjohnss@BenMildenhall@theworldlabs@martin_casado
分享至:

热门快讯

APP下载

X

Telegram

Facebook

Reddit

复制链接

热门阅读