42章经 · Episode · 2023-12-17

从图形学到 AI 生成 3D:我们离 3D 版 Midjourney 还有多远? | 对谈 Meshy.AI 创始人渊鸣

原节目 https://www.xiaoyuzhoufm.com/episode/657d446d3d5d24e9cb3a6b86
本页是中文逐字稿 —— 书面化中文正文;原始 ASR 底档见页尾,时间戳可回源核对。
Chapter 01

从真实感渲染到数字世界合成

00:02 — 07:02 · 图形学 · 渲染 · 数字内容
00:00:02

Something there。我们今天很开心请到胡渊鸣。

00:00:21

他是 mit 图形学博士,过去十多年一直从事图形学相关工作。

最近,他刚发布了一个 AI 生成3D的产品。

这个产品叫 Mesh,他也是 Mesh 点 AI 的创始人。

渊铭,请和大家打个招呼。

00:00:37

大家好,我是渊铭。很高兴今天能和大家交流分享,也感谢曲凯老师的邀请。

00:00:43

我们今天请袁明来,主要是想聊一聊整个图形学,包括 AI 生成图片、视频、3D 这一整套技术的基本逻辑与发展脉络。

尤其是 AI 生成3D,是叶明现在比较核心的工作方向,所以我们可能会深入讨论 AI 生成3D 这件事。

你最早是在国内读的本科,对吗?

就是学技术。

00:01:07

我是13年到17年在清华的姚班学习计算机。本科毕业以后,我去了波士顿,在麻省理工学院开始读博士。

读博士的过程也比较顺利,四年不到,大约三年半就博士毕业了。

00:01:24

这个速度非常快。

00:01:25

是的,确实挺快。

毕业以后,我用了两年半时间,一直在做图形软件方面的产品和创业工作。

所以我觉得自己比较有意思的经历,是对学术界和创业界两边的事情都了解一些。

00:01:39

嗯哼。

你本科阶段其实就已经在做图形学了吗?

是的。

到底什么是图形学?

00:01:44

其实大家最早对图形学的理解,是真实感渲染。

嗯。

这是什么意思呢?

给定一些3D数据,图形学要把它渲染成一部电影。

渲染结果越真实越好。

但坦率地说,这部分内容发展到大约2000年以后,大家发现其中能够实现的本质性突破

越来越少。

嗯。

大家的兴趣逐渐转向了许多其他方向。

例如,既然现在渲染已经做得比较好,接下来还可以在哪些方面继续改进?

可以把仿真等工作做得更好。

例如,现在要表现一栋楼爆炸,就不再继续实拍炸楼,而是改用一些数理方程来描述这一过程。

这股热潮也持续了一段时间。后来到2012、2013年,AlexNet 这样的工作出现,大家对 AI 的关注度也逐渐提高。

图形相关的内容与 AI 的结合越来越紧密。

因此,我认为图形学可能并不是一项具体的技术。

它是一个由许多应用催生并演化出来的学科。

00:02:56

能否这样理解:图形学仍然是在研究如何用技术更好地把控或修改

对外输出的图形效果。

00:03:05

是的,我认为可以这样理解。无论是现在的显示屏,还是以后的 VR AR,最终都要输出为可见的视觉内容。

对吧?

因此,图形学的许多研究都在关注如何更好地合成这样的数字内容。

00:03:20

OK,所以它必然会分为硬件和软件两部分。

00:03:24

是的,这个理解非常准确。

00:03:25

软件部分包括前面提到的渲染、模拟仿真等,更多属于算法层面。

是的。

另一部分是硬件,例如显卡这一类。

我顺便想问一下游戏中的相关内容。

历史上各代游戏引擎,本质上也属于图形学吗?

00:03:38

是的,实时渲染是图形学中特别重要的一项内容,也需要把实时渲染做好。

基本上都要用到游戏引擎。

典型的例子包括 Unity、unreal engine,这些都是用于实时渲染的游戏引擎。

00:03:53

我认为可以先快速向大家说明这几个概念,因为大多数人可能经常听到它们。

CPU、GPU,以及渲染、仿真等概念,或者各种引擎,究竟分别承担什么作用?

00:04:06

我认为它们都服务于同一个目的。

这个目的就是为大家合成一个更加真实、更具沉浸感的数字世界,通常是 3D 的。

图形学中的许多研究,都是朝着这个方向进行的。

这个目标去努力。

嗯哼。

刚才提到了几个概念,其中包括硬件。

例如 CPU 和 GPU。GPU 之所以诞生,是因为它相比 CPU 具有更大的吞吐量。

因此,GPU 更适合承担渲染、仿真等方面的任务。

后来,AI 又发展成为 GPU 上一个非常重要的 Workload。硬件方面大致如此;软件方面,则有许多大家会用到的创作软件。

其中包括一些用于影视行业的创作软件,这些主要属于离线图形学,即 offline computer graphics。它所做的事情,是先把内容渲染完成,例如渲染成一个 MKV 或者 MK MP4格式的文件。

随后,用户就可以固定播放这个文件,它不具备交互属性。

这类软件包括许多传统意义上的工具,例如 3DMAX。

00:05:14

Maya Blender Houdini 这类软件一般称为 DCC 软件。

它们主要应用于影视、广告等行业。后来又出现了新的变化。

其中一些功能也变得更加适合实时应用。

例如 Houdini 中许多程序化建模功能,其实也可以用于游戏引擎。

另一类软件就是游戏引擎。游戏引擎的特点是什么?

它具有可交互性。

正因为它具有可交互性,所以带来了许多新的挑战。

例如,渲染必须实时完成。以影视中的一些场景为例。

这些场景可以直接全部加载到内存中。

但游戏不能这样处理。特别是一些开放式游戏,完整地图和场景规模非常大,很难将整个场景全部加载到用户的机器中。

在这种情况下,游戏引擎作为实时图形渲染中的重要角色,面临许多挑战。例如,在离线渲染中,可能有一个小时来渲染一张图;但在实时渲染中,情况不同。

实时渲染只有16毫秒的时间。

嗯。

在16毫秒内渲染一张图,与离线渲染之间存在千倍、万倍的计算能力差异。

00:06:19

需要解决的就是这两个问题。

二者的条件和产出要求并不相同。

因此,软件实际上分为离线软件和实时软件。

还有一类的可能就是算法了,那算法呢?

例如 nerf、光线追踪,以及刚才提到的高斯散射等算法,始终在不断迭代。

这些算法当然可以运行在 cpu 上,也可以运行在 gpu 上;可以用于离线,也可以用于实时。

但是,不同算法会有不同的要求。

因此,算法、软件、硬件,当然还有商业生态,是几个相关的部分。

我认为,这四者之间的关系是一种相互耦合的关系,很难把它们完全分开。

Chapter 02

硬件、软件与算法如何互相抬升

07:02 — 11:25 · GPU · 游戏引擎 · 实时渲染
00:07:02

这些年,你认为整体图形学的进展更多是由硬件驱动,还是由软件或算法驱动?

00:07:08

这是很好的问题。我只能说,它们是相互作用的。

嗯哼。

硬件和软件的发展始终处于相互迭代的状态。

以 GPU 的诞生为例,在有了 GPU 以后。

大家突然发现,可以渲染的内容变多了。

以前可能只能渲染5个三角形,现在可以渲染500个、5000个,甚至5万个。

因此,就可以有新的软件和算法。

这些软件和算法可以更好地利用硬件提供的资源。

并把相应的内容渲染出来。

当算法需求逐渐提高以后,硬件可能会发现自己已经不够用,现在只能渲染5万个三角形。

但是软件要求它能够渲染500万个三角形。

那该如何解决?

他只能不断优化硬件。

在摩尔定律的持续推动下,硬件可能会变得越来越强大。

有了这些硬件更新之后,又会发生什么?

算法又会开始思考,是否可以做一些其他事情。

嗯。

算法会尝试新的做法,因为大众对于游戏画面的需求一直在不断提高。

由于需求不断提高,硬件和软件都会持续迭代。

因此,可以认为这是一种左脚踩右脚、一步一步爬得越来越高的状态。

00:08:16

我们刚才提到了许多与渲染相关的内容,所以能否再简单解释一下什么是渲染?

00:08:22

渲染其实是一个很经典的任务。

渲染要做的事情,是处理场景中的一些3D 模型。

现在需要把这些模型渲染成一张具有真实感的2D 图像。

渲染做的就是这件事。

这件事的难点在哪里?

在现实世界中,光线会在场景中不断弹射。

例如,当你打开一盏灯时,并不是只有被这盏灯直接照到的地方会变亮。

嗯。

整个房间都会变亮。

嗯。

原因是什么?

因为这盏灯发出的光子照亮物体之后,还会继续在整个空间中传播。

这就带来了巨大的计算量。

因此,渲染算法方面出现了很多研究,例如光线追踪和光栅化。

这些算法所做的事情,都是希望在尽可能少的硬件资源条件下,把场景渲染得更加符合人类的视觉系统。

00:09:17

因此,渲染最直接涉及的是光。

00:09:19

是的,渲染最直接涉及的是光线的传播。

当然,光线传播是一个非常复杂的问题。

是。

因为光线遇到物体表面时,会受到不同表面属性的影响。大家以前可能学过,表面存在镜面反射和漫反射。

但实际情况可能比这更复杂。

许多材质介于镜面反射和漫反射之间,甚至还有透明材质。

有些材质还会具有花纹和纹理,例如房间里的这些大理石。

这些木板也使问题变得非常复杂。

当你越来越精确地建模光线传播方式,就可以越来越精确地还原整个数字世界呈现在观众眼前的样子。

00:10:02

我大致理解了:从本质上讲,肉眼看到的是一张图。

这张图里面有无数的像素。

是的。

点。

随后,光最终会形成呈现结果。

呈现出来的就是当时那个像素点位的效果。

它包括颜色和形态。人眼最终接收整张图片后,会在大脑中形成一个类似仿真的实际结果。

00:10:24

是的,你可以认为,渲染这件事就是在进行光线传输的仿真。

00:10:29

是的。但我好奇的一点是,我们在谈渲染、图片和图形学时,

似乎很少提到图片本身。

更多是在谈视频和3D,这是为什么?

例如,一键修图算不算是在做渲染?

00:10:44

一键修图不算渲染。

00:10:46

那么这个区别是什么?

我也可以改变它的光影效果。

00:10:49

这是一个很好的问题。

如果只是一个2D问题,通常不会被认为是在做渲染。

00:10:55

好的。

00:10:56

渲染与其他过程的区别在于,渲染一定涉及3D数据;把3D转化为2D的过程,在图形学中通常称为渲染,英文叫 Rendering。

如果从狭义的图形学领域来谈 Rendering,它指的是把3D以物理真实或风格化的方式转化为2D。

这个过程也可以渲染成视频。

Chapter 03

视频、3D 与多种空间表示法

11:25 — 17:19 · NeRF · 点云 · 体素
00:11:25

那我必须要问,视频与3D之间到底是什么关系?

如果按你的说法来理解。

00:11:29

这也是一个非常本质的问题。

这个问题其实很大。我们不妨把它聚焦在 AI 生成视频和 AI 生成3D上,这样可能更具体一些。

视频和3D之间最直接的关系,可能在于很多人会认为:如果能够生成一个围绕物体旋转一圈的视频,是否就可以通过这样的环绕视频,使用3D重建的方法把这个物体重建出来。

明白。

正因为如此,才会有人认为,如果 AI 生成视频的问题解决了,那么 AI 生成3D的问题也能够解决。

明白。

很多学术界的朋友,以及一些创业者,都会这样思考。

我个人的观点仅是一家之言。我认为这样做其实有些绕路。

其实有一条更好的路线,就是直接通过 AI 学习2D和3D数据。

这样可以不借助 AI 生成视频的方法,直接生成3D模型。

具体到视频和3D,它们之间有什么区别?

我认为比较棘手的一点是,3D的表达格式比视频更加复杂。

例如,表达一个3D物体时,可以采用多种表达方式。

00:12:39

可以使用神经辐射场,也就是 NeRF;也可以使用 Point cloud,也就是点云。那么,点云是什么?

点云就是空间中的一个个点。可以用很多点来表达这个3D物体,就像可以用很多像素来表达一张2D图像一样。

还可以使用体素。体素就是3D版的像素。

不知道大家有没有玩过 Minecraft。它实际上就是由一个个方块组成的,你可以用这些方块把物体堆出来。

00:13:04

但我可以理解,体素像是规模更大的点云。

00:13:08

体素和点云唯一的区别在于,体素是规则分布的。可以这样理解体素。

假设有一块豆腐。

现在把这块豆腐切成一块块豆腐丁。

嗯。

具体会如何操作?

横向切100刀,纵向切100刀。

然后再沿水平方向。

切100刀。

嗯。

对吧?

这样就得到了100×100×100,也就是一百万个小豆腐丁。

这是一种非常规则的表示方式。

嗯。

体素的好处是什么?

体素非常适合计算机体系结构。

嗯。

因为计算机体系结构特别适合处理这种横平竖直的结构。

它也非常适合神经网络,因为在做2D神经网络时,图像本身就是2D的。

也就是这种栅格。

嗯。

它由多少行、多少列构成。

因此,基本上可以把2D神经网络的组织方式无缝切换成3D,只是增加一个维度。

嗯。

只是计算量可能会更大一些。

嗯。

这是体素的表达方式。

00:14:03

它有些类似像素风格。

00:14:05

是的,体素是规则的,而点云是不规则的。

00:14:07

因此,如果这样理解,点云应该更高级,因为点云可以生成体素。

00:14:13

理论上确实如此。点云可能更通用,但与体素相比,它也有所损失。

体素因规则排列这一性质具有许多好处。

00:14:23

关于 nerf,你刚才已经提到过。今年大家也经常谈到 nerf 这个词。

是的。

因此,nerf 与点云、体素其实是

并行的关系,是吗?

00:14:31

NERF 的全名是 neural radiance field,中文名是神经辐射场。

它的作用是什么?

它使用一个神经网络。

这个神经网络用于表示场景中的每一个点在不同观察角度下的样子。

因为场景中的每一个点,从不同角度看上去都有各自的样子。

但是,这类数据量很大,需要有一种方式对其进行压缩。

神经网络恰好很适合完成这件事。

这就是神经辐射场成为当前研究热点的原因。

嗯。

与神经辐射场密切相关的一个概念叫做高斯散射。大家通常会把它看作 nerf 的替代品,或者认为它在某些情况下是升级版本。

高斯散射与神经网络没有任何关系。

嗯。

它使用的是空间中的一组点,每一个点都有自己的方向性和大小。

因此,它也可以像神经辐射场一样,表示一个场景的三维信息。

嗯。

点云与高斯散射也有一些关系,可以认为高斯散射是一种点云。

嗯。

但一般来说,点云的数据表示形式是一些独立的点。

00:15:43

人们较少直接在点云上优化点云,使其能够还原场景。

对于整个场景,点云一般是通过一些算法直接生成,并作为算法输出。

嗯。

但是高斯散射有一个优点:可以不断微调、不断调整,并在其基础上进行优化。

而在实时图形领域,即 Real time Graphics,比如玩游戏时,最常用的是三角网格。

什么是三角网格?

三角网格就是用一组三角形来表示模型。

在传统渲染管线中,通常以三角形为单位进行渲染。

这些三角形可能非常小、非常细微。

嗯。

只有三角形还不够,通常还需要表面贴图;贴图决定了表面的视觉效果。

例如送出一个圣诞礼盒,它的三角网格可以假设为一个完全的立方体。

立方体有六个面。

但是每个面都是一个正方形,该如何处理?

可以把每个面斜切一刀,使其变成两个三角形。

因此,实际上可以用12个三角形表达一个

00:16:55

立方体。

我现在突然想到,你们做这方面研究,几何学、线性代数都应该学得非常好。

00:17:01

你说得非常对。

00:17:02

这太复杂了。我的线性代数好像只考了60分。

00:17:06

线性代数其实是图形学中最关键的基础科学之一。

是。

如此。

当然,还没有说完:三角网格可以表达它的几何形态,而它表面的花纹则通过

纹理贴图实现。

Chapter 04

为什么网格仍是主流管线

17:19 — 19:57 · Mesh · 三角网格 · 贴图
00:17:19

明白。不过刚才还有一点没有讲,就是 Mesh。你们肯定使用的是 Mesh,对吗?

你们是叫 Mesh 一点 AI 吗?

00:17:26

对,Mesh 指的就是三角网格。

不过,Mesh 除了三角网格以外,还可以是四边形网格。

也可以是五边形网格。

这个问题非常复杂。

比如,如果你问一位动画师,他肯定会说需要四边形网格,因为四边形网格在制作动画时更方便。

对于建模人员来说,四边形网格的拓扑结构更好,也更容易编辑。

00:17:47

但听起来,三角形也可以拼成四边形,也可以拼成五边形。

00:17:50

对,你也很容易把四边形转换成三角形。

明白。

但是你把。

问题在于,当你把一个四边形网格转换成三角形网格之后,再对它进行编辑、制作动画,就会更困难一些。

是。

因为它失去了一些原有的几何信息。

00:18:07

因此,这几种技术大体上的优劣,以及目前市面上公认的选择方向是什么?

为什么你们会选择 Mesh?因为我们今天听到最多的还是 Nerve。

00:18:18

对。

明白。

首先,我们叫 Mesh 加 AI,并不是因为我们的技术中大量使用了 Mesh 相关内容;当然也肯定会用到,因为做图形的人几乎不可能不用 Mesh。

实际上,虽然现在有很多新的表达方式,但大家使用最多的仍然是三角网格。

这也包括手机游戏。

人们仍然会用三角形网格来表示其中的道具和角色。

嗯。

当然,你可能也看到一些创新者正在

尝试把 nerf 或者高斯散射这样的技术放入游戏引擎。

嗯。

这样做的一个好处,是可以把一些从真实世界中捕获的内容放入游戏。

这确实很有吸引力。

嗯。

但是,它距离在主流游戏中真正发挥重要作用仍然需要时间。

我认为未来可能会如此,但在五年之内,它也许还不会成为主流的表示方式。

00:19:20

今年我们也聊过一些 AI 生成3D的公司,尤其是在上半年,感觉大家比较纠结于一个问题。

这个问题就是它不能进入所谓的管线。

也就是说,这个内容生成出来以后,并不具备其中所需的内容;按照我粗浅的理解,里面需要有一些网状的点格之类的结构。

00:19:41

有了这些结构,才能够和现有图形的使用场景相吻合。

00:19:45

也就是它才会变得可编辑、可控。

才能有这个。

也就是可用。

那么,从今年一整年来看,你觉得整体的技术进展如何?

因为我们确实不断看到一些技术突破,以及一些新的开源算法出现。

Chapter 05

AI 生成 3D 的三类任务

19:57 — 24:29 · Text to Texture · Text to 3D · Image to 3D
00:19:57

是的,我认为进展确实非常快。

我在这个行业也有一段时间了,从来没有看到大家如此猛烈地研究同一个问题,也就是 AI 生成三 D 内容。

00:20:10

那么,进展快也是因为大模型带来的吗?

00:20:13

坦诚来说,我认为大模型在其中的贡献可能没有那么大。

因为 Large Language Model 更多是一个语言方面的模型。

相比之下,一些开源图像模型,例如 Stable Diffusion,为科研提供了很好的基础设施。

许多人在开展这类研究时,是将 2D 生成模型升维到 3D,因此 Stable Diffusion 这样的模型具有重要作用。

这类开源 2D 模型反而为学术研究带来了很大价值。

00:20:51

我们都知道,AI 生成文字或生成图片,本质上仍然是概率模型。

对吧?

生成视频也可以理解为像素概率在时间上的延续。

那么 3D 呢?

它也是类似的吗?

00:21:05

这是一个好问题。3D 基本上可以被视为 2D 的一个未来方向。

2D 有两个发展方向:第一种是加入时间维度,形成视频。

第二种是加入空间维度,形成 3D。

不过,虽然思路如此,真正解决这个问题时会发现,3D 会带来许多额外挑战。

例如,在 2D 中生成一张图像,假设分辨率为 512×512,这个分辨率尚可接受。

但如果要构建一个 3D 表示,就需要 512×512×512 这样的规模。

这会带来非常高的计算量。

嗯。

因此,在计算资源和数据都有限的情况下,研究者必须另辟蹊径,在限制中寻找可行方案。

嗯。

他们需要设计更好的算法。

00:21:50

嗯。

我们今天看到的生成 3D 的方法大致有四种。

第一种方法出现得可能比较早,据我所知,你们也较早开始做这类工作,也就是改变贴图的方法。

00:21:59

给定模型去绘制贴图。

00:22:02

这项技术可以通过更换贴图来改变各种材质和光线效果。

是的。

00:22:07

首先,我认为这里涉及两个问题。

第一个问题是,什么样的3D 生成式 AI 产品才算好的产品?

第二个问题是,3D,甚至 AI,到底应该解决哪几类任务?

我先谈第二个问题,也就是3D 的 AIGC,甚至 AI。

它应该解决什么任务?

我认为主要有三个任务。

第一个任务是从文字生成贴图。这是我们最早开始做的方向,也是目前市场上最有竞争力的产品。

我们的贴图可以达到4K的分辨率,也具备很好的风格控制能力。

嗯。

00:22:43

Texture 指的是从文字生成一个……

从文字生成贴图。

Texture 这个名称本身已经很能说明它所指的内容。

也就是材质之类的内容。

00:22:51

是的,也就是材质纹理。

嗯。

这是第一个任务。第二个任务是从文字直接生成3D模型。

嗯哼。

它与从文字生成纹理的区别在于,从文字生成纹理仍然需要用户提供三维模型。

嗯。

可以理解为,我拿到一个白色雕像,然后用水彩笔在上面绘画,只改变它表面的样子。

那么,从文字生成3D是什么?

或者说 Text to 3D,它要做的是同时生成模型和贴图。

因此,这件事的难度会更大一些。

这一块我们也在做,并且也是目前市场上最领先的产品之一。

嗯。

这一部分的主要应用场景,是用于生成影视和游戏中的中远景内容。

例如这类道具。

嗯。

这类应用没有问题。例如,远处有一座小房子,桌上有一个苹果,观众通常不会凑近查看。原本需要大量这样的道具来填充场景,现在可以用 AI 生成。

这是任务二:从文字生成 3D。

任务三是从图像生成 3D 模型和贴图。

这个问题与从文字生成 3D 的难度相近。

00:24:03

在这一方向上,大家之所以希望用图像生成 3D 模型,而不是用文字生成,

最主要的原因是图像更加可控。

嗯。

例如,要描述一个角色的正面长相,用文字描述很困难;如果有一张照片,就容易很多。

嗯。

这一领域的学术研究也很多,我们也有一个线上产品。当然,这可能不是我们最近主要投入精力的方向。

Chapter 06

从单图猜背面到数据瓶颈

24:29 — 27:53 · 多视角数据 · 3D重建 · 数据稀缺
00:24:29

传统做法之一是,在电商场景中,对一双鞋不断拍照,拍几十张照片,最后合成一个 3D 物体。

这种方式其实可以实现,只是成本很高。

00:24:44

这属于 3D 重建。

嗯。

其实成本也没有那么高,这项技术十年前就已经很成熟了。

嗯。

也就是拍摄一组照片,但它对照片的要求很高。

嗯。

拍摄必须在受控条件下进行,相机角度也要有约束。

00:24:58

有点像《黑客帝国》里的子弹。

00:25:00

对,有点像子弹时间。

需要布置一个相机阵列,或者把相机放在非常稳定的位置,不能拍糊。

00:25:07

是的,但我们刚才讨论的情况是,只提供一张照片。

对,只提供一张图。

随后,它进行的仍然是一种概率预测,也就是预测对象。

它的其他各个面是什么样子?

00:25:15

对,AI 需要推测背面是什么样。

00:25:18

那么,它怎么能够推测出来呢?

它首先需要理解这张图的内容吗?

还是通过其他方式?

00:25:22

这是很多人都会提出的问题。

首先,它会尝试理解对象正面的样子。训练 AI 时,数据集里会包含一种叫做多角度数据集的内容。

这个多角度数据集并不是用单张图片训练,而是把正面和背面一起用于训练。

嗯。

给它正面,它生成背面;给它背面,它生成正面。

因此,它可以通过正面图像预测出从其他角度看到的图像是什么样子。

00:25:53

不过,大家一直在说,现成的 3D 数据和资产仍然相对较少。

很少。所以目前来看,数据是最大的局限。

00:26:03

目前来看确实如此。我可以举几个具体数字。

例如,2D 数据集 Lion 有 58 亿 5000 万张图。

这是一个巨大的数据集。

但是,如果看包含 3D 模型的数据集,情况就不同了。

如果查看 Sketchfab 这样的 3D 模型网站,它也只有 500 万个模型。

嗯。

你想。

500 万和 50 亿。

嗯。

两者之间相差约三个数量级。

嗯。

而且 Sketchfab 的数据并不能直接使用,因为其中涉及版权问题。

是的。

对吧?

因此,这里面的数据差距很大。

00:26:34

是的。但从另一方面看,我认为 3D 仍然主要是 to b 的业务。

更多人是在制作游戏,或者从事建筑等其他领域的工作。

但是图片和视频存在 ugc。

这是另一类情况。

对吧?

3D 其实很少有 ugc 的概念。

00:26:50

是的,这也是我们思考较多的问题。坦率地说,3D 资产市场只有 2D 资产市场的。

这取决于统计口径。目前来看,大概可能是 1/10~1/20 的规模。

至于 3D 是否存在 ugc。

我们其实也做了一些探索,有些地方是存在的。

例如在游戏领域,我们和合作伙伴做了全球第一款 3D 的 AIGC 手游。

我们提供的功能是:过去你在游戏里穿的衣服,都是美术老师提前画好后供你选择。

嗯。

现在你可以输入提示词,然后由我们把衣服生成出来。

这是一个典型的 UGC 场景。事实上,UGC 场景更适合这类 3D 技术,因为现在的 3D 技术还不太成熟。

反而在 UGC 场景中,用户对质量的要求没有那么高。大家更多是觉得能够生成 3D 内容很有意思,因此愿意使用。

如果真的把它放在 professional 的专业场景中。

坦率地说,3D 还达不到大家的要求。

Chapter 07

3D 消费场景等待硬件拐点

27:53 — 30:32 · UGC · VR · Vision Pro
00:27:53

这里我认为,3D 是否跳过了一个步骤:图片和视频都有一个从专业工具向 c 端工具演进的过程。

这是一个过程。

首先,C 端先出现了美图秀秀这样的工具,用户可以快速自行修图;后来又出现了剪映这样的工具,用户可以快速自行剪视频。

但 3D 仍然是一整套非常专业的工具。

现在中间缺少一个 C 端用户可以自行使用的工具环节,而是直接跳到了 AI 生成 3D 的阶段。

00:28:20

我觉得美图秀秀和剪映都有相应的专业产品。比如,美图秀秀对应的可能是 Photoshop。

PS,是的。

剪映对应的,可能是之前的 Adobe Premiere、AE、PR、Premiere 这些工具。

是的。

至于 3D,现在大家还停留在 Blender、玛雅、Max 这样的专业工具阶段。

00:28:39

是的,这些都是我没有听过的工具。

对吧?

00:28:42

大家可能离这些工具比较远。

但 3D 面临的一个问题是什么?

让普通人操作美图秀秀、剪映,他们还是能够学会的。

只要界面经过良好设计,普通人还是能够学会。

但是,3D 建模并不是所有人都愿意投入精力去尝试的事情。

而且,很难把 3D 建模变成所有人都能接受的东西。

不是所有人都有空间感。

00:29:08

是的,而且我觉得主要原因是它确实没有太多应用场景。

这种东西是不是必须在 VR、AR 里实现?

00:29:15

是的,我觉得现在一个很大的问题是,看看所有 VR headset 的情况。

VR 头显有多少 MAU?

也就是月活,大概大几百万。

嗯。

但是,这与手机等设备的月活相比,差距很大。

是的。

大家会有什么期待?

一个很重要的问题是:到了2026年、2027年、2028年,几年之后,Vision Pro 是否会成为类似 iPhone 的产品。

00:29:43

你认为会吗?

00:29:43

我认为可能会。

00:29:45

是的,我也这样认为。

00:29:46

我认为有这种可能。如果情况确实如此,可以设想一下:如果日常使用 VR headset 的 MAU 达到1亿,那么到那个时候会发生什么?

它可能会催生出每个人日常生活中都会用到的3D资产。

是的。

这样一来,它就有了应用场景。

是的。

因此,我认为现在这个时间点很好。现在是2023年。

我们可以在2027年再回来做一期,四年之后再做一期,看看今天说的到底是否正确。

00:30:14

2026年吧,争取2026年。

00:30:16

争取2026年。

因为你看 iPhone 和 iPhone4中间其实是隔了三年的时间,iPhone07年,iPhone4是。

2010年,是吧?

移动互联网这场革命是什么时候开始的?

是在2010年。

所以,如果把 Vision Pro 看作 iPhone,其实也就是三四年,或者两三年的时间。

Chapter 08

从物理方程转向数据驱动

30:32 — 34:50 · 科研路径 · AI结合 · 商业机会
00:30:32

是的。不过你之前其实一直在做一些视频渲染,或者一些与游戏相关的3D渲染工作,对吧?

你为什么会在这个节点想到要做 AI 加3D生成这件事?

00:30:42

这是一个很好的问题。

其实,我自己的经历中有这样一个转变。刚才也提到,最早的时候,我是一个非常正统的。

图形研究者。

嗯。

什么是正统?

我不太相信数据驱动的方法。

好的。

我更相信渲染方程,也更相信牛顿、麦克斯韦、拉格朗日留给我们的体系。

00:31:03

线性代数。

00:31:04

是的,就是线性代数的体系。

后来在实践过程中,我也意识到,这种试图精确刻画世界的方式本身存在局限。

例如这些方程。

很多东西很难测量,也很难建模。

是的。

在这种情况下,有时用数据驱动反而是更好的方式。

在读博士期间,我既研究图形学,也研究图形学与 AI 的结合。

这方面大约5年的经历改变了我的看法。

我最早做科研是在2016年,到现在已经过去7年。

现在,我们团队拥有一个独特的机会,我个人也拥有这样的机会。

我既熟悉传统图形领域,也熟悉人工智能领域。

嗯。

而在这两者之间,恰好存在一个在商业化层面听起来很有前景的方向,我们相信这件事。

它有市场需求,而且我认为我们整个团队在这个方向上非常有竞争力。

因此,我们现在非常坚定地投入 AI 生成3D内容。

00:32:08

你刚才提到自己看到了一个非常明确的市场需求,这个需求是什么?

更多来自游戏行业吗?

还是。

00:32:14

我认为,从传统图形行业来看,无论是游戏还是影视,大家对3D模型的需求始终存在。

嗯。

我曾向一些公司了解情况。

我举几个数字。第一个是3A游戏,其中50%的成本都是3D美术。

尤其是开放世界的MMO RPG这类游戏,需要的资产越多,制作资产的成本就越高。

现在这些资产是如何制作的?

它们可能会外包给一些资产外包公司。

按一个人一天1000块钱计算,制作游戏里的一把剑、一个盾牌,用两周时间就要投入一两万。

一些制作更精良的角色,成本可能会更高。

因此,整个游戏行业和影视行业,对这类3D资产的需求都很高。

如果只看专业市场,整体大概是一个30到100亿美金的市场。

当然,作为一个AI生成的3D资产产品,不可能一下子吃下全部市场。

一定可以找到一些细分领域,先在这些领域做深做透。即使只占100亿市场的1%,也足以做出一个Midjourney级别的产品。

00:33:28

我刚才就想问你,你认为3D这项技术发展到Midjourney或者SD的程度,大概需要多久?

此外还有哪些挑战?

00:33:35

我想从市场和技术两方面来谈。

市场方面,我们刚才提到,现在消费级3D需求的市场其实还比较小。

例如,我发给你一个3D模型,你知道如何打开它吗?

00:33:49

你应该打不开。

00:33:50

这就是现在3D消费级市场的现状。

这种情况什么时候会改变?

我认为也许要到26年,等一些愿意尝鲜的人都拥有一台Vision Pro,或者小米版的Vision Pro能够普及以后。

届时,大家不会再满足于只看图片和视频。

大家一定会希望观看可交互的3D内容。

到那时,需求和供给之间就会出现很大的差距。

市场方面,我认为乐观来看需要两三年时间。

在技术方面,我认为我们只解决了10%的问题。

目前,AI 生成的3D模型仍有许多问题尚未解决。

从专业角度看,uv、拓扑、生成模型的质量、贴图质量、可控性以及速度等问题,都还没有得到解决。

当然,我认为这个领域进展很快,我们自己也在加大对这一方向的投入。因此,剩下90%的问题,可能也就是两三年的时间。

好的。

因此,我对此比较乐观。

Chapter 09

3D 版 Midjourney 还缺什么

34:50 — 36:01 · 市场需求 · 技术成熟度 · 消费入口
00:34:50

那么,你认为视频和3D哪个会发展得更快?

00:34:53

我认为视频会更快。不可否认,视频的市场比3D大很多。

嗯。

视频已经有消费场景了。

但是就技术成熟度而言,我认为视频和3D半斤八两。

现在大家还在解决如何把生成的两秒钟视频扩展到8秒钟这样的问题。

00:35:09

是的。但视频应该仍然有一些小技巧,比如通过插帧、补帧、AI 剪辑等方式,做出类似效果的最终结果。

00:35:19

可以。但是核心问题在于,大家之所以希望生成视频,仍然是希望视频有故事和逻辑。

如果只有几秒钟,那么无论怎样插帧,也很难呈现出故事的逻辑。

00:35:31

不过,现在有很多公司在做视频相关的应用,比如换脸、换语言、对嘴等。

在3D上,能否基于已有的内容快速变出一个模型?

00:35:41

可以是可以,但是没有应用场景。

00:35:44

这也是场景的问题,对吗?

00:35:45

对。

是的。

如果有 VR,也就是如果每个人都有一台 VR 设备,

那么做这件事就是有意义的。

比如,我拍一张你的照片,把你变成一个 q 版头像。

嗯。

这方面肯定存在需求。

但目前主要的问题是,大家还没有很好的 3D 消费场景。

Chapter 10

科研创业者如何寻找真实需求

36:01 — 43:35 · 创业 · PMF · 用户付费
00:36:01

过去几年里,正如开头提到的,你经历了科研和创业两件事。

对。

而且你当时。

中间正好处在那个转折点,你做了用图形实现的项目,那算什么?

你用图形编程语言快速做出了一个冰雪奇缘的效果,当时非常震撼,大多数人应该都看过。

00:36:18

对,当时大家很喜欢,我也没有想到。

其实我自己写了一篇文章,初衷只是做一次技术分享。

大致背景是,我那个时候拔了智齿。

拔完智齿以后牙疼,也写不动代码了,于是我就想,能不能把这段科研经历稍微写一写。

我也没想到,大家会这么喜欢这样一个关于科研工作者的、非常枯燥的故事。

00:36:45

所以这几年做下来,你觉得这两种生活和体验的感受如何?

00:36:49

我觉得创业很难。

00:36:52

比科研和发论文还难。

00:36:54

比那些难多了,难得多。

00:36:56

或者如果问你,最终是否后悔创业这件事呢?

00:37:01

我觉得不后悔,至少目前为止不后悔。

我没有像老黄那样。老黄说,如果再选一次,可能就不会创立英伟达了。

00:37:10

他都已经做成这样了,还可以这么说?

00:37:12

对,是这样。

我觉得至少目前来看,我还是很享受。

创业的这个状态中途确实有一段时间让我觉得压力比较大。

嗯。

那段时间,家里有老人去世,也面临这个方向的选择。

是。

创业初期也出现过一些问题,主要是因为缺乏经验。

是。

但是我认为自己现在已经走过了这个阶段。尤其是开始做 Mesh 以后,我非常享受这件事,团队也很享受,因为它带来了很好的反馈。

00:37:46

是的。我认为这件事在某些层面上又回到了你之前擅长的事情和模式。

是的,可以这么说,它更偏底层和技术。

00:37:56

是的。反而我认为技术方面对我们来说是比较容易的事情。

是。

00:38:01

商业化到底应该如何推进?

如何找到 PMF 始终是一个挑战。

是的。

00:38:06

我们必须时刻思考,要 build 一个对世界有用的东西,而不是只 build 我们自己想做的东西。

是。

我认为后者是一个很大的误区,因为如果 build 自己想做的东西,就非常容易获得这种正反馈。

是。

比如今天写了一段 code。

00:38:23

然后自己感到开心。

00:38:24

自己会很开心。

但是,你如果。

就会发现很多问题并没有好的答案。

00:38:31

是的。AI 这一波浪潮中,其实有非常多的教授、PhD 学生以及科研人员出来创业。

那么,你有什么建议可以给他们吗?

00:38:41

我认为有几点。第一点,还是要尽早思考市场需求。

我经常谈到的一个问题是,这两年创业给我带来的感悟是什么。

我最大的感悟是,why 可能比 how 更重要。

科研领域也是如此。

在科研界,大家都会强调要 work on an important problem。

也就是在一个重要的问题上开展工作。

00:39:08

也就是说,选题很重要。

00:39:09

选题非常重要,必须去询问用户。

应该询问用户有什么问题,而不是强加给用户,认为用户应该有某个问题。

不能只是自己认定用户存在这个问题。

用户可能比较 nice,会告诉你确实有这个问题。

但真正做起来之后,你会发现自己被这件事带进了坑里。

00:39:24

所以,答案其实仍然是商业化。

也就是说,在询问用户时就让他付钱;如果他真的付了钱,情况就还好。

00:39:29

更好的问题可能是:你会为什么样的东西付钱?

或者直接把东西交给用户,让他付钱,观察他是否愿意支付。

00:39:36

正如你刚才提到的,中国的用户真的太 nice 了。你问他是否会付钱,他很多时候会说会;但当你真的让他付钱时,情况就不同了。

00:39:44

他可能宁可去买一杯二三十块钱的喜茶,也不会为你的软件付钱。

这是一个相当大的挑战。

嗯。

所以我认为,从科研领域出来的人,有时必须忘记自己过去的经历。

第一,是忘记自己在具体科研过程中解决过的一些问题。

第二,是忘记自己从科学家角度形成的对世界的理解。

前者要防止的是什么问题?

例如,我博士期间研究的问题可能是 a b c,但我去询问了一圈用户之后,他给我的答案可能是 d e f。

这与我研究的 A B C 完全不同。

这时我到底应该怎么办?

我到底是强行继续做 A B C,不撞南墙不后悔吗?

或许我认为,另一种心态会更好。

这种心态是:

作为科研人员,如果我能把 a b c 做好,就一定也能把 d e f 做好。

嗯。

并且,d e f 才是用户真正需要的东西。

00:40:34

但我很同意你刚才讲的一个观点:很多做投资的人,其实是从管理咨询转过来的。

嗯。

而管理咨询的那套逻辑,其实来自科研。

也就是 hypothesis driven,即假设驱动,以及如何做 AB test、如何做实验。

是的。

所以,如果你是一个好的科研者,有时未必需要向商业人士学习;更重要的反而是如何把科研的那一套

理论和逻辑用到极致。

00:40:59

我认为科研工作者其实有自己的优势,比如逻辑清楚。

是。

比如,大部分科研工作者比较客观。

但我常常发现,大家对实验比较客观。

嗯。

但对自己有时没有那么客观。

嗯。

比如,你很难改变自己的一些想法。

但是创业要求你非常及时地做出很多调整。

作为 CEO,你就像一个赛车手,掌握着方向盘。道路肯定不是直的,你必须及时转弯。

这也是很多科研工作者会遇到的问题。我在科研界时,可能会对一件事很执着,有某种执念,一定要按照某种方式去做;但创业并不一定如此。

还有一个情况是,很多科研工作者相对更内向一些。比如我自己,就是非常内向的性格。

00:41:44

但我觉得,你已经比大多数人,尤其是大多数科研人员做得更好了。

00:41:47

坦白说,和你聊了这两个小时,我已经感到非常疲惫。

连续聊两个小时之后,我需要休息。

我需要一整天才能恢复过来。

但因为我从事这样的岗位,我会提醒自己,不要总是以让自己舒服的方式度过每一天。

你需要不断走出自己的舒适圈,去做那些让自己没有那么舒服的事情。

有时候,那些让自己没有那么舒服的事情,反而是对整个团队、整个公司以及所有利益相关者更负责任的事情。

是。

这个过程可能是痛苦的,但如果不逼迫自己去做这些事,就不可能取得很好的成绩。

但实际上,如果让我休假,我最想做的是一个人把自己关在小黑屋里写代码。

那才是我最舒服的状态。

00:42:25

明白,完全理解。

现在你们已经发布了一版产品,是吗?

也就是说,如果大家想用,现在已经可以使用了。

00:42:31

对,大家可以直接在 Mesh 一点 AI 这个网站上使用。

00:42:34

是。

但我觉得,AI 生成 3D 听起来是一件需要延迟满足的事情,而你所做的是整个世界的一块基石。

我认为这当然可以这样说。

00:42:44

从愿景层面来说,我们希望每个人都能创造一个属于自己的虚拟世界。

这与我们一开始所说的图形学非常吻合:图形学是一门帮助大家创造更好的虚拟数字世界的学科。这也是很多人的梦想,每个人都希望只说一句话,就能把整个世界创造出来。

我认为现在这个时间点是一个很好的机会,而且 AI 生成 3D 也是解决这个问题的最重要途径之一。

最重要的途径之一。

00:43:11

上帝说的第一句话是不是“要有光”?

00:43:15

很对,上帝说“要有光”,所以我们先解决了渲染的问题。

有了光之后,就需要有山川、森林。

这就是 AI 生成内容的问题。

是。

00:43:27

我们感谢袁明。

00:43:29

啊。

谢谢曲凯老师的 podcast,我也很高兴能够和大家分享这些内容。

原始逐字底档(ASR 未润色)
Something there 那我们今天呢很开心请到了胡渊鸣。
呃,他是 mit 的图形学的博士,过去十多年吧,应该说一直是在做图形学相关的事情。 然后最近呢刚发了一个 AI 生成3D的。 产品叫 Mesh,他就是也是 Mesh 点 AI 的创始人啊。 渊铭跟大家打个招呼。
嗨,大家好,我是渊铭,很高兴今天能和大家一起交流分享,也感谢曲凯老师的邀请。
对,我们今天其实最主要的请袁明来,就是想聊一下整个的图形学,包括 AI 生成图片、视频、3D 这一整套的一个大的逻辑跟发展的脉络。 啊,尤其是 AI 生成3D这块是,叶明现在比较核心在在做的这么一个事情,所以我们可能会深入地聊一下 AI 生成3D这件事。 啊,然后你最早其实是在国内读的本科是吧? 就是学技术。
对,呃,我是13年到17年是在清华的姚班学计算机,然后本科毕业以后呢,就到了波士顿那边,麻省理工学院开始读博士。 然后读博士,呃,也比较顺利吧,呃,四年不到,三年半左右就博士毕业了。
那是非常非常快。
对,是是挺快的。 然后毕业以后呢,两年半的时间呢,在一直就是做图形软件这方面的产品和创业方面的工作。 所以我觉得我可能比较有意思的经历就是学术界和创业界这两边的事情我都知道一些。
嗯哼。 你本科其实就在做图形学了吗? 对。 到底什么是图形学?
哇哦,其实大家最早对于图形学的理解就是真实感渲染。 嗯。 什么意思呢? 我给你一些3D的数据,你给我把它渲染成一部电影。 越真实越好。 但是这部分的内容呢,坦率来说,到可能2000年左右,再往后大家就发现这块能做的本质上的突破。 它就越来越少了。 嗯。 那大家逐渐的兴趣呢,就是到很多很多其他的地方。 比如说我现在能渲染的比较好了,那我怎么样? 把仿真啊,这些东西能够做得更好。 比如说我现在要炸一个楼,我不炸了,我不继续实拍炸这个楼了,我现在变成我用一些数理方程来描述它。 然后呢这个热潮也持续了一段时间吧,然后后来到了2012 13年的时候,那个时候 AlexNet 这样的工作出来了,然后大家对 AI 的关注度也逐渐上去了。 图形方面的东西和 AI 结合的就越来越紧密。 所以我觉得嗯图形学它可能不是一个具体的技术。 它是一个由很多的应用去催生,演化出来的一个学科。
我能不能理解图形学就是还是大家在试图怎么样用技术更好的去把控,或者去修改。 对外的一个图形的输出的感觉。
对,我觉得可以这么理解,因为始终呃不管是现在显示屏,还是以后的 VR AR 你都是要输出成视觉的东西,给大家能看到。 对吧? 所以图形学很多的东西就是在研究我如何去,呃,更好的合成这样的数字内容。
OK,所以它就必然会分成硬件跟软件两部分。
对,这个非常对。
嗯,然后软件就是包括你讲的渲染和模拟仿真等等,可能更多的是算法层面的。 是的。 然后另外一部分就是硬件,那就是比如说显卡这一部分。 对,我顺便想问下游戏里的。 其实历史上那种各代的游戏引擎,它本质上也是图形学吗?
对,其实实时渲染是图形学里面特别重要的一个内容,也要做好的实时渲染。 基本上都要用到游戏引擎。 典型的比如说像 Unity 啊,像 unreal engine 啊,这些都是用来做实时渲染的一个游戏引擎。
我觉我们是不是能快速地把这几个概念给大家讲一下,我觉得大多数人可能大家经常听到。 CPU、 GPU 也经常听到渲染、仿真呃这些东西,或者也经常听到各种引擎,到底它们是干嘛的?
对,我觉得就一个目的吧。 就这个目的就是给大家合成一个更加真实的、更加沉浸感的数字世界,通常是3D的。 图形学做了很多的研究,都是在朝着这个方向。 这个目标去努力。 嗯哼。 那么,呃,你刚才提到了几个概念呢,有这种硬件,对吧? 比如说 CPU 和 GPU 那么 GPU 之所以呃会诞生,其实是因为它比 CPU 有更大的吞吐量。 更容易去做渲染、仿真这方面的一些事情。 但是最后发展到 AI 变成了 GPU 上面的一个很重要的一个 Workload 硬件方面大概是这样,然后软件方面呢,其实有很多的大家用到的创作软件。 呃,这里面其实包括用于影视行业的一些创作软件,主要这些都是离线图形学了, offline computer graphics 他做的事情呢,就是我把这个东西给渲染好,比如说我就渲染出来是一个呃 MKV 或者 MK MP4格式的一个文件。 你就可以去呃固定的播放,它是没有交互属性的。 那这类软件呢,就包括很多的,呃,传统意义上来说,像3DMAX。
Maya Blender Houdini 这类一般叫做 DCC 软件。 主要是影视啊、广告啊这种行业的应用,然后再到后面呢? 有一些他们的功能也变得更加的能够被实时应用。 比如说,Houdini 里面很多的这个程序化建模的功能,其实在游戏引擎里面也可以用上。 另一类软件呢,就是这个游戏引擎了,游戏引擎它的特点什么? 它是可交互的。 因为它可交互,所以带来了很多的新的挑战。 比如说你渲染得是实时,比如说我举个例子,影视里面的一些场景。 你是可以直接把它全部加载到内存里面的。 但是游戏又不能这么干,游戏它的特别是一些开放式的游戏,它的这个整个的地图啊,它的场景是非常非常大的,你很难说我把整个场景全部加载到你的机器里面去。 在这种情况下就会呃使得游戏引擎,它作为实时图形渲染的里面一个重要的角色,它要去做的挑战就非常多,比如说呃,你可能离线,你有一个小时渲染一张图,但是你实时呢。 有16毫秒的时间。 嗯。 渲染一张图,这中间就是千倍万倍的一个计算能力的差异。
就解决这两个问题。 是你的条件啊,你的产出的要求啊是不一样的。 所以软件其实分为离线的软件和实时的软件。 还有一类的可能就是算法了,那算法呢? 往往,比如说 nerf 比如说这个光线追踪,比如说这个刚才提到的高斯散射啊,这样的算法,它永远是在不断的去迭代的。 那它当然是可以运行在 cpu 上,也可以运行在 gpu 上,可以用于离线,也可以用于实时。 但是不同的算法它会有不同的要求。 所以算法软件硬件,当然还有一块可能是它的商业生态。 这四个我觉得,嗯,它中间的关系可能是一个相互耦合的关系,把它完全分开。
但这些年你觉得整体图形学的进展,更多的是硬件驱动,还是软件或者算法驱动?
很好的问题,我只能说它是相互的。 嗯哼。 就是硬件和软件它的发展永远是处于一个这种相互迭代的状态。 我们就举这个 GPU 诞生这个例子吧,当你有了 GPU 以后。 呃,大家突然发现能渲染的东西变多了。 我以前可能渲染5个三角形,我现在能渲染500个了,5000个,5万个。 对吧,我就可以有新的软件和算法。 去利用好这个硬件给我提供的这样的资源。 去把这个东西给它渲染出来。 那么当你的算法需求逐渐变高了以后,那硬件它可能说哎呀,我现在不行,我只能渲染5万个三角形。 但是我的软件里面要要求我能渲染500万个。 那怎么办呢? 他只能不断优化这硬件。 在摩尔定律的不断推动下,他硬件可能是越来越厉害,越来越猛的。 那么有了这些硬件的更新以后呢? 那算法又会去想,哎,是不我可以做点什么别的? 嗯。 整点花活,因为大众对于游戏的画面的需求呢,它其实是不断地去抬高的。 由于你需求不断地提高了,那它的硬件和软件总会去不断地迭代。 所以你可以认为它是一个这个左脚踩右脚,一步一步爬得越来越高这样的一个状态。
是,哎,我们刚才其实提了一堆渲染,所以你能不能再简单解释什么是渲染?
啊,对,渲染其实是一个很经典的任务。 它做的事情呢,就是你的场景里面有一些3D 的模型。 那你现在想把它渲染成一张有真实感的2D 的。 图像,其实他就是在做这个事。 这个事有什么难的呢? 因为你在呃现实世界中啊,你这个光线会在这个场景中不断地弹射。 比如说,当你去打开一盏灯的时候,并不是只有这个灯照到的地方它会变亮。 嗯。 你是整个房间都变亮了。 嗯。 为什么呢? 因为这个灯发出来的光子,它照亮这个物体以后,这光子它会继续的在整个空间里面去传播。 所以这带来了巨大的计算量。 那么这就带来了很多渲染算法方面的研究,比如说光线追踪,比如说光栅化。 他们所做的事情呢,都是希望在尽可能少的硬件资源前提之下,我把这个场景渲染得更加符合人类的视觉系统。
所以渲染其实最直接的就是光。
对,最直接的就是光线的传播。 当然光线传播这个是非常复杂的一个问题。 嗯。 因为光线它如果遇到物体表面的时候,它会根据这个不同表面的属性,大家可能在以前学过表面有这个镜面反射和漫反射,对吧? 但实际情况可能比这个更复杂一些。 它可能有一些,很多材质它是介于镜面和漫反射之间的,甚至有透明的材质。 甚至呢,有些材质它会有一些花纹和纹理,比如说咱们房间里面这些大理石啊。 这些木板啊,它其实是特别复杂的一个问题。 当你去越来越精确的去建模这种光线传播的方式了以后,那你就可以越来越精确的去还原整个数字世界,它呈现在你的观众眼前的样子。
对,我好像大概摸到点门路,就本质来讲,肉眼看到就是一张图,对吧? 这张图里面有无数的像素。 是的。 点。 然后呢,其实光最后它。 呈现出来的也就是当时那个像素点位的一个效果,对吧? 什么颜色,然后什么样一个形态,然后最终人眼把这整个图片吸收以后,它在脑子当中形成了实际的一个类似仿真的一个结果嘛。
对,你可以认为渲染这个事情呢,就是在做光线传输的仿真。
是,嗯,哎,但我好奇的一个点就是你看我们说渲染,说图片,说图形学。 但好像很少提到图片本身,对吧? 都是在讲视频,讲3D,这个是为什么? 就比如我一键修图,算不算在做渲染?
一键修图不算做渲染。
那这个区别是什么呢? 我我也可以改它的光影效果。
对,呃,很好的问题。 你如果只是一个二 d 的问题,那它一般大家不会认为它是做渲染。
OK。
渲染和其他东西的原则呢,就是呃,渲染它一定是有3D的数据的,把3D转化成2D,这个过程呢,在图形学里面一般叫做渲染,或者英文叫 Rendering。 呃,如果你狭义意义上面说图形学领域里面的 Rendering 这个事情的话,那它其实就是指把3D以物理真实或者风格化的方式变成2D的。 这种竞争或者说渲染成视频也可以。
那我不得不问,视频跟三体之间到底是一个什么样的关系呢? 你就这么讲的话。
对,这也是特别本质的一个问题。 这问题其实很大,我们要不把它聚焦在 AI 生成视频和 AI 生成3D上面,这样可能更具体一些。 视频和3D它最直接的一个关系可能是大家会觉得如果说我能生成一个绕这个物体转一圈的视频,我是不是就可以通过这样的所谓的一个环绕视频,把这个物体给用3D重建的方法给它重建出来? 嗯哼。 这个是的,为什么会有人觉得如果 AI 生成视频能解决了,那么 AI 生成3D也能解决。 嗯哼。 很多学术界的朋友,还有也有一些在创业的人,他会这样去想。 我自己的观点,就一家之言,我感觉这样其实有点绕路了。 其实你有一条更好的路线,去直接从,通过 AI 去学习2D和3D数据。 你可以直接不用这个 AI 生成视频的方法去生成3D 的模型。 呃,那具体到视频和3D,它们俩有什么区别呢? 我觉得可能比较让人头疼的事情是3D 它的表达的格式和视频比起来更加的复杂。 比如说3D,你表达一个3D物体,它有很多种表达的方式。
你可以用神经辐射场,用 NeRF 可以用 Point cloud 用这种点云,点云是什么呢? 就是空间中一个一个点,那你可以用很多点把这个3D 物体给表达出来,就像你可以用很多像素把2D 的图像给表达出来一样。 你呢还可以用体素,体素就是3D版的像素。 我不知道大家有没有玩过 Minecraft 它其实就是一个方块一个方块,你可以把这物体堆出来。
但我能理解体素是一个更大的点云的感觉。
呃,体素和点云唯一的区别就是体素它是规则分布的,你就想象体素是什么呢? 就是你有一块豆腐。 现在把这个豆腐呢,给它切成一块一块的豆腐丁。 嗯。 你会怎么做? 横切100刀,竖切100刀。 然后再水平的。 切100刀。 嗯。 对吧? 那你这样就得到了,100×100×100,一百万个小的豆腐丁。 那它是非常规则的一种表示方式。 嗯。 呃,体素有什么好处呢? 它对计算机体系结构是非常的合适的。 嗯。 因为计算机体系结构特别喜欢这种横平竖直的东西。 并且呢它和神经网络也是非常适应的,因为你再去做2D的这种神经网络的时候,你的图像就是2D的。 这种栅格。 嗯。 横多少行多少列,对吧? 所以你基本上可以把2D的这些神经网络的组织,无缝地给它切换成3D,无非就是加一维嘛。 嗯。 只不过计算量可能会大一些。 嗯。 这个是体素的表达。
就有点像素风的那种。
对对对,它是规则的,点云它是不规则的。
所以点云应该更高级嘛,因为点云可以做出来体素嘛,如果这么讲的话。
呃,理论上是这样,它可能确实是更通用的,但是它也失去了体素。 由于体素的这种规则排列的性质带来的很多的好处。
然后 nerf 呢,你刚才其实提了一下,然后大家其实今年经常讲 nerf 这个词嘛。 对。 对,但所以 nerf 你就跟点云跟体素其实是。 平行的是吧?
NERF 呢全名呢叫做 neural radiance field 中文名叫做神经辐射场。 它做的是什么事呢? 它是用一个神经网络。 去表示这个场景里面的每一个点,从不同角度观察时候它的样子。 因为这个场景里面每一个点它都有自己的不同角度看上去的样子。 OK,但是这个数据是很大的,你需要一个东西去压缩它。 神经网络恰好就很适合做这个事。 OK,所以这是为什么神经辐射场是大家现在经常研究的一个东西。 嗯。 呃,和神经辐射场很相关的一个东西叫做高斯散射,大家一般会把它认为是 nerf 的一个替代品,或者说有些情况下是一个升级的版本。 其实高斯散射呢,它就和神经网络没有任何关系了。 嗯。 它就是用一堆在空间中的点,然后每一个点呢有自己的,应该你可以认为它有一定程度的方向性和大小。 那所以它就也可以像神经辐射场一样表示一个场景的三 d 的信息。 嗯。 点云其实和高斯散射也有一些关系,其实你可以认为高斯散射是一种点云。 嗯。 但是一般来说呢,点云它的数据的表示的形式呢,它就是一些独立的点。
大家也比较少在一个点云上面直接去优化这个点云,让它能够去还原。 整个场景,一般点名就是通过一些算法直接给吐出来,直接这个作为算法的输出给输出出来的。 嗯。 但是高思资产社有一个优点是,你可以不断地去微调它,不断地去调整它,去在上面做优化。 但其实呢在实施图形领域,Real time Graphics,比如说你玩游戏的时候,大家最常用的呢是三角网格。 什么是三角网格呢? 就是我用一堆三角形把你的模型给表示出来。 那么在传统的渲染管线里面,大家一般是以三角形为单位去进行渲染的。 这个三角形可能会非常非常的小,非常的细微。 嗯。 然后光有三角形还不够,一般来说大家还会有表面的贴图,贴图就决定了它表面看起来的样子。 比如说我送你一个圣诞礼盒,那它的三角网格可能就是,假设它是一个完全完完全全的立方体。 那它立方体有六个面对吧? 但是每个面它是一个正方形,怎么办? 我每个面给它斜切一刀,就变成两个三角形。 那所以呢,我其实可以用12个三角形去表达一个。
立方体。 我现在突然有个想法,我是我觉得你们搞这个的应该几何学,什么线性代数都要学的非常好。
你说的非常对。
我太复杂了,我线性代数好像考了60分。
呃,其实线性代数是图形学里面最最关键的一个基础要用到的科学。 嗯。 这样。 呃,当然没说完,就是这个三角网格可以表达它的几何,然后它表面的这个花纹是用。 纹理贴图去实现的。
明白,然后但刚才有一个没讲,就是 Mesh 然后你们肯定是用的 Mesh 嘛,是吧? 呃,你们叫 Mesh 一点 AI 了?
呃,对,讲 Mesh 就是三角网格。 哦,但是 Mesh 呢,它除了三角网格以外,还可以是四边形网格。 还可以是五边形网格。 OK,这个是非常复杂的。 呃,比如说你问一个动画师,他肯定说我要四边形网格,因为四边形网格呢,他要做动画的时候比较方便。 对于建模的人来说呢,四边形的网格他会觉得这个拓扑结构会更好,更容易他进行编辑。
哎,但我听起来就三角形可以拼成四边形,可以拼成五边形嘛。
对,你也很容易把四边形转成三角形。 啊。 但是你把。 但是问题呢,就变成当你把一个四边形网格把它变成三角形网格的时候,再对它进行编辑,再去做动画就会更难一些。 嗯。 因为它失去了原有的一些几何的信息。
嗯,所以这几个技术之间大体的优劣跟现在市面上公认的,大家在选择的方向上是怎么样的? 就为什么你们会选择了 Mesh,因为我们今天听的最多的还是 Nerve 嘛。
对。 嗯。 呃,就首先我们叫 Mesh 加 AI 倒不是说我们的技术上面用了很多 Mesh 相关的东西,当然肯定也有,因为ok呃,做图形的人肯定没有谁是不用 Mesh 的。 其实呢,虽然现在有很多新的表达方式,但是主要大家用的最多的还是三角网格。 嗯,这个就包括你玩的手机游戏。 那么大家还是会用三角形的网格去表示里面的道具啊,一些角色。 嗯。 呃,当然,你可能也看到一些创新者,他们在。 尝试把 nerf 或者高斯散射这样的东西给放到游戏引擎里面去。 嗯。 呃,这样带来的一个好处呢,就说你可以把一些真实世界中捕获的一些东西给放到游戏里面。 这其实是很有吸引力的。 嗯。 但是它距离真正的在主流的游戏里面发挥很大的作用,还需要时间。 我觉得以后可能是这样,但是在也许五年的时间之内吧,它还不会是主流的表示方式。
嗯,我们今年其实聊了一些 AI 生成3D的公司,然后尤其是在上半年的时候,感觉大家呢都比较纠结于说。 呃,就一个点,就是它不能进所谓的管线,对吧? 就是这个东西生成出来以后呢,它不具备里面的那,我粗浅理解里面要有一些那个网状的什么点格之类的。
才能够和现有的图形的使用场景去吻合。
就才是可编辑可控吧,对吧? 才能有这个。 呃,可用。 可用,所以今年一整年的整体的技术进展你觉得怎么样? 因为我们其实不断的还是看到一些技术上的突破和一些新的开源的算法出来。
对,我觉得真的进展得非常快。 就我在这个行业也有一段时间了,我从来没有看到说大家如此猛烈地研究这一个问题,这个问题就是 AI 生成三 D 内容。
嗯哼,那进展快也是因为大模型带来的吗?
我觉得大模型在这里面的贡献可能没有那么大,坦诚来说。 因为 Large Language Model 更多的是一个语言方面的模型。 那么反倒是像一些开源的图像的模型,比如说呃Stable Diffusion,这样的模型其实给大家提供了很好的科研的基础设施。 因为很多的人在做这个事的时候,他就是把二 D 的这种生成模型呢给升维做到三 D 所以呃像 Stable Diffusion。 这样的开源的二 d 模型反倒是给学术研究带来了很大的价值。
嗯,所以你看,像我们都知道,就是 AI 生成文字或者生成图片等等,它本质上还是一个概率的模型吧。 对吧? 然后生成视频其实也可以理解,就是像素的一个概率的延续,对吧? 那3D呢? 也是类似的吗?
啊,好问题,3D是的,3D基本上你可以认为它是二 d 的一个未来的方向吧。 二 d 有两个方向嘛,第一种你加上时间维度变成视频,对吧? 第二种,你加上空间维度,变成3D。 但是,虽然说它的思想上是这样,但是当你真的要去解决这个问题的时候,你会发现3D会带来很多额外的挑战。 就比如说呃二 D 你生成一张图像,我们就举例512×512,这个分辨率还行,对吧? 但是你如果真的要去搞一个三 D 的,512×512再乘512的这样的一种表示。 那这计算量是非常非常高的。 嗯。 所以大家就得另辟蹊径,去在这种有限的计算资源,有限的数据的情况下呢,带着镣铐跳舞。 嗯。 去想好的算法。
嗯。 我们今天看到其实应该有四种生成3D的方法。 第一种是可能做的比较早,你们我我知道比较早也在做,就是贴图的改变的方法。
给定模型去绘制贴图。
对,反正这个技术就是说我可以通过换贴图来换各种的材质跟光线的感觉。 嗯,对。
首先这里面我觉得涉及到两个问题。 第一个问题叫做什么样的3D 生成式 AI 产品是好的? 第二个问题呢是呃,3D 甚至是 AI 到底应该解决哪几类的任务? 我先说第二个问题吧,就是3D 的 AIGC 或者甚至是 AI。 它应该去解决什么任务呢? 我觉得主要是三个任务。 第一个呢,就是从文字生成贴图,这个我们现在是做的最早,也是市场上面最有竞争力的产品。 嗯,我们的贴图可以到4K的分辨率,也有很好的风格控制。 嗯。
Texture 就是文字到一个。 文字到贴图。 贴贴图的那个对,Texture 就其实就很说明它的这个东西了,对吧? 就是一个材质啊什么那种。
对对对对,就是它的材质纹理。 嗯。 呃,这是任务一,任务二呢是文字直接到3D模型。 嗯哼。 它和文字到纹理的区别在于,文字到纹理还是需要用户去提供三维模型的。 嗯。 你可以认为我拿到了一个白色的一个雕像,然后我用水彩笔在上面去绘画,只是在改变它表面的样子而已。 那么文字到3D呢? 或者说 Text to 3D,它做的事情是模型和贴图是同时一起生成的。 那这个难度就会更大一些。 嗯,这块我们也在做,也是市场上现在最领先的产品之一。 嗯。 这块呢,它主要应用场景呢,是你可以用它去生成一些,像影视啊,还有游戏里面的一些中远景的。 这样的道具。 嗯。 那是没有问题的,比如说我远处有一个小房子,我桌上有一个苹果,大家不太会凑近了去看,你本来需要大量这样的道具来填充你的场景,但是你有 AI 了,可以去做这样的生成。 这个是任务二,从文字生成3D。 任务三呢,是从图像生成3D模型和贴图。 那么这个问题其实和呃,从文字生成3D呢,是差不多难的问题。
那么这个方面呢,大家之所以希望用图像去生成3D模型,而不是用文字。 最主要的原因就是因为图像更加可控。 嗯。 比如说你要描述一个角色,他正面长什么样,你用文字去描述是挺难的一个事,但你有一张照片,那就容易很多。 嗯。 那么这一块其实在做的学术界的研究是也是很多的,然后我们也有一个产品在线上,当然这个可能不是我们最近主要花精力去做的事情。
嗯,哎,之前其实传统的,一是说我可以,比如说电商场景里面,他把一双鞋,然后去不断地去拍照,拍几十张,最后合成一个3D的东西。 这个其实是大家能做到的,只是说成本很高。
这个就属于三 d 重建了。 嗯。 呃,其实成本也没有那么高,这个技术十年前就很成熟了。 嗯。 就是你拍一堆照片,但是它对你照片的要求是很高的。 嗯。 那你得是,受控条件之下,相机角度有约束。
啊,有点像黑客帝国的那个子弹。
哎,对对对,有点像那个子弹时间。 他得摆一个相机阵列,或者说你是呃相机得放在很稳定的位置,不能拍糊。
是,但现在我们刚才讲的那个就是我只给你一张照片。 对,一张图。 然后其实是它还是一个概率预测,就是我去预测你。 其他的各面是长什么样子?
对,就 AI 要去猜背面是长什么样。
那这个它怎么猜得到呢? 它首先要先理解这张图是什么吗? 还是怎么样?
呃,这是很多人会问的问题。 呃,首先它会去尝试理解它的正面是什么样,然后呢,你的 AI 在训练它的时候呢,它的数据集里面会有一个叫做多角度数据集。 这个多角度数据集呢,它就是我不是单张图片去训练,我是把你的正面和背面一起训练。 嗯。 呃,我给你正面你出背面,给你背面你出正面。 所以它这样呃,就可以通过你的正面的图像呢,去预测出来它的其他角度看到图像是长什么样。
嗯,哎,但这一块大家一直都在讲3D现成的数据跟资产还是相对比较少。 很少,对,所以它就是数据上是一个最大的局限吧,目前。
目前来看确实是的,我给你举几个具体的数字吧。 比如说二 d 的数据集像 Lion,它有58亿5000万张图。 这是一个巨大的数据集。 但是你如果看,有3D模型的数据集。 呃,你如果去看 Sketchfab 这样的3D模型的网站,它也只有500万个模型。 嗯。 你想。 五百万和五十亿。 嗯。 中间差了有三个数量级。 嗯。 而且还不是那些 Sketchfab 的数据,你就能直接用,人家有版权问题。 是。 对吧? 所以这里面数据上的差距是很大的。
是,但它其实另一方面说明了说,因因为我觉得3D 这个东西它还是一个 to b 的一个事情,对吧? 大家更多的时候是在做游戏或者做一些其他的建筑等等的事情。 但是图片跟视频有 ugc 的。 一个事情。 对吧? 三,3D其实是很少有 ugc 的概念的。
是,这个也也是我们想的比较多的一个事,就是呃坦率来说呢,3D资产的市场只有2D资产市场的。 取决于你的统计口径吧,大概可能是1/10~1/20的规模,目前来看。 嗯,呃,至于3D 有没有 ugc 呢? 我们其实也做了一些探索,呃,有的地方是有的。 就比如说在游戏里面,我们做了全球第一款3D的 AIGC 的手游和我们的合作伙伴。 我们提供的功能呢是,你以前在游戏里面穿的衣服啊,都是和美术老师提前画好,你去选择。 嗯。 但我们现在可以你输入提示词,然后我给你把衣服给画出来。 这个就是一个典型的 UGC 的场景,并且其实 UGC 的场景呢还更适合3D的这样的技术,因为现在3D的技术还不太成熟。 反倒是 UGC 的场景,大家对于质量的要求没有那么高,大家更多觉得诶,我能生成3D的,我觉得很有意思,我就愿意用。 你如果真的放在这种 professional 的专业的场景里面。 那么三 d 坦率来说还达不到大家的要求。
哎,那这里面你看,我觉得三 d 是不是跳过了一个步骤,就是图片跟视频,它都有一个从专业工具到 c 端工具演进的。 一个过程。 就首先,图 c 它先有了,比如先有的美图秀秀这样的工具,我能快速的自己去修图,然后先有的剪映这样的工具,我能快速的自己去剪视频。 但三 d 还是非常专业的一整套工具。 然后中间其实现在是不是没有这么一个 c 端自己能使用的工具的环节,然后它直接跳到了一个 AI 生成3D的一个一个程度。
嗯,我觉得其实美图秀秀和剪映,它们都有相应的专业产品,比如说美图秀秀可能是 Photoshop 是是。 PS 对。 然后剪映呢,它可能之前是 Adobe Premiere AE PR Premiere 这些工具。 是是。 那么三 D 呢,现在大家还停留在 Blender 玛雅、 Max 这样的专业工具。
对,都是我没听过的工具。 对吧?
可能大家就离这个比较远了。 但三 D 有一个问题是什么呢? 你让普通人去操作美图秀秀,操作这个剪映,他还是能学会的。 当你把界面经过良好的设计以后,还是能学会的。 但是3D 建模这个东西可不是所有人都愿意去折腾的。 并且你其实很难把这个3D 建模这个东西变成大家都能接受的。 不是所有人都能都有那个空间的感觉。
对,而且我觉得主要是好像确实没有太多的场景。 这个东西,那是不是就是得在什么 VR AR 里面去实现呢?
对,我觉得现在的一个大问题呢,其实是你看所有的 VR headset。 VR 头显,它有多少的 MAU? 就是月活,呃,大几百万吧。 嗯。 但是这个和,比如说手机,它的月活差距是很大的。 是是。 大家会期望什么呢? 是不是在26年、27年、28年,过几年以后,像 Vision Pro 啊,就是 Vision Pro 是不是 iPhone 这个是一个很大的一个问题。
你觉得是吗?
呃,我觉得可能是。
对,我觉得我也觉得。
我我觉得有可能是,如果是这样的话,你就想,呃,如果大家日常,比如说有1亿的 VR headset 的这个 MAU 那么在这个时候呢? 他可能就会催生出这个每个人的日常生活中都会用到这样的3D的资产。 是。 那这样就他就有了场景。 是。 所以我觉得这个时间点现在是很好,现在23年嘛。 对吧,我,咱们可以27年再回来做一期,四年以后再做一期,我看今天说的到底对不对。
二六年吧,争取26年。
争取26年。 因为你看 iPhone 和 iPhone4中间其实是隔了三年的时间,iPhone07年,iPhone4是。 2010年,对吧? 移动互联网这个革命什么时候开始的? 10年的时候。 所以你如果把 Vision Pro 看成是 iPhone 的话,那其实也就是三四年,两三年的时间。
对,但但你之前其实都在做一些视频渲染啊,或者一些也有做一些游戏相关的3D渲染的东西,对吧? 就你为什么会在这个节点想到要做 AI 加3D生成这件事情?
呃,很好的问题。 其实呢,我自己的经历呢,有这么一个转变吧,刚才也提到我最早的时候,我是一个非常正统的。 图形研究者。 嗯。 什么叫正统呢? 就是我不咋信这个数据驱动这套方式。 ok。 我更信渲染方程,更信牛顿、麦克斯韦、拉格朗日给我们的一套。
啊,线性代数。
啊,对,就线性代数的一套。 然后后来做着做着呢,我也意识到这种尝试去精确的刻画世界的方式,它本身是有一个局限的。 就比如说这些方程。 有很多东西你是很难去,甚至你都很难去测量,也很难去建模它。 是。 那在这种情况下,有的时候数据去驱动它反倒是一更好的方式。 我在整个读博士的期间,我就既做图形学方面的东西,也去做图形学和 AI 的结合。 呃,这块可能有个5年的时间改变了我的看法。 你看我最早做科研是2016年,现在7年过去了。 那我现在就有一个独特的属于我们团队的机会,也是属于我的机会。 就是我既熟悉传统图形这一块,又熟悉人工智能这一块。 嗯。 然后呢,在他们中间恰好又有一个商业化上面听起来很有希望的一个事情,我们相信这个事情。 它是有市场需求,而且我们整个团队在这个里面,我想是非常有竞争力的。 所以我们现在非常坚定地去做 AI 生成三 d 内容。
你刚才提到你你看到的一个很明确的市场需求是什么? 是,更多是游戏行业吗? 还是。
我觉得是从传统的,图形行业来说,不管是游戏还是影视,大家对于3D模型的需求是永远存在的。 嗯。 我去问过一些公司。 我给你举几个数字吧,第一个呢是3A 游戏,它里面的成本有50%都是三 d 美术。 特别是越是这种开放世界的 MMO RPG 啊这种游戏,它里面需要的资产越多,它做资产的成本就越高。 嗯,那现在这些资产是怎么做的呢? 它可能外包给一些资产外包公司。 1000块钱一个人一天,那你做一个游戏里面的剑、盾牌,搞个两周就是一两万就放进去了。 一些这个制作更精良的角色,他可能成本会更高。 所以整个游戏行业、影视行业,它对于这种三 d 资产的诉求是是挺高的。 整个的,如果你只是看这个专业的市场啊,大概是一个30~100亿美金的一个市场。 那当然这里面你作为一个 AI 生成的三 d 资产,你不可能一下子把它全部给吃掉,对吧? 肯定能找出一些细分的一些地方,先去在这些地方去把它打透,哪怕你就是,你占100亿的市场的1%,那也足够做,你做一个 Midjourney 级别的一个产品了。
对,我刚才就想问你,你觉得3D这个技术,它到 Midjourney 或者 SD 的那个程度,大概需要多久? 然后还有哪些挑战?
对,我想从市场和技术两方面来说吧。 市场就是咱们刚才聊到的,现在其实消费级别的3D的需求的市场还比较少。 比如说我发给你一个3D 模型,你知道怎么打开它吗?
你应该打不开。
这个就是现3D 的消费及市场的现状。 那这个什么时候会改变呢? 我觉得也许26年,等到可能一些愿意尝鲜的人人手一台 Vision Pro 或者说呃小米版的 Vision Pro 能够普及了以后。 大家不会再去满足于就是看图片、视频,对吧? 那么大家肯定会去希望去看可交互的3D的内容。 这个时候就会有大量的一个需求和供给的一个差别。 对市场方面,我觉得两三年时间,乐观来看。 技术方面呢,我觉得我们只解决了10%的问题。 现在我们 AI 生成的3D模型还有很多问题没有解决。 专业点说什么 uv 啊、拓扑啊,呃,它的生成的模型的质量啊、贴图的质量、可控性啊、速度啊,好多都没解决。 当然我想这个领域进展是很快的,我们自己也在加大投入去做这个方向,所以我想这个未来90的问题,可能也就是两三年的时间。 OK。 所以我是比较乐观的。
所以你你觉得视频跟3D哪个会更快一点?
呃,我觉得视频会更快,你不可否认的是视频的市场比3D要大很多呀。 嗯。 你视频的已经有消费场景了。 但是它的技术的成熟度呢,我觉得和三 d 成熟度半斤八两。 嗯,那大家现在还在解决我视频,我生成两秒钟如何扩展到8秒,这样的问题。
是,但视频应该还是有些这种这种小的技巧,比如用一些什么插帧补帧啊,一些这个 AI 剪辑啊,去去做成一个类似效果的,最后的结果出来。
可以,但是这个核心的问题还是大家之所以希望生成视频,还是希望它有故事有逻辑嘛。 你如果只是几秒钟,那你再怎么插帧,你也很难把故事的逻辑给搞出来。
哎,但视频它现在有很多公司在做那种,这个什么换脸呀,然后换语言呀,对嘴啊这些。 3D上我能基于已有的东西快速去变一个模型出来吗?
可以是可以,但是没有应用场景,对吧?
啊,也是场景的问题,对吗?
对。 嗯,是。 如果有 VR 的话,就是如果人手一台 VR 设备,那。 你做这个是有意义的。 比如说我拍一张你照片,把你变成 q 版的一个头像。 嗯哼。 这个肯定是有需求的。 但现在主要还是大家没有很好的3D的消费场景。
你其实在过去几年里面,其实像开头也讲了,你经历了科研跟创业的两件事情,对吧? 对。 然后而且你。 中间正好是在那个转折点,你做了用图形,那个算什么? 用图形编程的语言去快速做出来一个冰雪奇缘的那个效果,那个当时非常炸裂,应该大多数人都看过。
对,当时大家挺喜欢,我也没有想到。 其实我自己写了一篇文章,初衷就只是一个技术分享吧。 然后大概的背景就是我那个时候拔智齿。 然后拔了智齿以后牙疼,然后就也写不动代码了,我就想能不能把这个科研的经历稍微写一写。 嗯,我也没想到大家会这么喜欢这样的一个科研工作者非常枯燥的故事。
对,所以这几年做起来,你觉得这两种生活和体验的感受如何?
哇,我觉得创业好难啊!
比比科研和发论文还难。
比那难多了,难多了。
或者我可能可能,比如说如果问你说,你最终后不后悔创业这件事情呢?
我觉得不后悔,目前为止不后悔。 我没有像老黄那样,老黄就说再选一次的话,可能就不会去创立英伟达了,对吧?
他都做成这个样子,还可以这么讲?
对呀,对是,就是。 我觉得可能目前来看,我还是很享受。 创业的这个状态,中途有一段时间确实是呃觉得压力比较大的。 嗯。 那段时间有,家里面有老人去世,有这个方向的选择。 嗯。 呃,也有一些刚创业的时候有一些问题,其实是缺乏经验。 嗯。 呃,但是我觉得我现在走过去了这个阶段,特别是开始做 Mesh 以后呢,我觉得我自己会非常享受这个事情,而且团队也很享受这个事情,因为他有了很好的一个反馈。
对,我觉得这件事情在某些层面上又回到了你之前擅长的那些事情和模式上。 对,可以这么说,更偏底层跟技术一些。
对,反倒是我觉得技术方面对我们来说是容易的事情。 嗯。
商业化到底该怎么做? 怎么样找到 PMF 是永远的挑战。 对。
呃,时刻要去想,我们得去 build 一个对世界有用的东西,而不是我们想 build 的东西。 嗯。 前者我觉得是特别大的一个误区,因为呃,你如果 build 自己想做的一个东西,你非常容易有这种正反馈。 嗯。 你很容易,我今天写了一个什么 code 然后。
就自己开心。
自己很开心,对吧? 但是,你如果。 朝更远的时间去想的话,你会发现很多问题是没有一个好的答案的。
是,AI这波里面其实有非常多的教授或者这个 PhD 学生啊,什么就做科研的过来创业。 啊,你你,所以你有什么建议给他们吗?
我觉得就几点吧,第一点是还是要尽早去想一想市场需求。 我觉得我经常聊的一个事情是这两年创业给我带来的感悟是什么? 我觉得最大的感悟就是 why 可能是比 how 更重要的事情。 其实在科研也是一样的。 在科研界,大家都会强调你要去 work on an important problem 嗯。 在一个重要的问题上面去工作。
是,就是选题很重要。
选题非常非常重要,得去问用户。 你有什么问题,而不是你强加给用户说,我觉得你要有什么问题。 我觉得你有这个问题,是不是啊? 用户可能比较 nice 他跟你说呃确,对对对,确实有这个问题。 但你做的之后,你就发现被这东西带到坑里面去了。
所以其实答案还是商业化。 就是你在问的时候就让他付钱,他他如果真的付了就还好。
对,更好的问题可能是呃你会为什么样的东西付钱,对吧? 或者说来,我给你这个东西,你付钱,我看你付不付。
就是就是就就像你刚才提到,中国的用户真的太 nice 了,你问他会不会付钱,他很多时候说会,但你真的让他,对,你真的让他付钱。
他可能宁可去买一杯二三十块钱的喜茶,也不会为你的软件付钱。 这个是挺大的一个挑战。 嗯。 呃,所以我觉得从科研的领域出来呢,有的时候得忘记自己的之前的经历。 一是忘记自己具体科研的时候解决的一些问题。 第二是忘记自己从一个科学家角度对这个世界的理解。 所以前者呢就是防止什么问题呢? 比如说我博士期间我研究的问题可能是 a b c 但是我去问了一圈用户,他可能给我答案是 d e f。 和我研究的 A B C 完全不一样。 这时候我到底该怎么办? 我到底是强行继续做 A B C 不撞南墙不后悔呢? 还是说我觉得一另外一种心态可能就更好。 这种心态叫做。 我作为一个科研人员,我能把 a b c 做好,我就一定也能把 d e f 做好。 嗯。 并且 d e f 是用户真正需要的东西。
但我很同意你刚才讲一个点,就我觉得其实很多做投资的是从管理咨询啊这个转过来的。 嗯。 然后管理咨询那套逻辑其实是来自于科研的。 就是 hypothesis driven 就假设驱动,然后怎么样去做 AB test 去做实验。 是的。 对,所以所以其实就是你如果是一个好的科研者,我觉得有的时候可能不一定是你要去跟商业的人去学,反而是怎么样把科研的那一套。 理论跟逻辑用到最极致。
对,我觉得科研工作者其实有自己的优势,比如说逻辑清楚。 是。 比如说大部分科研工作者是比较客观的。 但是往往呢,我会发现大家对实验是比较客观的。 嗯。 但是对自己有的时候没有那么客观。 嗯。 比如说你很难去改变自己的一些想法。 但是创业这个事情,你要非常及时地做出很多的调整,对吧? 你作为 CEO 你就是一个赛车手,你开这个方向盘,那你路肯定不是直的,你要及时地转弯的。 这个也是很多,我在科研界的时候,我可能会对一个事情很执着,有这种执念,一定要按照某种方式去做一个事,但其实创业不一定。 可能还有一个事情呢,是很多的科研工作者相对来说内向一些,比如说我自己就是很严重的内向的性格。
哎,但我觉得你已经比大多数人,大多数这个科研的人。
我老实跟你说,我跟你聊这俩小时,我已经虚脱了。 就我我得我跟着聊俩小时,我就得休息。 一整天我才能缓过劲来。 ok,但是因为我从事这样的岗位,我告诉自己,不要以自己舒服的方式去过每一天。 嗯哼,你要不断地走出自己的舒适圈,去做自己没有那么舒服的事情。 有的时候你没有那么舒服的事情,反倒是对整个团队,对整个公司,对所有利益相关者更负责的事情。 是。 这个过程可能是痛苦的,但是你不去逼迫自己做这些事,那是不可能取得很好的成绩的。 但是其实我恨不得我,你让我休假的时候,我恨不得一人把自己关在小黑屋里面写代码。 那样是我最舒服的状态。
明白明白,完全理解。 现在你们是已经发了一版产品嘛,是吧? 就是大家其实想用的话是可以去用的。
对,大家可以直接在 Mesh 一点 AI 这个网站上面去用。
是。 但我觉得反正 AI 生成3D听起来是一个需要延迟满足的事情,但你在做的是整个世界的一个基石。 我觉得这个肯定是可以这么讲的,对吧?
嗯,我觉得这个其实往愿景的层面说,我们就是希望每个人都能去创造一个自己的虚拟世界嘛。 这个和咱们一开始说的图形学是一门帮助大家创造更好的虚拟数字世界的学科,是非常吻合的,这也是很多人的一个呃,梦想吧,每个人都希望说一句话就能把整个世界给创造出来。 对,我觉得现在这个时间点是个很好的一个机会,而且 AI 生成3D也是解决这个问题。 最重要的途径之一。
哎,上帝是不是第一句话说的是要有光啊?
很对对,上帝说要有光,所以我们先解决了渲染的问题。 要有光以后呢,那就得去有这个山川,有这个森林,对吧? 这个就是 AI 生成内容的问题。 是是是。
对,那我们就谢谢袁明。
啊。 好,谢谢曲凯老师的 podcast 也特别开心能够和大家分享这些内容。嗯嗯。