原始数据商品化,edge 上移到特征层
"The ability to think about in a clever and unique way how to take data and come up with really clever ideas of how to use it is just a huge edge."
"I would say data access as a relative weight was probably larger than it is today. Though it's still important. I just think that with more commoditization, it puts pressure on that proprietary data piece."
alpha 能藏的三层里(数据 / 特征 / 预测),数据接入这一层的相对权重在过去 15-20 年一路下降,人的巧思那一层反而变重了。
特征 = 值得单独记一笔的世界事实
"What is a fact about the world that is worth itself noting?"
"It's easier to give an example than a definition. I think an example is something like the change in stock price over the last week of a company. It's a fact about something we trade that's economically meaningful."
Two Sigma 内部为 feature 的定义争论过很多次,最后落在这句上,外加一条硬限定:必须在经济意义上说得通。
单条特征只要对 50.001%,靠数量堆出 alpha
"These are tiny tiny signals in the way we act, but it's the aggregation of all of that interesting ideas that I think really makes a huge difference."
"How many different ways can you study an analyst? ... if you can ask 200 of those questions and you've created 200 new features, it's that long list that in aggregate starts to make a difference."
分析师住在哪个市场、跟 CEO 是不是校友——单看都接近噪音,200 条叠在一起才浮出信号。
共线性是一个信号的死因
"Collinearity is the death of a signal."
"Almost by definition, we wake up every day as an alpha modeler searching for orthogonality."
拿新数据源做出来的「新闻情绪」如果只是在追财报数字,那它不过是 earnings 的一个脏版本,不是新 alpha。
万物皆可为语言
"NLP was about turning language into numbers. With LLMs, I can turn numbers into language. Anything can be language now."
"You can upload an Excel sheet or your personal finances at home and you can say tell me about it, and what you're getting out is text. And so that text, if it has meaning, is interesting in itself."
专有数据的边界被推开了:过去只能是「我采集到的」,现在还包括「我生成出来的」。
LLM 把研究的 ROI 分母打穿了
"It frees the mind from having to worry so much about implementation as a constraint."
"If someone said to you, well it's going to take you six months of your team's time to study, you're going to say, well, it's a good idea, but it's not that good idea."
过去要六个月才能验证的怪点子(数 CEO 在财报电话会上眨几次眼)直接被 ROI 否掉;现在它们能排上队了。
过度自动化会降低产出的熵
"If you overautomate, you could end up with a system that it doesn't matter who's using it, it creates the same thing."
"If I'm building a cardboard box, automation, I want the output of that thing to be the same every time. The thing about adding alpha to a portfolio is you want the opposite."
纸箱厂要的是一致性,alpha 要的是正交性。同一个按钮人人来按,整个组合会塌缩成一个点。
工具该放大人的差异,不是抹平它
"If a tool doesn't allow two people to come up with different answers, if those two people have different backgrounds, that makes me nervous."
"We see AI as an amplification tool of our originality. I want to build tools that allow our people to multiply what's unique about them."
物理学家和计算机科学家用同一个工具跑出同一个答案,是危险信号,不是效率的证明。
先去撞墙,别等技术成熟
"It's like having a flashlight seeing the wall that's blocking you."
"If you can't see that wall and then someone comes and they're like I can blow up a wall and you're like I don't know where the wall is, so let's start looking for walls. It's too late."
先把墙撞出来,新工具落地那天你才知道该往哪儿使;等 18 个月省下的是工程麻烦,丢掉的是先发的 alpha。
每个人都在过拟合,区别是知不知道过了多少
"Everybody overfits by definition because the future is not the same as the past. If you've trained on the past and you're predicting the future, you overfit. Congratulations."
"It's not about not overfitting. Let's not pretend we don't overfit. Everything is overfit to some degree."
问题从来不是「有没有过拟合」,而是过到什么程度、能不能量化,以及扛不扛得住真实交易环境。
数据升级了,未必值得回头重训
"What is the time trade-off of making your thing 10% better versus going and building something completely different?"
"You might believe that the last 10% of gains in that journey is 90% of the work. That time might be better spent doing 10 things at 90% capacity than one thing at 95% capacity."
十件事做到 90 分胜过一件事做到 95 分——因为组合要的是分散度,不是单点的极致。
写代码的人贬值,提问题的人升值
"The amount that your people are coding is going to go down. The amount of people that are prompting is going to go up, and therefore it's the ideas that are going to carry the day."
"Whereas you might have had somebody who is very adept at building the thing that somebody tells them to build, I feel like that as a skill is growing less valuable."
给年轻 quant 的建议:别练「照着说明把东西造出来」,练「你独有的知识能问出别人问不出的那个问题」。
Corey 开场就把这期的骨架立了起来:在现代量化流程里,edge 只可能藏在三个地方——你能搞到的数据、你拿这些数据做了什么、你怎么从中做预测。他说 Ben 正好待在中间那层,而那层恰恰是被 AI 重塑最快的地方。这个三分法后来贯穿全场,Corey 反复拿它来逼问。
"As raw data gets commoditized, the edge increasingly comes from what you build out of it."
「随着原始数据变成大宗商品,edge 越来越来自你用它造出了什么。」
Ben 的起点是纽约大学的自然语言处理博士,方向机器翻译。他特意提醒要把时间倒回去理解那个选择的语境:那是 Siri 之前、Alexa 之前,对着电脑说话这件事本身还很古怪。至于为什么选这个方向,他给的理由坦率到近乎反励志。
"When I was looking to go to grad school cuz I didn't know what to do with my life, I read some research areas and it just seemed fun."
「我当时准备读研,因为不知道自己这辈子该干嘛,翻了翻几个研究方向,就觉得这个看着好玩。」
"So I dove into what, fast forward to today, turned out to be a pretty central part of the growing economy — but that was mostly luck, right?"
「于是我一头扎进去了。快进到今天,这个方向成了增长经济里相当核心的一块——但那基本上是运气,对吧?」
博士之后的第一份正经工作就是 Two Sigma——他说得很具体:纽约 Soho 一栋 loft 楼里,当时大概 125 人。他 2007 年入职,进的是数据工程团队,负责开始采集、接入、清洗公司当时在收的数据。虽然带着 NLP 背景,那时干的更像宽泛意义上的工程。
转折点不是一次晋升,是一次纯出于好奇的分析加一个内部帖子。他在公司数据里翻到一批新闻数据,顺手做了个分析——不同新闻机构在政治上偏向哪边,然后发到了内部留言板。
"And I got this call from someone at the company who said, "Hey, I like what you did — maybe not the best to send everyone everything like this, but what else can you do?""
「然后公司里有人给我打电话说:「嘿,你做的东西我挺喜欢——虽然这么发给所有人可能不是最好的做法,不过你还能做点别的什么?」」
打电话的人来自建模团队。这通电话把他的职业线从工程掰向建模,之后十多年他研究的都是同一件事:文本以各种方式如何预测市场。这条线也解释了他今天的位置——complex feature engines 负责人,目标是用尽可能多的数据,预测标的在不同时间尺度上往哪儿走。
Corey 指出这个词在量化圈被用得太滥,不同人指的东西不一样,请 Ben 给个定义,外加从最常见到最另类的例子。Ben 的回应是先承认内部为这个定义辩论过很多次、前后落在过不同的地方,然后选择绕开定义先给例子:一家公司过去一周的股价变动——一个关于我们所交易之物的事实,而且在经济意义上说得通。他强调「经济意义」这条限定是 Two Sigma 特有的,换个行业未必在定义里。
绕完一圈,他给出了那句最接近定义的话。
"And so really, we look at it as saying, okay, what is a fact about the world that is worth itself noting?"
「所以我们真正的看法是:什么样的关于世界的事实,值得被单独记上一笔?」
接下来是一个从最普通爬到最刁钻的梯子。股价本身只是原始数据,它涨涨跌跌;但你能从中抽出各种特征——过去一年怎么走的、动了多少、波动率是多少,这些是比较技术流的常见特征。再往上一级:最近有分析师上调这只股票吗?他补了一句很有意思的观察——看你从哪个角度看,这既可以是关于股票的特征,也可以是关于那个分析师的特征。
再往上是他的老本行。某家公司当下的新闻曝光量相对于它自身历史是多少?某份文件什么时候披露的?新闻稿是周几发的——周五盘后,还是更早?
关键的一跳在这里:为什么要费劲把这些封装成「特征」,而不是把原始材料整堆扔给模型。
"The nice thing about making a feature is that you can then study that feature, instead of just saying, "I'm going to study all press releases in a giant pile and throw it at a computer and see what comes out.""
「做成特征的好处是,你接下来可以研究这个特征本身,而不是说「我要把所有新闻稿堆成一大坨扔给计算机,看看能出来什么」。」
"By layering human intelligence and intuition over it, I can start to pick apart what's meaningful in there."
「在上面叠一层人的智慧和直觉,我就能开始把里面真正有意义的东西拆出来。」
他把这层人工过滤描述成给计算机减负:不要求模型在所有时刻检查一家公司有史以来的一切(那是个大得离谱的要求),而是用人对公司如何运转的认知先圈出范围——这儿有意思、这儿可能撬动市场——把任务变得可解。
他没有把这说成唯一正确的路。原始数据直接扔进机器学习算法当然也是一种做法,只是他们相信中间这层的价值。
"You can't just throw a bunch of raw data into some machine learning algorithm and tell it to predict the future. It's definitely a way to approach things, but we really believe there's value in this feature layer."
「你不能就把一堆原始数据扔进某个机器学习算法,然后让它预测未来。那当然也是一种做法,但我们真心相信特征这一层是有价值的。」
Corey 在这里插了一句很轻但很准的调侃,Ben 笑着认了。
"In a year or two, we're going to have to revisit that feature example about Friday afternoons and see if it survives a 24/7 market environment."
「过一两年我们得回头看看「周五下午」这个特征例子,看它在 7×24 小时交易的市场环境里还活不活得下来。」
Corey 把问题架在行业最大的结构分歧上:量化股票这些年最大的演化是 pod shop 模式——一串互相竞争的独立小组;Two Sigma 走的是共享平台。他问这个结构选择怎么塑造了团队每天优化的目标,以及跟 pod shop 里的研究员比差在哪。
Ben 先拆了一个字面上的误解:并不是只有一个组合,公司有很多产品和组合。真正的差别在视角——作为建模者,他们不透过任何特定组合的镜头看问题,工作是做预测,而这些组合最终怎么交易并不由他们控制。不同团队各自从不同角度预测同一批标的(他举的例子是 IBM 和英伟达),彼此不构成竞争,因为所有预测最后都汇总到公司层面更大的组合里做聚合。
接下来是这一章的核心:激励结构的方向不同。在 pod 互相竞争的世界里,你有理由把技术捂着、只在本地投入,因为你在试图击败隔壁那个团队。
"At Two Sigma, we're thinking: how can we globally optimize instead of locally optimize?"
「在 Two Sigma,我们想的是:怎么做全局最优,而不是局部最优?」
落到实处就是把自己做出来最好的东西往上抬——可能是一组有意思到值得放出来给别的团队研究的特征,也可能是某人发现的一个特别聪明的机器学习算法,做成工具共享出去。他说这让平台以一种相当了不起的方式扩展,因为有太多人在全局层面往里贡献。
最后他把差别浓缩成一个方向问题——平台是被取用的,还是被推高的。
"I think in a normal pod shop there's a centralized platform that's mostly pulled from. It's the team utilizing the platform. And here it's cyclical."
「我觉得在典型的 pod shop 里,有一个中央平台,主要是被「取用」的——是团队在使用平台。而在这里,它是循环的。」
"The platform is an iterative process and our teams are constantly pushing up into the platform for others to share, because we all are aligned in making Two Sigma make the best predictions possible."
「平台本身是一个迭代的过程,我们的团队不断把东西往平台上推、供别人共享——因为我们的目标是一致的:让 Two Sigma 做出尽可能好的预测。」
Corey 把开场那个三分法完整摊开来问:alpha 可以住在三个筒仓——一是数据本身(拿到别人没有的另类数据);二是特征生成(大家数据一样,但你能把它转化成别人没有的观察);三是预测层(数据和特征都一样,但你有新方法能从中榨出更多信息)。他问 Ben 怎么给这三桶加权,以及这个答案在过去 5 到 10 年变了没有。
关于第一桶,Ben 的回答很坦率:数据接入依然重要,但如果不承认过去 15 到 20 年里有一部分已经商品化了,那就太天真。他讲了早期跟数据供应商打交道的场景——对方问「你要哪家公司的数据?」,他们说「全都要」,对方一脸茫然说「全都要是什么意思?这讲不通啊」。
"Clearly, we were the first people interacting with many of these vendors thinking about a different way to package their data — you know, teaching them."
「很明显,在很多供应商那里,我们是第一批用一种不同的方式去思考怎么打包他们数据的人——某种意义上是在教他们。」
他强调 Two Sigma 仍然握着大量专有数据:很长的历史积累、从人群里收集来的交易想法。所以这不是在贬低第一桶,只是它的相对权重大概率下降了,因为商品化在挤压专有数据这一块。
第二桶他给的评价最高,而且给了理由——不是理论推演,是他亲眼看到成功模型是怎么建起来的。
"The ability to think about in a clever and unique way how to take data and come up with really clever ideas of how to use it is just a huge edge."
「能用聪明且独特的方式去思考怎么拿数据、怎么想出真正巧妙的用法——这本身就是巨大的 edge。」
"It's the creative process that we say, "Oh, that's really clever." That drives a lot of what we do."
「驱动我们大量工作的,就是那个创造性的过程——那一句「哦,这个真聪明」。」
然后是那个被反复引用的分析师例子。一开始你会觉得关于一个分析师能有多少数据?但顺着问下去:他住在哪、他所在的市场跟他覆盖的公司是什么关系、他在这个位置上待了多久、他跟他覆盖公司的 CEO 是不是同一所学校毕业的?他承认这些都是小点,但数量能变质。
"If you can ask 200 of those questions and you've created 200 new features, it's that long list that in aggregate starts to make a difference."
「如果你能问出 200 个这样的问题,你就造出了 200 个新特征——正是这张长长的清单,聚合起来开始产生差别。」
他随后把单条特征的信噪比说得非常直白,这句是理解整套方法论的钥匙。
"Any one of those things I'm talking about — it's like you're right 50.001% of the time. These are tiny tiny signals, but it's the aggregation of all of that interesting ideas that really makes a huge difference."
「我说的这里面任何单独一条,大概就是你有 50.001% 的时候是对的。这些都是极其微小的信号,但正是所有这些有意思的想法聚合起来,才真正拉开巨大的差距。」
第三桶(算法)他也认为分量很重,公司有个叫 techniques 的大团队专门研究算法本身。他把 Two Sigma 描述成两类团队的交叉:特征团队想的是「我能造出哪些酷的数据」,techniques 团队想的是「给定这些酷数据,我能上哪些酷算法」。
"It's at the intersectionality of those two areas where we see just amazing things happening. It's experts from different areas with different interests coming together to make predictions, and that diversity of approach I think really strengthens what we do."
「正是在这两个领域的交叉处,我们看到了非常了不起的事情发生。是来自不同领域、有着不同兴趣的专家聚在一起做预测——我认为这种方法上的多样性真正强化了我们所做的事。」
Corey 提了一个很尖锐的反问,而且他自己先把归谬做完了:如果目标是想出各种独特有趣的特征,他完全可以坐下来编一堆大概率没意义的——分析师有多高?眼睛什么颜色?他和 CEO 是不是同名?要么样本太小,要么根本不相关。实际流程到底长什么样?你的团队怎么从一份大家都有的数据里,拉出市场其他人没拉出来的东西?
Ben 没有回避,他承认这个批评成立:眼睛颜色的先验很低,他不会花时间,甚至会主动避开,因为它只会加噪音。目标从来不是穷举一个人能想到的所有特征。
想法的来源他列了三条。第一条是学术文献,而他举的例子相当有画面感:有篇论文把分析师映射到某类公开记录上,试图判断他们有没有孩子,然后拿这个当指标。方向他拒绝透露——因为他自己有孩子。他用这个例子说明这类研究能走多远。
第二条是背景的多样性:物理学家、数学家、计算机科学家面对同一个问题,会问出不同的问题、用不同的方式去解。第三条是从世界上真实发生的事往回推——某地出了脱轨事故,有篇报道说某只股票因此下跌,正确的反应不是记下这一条,而是追问它能不能泛化。
"How do I take this one instance that's happened in the world and think about how you would write it up and play it back over a decade to all companies?"
「我怎么把世界上发生的这一个个例,写成一个可复现的东西,然后放回过去十年、跑在所有公司身上?」
但他坚持这里必须守科学方法,而且他对「事后合理化」的态度很硬。你有先验:火车相撞是坏事。如果研究出来符号是反的,那不妙——你不能反过来说自己本来就是那个意思。
"You state your hypothesis, you test it, and if it doesn't go the way you said, you can't just be like, well, I meant the opposite direction."
「你提出假设,你去检验它;如果结果跟你说的不一样,你不能来一句「哦我其实说的是反方向」。」
Corey 接着把问题推到更难的地方:一个不停找特征的团队,确实会找到新颖有趣的特征,但它们可能跟已有特征高度共线而表面上看不出来。于是你有了成百上千个各自有趣、却让组合构建变得复杂得多的特征——还有一个不断膨胀的特征坟场。
Ben 的回答是全场最锋利的一段之一。他说他们每天的核心工作就是产出正交且新颖的预测;想出跟过去相关的东西太容易了,那是最低垂的果子。所以按定义,每天醒来做 alpha 建模就是在找正交性。
"So collinearity is the death of a signal."
「所以共线性就是一个信号的死因。」
他给的例子直指自己的老本行。你拿新闻数据做了个情绪模型,很兴奋;但如果它其实只是在捡财报之后的报道呢?
"You're sitting there saying, I got this novel data source, and all it is is a dirty version of earnings numbers."
「你坐在那儿想,我拿到了一个新颖的数据源——结果它不过是财报数字的一个脏版本。」
"You might get excited and think you found something clever, but by the time you've run through the tools, you've explored correlation structures, which is just a part of the job. If you can't do that, then you're not going to make it."
「你可能会很兴奋,以为自己发现了什么聪明的东西;但等你把工具跑一遍,你已经把相关性结构探索过了——这就是这份工作的一部分。做不了这个,你在这行就干不下去。」
他说公司有明确的规则和阈值:新的 alpha 信号必须达到一定的正交度他们才接受。他强调这不是事后检查,而是起点——你从一开始就是被正交性驱动的。
最后 Corey 问到预测期限:不同频段(高频、中频、超低频)对应的特征完全不同,建模者在想新特征时对这件事有多自觉?Ben 说这是很大一部分考量,而且是内建在假设里的。他举的例子是门店客流:如果你的假设是关于人们去沃尔玛购物,你不会认为这个信号会在接下来 5 秒内被定价——它得一路走到某个同店销售的披露里,那是几个月之后的事。不同信号对「它如何进入价格」有不同的假设。
Corey 拿同店销售继续追问,而且他把生命周期讲得比 Ben 还完整:一份数据刚出来、用的人不多时,它的预测期限可能比较慢;随着越来越多人拿到、反应更快,市场对它的定价会持续加速,同一个特征的预测期限不断缩短,直到有效到它不再有用。
Ben 确认了这个描述,并给出应对的两条腿。第一条是靠创造性避开挤压。
"Your goal is to create something so creative that it doesn't come under that pressure. That's not always going to happen."
「你的目标是造出足够有创造性的东西,让它不至于承受那种压力。但这不总能做到。」
第二条是监控。他在这里特意做了职责区分,这个区分对理解他们的组织结构很关键:建模者做预测,而运行组合的人是另一整块 quant 职能,他们盯的是 alpha 衰减,并据此决定某个信号该以多大力度去交易。
接下来转到人。Corey 指出一个真实的张力:招 quant 时人们想的通常是硬技术能力——数学、统计、写代码;但 Ben 描述的这些特征需要相当程度的创造力和横向思考。这种人怎么找、怎么在面试里筛出来?
Ben 说他们用开放式对话,题目本身没有对错答案——比如给你一个社交媒体的实时数据流,告诉我你能预测出哪些有意思的东西。他要看的不是答案质量,是别的东西。
"The question is, how many clever ways and how many things that I've never heard anyone else say are they saying?"
「要看的是:他能想出多少种聪明的路子,其中有多少是我从没听别人说过的?」
他讲了自己读研时在微软面产品测试岗的经历作为参照:题目是「这儿有台自动售货机,你的目标是测试它,你会怎么测?」他说这看起来是个傻问题,但正因为没有对错,他滔滔不绝讲了很久——手伸进去会不会被夹断?拔掉电源会怎样?能不能塞张纸进去?能不能把硬币拴在绳子上?晃它会怎样?他说自己脑子一直是这个模式:下一个是什么?下一个是什么?
"So we're looking for that kind of spark of people who like to think and solve problems in sort of a continuous basis and can always find the next question."
「所以我们要找的就是那种火花——喜欢持续地思考和解决问题、总能找到下一个问题的人。」
他补了一句诚实的注脚:自己从没问过那道具体的题,岗位也完全不同,但那种开放性对他一直有启发。而且这题至少存在二十年了——因为二十年前有人拿它问过他。
这里是全场的转折点。Corey 引用了 Ben 在预采访里说过的一句话,并说它一直在自己脑子里打转——这也是整期最常被单独摘出来的一句。
"NLP was about turning language into numbers. With LLMs, I can turn numbers into language. Anything can be language now."
「NLP 做的是把语言变成数字。有了 LLM,我可以把数字变成语言。现在,万物皆可为语言。」
Ben 的展开是从稀缺性讲起的。对一家靠文本数据交易了十五年以上的公司来说,能拿到更多文本本身就令人兴奋——但世界上能收集的东西有边界:互联网有边界,供应商有边界,你只能分析你能拿到手的。LLM 让人兴奋的地方在于,它们生成文本。
"This idea of what is proprietary data — maybe it's a little wider tent than we thought. Before it was just data that we went out and collected or that we had unique access to, but now it's data that we can generate."
「「什么算专有数据」这件事——这顶帐篷可能比我们以为的要大一些。以前它只是我们出去采集到的、或者我们有独家渠道拿到的数据;现在它还包括我们能生成出来的数据。」
他用了一个很直白的比喻:你懂怎么用石油,而石油快用完了,这时有人拖来一根巨大的油管。他说 LLM 的每一次输出都是又一份文本数据集,对一个研究文本这么多年的团队来说,这是机会的革命。他补充说「数字变成文本」的字面意思也很简单——你可以把一张 Excel 表或者家里的个人财务上传给 LLM,让它讲讲这是什么,出来的东西是文本;只要那文本有含义,它本身就有意思。
Corey 接着抛出那个具体到近乎荒诞、但恰好说明问题的例子:测量 CEO 在财报电话会上的微表情——眨眼频率、说到某些词时眼睛看哪里。几年前要做这个研究,你得有一支专职的计算机视觉团队,过程极其艰难;今天靠 LLM 快速原型,成本已经大幅坍塌。这改变了团队愿意探索的东西吗?
Ben 说变化是巨大的,而且他把机制讲得很具体——一切都是投入产出比。他先把这个假想实验搭完整:假设你真有了每个 CEO 的眨眼基线,能算出这次比历史高了几个标准差(他反复声明这是编的例子)。这算有意义吗?你心里那个声音会说,挺怪的,可能真有点东西。然后现实登场。
"But then if someone said to you, well, it's going to take you six months of your team's time to study, you're going to say, well, it's a good idea, but it's not that good an idea."
「但如果这时有人告诉你,研究这个要占掉你团队六个月,你就会说:嗯,是个好主意,但没好到那个份上。」
投入端一旦暴跌,整个算式就变了。那些一直在你脑子里游荡的「我要是能看看这个就好了」突然变得可行。他打了另一个比方:你是个在实验室工作的科学家,突然设备没有预算限制了——不用操心怎么造粒子对撞机,眼前直接摆着一千台。
"It really frees the mind from having to worry so much about implementation as a constraint."
「它真正把你的脑子从「实现方式是个约束」这件事里解放出来了。」
他也没有把话说满:这不代表一切都能从 LLM 里免费掉出来,不是所有问题都解决了;但很多项目可以比过去快上一百倍。
Corey 立刻提出了反面,而且提得很到位:如果 LLM 让特征创造变得便宜得多、技术本身不再是护城河、准入相当民主化,那 edge 会不会侵蚀得更快?过去那些藏在「难度之墙」后面的 edge,墙塌了之后大家会迅速趋同。
Ben 承认前半段是真的:护城河确实在降低,人们能更快造特征,不只是 Two Sigma,到处都是。他的反驳全在后半段。
"We have such deep experience building these things at scale that we're shovel ready for this change. It's our DNA."
「我们在大规模构建这类东西上积累了极深的经验,面对这种变化我们是随时可以开工的。这是我们的 DNA。」
他把关键落在两个字上——「然后呢」。他说别搞错,数据谁都能造,在家用笔记本电脑就能造,想造多少造多少;但造完之后做什么,才是真问题。
"While the ability to create a data set is not the moat, the how, the what is very much part of that. And experience is a big part of that."
「造出一个数据集的能力不是护城河,但怎么造、造什么,非常是护城河的一部分。而经验在其中占很大比重。」
Corey 引用了 Ben 的另一句原话作为切入:AI 的风险在于「降低产出的熵」。这是全场第二个核心非共识。
Ben 从常识的反面说起。所有人都在说自动化、把一切都自动化,听起来很对——谁不想躺在沙滩上让工具替自己干活。但他说自动化是件有细微差别的事,而差别取决于你要的产出是什么。
"If I'm building a cardboard box, automation — I want the output of that thing to be the same every time. The thing about adding alpha to a portfolio is you want the opposite."
「如果我在造纸箱,自动化——我希望它每次的产出都一模一样。而给一个组合添加 alpha 这件事,你要的恰恰相反。」
他把这条线接回前面的正交性:组合的强度来自多样性。在 Two Sigma,是成百上千个模型,每个有自己的数据、自己的假设、自己的研究员——他特意强调「每个背后有自己的那个人,这是关键」——正是这个结构让它们放在一起时相关性足够低,从而能做出很强的预测。
然后他把担心的场景具体描述了一遍,这段的画面感是他整场最强的。
"The fear is that if you give everyone a push-button tool, and the tool is "throw all your data in and make a model," they all hit the button and they all point at the same place — they're all going to be putting in the same output. And wow, I did that really fast. But we're all doing the same thing."
「我担心的是:你给每个人一个一键式工具,这工具就是「把你的数据全扔进来,生成一个模型」;大家都按下那个按钮、都指向同一个地方——那产出也就都一样了。哇,我干得真快。但我们干的是同一件事。」
他说这在一个以多样性为立命之本的行业里让他不寒而栗。反击的思路是把 AI 定位成放大器而不是替代品:他想造的工具,是让每个人把自己身上独特的那部分乘出去的工具。同样一份数据、同样一个工具,因为两个人的历史轨迹和思路不同,应该得到不同的答案——在 AI 里可以靠 context 这类机制实现,让不同的人走出不同的路径。
他给了一条可操作的验收标准,这句话可以直接当工具评估的判据用。
"If a tool doesn't allow two people to come up with different answers, if those two people have different backgrounds — I have a physicist and a computer scientist try to solve the problem and they end up with the same answer — I don't like that. That makes me nervous."
「如果一个工具没法让两个背景不同的人给出不同的答案——我让一个物理学家和一个计算机科学家去解同一个问题,他们得出了同样的答案——我不喜欢这样。这让我不安。」
接下来是「理性忽视」(rational inattention)那一段。Corey 先铺垫:LLM 能力提升太快,现在花力气跟模型死磕可能不划算,因为 12 到 18 个月后它可能就是个已解决的问题。所以团队面临一个真实的选择——今天硬上、跟技术较劲、忍受各种毛刺;还是等一年半,那时这个想法探索起来容易得多,但代价是别人也同样容易。
Ben 明确站在「先撞墙」这边,而且给了一个很好的意象。
"The very act of being unable to solve a problem because the technology is not there yet — it's like having a flashlight seeing the wall that's blocking you."
「正因为技术还不到位而解不开一个问题,这件事本身——就像拿着手电筒照见了挡住你的那堵墙。」
他的论证是:如果你没见过那堵墙,等有人拿着炸药过来说我能炸墙,你却说我不知道墙在哪、我们先去找找墙吧——那就太晚了。所以健康的做法是把边界推到工具前面去,这样新工具落地那天,你因为已经对着那堵墙撞了六个月,一眼就知道它该用在哪。
他还把「等 18 个月」这笔账算给了 Corey 听,而且算的是竞争账不是工程账。
"18 months can be an eternity if you are the only one in the market taking certain approaches, and that means that your alpha signals are just much more impactful when you're out first."
「如果你是市场上唯一在用某些方法的人,18 个月可以是一个永恒——这意味着当你率先出手时,你的 alpha 信号影响力要大得多。」
最后一段转到基础设施。Corey 把取舍摆得很清楚:用别人数据中心里的模型,会带来 IP 顾虑,以及对供应商版本、定价、路线图决策的依赖;全部私有化部署,则要承担成本和能力上的代差。
Ben 的答案是分散化——不要把宝押在任何单一做法上,否则你就被那条路的局限绑架了。落到工程上就是:不要对你所用的模型做假设,确保技术栈能在需要时把模型换掉。
然后他补了一个 Corey 没提、但他认为最重要的取舍。
"Maybe the one that you didn't mention, but I think is actually the most important, is just control of the life cycle of a model."
「也许有一条你没提到,但我觉得其实是最重要的——就是对一个模型生命周期的控制权。」
他把这个风险讲得很具体:你用某个前沿实验室的模型,把一堆东西都调在它上面,然后对方说这个模型六个月后下线,你就得升级到下一个、再下一个。这没问题,但那是一个你无法控制的移动靶。
另一个他点名的风险是前视偏差。如果你不清楚模型在什么数据上训练过,它可能让你以为看到了并不真实的东西;而模型越复杂,越难搞清它「心里深处」装着什么。他举的例子是安然:如果 LLM 底层已经把这家公司和负面绑定了,那你回到某个历史时点问它对这只股票怎么看,它张口就是坏、坏、坏——而你其实还没问到那个问题。
他的结论是个平衡而不是站队:其他条件相同当然选完全可控;但也很难无视前沿实验室推进边界的速度,得在控制力和最先进之间找位置,而什么时候用哪个,是这条路的一部分。
Corey 说他不得不问那个老套问题:p-hacking 和过拟合的风险,在制度层面怎么管?怎么保证研究员不是在反复发现同一批信号、或者在过拟合?
Ben 的第一层回答是激励结构。如果你作为研究员严重过拟合、流程又没抓住,最终你的模型表现不会好,而这会在你的职业和成果上追上你。他把逻辑收得很紧:你的工作是造出能在未来交易的模型;如果你把过去拟合得太死,你没法在未来过拟合并成功——你可以过拟合,然后失败。所以任何建模的人都有一个天然的自检点。
第二层是承认人性:人看到数据是会兴奋、会骗自己的,会想「这太棒了,我发现了这个东西」。所以他们发展了一整套工具、统计检验和先验,是长期做大规模机器学习实验积累下来的最佳实践。
但真正锋利的是第三层——他把这个问题的前提整个掀了。
"Everybody overfits by definition, because the future is not the same as the past. If you've trained on the past and you're predicting the future, you overfit. Congratulations. The world changed since yesterday."
「按定义每个人都在过拟合,因为未来跟过去不一样。你在过去上训练、去预测未来,你就是在过拟合。恭喜你。世界从昨天起就变了。」
"It's not about not overfitting. Let's not pretend we don't overfit. It's about overfitting to a degree that you're comfortable with and that you can measure."
「问题不是「不要过拟合」。别假装我们没在过拟合。问题是过拟合到一个你能接受、并且能度量的程度。」
关于 AI 是否让这件事更可怕,他的回答很直接:是。而且他给的对比很好记。
"If you have a thousand people running a thousand experiments, it's a lot more scary than when you have three people running a thousand experiments."
「如果你有一千个人在跑一千个实验,那比三个人跑一千个实验可怕得多。」
所以必须确保教育跟上、检查跟上、稳健性检验跟上,不能因为规模变大就放松警惕。他承认 Corey 点到了正确的位置:压力确实在增加;但他们有经验,认为自己扛得住,也做好了「事情比过去扩张得更快」的准备。
后半章转到数据本身。Corey 提到 Ben 在预采访里的一个反直觉观点:数据库并非固定不变,经常能拿到升级——更好的覆盖、更干净的数据、更长的历史。多数人的直觉是拿新数据重建模型,而 Ben 说这未必是最优选择。
他的解释从学术界与量化机构的差别切入。博士生的目标是把某一件事做到自己能做到的极致,在这个非常具体的点上挤出一个新发现,然后无限循环地问「怎么能更好」。这没错,是好事。但如果你的工作是构建一个多元化的组合,算式完全不同。
"You might believe that the last 10% of gains in that journey is 90% of the work. That time might be better spent doing 10 things at 90% capacity than one thing at 95% capacity."
「你可能会认为,这段路上最后 10% 的收益要花掉 90% 的工作量。那些时间也许更值得用来把十件事做到 90 分,而不是把一件事做到 95 分。」
他说他们的任何一个模型都可能是一篇博士论文——可以是三个月的项目,也可以是五年的项目。而好研究员的标志恰恰是知道什么时候停。
"Either it looks good enough to walk away and ship it — that's hard for people cuz they want to do better — or this isn't working, walk away, which is also hard for people. That skill, I think, is what makes a great quant."
「要么它看起来够好了,可以收手发布——这对人很难,因为大家都想做得更好;要么它就是不行,该走开——这对人同样难。我认为正是这个能力,造就了一个优秀的 quant。」
回到数据升级的问题:理想世界里当然是按个按钮全部重训。但现实里你的模型是带着某些假设建起来的,重启这个过程可能让它好上 10%——而问题是,把这件事提升 10% 的时间成本,对比去建一个完全不同的东西,哪个划算?
他明确说这不代表他们从不更新,他们一直在监控,看到机会就会追;只是会用生意的眼光看 ROI。供应商从 V3 升到 V4,他可以重训整个项目,也可以说:我已经有个用这类数据的东西了,表现还不错,为什么不继续推进自己的议程去做别的?因为世界上还有太多东西他们根本没碰过——如果你要的是正交性,它很少会藏在「这家供应商把东西稍微做好了一点」里面。
「idiosyncrasy at scale」(规模化的特异性)是 Ben 自己常用的说法,用来推动那些一向回避「过于公司特定」的度量的人。回避的理由很自然:大家想要更大的样本、更多公司、更大的机会——一个只覆盖一家公司的特征,当然不如覆盖一百家的令人兴奋。
AI 打开的口子在于:你可以深挖某一家公司,构建那种可能只属于它、但又可能可以泛化到别的公司的特征类别。你可以一路推理到关于这家公司极其具体的事情,然后再回过头把它泛化。这句是这个概念最凝练的表述。
"We can use AI to do something at 3,000 companies at once, while the thing it's doing for those 3,000 companies is itself unique."
「我们可以用 AI 同时在三千家公司上做同一件事,而它对这三千家公司做的那件事本身又各不相同。」
他把这条思路跟主观投资做了类比:主观投资者的很多价值就来自对少数标的的深度认知,而这类东西在规模化地看财报数字时是挑不出来的——它们通常是非常公司特定的机会。想在这类分析上更有竞争力、同时保持 Two Sigma 那种规模化的态度,他认为 AI 是这个机会里很大的一块。
然后是给年轻人的部分。Corey 先自嘲了一段:他 2009 年读研,毕业设计是给信用违约互换定价,毕业一年内这项技能在华尔街就彻底没用了。今天的特征工程师面对的变化更快,那些正在想职业规划的初级研究员,该往哪儿练?
Ben 的判断分两半。先说贬值的那半——把想法写成代码、按某个格式执行出来的技术能力,相对价值会下降。
"Whereas you might have had somebody who is very adept at building the thing that somebody tells them to build, that as a skill is growing less valuable, because if you can ask an AI to build it, that person's additive value is less."
「过去你可能有个人非常擅长照着别人的要求把东西造出来;这项技能正在贬值,因为如果你能让 AI 去造,那个人的增量价值就变小了。」
他提到一个现象作为佐证:他们从学校招进来的每一届人都越来越 AI native,越来越期待东西是某个样子的,因为那就是他们在学校里用的——而且这个变化发生得非常快。
升值的那半,他绕回了正交性:要成功,你既得与众不同,又得能规模化。他说很多人担心 AI 会取代自己或取代这个岗位,而他的态度是——让它放大你。
"Maybe not the skill of just "build a website," but what's unique to you? What does your knowledge and your education bring that you can do that others can't? And how do you use AI to amplify that?"
「也许要练的不是「做个网站」这种技能,而是:你身上独特的是什么?你的知识和教育带来了什么别人做不了的东西?以及,你怎么用 AI 把那个东西放大?」
他把这个趋势落到一个很具体的预测上,这句是给年轻人的那部分里最实用的。
"The amount that your people are coding is going to go down. The amount of people that are prompting is going to go up, and therefore it's the ideas that are going to carry the day."
「你的人写代码的量会下降,做提示的人会上升——所以最后决胜的是想法。」
收尾是本季的固定问题:你现在着迷于什么,最好是工作之外的。Ben 的答案是公共数据和政府数据。他承认这跟工作有关(他本来就是搞数据的人),但他是以个人身份在做。他觉得着迷的地方在于外面有海量信息——我们收到的停车罚单、谁因为超速被拦下、餐厅的卫生检查记录——里面有太多有意思的事情可以做,他很享受探索「怎么用已经存在的数据让城市和社会运转得更好」。
他对 AI 在这件事上的期待,和他整场的主线完全一致——门槛消失,而不是能力集中。
"It used to be that only data scientists could go in and use this data. But if you don't need that skill anymore and you can just ask questions, suddenly that data is going to be driving power for urban planners and lawyers and anyone. It just democratizes the access to information for a public institution."
「过去只有数据科学家才能进去用这些数据。但如果你不再需要那项技能、直接提问就行,这些数据突然就能为城市规划者、律师、任何人提供动力。它把公共机构的信息获取民主化了。」
Corey 最后补了一句带锋芒的推论:越多人接入这些数据,地方或联邦政府就越会显得低效,那些数据也就越可能被撤下来。Ben 的回应留了个开口——我们将能够追踪这些信息随时间推移的有用程度。