快捷导航
Quick Navigation
联系我们
挑和GPU、绕过HBM深挖史上最大芯片背后的Cerebra
推理,从一个辅帮性的需求,变成了AI根本设备的焦点。我们也问了Angela,Cerebras为什么选择从锻炼市场,转而关心AI推理市场。
2025年12月24日的安然夜,本应是恬静的一天。但那一天发生的两件事,改变了AI芯片行业的款式。
OpenAI选择Cerebras的缘由很简单:速度,以及供应链多元化。OpenAI需要的算力,曾经不是单一供应商可以或许完全满脚的。它也需要高速推理,来支持及时产物。同时,它不想正在推理营业上只依赖一个算力来历,也就是英伟达。
他会讲故事,但他也有愿景和。十年前,我做那四周尽调的时候,几乎每天都要和他通德律风两个小时,问他每一个具体的风险点。他每一个问题都回覆得很是好。他有一种很是严谨的工程思维。他很清晰每一个问题该当怎样处理。
2024年9月,Cerebras向纳斯达克提交了S-1招股书,预备上市。美国外国投资委员会(CFIUS)正在看到Cerebras的多量营收来自阿联酋客户G42后,几乎当即启动了审查。
我们其时有一个疯狂的卷发研究员,叫Dario Amodei。我们一路研究言语模子,也研究若何扩狂言语模子的规模。那段时间,我们具有世界上最大的、用于深度进修的CUDA集群,这后来也挺出名的。
有一家Cerebras的合做伙伴做了如许一个功能:当法式员把鼠标悬停正在一段代码上,系统能够立即显示这段代码正在整个项目里被哪些处所挪用、依赖关系是什么。这个功能素质上需要模子快速读懂代码上下文,再生成一个完整的挪用图。若是推理很慢,这个功能就很尴尬:光标要逗留5到10秒才有响应,开辟者的思早就断了。但若是响应几乎是瞬时的,它用起来就像IDE自带的功能一样天然。
6月24日,Cerebras发布了上市后的第一份财报,股价当全国跌跨越15%。
我们一起头确实是从锻炼起头的。部门缘由是,正在2016年,或者说AI还比力晚期的时候,大大都公司关心的都是锻炼根本模子。但现正在纷歧样了。我们曾经有了来自OpenAI、Anthropic以及良多开源公司的前沿模子,这些模子曾经脚够强大,能够被普遍用于各类使用。从Cerebras的角度来说,我们其实两边都擅长。但当我们看到推理市场扩张得这么快,并且我们正在推理速度上比拟GPU有大约15倍的劣势时,我们就认识到,这里会有一个很是好的机遇。我们能够帮帮那些正正在利用推理的公司,以过去无法实现的体例继续增加。
做为投资人,研究员们交给我的使命是:去寻找一种很是强大的、英伟达之外的AI算力方案。由于他们预测,正在将来五到十年,更现实地说可能是十年摆布,会呈现很是大的模子,参数规模会远远跨越5亿,像一个模子一样。所以正在其时,他们都说:我们需要一种分歧类型的GPU,或者说,一种分歧的计较架构,来确保模子能够继续扩大,并且锻炼得更快。由于其时的GPU,并不是为深度进修优化的架构。
对于推理来说,最环节的就是内存带宽。所以,我们最底子的立异,是把计较单位和内存放正在统一片晶圆上。恰是这种设想,带来了极高的内存带宽,并最终为终端用户的使用供给了高机能、高速度的推理能力。
换句话说,Cerebras本来想处理的是AI锻炼里的数据搬运问题。但当AI进入推理时代,反而愈加利好Cerebras。想一想,每次和AI对话、挪用Agent的时候,你是不是都但愿速度快一点,再快一点?
十年前,它是硅谷。今天,这块餐盘大小的芯片就正在数据核心里,办事着一系列主要客户。这个已经的科幻故事,变成了能够登岸纳斯达克的现实,实正在到本钱市场起头用毛利率来审讯它。
从2016年成立到2019年年中,Cerebras完全处于现体态态:没有产物,没有客户通知布告,没有旧事稿。这家正在眼里奥秘莫测的硬件公司,内部一度很是。
于是,OpenAI和Cerebras正在节前夕签了term sheet(投资意向书),正在四周后的安然夜签了master agreement(从和谈)。一个200亿美元以上的买卖能正在四周内完成,是很稀有的。
其实那时候,挑和通用GPU的测验考试并不少。谷歌曾经正在内部利用TPU,这是一种特地为机械进修中的矩阵计较而设想的ASIC(公用集成电)。英特尔收购了深度进修硬件创业公司Nervana,英国的Graphcore正在做IPU,Groq、Habana、SambaNova这些硬件公司也根基都正在这个阶段成立,沿着分歧标的目的试图从头设想AI芯片。
正在最起头的几章里,我们关心的是Scaling Law,是模子的锻炼。这也是2024年之前,Cerebras和大部门硬件公司都正在关心的标的目的。
我们正在二月份完成了第一个集成。也就是说,正在颁布发表合做后的几周内,我们就完成了和Codex的第一次集成。这个合做的反馈很是好。我们推出了Codex Spark模子,它出格针对速度和互动性做了优化,后端由Cerebras供给支撑,并向全球。这也让良多开辟者和小我用户,而不只是企业客户,第一次切身体验到Cerebras的能力。
通俗芯片的制制,是正在一张晶圆上同时印出几百个小芯片,然后切开,一块一块零丁利用。但Cerebras是把整张晶圆做成一个庞大的AI处置器。这片晶圆的面积是最大GPU的58倍。良多本来需要跨GPU、跨办事器、跨收集完成的数据挪动,现正在能够正在晶圆内部完成。
正在其时,Cerebras对这个问题给出的谜底常斗胆的。我其时的理解是:若是AI会继续增加,若是模子会继续变大,那么整个计较系统就必需被从头发现。而Cerebras的做法,就是晶圆级计较,也就是Wafer-Scale Engine。所以阿谁时候,实正的问题和风险是:若是算力会成为AI前进的瓶颈,那么这种布局实的能工做吗?这种架构实的能加快AI计较吗?这个设法听起来很是疯狂。但我十年前做的整个尽调,最初变成了一个很是科学驱动的项目。
第一层产物,是芯片。2019年,Cerebras做出第一代晶圆级引擎WSE-1:16纳米制程,面积46,225平方毫米,40万个计较焦点,18GB片上SRAM。这是世界上第一款晶圆级芯片,大小是其时最大GPU的56。7倍。
保守GPU架构里,HBM(高带宽内存)是和计较芯片分隔的。只需数据需要正在内存和计较单位之间传输,就会花费很长时间。这个过程受限于所谓的内存带宽。由于我们的内存和计较单位正在统一片硅上,所以我们具有极高的内存带宽,达到GPU的数千倍量级。
并且,若是实的出了什么问题,只需公司有脚够的资金,这些问题就是能够处理的。所以我们决定押下这个激进的赌注。
我们晓得,最后的AI锻炼靠CPU和GPU搭配。CPU是总批示,担任安排使命。GPU则像一座庞大的工场,里面有成千上万个小工位,能够进行大规模并行计较。但AI锻炼远不止一次计较,参数、梯度、激活值全得正在显存、缓存、计较单位和GPU间来回倒腾。一旦模子大到单卡塞不下,就得切成几块分给多卡,让它们互相共同。
我第一次看到这个纪律的时候,就感觉这是通向智能的道。我其时简曲不敢相信,智能竟然有可达。你想象一下,像我这一代学计较机的人,一曲被教育说:计较机科学里的前进都很是坚苦,每一点提拔都来之不易。有些问题几乎是碰不得的,好比语音、言语、视觉这些问题,都很是很是难。但这个工具,就是能跑通。并且它很简单。你需要做的,只是锻炼一个更大的言语模子。
我对Groq一曲没有那么兴奋。由于我心里总感觉,若是Nvidia实的想做,它其实也能够做雷同的工具。
第二,是激烈的合作款式。英伟达通过取Groq的合做,有了本人的推理优化手艺。Broadcom正在帮各大云厂商设想定制ASIC。谷歌的TPU、亚马逊的Trainium都正在做推理。一批新的推理芯片创业公司正正在融资。对此,Angela是如许回覆我们的。
推理问题的素质是什么?它其实由两个部门构成。第一部门叫做处置prompt。第二部门,是生成谜底。所以整个推理过程,就是先处置prompt,再生成谜底。我们把第一部门叫prefill(预填充),把第二部门叫decode(解码)。而这两个阶段,其实有很是分歧的计较特征。
Greg Diamos,正在独家采访中告诉我们,昔时,吴恩达给百度带来了一批顶尖的AI研究员,Greg就是此中之一。正在此之前,Greg正在英伟达建立CUDA软件架构:而其时的CUDA,仍是一个置之不理的内部项目。
遭到Google Brain的,百度投入3亿美元,成立了位于硅谷的AI尝试室。他们最次要的目标是:让深度进修阐扬贸易价值。对于其时的互联网公司来说,深度进修的使用大多正在物理层面:从动驾驶、机械人、语音识别。
概况上看,这份财报并不差,第一季度收入以至高于华尔街预期。但Cerebras给出的第二季度中,调整后毛利率只要36%到38%,低于第一季度的47%。也就是说,收入增加留下的利润空间,正正在被压缩。对于一家上市公司来说,市场看到的是一个现实问题:包罗数据核心、电力、冷却正在内的成本,会不会吃掉手艺劣势?
狂言语模子生成回覆时,并不会一次性把整段话吐出来。生成了第一个词,才能晓得第二个词该是什么。生成了第二个词,才能继续生成第三个词。也就是说,推理有很强的串行性。
起首,是供应链的问题。Cerebras的整条产物链,包罗对OpenAI许诺的750兆瓦算力,全数成立正在台积电5纳米产能上。台积电是目宿世界上独一可以或许制制Cerebras芯片的代工场。那么,Cerebras正在将来能拿到几多市场份额,会不会取决于它能从台积电拿到几多产能?
我们后来认识到,有些机械比我们更适合做第一部门。由于处置prompt是一个能够并行化的问题,它和decode完全纷歧样。decode,也就是生成谜底,是一个严酷串行的过程。
2019年炎天,Cerebras终究让第一代WSE成功量产,并起头一般工做。那一天,几位工程师坐正在Los Altos市核心一间姑且搭建的办公室里,盯着电脑屏幕,看着这个曾被认为不成能的系统实的跑了起来,半个小时没有人说线月,Cerebras走呈现身模式,正在Hot Chips大会上发布了全球第一款晶圆级芯片WSE-1。它的规格正在其时看来近乎荒唐:面积跨越4。5万平方毫米,是其时最大GPU的56。7倍,具有40万个AI计较焦点和18GB片上SRAM内存。比拟之下,英伟达同期GPU的片上内存只要几十兆字节。
Cerebras实正的立异,是把这个冗余逻辑从一块小芯片放大到整张晶圆的标准,用几十万个细小焦点,加上一套能正在整片晶圆上动态绕障的由收集,把一个“70年无解”的良率难题,变成了一个能够办理的工程问题。
IPO前一天,投行给出的刊行价钱区间大要是每股120到160美元。我其时就想:哇,就算是160美元,比拟我们Series C进入时的价钱,也曾经是跨越25倍的报答了。但到了IPO当天,我坐正在纳斯达克买卖台后面,看着阿谁数字一往上走:200美元、300美元、380美元。这是我整个职业生活生计里,见过需求最疯狂的一次IPO。
G42是阿布扎比的一家AI科技集团,取阿联酋深度联系关系,同时是微软的计谋合做伙伴。2023年,G42取Cerebras颁布发表了一个名为Condor Galaxy的合做:基于Cerebras的系统建制一个大规模超算收集,此中最大的一台超等计较机算力达到4 exaflops,合同规模跨越10亿美元。
由合作带来的第三个风险,是主要客户OpenAI充满变数的计谋。就正在6月,OpenAI和Broadcom发布了OpenAI第一颗自研推理芯片Jalapeño。这是一颗特地为LLM推理设想的ASIC。OpenAI暗示,Jalapeño是它持久全栈AI根本设备策略的一部门:将来,OpenAI想把模子、软件、收集、办事器,以至芯片本身,都更深地控制正在本人手里。
Cerebras的分歧之处正在于,它从一起头就问了一个更底层的问题:若是AI会成为一种全新的计较负载,能不克不及为它从头设想一台机械?
其实正在做出投资决定之前,周楠还见到了Andrew本人。创始人的小我魅力,也是投资人的主要缘由。
Andrew正在Odd Lots播客上没有间接回覆这个问题。他认可,台积电当然是Cerebras供应链里极其主要的一环。但他也提到,Cerebras有几个不测的劣势:它避开了当下AI芯片行业最严重的三个供应瓶颈,HBM(高带宽内存)、台积电的先辈封拆手艺CoWoS,以及台积电最先辈的3纳米产线。这三个合作最激烈的环节,Cerebras的产物都用不到。
但问题也随之而来:若是Scaling Law是对的,那么锻炼将来实正有用的模子,所需要的算力将是现有GPU集群完全无法供给的量级。百度的研究员们认识到,他们需要一种新的硬件。
但锻炼完成,AI被我们实正用起来的时候,发生的是推理。从硬件角度看,推理是一个很是特殊的计较过程。
我对Cerebras的前景很是有决心,缘由是我们具有适才提到的全栈能力。无论市场下一步需要什么,我们都有能力正在每一个层面继续立异,继续跟上市场的成长标的目的。
那时,Cerebras每个月的烧钱速度大约是800万美元。每六周开一次董事会,Andrew都要报告请示统一个坏动静:芯片仍是不克不及用。三年,也就是快要三亿美元,都花正在了一个没有人见过的产物上。
投资人对Cerebras持久、不变盈利能力的关心,其实也是这个故事最成心思的处所。它并不是一个英伟达挑和者上市的爽文。Cerebras的一波三折,更像是对AI时代根本设备需求变化的一步步回应:当我们对模子的关心从规模变成推理,从能力变成速度,我们到底需要什么样的计较机?
最初一层,就是云端推理营业。2024年8月,Cerebras发布Cerebras Inference:客户不消买一台CS系统,而是间接通过API挪用云办事。
我开车去了Cerebras的办公室。CEO拿出一本尝试笔记本,对我说:“我想出了怎样把更多处置器实正集成正在一路。”接着,他们叫来一群做散热的工程师,搬出一大块金属,说:“这是我们要毗连到芯片上的热互换器,用来给它降温。”。
第二件事:Cerebras取OpenAI颁布发表合做。他们签订的合同总价值同样跨越200亿美元。OpenAI许诺摆设750兆瓦的Cerebras计较能力,用于本人的推理营业,最大可扩展至2030年的2吉瓦。这是全球汗青上规模最大的AI高速推理摆设合同。
但我们说过,而是机械。这就是Cerebras的第二层产物:系统。WSE-1被拆进CS-1系统里,成为一台能够间接放进数据核心的AI超等计较机。2021年,Cerebras发布第二代WSE-2:7纳米制程,85万个计较焦点,2。6万亿个晶体管,配套产物是CS-2系统。
接下来,周楠花了整整四周时间,把尽调变成一个科学项目,将所有的投资风险拆解成一个个能够验证的手艺问题。
2021年11月,Cerebras完成Series F融资,估值40亿美元。2026年5月,Cerebras IPO时,估值950亿美元。五年间,估值涨了快要25倍。此中一半的功绩,要归于一个客户:它正在三年时间里,把Cerebras从一家只要尝试室客户的公司,变成了一家有实正贸易规模的企业。但也是这个客户,让Cerebras的第一次上市打算完全泡汤。
其时,Cerebras的团队有70多名PhD,大部门人都已经正在SeaMicro共事过。最初,Greg说,就算Cerebras找不到客户,他也相信这个产物是有价值的。
虽然撤回了S-1,但这段期待并没有被华侈。正在期待上市的这段时间里,Cerebras通过私募市场完成了新一轮本钱化:2025年9月,Series G融资11亿美元,估值81亿美元。2026年2月,Series H融资10亿美元,估值230亿美元,AMD、Tiger Global、Coatue、Benchmark、Fidelity等参取此中。
很多芯片公司处理这个问题的思,是把GPU拼成一个集群,再花大量工程处理它们之间若何通信的问题。而Cerebras的思是,把尽可能多的计较单位、内存和互联,放到一整片晶圆上,做成Wafer-Scale Engine(晶圆级引擎,简称WSE)。
所以我们带着这个察看去找AWS,说:我们能够用你们的锻炼芯片,来做一部门prefill;然后用我们的巨型芯片,来做decode。如许组合起来,就会获得一个很是强大的处理方案。
正在台积电5纳米工艺下,每平方毫米大约会呈现0。001个缺陷。听起来很小,但Cerebras的WSE-3芯全面积是46,225平方毫米。算一下,一整片晶圆上大约会有46个缺陷。正在一块没有容错设想的保守芯片上,这46个缺陷里的任何一个,都脚以让整块芯片报废。
第一件事:英伟达取Groq签订合同,告竣200亿美元规模的手艺授权和资产买卖。Groq是Cerebras正在推理芯片市场最间接的合作敌手,它做的是LPU(言语处置单位),特地为固定大小的模子设想,逃求极致简直定性和低延迟。
AI尝试室成立后不久,百度团队就颁发了一篇出名的论文《Deep Speech》:一个端到端的语音识别模子,答应人们点击麦克风标记,对搜刮引擎措辞。他们还锻炼了世界上最后的几个深度神经收集,下一步的打算,是锻炼言语模子(language model)。
我其时会这么兴奋是由于正在英伟达的时候,我就正在想,我们该当把整个CUDA的线图都转向深度进修,由于AI终究起头实正起感化了。一起头,此次要是正在视觉使命上被证明的,好比图像识别。但后来,Andrew(吴恩达)插手百度之后,我们起头从头思虑这个问题。他的设法是:我们该当做一些实正有产物影响力的工具,做一些人们实的会利用的工具。所以我们才从语音起头。由于语音的用户规模,比图像搜刮要大得多。
其实,这个合做并不令人不测。Sam Altman是Cerebras最晚期的投资人之一,两家公司的团队从2017年起就屡次交换。他们都相信一点:跟着模子规模扩大,硬件架构和模子需求迟早会汇合。
第一次聚正在一路的时候,五小我正在一块白板上写下了他们的希望:他们但愿,硅谷的计较机汗青博物馆里有一天会呈现他们的名字。从第一天起,Cerebras的方针就是:制一个为AI而生的硬件。
这个思其实不是Cerebras发现的。内存芯片厂商和GPU厂商几十年来都正在用冗余焦点处置缺陷:英伟达的H100需要132个焦点工做,但芯片上现实制了144个,答应最多12个是坏的。
我们正在2026岁首年月制定了一个打算,上市时也把这个打算分享给了投资人。而现正在,我们其实曾经跑正在打算前面。我们的毛利率较着高于市场共识,并且我们给出的全年是:全年毛利率会比原打算超出跨越10个百分点。同时,我们也告诉市场,正在第二季度和第三季度,为了跟上需求,我们会从一些客户那里把曾经卖出去的设备再租回来利用,这会对毛利率形成大约10到15个百分点的影响。我们如许做,是为了继续办事好客户,确保能跟上他们对高速推理产物的庞大需求。这就是整个故事。我们发布的每一个目标,都跑正在打算前面。
第三个例子,是AI科学家。有Cerebras的合做伙伴正在做一个面向药物研发的AI科学家。想象一下,正在一个新药研发的会议里,团队正正在会商一个假设,这个AI员工能够正在会议进行的同时,及时查找合作敌手的研究、检索论文、测试假设,然后间接参取会商。
阿贡国度尝试室(Argonne National Laboratory)用Cerebras的系统阐发新冠病毒的变异序列,这个尝试后来协帮获得了2022年的戈登贝尔出格,那是高机能计较范畴最主要的项之一。Lawrence Livermore国度尝试室用它跑核聚变模仿。国度能源手艺尝试室(NETL)的测试成果显示,Cerebras系统比尝试室本人的超等计较机快了大约500倍。
财政数字是最好的证明。2022年,Cerebras营收2460万美元。2023年,这个数字跳至7870万美元,此中G42占比跨越83%。到2024年上半年,G42的占比进一步升至87%。
第二,冗余加智能由。Cerebras正在整片晶圆上多放了大约1%到1。5%的备用焦点,日常平凡这些焦点处于封闭形态。芯片上还内置了一套能够动态从头设置装备摆设的on-chip bric(片上收集)。正在制制测试阶段,系统能够识别哪些区域出缺陷,把坏掉的焦点屏障掉,通过片上收集绕开它们,再把工做负载映照到一般区域。从软件的角度看,整片晶圆一直是一块完满无缺的芯片。那46个缺陷,被悄然地躲藏掉了。
对一家深科技硬件公司来说,光证明手艺可行还不敷。你实正需要的,是一个情愿摆设你的系统、情愿付出实金白银环绕这项手艺进行扶植的大客户。G42给了Cerebras如许的机遇,为它带来了实正的收入。这对Cerebras来说很是主要。
十年前,这是一家没人看好的公司。从成立第一天起,它就只想做一种从来没有被制出来过的芯片。它试图挑和英伟达的霸从地位,却正在成立之初屡屡碰鼻,多次接近倒闭。
那一刻他认识到,Cerebras不是一个盗窟版的英伟达,他们正在做一件完全分歧的事:制一块大到史无前例的芯片。若是Cerebras实的能制出如许一块芯片,就能处理百度团队的问题:速度。
回到一块白板,一家将近倒闭的创业公司,一场几乎没有人相信的物理学赌局,还有一个具有其时全球最狂言语模子的AI尝试室,若何正在一个不成能的时间节点,成为这个故事里最环节的那一页。
投资人周楠正在2016年插手百度AI尝试室,成为了Greg的同事。她的第一个使命,就是寻找一种专为深度进修打制的新计较方案。
Angela告诉我们,他们曾经把整个产物做成了OpenAI API兼容。若是一家公司曾经正在用OpenAI或者其他兼容接口,就不需要沉写整套代码,只需换成Cerebras的API key,就能够把请求送到Cerebras后端。
这个设法后来反应很好,现正在我们也正在和其他公司做雷同的工作:用别人的芯片来处置问题的一部门,用我们的芯片来处置另一部门。根基上,我们正在和所有hyperscaler(超大规模云办事商)会商这种合做,除了Nvidia。也就是说,除了Nvidia之外,其他人都能够合做。
尽调过程中的一个环节转机点,发生正在Greg见到Cerebras团队之后。正在Scaling Law的初步发觉之后,Greg曾经见过20多家做AI芯片的创业公司,每一家的pitch都大同小异:他们说,本人正在做比英伟达更好的GPU。一起头,Cerebras正在Greg眼里也是这20多家里平平无奇的一家。曲到有一天,他来到了Cerebras的办公室。
另一个例子是及时教育。想象你需要让AI给你注释一个复杂的概念,AI一边正在虚拟黑板上绘图,一边回覆你的诘问,你还能够间接圈出图上的某一部门,让AI再讲一遍。若是AI每次都要搁浅好久,这就只是一个通俗的讲授视频加聊天框。但若是AI能立即回应,它就变成了一个能够及时对话的教员。
第一,把焦点做到极小。保守GPU的一个计较焦点很大,英伟达H100的一个SM焦点大约是6平方毫米,一旦缺沦陷正在,这6平方毫米就全废了。而Cerebras把每个焦点缩小到0。05平方毫米,大约是H100焦点的1%。这意味着,同样一个缺陷,砸正在H100上要丧失6平方毫米,砸正在Cerebras上只丧失0。05平方毫米。仅仅是把焦点做小这一点,就让Cerebras芯全面对缺陷时的容错能力,达到保守GPU的百倍量级。
周楠告诉我们,团队将Cerebras的编译器接入了百度自研的3亿参数言语模子,正在Cerebras的模仿器上跑了一遍测试,获得了不错的成果。要晓得,其时Cerebras还没有实正出货的产物,他们只要一张尝试室里的晶圆原型和一台模仿器。
说到这里,我们不得不感慨Andrew的远见。2015岁尾,正在Cerebras决定押注晶圆级引擎的时候,Transformer架构以至还没有降生,今天这套以大模子为焦点的AI财产还远没有成型。其时,深度进修当然曾经正在迸发,英伟达也曾经起头把GPU推向数据核心和神经收集锻炼。但支流线,仍然是把GPU拼成越来越大的集群,再用软件和高速互联处理锻炼速度的问题。
十年磨一剑。本年5月,Cerebras终究上市了,市值一度接近千亿美元。CEO Andrew Feldman说:我们情愿和每一家hyperscaler(超大规模云厂商)合做,提拔AI推理速度,除了英伟达。
锻炼的时候,你能够把海量数据分成良多批次,扔给几千张GPU并行计较。但推理的时候,特别是生成谜底的decode(解码)阶段,模子必需沿着时间挨次往前走。每生成一个token,都要进行一次模子计较,都要正在模子权沉、缓存和计较单位之间挪动转移大量数据。
我们有幸采访了Cerebras的晚期投资人,和最早证明Cerebras产物能够落地的研究人员,还取Cerebras内部担任产物的高管会商了近两年公司的转型,以及IPO之后的动做。串起这些千丝万缕后,我们很惊讶地发觉:要理解Cerebras上市的灿烂,需要回到10年前。
正在颁布发表取OpenAI合做后不久,Cerebras又正在2026年3月颁布发表取AWS合做。Cerebras的CEO Andrew正在采访中注释了这个合做的逻辑,并颁布发表将会和所有Hyperscaler(超大规模云办事商)合做,除了英伟达。
第三层,是超等计较机集群。2022年11月,Cerebras用16台CS-2拼成了Andromeda超等计较机:1350万个AI焦点,跨越1 exaflop的AI算力,功耗500千瓦,远低于同级此外GPU集群。这展现了多台晶圆级系统构成集群的能力,让狂言语模子锻炼实现接近线年,Cerebras发布第三代WSE-3:5纳米制程,90万个计较焦点,44GB片上SRAM,内存带宽每秒21 PB,4万亿个晶体管,面积是其时最大GPU H100的57倍。
当然,推理市场的需求,也改变了Cerebras的产物形态。之前,就像G42的例子里那样,Cerebras卖的是超等计较机。而现正在,它起头把本人的硬件能力包拆成云办事:客户通过API发送请求,Cerebras正在后端完成模子推理,把成果返还给客户。
他们要处理的问题,不只是芯片本身。一张晶圆级芯片的功耗高达25千瓦,大约是一个通俗家庭年用电量的两倍多,并且集中正在一块餐盘大小的面积上。这意味着他们还需要从头发现散热系统,从头设想供电布局,从头设想取办事器机架的接口。上一章提到的手艺问题,每一个都是壁垒。
我其时的反映是:等一下,GPU底子不需要这么大的功耗,你们想的必定不是通俗GPU。然后他们把一整片庞大的晶圆拿了出来。我一会儿大白了:哦,本来你们实的正在测验考试制一颗更大的芯片。并且不只是想制,你们曾经成功有了一片。
有投资人回忆,2015岁尾取Andrew碰头时,他有一页slide,列出了深度进修面对的七个焦点问题,而这些问题素质上都指向统一件事:锻炼时间太长。这也恰是上一章结尾提到的、百度团队面对的瓶颈。
第二,第一次tapeout(流片)能不克不及成功?正在芯片行业,流片意味着把设想交给工场出产。一次失败,就可能意味着几万万美元的额外成本和几个月的时间丧失。
Cerebras可能最终会被英伟达、AMD或者Intel之类的公司收购,就算他们找不到客户。速度对于百度来说是一个主要的挑和。所以我们决定和他们合做。
锻炼是建制模子:你把海量的数据喂给一个神经收集,让它学会言语的纪律、世界的学问。这是一个庞大的、一次性的计较过程。GPU很是适合做锻炼,由于矩阵乘法能够高度并行化,你能够把几千块GPU连起来同时计较。
这就是推理时代最主要的变化:Agent间接进入及时交互场景。代码、教育、科研、客服、语音帮手、工做流,这些使用的配合点是互动。而互动的素质,是速度。这也注释了为什么Cerebras会正在2026年这个时间点,送来IPO窗口。
2021年,WSE-2发布,升级至7纳米制程,计较焦点增至85万个,晶体管数量达到2。6万亿。2022年,Cerebras用一台CS-2正在单台机械上锻炼了参数量高达200亿的模子,创下其时的记载。也是正在这一年,美国计较机汗青博物馆为Cerebras的WSE-2揭幕了一个永世展览,题为“The Biggest Chip in the World”(世界上最大的芯片)。
IPO的意义,是把公司带到下一个阶段,让我们实正起头规模化。若是我们想跟上这个市场的增加速度,就必需进行庞大的投入:投入数据核心,投入制制能力,投入产物线图,当然也要投入我们的整个软件栈,才能把这个产物实正做到它该当达到的样子。所以我认为,我们接下来一年的首要使命,把产物交付给尽可能多的客户。
百度团队研究的言语模子,正在昔时是全球最大的:具有3亿参数。锻炼这个模子,需要三个月的时间。正在这个过程中,他们发觉了一个纪律:模子越大、数据越多、算力越强,模子就越伶俐。并且这个提拔是能够预测的,是线性的。
但可想而知,上市并不是Cerebras故事的起点。上市之后,Cerebras面对着更多挑和。
这套架构是可行的,并且它很是主要,由于它实的有可能加快AI的成长。当然,阿谁时候Transformer还没有呈现,但我们曾经看到,言语模子的规模会变得很是大,远远跨越5亿参数。