达州罐体保温施工队 AMD把AI模子刻进硅片, 英伟达的GPU外传还能撑多久?

编者按:好伙,AMD又脱手了。此次不是跟英伟达拼算力,而是径直掀桌子——把AI模子权重蚀刻进硅片达州罐体保温施工队,松手带宽内存(HBM)这根手杖。英伟达客岁刚花200亿好意思元买下Groq,AMD七个月后就掏脱手模子用集成电路(MSIC),两巨头在理芯片赛谈上的炸药味照旧浓到呛鼻子。问题是,这种锤子买的芯片道路,到底是真创新如故场上流的?苏妈此次押的注,可能比收购ZT Systems那49亿好意思元还要刺激。
48倍碾压:这不是跑分,这是脸
本年2月,Taalas发布了款测试芯片HC1,台积电6纳米工艺,不是什么端制程,致使不错说是练习工艺里的老熟东谈主。但即是这样块光罩尺寸的芯片,跑起Meta的Llama 3.1 8B模子来,速率飙到每秒16960个token。
16960 token/秒是什么观念?
英伟达Blackwell架构的B200 GPU,跑同型号模子或者每秒350个token。Cerebras的晶圆加快器,堪称数据流架构的颠覆者,也就每秒2000个token傍边。Taalas HC1的速率,是英伟达GPU的48倍,是Cerebras的8.5倍。
我的妈呀,这照旧不是跑分先了,这是径直按在地上摩擦。
离谱的是功耗。传统GPU为了通用,预留了无数运算单元和调遣逻辑,冗余大到离谱。Taalas把模子权重径直刻进掩膜ROM,KV缓存和微调适配器塞进SRAM,通盘这个词芯片就两个区域,浅易奸猾到让东谈主怀疑东谈主生。恶果即是:速率快了几十倍,功耗降到传统案的尽头之。
十张HC1卡加起来,空气冷却只需要2.5千瓦。英伟达个DGX机柜的功耗是些许?我方去查吧,归正数字说出来有点伤东谈主。
天然,Llama 3.1 8B以咫尺的圭臬看如实不算新模子了,GPT-4o、Claude 3.5、DeepSeek-V3这些怪物粗率个参数齐是它的几十倍上百倍。但Taalas我方也说了,HC1仅仅考证技艺观念,本年夏天要的HC2芯片,单芯片救援参数目径直拉到200亿。
200亿听起来如故不够看?别急。Taalas的案不错通过活水线并行把权重散布在多个加快器上运行。单芯片200亿参数,50颗加快器就能救援万亿参数别的大模子。AMD手里正巧有Helios机架运筹帷幄平台和里面系统假想团队,这招引得,确切是量身定制。
比拟之下,英伟达刚发布的LPX系统,跑同等领域模子需要数十颗GPU和至少2000颗Groq LPU。空间占用和功耗率的差距,照旧不是代两代的问题,而是根底的架构代差。
苏妈的阳谋:不是跟英伟达拼算力达州罐体保温施工队,是换赛谈
AMD东谈主工智能总裁Vamsi Boppana在声明里说了句极度挑升义的话:AMD正在构建全栈式AI平台,为客户提供活泼,使其能够为每项AI责任负载部署适应的运筹帷幄惩办案。
翻译成东谈主话即是:老子不跟你在GPU检修赛谈上死磕了,理这块蛋糕,我要用另种服法。
英伟达客岁12月花200亿好意思元收购Groq,创下公司史上大收购记载。Groq的LPU架构走的是数据流道路,靠致的片上SRAM和笃定执行来压榨理能。恶果AMD七个月后掏出的Taalas,道路比Groq还要激进——Groq好赖如故通用加快器,仅仅针对理作念了度化;Taalas径直作念成模子用集成电路,颗芯片只为个模子而生。
这就像是,英伟达在造跑车,Groq在造赛车,Taalas径直给F1车手定制了义肢——除了这位车手,别东谈主用不了,但用起来即是东谈主车合。
AMD的筹备也很明晰:基于Taalas技艺的芯片跟Instinct系列的Helios机架配对,变要素离式架构。运筹帷幄密集型的教唆词处情理GPU崇拜,token生成任务卸载到Taalas加快器上。另种玩法是,客户先在Instinct加快器上部署考证模子,阐发果舒心后再移动到Taalas加快器,变成近似tick-tock的迭代节律。
说白了,AMD不才盘大棋:检修用Instinct MI系列跟英伟达H100/B200正面刚,设备保温施工理用Taalas走互异化道路侧翼。你英伟达GPU是万金油,我AMD给你来个精怪,各有各的活法。
而况AMD跟OpenAI、Anthropic、Meta这些主流模子厂商的相关直不差。异日看到GPT或者Claude系列模子部署在Taalas与Instinct羼杂架构上,真不是什么偶然的事。Taalas我方还放话说,把模子权重蚀刻进硅片的本钱,比检修前沿模子低100倍。这话听着有点炫夸的要素,但就算个对折,本钱势依然实足诱东谈主。
致命的阿喀琉斯之踵:模子固化,何如跟得上AI的新速率?
好了,吹了这样多,该泼点冷水了。
Taalas这套案大的硬伤,亦然通盘东谈主眼就能看出来的问题:模子权重被固化在硅片里,芯片旦出厂,就没法换模子了。
什么意义?你今天买了块跑Llama 3.1的Taalas芯片,翌日Meta发布了Llama 4,不好意义,这块芯片就成了电子垃圾——或者说,至少成了过时的用开拓。任何出LoRA适配器领域的转变,齐需要从新流片。流片次些许钱?周期多长?业内东谈主齐知谈,这玩意儿动辄几百万好意思元起步,周期按月致使按季度算。
在AI模子险些每月齐有新版块出确当下,这意味着什么?意味着采选Taalas技艺的客户,必须对模子聘请有充分主理。你得押注某个模子会在异日两年里保持竞争力,不然即是本归。
Taalas面的回复是:诚然新模子如实需要从新流片,但需重新开动,只需改两层金属层即可,本钱和周期齐大幅镌汰。而况他们堪称收到未适配的模子后,仅需2个月就能把它落实到硬件上。
2个月?听着挺快。但问题是,AI模子的迭代速率所以周为单元的。OpenAI、Anthropic、Google这些大厂,新模子发布频率越来越,越来越强。2个月的适配周期,意味着你长久是逾期半个身位的追逐者。
这就引出了个层的产业惊险:若是理芯片被模子版块绑定,那芯片厂商和模子厂商的相关将发生根底变化。不再是通用算力平台,而是变成模子厂商的定制代工场。AMD收购Taalas,某种进度上亦然在赌异日AI模子的握住速率——赌大模子的架构和权重散布在接下来几年里会趋于壮健,赌用芯片的人命周期能够掩盖其交易讲演周期。
这赌注不小。赌赢了,AMD在理阛阓能撕开谈大口子;赌输了,Taalas的技艺就成了个上流的技艺玩物,颜面但不顶用。
不外话说总结,Taalas的技艺对模子开发式自己也可能产生反噬应。开发者连年来通过测试时缩放技艺来镌汰模子幻觉,允许模子在回答前进行万古期的理,代价是虚耗多token、本钱飞腾、用户恭候时间延伸。若是Taalas技艺果然能把单token本钱大幅镌汰并将输出速率涵养10倍致使20倍,模子开发商可能会反过来跨越延伸理时间以疏导的准确——归正快了这样多,多花点时间理又何妨?
这就像个闭环:用芯片动理本钱下落→模子开发商勇于用长的理链→模子质地涵养→用户对用芯片的需求增多→芯片厂商加大插足。若是这个飞轮转起来了,那Taalas的赌注可能真就押对了。
AMD把AI模子刻进硅片,这事的狂进度,不亚于畴昔乔布斯把键盘从手机上干掉。英伟达的GPU外传建立在通用和生态壁垒之上,但Taalas正在讲明:在理这个特定场景下,致的用化可能比通用有伤力。
苏妈此次收购的金额莫得暴露,但Taalas累计融资也就2.19亿好意思元,AMD拿下它花的钱或者率连英伟达买Groq的头齐不到。花小钱办大事,这很AMD。
但问题是,模子固化芯片这条路,到底能不行走通?2个月的适配周期能不行跟上模子迭代的速率?客户愿不肯意为单模子押注颗用芯片?
这些问题的谜底,可能要到来岁能力见分晓。不外有件事是笃定的:英伟达咫尺不行再躺着收成了。GPU的护城河,正在被群子用不同的逻辑点点蚕食。
英伟达的GPU外传还能撑多久?也许不是翌日垮塌,但罅隙,照旧出现了。手机:18632699551(微信同号)相关词条:罐体保温施工 异型材设备 锚索 玻璃棉 保温护角专用胶
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》达州罐体保温施工队,以此来变相勒索商家索要赔偿的违法恶意行为。
