AMD收购AI推理芯片创企Taalas:24人团队打造黑科技,模型权重直刻硅片速度达H200的73倍
8月7日,AMD正式宣布已达成收购加拿大AI推理芯片初创公司Taalas的最终协议,旨在快速切入高速增长的AI推理芯片市场,补强其全栈AI平台布局。具体交易金额未披露。这是继收购Silo AI、ZT Systems之后,AMD在AI领域的又一重磅并购。
总部位于多伦多的Taalas成立于2023年,是一家极具传奇色彩的芯片初创公司:整个公司仅24名员工,创始人Ljubisa Bajic曾任职AMD集成电路设计架构总监、英伟达高级架构师,也是知名AI芯片公司Tenstorrent的创始人(2023年交接给Jim Keller后二次创业)。公司首款产品HC1芯片仅花费3000万美元研发完成,总融资超2亿美元。
核心技术突破:将模型权重直接"刻进"硅片
Taalas走了一条与主流GPU完全不同的技术路线:摒弃高带宽内存(HBM)依赖,直接将模型结构、参数与权重深度固化于硬件之中。这种"模型即芯片"的极端方案在特定场景下实现了惊人的性能跃升:
- 速度碾压:基于台积电6nm制程,芯片面积815平方毫米与H100相当。Llama 3.1 8B单用户生成速度可达17000 token/秒,是Cerebras推理平台的10倍、英伟达H200的73倍、B200的48倍;DeepSeek R1-671B多芯片方案也能达到12000 token/秒
- 成本骤降:Llama 3.1 8B推理成本仅每百万token 0.75美分(约0.052元人民币),DeepSeek R1每百万token 7.6美分,相比传统GPU吞吐量优化方案成本降低约80%,相比延迟优化方案成本降低97%
- 功耗优势:构建成本为Cerebras方案的1/20,功耗仅为其1/10
AMD全栈AI布局加速
Taalas技术将补充完善AMD全栈AI平台,包括AMD Helios机架级解决方案、AMD Instinct GPU、AMD EPYC CPU、AMD ROCm软件生态。AMD计划未来将Taalas技术融入加速器路线图,结合Instinct GPU开发系统级解决方案。
值得注意的是,Taalas方案并非通用解决方案:其将模型固化到硬件的做法牺牲了灵活性,早期版本也被用户吐槽错误率较高(简单算术题也会答错)。但在对速度和成本敏感、模型相对固定的推理场景(如大模型服务、搜索、推荐系统),这种专用推理芯片具有巨大商业价值。
AI芯片市场正从训练为主向"训练+推理"双轮驱动转变,英伟达虽仍占据主导,但AMD通过自研+并购双线发力,加上Cerebras、Groq等初创公司从不同技术路线突围,AI推理芯片市场格局正在发生深刻变化。