
把“AI 刻进硅片里”要看懂失业小哥的操作有多逆天得先明白 AMD 花重金买了个怎样的公司。在目前的 AI 世界里英伟达的 GPU 是绝对霸主。但随着大模型越来越庞大GPU 遇到了不可逾越的内存墙。简单来说传统的 GPU 架构冯·诺依曼架构中计算单元和存储单元分开。每次计算GPU 都要去 HBM 里把模型的“权重”搬出来算完再放回去。而成立于 2023 年的加拿大初创公司 Taalas 直接打破常规。他们的创始人 Ljubisa Bajic前 Tenstorrent CEO提出逆向思维既然搬运数据慢为何不直接把大模型的权重物理“刻”进芯片的晶体管里这就是 Taalas 的杀手锏——特定模型集成电路。他们不搞通用的 GPU而是围绕某一个 AI 模型定制硅片将模型的权重和数据流硬连线成电路。结果极其震撼——他们的第一代测试芯片 HC1基于台积电 6 纳米工艺在运行 Meta 的 Llama 3.1 8B 模型时达到了 17,000 tokens/秒/用户的推理速度根据 Taalas 早前说法这个速度是英伟达 H200 的 73 倍而功耗只有其十分之一虽然代价是“一颗芯片只能跑一个特定的模型”但由于流片周期短至两个月成本被极大摊薄。这就是 AMD 毫不犹豫买下它的原因。看起来这是只有顶尖硬件团队才能玩转的“黑科技”直到这位失业小哥出现。7000 行代码的“炼金术”面对估值过亿的 Taalas失业小哥没被吓倒。相反失业的半年里他像沉迷解谜的黑客一头扎进 Taalas 公开的专利文件。看了几个月后他想到“Taalas 的设计思路依然有优化的空间”他在 X 上指出Taalas 的技术虽厉害但仍从只读存储器ROM里读取数据bitROM在他看来这种能量消耗可“完全跳过”。于是他闭关爆肝用约 7000 行人类可读的代码写出一个“AI 模型硬件编译器”。这套编译器逻辑简单粗暴能把 HuggingFace 上的大模型直接“翻译”成硅片电路他公布的流水线工作流堪称魔法1. 输入模型直接丢进一个 HuggingFace 的 checkpoint模型权重文件。2. 模型量化编译器自动将模型极致量化他声称自己纯软件驱动的量化比 Taalas 硬件团队做得更好。3. 权重下沉将量化后的权重沿金属层“下沉”转换为 RTL寄存器传输级芯片设计的逻辑代码和 GDS芯片制造的光刻掩模版图。4. 物理验证自动跑完 DRC设计规则检查、Yosys开源综合工具、PEX寄生参数提取。5. 最终产出一张可把 HuggingFace 模型中的矩阵乘法变成电子波形执行的物理电路图这个流水线能一键输入大模型一键输出 AI 芯片图纸。听起来像天方夜谭性能预测更让人惊讶。他声称通过更彻底的“硬编码”方式他的设计比 Taalas 的 bitROM 减少了 100 倍的内存获取。在推特上他艾特几位大 V 发出灵魂拷问“想看 40,000 tokens/sec 吗”要知道Taalas 跑出 17,000 tokens/s 已被 AMD 视为珍宝而他的目标直接让性能翻了一倍还多人才招聘现场其实这个故事真正令人印象深刻的是失业小哥在帖子中求助“顺便问一下谁有晶圆厂的人脉或者能弄到 7nm 的 PDK工艺设计套件再或者欧洲 PTW 班车一种廉价的多项目晶圆流片服务的联系方式……我破产了而且失业了。”最高端的技术最落魄的处境令人唏嘘。一位网友感慨“真没想到单靠研究专利就能把整套方案做出来还只有七千行代码……这执行力真强个人英雄主义的浪漫。”这篇 X 立刻成了硅谷的“人才招聘现场”。知名 AI 研究员 Stanislav Fort 留言“你能拿这个去融一笔 VC 的钱吗如果这是真的绝对是个灌篮级别的扣篮得分。”小哥激动回复“我们正在找钱”就连因操纵药价出名的“医药界华尔街之狼” Martin Shkreli 都来凑热闹“我雇你把芯片造出来。”一群 VC 合伙人、科技公司高管也纷纷留言“快看私信我想我们应该谈谈。”当然懂行的工程师提出致命问题为什么第一版就要挑战 7nm 工艺小哥的回答揭示芯片制造残酷的物理法则“因为大模型太复杂13nm 的工艺光刻面积根本装不下。只有 TSMC 能做 7nm 及以下。但想做 5nm 或 6nm你必须是英伟达、苹果或博通这种大鳄TSMC 才会坐下来跟你谈判。”这形成巨大悖论一个人能用 7000 行代码在卧室里颠覆千亿巨头的逻辑设计但却因掏不起台积电的几百万美元流片费只能在网上求助。这件事也告诉我们AI 芯片的设计正在从“硬件工程”降维成“软件编译”问题。长期以来设计一款芯片耗时数年、需几百名硬件工程师协同、花费数千万美元。但现在逻辑变了。如果大模型的最终归宿是变成“ASIC”如果输入一个 AI 模型经过编译、量化、自动生成电路的流水线能被彻底打通那么未来的芯片设计将不再是物理搭建而只是软件编译器的一个 Target。正如一位大 V 所写“这个项目现在还只是预硅片阶段但释放的信号极其有趣。如果这个流水线checkpoint → quantization → RTL → GDS变得自动化定制 AI 芯片将越来越不像多年的硬件项目而更像一次代码编译。”