AI 冲击的知识密集新时代:如何看待 DeepSeek 刘胜与的《我不得不把才华埋葬在昨天》
引言
新一代模型同时击穿了知识工作者的 "思维方式"(循环推理 + 隐式分析)和 "工作方式"(自动化闭环),人类工程师基于 "经验" 和 "串行试错" 建立的旧范式正在失效。
一、冲击现场:算子开发被彻底打穿
以文章里 DeepSeek 的 DS v4.1 Flash 为例——CUDA 算子开发、整个大模型推理系统的模型支持、模型性能优化,整个工作面都被 GPT-6 彻底打穿了。
- 95% 的工作都是 GPT-6 完成了实现和优化,很多优化思路也是它自己想的。
- 人类积累的优化知识全部被击穿:单 Kernel 优化、Kernel 融合、数据依赖分析、多 Stream 重叠、PDL、Prefetch、各种"妙妙参数"调整,全部被击穿。
- 这真是我第一次感受到:在 AI Infra 领域,拥有了 GPT-6 就真正实现了 AGI。即使 GPT-6 的模型版本从此不再做任何进化,留给我自己可以发挥的空间,也已经向 5% 以下滑落。
- 推理框架的实现方式、是否开源、在哪个模型上领先某个框架,或许根本就不再是技术问题,只是 token 成本与质量的问题。
二、底层原理:GPT-6 为什么能做到?
传统大模型(如 GPT-5.6 Sol)在处理复杂工程任务时,本质上仍然是 "模式匹配 + 有限推理",其能力上限受限于训练数据和静态网络结构。而 GPT-6 Astra 带来三个架构级的进化,直接打破了这个天花板。
1. 循环深度推理:从"一次猜完"到"反复迭代"
传统 Transformer 模型的推理是一次性前向传播,输出即最终答案。GPT-6 Astra 引入了 ** 循环 Transformer(Looped Transformer)** 架构,允许模型在同一层网络内进行多次内部迭代计算。
- 机制:模型的某些层可以循环处理信息,每一次循环都在前一次的基础上进行校验、修正和深化。这相当于让模型在输出最终答案之前,先在自己脑子里"想很多遍",进行自我纠错和逻辑链优化。
- 效果:这种"慢思考"能力让 GPT-6 能够处理极其复杂的、多步骤的工程优化问题。它不是"猜"一个优化的方向,而是能像人类工程师一样,先提出一个方案,然后反思它,再改进它。这被称为"推理时计算扩展"(Inference-Time Compute Scaling),是其能够自主优化算子的认知基础。
2. 隐式推理链:从"看得见的思考"到"潜意识级优化"
与人类需要写出 CoT(思维链)不同,GPT-6 Astra 能够在 ** 隐空间(Latent Space)** 内部完成复杂的推理步骤,而不将其全部输出为可见的 Token。
- 机制:它将推理的中间状态隐藏在模型的高维表征中,只输出最终结果。这意味着它优化算子时,不必像人一样"先分析数据依赖,再决定融合方案",而是直接在模型内部完成这些复杂的逻辑推演,并以最高效的方式生成最终代码或策略。
- 效果:一是效率更高(因为不输出冗余 Token);二是可以处理人类难以形式化表达的优化直觉。"人类积累的优化知识全部被击穿",正是因为 GPT-6 直接跳过了人类依赖的显式知识表达,在更高的抽象空间里找到了更优解。
3. 原生多模态与统一表征:从"翻译"到"直接理解硬件"
这是最致命的一点。GPT-6 Astra 实现了文本、图像、代码、乃至硬件底层指令(PTX/SASS)在统一语义空间中的表征。
- 机制:传统模型看 PTX 代码,只是"看到了一串字符";而 GPT-6 的隐空间里,PTX 代码的语义与其对应的硬件行为(如内存访问模式、线程束调度、寄存器压力)是直接关联的。它不是在"阅读代码",而是在"理解硬件状态"。
- 效果:这使得 GPT-6 能够直接"看懂"Profiling 工具输出的底层指令停顿、缓存缺失等信息,并像资深工程师一样,将代码瓶颈与微架构行为一一对应。它不需要人类去总结"规则",它自己能从海量的 PTX/SASS 和 Profile 数据中"悟"出优化的本质。
三、自动化闭环:AI 如何完成性能工程?
场景还原:一个完整的自动化性能工程闭环
"睡觉前定目标,起床后发现已完成" 并非奇迹,而是上述架构能力在具体工作流中的产物。这个过程形成了一个完美的自动化性能工程闭环:
- 目标输入:人类工程师输入一个高层次的性能目标,如"将 SGLang 上 DeepSeek v4.1 Flash 的 bs=1 首 Token 延迟降低 30 倍"。
- 深度拆解:GPT-6 利用其循环推理能力,自动将宏大的目标拆解为一系列子任务。它不会从写代码开始,而是先思考:性能瓶颈在计算还是访存?数据依赖如何处理?是否需要 Prefetch?
- 并行试错:凭借其隐式推理和底层硬件理解,GPT-6 可以同时生成十几个、甚至几十个不同方向的优化方案(例如不同的 Kernel 融合策略、不同的 Shared Memory 分配方案)。这远远超出了人类工程师串行试错的能力范围。
- 自主验证:它不仅仅是"生成代码",而是会自主编译、运行 Profile、分析结果,并将结果反馈回循环推理的起点。
- 迭代优化:基于反馈,GPT-6 会快速否定掉不成功的方案(这正是"几乎没有 Reward Hacking"的含义),并在成功方案的基础上进行微观调优,直至逼近理论极限。
在这个过程中,人类从 "执行者" 变成了 "目标设定者" 和 "结果验收者"。所谓 "被击穿",正是自己的定位从 "写代码的人" 变成了 "提需求的人"。
工程现实:闭环已被多个系统验证
从目前业界的实践来看,这个闭环已经不是概念,而是被多个系统验证了的工程现实。其核心是一个 "理解 → 生成 → 验证 → 迭代" 的四阶段循环,每一层都有具体的机制设计。
1. 理解与拆解:从需求到结构化描述
AI 需要理解算子的 "意图"。当前主流做法是:
- 输入形式多样化:用户可以通过自然语言、数学公式、PyTorch 官方文档、GitHub 链接甚至已有代码来描述算子需求。
- 结构化建模:系统将算子信息(名称、输入输出类型、数学公式、适配框架、芯片限制等)分类整理、解析存储,形成结构化的"算子规格"。
- 硬件感知:更先进的系统(如 TritorX)不依赖完整的硬件文档,而是通过"试错"自动蒸馏硬件的实际行为——它会给 LLM 提供编译器和真实芯片的反馈,让模型自己"学会"某块芯片的具体语义和指令约束。这解决了新芯片文档不完整的痛点。
2. 生成与执行:多路线并行试探
这个环节的核心突破是从 "单次猜测" 变成了 "策略性探索":
- 多候选并行生成:AI Agent 不会只生成一个方案,而是针对同一个算子,利用 LLM 的随机性和多种推理路径,同时生成几十个甚至几百个不同的 Kernel 实现(不同的分块策略、不同的调度方式等)。
- 编译与部署:系统会自动编译、安装、运行这些 Kernel,并适配对应深度学习框架(PyTorch 等)的调用规范。像 CATLASS Skills 甚至将这一流程模块化为"工程建立 → 设计 → 代码生成 → 编译调试 → 文档生成 → 精度验证 → 性能优化"七个独立 Skill 模块,可串行也可独立调用。
- 防作弊机制:为了防止 LLM 偷懒(比如调用 CPU 上的 PyTorch 原生函数来"假装"生成了 Kernel),TritorX 设计了定制的 Linter,在代码通过编译前会拦截掉所有非法的高层函数调用,迫使 LLM 真正去写底层代码。
3. 验证与反馈:硬件在环的闭环
这是整个系统中最关键的一环——将真实硬件的执行结果作为反馈信号:
- 硬件在环(Hardware-in-the-loop):生成的 Kernel 会被部署到真实的芯片(NVIDIA GPU、华为昇腾、Meta MTIA 等)或硬件模拟器上运行,采集编译错误日志、执行结果偏差、性能数据。
- 多层次验证:包括编译验证(能否通过编译)、功能正确性验证(与 PyTorch reference 对比数值精度)和性能验证(记录延迟/吞吐)。不同的数据类型有不同的精度容忍阈值(如 FP32 精确到 1e-6,BF16 精确到 1e-2)。
- 错误摘要与反馈:当 Kernel 失败时,系统用更轻量的 AI 模型(如 Llama-4-Maverick)提取编译器和 Profile 工具输出的错误日志,总结成结构化的反馈,喂回给主模型进行下一轮迭代。智子芯元的 KernelCAT 更进一步——在开发 GELU 算子时,它发现硬件内置函数在极端数值下精度不达标,就自动改用手写的多项式逼近,直到验证通过。
4. 迭代优化:知识沉淀与性能爬坡
这个循环不是机械重复,而是有 "记忆" 的:
- 自动迭代搜索:AI 通过"运行 → 分析 → 修改 → 再执行"的闭环,自动搜索最优的 Tiling 参数、调度策略、数据搬运方式等。前文那种"睡前定目标、起床发现已实现",对应的是一个持续运行数小时甚至跨夜的自动优化 Bot。
- 专家知识注入:KernelGen 的实验表明,在优化迭代中引入"模型轨迹总结知识"和"外部专家种子知识",可以显著提升性能。引入后,算子执行正确率达到 75.5%,74.2% 的算子加速比超过 0.8,68.5% 的算子加速比超过 1.0。
- 多芯片知识迁移:同一套优化策略在不同芯片上的表现可能完全不同。像 FlagTree 这样的统一编译器,通过提供一个硬件中间表示层,将不同芯片的差异收敛在编译器内部,使得生成的 Kernel 在多款国产芯片(华为、摩尔线程、海光等)上都具备一定的通用性和可用性。
质变在哪?
传统上,人类优化 Kernel 是串行试错:一次只能沿着一个方向思考,改一个参数、Profile、再改。而 AI Agent 的闭环带来了 **"并行性 × 速度 × 自主性" 的乘法效应 **:
- 并行性:同时探索数百个候选方案;
- 速度:一轮"生成 → 编译 → 运行 → 反馈"可以在几分钟内完成;
- 自主性:不需要人类介入每一步,可以跨夜运行。
这也是为什么 "人类积累的优化知识被全部击穿"——不是因为 AI 用了更高深的技巧,而是因为它把 "试错" 这件事做到了人类无法企及的规模和速度。
四、人的出路:如何研究"用 AI 更好地写算子"?
刘胜和自己给出了答案:"研究如何用 AI 更好地写算子。" 这句话背后是一个角色转型的蓝图。结合前面拆解的闭环,具体可以从以下四个维度入手。
1. 掌握"AI Agent 算子开发"的基建工具
这是最基础的第一步。你需要熟悉目前已经比较成熟的平台和工具栈:
| 工具 / 平台 | 特点与数据 |
|---|---|
| KernelGen / FlagOS | 基于 FlagTree 统一编译器,支持多芯片自动算子生成与验证;当前生成成功率 82%,执行正确率 62%;可在 Web 端通过自然语言直接生成 Triton Kernel |
| CATLASS Skills | 昇腾平台上专门针对矩阵乘算子的全流程自动化开发技能体系,从设计到优化共 7 个模块;声称"传统 3–5 天缩短至 1 小时" |
| TritorX(Meta) | 面向 MTIA 加速器的端到端 Kernel 自动生成系统;84.7% 的算子覆盖率;开源模型 + 硬件在环验证 |
| KernelCAT(智子芯元) | 主打"大模型 + 运筹优化 + 自动算法发现";在 KernelBench 上实现正确率 100%、平均加速比 2.12 倍 |
你需要像当初学习 CUDA/Triton 一样,去学习这些工具的架构、输入输出规范和 Skill 编写方式。
2. 学会构建和定制闭环中的各环节
理解了 "理解 → 生成 → 验证 → 迭代" 闭环之后,你就会知道:AI 写算子的瓶颈往往不在 "生成" 这一步,而在正确的目标定义、有效的验证和合理的反馈。你的角色应该是:
- 定义评价标准:哪些算子需要优化(热点分析)?性能目标是什么(延迟/吞吐/内存)?正确性容忍度是多少?这些需要你基于对业务模型的理解来设定。
- 调试反馈信号:当 AI Agent 产出错误的 Kernel 时,它可能给出模糊的日志。你需要具备阅读 PTX/SASS、阅读 Profile 数据的能力,去判断到底是访存瓶颈还是计算瓶颈,并将这个判断转化为更清晰的 Prompt 或约束,注入到下一轮迭代中。
- 积累领域知识库:"引入模型轨迹总结知识"和"外部专家种子知识"可以显著提升 KernelGen 的优化效果。这意味着,你过去手写 Kernel 时积累的那些"妙妙参数"、对特定芯片架构的直觉、对某种算子数值特性的理解,都可以提炼成结构化的知识,注入到 Agent 的迭代过程中。经验变成了"元知识"——这仍然是很难被替代的价值。
3. 主动参与开源社区,成为"经验提供者"
目前多个关键项目(如 KernelGen、FlagTree、CATLASS Skills)都已开源或正在建设社区。你不需要从零开始造轮子,而是:
- 贡献正确的 Profile 数据和 Benchmark 结果:这些是训练 Agent 微调模型或构建 Knowledge Base 的关键原材料。
- 编写和分享"Skill"模块:CATLASS Skills 的设计理念就是通过模块化的"技能"来固化工程经验。你可以针对自己熟悉的某个细分领域(如 Flash Attention、稀疏注意力、Grouped MatMul),编写面向 Agent 的 Skill 描述和优化模板。
- 参与"模型自反思"的评测和迭代:一些系统(如 KernelGen)已经在用模型对自身的生成结果进行反思和优化,反馈其中暴露的问题(比如边界条件处理不当),这需要人工专家的介入。
4. 训练"目标价值判断"的顶层能力
AI 擅长在给定的约束空间里找到局部最优解,但它不擅长判断什么是更有价值的问题。这是人类最后的、也是最重要的领地:
- 识别"更高阶的优化问题":优化单算子 vs. 算子融合 vs. 图级别的重排,哪个对模型端到端吞吐提升最大?这需要全局视角。
- 判断"优化边界":什么时候该停?继续优化边际收益递减时,是否应该把资源投到另一个算子上?这不是 AI 能自主决定的,需要你结合业务场景做决策。
结语
正如智子芯元的理念所表述的:"让智能体接管九成以上的工作,人只留在设定目标和最后验收这两头。" 你不再是那个织毛衣的人,但你是那个设计毛衣机器、决定织什么图案、以及判断毛衣质量的人。
评论交流
欢迎留下你的想法