DeepSeek工程师预测:AI将掌握GPU算子开发,程序员角色迎来转型
DeepSeek工程师分享AI算子开发趋势,分析AI Agent如何改变CUDA优化、GPU Kernel开发以及未来底层研发岗位模式。

引言
DeepSeek V4.1主Attention算子作者刘胜与发布的长文《我不得不把才华埋葬在昨天》,近期在技术社区广泛传播,被翻译为多国语言引发全球AI从业者讨论。作为深度参与底层模型算子开发的一线工程师,他基于自身落地实践提出一个大胆判断:在半年到一年时间窗口内,AI将具备独立编写、调优高性能算子的能力,水平追上甚至超越人类工程师。这一论断并非单纯技术畅想,还延伸到工程教育体系、人机分工、技术权力分配等一系列深层命题,为大模型底层研发领域提供了全新的思考视角。本文将拆解其核心观点,结合底层算子开发行业现状,分析这一趋势对研发岗位、工程人才培养以及AI工程落地带来的连锁影响。
刘胜与是DeepSeek V4.1版本核心Attention算子实现者,独立完成head dim=512的MQA(Multi-Query Attention)算子交付工作,V4.1模型在小模型推理性能与执行效率上的优化成果,该算子贡献了关键支撑。长期深耕CUDA底层开发的他,亲历AI工具从辅助文档检索、代码查错,逐步走向独立编写高性能计算代码的演进过程。基于持续观测,他给出时间预判:半年至一年,AI算子开发能力将达到人类顶尖工程师水准。
一、AI算子开发能力演进:从辅助工具走向独立优化专家
高性能算子是大模型推理加速的基石,也就是模型运行时在GPU上执行的底层计算逻辑。传统算子开发要求工程师熟练掌握CUDA、PTX、SASS汇编,需要借助性能分析工具逐条拆解指令的停顿周期,不断调整内存访问策略、计算调度方案,最终压缩延迟、提升硬件利用率。这项工作门槛极高,不仅需要深厚的GPU硬件知识,还要大量试错调优,长期以来属于少数底层工程师掌握的专业能力。
刘胜与观察到,AI在算子领域的能力正在快速跨越阶段。过去,AI只能承担辅助工作:查阅官方文档、读取已有代码片段,辅助定位简单bug。在这个阶段,AI是工程师的助手,核心的逻辑设计、指令调优,依旧由人类完成。而按照当前模型迭代速度,在半年到一年后,AI将进化为独立算子优化大师。它能够直接阅读CUDA源码、PTX中间代码与SASS汇编指令,借助硬件性能分析工具,逐条评估每一条指令的耗时与停顿,自主完成算子编写与迭代优化。
这一变化,会直接改写底层GPU算子开发的工作模式。过去一个算子从原型到上线,工程师需要反复修改、多轮性能剖面测试;未来AI可以并行生成多套算子实现方案,自动在不同GPU卡型上做基准测试,筛选延迟最低、显存占用最优的版本。人类工程师的核心工作不再是逐行编写底层指令,而是定义算子目标、约束边界,评估AI产出代码的正确性、稳定性。
很多技术从业者会产生疑问:算子开发涉及硬件特性,是否真的可以被AI掌握?从当前开源模型在CUDA编码任务上的评测数据来看,模型已经可以实现基础算子编写,只是复杂优化、边界异常处理还依赖人工校验。随着模型持续吸收海量GPU底层代码、硬件调优案例,AI在算子领域的能力上限会持续拉高,最终在标准化算子场景超越普通人类工程师。当然,硬件架构颠覆性创新场景,依旧需要人类做顶层设计,但常规模型推理算子的开发工作,会大量由AI承接。
二、工程师职业转型:手写底层代码的开发者,转变为AI Agent的“机甲驾驶员”
在大众讨论AI替代岗位的恐慌氛围下,刘胜与提出的观点并非失业论,而是岗位转型。未来底层工程师的身份,会从逐行手写底层指令的开发者,转变为AI Agent的机甲驾驶员。人机分工将被重新定义:人类负责下达目标指令,设定业务约束、安全边界,评估方案优劣;而吞吐效率极高的AI Agent负责具体代码编写、迭代调试、基准测试等重复性高强度工作。
他使用纺织行业的例子类比这一变革:自动织机诞生之后,手工织工并没有彻底消失,但手工编织的核心乐趣、大规模生产价值被机器大幅压缩。放到算子开发领域,AI Agent可以快速生成多版本CUDA代码,完成上万次基准测试,人类工程师不再需要耗费大量时间反复调试指令停顿、显存分片。
岗位转型之后,工程师核心能力重心发生转移。过去考核重点是CUDA编程熟练度、汇编调优技巧;未来,工程师核心价值体现在任务拆解、约束定义、结果校验、风险识别。懂得如何向AI下达精准指令、识别AI生成代码中的隐藏缺陷,会成为新一代底层工程师的必备技能。不懂算子原理的使用者,无法判断AI输出代码是否存在显存泄漏、数值溢出、硬件死锁等隐性问题,底层硬件知识依旧是重要基础,但工作内容的占比会发生巨大改变。
这种人机协同模式,在各类AI开发场景中快速普及。企业落地大模型服务时,往往需要统一管理多模型接口、做流量调度,koalaapi作为API gateway,可以简化多模型接入流程,帮助研发团队快速搭建稳定的模型调用链路,把人力更多投入任务设计与方案评估。
当然转型过程也伴随阵痛。长期依赖手写底层代码的工程师,需要调整工作习惯,学习如何和AI Agent协作,把精力转移到更高维度架构设计。如果固守传统编码工作模式,工作效率会被熟练使用AI Agent的同行拉开明显差距。
三、教育、成本与权力:AI时代衍生的深层社会命题
文章后半段,刘胜与跳出技术层面,抛出两个值得整个行业深思的核心议题:工程教育的变革,以及技术背后的权力分配。
在教育层面,过去打磨底层工程能力需要大量时间、高额硬件成本。而在AI时代,学生只需要极低成本,花费几分钟,就能借助AI完成高难度Lab实验。这里就引出一个关键疑问:当AI可以快速产出工程结果,我们还需要投入大量精力打磨底层工程能力吗?这类底层硬件、算子知识,会随着时代被抛弃,还是长期作为从业者的基础基座?
他同时指出一个反常识现象:工程基础薄弱的人,搭配强大AI工具,产出低质量工程方案的速度会更快。没有底层知识作为判断基础,使用者无法识别AI代码的缺陷,快速生成大量有隐患的实现,快速堆砌出“看似可用”但稳定性差的工程产物。这意味着未来工程领域的门槛会分化:入门门槛降低,但是高质量工程产出的门槛反而提升。区分工程师水平的标尺,不再是能不能写出代码,而是能不能甄别AI输出方案的缺陷、评估方案长期运行风险。
除教育之外,还有权力层面的思考。在AI能力爆发之后,权力、资源分配的权重,是否会超过技术和智商本身?顶尖模型、算力资源掌握在少数平台手中,能够优先使用最强AI Agent的团队,可以更快完成算子迭代、模型优化。算力与模型访问权限,会成为企业和个人核心竞争力。即便工程师具备深厚技术功底,如果无法获取顶尖AI工具,产出效率也会落后。这个观点,戳破单纯技术至上的思维,提醒从业者重视资源、权限在AI时代的影响力。
四、选择留守DeepSeek:开源普惠AI的价值追求
刘胜与解释自己留在DeepSeek的核心原因:他认为前沿智能能力,应当以开放、廉价的方式供给全球使用者。他对Anthropic、OpenAI的产品路线持保留看法,认为DeepSeek持续研发强大、快速、普惠的开源AI,或许可以把行业发展方向拉回更均衡的轨道。
当前主流闭源大模型厂商倾向于封闭生态,模型权重、底层优化方案不对外完全开放;而开源路线允许开发者自由下载权重、修改底层算子,自主部署、二次调优。开源模式降低全球开发者使用前沿大模型的门槛,独立研发人员、中小团队,不需要高额算力预算,就可以基于开源模型,完成算子定制与业务落地。
开源AI生态的持续壮大,也推动算子优化、推理加速技术在社区快速流通。大量社区开发者共同贡献算子实现方案,互相验证性能缺陷,加速底层技术迭代。闭源与开源两条路线的博弈,会持续影响未来AI技术的普及方式,以及技术红利的分配格局。编辑观点认为,刘胜与的思考,不止局限算子开发,也折射出AI技术冲击各行各业之后,全行业需要面对的人才、教育、资源分配问题,开源AI的发展方向值得长期关注。
五、行业启示与未来展望
综合刘胜与的预判,半年至一年的时间窗口,将是底层算子开发领域的重要转折点。AI逐步掌握高性能算子开发能力,不是简单替代岗位,而是重构人机协作模式。对于底层研发从业者而言,与其抗拒AI工具,不如主动适应角色转变,将重心从重复底层编码,迁移到任务定义、风险校验、顶层架构设计上。
对于企业研发团队,需要提前布局人机协同开发流程。建立AI生成算子代码的审核规范、自动化基准测试体系,防止AI输出代码带来线上稳定性隐患。同时,人才培养思路也要调整,工程教育不能单纯训练手写代码能力,更要训练学生读懂底层原理、评估AI输出质量、识别隐性工程风险的能力。
从行业宏观视角,开源与闭源生态的竞争、算力资源分配、工程教育改革,会伴随AI能力提升持续发酵。AI算子能力突破,只是整个技术浪潮的其中一环,后续AI会持续向更多高门槛底层工程领域渗透,持续改变软件研发行业的工作范式。技术演进无法逆转,如何合理利用AI工具、守住工程质量底线,平衡技术普惠与资源公平,是所有从业者需要持续探索的课题。
了解更多:https://koalaapi.com

