# 编码工业化后程序员价值如何重分配

- 来源：ginobefun (@hongming731)
- 发布时间：2026-08-23 20:59
- AIHOT 分数：44
- AIHOT 链接：https://aihot.virxact.com/items/cmt5uzewn0rjbro73tvxb97e6
- 原文链接：https://x.com/hongming731/status/2091510733251174840

## AI 摘要

BestBlogs 精选周刊第 109 期聚焦程序员职业未来，核心判断是编码执行正被工业化，但程序员价值不会自动消失或上移。周刊从工业化、治理前置、组织提效三方面展开，引用 Anthropic、Stripe、METR 等案例与数据，指出新分水岭在于定义问题、转化组织知识、独立验证与结果负责。

## 正文

http://x.com/i/article/2091509992168083456

BestBlogs 精选周刊第 109 期：程序员的职业未来

🎧 本期也有播客版本：BestBlogs 周刊第 109 期 · 时长 22:26 · 在小宇宙搜索「BestBlogs 周刊」即可收听。

在线阅读和收听：https://www.bestblogs.dev/newsletter/issue109

导语：编码工业化之后，价值不会自动上移

关于程序员的未来，现在最常见的是两种截然相反的判断。一种认为，编码已经进入自动化阶段，大量岗位会很快消失；另一种认为，软件需求没有上限，工具越强，程序员反而越稀缺。两种说法都抓到了一部分事实，也都容易把一个复杂的职业重组压缩成单向预测。

本周 20 篇精选内容给出了更细的图景。Agent 正在接走越来越多可描述、可检索、可验收的实现任务；与此同时，验证、权限、组织知识、业务语义和真实环境反馈变得更重要。人不会因为少写代码就自然获得更高价值。只有当这些新职责被真正承担、被组织识别并进入评价体系，所谓角色上移才不是一句安慰。

过去七期周刊，我们从 Token、上下文和验证的成本谈到模型与 Harness 组成的执行系统，又依次讨论判断力、可靠性边界、1% 法则和个人 AGI。第 108 期回答了智能怎样穿过工具、状态与环境稳定完成任务。第 109 期继续追问：当执行层已经开始工作，任务、岗位、组织权力和结果责任会怎样重新分配？

我的中心判断是：编码执行正在被工业化，但程序员的价值不会自动消失或自动上移。新的分水岭，是谁能定义值得解决的问题，把组织知识变成机器可用的上下文，用独立验证约束高速执行，并对进入真实世界的结果负责。

一、工业化会拿走哪些工作

阮一峰在科技爱好者周刊第 409 期里，从软件工业化的内在逻辑出发讨论程序员的未来。企业持续追求更低成本、更快速度和更稳定的质量，只要编码 Agent 继续改善，它就不会因为某一轮估值周期结束而退出开发流程。手工编码会减少，生成门槛会下降，程序员的工作将更多转向改进 AI、审查结果和测试变更。

这个方向值得重视，但文章中的九点预测仍然是趋势推演，不是就业数量与时间表的实证结论。任务被替代、岗位被取消和职业价值下降是三个不同层次。机器可以接走某类实现任务，团队也可能把释放的产能投入新产品、技术债或过去无法服务的长尾需求。岗位总量最终还要看需求是否增长，以及企业选择扩张还是降本。

京东技术对 AI Coding 四阶段的拆解提供了一个更贴近日常工作的观察框架：工具、副驾、协作者、共生体。越是形式化、可检索、可流程化的劳动，越适合交给 AI；人则上移到需求分治、约束设定、置信度分流、验证与裁决。团队用需求分治 Skill、仓库路由表和架构图让 AI 参与系统拆分，这时工程师已经不只是实现者，也在设计机器与人怎样分工。

不过，京东的文章没有把角色上移包装成就业保险。效率提高如果遇上增长放缓，岗位总量仍可能收缩。学习判断、取舍、怀疑和知识沉淀，会提升一个人的迁移能力，却不能保证每个组织都愿意为这些能力保留位置。这是职业讨论中必须保留的现实约束。

Anthropic 的 Claude Code 初创公司指南访问了十多家快速增长公司，归纳出五条规则：让更多角色参与交付、自动化机械工作、信任但验证、为重构而构建、先内部自用再生产化。官方案例称 ClickHouse 多交付 30% 功能、Omni 工程效率提高 2 至 3 倍、Clay 自动化全部缺陷分诊、Artemis Security 每周处理 6000 多个 PR。这些公司口径证明高吞吐已经可以实现，却不能直接外推到所有团队，更不能换算成就业数量。

Stripe 总裁 Will Gaybrick 的访谈给出了需求侧的反例。Stripe Minions 在一周生成约 7000 个 PR，占全部 PR 的约 30%；内部知识工具 Kai 由两人构建，周活跃使用率达到 83%。Stripe 把新增产能用于回应更多客户需求、扩展产品边界和准备智能体商业，而不是只把它换算为减少工程师。这不是未来的唯一答案，但说明软件变便宜以后，需求也可能扩张。

真正困难的是，我们甚至还没有一种稳定的方法测量今天的 AI Coding 生产率。METR 在 2025 年的随机实验中发现，16 位熟悉自己项目的开源开发者使用当时前沿工具后，平均慢了 19%。到 2026 年 2 月的更新，样本扩展到 57 位开发者、143 个仓库和 800 多个任务，估计已经接近轻微提速，但置信区间很宽，任务选择、并行 Agent 与计时方式又让结果变得不可靠。约 30% 至 50% 的开发者还会避开不能使用 AI 的任务。

这组前后变化比单个百分比更有启发。当人开始挑选适合自动化的任务，并行安排多个 Agent，旧的工作单元已经改变。我们也许知道工具方向在进步，却很难用坐在编辑器前的工时精确回答端到端收益。PR 数、生成代码量和主观流畅感都只是局部信号。

因此，工业化最先拿走的是可描述、可检查、可重复的编码劳动。它降低进入门槛，也提高少数人的杠杆。个人应该继续写代码，但不能再把价值只定义成敲出代码的速度；组织则必须回答更难的问题：新增产能究竟转化成了客户价值、可靠性，还是更大的审查队列。

二、生成越快，治理越靠前

执行成本下降后，系统会产生更多代码、更频繁的变更和更大的影响范围。此时稀缺环节不再是生成，而是验证、治理与责任。Thoughtworks CTO Rachel Laycock用一句话概括新的分工：公民构建，智能体执行，专家治理。

这个框架回应了高管常问的问题：非技术人员周末就能做出应用，为什么企业工程团队不能快十倍？原因是演示软件不会自动处理安全、韧性、可审计性、扩展性和长期维护。生产系统中的专家治理，也不是上线前找资深工程师看一遍代码，而是把权限、观测、回滚、责任和停止条件提前嵌入执行链。

Claude Tag 作为 Anthropic CI/CD 故障第一响应者展示了这种治理怎样被编码。编排 Agent 并行读取 Grafana、日志、PagerDuty、GitHub、Kubernetes 与 Slack，再结合调查 Skill、playbook 和持续更新的 lessons 文件生成态势报告。官方披露，近期相关事故的首份报告通常在 15 分钟内完成，中位首份证据分析为 14 分钟，最快 4 分钟定位根因。

数字很亮眼，边界同样重要。每个改动仍有具名的人类负责人，必须人工批准，并通过相同的持续集成门禁。团队明确承认 Claude 第一次判断并不总是正确，人类直觉仍然重要，连报告格式也经过多轮调整。Agent 接走了并行搜索、证据整理和状态沟通，人承担解释、取舍与发布责任。事故经验则从个人记忆进入可版本化的调查系统。

GLM-5.3 的发布把能力与治理放在同一张表里。智谱没有更换 GLM-5.2 基座，而是延长后训练并加入更多长程任务环境。官方内部编程体感评测提升 50%，联合安全团队初筛、去重后累计发现 2436 个漏洞，其中 1097 个属于中高危。这一结果说明网络安全能力可能在训练中涌现，也说明开放权重前的能力评估与安全加固会成为模型工程的固定职责。

模型能发现漏洞，不等于系统天然安全。更强的攻击与防御能力可能同时出现，开放范围、身份、沙箱和动作审查必须随着能力升级。Addy Osmani 的访谈从另一侧提醒我们，过度委托还会形成认知债务。工程师持续交付自己不理解的代码，短期速度很快，长期会在事故、迁移和维护时偿还理解缺口。

Addy 的建议并非拒绝 Agent，而是让生产信号、影响范围、人工审查和明确所有权进入软件工厂的反馈环。技术好奇心也不是浪漫附加项。只有持续追问系统为什么这样工作，工程师才有能力在自动验证覆盖之外识别异常，在新场景里重新建立判断。

NVIDIA ALCHEMI 的外部案例进一步说明，验证必须独立于生成路径。团队评估 45 条 AI 生成的材料模拟流程，覆盖三类工作流、五档提示细节和每档三次采样。提示更详细改善了代码结构与复用，却没有保证物理正确性。7 条流程在目标 H200 环境运行时失败，而 CPU 自测没有暴露问题。

更严重的是，有一段代码用同一个错误常数验证错误的单位转换，自测仍然通过；某个恒温器选择把扩散速度压低 3 至 5 倍，只有独立实验锚点发现偏差。代码能运行、统计上稳定和物理上有意义，可以彼此正交。如果生成器同时负责实现和验收，它很容易把同一个误解复制两次。

这一节的编辑判断是：治理会从发布前的审查动作，变成贯穿任务生命周期的系统设计。权限、观测、独立验证、事故记忆和责任越早进入执行链，Agent 才越有资格获得更大自主性。专家价值会被放大，但专家容量也可能成为新瓶颈，所以治理自身同样需要清楚的接口、证据与反馈。

三、个人提效为何卡在组织里

大淘宝技术对 AI Native 团队的思考把企业困境概括为「单点优化、全局低效」。工程师写代码更快，需求仍要排期，信息仍分散在文档和聊天里，跨团队联调仍靠人催，审批与等待也没有消失。一个环节吞吐突然上升，甚至可能让后面的审查、测试和发布更加拥堵。

他们提出的三层结构是知识底座、分工明确的 Agent，以及承担目标与判断的人。软件本来就是被固化的知识。当业务规则、架构决策和事故经验无法被机器正确检索，Agent 只能反复猜测或打断人。组织速度的上限因此取决于知识是否准确、可访问、会更新，而不只取决于模型是否更强。

腾讯安全中心的团队知识实践把这件事拆成知识盘点、结构化与检索选型、准入门禁、分级、过期退场和知识包分发。团队披露代码审查从半小时至两小时缩短到平均 3.4 分钟，知识月增量从 86 条增加到 716 条。这个结果来自单团队，真正可迁移的是把知识当成有来源、有版本、有生命周期的生产资产。

知识库不是越大越好。错误和过期内容一旦进入自动检索，会被模型以更高速度扩散。准入、引用、版本、责任人和退场机制决定它能否被信任。未来一部分工程工作，会从写新功能转向维护组织能够共同使用的事实底座。

腾讯健康团队的研发项目管理实践从价值流测量切入。他们发现 AI Coding 提高个人产出后，排期、联调和跨团队等待仍然主导交付周期，于是让 PM 从过程催办转向效率治理：统一流程模型，自动校准状态，持续巡检异常，再分析系统瓶颈。

团队披露，中位交付周期从 19 天降至 9 天，P85 从 52 天降至 23 天，30 天以上的长尾需求从 35% 收敛到 7%。这些变化不能归因于某一个 AI 工具，也不能直接复制到所有企业。它证明的是，组织摩擦可以被建模、观测和持续治理；如果只优化编码环节，交付速度会在等待中失去。

Linear 的 2026 年报告提供了很有价值的交叉验证。连续活跃的 12.7 万名付费用户样本中，各职能 AI 采用率在半年内翻倍；截至 8 月，接近一半 issue 由 AI 撰写。与 2024 年 6 月相比，每工作区创建的 PR 增长 111%。可是，用户在 Linear 内花在规划上的时间没有下降，AI 更像新增的一层工作，原有时间没有自动缩短。

连接 Agent 的团队每周 PR 从 21 增至 65，未连接团队从 8 增至 10。两组团队原本就不同，统计的又是打开而非合并的 PR，更没有测量客户价值。Linear 自己也明确说，无法由此判断业务结果是否改善。这提醒我们，活动量只能说明系统很忙，不能证明组织正在前进。

Slack 与 Anthropic 的人机团队经验强调默认公开的知识、清楚的 Agent 角色、稳定的人机交接，以及按结果而非使用量衡量。Agent 可以起草、总结和监控，人要审查、决定和改向。受访者同样承认，没有一个仪表盘能直接证明使用量带来业务结果。采用率是脉搏，不是价值证明。

ABC Legal 的公司案例展示了非工程师参与构建的可能性。其官方披露覆盖 1100 名员工、50 多个生产 Agent 和约 310 名日活用户，部分任务成本最多下降约一半。关键并非让所有人随意发布自动化，而是把每个 Agent 都按代码管理：版本、PR、审查、回滚、审计一项不少，调优 Agent 只能提案，人决定是否合并。

大淘宝直播团队的 Semantic 语义层实践补上了业务接口。指标、维度、逻辑表与适配层把物理数仓抽象成业务可理解的知识图谱，再供 Data Agent 和人类 BI 共同消费。数据研发的角色从 SQL Developer 转向 Semantic Architect 与 AI 教练，重点变成定义一个指标是什么意思、可以怎样组合、来源如何绑定、结果怎样验证。

这一节的结论是，个人提效经常被组织等待吃掉。真正的组织跃迁需要重构价值流、公共知识、业务语义和人机交接。评价体系也必须跟上。如果公司仍然奖励代码量、会议数、PR 数和 Agent 使用次数，它得到的只会是自动化后的旧式忙碌。

四、程序员开始设计会学习的系统

当知识与流程能够被机器调用，工程对象也在变化。程序员不再只是使用一个稳定工具，而是在设计一条会学习、会调整、可能越改越好，也可能越改越乱的执行回路。一张约 2480 万 Token、202 元的真实账单，很好地揭示了这种系统的反直觉之处。

实验中，CodeGraph 在明确符号任务上最多节省 80%，在完整调用链等任务中却可能增加 95.8% 至 152.9%；压短终端字符也没有稳定降低总 Token。局部输入变少后，Agent 可能走更多步骤、重复搜索信息，或者在交接时重新构建上下文。单轮更省不等于整项任务更便宜。

团队后来重做 Handoff、Artifact、路由与熔断，把状态迁移和去重交给确定性程序，让模型专注推理。GLM 平均每步 Token 从 10.68 万降到 6.70 万，Claude 总量下降 23.34%。这里真正可迁移的能力，是沿完整轨迹判断成本，把局部指标放回最终结果。

DeepSeek Harness 的新世界观把 Session、系统提示、工具和 Agent Loop 等传统固定组件拆成插件，只留下 Cordis Runtime 管理依赖与生命周期。所谓时空可组合性，希望同一组原语可以在一个工作流里组合，也能在不同阶段被替换。对强化学习而言，这些组件边界还是信用分配的干预点。

插件化并不等于系统已经可以稳定自我进化。不同组件的交互可能产生新失败，奖励可能被利用，所谓通用 Harness 也可能并不存在。上一期周刊讨论了执行层怎样连接模型与环境；这一期更关心维护它的人：谁决定哪些部分可以学习、哪些部分必须确定，哪些变化需要留出集验证，何时回滚，何时停止。

阿里安全团队的 Skill 改进流程给出了一套可审计的回答。确定性规则先诊断失败，大模型只生成不超过 80 行的最小修改，再经过 target、guardrail、holdout 和 verify 四层门禁。系统保留跨版本黑名单、失败 patch 与检查点，案例中 GLM 准确率从 77.8% 提升到 88.9%。

作者同时划清能力边界：这套循环只能优化已有工具范围内的「怎么做」，不能凭空补齐一种不存在的能力。失败修改和 ground truth 审计也不是废料，它们定义了系统不应该再次走入的区域。会学习的系统需要记住失败，但记忆本身也要能够被检查和删除。

Evolvent AI 创始人胡梦康的访谈把 Agent 进化所需数据概括为 Environment、Task 与 Verifier。真实长程环境暴露能力缺口，任务定义学习目标，独立评价防止 reward hacking。通用 Agent 可能逐渐被基础模型吸收，帮助 Agent 接触环境、形成反馈并证明进步的系统，仍可能保留独立价值。

这是一项等待市场成熟的创业判断，却指出程序员可能迁移的新位置：不只构建一个 Agent，也构建它接受训练、暴露失败和证明能力的世界。环境需要版本，任务需要分布，验证器需要独立，训练与评测之间还要防止泄漏。

Anthropic 2026 年 6 月的经济指数也说明，产品形态会改变同一个模型的自主程度。Claude Code 的平均自主程度比普通聊天产品高 0.37 分；控制为同一个 Sonnet 模型后仍高 0.26 分。Harness、权限和交互设计与模型本身一起决定人机分工。用户自报的速度与质量改善只能作为体验信号，不能排除选择偏差和技能侵蚀。

因此，未来程序员会越来越多地设计完整学习回路：给对上下文，划分可干预组件，用轨迹与独立验证分配改进信号，并为成本、回滚和停止条件保留确定性边界。框架熟练度会折旧，让系统在变化中仍然可理解、可检验、可负责，才是更持久的工程能力。

五、代码之外，稀缺性回到领域和现实

如果生成能力继续扩散到设计、研究、搜索和机器人，人的优势还能否概括为掌握某种工具？OpenAI 产品设计负责人 Ian Silber认为，设计师的焦虑主要来自职责预期快速变化。AI 降低了表达和探索成本，一个想法可以更快被做出来，也可以更快被舍弃。

设计任务的成功标准通常比工程委派更开放，需要反复提出、验证、推翻，再经过用户反馈和团队共识。品味不会因此成为不可解释的天赋，它仍然要接受用户和市场检验。稀缺的是理解人、定义问题、判断质量，以及在精细打磨与公开试验之间选择合适节奏。

这种变化同样适用于程序员。许多工程问题没有唯一正确答案，架构需要在速度、成本、可靠性和迁移难度之间取舍。生成器可以列出方案，最终仍要有人解释风险、选择什么不做，并承担发布后的结果。

17 岁研究者苏庭灏的访谈把职业问题带回学习与动机。他从在线课程和 GPT 教程起步，坚持 30 天每天读一篇论文，在自写 Transformer 框架上做了 200 多次实验。按访谈口径，他的注意力研究被 ICML 2026 Main Track 接收。

这个个人经历不能被外推成所有年轻人都能借 AI 快速成为研究者。更值得保留的是效率与意义之间的张力：AI 帮助他更快获得答案，也会削弱独立解决难题后的成就感。长期投入需要好奇心、自由探索、人际连接和对问题本身的兴趣，效率无法替代一个人为什么愿意继续做下去。

2026 年世界机器人大会的现场报道把现实约束推到最前面。文章引用 Counterpoint 行业统计，上半年全球人形机器人出货超过 2.2 万台，同比增长接近 300%；但文娱表演、数据生产与科研占比超过六成，制造与仓储物流合计不足两成。固定场景接近成功，不等于换物体、环境或工厂后仍能泛化。

物理世界没有一个可以随意复制的动作互联网，最后几毫米的误差就可能让任务失败。这不意味着具身智能没有进展。最近早报里的结构化物流案例已经能在受控场景达到每小时 1816 件、准确率 98%。两类案例放在一起，说明部署速度由泛化程度、场景结构和失败成本共同决定，不能用统一时间表概括整个产业。

美团搜索 3.0 的三期实践把同样的逻辑放回数字世界。团队从 2025 年第四季度到 2026 年第二季度，把大模型语义表征从单点特征推进到 Query、POI、Deal 联合表征，再迁移到下挂精排。过程中更换训练目标，引入难负样本和多尺度表征，并修复覆盖率。

最终，Query 覆盖率从 81.24% 提升到 98.92%，长尾 NDCG@5 提升 2.21 个百分点。这类工作没有一个通用 Agent 那么显眼，却说明领域工程为何不会自动消失。模型提供语义能力，生产系统仍要理解业务对象、构造训练数据、识别困难样本、修复长尾覆盖，并用线上指标验证收益。

工具熟练度会快速折旧，领域模型、用户理解、实验品味、现实反馈和长期动机会更持久。它们也不是 AI 永远无法触及的安全区。设计判断会被辅助，研究流程会被重写，机器人会逐步扩大场景。真正可迁移的能力，是靠近问题和证据，让自己的判断进入系统，再愿意接受现实检验。

本周关键词

任务重组：AI 优先接走可形式化劳动，岗位结果还取决于需求增长与组织怎样分配新增产能。

前置治理：权限、观测、独立验证、事故记忆和责任必须在 Agent 执行前进入系统，而不是留给上线后的人工补救。

组织知识：个人编码提速能否转化为交付提速，取决于业务规则、团队经验和协作状态能否被准确共享、持续更新。

独立验证：生成器不能只靠自己编写的测试证明正确，验收需要来自不同路径，并尽可能连接真实环境与业务结果。

现实反馈：用户、线上指标、事故和物理世界会揭示演示中看不见的边界，也是职业判断最难被快速商品化的来源。

对个人而言，可以从四件小事开始：记录 AI 真正节省与新增的时间；把反复解释的业务规则写成有来源、有版本的知识；为常见任务建立独立验收条件；主动靠近需求、用户、事故和线上结果。下周值得继续观察的是，企业会不会从统计 Agent 使用量，转向公开任务成功率、返工、事故和业务结果。

关于 BestBlogs

BestBlogs.dev 是 AI 驱动的私人阅读助手。它会从 RSS、Newsletter、Twitter、YouTube、Podcast 等来源中筛选高质量内容，结合你关注的源、兴趣标签和阅读行为，把「我的早报」整理成每天真正适合你的阅读流——不论你关注的是技术、AI、产品、商业、研究、设计、投资、文化还是个人成长。

完成新用户三步引导即送 7 天 Pro 试用；现有 Pro 用户每邀请 1 位朋友双方各得 7 天 Pro，单人上限 28 天。

发现真正适合你的高质量内容——欢迎来体验，也欢迎推荐给身边认真阅读的朋友。

🏷️ 标签：#程序员职业未来 #AICoding #AIAgent #AI原生组织 #工程治理 #独立验证 #领域工程

BestBlogs.dev · 发现真正适合你的高质量内容 · https://bestblogs.dev
