2026.7 期
2026.7 期
7.31
- 从 Spec 驱动转向环境与验证驱动——我对 AI Coding 的一点思考:吴佐衍(阿里技术)——认为 Coding 能力接近被解决后,研发提效的主战场应从 Spec、Prompt 和固定 Workflow 转向环境与验证,把构建、部署、测试、数据、日志、监控和发布链路改造成 Agent 可调用、可反馈的基础设施。
7.30
对Loop Engineering的思考:吕昊俣(腾讯云开发者)——从 Prompt、Context、Harness、Loop 到 Graph Engineering 梳理 AI 工程范式演进,结合控制论、TDD、证据链和预算机制说明如何从最小可收敛闭环逐步扩展无人值守能力。
AI Coding的下一站,不是更会写代码,而是更懂团队:linjangyang、lypeerluo、kehawang、yansycao(腾讯技术工程)——以 QQ 浏览器团队为例,围绕“对话上报—主题分组—经验抽取—Review—Dedup—Merge—召回”搭建团队经验系统,用三层治理把候选经验从高噪声沉淀为可复用资产。
高德AI Native数据Agent工程实践:信息业务中心(高德技术)——以知识库、LLM、工具执行和规约约束构建查数、归因、找资产三类 Agent,通过四步漏斗选表和分钟级盲测将查数准确率从 40% 提升至 95%,线上灰度准确率达到 90%。
7.29
- 当所有人都在给AI造缰绳,马厩正在消失:周依涛(腾讯云开发者)——借“约束消失”解释 AI 的降维冲击:执行型白领工作与当前 Harness 工程都可能被标准化吞没,长期稀缺性将转向定义目标、判断价值与为结果承担责任。
7.28
Agent开始“自我进化”:会出题、会反思,还会自己长出新技能:horacebao、ashexie(腾讯技术工程)——对比自进化 Agent 的经验 / Skill 外置、RL 写入权重与零数据自训三条路线,重点分析失败反思、验证器和跨轨迹融合如何把交互经验变成可复用能力。
百亿补贴 C 端 AI Coding 实战:基于 SDD 的服务端 AI Coding 实践:天猫技术(大淘宝技术)——将 Spec 作为唯一真相源,以 Specify → Plan → Implement → Validate 约束 AI Coding,并在关键 Spec、架构和质量关口保留开发者审核,避免端到端自动化的误差累积。
Loop Engineering 已死? 一文带你了解Graph Engineering:lukiexing(腾讯技术工程)——把 Graph 定义为节点、边、状态和策略构成的可执行编排层,用并行、路由、主管—工人和独立 Verifier 将单 Agent Loop 扩展为可恢复、可观测的多角色系统。
22580: From GPT2 to Kimi3, Explained:ali(@waterloo_intern)——沿 GPT-2、Linear Attention、DeltaNet、Kimi Linear 到 KimiK3 的路径,解释模型架构演进的主线是如何更高效地存储、更新和检索内部记忆,而非单纯扩大参数规模。
高德广告工程的AI Native知识库体系:信息业务中心(高德技术)——以六类知识域、跨层映射和模板契约组织研发知识,再用意图识别、高置信索引直达、结构化与向量并发召回及反馈保鲜,支撑 Agent 全流程获取权威上下文。
7.25
一文读懂怎么让 Agent 理解业务,别一上手就写 Prompt!:陈思州(Datawhale)——梳理意图识别从规则、分类器、Embedding、LLM 到意图 RAG 的演进,并以多轮状态、任务规划和权限确认构成按复杂度分流的生产级 Agent 架构。
The new rules of context engineering for Claude 5 generation models:Anthropic——总结 Claude 新一代模型的上下文工程转向:删去过度约束与重复示例,改用可表达的工具接口、渐进式披露、轻量 CLAUDE.md 与自动记忆。
7.24
Token降本50%:Harness工作流的成本优化实践:叶珊珊(腾讯云开发者)——先按 Wave 度量系统提示词、工具返回和历史消息等成本,再以按需加载、脚本替代 MCP、子 Agent 摘要与记忆索引等十项改造,将全流程 Token 预估降低 50%–65%。
Loop Engineering 已死,Graph Engineering 永生:小林coding——区分单 Agent 内部的 Loop 与多执行单元的 Graph:以节点、边和持久化状态编排并行、汇合、返工与人工审批,解决长流程的调度、恢复和可观测性问题。
分解一座冰山:后端系统「AI 知识库体系」建设实践(长文干货):刘瑞洲(阿里技术)——将 AI Coding 知识库拆为业务映射、架构依赖、代码约束与验证规则等形态,贯穿需求到交付闭环,为技术方案提供完整、准确且按需加载的系统上下文。
7.23
- Agent 工程思考:从 ReAct 到 Agent Harness:Ding Junjie(vivo互联网技术)——说明 ReAct 只描述模型的思考循环,产品级 Harness 则以 runtime 事件、State Schema、checkpoint 与 control 将审批、产物和子 Agent 变成可恢复、可控制、可审计的系统事实。
7.22
让 Agent 越用越准、成本越来越低:AgentLoop 的 Agent 经验自进化闭环:马云雷(千问AI平台)——把真实 Trace 清洗为可挖掘的 Trajectory,提炼成功路径、失败模式与恢复策略并在运行时召回,形成以成功率、稳定性和单位成功成本共同衡量的经验飞轮。
RAG 核心概念与原理:Chunking、Embedding、相似度、HNSW 与多路召回|得物技术:羊羽(得物技术)——从离线切块、Embedding 与 HNSW 索引到在线 Query Rewrite、元数据过滤、ANN + BM25、RRF 融合和 Rerank,串起决定 RAG 准确性的完整检索链路。
7.21
删掉80%的Skill,Agent反而更听话了:郑姝雅(腾讯云开发者)——从长 Skill 的注意力稀释、隐性冲突和自动追加膨胀出发,用规则分层、正向指令、外置参考与定期压缩,把 1,500 行指令精简为更易遵循的 300 行。
从 Vibe Coding 到 AI 原生研发团队:一套能落地的工程实践:masoncai(腾讯技术工程)——以统一 SDK、权限审计、API、MCP、任务调度和 Durable Workflow 打好企业底座,再用 monorepo、Rules 与 Skills 让非研发角色也能在可控质量下参与 AI 原生交付。
NL2SQL 在超大规模数仓场景的架构突破与工程实践:薛飞跃(阿里技术)——将多领域 Skill 收敛为统一入口,通过可解释的两级确定性路由、渐进式知识加载、统一 SQL 自检和标准化表知识卡片,在 352 张表规模下控制口径与选表质量。
7.20
最新!万字综述 AI Agent 从记忆到自我进化!:管秉涛(Datawhale)——围绕记忆、推理和递归自我改进的三重悖论,说明记忆需动态控制、Harness 会引入新的故障面,而可持续进化的关键在于独立且不易被“游戏化”的外部验证器。
从 Prompt 到 Harness:企业级 Agent 工程的完整演进之路:阿里云开发者——从上下文窗口、注意力稀释、数据搬运和无状态四个约束出发,复盘企业 Agent 如何经由 Prompt、Context、Harness 工程演进为具备分层上下文管理、可恢复执行、知识治理与人机协同的 Agent OS。
7.17
一文讲透Skill:腾讯云开发者——从 Agent 的感知—思考—行动闭环解释 Skill 的角色,并以 API + OpenAPI 描述、按需发现(FindSkill)和精确 description 说明如何让模型安全、准确地调用外部能力。
驾驭AI Coding:一份面向团队的Harness Engineering落地规范:腾讯技术工程——以上下文、工具、编排、记忆、评估、约束六大支柱构建团队 Harness:将 Spec、Rules、Skills、MCP、分阶段 Agent 和测试 / 人工审查串成从计划到归档的可追溯交付闭环。
7.16
- Agent 治理:用 Hook 堵住 LLM 的偷懒、越权与失忆:xiangnzhang(腾讯技术工程)——以 DECO 数仓 Agent 为例,将 Hook 切面用于读写两侧长文本 offload、危险工具 HITL 门禁和 Hook → state → Attachment 上下文注入,把 prompt 无法可靠约束的截断、越权与遗漏改为框架层的确定性治理。
7.15
Prompting guidance for GPT-5.6 Sol:OpenAI——为 GPT-5.6 设计 prompt 时先删减重复指令、冗余示例与无关工具描述,保留结果、约束、证据和完成标准,再用代表性 eval 验证精简是否兼顾效果与 Token 成本。
阿里荣膺 ACL 2026 最佳资源论文 | HSCodeComp 揭开智能体「分层规则应用」的能力鸿沟:兰天(阿里技术)——HSCodeComp 用 632 个真实商品、26 位关务专家的六步标注流程评测 Agent 逐层应用 HS Code 规则的能力:最强系统 10 位编码准确率仅 49.4%,远低于专家的 95%,关键在于检索历史裁定与专家规则、按优先级逐层应用并可靠回溯,而非单纯增加推理或投票次数。
7.14
- 从 Coder 到 Designer :电商团队数据研发的 Harness Engineering 实践:白林林(阿里技术)——以语义层、Spec / Plan / Task 和经验沉淀构成知识工程,再用带人工 Gate 的 7 Agent 工作流、可验证产物校验、空间隔离与配置治理,把 NL2SQL 数据研发从单点提效变为可控的工程闭环。
7.13
精华:AI Coding 时代,把最好的工程师从「写功能」挪到「搭流水线」:无处不在的技术——复盘徐文浩在 Agentic AICon 的分享:AI Coding 的个体产出不等于组织提效,需用 AI Native 组织设计、Harness 与可见产物重构信息流和质量门禁。
浅谈AI时代的工程记忆结构:写代码的SharkChili——以 Claude Code 为例梳理企业、用户、项目、本地四层记忆与 rules:把技术栈、架构约束和团队规范显式化、按作用域加载,减少 Agent 的检索试错与上下文消耗。
7.10
- 一文读懂Harness Engineering!:Yousa 博阳(腾讯云开发者)——沿 LangChain 与 Anthropic 的 Harness 工程演进,区分 Harness 和 CLI / Skill / MCP 等 Agent Infra:核心是用外部记忆、控制流、验证器与沙盒隔离补偿模型短板,并指出强模型迭代后部分复杂控制会被反向拆除。
7.8
Harness 工程实践:如何让 Agent 完成自主迭代:肖汉松(阿里技术)——复盘线上业务 Agent 的 Harness 自主优化闭环:把部署、评测、结果分析和 prompt 改写工具化,用父子 Agent、训练 / 验证集隔离与 champion-challenger 机制跑出 17 小时、16 轮迭代,防止早停、上下文爆炸和 reward hacking。
精打细算虾养成指南: 省 Token 和把 AI 用好,从来就是一件事:Kario Chen(腾讯技术工程)——把省 Token 归结为上下文工程:用 JIT 检索、上下文分层卸载、Prompt Caching、代表性示例和主 Agent + 子 Agent 架构,在更少上下文里给模型更强信号。
AI 自我改进的关键,从模型转向 Harness了!:翁荔(Datawhale)——围绕《Harness Engineering for Self-Improvement》梳理 RSI 的近期路径:模型外的 Harness 通过工具、文件记忆、子 Agent、评估器和自我优化循环,成为 AI 自我改进的关键控制层。
7.7
美团二面:Agent、Tools、Workflow 这三个的概念和区别介绍一下?:犬小哈(小哈学Java)——用 Anthropic 定义和 Spring AI 示例区分 Tools、Workflow、Agent:Tool 是被动能力单元,Workflow 是固定路径编排,Agent 是带 ReAct 循环的自主决策系统,并强调能用 Workflow 就别上 Agent。
从Vibe Coding到Harness—— 一套大仓AI工程化实战:fitchzheng、leoshli(腾讯技术工程)——以 TAB 大仓为样本复盘 Harness 落地:SPEC 先行,Rule 下沉为 Skill / 脚本,4 个 Sub Agent、13 阶段 Workflow、7 道门禁脚本和 MCP 接口共同把跨仓需求做成可审计交付链路。
从分布式架构到AI架构面试题:码农SharkChili(写代码的SharkChili)——把后端架构面试题从单体、读写分离、分布式与容量估算,延伸到 Claude Code / Harness:用记忆层、扩展层、集成层、编程层解释 AI 时代的架构推导能力。
Claude Code Skills 的技术实现和运行方式:小G(JavaGuide)——从 CLAUDE.md 与 Skill 的分工讲到 Claude Code 的 Skill 加载机制:用 description 触发、frontmatter / allowed-tools 约束、supporting files 渐进披露,把长流程从常驻上下文拆成按需操作手册。
Loop Engineering 实战:实现从日志扫描到预发部署的全自主闭环:也达(阿里云开发者)——把 Loop Engineering 定义为 Harness 之上的持续维护闭环:用 Connectors、Automations、Skills、Worktrees、Sub Agents、State 串起日志发现、补丁生成、334 条测试、预发验证和经验沉淀。
7.6
为什么大模型的缓存命中率能到 90%?:陈威特(阿里技术)——从 KV Cache、Prefix Caching、PagedAttention、RadixAttention 到商用模型缓存策略,解释 Agent 会话“只追加”的调用形态为什么天然把缓存命中率推到 90% 左右,并提醒高命中率不等于绝对低成本。
Agent 评测:方法论与体系设计:孙敦灿(阿里技术)——把 Agent 评测从上线前抽查升级为研发流程门禁,围绕 Agent 类型、对话 Session / Trace / Outcome、Golden Set、Scorer、Badcase RCA 和持续回归设计可发布质量体系。
7.3
- 从AI Coding到Harness Engineering的端到端工程开发实践:zimingxing、kinglongli、yifhao(腾讯技术工程)——以应用宝活动平台重构为样本,把 Harness 落成“知识库工程 + 端到端开发工程”:800+ 结构化文档、12 个专家 Agent、状态文件驱动、DAG 并行、脚本化执行和 DevOps 集成共同串起需求到提交的闭环。
7.2
Loop Engineering又是啥?一文讲清企业Agent落地的四层工程进化论:李伟山(腾讯云开发者)——把 Prompt、Context、Harness、Loop 四层定义为嵌套演进关系,说明企业 Agent 从“说清任务”到“提供背景”、再到“外部验证”和“自循环调度”的落地边界与采纳路径。
相比层出不穷的 Agent 框架,不变的 Agent Protocol 是什么:晓灰(阿里云开发者)——不追逐单个 Agent 框架 API,而是抽象生产级 Agent Protocol 的稳定对象:Thread、Run、Step、Event、Artifact、Checkpoint 及 stream / interrupt / resume 等生命周期操作,用协议边界判断 Runtime 是否真正可生产化。
7.1
AI Agent 的 Skill 系统设计:会员技术(大淘宝技术)——把 Skill 定义为让 Agent 稳定执行特定任务的能力包,围绕 description 触发、渐进披露、scripts / references / assets 分层、门控与前向测试,给出从提示词模板走向可维护行为系统的设计方法。
Harness 工程之道:Skill 原理与最佳实践:张梦杰(阿里云开发者)——结合 trade-ab-skill 讲解 Agent Skill 的开放规范与工程落地:用 Progressive Disclosure 管住上下文,用 SKILL.md frontmatter 负责发现与触发,再通过权限隔离、脚本增强、快照传参和触发 / 功能 / 性能测试把 Skill 做成可复用能力。
