2026.6 期
2026.6 期
6.30
给野马套上缰绳:Agent Harness 工程实践 ——从范式理论到钉钉AI招聘的真实落地:涅羽(阿里云开发者)——把 Harness Engineering 落到 Agent = Model + Harness 的工程框架,提炼上下文精简、专才 Agent、Workspace 状态、Linter 约束四条铁律,并用钉钉「悟空」AI 招聘从全能 Agent 改为 2 Agent + N Skill 的案例说明可控 Agent 系统如何设计。
万字长文推演Claude的代码统治力从何而来:叶强盛(腾讯云开发者)——从 Anthropic 公开研究推演 Claude 代码能力的来源,主线是 Constitutional AI 约束下的可验证奖励 RL、代码场景的高密度自动反馈与产品端用户数据飞轮共同形成自我强化。
6.29
MySQL binlog缓存一致性的Loop Engineering实践:写代码的SharkChili——以 MySQL binlog 缓存一致性为实践案例,先讲清 row / statement / mixed、刷盘和 redo log 差异,再用 Loop Engineering 把缓存回写、位点推进、goal 编码和 loop 巡检组织成可验证闭环。
最新!万字综述 Prompt 到 Loop 进化:邱汉宸(Datawhale)——沿 Prompt → Context → Harness → Loop 四阶段梳理 AI 开发范式迁移,核心是把人从单轮提示和信息搬运中抽出来,转向设计可装配上下文、可约束环境和可自我迭代的循环系统。
开启Harness Engineering探索之旅:fanniemeng(腾讯技术工程)——把 Harness Engineering 定义为模型外的工程环境设计,并用腾讯电竞团队的 P1-P6 研发交付、运营告警和长期记忆轨道,拆解协议、管线、评分卡、测试自愈与知识治理如何让 AI 在真实业务里稳定运行。
6.28
聊一聊我是怎么审查 Claude Code 写的代码:记一次复刻 Redis Set 审查随笔:写代码的SharkChili——从「AI 代码默认都要过人眼」出发,把审查拆成工程影响面和学习收益两条判断线,再以 Claude Code 复刻 Redis Set 为例,按正确性与边界、数据结构选型、代码整洁度、测试 / 压测验证来防「看起来对、实则幻觉」的代码。
AI时代Java开发者的流式编程入门课:写代码的SharkChili——用菜肴筛选例子对比传统
for/Comparator和 Java 8 Stream,讲清filter、sorted、map、collect如何组成流水线,并解释惰性求值、中间 / 终止操作、流只能消费一次与parallelStream线程池等入门追问。
6.25
刚刚,全网爆火的Loop Engineering,保姆教程来了!:Datawhale——用三个文件和一个模型配置搭建 Loop Engineering:拆出 builder / checker 两个 Agent,用
/loop编排器循环调度,把 checker 的完整失败报告反馈给 builder,并通过停止规则与 step-3.7-flash 配置把 AI Coding 做成自动检查到全绿的闭环。让 Agent 直接操控电脑的神器,开源了!:GitHubDaily——介绍开源 Cua 如何把 Sandbox、Driver、Cua-Bench 和 Lume 组合成一套 Agent 操作系统,让 Agent 在隔离虚拟桌面里通过 VNC / MCP 操作系统、保留快照,并支撑 Computer Use Agent 训练评测与桌面自动化。
6.24
- 精华:去哪儿网AI Coding研发平台实践,值得读三遍的样本:把 AI Coding 从“个人玩具”升级为“组织能力”的完整样本:先用 Quantity × Maturity、L0-L5 自动驾驶分级和 T/M/C 指标定义度量,再用 Harness、QDO、Qsuperpowers 与 Skills 把需求拆解、编码、部署、测试串成可观测、可调度的研发闭环。
6.23
AI Evals的一些实践:如何从 0 到 1 构建 agent 的评测系统?:把「AI 结果好不好」拆成可决策的六步评测流程:从业务目标定义维度,再设计评分器、沉淀黄金集与 bad case、做校准和持续自进化,让 agent 迭代从凭感觉改 prompt 变成基于证据的产品工程。
从源码到生产-Java线程池原理与AI代码审查:从
ThreadPoolExecutor的核心参数、任务流转、状态机与拒绝策略一路讲到生产调参,顺带提醒不是所有并发场景都该养常驻线程池,配置应按峰值形态、资源成本和误用风险来定。重磅!Loop Engineering 实操手册公开:先用四个前置问题判断值不值得上 Loop,再把自动检查、外部状态、断点恢复、权限边界、Worktree、Connectors 和 Sub-agents 等积木拼成 14 步最小闭环,让重复且可机器验收的任务稳定自动跑起来。
一文搞懂!Loop Engineering的进化史和本质:把 AI 协作范式串成 Prompt → Context → Harness → Loop 的演进链,说明 Loop 的本质不是「更会写提示词」,而是把提示、验证和下一步决策外置成可持续运行的系统,并强调在任务重复、可校验、可回滚之前别急着上。
6.22
Loop Engineering 实践指南:在 Code Buddy 中构建自主循环系统:腾讯技术工程——把 Loop Engineering 定位为 ReAct(Inner Loop)之上的编排层(Outer Loop),用 Discover→Plan→Execute→Verify→Iterate 五阶段闭环与状态外置、对抗验证、断点续跑、多 Agent 并行等六要素,在 CodeBuddy 中以 /goal 条件驱动让 AI 跨多轮自治推进到可验证条件满足。
一文吃透 Java 并发基础:从三类问题到线程状态机:写代码的 SharkChili——从「为什么需要多线程」出发梳理 Java 并发三类核心问题(安全性、活跃性、性能),辨析并发与并行、同步与异步,并解释程序计数器 / 虚拟机栈 / 本地方法栈为何线程私有。
6.21
Progressive Disclosure: Claude-Mem's Context Priming Philosophy:Claude-Mem 官方文档——先给「有什么 + 取用成本」的轻量索引、由 agent 自行决定取什么的三层渐进式披露(索引→按需详情→源文件),替代传统 RAG 一次性塞满上下文的 context pollution,把有限注意力预算只花在高价值信息上。
Context Engineering for AI Agents:Claude-Mem 官方文档(提炼自 Anthropic《Effective context engineering for AI agents》)——上下文工程的核心是「找到能最大化目标达成概率的最小高信号 token 集」,针对 context rot 用 Just-In-Time 检索、Compaction、结构化笔记、Sub-Agent 等手段在多轮迭代中维护 token 的信噪比。
6.18
- Loop Engineering 概念解析、思考与实践:阿里技术——区分底层 Agent Loop 与面向需求验收的 Loop Engineering,提出用 Automations、Worktrees、Skills、Connectors / Plugins、Sub Agents 与 State 组织自动化闭环,把原本依赖人反复提示、测试和纠偏的协同过程升级为可定时、可隔离、可验证、可沉淀的自运行系统,同时提醒需求和验证标准不清时应保留 Human-in-the-Loop。
6.17
更可靠的主播助理:淘宝主播Agent的Harness工程实战:阿里云开发者——以淘宝主播 Agent 为高压生产场景,拆解 Harness 如何通过上下文工程、Tool Registry、Lifecycle Hooks、Checkpoint、安全防护、评测体系与三层记忆,把即时直播操作做成可控、可恢复、可追踪的工程系统。
一文搞懂Token经济学:同样额度多干3倍活,只需理解消耗机制:腾讯云开发者——从一次 AI Coding API 调用的上下文组成讲清 Token 消耗机制,结合 KV/Prompt Cache、Rules/Memory/Skills/MCP 分层成本与 Sub-Agent 冷启动代价,给出精简系统税、保护缓存和按需加载的降本路径。
面向Skills编程-淘宝企业购端对端研发提效实践:大淘宝技术——提出「面向 Skills 编程」范式,把领域知识、工作流和约束规则封装成可版本化 Skill,让 LLM 在确定性框架内生成代码;以企业购客户对接为例,沿 Vibe Coding、Prompt 模板、SDD、Skill、云端平台演进,将商品域端到端交付周期从 23.5 人日缩短到 8 人日。
拆解大模型几项核心操作背后的数学与 Infra 优化逻辑:腾讯技术工程——从 RMSNorm、Softmax、Causal Mask、Sampling 拆解大模型核心算子的数学等价变换与 Infra 优化逻辑,解释数值稳定、访存瓶颈、SFU、FlashAttention 等如何通过精度取舍和硬件利用率换取推理吞吐。
6.16
AI 不缺智商缺纪律:我的 Harness 工程化实践:阿里云开发者——把 AI Coding 稳定性的关键从模型能力转向流程工程,用分层上下文、角色 Agent、状态外置、G1-G8 门禁与 hook 拦截,把 prompt 约束升级为可执行、可评测、可续跑的 Harness。
AI Agent & Skill 测评方案及落地实践:腾讯技术工程——面向 Agent 从 Demo 到生产可靠的测评体系,拆解确定性评分器、Rubric 评分器、人工评分器三类组合,覆盖功能正确性、过程质量、效率成本、鲁棒安全和体验对齐,并用 TPerf 智能分析 Agent 给出落地流程。
AI 时代,如何超过大多数人?:拓跋阿秀——反驳把 AI 当搜索、模板和外包的低效用法,强调靠近源头、定义好问题、提供高质量上下文、坚持验证、沉淀工作流和建立判断标准,才能用 AI 放大思考而不是外包思考。
6.15
别再问我什么是 Loop Engineering(橙皮书):花叔——提出 loop engineering(循环工程):在 harness 之上再搭一层「自动外循环」,按 prompt → context → harness → loop 四层栈组织,靠定时触发、自孵化 sub-agent、外部独立验证(AI 不能给自己打分)、记忆与下一步决策自动驱动 agent 干活;核心是把人从「逐条指挥 agent」升级为「设计指挥系统的工程师」,并警示验证债、理解腐烂、token 失控、认知投降四笔代价。
一篇搞懂 AI Coding Agent 的 Token 成本控制:腾讯技术工程——Token 账单大头是系统反复搬运的上下文(固定前缀 + 会话历史 + 工具往返 + 重试)而非用户提问本身;以 Prompt Cache 稳定前缀为基础,沿「使用习惯 → 模型路由 → 上下文压缩(RTK/Caveman/headroom/context-mode)→ 代码图谱(Graphify/CodeGraph)→ Orchestrator-Worker 多 Agent 分工」五层路径,让便宜模型干标准活、贵模型只做高价值推理来系统性压成本。
后端架构 AI Friendly 的标准与路径:面向无人值守开发时代的系统重构:阿里技术——后端「AI Friendly」的本质是把藏在人脑、群聊、事故里的系统知识显式化、可检索、可验证:用 Architecture Map + Service Card + 显式领域模型与不变量 + SKILL + 受控 Harness + Test-Gated 开发 + 结构化可观测 + L0-L5 分级权限 + Architecture as Code,把系统从「可维护」升级为「可被 Agent 维护」,沿 Copilot → Coworker → Operator 三阶段扩大 AI 可信半径,核心准则是「先可验证、再无人化」。
6.12
如何构建一个更“好”的知识库?:大淘宝技术——系统讲解 RAG 知识库全链路优化,涵盖 RAGAS 评估框架、文档切分策略(Late Chunking)、混合检索(RRF 融合)、查询增强(HyDE/Multi-Query/EAR)、Cross-Encoder 重排序、AutoRAG 自动化优化、QuIM-RAG 问题倒排索引及 OpenViking 文件系统范式。
面向 Agent Skill 的 CLI/SSO 鉴权体系:安全、无感、可追溯:货拉拉技术——为 Agent Skill 调用企业内部系统设计的 SSO 鉴权方案,通过 keychain 主密钥 + 密文文件 + 飞书 Hook 登录 + Agent 轮询授权,实现 token 不落盘、多用户隔离、登录过程无感。
让 Claude Code 拥有自我进化和记忆系统|得物技术:得物技术——为 Claude Code 构建 Hook 机制驱动的自我学习系统:行为观测层(100% 捕获工具调用)→ 模式提炼层(统计+AI 语义双路径提炼 Instinct 规则)→ 记忆注入层(向量检索+上下文注入),Token 消耗降低 78%,错误重复率下降 80%。
AI 不缺智商缺纪律:一场 Harness 工程化实践:阿里技术——两个月 Harness 工程化复盘,五层 harness 分层结构(常驻入口→触发规则→状态外置→调度→执行支撑)、多 Agent 职责隔离、评测驱动迭代、4 条踩坑教训(prompt 是负债不是资产、过度拆分 Agent 代价大等)。
Harness Engineering落地前,先想清楚这几个问题:腾讯云开发者——从数据中台 AI 助手 Dola 出发,讨论两个问题:流式渲染架构改造(代码高亮库 DOM 模型与 AI 流式输出错配)和存量项目如何用 Harness Engineering 思路适配 AI Coding(规则机器可读、入口收敛、决策显式)。
Agent skill 迭代式编写实战:大淘宝技术——Agent Skill 编写经验,定义为模块化领域知识资产,核心设计遵循三层渐进式披露架构(主文件→补充文档→完整资源),用决策树替代模糊判断、确定性操作脚本化,建立内部自查与外部评估双重验证机制。
6.10
- 4000行代码撑起一个Agent框架?nanobot架构深度解析:俞孟凡(腾讯云开发者)——拆解港大 nanobot(3,935 行)的架构:ReAct 循环 + Markdown Skill 懒加载 + grep 记忆 + 消息总线重注入。
- Harness Engineering:长程自动化 AI Coding / Skills 开发实践:胡韶山(阿里技术)——Prompt→Context→Harness 三阶段演进,四个案例论证 Harness 是 Agent 时代的护城河。
6.8
- 横向拆解六大Agent上下文压缩策略后,我们做了第 7 个:腾讯技术工程——拆解 Claude Code、Codex、OpenCode 等七种 Agent 上下文压缩方案,提炼六条共识,落地四级水位线方案(Snip → Prune → Summarize)。
6.7
- 重新思考研发基础设施:当 Agent 成为第一公民:许晓斌(阿里技术)——提出「意图驱动 + 代码沉淀」框架,Agent 把循环速度从月级压缩到分钟级,传统 Git/CI/CR 假设系统性失效,代码分化为「瞬态代码」与「沉淀代码」两种形态。
- Agent-Memory 评测全景:基准、评估与记忆系统(理论篇):大淘宝技术——从基准数据集、评估框架、记忆系统三条主线梳理 Agent 长期记忆评测,核心发现:冲突解决能力(多跳场景准确率仅 6%)是所有方案的最大短板。
6.2
- AI软件工程范式革命的思考:从工程史视角推演——大模型实现「能源→高阶智能」,是与蒸汽机平行的事件;人的角色从「亲手消除偏差」退守到「设计自我纠偏系统」,落地路径分辅助→自主→自治三阶段。
6.1
- 面向 LLM 的架构设计:什么是真正的 AI Friendly 架构?:大淘宝技术——传统架构与 AI 不确定性冲突,提出 AI Friendly 三范式:确定性→概率性、结构化→语义化、静态→动态,AI 审核准确率达 95.7%。
- 深入解析Chromium的 AI Coding 开发体系:以 Chromium(3500 万行 C++)为例,拆解
agents/目录下的完整 AI 基建:四层 Prompt 体系 + 18+ Skills + RAG 知识库 + Eval 框架,核心原则是人类对每行代码负全责。 - Agent核心技术概念与范式发生了哪些演变以及背后的思考:梳理 2023-2026 Agent 四阶段演进(被动 ReAct → 工具增强 → Skill 封装 → 自进化),核心论点:旧范式并非淘汰而是可结合使用,搞不清演化逻辑容易陷入「为升级而升级」。
