◇ EXPERIMENT
AI COST · MEASUREMENT
Agent Cost Lab
一个专门测 Agent 真实账单的实验室。首轮实验发现,一次上下文压缩需要 18–19 轮才能回本,远慢于测量前预测的 2–4 轮;减少 token 并不自动等于降低成本。
你好,我是许昆瑜。
AI Engineering · Agent Systems · Developer Tools成都 · 远程办公
我搭建能让人用起来的想法。
Thoughtworks 软件开发工程师,工作覆盖 TypeScript、React、Node.js、Python 与 Java / Spring Boot。我构建 Agent、评估工具和生产工作流,用清晰证据支持交付判断。
系统、证据与交付
在 Thoughtworks 构建电商 SaaS,同时推进 Agent 评估、AI Code Review 与跨团队可复用的 AI 交付实践。
技术栈
我从建筑与 UX 转入软件工程。这段背景让我习惯把产品看成一条动线:人在哪里犹豫,状态在哪里丢失,系统又是从哪里开始失去帮助。
现在的工作横跨前端、BFF 和后端服务。我把 Agent 当成交付系统的一部分,为它设计界面、API、数据契约、可观测性与明确的失败路径。
我的项目会用固定测试集、安全闸、人工复核和成本实测,让模型行为可以被检查。
我关心什么有效、什么会失败,以及现有证据是否足以支持下一次交付判断。
探索方向
工作经历
软件开发工程师
工作覆盖 React / TypeScript 购买流程、BFF、Java / Spring Boot 服务与 Kafka 事件链路,也以 feature owner 身份负责过从技术方案、埋点到生产部署的完整交付。
为多个 TypeScript 仓库搭建项目级 AI Code Review 平台,在每个 PR 上运行,并发现了 ESLint 和 AI 生成测试都漏掉的运行时崩溃。
构建 Agent 配置评估引擎与人工反馈改进循环,并在两个交付团队中试用。
把多市场 rollout 经验编码成可复用的 coding-agent 工作流,将配置时间从约一周缩短到半天。
可量化的交付结果
精选 AI 系统与实验
◇ EXPERIMENT
AI COST · MEASUREMENT
一个专门测 Agent 真实账单的实验室。首轮实验发现,一次上下文压缩需要 18–19 轮才能回本,远慢于测量前预测的 2–4 轮;减少 token 并不自动等于降低成本。

● LIVE
AI AGENT · E-COMMERCE
筛选器解决不了的问题,Agent 从这里开始。用 Claude API + tool calling 构建的 AI 导购 agent,演示自然语言意图理解如何替代传统多级筛选。

● LIVE
CLAUDE CODE · SKILL · VISUALIZATION
你写了好文章,但大多数人不会点开链接。Claude Code `/viz` skill:自动识别文章结构,生成思维导图、交互 HTML、图片卡片等可分享产出,每种形式都链回原文,让不同受众找到自己的入口。
◇ EXPERIMENT
AI AGENT · EVALUATION · SAFETY
保险咨询分流与回复起草 Agent,配有固定 golden set、人工复核队列和 2×2 模型 / prompt 评估矩阵。所有受测配置都未达到安全门槛,因此结论不是上线,而是一份有证据的 no-ship 判断。
◇ EXPERIMENT
AI AGENT · COST & EVALUATION
一个源码学习 Agent 的工程切片。通过 638 个测试与 22 个合并 PR,验证了 Agent 循环成本、双向安全闸与跨进程状态,并把实测结果整理成可复用的工程经验。
◇ EXPERIMENT
RAG · GENERATIVE UI · EVALUATION
把有依据的检索结果转换成受 Schema 约束的交互式知识卡,而不是让模型生成任意 UI 代码。60 道评估题中,dense retrieval 的 Recall@10 达到 63.7%,高于 BM25 的 47.6%。
◇ EXPERIMENT
AI COST · MEASUREMENT
一个专门测 Agent 真实账单的实验室。首轮实验发现,一次上下文压缩需要 18–19 轮才能回本,远慢于测量前预测的 2–4 轮;减少 token 并不自动等于降低成本。

● LIVE
AI AGENT · E-COMMERCE
筛选器解决不了的问题,Agent 从这里开始。用 Claude API + tool calling 构建的 AI 导购 agent,演示自然语言意图理解如何替代传统多级筛选。

● LIVE
CLAUDE CODE · SKILL · VISUALIZATION
你写了好文章,但大多数人不会点开链接。Claude Code `/viz` skill:自动识别文章结构,生成思维导图、交互 HTML、图片卡片等可分享产出,每种形式都链回原文,让不同受众找到自己的入口。
◇ EXPERIMENT
AI AGENT · EVALUATION · SAFETY
保险咨询分流与回复起草 Agent,配有固定 golden set、人工复核队列和 2×2 模型 / prompt 评估矩阵。所有受测配置都未达到安全门槛,因此结论不是上线,而是一份有证据的 no-ship 判断。
◇ EXPERIMENT
AI AGENT · COST & EVALUATION
一个源码学习 Agent 的工程切片。通过 638 个测试与 22 个合并 PR,验证了 Agent 循环成本、双向安全闸与跨进程状态,并把实测结果整理成可复用的工程经验。
◇ EXPERIMENT
RAG · GENERATIVE UI · EVALUATION
把有依据的检索结果转换成受 Schema 约束的交互式知识卡,而不是让模型生成任意 UI 代码。60 道评估题中,dense retrieval 的 Recall@10 达到 63.7%,高于 BM25 的 47.6%。
精选文章与笔记

所有人都说搭一个 agent 太快了,也都说 agent 上线怎么这么难——两句都对,说的不是同一件事。这篇拆开从 demo 到交付的那几周:先是发现它会怎么坏,再是定出什么叫「做对了」,最后是每改一次都得重新验一次。成本没有降下来,只是从「写」挪到了「验」,挪过去之后还更贵。

做了一个 demo:同一套 HTML,9 种不同的 design token,每种呈现出完全不同的产品人格。看起来每套都能用——直到我追了一个问题:换一个 IA 还成立吗?把 Playful 放进数据 dashboard,把 AI Gradient 放进支付流程——感觉立刻不对了。

功能跑通了,界面差点意思,让 AI 优化,改了十几轮越来越乱——很多人都经历过这个过程。这篇文章记录了我从「prompt 写得不够好」到「原来根本没有设计系统」的认知转变,以及 design token 是怎么把这件事从玄学变成可以被执行的定义。

微前端跳转后滚动复原,不是一个 scrollTo 能解决的。状态要活过跳转、元素要出现在 DOM、还要等渲染真正完成——三件事都得在浏览器渲染管线的正确时机触发。「元素在 DOM 里」和「元素画好了」是两个不同的问题,用错 API 就会踩坑。

不是排名低,是页面对 Google 完全不存在。这篇记录了一次微前端项目的完整 SEO 排查过程,以及从中整理出的四层诊断框架:链接发现、可访问性、内容渲染、语义理解。断点找错了层,改再多也没用。