你好,我是许昆瑜。

AI Engineering · Agent Systems · Developer Tools成都 · 远程办公

构建团队能审查、衡量与交付的 AI 系统

一点关于我

我搭建能让人用起来的想法。

Thoughtworks 软件开发工程师,工作覆盖 TypeScript、React、Node.js、Python 与 Java / Spring Boot。我构建 Agent、评估工具和生产工作流,用清晰证据支持交付判断。

关于

系统、证据与交付

当前方向

在 Thoughtworks 构建电商 SaaS,同时推进 Agent 评估、AI Code Review 与跨团队可复用的 AI 交付实践。

技术栈

  • TypeScript
  • React
  • Next.js
  • Node.js
  • Python
  • Java
  • Spring Boot
  • PostgreSQL
  • GCP
  • Docker
  • GitHub Actions
  • MCP

我从建筑与 UX 转入软件工程。这段背景让我习惯把产品看成一条动线:人在哪里犹豫,状态在哪里丢失,系统又是从哪里开始失去帮助。

现在的工作横跨前端、BFF 和后端服务。我把 Agent 当成交付系统的一部分,为它设计界面、API、数据契约、可观测性与明确的失败路径。

我的项目会用固定测试集、安全闸、人工复核和成本实测,让模型行为可以被检查。

我关心什么有效、什么会失败,以及现有证据是否足以支持下一次交付判断。

探索方向

  • Agent 评估固定测试集、安全闸、人工复核与可衡量的上线判断
  • 有依据的生成RAG、受 Schema 约束的 UI 与带证据的回答
  • 开发者工具AI Code Review、MCP 工作流与可复用的交付自动化

经历

工作经历

ThoughtWorks

2022.12 – 至今

软件开发工程师

工作覆盖 React / TypeScript 购买流程、BFF、Java / Spring Boot 服务与 Kafka 事件链路,也以 feature owner 身份负责过从技术方案、埋点到生产部署的完整交付。

为多个 TypeScript 仓库搭建项目级 AI Code Review 平台,在每个 PR 上运行,并发现了 ESLint 和 AI 生成测试都漏掉的运行时崩溃。

构建 Agent 配置评估引擎与人工反馈改进循环,并在两个交付团队中试用。

把多市场 rollout 经验编码成可复用的 coding-agent 工作流,将配置时间从约一周缩短到半天。

成果

可量化的交付结果

多市场 rollout 配置
≈90% 时间缩短
评估 worker 体积
1,018 → 92 KB
集成覆盖
31 个 HTTP 测试
Thoughtworks AI/works 挑战赛
APAC Top 3

项目

精选 AI 系统与实验

◇ EXPERIMENT

AI COST · MEASUREMENT

Agent Cost Lab

一个专门测 Agent 真实账单的实验室。首轮实验发现,一次上下文压缩需要 18–19 轮才能回本,远慢于测量前预测的 2–4 轮;减少 token 并不自动等于降低成本。

查看仓库 →
Brooch Shop

● LIVE

AI AGENT · E-COMMERCE

Brooch Shop

筛选器解决不了的问题,Agent 从这里开始。用 Claude API + tool calling 构建的 AI 导购 agent,演示自然语言意图理解如何替代传统多级筛选。

查看 Demo →
Readable & Shareable

● LIVE

CLAUDE CODE · SKILL · VISUALIZATION

Readable & Shareable

你写了好文章,但大多数人不会点开链接。Claude Code `/viz` skill:自动识别文章结构,生成思维导图、交互 HTML、图片卡片等可分享产出,每种形式都链回原文,让不同受众找到自己的入口。

查看 Demo →

◇ EXPERIMENT

AI AGENT · EVALUATION · SAFETY

Pace Triage Agent

保险咨询分流与回复起草 Agent,配有固定 golden set、人工复核队列和 2×2 模型 / prompt 评估矩阵。所有受测配置都未达到安全门槛,因此结论不是上线,而是一份有证据的 no-ship 判断。

查看仓库 →

◇ EXPERIMENT

AI AGENT · COST & EVALUATION

RepoCoach

一个源码学习 Agent 的工程切片。通过 638 个测试与 22 个合并 PR,验证了 Agent 循环成本、双向安全闸与跨进程状态,并把实测结果整理成可复用的工程经验。

查看仓库 →

◇ EXPERIMENT

RAG · GENERATIVE UI · EVALUATION

RAG Generative UI Explorer

把有依据的检索结果转换成受 Schema 约束的交互式知识卡,而不是让模型生成任意 UI 代码。60 道评估题中,dense retrieval 的 Recall@10 达到 63.7%,高于 BM25 的 47.6%。

查看仓库 →

◇ EXPERIMENT

AI COST · MEASUREMENT

Agent Cost Lab

一个专门测 Agent 真实账单的实验室。首轮实验发现,一次上下文压缩需要 18–19 轮才能回本,远慢于测量前预测的 2–4 轮;减少 token 并不自动等于降低成本。

查看仓库 →
Brooch Shop

● LIVE

AI AGENT · E-COMMERCE

Brooch Shop

筛选器解决不了的问题,Agent 从这里开始。用 Claude API + tool calling 构建的 AI 导购 agent,演示自然语言意图理解如何替代传统多级筛选。

查看 Demo →
Readable & Shareable

● LIVE

CLAUDE CODE · SKILL · VISUALIZATION

Readable & Shareable

你写了好文章,但大多数人不会点开链接。Claude Code `/viz` skill:自动识别文章结构,生成思维导图、交互 HTML、图片卡片等可分享产出,每种形式都链回原文,让不同受众找到自己的入口。

查看 Demo →

◇ EXPERIMENT

AI AGENT · EVALUATION · SAFETY

Pace Triage Agent

保险咨询分流与回复起草 Agent,配有固定 golden set、人工复核队列和 2×2 模型 / prompt 评估矩阵。所有受测配置都未达到安全门槛,因此结论不是上线,而是一份有证据的 no-ship 判断。

查看仓库 →

◇ EXPERIMENT

AI AGENT · COST & EVALUATION

RepoCoach

一个源码学习 Agent 的工程切片。通过 638 个测试与 22 个合并 PR,验证了 Agent 循环成本、双向安全闸与跨进程状态,并把实测结果整理成可复用的工程经验。

查看仓库 →

◇ EXPERIMENT

RAG · GENERATIVE UI · EVALUATION

RAG Generative UI Explorer

把有依据的检索结果转换成受 Schema 约束的交互式知识卡,而不是让模型生成任意 UI 代码。60 道评估题中,dense retrieval 的 Recall@10 达到 63.7%,高于 BM25 的 47.6%。

查看仓库 →

文章

精选文章与笔记