架构01
给 Agent 出一张考卷:评测驱动开发实录,从 12 分到满分
我给博客 AI 助手建了一套 20 题金标准评测集。第一次跑分 12/20——每一个丢分的题目背后,都藏着一个真实缺陷:知识盲区、未查先拒、门控误伤、中文匹配漏配。这是一份带完整解题过程的错题本。
2026-08-26 11:02:0418 阅读
共 3 篇文章
我给博客 AI 助手建了一套 20 题金标准评测集。第一次跑分 12/20——每一个丢分的题目背后,都藏着一个真实缺陷:知识盲区、未查先拒、门控误伤、中文匹配漏配。这是一份带完整解题过程的错题本。
AI 助手能答对文章里的技术题,却不认识博主自己的象棋项目。从这次失败出发,补齐多轮记忆、反馈闭环、失败可恢复与可见化交互——记录一个 RAG Demo 跨过"最后一公里"的四段工程。
博客 AI 助手的第二次进化:把固定检索流水线升级为 ReAct 工具编排循环。五个只读工具的提示词工程、伪流式与 tool_calls 的工程取舍、防死循环保险丝,以及为什么用 200 行 Go 手写而不上 LangChain。