架构01
给 Agent 出一张考卷:评测驱动开发实录,从 12 分到满分
我给博客 AI 助手建了一套 20 题金标准评测集。第一次跑分 12/20——每一个丢分的题目背后,都藏着一个真实缺陷:知识盲区、未查先拒、门控误伤、中文匹配漏配。这是一份带完整解题过程的错题本。
2026-08-26 11:02:0418 阅读
共 3 篇文章
我给博客 AI 助手建了一套 20 题金标准评测集。第一次跑分 12/20——每一个丢分的题目背后,都藏着一个真实缺陷:知识盲区、未查先拒、门控误伤、中文匹配漏配。这是一份带完整解题过程的错题本。
AI 助手能答对文章里的技术题,却不认识博主自己的象棋项目。从这次失败出发,补齐多轮记忆、反馈闭环、失败可恢复与可见化交互——记录一个 RAG Demo 跨过"最后一公里"的四段工程。
在 1.7G 内存的服务器上落地博客 AI 问答助手:为什么不用向量数据库、为什么 Go 写 RAG 完全可行、SSE 被 BFF 攒成一坨的伪流式排查;以及上线首日的检索进化——混合召回、时间纠偏、阈值截断与拒答联动。