AI AI 评测系列(02):评测指标设计——从业务目标到可量化指标 指标缺失时会发生什么 一个 RAG 问答系统上线了。工程师说"测试都通过了"——API 响应时间 < 2 秒,格式正确,没有崩溃。 两周后用户反馈说"AI
AI AI 评测系列(01):为什么 AI 评测难——不确定性、主观性与多维度 传统软件测试的假设 传统软件测试建立在三个假设上: 输出确定 :相同输入给相同输出,测试可以复现 正确性可判定 :函数返回 42 是对还是错,有明确标准 维
AI 开源项目第151期:codex-plugin-cc — 在 Claude Code 里直接调用 OpenAI Codex 引言 "Use Codex from Claude Code to review code or delegate tasks." 这是「每日一个开源项目」
AI 每日一个开源项目(第150篇):caveman - 为什么用很多 token,少 token 也行——给 AI Agent 装上穴居人嘴巴 引言 "为什么用很多 token,少 token 也行。" 这是"每日一个开源项目"系列的 第150篇文章 。今天的主角是 caveman ——一个让 AI