<?xml version="1.0" encoding="UTF-8"?><rss xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title><![CDATA[别先调 Prompt：用评测集驱动 AI 功能迭代]]></title><description><![CDATA[<p dir="auto">当 AI 功能表现不稳定时，团队常见的第一反应是继续改 Prompt。没有固定评测集时，这种调整很容易让一个例子变好、另十个例子悄悄变坏。</p>
<h2>先建立一个很小但真实的评测集</h2>
<p dir="auto">初版不需要上千条数据。可以从 20 到 50 个真实任务开始，至少覆盖：</p>
<ul>
<li>最常见的正常请求。</li>
<li>信息不全、表达含糊和格式异常的请求。</li>
<li>工具超时、空结果、权限不足和重复回调。</li>
<li>应该拒绝或转人工的高风险请求。</li>
<li>曾经发生过的回归样本。</li>
</ul>
<p dir="auto">每条样本写清输入、允许使用的上下文、期望行为、禁止行为和判定方法。能用代码判定的就用代码；涉及帮助程度、事实完整性或语气的，再使用有量表的人类复核或模型评分，并定期校准评分器。</p>
<h2>每次改动都问四个问题</h2>
<ol>
<li>通过率是否提高，还是只对展示案例提高？</li>
<li>原来通过的样本有没有回归？</li>
<li>成本、延迟和工具调用次数发生了什么变化？</li>
<li>失败是否更容易被发现和人工接管？</li>
</ol>
<p dir="auto">OpenAI 的评测指南也强调持续评测、任务特定样本和人工反馈校准。无论使用哪家模型，这个方法都成立：先把“好”写成可检查的行为，再调整 Prompt、工具或模型。</p>
<p dir="auto">参考：</p>
<ul>
<li><a href="https://developers.openai.com/api/docs/guides/evaluation-best-practices" rel="nofollow ugc">https://developers.openai.com/api/docs/guides/evaluation-best-practices</a></li>
<li><a href="https://platform.openai.com/docs/guides/evals" rel="nofollow ugc">https://platform.openai.com/docs/guides/evals</a></li>
</ul>
<hr />
<p dir="auto">编辑说明：2026-08-15，COHAO 编辑部依据官方评测指南和工程实践整理；AI 协助起草，项目负责人复核。</p>
]]></description><link>https://cohao.cn/topic/6/别先调-prompt-用评测集驱动-ai-功能迭代</link><generator>RSS for Node</generator><lastBuildDate>Thu, 17 Sep 2026 00:54:56 GMT</lastBuildDate><atom:link href="https://cohao.cn/topic/6.rss" rel="self" type="application/rss+xml"/><pubDate>Sat, 15 Aug 2026 18:16:18 GMT</pubDate><ttl>60</ttl></channel></rss>