先理解
刚接触这个知识点
补齐先备概念,读原理与反例,再用自己的话解释为什么。
从核心原理开始 →理解 → 实现 → 排错 → 取舍
用同一任务集区分结构、来源、政策字段和自由文本支持,保留失败并比较新旧版本。
知识内容核对 2026-10-04 · 原题来源核对 2026-10-04
建议先理解:
第一次模型调用与响应契约 →按当前基础选择起点,也可以依次深入。遇到不熟悉的概念,先回到核心原理;完成后用知识练习检查理解。
LEARN · PRACTICE · REFLECT
先沿着原理、问答和迁移案例阅读。需要检查理解时,再切换巩固练习或展开个人记录。
核心知识 · 提示迭代、证据支持与独立验收
先备概念:模型响应分类、结构化对象、证据与参考标签
提示表达任务约束,结构输出稳定局部形状;业务结果仍要通过允许证据、独立标签、语义主张和执行事实核对。版本改善必须在固定且独立的任务上比较。
普通 API 的类型检查不能证明业务事实,生成接口同样如此。提示写允许来源、例外规则和拒答条件,Schema 写字段与枚举,执行端检查权限和账本。退货问题的 30 天规则遇到电池例外时,需要联合来源并使用适用关系。
先保存文档和实际 context,检查例外是否进入请求;接着检查结构、引用、决定与期限。证据已齐而候选误用规则,继续定位提示或推理;证据未提供,先修召回或组装。主张出现已退款,则核对批准与业务回执。
期望标签仅进入 grader,用固定任务及判断条件比较新旧候选,保留失败、正确拒答、过度拒答和未评分项。作者样本说明检查程序;实际效果需真实模型运行与独立保留集。
我会先定义任务输入、允许证据、候选结构和独立验收,再固定正常、例外与缺失证据样本比较新旧提示。Schema 检查形状,引用检查来源与权限,政策标签检查已标注字段;自由文本和实际动作另行复核。保留候选、版本、错误类别和全部运行成本,使用未参与调优的保留集判断改善与退化,避免只看格式合法或挑选成功回答。
虚构退货政策有普通 30 天规则和受损电池 7 天例外。提示需要说明允许来源、例外适用、输出字段和缺证据路径,候选包含决定、期限、解释与引用。当前任务交付政策解释;退款或运输动作仍需业务批准与独立账本。
结构检查字段、类型和枚举,引用检查来源是否出现在实际上下文以及当前授权与版本,必要证据集合说明回答是否保留一般规则与例外,独立标签核对已标注决定和期限。自然语言解释的每项主张仍需来源片段支持。输出形状稳定可参考 结构化输出契约,动作候选和执行边界可参考 函数调用。
固定任务、文档、模型、工具与 grader,对照新旧候选和失败类别,单列正确拒答与过度拒答。调优集与保留集按来源和业务条件区分;真实多次运行的费用、延迟和失败都应计入。更换裁判或政策标签后,先重跑两个版本,解释判断口径变化。
本站实验实际执行 grader,作者编写的 v1 候选一份通过、v2 候选三份通过,只用于观察检查程序。真实提示效果需要实际调用模型再保存候选。若合法对象写“退款已执行”,现有自由文本评分显示 not_scored,必须补语义与业务证据。这项边界应成为发布验收的一部分。
沿着问题的前提和约束继续向下读。先理解参考解答,再尝试收起答案,用自己的话解释因果和取舍。
第 1 层提示加上“只依据材料回答”,为什么仍需要独立验收?
从提示的作用推导程序应承担的验证责任。
指令表达目标,但模型仍可能误用规则、遗漏例外或给出无依据主张。应用先检查结构与允许来源,再对照独立政策标签和必要证据,最后复核自由文本。比如电池问题只引用普通 30 天规则,JSON 合法仍不满足任务合同。保留真实候选和失败类别,才能判断提示修改解决了哪一段问题。
第 1 层引用 ID 都存在,怎样判断回答有没有遗漏商品例外?
改变验收条件,从单条来源存在推进到多来源共同支持。
存在性检查只能确认引用来自允许集合。先由可信政策标注每道题的必要证据集合,电池题要求一般规则与电池例外同时出现;再核对候选是否在实际上下文中引用它们,并比较决定和期限。自由文本还需逐项对照来源片段,避免存在引用却解释错。
沿着这个回答继续深入
第 2 层两条必要来源都进入上下文,答案仍写 30 天,应该继续修检索吗?
沿证据充分的前提,继续把生成错误与检索错误分开。
先保存实际请求与候选,确认输入完整保留了例外和适用条件。如果这些都成立,召回在这项检查上已通过,下一步看提示、模型推理与解释支持,修改后用相同样本回归。不要把检索指标与回答正确性合成一个不可定位的分数。
沿着这个回答继续深入
第 3 层决定和期限字段都改对了,但文本说退款已执行,还需要什么证据?
从政策字段的正确继续推进到外部效果的独立事实边界。
将已退款列成独立业务效果主张,查询实际批准与退款账本、业务操作 ID 和回执。政策解释的标签与引用不能推出退款执行事实。当前教学 grader 对自由文本标为未评分,该候选应进入语义与业务复核,并增加相应回归样本。
第 1 层同一批样本的新提示通过更多,怎样避免对样本过拟合?
把局部改善放回有独立证据的版本比较。
将用于改提示的样本与冻结保留样本分开,按文档、任务来源和业务条件分组,避免近重复跨集合。固定模型、数据与 grader,保存所有候选及失败,分组观察正常、例外、缺证据和越权。真实模型的重复运行与成本也要记录,再决定新版本是否达到预先定义的发布门槛。
先找出改变的条件,再判断原方案中哪些前提仍成立。下面的案例是教学推演,便于将原理迁移到新问题。
改变的条件:普通退货窗口从旧版本迁移到新版本,旧任务仍保留历史上下文。
延伸问题:新提示总分变化,怎样区分政策变化和提示质量变化?
绑定文档、标签、候选和 grader 版本,先核对任务应使用哪个有效政策。用相同有效版本重跑两份提示,再解释差异。旧任务恢复重新核对当前授权与版本,不能仅因历史提示曾通过就交付旧政策结果。
保持不变的原理:比较效果需要固定或明确解释证据与判断条件。
改变的条件:决定和期限符合标签,解释却声称真实退款已经发生。
延伸问题:grader 的机械通过可以让业务结束吗?
将退款执行作为独立主张,核对可信批准对象、操作 ID 和账本回执。政策字段正确只支持有限回答契约,自由文本语义和外部动作仍需自己的验收。保留这条失败用于回归,记录现有 grader 未评分的范围。
保持不变的原理:每一种完成判断都依赖与它相匹配的可信证据。
依据官方接口契约及本站已运行教学程序设计,业务政策与候选均为虚构样本。 新增问答与迁移案例用于原理讲解,来源核查与案例运行验证分别记录。
读完后可以对照这些标准解释原理、边界和取舍。掌握程度由你自评;需要进一步验证时,再完成下方小任务。
运行 prompt_iteration.py,构造未知引用、缺失例外与合法对象中的错误自由文本,交付逐项验收和未评分说明。