Agent 应用开发会员账号
知识目录选择核心方向与细分内容
知识单元 64基础实现约 20 分钟

理解 → 实现 → 排错 → 取舍

提示迭代、证据支持与独立验收

用同一任务集区分结构、来源、政策字段和自由文本支持,保留失败并比较新旧版本。

PromptStructured OutputEvidenceRegression

知识内容核对 2026-10-04 · 原题来源核对 2026-10-04

这个知识点,你想学到哪一步?

按当前基础选择起点,也可以依次深入。遇到不熟悉的概念,先回到核心原理;完成后用知识练习检查理解。

先理解

刚接触这个知识点

补齐先备概念,读原理与反例,再用自己的话解释为什么。

从核心原理开始 →

再实现

准备把原理写进代码

理解实现步骤与边界,完成小任务,对照验收要求检查结果。

阅读实现与取舍 →

会排错

需要处理故障与条件变化

沿连续追问定位失效前提,再比较迁移案例,说明方案应如何调整。

沿问题继续深入 →

能取舍

需要设计或评审方案

结合工程推演与资深自评标准,解释方案的适用条件、代价和替代选择。

分析工程场景 →
知识单元目录

LEARN · PRACTICE · REFLECT

知识学习与个人记录

我的笔记与复习 ↗

先沿着原理、问答和迁移案例阅读。需要检查理解时,再切换巩固练习或展开个人记录。

作答与个人记录

每次修改后的提交会保留为独立历史。掌握程度由你对照标准自评。

核心知识 · 提示迭代、证据支持与独立验收

先理解核心原理

先备概念:模型响应分类、结构化对象、证据与参考标签

提示表达任务约束,结构输出稳定局部形状;业务结果仍要通过允许证据、独立标签、语义主张和执行事实核对。版本改善必须在固定且独立的任务上比较。

从接口契约走向回答契约

普通 API 的类型检查不能证明业务事实,生成接口同样如此。提示写允许来源、例外规则和拒答条件,Schema 写字段与枚举,执行端检查权限和账本。退货问题的 30 天规则遇到电池例外时,需要联合来源并使用适用关系。

把错误定位到具体段落

先保存文档和实际 context,检查例外是否进入请求;接着检查结构、引用、决定与期限。证据已齐而候选误用规则,继续定位提示或推理;证据未提供,先修召回或组装。主张出现已退款,则核对批准与业务回执。

比较的对象必须独立

期望标签仅进入 grader,用固定任务及判断条件比较新旧候选,保留失败、正确拒答、过度拒答和未评分项。作者样本说明检查程序;实际效果需真实模型运行与独立保留集。

用一个问题检查理解

怎样验证一次提示修改改善了业务回答,而没有破坏证据与拒答边界?

我会先定义任务输入、允许证据、候选结构和独立验收,再固定正常、例外与缺失证据样本比较新旧提示。Schema 检查形状,引用检查来源与权限,政策标签检查已标注字段;自由文本和实际动作另行复核。保留候选、版本、错误类别和全部运行成本,使用未参与调优的保留集判断改善与退化,避免只看格式合法或挑选成功回答。

实现与取舍

先把任务写成可检查契约

虚构退货政策有普通 30 天规则和受损电池 7 天例外。提示需要说明允许来源、例外适用、输出字段和缺证据路径,候选包含决定、期限、解释与引用。当前任务交付政策解释;退款或运输动作仍需业务批准与独立账本。

验收按四个边界展开

结构检查字段、类型和枚举,引用检查来源是否出现在实际上下文以及当前授权与版本,必要证据集合说明回答是否保留一般规则与例外,独立标签核对已标注决定和期限。自然语言解释的每项主张仍需来源片段支持。输出形状稳定可参考 结构化输出契约,动作候选和执行边界可参考 函数调用。

同一任务集比较修改

固定任务、文档、模型、工具与 grader,对照新旧候选和失败类别,单列正确拒答与过度拒答。调优集与保留集按来源和业务条件区分;真实多次运行的费用、延迟和失败都应计入。更换裁判或政策标签后,先重跑两个版本,解释判断口径变化。

从运行记录判断支持范围

本站实验实际执行 grader,作者编写的 v1 候选一份通过、v2 候选三份通过,只用于观察检查程序。真实提示效果需要实际调用模型再保存候选。若合法对象写“退款已执行”,现有自由文本评分显示 not_scored,必须补语义与业务证据。这项边界应成为发布验收的一部分。

工程推演

场景
虚构政策助手需要同时回答普通退货、商品例外和无税费材料的问题。
设计决策
分开结构、引用、必要证据、政策标签与自然语言支持,使用固定任务比较候选。
验证目标
本地 grader 对三份作者候选逐项检查,输出错误类别并标出自由文本未评分。
适用边界
作者候选的计数支持程序验收,不外推为真实提示性能;在线模型与语义评分需另外运行。

连续追问与解答

沿着问题的前提和约束继续向下读。先理解参考解答,再尝试收起答案,用自己的话解释因果和取舍。

举一反三:条件变了,怎样推导?

先找出改变的条件,再判断原方案中哪些前提仍成立。下面的案例是教学推演,便于将原理迁移到新问题。

政策版本更新

改变的条件:普通退货窗口从旧版本迁移到新版本,旧任务仍保留历史上下文。

延伸问题:新提示总分变化,怎样区分政策变化和提示质量变化?

推导与参考解答

绑定文档、标签、候选和 grader 版本,先核对任务应使用哪个有效政策。用相同有效版本重跑两份提示,再解释差异。旧任务恢复重新核对当前授权与版本,不能仅因历史提示曾通过就交付旧政策结果。

保持不变的原理:比较效果需要固定或明确解释证据与判断条件。

结构字段正确但自由文本越界

改变的条件:决定和期限符合标签,解释却声称真实退款已经发生。

延伸问题:grader 的机械通过可以让业务结束吗?

推导与参考解答

将退款执行作为独立主张,核对可信批准对象、操作 ID 和账本回执。政策字段正确只支持有限回答契约,自由文本语义和外部动作仍需自己的验收。保留这条失败用于回归,记录现有 grader 未评分的范围。

保持不变的原理:每一种完成判断都依赖与它相匹配的可信证据。

易错点

  • 用 JSON 合法代替事实和业务验收。
  • 将期望标签混进模型输入后统计匹配。
  • 引用存在就认定整段解释获支持。
  • 只统计成功候选,隐藏退化和重复费用。

参考资料

依据官方接口契约及本站已运行教学程序设计,业务政策与候选均为虚构样本。 新增问答与迁移案例用于原理讲解,来源核查与案例运行验证分别记录。

检查自己理解到哪一步

读完后可以对照这些标准解释原理、边界和取舍。掌握程度由你自评;需要进一步验证时,再完成下方小任务。

基础达标
能分别解释任务指令、结构输出、证据支持和执行授权。
中高级信号
能用固定标签和失败样本定位提示、检索与验收程序问题。
资深信号
能设计独立保留集、分组门槛、语义复核及有运行证据的发布回退。

动手验证 按需完成 · 建议 30 分钟

运行 prompt_iteration.py,构造未知引用、缺失例外与合法对象中的错误自由文本,交付逐项验收和未评分说明。

展开验收要求与检查点
  • 字段错误、引用错误和政策标签错误分别定位。
  • 参考标签未出现在模型输入中。
  • 自由文本支持与机械契约分别说明。
  • 候选来源、数据和提示版本可复查。

重点检查

  • 能区分提示、Schema、事实支持和执行授权。
  • 知道参考标签不能混入模型输入。
  • 能解释必要证据召回与回答正确性分别检查。
  • 版本比较保留失败和未评分项。