Agent 应用开发会员账号
知识目录选择核心方向与细分内容

SYSTEMATIC LEARNING / 分层专题

上下文与生成预算

从完整请求的容量算例出发,理解输入、输出、下一轮增量与证据保留的关系。

学习目标:能够为一次请求及下一轮工具结果计算容量,并解释超窗、输出截断和网络中断的不同原因。

内容核对 2026-10-04 · 每层有独立讲解、任务与检查

按这个知识点的熟悉程度选择起点。当前层:初级 · 完成实现。完成任务后可以继续下一层;阅读与自检不自动代表掌握。

本层学习目录

先补齐必要概念

适合:已经理解输入与生成共同占用容量的前提。

Token
模型编码和计量内容的单位,不等于固定数量的汉字或单词;实验直接给定计数,不实现分词。
上下文
本次请求中模型能使用的信息,包括指令、历史、工具定义和材料。
生成预算
允许生成内容的上限;某些接口还将推理用量计入其中,具体规则要查目标接口。
安全余量
应用主动留出的空间,用于计数误差或预计增量;不能替代真实计数。

原理怎样一步步成立?

  1. 组装请求

    分别统计指令、历史、工具定义和证据。

  2. 检查约束

    同时检查总容量与独立输出上限。

  3. 调用并检查状态

    区分完成、预算耗尽、拒绝和传输中断。

  4. 准备下一轮

    加入工具结果后重新计数,检查必要证据是否保留。

初级 · 完成实现

把容量规则写成可检查函数

本层目标:能运行预算实验,并把下一轮增量纳入检查。

先分项,再求和

离线实验的 components 将指令、历史、工具定义和证据分别计数。remaining 同时校验输入类型和独立输出上限,然后计算剩余容量。拒绝布尔值冒充计数,是因为 Python 的 bool 也可表现为整数,而业务需要明确的计数类型。

为什么要在每轮重新检查

第一轮还能放下,不代表第二轮也能放下。工具结果、模型响应和新问题都可能增加输入;实际接口对消息结构也有额外计量。实验只给定数字,生产接入时要使用目标模型适用的计数方法,并用实际 usage 校准估算。

容量通过之后仍要验收

预算函数只回答“本地容量规则是否允许”。它没有判断证据是否相关、引用是否完整,也没有判断参数能否执行。生成到上限后留下的部分 JSON 不能因为预算函数曾经通过,就直接发给业务工具。检查完整响应状态、解析结果与业务条件是后续责任。

运行实验,观察反例

给定 token 数的离线算术实验;不调用模型,不验证分词器、流式传输或厂商实际限制。

Python 3.10+ · 默认运行只使用标准库 · 在你的电脑运行

  1. 先手算,再运行脚本核对
  2. 改变工具结果增量并重新计算
  3. 故意超过独立输出上限,检查错误分支
下载 context_budget.py ↓
python3 context_budget.py
查看本入口脚本
"""Given token counts: no tokenizer, model request or provider-specific limit."""
import json


def remaining(context, output_limit, output, reserve, components):
    values = [context, output_limit, output, reserve, *components.values()]
    if any(type(v) is not int or v < 0 for v in values):
        raise ValueError("counts must be non-negative integers")
    if output > output_limit:
        raise ValueError("output limit exceeded")
    return context - sum(components.values()) - output - reserve


def demo():
    components = dict(instructions=2000, history=10000, tools=3000, evidence=8000)
    before = remaining(32000, 8000, 6000, 1000, components)
    after = remaining(32000, 8000, 6000, 1000, {**components, "result": 4000})
    assert before == 2000 and after == -2000
    return dict(input_tokens=sum(components.values()), current_room=before,
                next_turn_room=after, next_turn_fits=after >= 0)


if __name__ == "__main__":
    print(json.dumps(demo(), sort_keys=True))

本地运行的预期输出

{"current_room": 2000, "input_tokens": 23000, "next_turn_fits": false, "next_turn_room": -2000}
  • 完整输入分项一致
  • 下一轮容量重新计算
  • 实验通过不等于回答质量通过
查看运行环境、输出和校验记录 →

本层验收任务

下载 context_budget.py,运行后将 result 改为 1000,再把 output 改为 9000。

完成后逐条核对

  • 原始实验输出 current_room=2000、next_turn_room=−2000
  • 结果增量改为 1000 后下一轮余量为 1000
  • 生成预算改为 9000 时触发独立输出上限错误

保存自己的过程、代码与结果。这里提供验收要求,暂不自动评分或保存课程掌握状态。

收起答案,检查理解

函数返回正数,是否证明答案一定正确?

延伸原理与知识练习

遇到不熟悉的原理,先阅读实现、连续追问和迁移案例,再独立说明前提与边界。作答与笔记保存到原有账号记录。

本专题的全部关联解析与练习(3 道)

依据与验证范围

原理依据来自公开资料;数字、案例和任务是本站教学设计。离线实验验证本页注明的范围,学习效果仍需通过独立任务与反馈判断。