Response 压缩
2026/7/28大约 2 分钟
Response 压缩
Response 压缩接口用于将过长的对话历史进行摘要压缩,有效减少后续请求的 token 用量,降低调用成本。
接口信息
| 属性 | 值 |
|---|---|
| 基础 URL | https://api.quickapi.store |
| 端点 | POST /v1/responses/compact |
| Content-Type | application/json |
| 认证方式 | Bearer Token |
请求参数
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
model | string | 是 | 模型名称,如 gpt-4o-mini、gpt-4o |
input | array | 是 | 消息数组,包含完整对话历史 |
max_output_tokens | integer | 否 | 压缩后摘要的最大 token 数 |
instructions | string | 否 | 压缩指令,如"保留关键决策和技术细节" |
示例
压缩对话历史
curl https://api.quickapi.store/v1/responses/compact \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $YOUR_API_KEY" \
-d '{
"model": "gpt-4o-mini",
"input": [
{"role": "user", "content": "请帮我设计一个用户认证系统"},
{"role": "assistant", "content": "好的,我建议采用 JWT + Refresh Token 方案..."},
{"role": "user", "content": "如何保证 Token 的安全性?"},
{"role": "assistant", "content": "可以采用以下措施:1. 设置合理的过期时间..."},
{"role": "user", "content": "数据库表怎么设计?"},
{"role": "assistant", "content": "建议设计 users 表和 refresh_tokens 表..."}
],
"max_output_tokens": 200,
"instructions": "保留技术方案要点和关键决策,去除冗余对话"
}'响应示例
{
"id": "compact_xyz789",
"object": "response.compacted",
"created": 1721234600,
"model": "gpt-4o-mini",
"output": [
{
"type": "message",
"role": "assistant",
"content": [
{
"type": "text",
"text": "对话摘要:用户请求设计用户认证系统。技术方案:采用 JWT + Refresh Token 双 Token 机制。安全措施:设置短过期时间(Access Token 15分钟,Refresh Token 7天)、HTTPS 传输、Token 黑名单。数据库设计:users 表(id, username, password_hash, email)和 refresh_tokens 表(id, user_id, token, expires_at)。"
}
]
}
],
"usage": {
"input_tokens": 320,
"output_tokens": 85,
"total_tokens": 405
},
"compression_ratio": 0.27
}Python 示例
from openai import OpenAI
client = OpenAI(
api_key="your-api-key",
base_url="https://api.quickapi.store/v1"
)
# 压缩对话历史
response = client.responses.create(
model="gpt-4o-mini",
input=[
{"role": "user", "content": "请帮我设计一个用户认证系统"},
{"role": "assistant", "content": "好的,我建议采用 JWT + Refresh Token 方案..."},
{"role": "user", "content": "如何保证 Token 的安全性?"},
{"role": "assistant", "content": "可以采用以下措施:1. 设置合理的过期时间..."}
],
instructions="保留技术方案要点和关键决策",
max_output_tokens=200
)
print(response.output[0].content[0].text)提示
建议在对话超过 4000 tokens 时进行压缩,既能节省成本又能保持上下文连贯性。
注意
压缩会丢失部分细节信息,请确保在 instructions 中明确需要保留的关键内容。

