STEP 1
设置接口地址
https://pufferpro.com/gateway/v1STEP 2
发送请求
curl https://pufferpro.com/gateway/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-chat",
"messages": [{"role": "user", "content": "你好"}],
"max_tokens": 2500,
"stream": false
}'模型列表
请求中的 model 必须填写以下名称之一。每次调用按照上游返回的真实输入、缓存和输出 Token 成本合计,再乘 1.5 扣除额度。
| 模型名称 | 适合用途 | 计费方式 |
|---|---|---|
| deepseek-chat | 通用聊天、翻译与写作 | 真实 Token 成本 × 1.5 |
| deepseek-reasoner | 复杂推理、数学与代码 | 真实 Token 成本 × 1.5 |
| deepseek-v3.2-exp | 实验版对话模型(专属上游线路) | 真实 Token 成本 × 1.5 |
| deepseek-v4-flash-vision-exp | 图片理解、截图识别与图文问答 | 真实 Token 成本 × 1.5 |
| glm-4-flash | 低价通用问答、翻译与轻量任务 | 真实 Token 成本 × 1.5 |
| gpt-5-nano | 快速对话、识图、工具调用与轻量推理(Responses) | 真实 Token 成本 × 1.5 |
GPT-5 Nano Responses 示例
该模型使用专用 Responses 地址,不使用 Chat Completions 地址。
curl https://pufferpro.com/gateway/v1/responses \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5-nano",
"input": "请用一句话介绍你自己",
"max_output_tokens": 2500
}'文本重排序
使用 netease-youdao/bce-reranker-base_v1 对检索到的文档按相关性重新排序。接口地址为 /gateway/v1/rerank,按照真实 Token 成本 × 1.5 扣除额度。
curl https://pufferpro.com/gateway/v1/rerank \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "netease-youdao/bce-reranker-base_v1",
"query": "人工智能如何帮助学习?",
"documents": ["AI 可以生成学习计划", "今天的天气很好"],
"top_n": 2
}'流式输出
把 stream 设置为 true,服务会使用 SSE 逐段返回内容,最后发送 [DONE]。
curl https://pufferpro.com/gateway/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-chat",
"messages": [{"role": "user", "content": "介绍一下你自己"}],
"max_tokens": 2500,
"stream": true
}'常见错误
HTTP 401
API Key 无效、停用或未提供
HTTP 402
当前 Key 剩余额度不足
HTTP 429
请求速度过快,请稍后重试
HTTP 502
上游模型暂时不可用
使用限制与安全
- • 每次请求最多输出 2500 Token。
- • API Key 可在全网支持自定义 OpenAI 接口的 App 中使用。
- • API Key 只在创建成功时完整显示一次,请妥善保存。
- • 不要把 Key 写进公开网页、代码仓库或截图。
- • Key 停用、归档或额度不足后将无法继续调用。