性能
LW AI 专为高吞吐量和低延迟而设计。本页提供性能基准和优化建议。
延迟基准
以下典型响应时间在希尔斯伯勒和新加坡区域测得:
| 模型 | 首 token 时间(TTFT) | 每秒输出 token 数 |
|---|---|---|
| deepseek/deepseek-v4-flash | ~200ms | ~80 tok/s |
| deepseek/deepseek-v4-pro | ~500ms | ~40 tok/s |
| z-ai/glm-5.1 | ~400ms | ~50 tok/s |
| z-ai/glm-5.2 | ~600ms | ~35 tok/s |
| linkwo/fusion | ~300ms | ~60 tok/s |
| astra | ~400ms | ~45 tok/s |
以上数值为近似值,会因输入长度、输出长度和当前负载而变化。测量使用短提示词(约 100 token 输入)。
区域延迟
| 客户端位置 → API 区域 | 预估延迟 |
|---|---|
| 新加坡 → openapi.linkwo.ai | ~15ms |
| 东京 → openapi.linkwo.ai | ~50ms |
| 美国西部 → openapi.linkwo.ai | ~15ms |
| 美国东部 → openapi.linkwo.ai | ~60ms |
| 欧洲 → openapi.linkwo.ai | ~200ms |
| 南美洲 → openapi.linkwo.ai | ~120ms |
吞吐量
| 等级 | 最大并发请求数 | 预估最大 TPM |
|---|---|---|
| Free | 2 | 40,000 |
| Standard | 10 | 200,000 |
| Pro | 30 | 1,000,000 |
| Enterprise | 自定义 | 自定义 |
优化建议
降低延迟
- 选择合适的区域 — 使用
openapi.linkwo.ai自动路由到最近区域 - 使用 Flash 模型 — DeepSeek V4 Flash 比 Pro 快 2-3 倍
- 启用流式响应 — 在 token 生成时即时接收,无需等待完整响应
- 精简提示词 — 输入 token 越少,处理越快
最大化吞吐量
- 批量请求 — 对非实时工作负载使用 Batch API
- 连接池 — 跨请求复用 HTTP 连接
- 并发请求 — 在速率限制范围内并行发送多个请求
- 缓存结果 — 避免对相同输入重复调用 API
减少 token 用量
- 设置
max_tokens— 不需要长响应时限制输出长度 - 使用简洁的提示词 — 表达具体,避免多余上下文
- 善用系统提示词 — 一次性设定行为,无需在每条消息中重复
- 使用结构化输出 — 直接请求 JSON,避免冗长的格式化
监控用量
联系 support@linkwo.com 获取你账户的性能指标:
- 请求延迟分位数(p50、p90、p99)
- token 用量随时间变化
- 各模型错误率
- 速率限制利用率