性能

LW AI 专为高吞吐量和低延迟而设计。本页提供性能基准和优化建议。

延迟基准

以下典型响应时间在希尔斯伯勒和新加坡区域测得:

模型首 token 时间(TTFT)每秒输出 token 数
deepseek/deepseek-v4-flash~200ms~80 tok/s
deepseek/deepseek-v4-pro~500ms~40 tok/s
z-ai/glm-5.1~400ms~50 tok/s
z-ai/glm-5.2~600ms~35 tok/s
linkwo/fusion~300ms~60 tok/s
astra~400ms~45 tok/s

以上数值为近似值,会因输入长度、输出长度和当前负载而变化。测量使用短提示词(约 100 token 输入)。

区域延迟

客户端位置 → API 区域预估延迟
新加坡 → openapi.linkwo.ai~15ms
东京 → openapi.linkwo.ai~50ms
美国西部 → openapi.linkwo.ai~15ms
美国东部 → openapi.linkwo.ai~60ms
欧洲 → openapi.linkwo.ai~200ms
南美洲 → openapi.linkwo.ai~120ms

吞吐量

等级最大并发请求数预估最大 TPM
Free240,000
Standard10200,000
Pro301,000,000
Enterprise自定义自定义

优化建议

降低延迟

  • 选择合适的区域 — 使用 openapi.linkwo.ai 自动路由到最近区域
  • 使用 Flash 模型 — DeepSeek V4 Flash 比 Pro 快 2-3 倍
  • 启用流式响应 — 在 token 生成时即时接收,无需等待完整响应
  • 精简提示词 — 输入 token 越少,处理越快

最大化吞吐量

  • 批量请求 — 对非实时工作负载使用 Batch API
  • 连接池 — 跨请求复用 HTTP 连接
  • 并发请求 — 在速率限制范围内并行发送多个请求
  • 缓存结果 — 避免对相同输入重复调用 API

减少 token 用量

  • 设置 max_tokens — 不需要长响应时限制输出长度
  • 使用简洁的提示词 — 表达具体,避免多余上下文
  • 善用系统提示词 — 一次性设定行为,无需在每条消息中重复
  • 使用结构化输出 — 直接请求 JSON,避免冗长的格式化

监控用量

联系 support@linkwo.com 获取你账户的性能指标:

  • 请求延迟分位数(p50、p90、p99)
  • token 用量随时间变化
  • 各模型错误率
  • 速率限制利用率

相关文档