Defined Term
Latency(延迟)
从请求发出到收到第一个 token 的时间,常用 TTFT 与 TPOT
详细定义
Latency 是 LLM 应用的用户体验生命线。关键指标:TTFT(Time To First Token,首 token 延迟,决定「响应感」)、TPOT(Time Per Output Token,每 token 间隔,决定「流畅度」)、端到端延迟(完整回答耗时)。FDE 现场必须按场景设延迟目标:实时对话 <500ms TTFT、批处理 <5s 端到端。
实例
- 实时客服:TTFT <300ms、TPOT <50ms。
- 代码补全:TTFT <100ms。
- 长文档总结:端到端 <10s 可接受。
来自行业的实例
实时客服:TTFT <300ms、TPOT <50ms。
代码补全:TTFT <100ms。
长文档总结:端到端 <10s 可接受。
关联术语
关于 Latency(延迟) 的常见问题
Latency(延迟) 的核心定义是什么?
从请求发出到收到第一个 token 的时间,常用 TTFT 与 TPOT
Latency(延迟) 在 FDE 工作流中扮演什么角色?
Latency 是 LLM 应用的用户体验生命线。关键指标:TTFT(Time To First Token,首 token 延迟,决定「响应感」)、TPOT(Time Per Output Token,每 token 间隔,决定「流畅度」)、端到端延迟(完整回答耗时)。FDE 现场必须按场景设延迟目标:实时对话 <500ms TTFT、批处理 <5s 端到端。