FDE Hub
术语词典/Latency(延迟)
Defined Term

Latency(延迟)

从请求发出到收到第一个 token 的时间,常用 TTFT 与 TPOT

详细定义

Latency 是 LLM 应用的用户体验生命线。关键指标:TTFT(Time To First Token,首 token 延迟,决定「响应感」)、TPOT(Time Per Output Token,每 token 间隔,决定「流畅度」)、端到端延迟(完整回答耗时)。FDE 现场必须按场景设延迟目标:实时对话 <500ms TTFT、批处理 <5s 端到端。

实例

  • 实时客服:TTFT <300ms、TPOT <50ms。
  • 代码补全:TTFT <100ms。
  • 长文档总结:端到端 <10s 可接受。
来自行业的实例
实时客服:TTFT <300ms、TPOT <50ms。
代码补全:TTFT <100ms。
长文档总结:端到端 <10s 可接受。

关联术语

关于 Latency(延迟) 的常见问题

Latency(延迟) 的核心定义是什么?

从请求发出到收到第一个 token 的时间,常用 TTFT 与 TPOT

Latency(延迟) 在 FDE 工作流中扮演什么角色?

Latency 是 LLM 应用的用户体验生命线。关键指标:TTFT(Time To First Token,首 token 延迟,决定「响应感」)、TPOT(Time Per Output Token,每 token 间隔,决定「流畅度」)、端到端延迟(完整回答耗时)。FDE 现场必须按场景设延迟目标:实时对话 <500ms TTFT、批处理 <5s 端到端。