For a long time, I recorded one latency number for every LLM request:

latency_ms = response_finished_at - request_started_at

Enter fullscreen mode

Exit fullscreen mode

It looked useful. I could calculate an average, add a p95 chart, and see whether a model was getting slower.