vLLM后台服务显示的Prefix cache hit rate: 45.7%,而通过流式响应获取的"usage":{"prompt_tokens":18995,"total_tokens":26108,"completion_tokens":7113,"prompt_tokens_details":{"cached_tokens":16464}}计算出来为86.7%(16464/18995),为啥差别这么大
vLLM后台服务显示的Prefix cache hit rate: 45.7%,而通过流式响应获取的"usage":{"prompt_tokens":18995,"total_tokens":26108,"completion_tokens":7113,"prompt_tokens_details":{"cached_tokens":16464}}计算出来为86.7%(16464/18995),为啥差别这么大