好文推荐
prompt caching 也叫 KV caching,缓存的不是答案,是中间干活的结果,规避 LLM 推理过程中的冗余计算,但不影响输出的随机性。很灵活,不用完整匹配整段,支持前缀部分匹配。
https://ngrok.com/blog/prompt-caching/
prompt caching 也叫 KV caching,缓存的不是答案,是中间干活的结果,规避 LLM 推理过程中的冗余计算,但不影响输出的随机性。很灵活,不用完整匹配整段,支持前缀部分匹配。
https://ngrok.com/blog/prompt-caching/