跳至内容
mylogs.cn
首页
科技
体育
娱乐
经验与技巧
我的项目
标签:
大模型推理
显存不够用?vLLM 把 KV 缓存拆成了 16 个词一页
2026年8月7日
发布于
科技
同样一张显卡,同样一个模型,换个推理引擎,能同时服务的用户数可以差出好几倍。差距不在模型,而在显存怎么管、请求…