目标:让 27B 模型在 8×RTX 4090 上,以生产级质量服务多个真实用户——单用户 76+ tok/s,长上下文 262k,图片理解可用,多用户缓存秒恢复。 本文是完整踩坑 + 调优过程的沉淀,照着走可以直接复现。 1. 硬件与最终…
博客
1 篇
想追更新?有 RSS 订阅源,丢进阅读器就行。
目标:让 27B 模型在 8×RTX 4090 上,以生产级质量服务多个真实用户——单用户 76+ tok/s,长上下文 262k,图片理解可用,多用户缓存秒恢复。 本文是完整踩坑 + 调优过程的沉淀,照着走可以直接复现。 1. 硬件与最终…
想追更新?有 RSS 订阅源,丢进阅读器就行。