⚡ 为了实现本地推理的超轻量化,社区开发了一个EXL3 4位量化版本的MiniCPM5-2B,模型权重压缩到了仅1.61GB!✨ 主要亮点: ⚡ 使用4.0位EXL3量化,使模型更小巧轻便 🚀 在NVIDIA Tesla T4上验证,每秒可处理约68-70个令牌 💾 量化后的模型权重仅需1.61GB 🛠️ 支持ExLlamaV3和TabbyAPI的本地推理 这是社区对MiniCPM5-2B进行轻量化优化的一大贡献,使其更适合本地部署。 🤗 模型: 🤗 基础模型:
—— OpenBMB (@OpenBMB) X帖子|2026-09-28T13:00:03+00:00
原帖:https://x.com/OpenBMB/status/2104556745863360697
OpenBMB:⚡ 为了实现本地推理的超轻量化,社区开发了一个EXL3 4位…
⚡ 为了实现本地推理的超轻量化,社区开发了一个EXL3 4位量化版本的MiniCPM5-2B,模型权重压缩到了仅1.61GB!✨ 主要亮点: ⚡ 使用4.0位EXL3量化,使模型更小巧轻便 🚀 在NVIDIA Tesla T4上验证,每秒可
扫描二维码,在手机上阅读
