OpenBMB:RT David Hendrickson:GGUF量化可能迎…


RT David Hendrickson:GGUF量化可能迎来一种“大小调节器”——全新的FIT-GGUF量化技术!通常下载本地模型时,你得选量化等级(Q3→Q4→Q5→Q6…),然后祈祷它能适配你的内存/显存。而FIT-GGUF反过来操作

RT David Hendrickson:GGUF量化可能迎来一种“大小调节器”——全新的FIT-GGUF量化技术!通常下载本地模型时,你得选量化等级(Q3→Q4→Q5→Q6…),然后祈祷它能适配你的内存/显存。而FIT-GGUF反过来操作:你给个目标大小或精度等级,它就能逐张量混合精度,找到符合要求的GGUF模型。OpenBMB在MiniCPM5-2B上展示了效果:📦 质量版——1.46GiB,⚖️ 平衡版——1.28GiB,🗜️ 紧凑版——1.21GiB,🤏 极简版——1.14GiB。这些标签代表逐步降低对BF16模型的精度,主要用KL散度衡量。

—— OpenBMB (@OpenBMB) X帖子|2026-09-24T16:34:18+00:00
原帖:https://x.com/OpenBMB/status/2104433379265724620



扫描二维码,在手机上阅读

OpenBMB:⚡ 为了实现本地推理的超轻量化,社区开发了一个EXL3 4位…

OpenBMB:🚀 FIT-GGUF为MiniCPM5-2B带来了可控大小的…

评 论
评论已关闭