PrismML发布Bonsai 2 27B:基于Qwen3.8三值化压缩9倍
PrismML发布Bonsai 2 27B:极致压缩、性能不变
推荐理由
端侧部署利器,27B模型压到5.9G还能跑满RTX5090,做本地Agent的同学赶紧试试这个三值化方案。
PrismML发布Bonsai 2 27B:极致压缩、性能不变 基于Qwen3.8 27B推出三值化模型,将体积压缩9倍至5.9GB,并保留了原模型98.2%的综合评测表现。
保持262K长上下文,能直接以MLX或CUDA内核在个人设备运行,RTX 5090推理速度达到143 tokens/s。
模型:https://huggingface.co/collections/prism-ml/bonsai-2
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力