跳到主内容
@wquguru
精选86Hugging Face 每日论文(json_list)论文研究

Llama-Mobile:面向移动端的2.7-bit VLM量化框架

Llama-Mobile: Efficient 2.7-Bit Quantization of VLMs

原文
发到 X
推荐理由

移动端部署 VLM 是刚需,这篇论文给出了具体的 2.7-bit 量化方案与实测数据,对做端侧推理的同学有直接参考价值。

在移动设备上部署视觉-语言模型(VLMs)因其显著的内存和计算需求而具有挑战性。我们提出了一种针对资源受限硬件进行高效推理的 VLM 量化框架。我们的方法结合了利用模型自身生成训练数据且无需访问训练设置的量化流水线,以及一种新颖的每参数 2.7 位格式,支持在 Arm CPU 上高效执行。我们通过将 Llama 3.2 11B Vision Instruct 模型压缩至 3.7 GB(使用 8 位激活值),并在一系列标准视觉问答任务中保持强大性能,验证了该方法的有效性。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近