精选80Hugging Face 博客(RSS)产品发布/更新
TGI Multi-LoRA:一次部署服务30个模型
TGI Multi-LoRA:一次部署,服务30个模型
Hugging Face 发布 TGI Multi-LoRA 功能,允许在单个基础模型上同时部署多达30个 LoRA 适配器,实现一次部署服务多个模型。该功能基于 Text Generation Inference(TGI)框架,通过动态加载和切换 LoRA 权重,显著降低多模型部署的显存占用和运维成本。用户只需指定基础模型和多个 LoRA 适配器路径,TGI 即可自动处理请求路由和适配器切换。实测表明,在相同硬件条件下,相比独立部署多个模型,显存节省可达90%以上,且推理延迟增加有限。该功能已开源,支持 Hugging Face Hub 上的 LoRA 模型直接加载。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力