精选70Hugging Face 博客(RSS)产品发布/更新
TGI 集成 Intel Gaudi 加速 LLM 推理
Hugging Face 宣布其文本生成推理(TGI)库现已集成 Intel Gaudi AI 加速器,支持在 Gaudi 2 和 Gaudi 3 硬件上高效运行大语言模型推理。该集成利用 Intel 的 Habana 框架,通过优化内核和内存管理,在保持模型精度的同时提升吞吐量并降低延迟。用户可通过 TGI 的 Docker 镜像或源码部署,支持 Llama、Mistral 等主流模型。此举旨在为开发者提供更多硬件选择,降低推理成本。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力