腾讯混元端侧翻译模型压缩至 440MB:3.3GB 模型几乎无损量化
腾讯混元将端侧翻译模型 Hy-MT2-1.8B 通过 2-bit 与 1.25-bit 两套极致量化压缩至几百 MB(分别 574MB 与 440MB),翻译质量几乎无损,FLORES-200 评测优于微软、豆包等商业翻译 API;联合英特尔完成 x86 算子优化使 token 速率最高提升 5 倍,并接入哔哩哔哩直播弹幕实时翻译。
腾讯混元将端侧翻译模型 Hy-MT2-1.8B 通过 2-bit 与 1.25-bit 两套极致量化压缩至几百 MB(分别 574MB 与 440MB),翻译质量几乎无损,FLORES-200 评测优于微软、豆包等商业翻译 API;联合英特尔完成 x86 算子优化使 token 速率最高提升 5 倍,并接入哔哩哔哩直播弹幕实时翻译。