• 首页
  • 关于我们
  • 新闻公告
  • 聚焦效率与精度平衡,昆仑技术参与GCC研讨会分享软FP8创新实践

    聚焦效率与精度平衡,昆仑技术参与GCC研讨会分享软FP8创新实践

    聚焦效率与精度平衡,昆仑技术参与GCC研讨会分享软FP8创新实践

    2026年01月23日 阅读 8

    随着人工智能技术的迅猛发展,AI应用落地正面临日益复杂且庞大的计算需求。如何在确保计算精度的同时,提升计算效率,是业界普遍关注的问题。2026年1月20日,全球计算联盟(GCC)在杭州举办低精度AI计算研讨会,邀请行业顶尖科研机构、头部企业及各类应用厂商专家,围绕当前低精度AI计算技术发展现状、问题及未来趋势展开研讨。河南昆仑技术有限公司(简称:昆仑技术)作为全球计算联盟的重要成员受邀参会,分享在低精度AI领域的技术创新成果与实践经验。

    会上,昆仑技术AI软件与解决方案高级工程师唐金龙发表题为《昇腾平台上的软浮点FP8/FP4实现》的主题演讲。唐金龙介绍,FP8浮点格式专为智能计算优化设计,与传统FP16/BF16相比,可将显存需求减半,显著缓解硬件资源压力,降低AI计算总成本。与INT8格式相比,FP8不仅保留了更高的推理精度,还具备更广泛的数值表示范围,成功实现了 “效率” 与 “精度” 平衡,可满足不同场景下的AI应用需求。

    然而,FP8技术在落地应用过程中仍面临两大核心挑战:一是如何保障稳定的推理性能,二是如何让不支持FP8的硬件顺利适配FP8权重。针对这一行业痛点,昆仑技术基于昇腾平台开展技术创新,研发设计软FP8解决方案,通过选择性反量化、带宽优化、Shape亲和优化、CV并行等一系列核心策略,实现在非FP8硬件上高效运行FP8计算,不仅具备广泛的模型兼容性,还具备良好的扩展性,目前已适配DeepSeek V3.1、DeepSeek-V3/R1、Qwen3等主流FP8量化模型,并可快速支持各类新推出的模型产品。

    集成了软FP8解决方案的KunLun AI Space大模型加速引擎,已在多个行业客户的实际应用中取得显著成效。在确保精度与性能几乎无损的前提下,KunLun AI Space大幅降低了大模型部署的算力门槛与成本投入,为企业AI落地提供了高性价比的解决方案。

    未来,昆仑技术将持续深耕昇腾芯片的算力潜力挖掘,不断迭代优化技术方案,推动大模型私有化部署从“可用”向“普惠”跨越,为人工智能行业的高质量发展注入强劲动力。

    分享至