大模型的能力越来越强,参数规模和部署成本也在不断增长。显存占用高、推理速度慢、硬件成本高,正在成为大模型真正落地时绕不开的问题。
为什么同一个模型可以从 FP16 量化到 INT2,甚至更低比特?量化之后,模型的速度、显存占用和效果会发生什么变化?面对不同模型、任务和硬件,又该如何选择合适的量化方案?
低比特量化并不是简单地“把数字变小”,而是在模型能力、推理速度、显存占用与部署成本之间寻找平衡。
本次免费线上公开课将从低比特量化的核心原理出发,系统梳理大模型量化的主要技术路线、代表性方法与工程挑战,并介绍 INT4、INT2 及更低比特量化、混合精度、向量量化等前沿方向。
既讲清底层逻辑,也关注真实部署中的方法选择,帮助你建立对大模型低比特量化的整体认识。
正在学习人工智能、大模型或深度学习相关内容
对大模型推理优化与高效部署感兴趣
接触过 GPTQ、AWQ、SmoothQuant 等方法,但缺少系统理解
想弄清不同量化方法的区别和适用场景
正在关注大模型显存占用、推理速度和部署成本
希望了解低比特量化技术的前沿发展方向
无需具备量化经验,了解基础的深度学习或大模型概念即可参加。
1. 为什么大模型需要低比特量化?
大模型面临的计算、存储与显存瓶颈
模型精度、推理速度与部署成本之间的关系
从 FP16 到 INT2,模型究竟发生了什么变化
2. 低比特量化的核心原理
量化与反量化的基本过程
量化粒度、缩放因子与零点
对称量化与非对称量化
量化误差从哪里产生
3. 主流量化方法与技术路线
训练后量化与量化感知训练
仅权重量化与权重—激活量化
GPTQ、AWQ、SmoothQuant 等代表性方法
不同量化方法的特点与适用场景
4. 量化中的关键挑战
异常值为什么会影响量化效果
校准数据应该如何选择
如何减少量化带来的模型能力损失
算法效果与硬件支持之间的差异
如何平衡精度、速度、显存和部署成本
5. 前沿进展与未来趋势
INT4、INT2 及更低比特量化
混合精度与自适应量化
向量量化与前沿趋势
量化与模型微调的结合
国产 GPU 适配与软硬件协同优化
一套完整框架:理解低比特量化为什么有效,以及它解决了哪些问题
一张方法地图:理清不同量化路线、代表性方法及其适用场景
一个工程视角:从模型效果、显存、速度、成本和硬件条件综合评估量化方案
一份前沿认知:了解大模型低比特量化正在向哪些方向发展
刘老师|算法工程师
长期从事大模型推理加速与高效部署相关工作,专注于模型量化、稀疏化、压缩及国产 GPU 适配,具备从算法研发、模型微调到部署与性能测试的完整实践经验,并拥有多项人工智能相关论文及发明专利成果。
🗓 活动日期: 9月17日
⏰ 北京时间: 17:00–18:00
⏰ 悉尼时间: 19:00–20:00
💻 活动形式: 免费线上公开课
🎤 主讲老师: 刘老师
💰 活动费用: 免费 · 报名制
👉 立即免费报名,一起读懂大模型如何跑得更快、更省
低比特量化的原理、方法与前沿进展 大模型的能力越来越强,参数规模和部署成本也在不断增长。显存占用高、推理速度慢、硬件成本高,正在成为大模型真正落地时绕不开的问题。 为什么同一个模型可以从 FP16 量化到 INT2,甚至更低比特?量化之后,…
大模型的能力越来越强,参数规模和部署成本也在不断增长。显存占用高、推理速度慢、硬件成本高,正在成为大模型真正落地时绕不开的问题。
为什么同一个模型可以从 FP16 量化到 INT2,甚至更低比特?量化之后,模型的速度、显存占用和效果会发生什么变化?面对不同模型、任务和硬件,又该如何选择合适的量化方案?
低比特量化并不是简单地“把数字变小”,而是在模型能力、推理速度、显存占用与部署成本之间寻找平衡。
本次免费线上公开课将从低比特量化的核心原理出发,系统梳理大模型量化的主要技术路线、代表性方法与工程挑战,并介绍 INT4、INT2 及更低比特量化、混合精度、向量量化等前沿方向。
既讲清底层逻辑,也关注真实部署中的方法选择,帮助你建立对大模型低比特量化的整体认识。
正在学习人工智能、大模型或深度学习相关内容
对大模型推理优化与高效部署感兴趣
接触过 GPTQ、AWQ、SmoothQuant 等方法,但缺少系统理解
想弄清不同量化方法的区别和适用场景
正在关注大模型显存占用、推理速度和部署成本
希望了解低比特量化技术的前沿发展方向
无需具备量化经验,了解基础的深度学习或大模型概念即可参加。
1. 为什么大模型需要低比特量化?
大模型面临的计算、存储与显存瓶颈
模型精度、推理速度与部署成本之间的关系
从 FP16 到 INT2,模型究竟发生了什么变化
2. 低比特量化的核心原理
量化与反量化的基本过程
量化粒度、缩放因子与零点
对称量化与非对称量化
量化误差从哪里产生
3. 主流量化方法与技术路线
训练后量化与量化感知训练
仅权重量化与权重—激活量化
GPTQ、AWQ、SmoothQuant 等代表性方法
不同量化方法的特点与适用场景
4. 量化中的关键挑战
异常值为什么会影响量化效果
校准数据应该如何选择
如何减少量化带来的模型能力损失
算法效果与硬件支持之间的差异
如何平衡精度、速度、显存和部署成本
5. 前沿进展与未来趋势
INT4、INT2 及更低比特量化
混合精度与自适应量化
向量量化与前沿趋势
量化与模型微调的结合
国产 GPU 适配与软硬件协同优化
一套完整框架:理解低比特量化为什么有效,以及它解决了哪些问题
一张方法地图:理清不同量化路线、代表性方法及其适用场景
一个工程视角:从模型效果、显存、速度、成本和硬件条件综合评估量化方案
一份前沿认知:了解大模型低比特量化正在向哪些方向发展
刘老师|算法工程师
长期从事大模型推理加速与高效部署相关工作,专注于模型量化、稀疏化、压缩及国产 GPU 适配,具备从算法研发、模型微调到部署与性能测试的完整实践经验,并拥有多项人工智能相关论文及发明专利成果。
🗓 活动日期: 9月17日
⏰ 北京时间: 17:00–18:00
⏰ 悉尼时间: 19:00–20:00
💻 活动形式: 免费线上公开课
🎤 主讲老师: 刘老师
💰 活动费用: 免费 · 报名制
👉 立即免费报名,一起读懂大模型如何跑得更快、更省
获取最新 AI 活动 / Workshop / Meetup 通知,邮箱可随时退订。
按城市、方向和活动类型找下一场 Workshop、Meetup 或直播。


我们很自豪能够与一些全球最具影响力的科技和商业公司建立合作。这些合作伙伴关系展现了我们对卓越与创新的承诺,并为我们的学员提供了接触Professional Networking, 真实项目, 实习机会, 就业机会以及前沿技术的宝贵机会。