大模型的能力越来越强,参数规模和部署成本也在不断增长。显存占用高、推理速度慢、硬件成本高,正在成为大模型真正落地时绕不开的问题。
为什么同一个模型可以从 FP16 压缩到 INT8、INT4,甚至更低比特?量化之后,模型的速度、显存占用和效果会发生什么变化?面对不同模型、任务和硬件,又该如何选择合适的量化方案?
低比特量化并不是简单地“把数字变小”,而是在模型能力、推理速度、显存占用与部署成本之间寻找平衡。
本次免费线上公开课将从低比特量化的核心原理出发,系统梳理大模型量化的主要技术路线、代表性方法与工程挑战,并介绍 4-bit 及以下量化、混合精度、KV Cache 量化等前沿方向。
既讲清底层逻辑,也关注真实部署中的方法选择,帮助你建立对大模型低比特量化的整体认识。
正在学习人工智能、大模型或深度学习相关内容
对大模型推理优化与高效部署感兴趣
接触过 GPTQ、AWQ、SmoothQuant 等方法,但缺少系统理解
想弄清不同量化方法的区别和适用场景
正在关注大模型显存占用、推理速度和部署成本
希望了解低比特量化技术的最新发展方向
无需具备量化经验,了解基础的深度学习或大模型概念即可参加。
1. 为什么大模型需要低比特量化?
大模型面临的计算、存储与显存瓶颈
模型精度、推理速度与部署成本之间的关系
从 FP16、INT8 到 INT4,模型究竟发生了什么变化
2. 低比特量化的核心原理
量化与反量化的基本过程
量化粒度、缩放因子与零点
对称量化与非对称量化
量化误差从哪里产生
3. 主流量化方法与技术路线
训练后量化与量化感知训练
仅权重量化与权重—激活量化
GPTQ、AWQ、SmoothQuant 等代表性方法
不同量化方法的特点与适用场景
4. 量化中的关键挑战
异常值为什么会影响量化效果
校准数据应该如何选择
如何减少量化带来的模型能力损失
算法效果与硬件支持之间的差异
如何平衡精度、速度、显存和部署成本
5. 前沿进展与未来趋势
4-bit 及更低比特量化
混合精度与自适应量化
KV Cache 量化与长上下文推理优化
量化与模型微调的结合
国产 GPU 适配与软硬件协同优化
一套完整框架:理解低比特量化为什么有效,以及它解决了哪些问题
一张方法地图:理清不同量化路线、代表性方法及其适用场景
一个工程视角:从模型效果、显存、速度、成本和硬件条件综合评估量化方案
一份前沿认知:了解大模型低比特量化正在向哪些方向发展
刘老师|算法工程师
长期从事大模型推理加速与高效部署相关工作,专注于模型量化、稀疏化、压缩、KV Cache 优化及国产 GPU 适配,具备从算法研发、模型微调到部署与性能测试的完整实践经验,并拥有多项人工智能相关论文及发明专利成果。
🗓 活动时间: 9月17日
北京时间: 17:00-19:00
悉尼时间19:00-21:00
💻 活动形式: 免费线上公开课
🎤 主讲老师: 刘老师
💰 活动费用: 免费 · 报名制
👉 立即免费报名,一起读懂大模型如何跑得更快、更省。
低比特量化的原理、方法与前沿进展 大模型的能力越来越强,参数规模和部署成本也在不断增长。显存占用高、推理速度慢、硬件成本高,正在成为大模型真正落地时绕不开的问题。 为什么同一个模型可以从 FP16 压缩到 INT8、INT4,甚至更低比特?…
大模型的能力越来越强,参数规模和部署成本也在不断增长。显存占用高、推理速度慢、硬件成本高,正在成为大模型真正落地时绕不开的问题。
为什么同一个模型可以从 FP16 压缩到 INT8、INT4,甚至更低比特?量化之后,模型的速度、显存占用和效果会发生什么变化?面对不同模型、任务和硬件,又该如何选择合适的量化方案?
低比特量化并不是简单地“把数字变小”,而是在模型能力、推理速度、显存占用与部署成本之间寻找平衡。
本次免费线上公开课将从低比特量化的核心原理出发,系统梳理大模型量化的主要技术路线、代表性方法与工程挑战,并介绍 4-bit 及以下量化、混合精度、KV Cache 量化等前沿方向。
既讲清底层逻辑,也关注真实部署中的方法选择,帮助你建立对大模型低比特量化的整体认识。
正在学习人工智能、大模型或深度学习相关内容
对大模型推理优化与高效部署感兴趣
接触过 GPTQ、AWQ、SmoothQuant 等方法,但缺少系统理解
想弄清不同量化方法的区别和适用场景
正在关注大模型显存占用、推理速度和部署成本
希望了解低比特量化技术的最新发展方向
无需具备量化经验,了解基础的深度学习或大模型概念即可参加。
1. 为什么大模型需要低比特量化?
大模型面临的计算、存储与显存瓶颈
模型精度、推理速度与部署成本之间的关系
从 FP16、INT8 到 INT4,模型究竟发生了什么变化
2. 低比特量化的核心原理
量化与反量化的基本过程
量化粒度、缩放因子与零点
对称量化与非对称量化
量化误差从哪里产生
3. 主流量化方法与技术路线
训练后量化与量化感知训练
仅权重量化与权重—激活量化
GPTQ、AWQ、SmoothQuant 等代表性方法
不同量化方法的特点与适用场景
4. 量化中的关键挑战
异常值为什么会影响量化效果
校准数据应该如何选择
如何减少量化带来的模型能力损失
算法效果与硬件支持之间的差异
如何平衡精度、速度、显存和部署成本
5. 前沿进展与未来趋势
4-bit 及更低比特量化
混合精度与自适应量化
KV Cache 量化与长上下文推理优化
量化与模型微调的结合
国产 GPU 适配与软硬件协同优化
一套完整框架:理解低比特量化为什么有效,以及它解决了哪些问题
一张方法地图:理清不同量化路线、代表性方法及其适用场景
一个工程视角:从模型效果、显存、速度、成本和硬件条件综合评估量化方案
一份前沿认知:了解大模型低比特量化正在向哪些方向发展
刘老师|算法工程师
长期从事大模型推理加速与高效部署相关工作,专注于模型量化、稀疏化、压缩、KV Cache 优化及国产 GPU 适配,具备从算法研发、模型微调到部署与性能测试的完整实践经验,并拥有多项人工智能相关论文及发明专利成果。
🗓 活动时间: 9月17日
北京时间: 17:00-19:00
悉尼时间19:00-21:00
💻 活动形式: 免费线上公开课
🎤 主讲老师: 刘老师
💰 活动费用: 免费 · 报名制
👉 立即免费报名,一起读懂大模型如何跑得更快、更省。
获取最新 AI 活动 / Workshop / Meetup 通知,邮箱可随时退订。
按城市、方向和活动类型找下一场 Workshop、Meetup 或直播。


我们很自豪能够与一些全球最具影响力的科技和商业公司建立合作。这些合作伙伴关系展现了我们对卓越与创新的承诺,并为我们的学员提供了接触Professional Networking, 真实项目, 实习机会, 就业机会以及前沿技术的宝贵机会。