大模型如何跑得更快、更省? 低比特量化的原理、方法与前沿进展

大模型如何跑得更快、更省? 低比特量化的原理、方法与前沿进展

匠人
主办方: 匠人学院
活动时间09月17日 (Thu) 17:00 - 19:00 北京时间
活动地点线上活动
活动类型线上活动

活动介绍

低比特量化的原理、方法与前沿进展

大模型的能力越来越强,参数规模和部署成本也在不断增长。显存占用高、推理速度慢、硬件成本高,正在成为大模型真正落地时绕不开的问题。

为什么同一个模型可以从 FP16 压缩到 INT8、INT4,甚至更低比特?量化之后,模型的速度、显存占用和效果会发生什么变化?面对不同模型、任务和硬件,又该如何选择合适的量化方案?

低比特量化并不是简单地“把数字变小”,而是在模型能力、推理速度、显存占用与部署成本之间寻找平衡。

本次免费线上公开课将从低比特量化的核心原理出发,系统梳理大模型量化的主要技术路线、代表性方法与工程挑战,并介绍 4-bit 及以下量化、混合精度、KV Cache 量化等前沿方向。

既讲清底层逻辑,也关注真实部署中的方法选择,帮助你建立对大模型低比特量化的整体认识。

🎯 这场公开课适合你,如果你——

  • 正在学习人工智能、大模型或深度学习相关内容

  • 对大模型推理优化与高效部署感兴趣

  • 接触过 GPTQ、AWQ、SmoothQuant 等方法,但缺少系统理解

  • 想弄清不同量化方法的区别和适用场景

  • 正在关注大模型显存占用、推理速度和部署成本

  • 希望了解低比特量化技术的最新发展方向

无需具备量化经验,了解基础的深度学习或大模型概念即可参加。

💡 本场分享内容

1. 为什么大模型需要低比特量化?

  • 大模型面临的计算、存储与显存瓶颈

  • 模型精度、推理速度与部署成本之间的关系

  • 从 FP16、INT8 到 INT4,模型究竟发生了什么变化

2. 低比特量化的核心原理

  • 量化与反量化的基本过程

  • 量化粒度、缩放因子与零点

  • 对称量化与非对称量化

  • 量化误差从哪里产生

3. 主流量化方法与技术路线

  • 训练后量化与量化感知训练

  • 仅权重量化与权重—激活量化

  • GPTQ、AWQ、SmoothQuant 等代表性方法

  • 不同量化方法的特点与适用场景

4. 量化中的关键挑战

  • 异常值为什么会影响量化效果

  • 校准数据应该如何选择

  • 如何减少量化带来的模型能力损失

  • 算法效果与硬件支持之间的差异

  • 如何平衡精度、速度、显存和部署成本

5. 前沿进展与未来趋势

  • 4-bit 及更低比特量化

  • 混合精度与自适应量化

  • KV Cache 量化与长上下文推理优化

  • 量化与模型微调的结合

  • 国产 GPU 适配与软硬件协同优化

🏆 你将获得

  • 一套完整框架:理解低比特量化为什么有效,以及它解决了哪些问题

  • 一张方法地图:理清不同量化路线、代表性方法及其适用场景

  • 一个工程视角:从模型效果、显存、速度、成本和硬件条件综合评估量化方案

  • 一份前沿认知:了解大模型低比特量化正在向哪些方向发展

🎤 主讲老师

刘老师|算法工程师

长期从事大模型推理加速与高效部署相关工作,专注于模型量化、稀疏化、压缩、KV Cache 优化及国产 GPU 适配,具备从算法研发、模型微调到部署与性能测试的完整实践经验,并拥有多项人工智能相关论文及发明专利成果。

📌 活动信息

🗓 活动时间: 9月17日
北京时间: 17:00-19:00
悉尼时间19:00-21:00
💻 活动形式: 免费线上公开课
🎤 主讲老师: 刘老师
💰 活动费用: 免费 · 报名制

👉 立即免费报名,一起读懂大模型如何跑得更快、更省。

活动讨论

大模型如何跑得更快、更省? 低比特量化的原理、方法与前沿进展
线上活动讲座meetup

大模型如何跑得更快、更省? 低比特量化的原理、方法与前沿进展

低比特量化的原理、方法与前沿进展 大模型的能力越来越强,参数规模和部署成本也在不断增长。显存占用高、推理速度慢、硬件成本高,正在成为大模型真正落地时绕不开的问题。 为什么同一个模型可以从 FP16 压缩到 INT8、INT4,甚至更低比特?…

2026年9月17日 (周四)17:00 - 19:00 北京时间
线上参与
1 / 100已报名

低比特量化的原理、方法与前沿进展

大模型的能力越来越强,参数规模和部署成本也在不断增长。显存占用高、推理速度慢、硬件成本高,正在成为大模型真正落地时绕不开的问题。

为什么同一个模型可以从 FP16 压缩到 INT8、INT4,甚至更低比特?量化之后,模型的速度、显存占用和效果会发生什么变化?面对不同模型、任务和硬件,又该如何选择合适的量化方案?

低比特量化并不是简单地“把数字变小”,而是在模型能力、推理速度、显存占用与部署成本之间寻找平衡。

本次免费线上公开课将从低比特量化的核心原理出发,系统梳理大模型量化的主要技术路线、代表性方法与工程挑战,并介绍 4-bit 及以下量化、混合精度、KV Cache 量化等前沿方向。

既讲清底层逻辑,也关注真实部署中的方法选择,帮助你建立对大模型低比特量化的整体认识。

🎯 这场公开课适合你,如果你——

  • 正在学习人工智能、大模型或深度学习相关内容

  • 对大模型推理优化与高效部署感兴趣

  • 接触过 GPTQ、AWQ、SmoothQuant 等方法,但缺少系统理解

  • 想弄清不同量化方法的区别和适用场景

  • 正在关注大模型显存占用、推理速度和部署成本

  • 希望了解低比特量化技术的最新发展方向

无需具备量化经验,了解基础的深度学习或大模型概念即可参加。

💡 本场分享内容

1. 为什么大模型需要低比特量化?

  • 大模型面临的计算、存储与显存瓶颈

  • 模型精度、推理速度与部署成本之间的关系

  • 从 FP16、INT8 到 INT4,模型究竟发生了什么变化

2. 低比特量化的核心原理

  • 量化与反量化的基本过程

  • 量化粒度、缩放因子与零点

  • 对称量化与非对称量化

  • 量化误差从哪里产生

3. 主流量化方法与技术路线

  • 训练后量化与量化感知训练

  • 仅权重量化与权重—激活量化

  • GPTQ、AWQ、SmoothQuant 等代表性方法

  • 不同量化方法的特点与适用场景

4. 量化中的关键挑战

  • 异常值为什么会影响量化效果

  • 校准数据应该如何选择

  • 如何减少量化带来的模型能力损失

  • 算法效果与硬件支持之间的差异

  • 如何平衡精度、速度、显存和部署成本

5. 前沿进展与未来趋势

  • 4-bit 及更低比特量化

  • 混合精度与自适应量化

  • KV Cache 量化与长上下文推理优化

  • 量化与模型微调的结合

  • 国产 GPU 适配与软硬件协同优化

🏆 你将获得

  • 一套完整框架:理解低比特量化为什么有效,以及它解决了哪些问题

  • 一张方法地图:理清不同量化路线、代表性方法及其适用场景

  • 一个工程视角:从模型效果、显存、速度、成本和硬件条件综合评估量化方案

  • 一份前沿认知:了解大模型低比特量化正在向哪些方向发展

🎤 主讲老师

刘老师|算法工程师

长期从事大模型推理加速与高效部署相关工作,专注于模型量化、稀疏化、压缩、KV Cache 优化及国产 GPU 适配,具备从算法研发、模型微调到部署与性能测试的完整实践经验,并拥有多项人工智能相关论文及发明专利成果。

📌 活动信息

🗓 活动时间: 9月17日
北京时间: 17:00-19:00
悉尼时间19:00-21:00
💻 活动形式: 免费线上公开课
🎤 主讲老师: 刘老师
💰 活动费用: 免费 · 报名制

👉 立即免费报名,一起读懂大模型如何跑得更快、更省。

适合谁学习

💼
想用 AI 提效的职场人
把 ChatGPT、Claude、Cursor 真正用进日常工作,而不只是听个热闹
🎓
留学生与应届生
提前看清行业在招什么、技能差在哪,少走半年弯路
🚀
转行与求职者
对照真实岗位要求补齐能力,拿到能写进简历的作品

订阅活动更新

获取最新 AI 活动 / Workshop / Meetup 通知,邮箱可随时退订。

免费
免费活动
1 / 100 人已报名1%
👑 开通会员享更多权益 →
活动时间09月17日 (Thu) 17:00 北京时间
活动地点线上活动
剩余名额99 / 100
活动类型线上活动
或者

活动信息

活动类型线上活动
活动费用免费

已报名参与 (1)

1 位同学已报名

快捷操作

活动保障

检票入场,实名核验
真实讲师,现场授课
活动结束后可评分反馈
开放问答互动环节

活动发起方

JR
JR Academy
澳洲 IT 职业培训机构

继续看 AI 活动

按城市、方向和活动类型找下一场 Workshop、Meetup 或直播。

浏览全部活动
添加日历

Partnership

我们很自豪能够与一些全球最具影响力的科技和商业公司建立合作。这些合作伙伴关系展现了我们对卓越与创新的承诺,并为我们的学员提供了接触Professional Networking, 真实项目, 实习机会, 就业机会以及前沿技术的宝贵机会。

Atlassian - 匠人学院合作企业Canva - 匠人学院合作企业Amazon - 匠人学院合作企业Deloitte - 匠人学院合作企业