LLM¶
大语言模型正在进入我们的现代生活:从搜索问答、内容创作与代码开发,到科研辅助、日常办公和各类智能体系统,它正在改变我们获取信息、解决问题和与世界交互的方式。这些能力背后,一个大语言模型究竟如何理解和生成语言?它又是怎样从“预测下一个词”,逐渐成为能够遵循指令、调用知识并完成复杂任务的通用模型?
在本节课程中,我们将沿着一条完整的技术链路走进大语言模型:从文本如何被切分为 Token,到 Transformer 如何处理上下文;从海量数据上的预训练,到sft、opd与rl等后训练方法,再到模型如何在推理阶段生成答案,并进一步连接工具与智能体系统。同时,我们也将概览大模型能力的来源与边界,理解幻觉、效率、评测、安全和可解释性等关键问题。
完成本次课程后,同学们将对大语言模型的数据、架构、训练、推理、对齐、评测与应用形成一张知识地图,理解现代 LLM 从数据走向智能系统的过程,并初步认识模型研究、系统优化、智能体、可解释性与 AI 应用等不同方向。
课程材料¶
学习资源¶
评论
作者: