斯坦福大学老师讲课

机器之心报道

编辑:Panda

斯坦福大学 2025 年春季的 CS336 课程「从头开始创造语言模型(Language Models from Scratch)」相关课程和材料现已在网上全面发布!

课程视频:https://www.youtube.com/watch?v=SQ3fZ1sAqXI&list=PLoROMvodv4rOY23Y0BoGoBGgQ1zmU_MT_课程主页:https://stanford-cs336.github.io/spring2025/

这是该课程的教职工阵容:

其中,讲师 Tatsunori Hashimoto 现为斯坦福大学计算机科学系助理教授。此前,他是斯坦福大学 John C. Duchi 和 Percy Liang 的博士后,研究机器学习模型平均性能和最差性能之间的权衡。在博士后研究之前,他在麻省理工学院攻读研究生,导师是 Tommi Jaakkola 和 David Gifford。他本科在哈佛大学学习统计学和数学,导师是 Edoardo Airoldi。他的研究成果已总计获得了超 3 万引用。

另一位讲师 Percy Liang 是斯坦福大学计算机科学系副教授,同时也是基础模型研究中心(CRFM)主任,同时也有参与以人类为中心的人工智能(HAI)、人工智能实验室、自然语言处理研究组和机器学习研究组等的研究工作。他本科毕业于 MIT,之后在该校获得工程学硕士学位,导师是 Michael Collins;之后,他在伯克利获得博士学位,导师是 Michael Jordan 和 Dan Klein;后来他进入谷歌从事博士后研究。Percy Liang 是一位引用量超过 10 万的研究大牛,我们此前也曾多次报道他的研究成果。

CS336 课程简介

CS336 课程的目标是「引导学生完成开发自己的语言模型的整个过程,从而帮助他们全面理解语言模型。」该课程借鉴了操作系统课程中从零开始创建完整操作系统的教学方法,引导学生完成语言模型创建的各个环节,包括预训练的数据收集和清理、Transformer 模型的构建、模型训练以及部署前的评估。

该课程包含 5 个单元,分别是基础、系统、扩展、数据、对齐和推理强化学习。

该课程也非常注重实践操作,因此也需要相当多的学习和开发时间。Percy Liang 也在 上简单分享了学生需要实践的内容,包括:

作业 1(使基本流程正常运行):实现 BPE 分词器、Transformer 架构、Adam 优化器,并在 TinyStories 和 OpenWebText 上训练模型。只允许使用 PyTorch 原语(不能直接调用 torch. nn. Transformer 或 torch. nn. Linear)。作业 2(让 GPU 运行起来):在 Triton 中实现 Flash Attention 2、分布式数据并行 + 优化器分片。作业 3(Scaling Law):使用 IsoFLOP 拟合 Scaling Law。为了模拟训练运行的高风险,学生会获得一个训练 API [超参数→损失] 和一个固定的计算预算,并且必须选择提交哪些运行来收集数据点。在后台,训练 API 是通过在一系列预先计算的运行之间进行插值来支持的。作业 4(数据):将 Common Crawl HTML 转换为文本,过滤(质量、有害内容、PII),删除重复数据。这是一项苦差事,却没有得到足够的重视。作业 5(对齐):实现监督微调、专家迭代、GRPO 和变体,在 Qwen 2.5 Math 1.5B 上运行 RL 以提升在 MATH 上的指标。我们也曾考虑过让学生自己实现推理(inference),但决定(可能是明智的)让人们使用 vllm。

更具体来说,CS336 课程的 5 个单元包含 19 门课。这里简单总结了该课程的目录,你可以在课程主页下载相应的材料:

课程概述和 token 化PyTorch 和资源(包括内存和计算资源)架构与超参数混合专家(MoE)GPUKernel,Triton并行化并行化Scaling Law推理Scaling Law评估数据数据对齐 ——SFT/RLHF对齐 —— 强化学习对齐 —— 强化学习客座讲座:阿里巴巴达摩院研究员、Qwen 团队技术负责人 Junyang Lin(林俊旸)客座讲座:Facebook AI 研究科学家、Llama 3 预训练负责人 Mike Lewis

另外,在考虑学习这门课程之前,你应该先具备以下能力:

熟练掌握 Python:大部分课程作业将使用 Python 完成。与大多数其他 AI 课程不同,本课程只会给学生提供极少的脚手架。你编写的代码量将至少比其他课程多一个数量级。因此,熟练掌握 Python 和软件工程至关重要。有深度学习和系统优化经验:本课程的很大一部分内容是关于如何使神经语言模型在多台机器的 GPU 上快速高效地运行。我们希望学生能够熟练掌握 PyTorch,并了解内存层次结构等基本系统概念。大学微积分、线性代数(例如 MATH 51、CME 100):你应该能够轻松理解矩阵 / 向量符号和运算。基础概率与统计(例如 CS 109 或同等课程):你应该了解概率、高斯分布、均值、标准差等基础知识。机器学习(例如 CS221、CS229、CS230、CS124、CS224N):你应该熟悉机器学习和深度学习的基础知识。

顺带一提,CS336 课程还为完成课程的学生赠送了纪念 T 恤,有如下 4 种图案。你觉得如何呢?

声明:壹贝网所有作品(图文、音视频)均由用户自行上传分享,仅供网友学习交流,版权归原作者wangteng@admin所有,原文出处。若您的权利被侵害,请联系 756005163@qq.com 删除。

本文链接:https://www.ebaa.cn/49784.html

(0)
上一篇 2025年8月7日
下一篇 2025年8月7日

相关推荐

  • 新加坡国立大学中外合作

    QS世界大学排名(QS World University Rankings)是由英国一家国际教育市场咨询公司Quacquarelli Symonds(简称QS)所发表的年度世界大学排名。 QS公司最初与泰晤士高等教育(简称THE)合作,共同推出《THE-QS世界大学排名》,首次发布于2004年,是相对较早的全球大学排名;2010年起,QS和THE终止合作,两…

    2024年9月24日
  • 庆熙大学插班生入学条件

    01学校简介 韩国庆熙大学 (Kyung Hee University) 是韩国著名的私立研究型大学之一,创立于1949年,位于首尔市东北部。庆熙大学是一所以研究为中心的大学,拥有全球领先的研究机构和学术中心,包括全球领先的细胞生物学中心、能源与环境研究所、东亚研究所等。 建校以来,庆熙一直以学术和实践融合为学识传统,致力于追求普遍与共存的价值观。1965年…

    2025年8月18日
  • oa图书馆

    www.oalib.com OA图书馆是Open Access图书馆的简称。OALib是一个集合开源论文的数据库,囊括2,011,936余篇学术论文供读者免费查阅或下载。此数据库囊括的文章数量会不断增加。我们的使命是向全世界的学者提供免费的学术研究论文。OALib除了可以搜索文章,还提供以下服务:出版文章、论文检索以及论文存储。

    2023年10月31日
  • 帝国理工大学世界排名

    在不久前发布的2026QS世界大学排名中,帝国理工学院连续两年位居全球第2! 而近期,帝国理工学院近日宣布成立四所跨学科融合科学学院,以“打破学科壁垒、聚焦社会”为使命,将知识整合推向全新高度。 图源 | 帝国理工学院 01 帝国理工全新布局四大融合学院 近日,帝国理工宣布成立“融合科学学院”(Schools of Convergence Science),…

    2025年10月27日
  • 密歇根大学接受高考成绩吗

    高考后为何选择密歇根大学密歇根大学的综合优势 密歇根大学(University of Michigan)是一所位于美国密歇根州的公立常春藤大学,成立于1817年,历史悠久且享有盛誉。它不仅是美国前十的综合型公立大学之一,也在世界范围内享有很高的学术声誉。密歇根大学在多个领域都排名靠前,特别是在商科、法学、工程、医学等领域表现优异。此外,它的校友网络也非常强大…

    2025年3月3日
  • 齐鲁师范学院值得上吗_齐鲁师范学院值得上吗知乎

    视频加载中… 记者 徐宁 岳致呈 后期 路董萌 齐鲁晚报·齐鲁壹点主办的2023年山东规模最大的专科场高考招生咨询会7月15日上午在济南高新区国际会展中心举行,200余家省内外高校现场为考生及家长解疑答惑。齐鲁师范学院专科招生计划为1700人,普通专科最低录取分数线为457分。需要说明的是,预估分数线为高校提供,报考影响因素变量较多,数据为预估,…

    2024年3月9日
  • 世界学校排名榜

    这次有个有关高校顶尖人才规模的榜单,把我们大学放在新的视角比较一下,这个榜单只算中国的内地高校。它统计的是每个学校公认被国际学术界广泛认可的、有代表性的顶尖科研人员数量。用这种方法看院校,能够更直观看到谁在搞出大成果和影响上更有重量,在这里还可以看出一所学校的整体人才培养能力和学科带动水平如何。 这份榜单是“高绩”发的,数据来源有三种情况:科睿唯安全球高被引…

    2025年11月19日
  • 辛辛那提大学吧

    辛辛那提大学(University of Cincinnati)成立于1819年,是美国第二古老的公立学府。普林斯顿评论(Princeton Review) 评选辛辛那提大学为中西部最好的公立大学。据《耶鲁大学日报大学指南》指出,大学的商科学院规模最大,最多学生入读,声誉良好,不过录取颇为严格。 辛辛那提大学教学资源 美国的带薪实习项目(Cooperativ…

    2023年10月8日
  • 美国阿肯色州立大学世界排名

    视频加载中… 当地时间12月8日(周四),美国媒体报道称,阿肯色州(Arkansas)的一座东部小城选出了该国有史以来最年轻的市长——一名18岁的大学新生。 周二,非裔美国人杰伦·史密斯(Jaylen Smith)在第二轮选举中当选为厄尔市(Earle)市长。非正式投票结果显示,史密斯赢得了235张选票,而他的竞争对手奈米·马修斯(Nemi Ma…

    2023年11月29日
  • 伦敦大学学院博士申请条件

    #留学# 凌晨两点,伦敦Bloomsbury的街道还亮着灯。学生们拖着电脑和书包从图书馆里走出来,有人刚写完一篇数学证明,有人还在对着建筑作品集皱眉。你能清楚感觉到:这不是一座普通的大学,这是伦敦大学学院UCL。 这所1826年建校的公立研究型大学,如今在2026年QS世界大学排名中位列全球第9,稳居英国第4。和牛津、剑桥、帝国理工、LSE并称“G5超级精英…

    2025年10月28日

联系我们

400-800-8888

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信