版本 M2-AI-REV-003 · 版本记录时间(UTC)2026-09-10T15:19:07.669733Z
人工智能:问题、学习与使用
六节选择性阅读路线,技术事件至2025年,并纳入2026年报告的指标口径。不是完整AI史,不声明截至2026年9月的全球覆盖。 内容截至(编校核对,UTC):2026-09-10T17:15:14Z
机器能思考吗
1950年,艾伦·图灵在论文开头追问机器能否思考,继而把起始问题转向模仿游戏:提问者辨认隐藏的参与者。这样,问题有了参与者、交流方式和判断任务。读者可以追问这些安排是否合适,也可以讨论一次表现究竟说明什么。哲学疑问由此进入一个更具体的讨论场景。
查看本段来源与事件日期
来源:M2-AI-C01 · Computing Machinery and Intelligence
事件:AI-E01 · 图灵把问题移到模仿游戏 · 起:1950-10;止:1950-10(月精度;状态:已报告);日期含义:发表日期;说明:日期表示材料发表时间。
1955年8月31日,一份达特茅斯夏季研究提案把学习、语言、抽象和自我改进列为机器智能的研究问题,计划在下一年夏天组织项目。这份文件留下了研究者希望共同处理的议程。提案的日期、设想中的项目时间和后来实际取得的成果,是三件需要分别核对的事;文件本身首先让人看见的是当时提出了哪些问题。
查看本段来源与事件日期
来源:M2-AI-A01 · A Proposal for the Dartmouth Summer Research Project on Artificial Intelligence
事件:AI-E02 · 达特茅斯研究计划提出 · 起:1955-08-31;止:1955-08-31(日精度;状态:已报告);日期含义:提案日期;说明:日期表示提案文件日期。
把图灵的文章与这份提案放在一起,便能看见两种不同的工作:一种是把“机器能思考吗”问得更具体,另一种是把语言、学习等问题分出来,安排研究。这里采用的是一条从提问走向研究任务的阅读路线。两份材料各自留下了可继续争论的选择;它们还不足以解释后来几十年间所有方法的来路。
查看本段来源与事件日期
来源:M2-AI-A01 · A Proposal for the Dartmouth Summer Research Project on Artificial Intelligence;M2-AI-C01 · Computing Machinery and Intelligence
事件:AI-E01 · 图灵把问题移到模仿游戏 · 起:1950-10;止:1950-10(月精度;状态:已报告);日期含义:发表日期;说明:日期表示材料发表时间。;AI-E02 · 达特茅斯研究计划提出 · 起:1955-08-31;止:1955-08-31(日精度;状态:已报告);日期含义:提案日期;说明:日期表示提案文件日期。
知识、评估与学习
费根鲍姆的斯坦福作者馆藏书目列有1968年的《Heuristic DENDRAL:在有机化学中生成解释性假说的程序》,署名为费根鲍姆、萨瑟兰和布坎南。该馆藏中的参与者回顾进一步描述,DENDRAL材料把知识库与生成、评估候选的过程分开呈现。这为理解知识系统怎样组织领域知识提供了线索。回顾没有核定发表年代中的每项实现细节,仍须与当时论文对照。
查看本段来源与事件日期
来源:M2-AI-C02 · Heuristic DENDRAL: A Program for Generating Explanatory Hypotheses in Organic Chemistry;M2-AI-G01 · EAF's Personal Commentary
事件:AI-E03 · DENDRAL有机化学论文见于作者书目 · 起:1968;止:1968(年精度;状态:已报告);日期含义:书目发表日期;说明:日期表示书目所列发表时间。
谁来判断一个研究方向值得多少支持,同样进入了这段历史。Lighthill报告现存文本标注1972年7月;其引言说明,评估受托为英国科学研究委员会审视AI研究资助申请提供参考。作者把意见界定为有限研究和咨询后形成的个人看法。这里可以辨认一次具体的资助评估,以及评估者自己划出的范围。仅凭这份引言,尚不能把整个世界的研究起伏概括成一个共同的“寒冬”。
查看本段来源与事件日期
来源:M2-AI-C03 · Artificial Intelligence: A General Survey
事件:AI-E04 · Lighthill报告写下资助评估的范围 · 起:1972-07;止:1972-07(月精度;状态:已报告);日期含义:文献日期;说明:日期表示文件日期。
1986年,鲁梅尔哈特、辛顿和威廉斯的论文说明了一种学习程序:调整网络连接的权重,减小实际输出与目标输出之间的差别。作者描述,在这个过程中,中间的隐藏单元可以形成与任务有关的表示。对普通读者而言,可以先抓住这一点:训练除了调整最后的答案,也可能改变网络内部怎样表示输入。论文讨论的是分层网络和具体方法,不据此判定机器已经理解世界。
查看本段来源与事件日期
来源:M2-AI-C04 · Learning representations by back-propagating errors;M2-AI-G02 · Learning representations by back-propagating errors
事件:AI-E05 · 反向传播论文说明权重与表示学习 · 起:1986-10-09;止:1986-10-09(日精度;状态:已报告);日期含义:发表日期;说明:日期表示材料发表时间。
让结果可以比较
1997年的一场棋赛给出了鲜明的比较。按IBM后来的历史回顾,深蓝在六局系列赛中战胜卡斯帕罗夫。棋盘上的胜负提供了一个清楚的结果,也留下了关于结果边界的问题:这里完成的是一项有规则的棋类对抗,距离评价机器在其他事情上的表现,还需要别的证据。本节所用的是企业回顾,独立赛事记录尚待补入。
查看本段来源与事件日期
来源:M2-AI-B02 · The games that helped AI evolve
事件:AI-E06 · 深蓝与卡斯帕罗夫的六局对抗 · 起:1997;止:1997(年精度;状态:已报告);日期含义:回顾记载的事件日期;说明:日期来自回顾性材料对事件的记载。
2009年的ImageNet论文把材料组织的问题摆到读者面前:作者以WordNet的类别结构安排图像,介绍了涉及Amazon Mechanical Turk的收集方案。这让我们在读算法成绩之前,先问一组关于材料的问题:类别怎样划分,图像怎样选入,标注怎样完成。论文首页为这些问题提供了入口,尚不能替代对具体收集和标注过程的核查;论文所列的当时规模,也不代表数据集往后的每个版本。
查看本段来源与事件日期
来源:M2-AI-B03 · ImageNet: A Large-Scale Hierarchical Image Database
事件:AI-E07 · ImageNet论文提出图像数据组织 · 起:2009;止:2009(年精度;状态:已报告);日期含义:发表日期;说明:日期表示材料发表时间。
2012年的AlexNet论文摘要报告了深层卷积神经网络在ImageNet分类中的实验,并介绍GPU参与训练。把这篇论文接在数据集之后阅读,可以同时看见网络、训练材料和计算设备。它们共同组成了一次实验的条件。分类成绩究竟能推广到哪些图像、哪些任务,还需要分别验证;这里保留论文所报告的方法,不把单次评测扩展成对所有视觉问题的结论。
查看本段来源与事件日期
来源:M2-AI-A06 · ImageNet Classification with Deep Convolutional Neural Networks
事件:AI-E08 · AlexNet论文报告深层卷积网络实验 · 起:2012;止:2012(年精度;状态:已报告);日期含义:发表日期;说明:日期表示材料发表时间。
2016年1月的AlphaGo论文将策略网络、价值网络与蒙特卡洛树搜索结合,训练涉及专家棋谱和自我对弈。作者报告,程序以5比0战胜欧洲围棋冠军。这是论文当时报告的对抗,日期与对象均须保留,不能写成后来与李世石的比赛。读到这里,可以看到同样是下棋,程序组合的方法和训练材料仍有需要分别说明的历史。
查看本段来源与事件日期
来源:M2-AI-B04 · Mastering the game of Go with deep neural networks and tree search
事件:AI-E09 · AlphaGo论文报告欧洲冠军对局 · 起:2016-01;止:2016-01(月精度;状态:已报告);日期含义:发表日期;说明:日期表示材料发表时间。
语言任务的共同底座
2017年6月首次提交的Transformer论文提出了一种完全基于注意力机制的架构,去掉所述的循环和卷积结构,并报告两个机器翻译任务的实验。它在这条阅读路线中留下一个架构节点:语言处理的方法怎样组织,成为可以明确描述和比较的问题。此处依据最初提交的摘要,保留它原来处理的任务范围。
查看本段来源与事件日期
来源:M2-AI-E01 · Attention Is All You Need
事件:AI-E10 · Transformer论文首次提交 · 起:2017-06-12;止:2017-06-12(日精度;状态:已报告);日期含义:首次投稿日期;说明:日期表示所记录版本的首次提交时间。
2018年10月首次提交的BERT论文,把预训练表述为同时利用左右上下文形成深层双向表示,再增加输出层、针对具体任务微调。这把两部分工作接在一起:先形成可供后续使用的表示,再适配特定任务。共同使用预训练结果的办法由此有了一个清楚的实例。至于各任务完成得怎样,应回到论文的实验设定,而不能从“理解”这个名称直接推出结论。
查看本段来源与事件日期
来源:M2-AI-E02 · BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
事件:AI-E11 · BERT论文首次提交 · 起:2018-10-11;止:2018-10-11(日精度;状态:已报告);日期含义:首次投稿日期;说明:日期表示所记录版本的首次提交时间。
2019年的FLORES论文让语言材料的差异变得具体。作者为尼泊尔语—英语、僧伽罗语—英语准备了译自Wikipedia句子的评测数据,并给出不同监督设置的基线;他们报告,当时的先进方法在这项低资源评测上表现仍差。这里有两个明确的语言对和一组当时的结果。评价语言能力,需要看哪些语言进入了评测,不能仅凭一种语言上的表现替其他语言下判断。
查看本段来源与事件日期
来源:M2-AI-D03 · The FLORES Evaluation Datasets for Low-Resource Machine Translation: Nepali–English and Sinhala–English
事件:AI-E12 · FLORES低资源翻译评测发表 · 起:2019-11;止:2019-11(月精度;状态:已报告);日期含义:发表日期;说明:日期表示材料发表时间。
从续写到接受反馈
2020年5月首次提交的GPT-3论文采用了一种评估安排:把任务说明和少量示例交给模型,让它作答,所述评估不为每项任务另做梯度更新或微调。读者可以把它理解为把任务的要求和例子放进提示中。作者同时列出困难任务和网络语料训练的方法问题。这一节点记录了适配任务方式的变化;具体回答是否可靠,仍有逐项检验的必要。
查看本段来源与事件日期
来源:M2-AI-E03 · Language Models are Few-Shot Learners
事件:AI-E13 · GPT-3论文首次提交 · 起:2020-05-28;止:2020-05-28(日精度;状态:已报告);日期含义:首次投稿日期;说明:日期表示所记录版本的首次提交时间。
2022年3月首次提交的InstructGPT论文,把示范和输出排序放进训练流程:先用人的示范微调,再利用对输出的排序开展强化学习。人的判断成为改变模型回答方式的一部分。作者仍报告简单错误,提醒我们把“更受偏好”与“每个回答正确”分开。阅读这类成果,除了看模型,还要看反馈来自什么任务、如何形成,以及它能支持多大范围的判断。
查看本段来源与事件日期
来源:M2-AI-A05 · Training language models to follow instructions with human feedback
事件:AI-E14 · InstructGPT论文首次提交 · 起:2022-03-04;止:2022-03-04(日精度;状态:已报告);日期含义:首次投稿日期;说明:日期表示所记录版本的首次提交时间。
2025年1月首次提交的DeepSeek-R1论文又区分了两条训练路径。按其摘要,R1-Zero未做前置监督微调而进行强化学习,出现可读性差和语言混杂等问题;R1则引入冷启动数据与多阶段训练。这个例子把训练步骤和实际表现之间的关系留了下来。本文采用固定的最初版本,以免把后续修订中的内容倒写到首次提交时,也不把作者的比较结果当作未经条件限制的能力排名。
查看本段来源与事件日期
来源:M2-AI-E04 · DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
事件:AI-E15 · DeepSeek-R1论文首次提交 · 起:2025-01-22;止:2025-01-22(日精度;状态:已报告);日期含义:首次投稿日期;说明:日期表示所记录版本的首次提交时间。
谁在使用,改变了什么
2025年5月,国际劳工组织发表一项职业暴露指数研究,以任务为单位估计生成式AI可能影响哪些工作。报告估计,全球约四分之一劳动者所处职业具有某种暴露程度,同时指出多数职业仍需要人的投入,转型比直接替代更可能。这里测量的是潜在影响。一个职业含有可以改变的任务,与这个职业中的人已经失去岗位,必须分开记录。
查看本段来源与事件日期
来源:M2-AI-D02 · Generative AI and Jobs: A Refined Global Index of Occupational Exposure
事件:AI-E16 · ILO发表职业暴露指数报告 · 起:2025-05-20;止:2025-05-20(日精度;状态:已报告);日期含义:发表日期;说明:日期表示材料发表时间。
实际使用也留下了另一类材料。2025年的《人们怎样使用ChatGPT》研究,按约翰斯·霍普金斯大学刊载的摘要,观察消费者产品从2022年11月至2025年7月的使用,并以自动流程为对话样本分类。实际指导、查询信息和写作列为主要用途。研究作者中有OpenAI研究者;本文只读到摘要,尚未核查抽样和分类方法。这些结果把注意力引向人们具体拿工具做什么,适用范围仍是该产品的样本,不能代表所有AI使用。
查看本段来源与事件日期
来源:M2-AI-H01 · How People Use ChatGPT — JHU研究摘要
事件:AI-E18 · 消费者产品使用研究记录对话用途 · 起:2025-09;止:2025-09(月精度;状态:已报告);日期含义:发表日期;说明:机构页面标注的发表月份;不是首次使用日期,摘要所述观察期止于2025年7月。
观察人们怎样使用AI,同样要先弄清数字怎样得到。2026年AI Index经济章把技术采用比较与跨国使用遥测并列展示;前一图的注释区分了18—64岁样本与所有年龄样本,后一图另用微软遥测。两幅图提供不同的观察角度,不能把其中的数字接成同一个全球人口比例。报告的年份,也需要与图中数据对应的年份分别阅读。
查看本段来源与事件日期
来源:M2-AI-F01 · AI Index Report 2026 — Chapter 4: Economy
事件:AI-E17 · 2026 AI Index报告并列不同采用指标 · 起:2026;止:2026(年精度;状态:已报告);日期含义:报告版本年份,不是测量日期;说明:日期表示报告版本年,不等于所有指标的测量时间。
回看这条路线,问题从怎样谈论机器智能,走到怎样训练、怎样比较,再走到人怎样参与和使用。FLORES留下语言材料的具体差异,劳动研究区分潜在暴露与实际结果。它们让技术史中那些容易被一个总分盖过的条件重新显出来。往后的记录,还需要跟踪这些条件怎样改变,并在新证据到来时说明原来的判断哪里需要修正。
查看本段来源与事件日期
来源:M2-AI-C01 · Computing Machinery and Intelligence;M2-AI-D02 · Generative AI and Jobs: A Refined Global Index of Occupational Exposure;M2-AI-D03 · The FLORES Evaluation Datasets for Low-Resource Machine Translation: Nepali–English and Sinhala–English
事件:AI-E01 · 图灵把问题移到模仿游戏 · 起:1950-10;止:1950-10(月精度;状态:已报告);日期含义:发表日期;说明:日期表示材料发表时间。;AI-E12 · FLORES低资源翻译评测发表 · 起:2019-11;止:2019-11(月精度;状态:已报告);日期含义:发表日期;说明:日期表示材料发表时间。;AI-E16 · ILO发表职业暴露指数报告 · 起:2025-05-20;止:2025-05-20(日精度;状态:已报告);日期含义:发表日期;说明:日期表示材料发表时间。
与上一可见版的差异
上一可见版本:M2-AI-REV-002(可阅读)
- 新增段落:AI-P20
- 新增来源:How People Use ChatGPT — JHU研究摘要
- 新增事件:消费者产品使用研究记录对话用途