===== 第1页 ===== 人工 情报 指数报告 2026年 ===== 第2页 ===== 1 内容 简介 主要要点 1 研究开发 2 技术性能 3 负责任的人工智能 4 经济 5 科学 6 医学 7 教育 8 政策与治理 9 舆论 附录 2 9 12 68 126 171 第231章 255 288 323 360 第385章 2026 年人工智能指数报告 人工智能指数是斯坦福人类研究所的一项独立倡议 中心人工智能(HAI)。 人工智能指数是在人工智能一百年研究中构思的 智能(AI100)。 ===== 第3页 ===== 欢迎阅读第九版人工智能指数报告。随着人工智能继续快速发展,问题 成为围绕它构建的系统是否能够跟上。治理框架、评估方法、 教育系统以及追踪人工智能影响所需的数据基础设施正在努力跟上步伐 技术本身。人工智能的能力与我们管理它的准备程度之间存在着差距 贯穿今年报告的每一章。本版新增内容,该报告跟踪了人工智能的测试情况 在推理、安全和现实世界任务执行方面更加雄心勃勃,以及为什么这些测量是 越来越难以依赖。它还包括对生成人工智能经济价值的新估计 其劳动力市场影响的新证据、人工智能主权的分析框架以及科学 与施密特科学公司合作开发的章节。该报告首次以独立的形式呈现 关于科学中的人工智能和医学中的人工智能的章节,反映了人工智能在这两个领域日益增长的影响。 近十年来,人工智能指数一直致力于将可靠的全球数据引入一个发展更快的领域 比大多数衡量它的努力都要多。该报告为政策制定者、研究人员、高管、记者和 公众拥有必要的证据来做出有关人工智能的明智决策。随着技术的深入 进入教室、诊所和立法机构,并重塑人们的工作、学习和治理方式 不完整数据持续上升。 在一个大量数据由与技术成功有利害关系的组织产生的领域,需求 中立和严格的测量持续增长。 AI 指数保持独立并专注于 揭示头条新闻背后的长期模式。该报告受到政府、研究机构的信赖 世界各地的机构和公司,并被媒体和学术论文引用。 接下来的几页提供了最全面、独立来源的人工智能发展轨迹图 可用。他们还明确指出了该图景仍然不完整的地方——因为我们还不能 衡量与我们所能做到的一样重要。 2 简介 2026 年人工智能指数报告 ===== 第4页 ===== 3 一年前,这份报告记录了人工智能作为主流力量的到来。今年的数据说明了什么 发生在抵达后。 这项技术比个人计算机或互联网更快地得到了大规模采用。 三年内,生成式 AI 的人口采用率达到近 53%。领先的人工智能公司是 达到有意义的收入规模所需的时间只是前几代技术的一小部分, 到 2025 年,全球企业投资将增加一倍以上。组织采用率升至 88%,并且 早期估计表明,生成式人工智能的消费者价值在一年内大幅增长。 数据没有指出 在一个方向上。它 揭示了一个领域 缩放速度比 围绕它的系统 可以适应。 “ 消息来自 the Co-chairs 简介 | 2026 年人工智能指数报告 在技术前沿,领先型号现在 彼此几乎无法区分。 开放重量模型比 曾经。但随着模型的趋同,所使用的工具 评估他们正在努力保持相关性。 基准已饱和,前沿实验室已饱和 披露较少,且独立测试不 始终确认开发人员报告的内容。 接下来的章节追溯了这个规模 活动和能力意味着实践。在 科学、人工智能从加速个人转向 尝试完全替代的研究步骤 整个工作流程。在医学、临床人工智能领域 工具从试点计划转向更广泛的 部署,使用环境 AI 抄写员等系统 跨卫生系统扩展。 世界各国政府在 2025 年对人工智能采取了行动,但方向不尽相同。欧盟第一部人工智能法案 禁令生效,而美国则转向放松管制。日本、韩国、 意大利各自通过了国家人工智能法律,新通过的国家人工智能战略中一半以上来自 发展中国家首次进入政策领域。人工智能主权的出现是 所有这些努力的核心组织原则。公众也在应对相互竞争的信号。 2025 年,全球对人工智能的乐观情绪有所上升,但紧张情绪也随之增加。 数据并不指向单一方向。它揭示了一个比系统扩展得更快的领域 周围可以适应。我们鼓励您自己探索并做出决定。 尤兰达·吉尔和雷蒙德·佩罗 人工智能指数报告联合主席 ===== 第5页 ===== 4 人择,经合组织 杰克·克拉克 于默奥大学 维吉尼亚·迪格努姆 斯坦福大学 拉斯奥特曼 东北 大学 卡拉·布罗德利 斯坦福大学 埃里克 布林乔夫森 指导委员会 简介 | 2026 年人工智能指数报告 摩根大通 大通公司 特拉·里昂 大学 明尼苏达州 维宾·库马尔 斯坦福大学 詹姆斯·兰迪 谷歌、大学 牛津大学 詹姆斯·曼伊卡 斯坦福大学, 销售人员 胡安·卡洛斯 尼布尔斯 斯坦福大学 凡妮莎·帕丽 斯坦福大学, AI21实验室 约夫·肖汉姆 布鲁金斯学会 伊尔哈姆·塔巴西 斯坦福大学 拉塞尔·沃尔德 大学 华盛顿 丹·韦尔德 新南威尔士大学 悉尼 托比·沃尔什 斯瑞国际 雷蒙·佩罗 南加州大学, 信息科学研究所 尤兰达·吉尔 主席 联合主席 会员 ===== 第6页 ===== 5 如何引用该报告 沙·萨贾迪、洛雷达娜·法托里尼、雷蒙德·佩罗、约兰达·吉尔、凡妮莎·帕利、拉波·桑塔拉斯奇、胡安·帕瓦、 内斯特·马斯莱吉、拉斯·奥尔特曼、埃里克·布林约尔松、卡拉·布罗德利、杰克·克拉克、弗吉尼亚·迪格努姆、维平·库马尔、 詹姆斯·兰迪、泰拉·里昂斯、詹姆斯·马尼卡、胡安·卡洛斯·尼布尔斯、约夫·肖汉姆、埃尔哈姆·塔巴西、拉塞尔 沃尔德、托比·沃尔什、丹·韦尔德。 “AI 指数 2026 年年度报告”,AI 指数指导委员会,研究所 以人为中心的人工智能,斯坦福大学,加利福尼亚州斯坦福,2026 年 4 月。 斯坦福大学 AI Index 2026 年度报告已获得许可 归因-NoDerivatives 4.0 国际。 公共数据和工具 AI 指数 2026 报告由原始数据和交互式工具补充。我们邀请每位读者使用 以与他们的工作和兴趣最相关的方式使用数据和工具。 • 原始数据和图表:报告中所有图表的公开数据和高分辨率图像 可在 Google 云端硬盘上找到。 • 全球人工智能活力工具:比较36个国家的人工智能生态系统。全球人工智能活力工具将是 2026 年底更新。 附属研究人员 本科生 研究员 斯坦福大学 亨利 张 毕业生 研究员 斯坦福大学 苏克鲁特 橡木 斯坦福大学 内斯特 马斯莱杰 斯坦福大学 胡安·尼古拉斯 帕瓦 IMT 学校 卢卡高级研究 拉波 桑塔拉西 简介 | 2026 年人工智能指数报告 工作人员和研究人员 首席研究经理兼主编 斯坦福大学 沙沙贾迪 斯坦福大学 洛雷达娜·法托里尼 ===== 第7页 ===== 6 简介 | 2026 年人工智能指数报告 支持伙伴 分析和 研究合作伙伴 人工智能指数欢迎明年的反馈和新想法。请通过 shahed@stanford.edu 联系我们。 人工智能指数由人类研究人员团队编写。作者使用 ChatGPT 和 Claude 来帮助完善 并复制编辑草稿。本出版物中的所有图像均由 Johanna Friedman (2026) 通过 AI 生成, Gemini 3.1(W-Nanobanana2)、Gemini 3(W-Nanobanana Pro)。 ===== 第8页 ===== 7 简介 | 2026 年人工智能指数报告 AI Index 谨按章和章节感谢以下个人的贡献 2026 年人工智能指数报告中包含的数据、分析、建议和专家评论的贡献: 简介 洛雷达娜·法托里尼、尤兰达·吉尔、凡妮莎·帕丽、雷 沙·萨贾迪·佩罗 研究与开发 乌斯曼·安瓦尔、西奥·伯恩、艾米丽·陈、雷切尔·库克、 让-斯坦尼斯拉斯·德南、梅雷迪斯·埃里森、洛雷达纳 法托里尼、妮可·芬、伊莎贝拉·弗洛雷斯、尤兰达·吉尔、汤姆 赫德、纳比尔·汗、詹姆斯·兰迪、谢恩·朗普雷、 内斯特·马斯莱吉、玛格达莱娜·奥尔蒂斯、哈利法·奥耶班吉、 奥瑞斯蒂斯·帕帕基里亚科普洛斯、凡妮莎·帕丽、雷·佩罗、 汤姆·皮尔斯、詹妮弗·拉奇福德、托马斯·理查森、 韦斯娜·萨布利亚科维奇·弗里茨、沙·萨贾迪赫、拉波·桑塔拉斯奇、 Sebastian Sardina, Andrew Shi, Yoav Shoham, Seth 波尔斯利、丹尼尔·韦尔德、徐凯文、梅格·杨 第一章 科学 迈克尔·克莱尔、史蒂文·迪尔曼、洛雷达娜·法托里尼、约兰达·吉尔、 詹姆斯·马尼卡、维平·库马尔、Minjoon Kouh、苏哈斯·马赫什、 凡妮莎·帕丽、雷·佩罗、沙·萨贾迪 第5章 医学 拉斯·奥尔特曼、彼得·布罗德、阿克谢·乔杜里、乔纳森 陈,马修·德维尔纳,阿卜杜勒·贾利勒·吉贝鲁·穆罕默德, 洛雷达娜·法托里尼、吴伊森、尤兰达·吉尔、杰夫·汉考克、 蒂娜·埃尔南德斯-布萨德、黄妍美、阿曼·科尔、 罗汉·库德利、亚历杭德罗·洛萨诺、丹妮尔·卢兹、大卫·马格纳斯、 Stephen P. Ma、Bethel Mieso、Fateme Nateghi Haredasht、 娜塔莉·佩吉勒 / 阿尤什·潘迪特 / 凡妮莎·帕丽 / 雷·佩罗 / 肖恩 赖尔丹、罗纳德·罗伯逊、奥斯汀·舍弗勒、沙·萨贾迪、 户上琴叶、丹尼斯·沃尔、吴大卫 第6章 教育 卡拉·布罗德利、约书亚·柴尔兹、丽莎·克鲁兹·诺沃哈茨基、洛雷达娜 法托里尼、约兰达·吉尔、雷切尔·戈因斯、劳拉·辛顿、索尼娅·科什、 詹姆斯·兰迪 / 克尔斯滕·龙格尔 / 杰奎琳·麦库恩 / 凡妮莎 帕利、雷·佩罗、沙·萨贾迪、布莱恩·特瓦里克、丽贝卡·扎克 第7章 经济 塔拉·巴拉克里希南、巴拉特·钱达尔、埃里克·布林约尔松、Ruyu 陈,Michael Chui,Heather English,Loredana Fattorini, 约兰达·吉尔、布莱斯·霍尔、希瑟·汉塞尔曼、罗茜·胡德、 阿卡什·考拉、埃琳娜·马格里尼、内斯特·马斯莱、詹姆斯·马尼卡、 丽贝卡·米尔德、大卫·阮、凯瑟琳·奥滕布莱特、凡妮莎 帕利、雷·佩罗、考特尼·普拉巴卡、布列塔尼·普雷斯滕、罗杰 罗伯茨、沙·萨贾迪、拉波·桑塔拉斯奇、亚历克斯·辛格拉、亚历克斯 苏哈列夫斯基、凯西·韦斯顿、张亨利 第4章 技术性能 埃里克·布林约尔松、洛雷达娜·法托里尼、约兰达·吉尔、塔莎 Kim、Sanmi Koyejo、Nestor Maslej、胡安·卡洛斯·尼布尔斯、 Sukrut Oak、凡妮莎·帕丽、雷·佩罗、沙·萨贾迪、 约夫·肖汉姆、托比·沃尔什、丹尼尔·韦尔德、张亨利 第2章 负责任的人工智能 加布里埃尔·摩根·阿萨泰 (Gabriel Morgan Asaftei),Rishi Bommasani,弗吉尼亚州 迪格努姆、洛雷达娜·法托里尼、约兰达·吉尔、内斯特·马斯莱吉、 凯瑟琳·奥滕布莱特、凡妮莎·帕丽、胡安·尼古拉斯·帕瓦、 雷·佩罗、布列塔尼·普雷斯滕、塞西尔·普林森、罗杰 罗伯茨、沙·萨贾迪、拉普·桑塔拉斯奇、艾比·斯蒂查、 伊尔哈姆·塔巴西、邹元浩 第三章 贡献者 ===== 第9页 ===== 8 简介 | 2026 年人工智能指数报告 政策与治理 弗吉尼亚·迪格努姆、洛雷达娜·法托里尼、约翰内斯·弗里茨、约兰达 吉尔、内斯特·马斯莱、凡妮莎·帕丽、胡安·尼古拉斯·帕瓦、雷 佩罗、沙·萨贾迪、拉波·桑塔拉斯奇、卡姆兰·萨塔里、 泰勒·莱诺克斯·史密斯、埃勒姆·塔巴西、拉塞尔·沃尔德 第8章 舆论 埃里克·布林约尔松、马特·卡迈克尔、扎克·德夫林-福尔茨、 洛雷达娜·法托里尼、娜嘉·弗莱希纳、尤兰达·吉尔、康纳赫 墨菲、凡妮莎·帕丽、胡安·尼古拉斯·帕瓦、雷·佩罗、马特 雷诺兹、沙·萨贾迪、拉塞尔·沃尔德、张亨利 第9章 AI指数感谢以下组织和个人提供的数据纳入本指数 年报: AI Index 还感谢 Jeanina Matias、Nancy King、Carolyn Lehman、Shana Lynch、Jonathan Mindes 和 感谢约翰娜·弗里德曼 (Johanna Friedman) 为准备本报告提供的帮助;克里斯托弗·埃利斯和玛德琳·赖特 帮助维护 AI Index 网站;以及安妮·贝尼施、马克·高夫、卡罗琳·迈因哈特、德鲁·斯宾塞、 凯西·韦斯顿和张勇在帮助推广该报告方面所做的工作。 时代人工智能 GitHub 光投 领英 奎德 泽基 麦肯锡公司 让-斯坦尼斯拉斯·德南 徐凯文 埃琳娜·马格里尼,丽贝卡·米尔德 罗茜·胡德、阿卡什·考拉、凯西·韦斯顿 希瑟·英格利希 汤姆·赫德 希瑟·汉塞尔曼,凯瑟琳·奥滕布莱特,布列塔尼 普雷斯滕、塞西尔·普林森、罗杰·罗伯茨、艾比·斯蒂查 组织机构 ===== 第10页 ===== 9 2026 年人工智能指数报告 1 人工智能能力并未趋于稳定。它正在加速并惠及更多的人 曾经。到 2025 年,超过 90% 的著名前沿车型将由工业生产,其中一些车型 现在在博士级科学问题、多模态推理等方面达到或超过人类基线 竞赛数学。在关键编码基准测试(SWE-bench Verified)上,性能得到提升 一年内达到人类基线的 60% 到接近 100%。组织采用 达到 88%,五分之四的大学生现在使用生成式人工智能。 2 中美人工智能模型性能差距已有效缩小。美国和中国 自 2025 年初以来,多个模型多次领先。2025 年 2 月,DeepSeek-R1 短暂地与美国顶级模型相匹配,截至 2026 年 3 月,Anthropic 的顶级模型仅领先 2.7%。美国仍然产生更多顶级人工智能模型和更高影响力的专利,而中国领先 出版物数量、引用量、专利产出和工业机器人安装。韩国 创新密度突出,人均人工智能专利量全球领先。 3 美国拥有最多的人工智能数据中心,其大部分芯片 由一家台湾铸造厂制造。美国拥有 5,427 个数据中心,还有更多 是任何其他国家的 10 倍,并且消耗的能源比任何其他国家都多。单个 台积电几乎代工所有领先的AI芯片,实现全球AI硬件供应 链条依赖于台湾的一家代工厂——尽管是台积电-美国公司。扩张开始于 2025 年。 4个AI模型可夺得国际数学奥林匹克金牌 但不能可靠地告诉时间——研究人员称之为锯齿状的一个例子 人工智能的前沿。 Gemini Deep Think 荣获 IMO 金牌,但顶级型号读取模拟信号 时钟正确率仅为 50.1%。 AI 代理的任务成功率从 12% 跃升至约 66% OSWorld,它在跨操作系统的真实计算机任务上测试代理,尽管它们仍然 在结构化基准测试中大约有三分之一的尝试失败。 5 机器人在大多数家务劳动中仍然失败,尽管它们在受控方面表现出色 环境。机器人只能成功完成 12% 的家务劳动,突显了人工智能离这一目标有多远 掌握物理世界。 On RLBench, robotic manipulation in software-based simulations 已达到 89.4% 的成功率,但可预测的实验室设置与不可预测的之间存在差距 家居环境广泛。 6 负责任的人工智能未能跟上人工智能能力和安全基准的步伐 滞后和事件急剧增加。 几乎都是领先的前沿AI模型开发者 报告能力基准的结果,但仍然报告负责任的人工智能基准 参差不齐。记录在案的人工智能事件从 2024 年的 233 起增至 362 起。 研究发现,改善一个负责任的人工智能维度,例如安全性,可能会降低另一个维度, 比如准确性。 主要要点 ===== 第11页 ===== 10 主要要点 | 2026 年人工智能指数报告 7 美国人工智能投资领先,但吸引全球人才的能力 正在下降。 2025年美国私人人工智能投资达2859亿美元,增长超过23倍 在中国的 124 亿美元投资——尽管仅考虑私人投资数据可能 考虑到政府的引导资金,低估了中国的人工智能总支出。美国也领先 2025年新融资AI公司创业活动达1953家,是2025年的10倍以上 下一个最近的国家。然而,移居美国的人工智能研究人员和开发人员的数量却在增加。 自2017年以来已下降89%,仅去年一年就下降了80%。 8 人工智能的采用正在以历史性的速度蔓延,消费者正在从中受益 他们经常免费使用的工具具有巨大的价值。生成式人工智能达到 53% 三年内人口的采用速度比个人电脑或互联网还要快,尽管速度 因国家而异,且与人均 GDP 密切相关。有些表现超出预期 采用率,如新加坡(61%)和阿拉伯联合酋长国(54%),而美国则排名第 24 位。 28.3%。生成式人工智能工具对美国消费者的每年估计价值达到 1720 亿美元 到 2026 年初,每个用户的中值价值在 2025 年至 2026 年间将增加两倍。 9 人工智能带来的生产力提升出现在许多相同的领域,这些领域的入门者 就业水平开始下降。研究表明,生产率提高了 14% 至 26% 客户支持和软件开发,对需要的任务产生较弱或负面影响 更多判断力。几乎所有业务功能中的人工智能代理部署仍保持在个位数。 在软件开发领域,人工智能的生产力提升最为明显,美国开发人员 22 至 25 岁年龄段的就业人数较 2024 年下降近 20%,尽管 22 岁至 25 岁年龄段的就业人数 开发商持续增长。 10 人工智能的环境足迹随着其能力的扩大而不断扩大。格罗克 4 预计训练排放量达到 72,816 吨二氧化碳当量。 AI数据中心电源 装机容量升至 29.6 吉瓦,与需求高峰时的纽约州相当,年度 GPT-4o 推断仅用水量就可能超过1200万人的饮用水需求。 11 个科学人工智能模型可以超越人类科学家,尽管模型更大 并不总是表现得更好。前沿模型的平均表现优于人类化学家 在 ChemBench 上,但它们在天体物理学中的复制得分低于 20%,在地球上的得分低于 33% 观察问题。 1.11 亿参数的蛋白质语言模型 MSAPairformer 击败了 ProteinGym 之前的领先方法,以及 2 亿参数的基因组学模型 GPN- Star,其性能比大模型近 200 倍。大多数科学人工智能基础模型都来自 来自跨部门的合作,与一般行业主导的格局形成鲜明对比 目的人工智能。 12 人工智能正在改变临床护理,但严格的证据仍然有限。人工智能工具 根据患者就诊自动生成临床记录的技术将在 2025 年得到广泛采用。 据报告,在多个医院系统中,医生花在写笔记和记录上的时间减少了 83% 倦怠显着减少。然而,除了某些工具之外,临床人工智能的证据基础 仍然很瘦。对 500 多项临床人工智能研究的回顾发现,近一半依赖于考试—— 风格问题而不是真实的患者数据,只有 5% 使用真实的临床数据。 ===== 第12页 ===== 11 主要要点 | 2026 年人工智能指数报告 13 14 15 正规教育落后于人工智能,但人们每天都在学习人工智能技能 人生阶段。超过 80% 的美国高中生和大学生现在将人工智能用于学校相关领域 任务,但只有一半的初中和高中制定了人工智能政策,只有 6% 的教师 说这些政策很明确。在课堂之外,人工智能工程技能的加速速度最快 阿拉伯联合酋长国、智利和南非。美国新增人工智能博士人数 从 2022 年到 2024 年,加拿大增加了 22%,构成这一增长的博士在 学术界,而非工业界。 人工智能主权正在成为国家政策的一个决定性特征,但能力 仍然不平衡,尽管开源开发有助于重新分配谁 参加。国家人工智能战略正在扩大,特别是在发展中经济体中, 国家支持的人工智能超级计算投资也在同步增加——这是人工智能超级计算不断增长的迹象 国内控制人工智能生态系统的野心。但模型生产仍然集中 在美国和中国。开源开发开始重新分配参与度, 世界其他地区的贡献现已超过欧洲并接近美国 在 GitHub 上,推动了语言上更加多样化的模型和基准。 人工智能专家和公众对该技术的看法截然不同 未来,全球对管理人工智能的机构的信任是支离破碎的。当它到来时 73% 的专家预计人们的工作方式会产生积极影响,而这一比例仅为 23% 与公众的差距达50分。人工智能对经济和医疗的影响也存在类似的分歧 关心。在全球范围内,人们对政府监管人工智能的信任度各不相同。在接受调查的国家中,美国 各州对本国政府监管人工智能的信任度最低,为 31%。在全球范围内, 在有效监管人工智能方面,欧盟比美国或中国更值得信赖。 ===== 第13页 ===== 12 研究与 发展 1 2026 年人工智能指数报告 概述 支撑AI发展的资源持续增长 2025 年,但发布的著名车型数量少于 一年前,前沿的系统越来越多 集中于少数组织。 目前,90%以上的著名人工智能模型都来自于工业界, 最有能力的系统也是最不透明的, 包含训练代码、数据集大小和参数计数 越来越多地被保留。这些背后的计算能力 自 2022 年以来,模型数量每年增长约 3.3 倍,但 几乎全部都流经台湾的一家单芯片代工厂, 使得全球硬件供应链变得脆弱。打开- 源代码开发和人工智能出版物持续增长, 研究领域正变得更加地理化 分布式。中国目前在出版量、引用量方面领先 份额和专利授权,而较小的国家,如 瑞士和新加坡在人均人工智能研究人员方面处于领先地位。 然而,该领域的某些维度根本没有改变。 人工智能人才的性别差距仍然根深蒂固,没有 自 2010 年以来任何国家都取得了有意义的进展。本章 涵盖研发管线,从 通过计算、数据中心、 能源以及支持它们的开源软件 更广泛的出版物、专利和人才研究生态系统。 ===== 第14页 ===== 13 章节亮点 1.1 著名的人工智能模型 按国家隶属关系 按部门和组织 模型发布 参数和计算趋势 亮点:模型会用完吗 数据? 1.2 计算和基础设施 性能和效率 著名型号的硬件 全球计算能力 数据中心电源容量 1.3 数据中心 GPU 之外的人工智能基础设施 地理分布 1.4 能源和环境影响 培训 推理 数据中心使用情况 1.5 开源人工智能软件 AI开发活动概览 项目 14 16 16 18 20 22 25 28 28 29 29 30 31 31 32 33 33 36 39 41 41 41 内容 1 研究与开发 | 2026 年人工智能指数报告 星星 模型和数据集生态系统 1.6 出版物 人工智能出版物总数 按场地 会议出席 按国家隶属关系 按部门 按主题 前 100 名出版物 按国家隶属关系 按部门和组织 1.7 专利 全球趋势 转发引文流 知识传播速度 技术接近性 亮点:人工智能专利实例 1.8 人工智能作者和发明家 地理分布 按教育程度 按性别 按专业分 移动性 43 44 47 47 48 48 50 52 53 53 53 54 56 56 58 59 60 61 62 62 63 65 66 66 ===== 第15页 ===== 14 内容 1 2 3 4 5 6 7 8 到 2025 年,超过 90% 的著名人工智能模型都是由工业界生产的,但最有能力的模型是 现在最不透明。训练代码、参数计数、数据集大小和训练持续时间 不再公开几个资源最密集的系统,包括来自 OpenAI、Anthropic 和 Google。 中国在研究方面处于领先地位,而美国在显着模型开发方面处于领先地位。中国领先 出版量、引用量和专利授予量,而美国保留了影响力较高的专利和 到 2025 年,将生产 50 款著名车型,而中国则为 30 款。韩国在人均人工智能专利方面处于领先地位,并且 中国在被引用次数最多的 100 篇人工智能论文中所占的份额从 2021 年的 33 篇增长到 2024 年的 41 篇。 随着披露的减少,报告的参数保持在数万亿美元。参数计数保持不变 三年来接近 1 万亿美元,尽管前沿实验室的报告已经停止。训练计算, 可以独立估计的,持续上升。 合成数据仍然不是在训练前取代真实数据,而是在数据质量和训练后取代真实数据 技术正在显示出希望。 OLMo 3.1 Think 32B,参数减少近 90 倍 比 Grok 4 通过修剪、重复数据删除在多个基准上取得了可比较的结果, 和单独的策展。 自 2022 年以来,全球 AI 计算能力每年增长 3.3 倍,达到 1710 万 H100 当量。 Nvidia 占总计算量的 60% 以上,其中大部分由 Google 和 Amazon 提供 其余部分和华为占有较小但不断增长的份额。扩建是由超大规模企业推动的 数据中心的扩展以及对前沿模型训练和推理的持续需求。 美国在人工智能数据中心方面处于领先地位,大部分由一家台湾代工厂制造 其中的芯片。美国拥有 5,427 个数据中心,是其他国家的十倍以上 国家,消耗的能源比任何其他地区都多。台积电 (TSMC) 一家公司生产 几乎每一款领先的AI芯片,都使得全球AI硬件供应链依赖于其中一款芯片 台湾代工厂,虽然是台积电-美国公司扩建将于2025年开始运营。 人工智能在电力、水和排放方面的环境足迹不断增加。 2025 年,Grok 4 估计训练排放量达到 72,816 吨二氧化碳当量。 AI数据中心电源容量 增至 29.6 吉瓦,与需求高峰时的纽约州相当,以及年度 GPT-4o 推断 仅用水量就可能超过 1200 万人的饮用水需求。 开源人工智能开发规模不断扩大,GitHub 上有 560 万个项目, 自 2023 年以来,Hugging Face 的上传量增加了两倍。美国的项目仍然吸引了最多的参与度, 已跨过 10 星门槛的项目累计 GitHub 星数达到 3000 万。 1 研究与开发 | 2026 年人工智能指数报告 章节亮点 ===== 第16页 ===== 15 章节亮点 | 研究与开发| 2026 年人工智能指数报告 9 10 自此以来,移居美国的人工智能研究人员和开发人员数量下降了 89% 2017年。下降速度正在加快,仅去年一年就下降了 80%。美国仍然是更多人工智能的发源地 其人才数量超过任何其他国家,但其吸引新人才的速度却是十多年来的最低水平。 人工智能人才地图正在发生变化,但性别差距仍然根深蒂固。瑞士和 新加坡在人均人工智能研究人员和开发人员方面处于世界领先地位,一些国家的数据显示 女性比例相对较高,包括沙特阿拉伯(32.3%)、加拿大(29.6%)和 澳大利亚(30.1%),但没有一个国家实现性别平等。 ===== 第17页 ===== 16 1.1 著名的人工智能模型 1 研究与开发 | 2026 年人工智能指数报告 本节从模型本身开始。使用 Epoch AI 精选的著名模型数据集, 部分研究了前沿人工智能模型的来源、部署方式以及需要什么 来建造它们。 Epoch AI 根据最新技术等标准将模型指定为值得注意的模型 进步、历史意义或高引用率。这是手动管理,因此数据集不是 所有人工智能模型的普查或所有模型开发活动的完整地图。1 趋势应被解读为模式 域内。接下来的部分跟踪这些系统背后的基础设施和输入, 包括计算、数据中心、能源成本和开源软件,然后再考虑更广泛的领域 通过出版物、专利和人才建立研究生态系统。 本章重点介绍研发渠道及其投入。下一章,技术 性能,详细审查模型功能和基准性能。 按国家隶属关系2 值得注意的模型生产仍然存在 集中于少数 国家(图 1.1.1-1.1.3)。从历史上看, 美国已经生产了 总产量最大,其次 由中国。这种模式在 2025 年仍在延续 美国率先发布 50 个著名的人工智能模型中,中国有 30 个, 韩国有 5 个。 新车型发布量同比下降 年覆盖所有主要地理区域。 图1.1.13 1 New and historic models are continually added to the Epoch AI database, so the total year-by-year counts of models included in this year’s AI Index 可能与去年报告中发布的内容不完全一致。该数据基于 2026 年 2 月 12 日拍摄的快照。 2 A machine learning model is associated with a specific country if at least one author of the paper introducing it is affiliated with an institution 总部设在那个国家。如果模型的作者来自多个国家,则可能会发生重复计算。 3 此图表突出显示了一组选定地理区域的模型版本。有关按国家/地区发布的车型的更全面的数据将在 即将推出的人工智能指数全球活力工具中提供。 1 1 1 1 5 30 50 0 5 10 15 20 25 30 35 40 45 50 英国 香港 法国 加拿大 韩国 中国 美国 著名人工智能模型的数量 按特定地区划分的著名人工智能模型数量 地区,2025 来源:Epoch AI,2026 |图:2026年AI指数报告 ===== 第18页 ===== 17 号 1.1 著名的人工智能模型 | 研究与开发| 2026 年人工智能指数报告 2005年 2010年 2015年 2020年 2025年 0 10 20 30 40 50 60 70 80 90 著名人工智能模型的数量 2、欧洲 30、中国 50、美国 按特定地区划分的著名人工智能模型数量 地区,2003–25 来源:Epoch AI,2026 |图:2026年AI指数报告 图1.1.2 图1.1.3 1–10 11-20日 21–60 61–180 181–630 2003-25 年按地理区域划分的著名人工智能模型数量(总计) 来源:Epoch AI,2026 |图:2026年AI指数报告 ===== 第19页 ===== 18 1.1 著名的人工智能模型 | 研究与开发| 2026 年人工智能指数报告 按部门和组织 著名人工智能模型的开发仍然主要集中在工业领域(图 1.1.4 和 1.1.5)。在过去的十年中,工业生产的份额稳步增长,现在代表了 遥遥领先(91.6%)。 2025 年,Epoch AI 发现了一个著名的人工智能模型,源自 学术界有 87 个,而工业界有 87 个。 在行业内,一小部分组织占据了发布的大部分份额(图 1.1.6 和 1.1.7)。在 2025 年,贡献最大的是 OpenAI (19)、Google (12) 和阿里巴巴 (11)。自 2014 年以来,谷歌已推出 著名模型数量最多,其次是 Meta 和 OpenAI。清华大学学术界 (26)、斯坦福大学 (26) 和卡内基梅隆大学 (25) 是过去最多产的大学 十年。 2003年 2004年 2005年 2006年 2007年 2008年 2009年 2010年 2011年 2012年 2013年 2014年 2015年 2016年 2017年 2018年 2019年 2020年 2021年 2022年 2023年 2024年 2025年 0 10 20 30 40 50 60 70 80 90 著名人工智能模型的数量 1、学术界 2、其他 5、产学合作 87、工业 2003 年按部门划分的著名人工智能模型数量 - 25 来源:Epoch AI,2026 |图:2026年AI指数报告 图1.1.4 ===== 第20页 ===== 19 1.1 著名的人工智能模型 | 研究与开发| 2026 年人工智能指数报告 2003年 2004年 2005年 2006年 2007年 2008年 2009年 2010年 2011年 2012年 2013年 2014年 2015年 2016年 2017年 2018年 2019年 2020年 2021年 2022年 2023年 2024年 2025年 0% 20% 40% 60% 80% 100% 著名的人工智能模型(占总数的百分比) 1.05%,学术界 2.11%, 其他 5.26%, 产学合作 91.58%, 工业 按部门划分的著名人工智能模型(占总数的%),2003–25 来源:Epoch AI,2026 |图:2026年AI指数报告 19 12 11 7 5 4 4 4 3 3 3 3 3 2 2 1 1 1 1 1 0 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 香港理工大学 香港中文大学深圳研究院 百度 蚂蚁集团 艾伦人工智能研究所 (Ai2) 英伟达 最小最大 Z.ai(智普AI) 伊利诺伊大学 登月计划 元 字节跳动 清华大学 LG人工智能研究所 深度搜索 人工智能 人择 阿里巴巴 谷歌 开放人工智能 学术界 工业 诺普特 著名人工智能模型的数量 2025 年按组织划分的著名人工智能模型数量 来源:Epoch AI,2026 |图:2026年AI指数报告 图1.1.5 图1.1.64 4 在组织统计数据中,DeepMind 发表的研究被归入 Google 下。 ===== 第21页 ===== 20 1.1 著名的人工智能模型 | 研究与开发| 2026 年人工智能指数报告 191 86 59 42 29 26 26 25 25 20 19 17 号 15 13 13 12 12 11 10 10 0 10 20 30 40 50 60 70 80 90 100 110 120 130 140 150 160 170 180 190 香港中文大学 字节跳动 纽约大学 销售人员 艾伦人工智能研究所 (Ai2) 百度 人择 麻省理工学院 牛津大学 华盛顿大学 加州大学伯克利分校 卡内基梅隆大学 阿里巴巴 清华大学 斯坦福大学 英伟达 微软 开放人工智能 元 谷歌 学术界 工业 诺普特 著名人工智能模型的数量 按组织划分的著名人工智能模型数量,2014-25(总计) 来源:Epoch AI,2026 |图:2026年AI指数报告 图1.1.7 模型发布 著名人工智能模型的发布模式继续转向受控访问(图 1.1.8)。在 到 2025 年,API 访问是最常见的发布类型,95 个模型中有 45 个模型以这种方式提供。和 自 2020 年以来,仅 API 版本稳步增加。第二个最常见的版本类型是“开放式” 权重(无限制)”,这意味着模型完全可供使用、修改和重新分发。的 其余模型以混合访问类型发布,包括“托管访问(无 API)”5“开放权重” (限制使用)”6 和“开放权重(非商业)”。 “未知”名称是指型号 具有不明确或未公开的访问类型,并且“未发布”模型仍然是专有的,只能访问 他们的开发商或选定的合作伙伴。 总体而言,训练代码变得比模型代码更难访问(图 1.1.9)。 2025 年,95 个中的 80 个 值得注意的模型在没有相应的训练代码的情况下发布,相比之下,有 4 个模型发布了相应的训练代码 代码“开源”。 2020 年,具有开源和未发布训练代码的模型在 数量,但到 2023 年,大多数尚未发布,并且差距继续扩大。这种不断增长的不透明度 限制了外部研究人员重现结果、审核开发和验证安全声明的能力。 这些挑战是第 3 章和第 8 章中负责任的人工智能和治理讨论的核心。 5 Hosted access refers to using computing resources or services (such as software, hardware, or storage) provided remotely by a third party, rather 而不是个人拥有或管理它们。托管访问不是在本地运行软件或基础设施,而是通过以下方式访问这些资源: 云或其他远程服务,通常通过互联网。例如,通过 AWS、Google Cloud 或 Microsoft 等平台使用 GPU Azure(而不是在自己的硬件上运行它们)被视为托管访问。 6 Open weights models share their architecture at varying levels of restriction, “noncommercial” limits use to research purposes, “restricted use” 在某些条件下允许更广泛的使用,并且“无限制”对使用、修改或重新分发没有限制。 ===== 第22页 ===== 21 1.1 著名的人工智能模型 | 研究与开发| 2026 年人工智能指数报告 20 30 45 13 10 18 9 19 14 22 26 33 30 22 15 26 11 18 24 20 37 21 28 36 36 16 27 13 19 29 33 29 49 55 37 68 50 78 91 119 98 95 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 20 40 60 80 100 120 140 API 访问 托管访问(无 API) 开放权重(非商业) 开放重量级(限制使用) 开放重量级(无限制) 未发布 未知 著名人工智能模型的数量 按访问类型划分的著名人工智能模型数量,2014–25 来源:Epoch AI,2026 |图:2026年AI指数报告 图1.1.87 7 Not all models in the Epoch database are categorized by access type, so the totals in Figures 1.1.8 and 1.1.9 may not fully align with those reported 本章其他地方。 14 29 22 34 31 30 12 11 9 13 12 13 24 25 38 54 76 80 80 29 22 29 34 9 11 33 29 49 55 37 68 50 78 91 119 98 95 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 20 40 60 80 100 120 140 开源 开放(限制使用) 开放(非商业) 未发布 未知 著名人工智能模型的数量 按训练代码访问类型划分的著名人工智能模型数量,2014–25 来源:Epoch AI,2026 |图:2026年AI指数报告 图1.1.9 ===== 第23页 ===== 22 1.1 著名的人工智能模型 | 研究与开发| 2026 年人工智能指数报告 参数和计算趋势 从 2010 年代初到 2022 年,著名人工智能模型的参数数量显着增加, 受模型架构日益复杂、数据可用性提高、硬件改进的推动, 以及大型模型已被证明的有效性(图 1.1.10-1.1.128)。从那时起,报告的参数数量不断增长 已趋于平缓,但由于缺乏某些数据点,这可能低估了实际增长。几个 近年来发布的资源最密集的模型,包括来自 OpenAI、Anthropic 和 谷歌尚未公开披露参数数量、训练数据集大小或训练持续时间。 同样,训练数据集大小和训练持续时间在 2020 年代初期有所增加,领先模型 在超过 100 天的时间内对数十万亿代币进行训练。再次,由于信息披露有限 各大前沿实验室,最新数据不完整。 8 本节中的一些图表使用对数比例来反映近年来 AI 模型参数和计算的指数增长。 2003 2004 2005 2006 2007 2008 2009 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 100 10k 1M 100M 10B 1T 学术界 产业界 产学合作 其他 出版日期 参数数量(对数刻度) 按部门划分的著名人工智能模型的参数数量,2003-25 来源:Epoch AI,2026 |图:2026年AI指数报告 图1.1.10 ===== 第24页 ===== 23 1.1 著名的人工智能模型 | 研究与开发| 2026 年人工智能指数报告 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 2026 10k 1M 100M 10B 1T 100吨 出版日期 训练数据集大小(标记 - 对数尺度) 著名人工智能模型的训练数据集大小,2010-25 来源:Epoch AI,2026 |图:2026年AI指数报告 美洲驼3.1-405B 变压器 GPT-3 175B(达芬奇) DeepSeek-V3 帕LM (540B) GPT-4(2023 年 3 月) 亚历克斯网 Qwen2.5-72B GLM-4.6 Qwen3-Max 奥尔莫3号 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 2026 0.1 1 10 100 出版日期 训练时间(天 - 对数刻度) 著名人工智能模型的训练时间,2010-25 来源:Epoch AI,2026 |图:2026年AI指数报告 亚历克斯网 变压器 BERT-Large 罗伯塔·拉格 GPT-3 175B(达芬奇) 威震天-图灵 NLG 530B 帕LM (540B) GPT-4(2023 年 3 月) 美洲驼3.1-405B GLM-4.6 格洛克3 奥尔莫3号 图1.1.11 图1.1.12 由于即使没有直接报告计算量也可以估计,因此训练计算趋势可显着 模型显示同期出现明显增长(图 1.1.13 和 1.1.14)。计算要求 著名模型的价格上涨了几个数量级,其中工业价值最高。 在比较模型产量最高的两个国家时,美国模型仍然是最多的 与中国模型相比,计算量较大。但近几年的比较不能 得到充分证实,因为美国模型尚未直接报告其训练计算。 ===== 第25页 ===== 24 1.1 著名的人工智能模型 | 研究与开发| 2026 年人工智能指数报告 2003 2004 2005 2006 2007 2008 2009 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 1μ 0.001 1 1000 1M 1B 1T 学术界 产业界 产学合作 其他 出版日期 训练计算(petaFLOP - 对数标度) 按部门划分的著名人工智能模型的训练计算,2003–25 来源:Epoch AI,2026 |图:2026年AI指数报告 图1.1.139 9 估计训练计算是 AI 模型分析的一个重要方面,但它通常需要间接测量。当直接报告是 不可用,Epoch 通过使用硬件规格和使用模式或基于模型计算算术运算来估计计算量 架构和训练数据。在这两种方法都不可行的情况下,基准性能可以作为推断训练计算的代理 将模型与已知的计算值进行比较。 Epoch 方法的完整详细信息可以在其网站的文档部分找到。 2018 2019 2020 2021 2022 2023 2024 2025 2026 1 10 100 1000 10k 10万 1M 10M 100M 1B 10B 100B 1T 10T美国中国 出版日期 训练计算(petaFLOP – 对数标度) GPT-4(2023 年 3 月) GPT-3 175B(达芬奇) 格罗克-2 克劳德 3.5 十四行诗 格洛克4 DeepSeek-V3 豆宝-proERNIE 3.0 泰坦 Qwen2.5-72B Qwen3-Max GLM-4.6 美国和中国精选的著名人工智能模型的训练计算,2018-25 来源:Epoch AI,2026 |图:2026年AI指数报告 图1.1.14 ===== 第26页 ===== 25 亮点: 模型会耗尽数据吗? 1.1 著名的人工智能模型 | 研究与开发| 2026 年人工智能指数报告 去年,人工智能指数强调了对数据瓶颈和扩展可持续性的担忧 与训练数据相关的方法。领先的人工智能研究人员公开声称可用的池 用于训练大型模型的高质量人类文本和网络数据已经耗尽,这种状态经常被提及 作为“峰值数据”。这继续引起全行业对规模化法律可持续性的担忧, 历史上一直依赖于更大的数据集。 Epoch AI 的一组预测表明 在某些假设下,估计耗尽日期可能在 2026 年至 2032 年之间。 预训练中的综合数据 如果合成数据(人工智能生成的数据 系统)可用于提高后续模型的性能。之前版本的人工智能指数 没有发现明确的证据表明合成数据可以在预训练阶段提高模型性能。10 2024 年报告引用的研究表明,在实际训练时模型性能可能会崩溃 数据被合成数据取代。 2025 年报告指出了最近的发现,即这种崩溃可能是 如果真实数据仍然是训练集的一部分,则可以避免,但简单地添加更多数据并不一定 导致性能提升。 共识基本保持不变。仍然没有明确的证据表明合成数据可以完全 抵消预训练环境中真实数据的耗尽。然而,最近的研究表明,综合数据 可以在更有限的环境中提供价值。混合训练方法结合了真实数据和合成数据, 可以显着加速训练,有时规模可提高 5 到 10 倍,但不会超过实际速度 最终模型性能的数据。对纯合成数据的训练已显示出对较小模型或 狭义定义的任务,例如分类、代码生成或使用低资源语言工作,但这些 成果尚未推广到大型通用语言模型。仅综合训练有 达到了与真实数据相当的性能,它通常涉及更小的模型 无法直接与当前最先进的系统相比较。例如,SYNTHLLM 系列模型, 完全基于合成数据进行训练,取得了很好的成果,但仍然落后于主要模型的领先模型 基准(图1.1.15)。 10 Pre-training refers to the initial phase of model development in which a model is trained (typically via self-supervised learning) on large, general- 目的数据集获取广泛的语言或多模式表示。训练后是指对基础模型的后续细化,通过 techniques such as supervised fine-tuning or reinforcement learning, to specialize behavior, improve alignment, or optimize performance on particular 任务。 图1.1.15 来源: 秦等人,2025 ===== 第27页 ===== 26 亮点: 1.1 著名的人工智能模型 | 研究与开发| 2026 年人工智能指数报告 以数据为中心的方法 关于数据可用性的讨论往往忽视了近期人工智能研究的一个重要转变。性能提升 越来越多的驱动因素是提高现有数据集的质量,而不是获取更多数据集。而不是 由于不加区别地扩展数据,研究人员正在花费更多的精力来修剪、策划和完善训练 输入。以数据为中心的方法强调通过清理等实践来提高性能 标签、重复样本删除以及构建更高质量的数据集。越来越多的研究表明 基于低质量或污染数据的训练模型会显着降低性能。同样,最近 证据表明,数据修剪,选择信息最丰富的训练输入,通常表现优于 不加区别地训练所有可用数据的方法。 训练后的综合数据 最近的研究表明,综合生成的数据可以有效提高模型性能 在训练后设置中,包括微调、对齐、指令调整和强化学习。 2025 年发布的越来越多的研究支持了这一发现。有证据表明合成 训练后数据在少样本生成设置中非常有效,可提高长上下文能力, 优化强化学习工作流程,并更广泛地加强推理。 78.1% 91.3% 92.7% 94.3% 95.7% OLMo 3 克劳德作品 4.5 格罗克-4 GPT-5(高) 双子座 1.5 Pro0% 20% 40% 60% 80% 100% 型号 分数 AIME 2025 上的模型表现 资料来源:人工分析,2026 年;人工智能2,2025 |图:2026年AI指数报告 图1.1.16 合成内容的普遍存在 自 2022 年 11 月 ChatGPT 推出以来,有人预测互联网很快就会 被人工智能生成的内容淹没。 Graphite 最近的研究表明,从一月份开始 到2025年,超过50%的新发布的网络内容是由人工智能生成的(图1.1.17)。其他人预测 2026 年这一比例可能会更高。 近期大型模型开发 在实践中说明了这一范式。奥尔莫 3名研究人员优先考虑大规模 重复数据删除、注重质量的数据选择、 以及特定阶段的培训课程 而不是不加区分的数据缩放。这些 干预措施与迭代相结合 评估和完善的反馈循环 候选数据混合,允许他们的模型 尽管达到有竞争力的表现 训练的标记数量远少于 其他领先的最先进模型(图 1.1.16)。以 Olmo 3.1 的 Think 32B 型号为例, 包含大约 320 亿个参数,近 比 Grok 4 的 3 万亿少 90 倍,但它 在几个方面取得了可比的性能 基准,包括美国邀请赛 数学考试 (AIME)11 2025。 11 美国数学邀请赛 (AIME) 是一年一度的高中数学竞赛,被广泛用作人工智能的基准 数学推理,每年的考试都会提供新的测试集。 ===== 第28页 ===== 27 亮点: 1.1 著名的人工智能模型 | 研究与开发| 2026 年人工智能指数报告 鉴于人们越来越担心合成数据是否适合训练人工智能系统,这一趋势引发了人们的关注。 有关当前扩展轨迹的长期可靠性的问题。作为回应,许多依赖 高质量培训数据的研究越来越多地转向专有来源。 2025 年 5 月,纽约 《泰晤士报》与亚马逊签订了许可协议,允许其内容用于培训目的。 到 2025 年中期,Meta 已 据报道从事 类似的讨论与 新闻机构、 在健康和生命的同时 科学公司如 …… 追求可比的 策略。这些 事态发展表明 巩固培训前沿 人工智能系统正在调整 他们的数据采集 策略作为数量 公开培训 数据继续下降。 2020 年 1 月 2020 年 7 月 202 年 1 月 1 202 年 7 月 1 2022年1月-2022年7月-2023年7月-2023年1月-202年 4 202 年 7 月 4 2025 年 1 月 0% 20% 40% 60% 80% 100% 生成内容的百分比 48.28%, 人类 51.72%, 人工智能 人工智能生成的内容与人类内容 来源:Graphite.io,2025 |图:2026年AI指数报告 图1.1.17 ===== 第29页 ===== 28 1.2 计算和基础设施 1 研究与开发 | 2026 年人工智能指数报告 人工智能模型的开发需要大量的基础设施投资。由于培训过程有 随着规模和复杂性的扩大,底层硬件的速度和效率也得到了提高。 反过来,这些成果决定了研究人员和实验室可以实际构建的模型类型。增长于 如果没有相应的训练计算,上一节中讨论的训练计算是不可能的 硬件能力的改进。本部分利用 Epoch AI 的数据来跟踪硬件 随着时间的推移,性能、采用率和聚合计算能力。 性能和效率 机器学习硬件的峰值计算性能在各个版本中呈指数级增长 2008 年至 2025 年(图 1.2.1)。在较低精度类型中,增益尤其明显,其中 精度是指用于表示数值的位数。较低精度的格式,例如 FP16 和 Tensor-FP16/BF16 现在显示出最高的性能水平,并已成为许多领域的标准配置 训练和推理设置。 2008 2009 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 10B 100B 1T 10吨 100吨 10 15 FP32 FP16 TF32(19位)张量-FP16/BF16 出版日期 性能(FLOP/s - 对数刻度) 不同精度的机器学习硬件的峰值计算性能,2008-25 来源:Epoch AI,2026 |图:2026年AI指数报告 图1.2.1 ===== 第30页 ===== 29 1.2 计算和基础设施| 研究与开发| 2026 年人工智能指数报告 著名型号的硬件 全球计算能力 著名人工智能模型中的硬件采用模式反映了性能和效率的提升(图 1.2.2)。自 2017 年以来,在 A100 级硬件上训练的著名模型的累计数量有所增加, 到 2025 年,将有 84 个模型接受训练。上一代 V100 继续占据相当大的份额(69 模型)。较新的硬件,例如 H100,已经得到了早期的快速采用 (28),而其他类别,例如 TPU v3 和 TPU v4 表现出稳定的曲线。 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 10 20 30 40 50 60 70 80 出版日期 著名人工智能模型的累计数量 4、H800 6、P100 28、TPU v4 28、H100 44、TPU v3 54、其他 69、V100 84、A100 加速器训练的著名人工智能模型的累计数量,2017-25 来源:Epoch AI,2026 |图:2026年AI指数报告 图1.2.2 各大芯片设计商的AI计算能力供给持续增加(图1.2.3)。总计 自 2022 年以来,产能预计每年增加 3.3 倍,达到约 1710 万个 H100- 12 Nvidia AI 芯片目前占总计算量的 60% 以上,与谷歌和亚马逊一样 其余大部分由华为提供,而华为所占份额虽小但不断增长。计算的增长 产能与第 4 章中描述的投资模式密切相关,领先的人工智能公司已经 增加资本支出和基础设施已成为私营企业增长最快的重点领域 人工智能资助。 12 Since these estimates are inferred from revenue data, financial disclosures and analyst reports, they reflect broader trends rather than exact 很重要。数据覆盖范围也因制造商而异; Nvidia 和 Google 的数据从 2022 年开始,而其他公司的数据从 2024 年开始。 ===== 第31页 ===== 30 1.2 计算和基础设施| 研究与开发| 2026 年人工智能指数报告 1.02M 1.10M 1.49M 1.88M0.94M 1.37M 200万 2.80M 3.10M 0.92M 1.36M 1.94M 2.62M 3.45M 4.69M 6.39M 8.28M 10.66M 11.38M 0.05M 0.12M 0.19M 0.28M 0.40M 0.64M 1.04M 1.57M 2.50M 3.62M 4.98M 6.88M 9.60M 12.64M 16.54M 1707万 2022Q1 2022Q2 2022Q3 2022Q4 2023Q1 2023Q2 2023Q3 2023Q4 202 第一季度第四季度 第202章 第四季度 第202章 第四季度第三季度 第202章 第四季度 2025Q1 2025Q2 2025Q3 2025Q4 0M 2M 4M 6M 8M 10M 12M 14M 16M 18M Nvidia 谷歌 亚马逊 AMD 华为 累计计算能力 (H100e) 主要设计者人工智能芯片的全球计算能力,2022-25 来源:Epoch AI,2026 |图:2026年AI指数报告 图1.2.3 图1.2.4 数据中心电源容量 计算能力的扩展会带来直接的能源成本。 AI数据中心总电源容量 到 2025 年第四季度达到约 29.6 吉瓦,足以在高峰需求时为整个纽约州供电(图 1.2.4)。以热设计功耗衡量的AI芯片功率约占总功率11.8GW,其中 其余部分归因于冷却、网络和其他数据中心基础设施。这一估计是基于 随着时间的推移销售的领先 AI 芯片的额定功率容量,乘以约 2.5 考虑供电基础设施的额外要求。 1.01 1.42 2.16 3.05 4.11 5.40 7.07 8.79 10.90 11.82 1.51 2.13 3.24 4.57 6.16 8.11 10.60 13.18 16.35 17.74 0.15 0.37 0.60 0.87 1.20 1.73 2.52 3.56 5.39 7.62 10.27 13.51 17.67 21.96 27.25 29.56 2022Q1 2022Q2 2022Q3 2022Q4 2023Q1 2023Q2 2023Q3 2023Q4 202 第一季度第四季度 第202章 第四季度 第202章 第四季度第三季度 第202章 第四季度 2025Q1 2025Q2 2025Q3 2025Q4 0 5 10 15 20 25 30 35 40 其他AI数据中心电源 (冷却、网络等) AI芯片功耗(TDP) 累计发电容量 (GW) 纽约州峰值使用量 ≈ 31 GW 荷兰 ≈ 19 GW 新西兰 ≈ 7 GW 全球人工智能数据中心电力容量,2022–25 来源:Epoch AI,2026 |图:2026年AI指数报告 ===== 第32页 ===== 31 1.3 数据中心 1 研究与开发 | 2026 年人工智能指数报告 底层的物理基础设施 人工智能的发展超越 中描述的模型和计算 上一节。数据中心是 计算所在的位置以及它们的 容量、地理分布、 和基础供应链的形状 可以构建哪些人工智能系统以及 哪里。本节借鉴数据 从 Cloudscene 追踪全球 数据中心的分布和 介绍了更广泛的概述 AI基础设施生态系统提供 地理和供应背景 链动力学。 人工智能基础设施:超越 GPU 现代人工智能数据中心依赖于计算、存储、通信和专业技术的组合 使人工智能系统能够大规模运行的硬件。 GPU 和自定义加速器(例如 Tensor) 处理单元 (TPU) 是讨论最广泛的,但它们只是更广泛基础设施的一层 堆栈。这些芯片处理的所有数据都保存在高带宽存储器(HBM)中,它支持移动 高效地输入和输出大量数据。 HBM 的领先制造商是 SK Hynix(韩国)、 三星(韩国)和美光(美国)。在训练期间,GPU 必须不断地与一个人共享数据 另一个,需要通过运行光纤电缆实现快速、高吞吐量的网络连接 高带宽网络架构,例如 InfiniBand。 该硬件背后的供应链增加了另一个维度。 Nvidia 和 SK Hynix 等公司 设计但不制造芯片。相反,他们为专门的半导体代工厂提供设计, 主要是台湾积体电路制造公司 (TSMC) 和三星代工厂, 现代人工智能硬件所需的纳米级芯片。然后对制作好的芯片进行封装 经过日月光集团(台湾)和 Amkor Technology(美国)等组装公司的测试。台积电 是全球人工智能供应链中的单点依赖,因为它制造了几乎所有领先的人工智能芯片, 包括 Nvidia 的 Blackwell GPU 和 AMD 的 MI300X。每一层都有很高的进入壁垒—— 需要数十年积累的专业知识、专业设备和大量资本投资 克服。 基础设施生态系统的相关性超出了人工智能能力,因为它决定了教育优先事项并 劳动力发展。第7章(教育)区分AI软件相关和AI硬件- 相关学位。这种区别在这里也很重要,不同的国家在全球范围内扮演着不同的角色。 硬件供应链。 ===== 第33页 ===== 32 1.3 数据中心| 研究与开发| 2026 年人工智能指数报告 地理分布 世界上大部分数据中心基础设施位于少数国家(图 1.3.1 和 1.3.2)。 2025年,美国大幅领先,拥有5,427个数据中心,是美国的10倍多 任何其他国家的计数。德国(529)、英国(523)和中国(449)紧随其后,而 其余大多数国家的设施均少于 300 个。美国可能表现出明显的领先优势,但 评估其他国家排名时应考虑到数据中心数量并不能反映 设施规模、计算能力或利用率方面的差异。 1–9 10–19 20–39 40–59 60–99 100–149 150–2 49 250–349 350–529 530+ 无可用数据 2025年数据中心全球分布 资料来源:Cloudscene,2025 |图:2026年AI指数报告 图1.3.1 图1.3.2 144 153 168 173 197 222 第251章 298 314 第322章 第337章 第449章 第523章 第529章 5,427 0 300 600 900 1,200 1,500 1,800 2,100 2,400 2,700 3,000 3,300 3,600 3,900 4,200 4,500 4,800 5,100 5,400 波兰 印度 意大利 墨西哥 巴西 日本 俄罗斯 荷兰 澳大利亚 法国 加拿大 中国 英国 德国 美国 数据中心数量 2025 年按地理区域划分的数据中心数量 资料来源:Cloudscene,2025 |图:2026年AI指数报告 ===== 第34页 ===== 33 1.4 能源与 环境影响 1 研究与开发 | 2026 年人工智能指数报告 随着人工智能系统的规模化并成为 更广泛地部署,他们的能源 消费与环境 足迹已经变得非常明显。 计算和基础设施趋势 前面几节中描述的 转化为对 能源、水和碳排放。 本节研究这些成本 人工智能发展的三个领域: 训练、推理和数据中心 能源使用。分析取自 Epoch AI 的模型级数据,最新 学术标杆研究 (Jegham 等人,2025),国际 能源署的数据报告 中心(IEA,2025),以及 de Vries 和 高(2025)。 培训 自 2016 年以来,领先的机器学习硬件的效率不断提高(以每瓦 FLOP/s 为单位) (图1.4.1)。领先芯片的每瓦计算量比十年前的芯片高出约 10 倍 以前,Nvidia B200 和 Google TPU v5e 是效率最高的。然而,模型的扩展速度更快 随着效率的提高,训练前沿系统所需的总功率持续增加。 自 2010 年代初以来,训练模型的总功耗增长了几个数量级(图 1.4.2)。需要数据集中计算最密集的模型,例如 Grok 3 和 Llama 4 Behemoth 训练期间超过 1 亿瓦。由于开发商披露有限,电力消耗 许多已发布的最新型号尚无信息。 培训产生的碳排放量增长得更为剧烈(图1.4.3)。 2012年训练AlexNet 估计产生了 0.01 吨二氧化碳当量,而 2025 年训练 Grok 4 产生了约 72,816 吨二氧化碳当量 吨。考虑到这一点,这比普通汽车的终生碳排放量(63 吨)还要多。 较大的型号通常会产生更多的排放,但并非总是如此,因为它也可能取决于硬件 效率、培训持续时间以及所用能源的碳强度。以 DeepSeek v3 为例, 产量约为 597 吨,远低于同等尺寸的型号(图 1.4.4)。 ===== 第35页 ===== 34 1.4 能源和环境影响| 研究与开发| 2026 年人工智能指数报告 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 1B 10B 100B 1T 硬件领先 非领先的硬件 出版日期 能源效率(FLOP/s 每瓦 - 对数标度) 英伟达 P100 谷歌 TPU v2 谷歌 TPU v3 谷歌 TPU v4 NVIDIA Tesla V100 SXM2 32 GB 谷歌 TPU v4i NVIDIA A100 谷歌 TPU v5e 英伟达B100 NVIDIA H100 SXM5 80GB 英伟达 B200 英伟达GB200 领先机器学习硬件的能源效率,2016-25 来源:Epoch AI,2026 |图:2026年AI指数报告 骆驼 4 巨兽(预览) 格洛克3 美洲驼3.1-405B GPT-4 帕LM (540B) GPT-3 175B(达芬奇) 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 2026 100 1000 10k 10万 1M 10M 100M 出版日期 所需的总功耗(瓦特 - 对数刻度) 训练前沿模型所需的总功耗,2011-25 来源:Epoch AI,2026 |图:2026年AI指数报告 图1.4.1 图1.4.2 ===== 第36页 ===== 35 1.4 能源和环境影响| 研究与开发| 2026 年人工智能指数报告 0.01 0.31 2.60 5.50 588 1,432 301 2,973 5,184 第597章 8,930 59,200 72,816 亚历克斯网 VGG16 BERT-Large 罗伯塔·拉格 GPT-3 威震天-图灵 NLG GLM-130B 猎鹰180B GPT-4 深度搜索 v3 羊驼3.1 405B 格洛克3 格洛克4 2012 2014 2018 2019 2020 2021 2022 2023 2024 2025 0 10,000 20,000 30,000 40,000 50,000 60,000 70,000 80,000 碳排放量(吨二氧化碳当量) 培训选定的人工智能模型和现实生活活动的估计碳排放量,2012-25 资料来源:人工智能指数,2026; Strubell 等人,2019 |图:2026年AI指数报告 航空旅行(1 名乘客,纽约↔旧金山):0.99 人类寿命(平均,1 年):5.51 美国生活(平均,1年):18.08 汽车使用次数(平均,包括燃油,1 次生命周期):63 亚历克斯网 VGG16 BERT-Large 罗伯塔·拉格 GPT-3 威震天-图灵 NLG GLM-130B 猎鹰-180B GPT-4 深度搜索 v3 羊驼3.1 405B 格洛克3 格洛克4 0.01 0.1 1 10 100 1000 10k 100k 1B 1T 碳排放量(吨二氧化碳当量 - 对数刻度) 参数数量(对数刻度) 通过选定的人工智能模型估算碳排放量和参数数量 来源:人工智能指数,2026 |图:2026年AI指数报告 图1.4.3 图1.4.4 ===== 第37页 ===== 36 1.4 能源和环境影响| 研究与开发| 2026 年人工智能指数报告 推理 培训成本通常受到最多关注,但推理在人工智能中所占的份额越来越大 总能源足迹。一旦模型大规模部署,服务查询所需的累积能量 几个月内就可以超过一次性培训成本。 Jegham 等人最近进行的基准测试。 (2025) 提供每个模型的推理能耗估计值 中等长度提示的碳排放(定义为大约 1,000 个输入令牌和 1,000 个 输出令牌)。 2025年能耗前15名机型中,DeepSeek V3.2 Exp和DeepSeek V3.2 每次查询消耗的电量最多(23 Wh),其次是 GPT-5(高),为 21.9 Wh(图 1.4.5)。型号 例如 Claude 4 Opus 和 GPT-5 min(中)处于较低端,消耗 5 到 6 Wh 之间。 当按碳排放量排名时,模型也遵循类似的模式(图1.4.6)。深寻V3.2 Exp 和 DeepSeek V3.2 产生的每个中等长度提示的最高量,大约 14 克 CO2 各等价。作为比较,Claude 4 Opus 和 Mistral Medium 3 的重量最低,分别为 1.6 和 1.5 克, 分别。即使在同一年发布的车型之间也存在广泛的差异,这不仅表明 推理效率各不相同,但较高的能力不一定与环境成本成正比。 7.20 6.90 1.69 15.86 9.00 7.45 5.34 4.594.544.36 4.13 2.99 2.96 2.46 1.88 1.88 1.68 1.45 23.2423.1321.8521.77 14.90 13.0811.90 8.35 7.65 7.48 6.71 6.26 5.57 5.32 5.13 GPT-4 GPT-4涡轮增压 GPT-3.5涡轮 DeepSeek V3(DeepSeek) 美洲驼 3.1 405B 标准型 米斯特拉尔大型 2 (AWS) 米斯特拉尔大型 2(天蓝色) 奥1 克劳德 3.5 俳句 美洲驼 3.1 70B 标准型 美洲驼 3.2 90B(远景) Llama 3.1 405B 延迟优化 羊驼3 70B GPT-4o(五月) GPT-4o迷你 克劳德 3 俳句 GPT-4o(十一月) GPT-4o(八月) DeepSeek V3.2 实验版 深寻V3.2 GPT-5(高) o3-pro GPT-5迷你(高) GPT-5(中) 格洛克4 GPT-5(低) 基米K2思维 GPT-5纳米(高) o3-迷你(高) o4-迷你(高) 格洛克 3 快速 克劳德 4 作品 GPT-5迷你(中型) 2023 2024 2025 0 5 10 15 20 25 能源消耗(平均 - 瓦时) 中等长度提示的能耗模型 资料来源:Jegham 等人,2025 |图:2026年AI指数报告 图1.4.513 13 该图显示了 2024 年和 2025 年能源消耗排名前 15 的型号。全套型号可通过源仪表板获取。 ===== 第38页 ===== 37 1.4 能源和环境影响| 研究与开发| 2026 年人工智能指数报告 2.45 2.34 9.51 2.70 2.24 2.15 1.82 1.60 1.36 1.31 1.24 0.90 0.89 0.83 0.73 0.68 0.56 13.9513.88 7.43 7.40 5.07 4.58 4.45 2.84 2.54 2.29 2.28 2.13 1.75 1.60 1.52 GPT-4 GPT-4涡轮增压 DeepSeek V3(DeepSeek) 美洲驼 3.1 405B 标准型 米斯特拉尔大型 2 (AWS) 格洛克 3 快速 米斯特拉尔大型 2(天蓝色) 奥1 克劳德 3.5 俳句 美洲驼 3.1 70B 标准型 美洲驼 3.2 90B(远景) Llama 3.1 405B 延迟优化 羊驼3 70B GPT-4o(五月) DeepSeek V3(Azure) GPT-4o迷你 GPT-4o(十一月) DeepSeek V3.2 实验版 深寻V3.2 GPT-5(高) o3-pro GPT-5迷你(高) 格洛克4 GPT-5(中) GPT-5(低) GPT-5纳米(高) 基米K2思维 o3-迷你(高) o4-迷你(高) GPT-5迷你(中型) 克劳德 4 作品 米斯塔尔中型 3 2023 2024 2025 0 3 6 9 12 15 18碳排放量(平均 - gCO2e) 中等长度提示的碳排放模型 资料来源:Jegham 等人,2025 |图:2026年AI指数报告 图1.4.614 14 该图显示了 2024 年和 2025 年能源消耗排名前 15 的型号。全套型号可通过源仪表板获取。 在单个查询的层面上,这些数字似乎 比较谦虚。一个简短的 GPT-4o 查询消耗 约 0.42 Wh,多出 40% 比 Google 搜索的功耗低 0.3 Wh(图 1.4.7)。 每日会话包含八个中等长度的查询 使用的能量相当于为两个 智能手机(9.7 瓦时)。但跨越数百 日均百万查询,消费规模 变成更大的东西。 对于水来说,同样的缩放动态也适用 消耗(图1.4.8)。年度预估 对于 GPT-4o 推断范围约为 1.3 至 1.6 千升,在高端,超过了 每年1200万人的饮用水需求。 ===== 第39页 ===== 38 1.4 能源和环境影响| 研究与开发| 2026 年人工智能指数报告 0.30 0.42 1.21 1.79 3.37 9.71 10.00 1 谷歌 搜索 GPT -4o(米 2025 年) – 短 特曲 埃里 GPT -4o(米 2025 年) – 中等曲率 埃里 GPT -4o(米 2025 年) – 龙曲 埃里 日常 会议(8混乱 年龄,短 特曲 系列) 日常 会议(8混乱 年龄,中等 系列) 为 2 部手机充电(能量 吉乌斯 年龄 ) 0 2 4 6 8 10 能耗(瓦时) 每个查询和每日能耗:GPT-4o 与常见活动 来源:人工智能指数,2025 |图:2026年AI指数报告 1 2,500 1,250,000 1,314,000 1,334,991 1,579,680 1 人 安安 一般饮酒 阿特 (美国AV 克) 1 奥运会 游泳池 500 奥运 游泳池 (合计 埃盖特) 每年 1200 万人 瓦尔 喝酒 阿特(聚合 埃盖特) GPT -4o 信息 埃伦茨 e (最小 嗯估计 e) GPT -4o 信息 埃伦茨 e (格言 嗯估计 e) 0 0.2M 0.4M 0.6M 0.8M 1M 1.2M 1.4M 1.6M 年用水量(千升) 年用水量:GPT-4o 与现实世界基线 来源:人工智能指数,2025 |图:2026年AI指数报告 图1.4.7 图1.4.8 ===== 第40页 ===== 39 1.4 能源和环境影响| 研究与开发| 2026 年人工智能指数报告 数据中心使用情况 模型和查询的功率需求加起来导致基础设施占用空间更大。估计的 到 2024 年,AI 加速器模块的电力需求累计达到约 5,200 MW (图1.4.9)。 Nvidia占据最大份额,这与该公司的领先地位一致 全球人工智能芯片产能(如第 1.2 节所述)。当包括支持这些的完整系统时 加速器(服务器、冷却、网络),估计需求达到约 9,400 MW(图 1.4.10)。然而,de Vries 和 Gau (2025) 的这些数据因利用率变化而存在不确定性 率和设施级效率,如图表上的误差线所示。 从这个规模来看,全人工智能系统的累积电力需求相当于 瑞士或奥地利的全国电力消耗,大约是比特币挖矿的一半(图 1.4.11)。不包括加密货币,全球数据中心估计电力需求最高,约为 47,000 MW,其中人工智能硬件所占的份额越来越大。 2023 2024 累计 0 2,000 4,000 6,000 8,000 10,000 英伟达 AMD 其他人工智能系统 兆瓦 (MW) 预计全人工智能系统的电力需求 资料来源:de Vries-Gao,2025 |图:2026年AI指数报告 2023 2024 累计 0 1,000 2,000 3,000 4,000 5,000 6,000 英伟达 AMD 其他AI加速器模块 兆瓦 (MW) AI加速器模块的预计功耗 资料来源:de Vries-Gao,2025 |图:2026年AI指数报告 图1.4.9 图1.4.10 图1.4.11 0 5 10 15 20 25 30 35 40 45 爱尔兰 AI加速器模块 瑞士 奥地利 芬兰 全方位人工智能系统 荷兰 比特币挖矿 英国 法国 数据中心 (不包括加密货币) 电力需求(千 - 兆瓦) 预计电力需求:人工智能硬件与国民消费、比特币挖矿和全球数据中心 资料来源:de Vries-Gao,2025 |图:2026年AI指数报告 ===== 第41页 ===== 40 1.4 能源和环境影响| 研究与开发| 2026 年人工智能指数报告 然而,成本一直在向相反的方向发展。自 2006 年以来,GPU 计算的成本已经 下降超过99%(图1.4.12)。这种下降是实现所描述的扩展趋势的关键 在本章中,使训练和部署模型的水平在经济上可行 即使在十年前,成本也高得令人望而却步。从区域层面看,数据中心用电量 所有主要地区均有所增加,预计到 2030 年将继续增加(图 1.4.13)。的 美国占据最大份额,其次是中国、欧洲和亚洲其他地区。 2006 2007 2008 2009 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0.00 0.20 0.40 0.60 0.80 1.00 GPU 成本指数(2006 年=1) 0.002 GPU 计算成本,2006–24 资料来源:国际能源署 (2025),能源与人工智能,IEA,巴黎 |图:2026年AI指数报告 2020 2021 2022 2023 2024 2025 2026 2027 2028 2029 2030 0 200 400 600 800 1,000 美国 中国 欧洲 亚洲(不包括中国) 世界其他地区 耗电量(太瓦时) 2020-30 年各地区数据中心用电量 资料来源:国际能源署 (2025),能源与人工智能,IEA,巴黎 |图:2026年AI指数报告 图1.4.12 图1.4.1315 15 该图表中的数据反映了国际能源署的预测,而不是观察到的消费量。 ===== 第42页 ===== 41 1 研究与开发 | 2026 年人工智能指数报告 1.5 开源人工智能软件 前面的部分重点介绍了著名的前沿模型以及构建和构建所需的基础设施。 维护它们。 GitHub 和 Hugging Face 等开源平台提供了不同的视图来捕捉 开发者生态系统试验并构建人工智能模型。这项活动的大部分内容并未体现在 学术出版物或前沿模型发布。 AI Index 分析两个平台的数据16,以便更好地分析 了解开源人工智能开发如何随着时间的推移而发展。 16 中国研究人员经常使用 GitHub 的替代品,例如 Gitee 和 GitCode 来进行代码共享,但来自这些网站的数据不包含在 这份报告。附录中提供了完整的方法描述。 开源发展规模稳步增长。 AI相关的GitHub项目数量 从 2011 年的 1,549 人增加到 2025 年的约 560 万人,同比增长加速 2024 年起 23.7%(图 1.5.1)。然而,大多数存储库通常由个人或实验工作组成 并受到最少的关注。当筛选至少 10 颗星的项目时,社区的粗略代理 参与人数,到 2025 年将下降至 206,880 人(图 1.5.2)。两者的增长轨迹相似 措施。 AI开发活动概览 项目 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0.00 1.00 2.00 3.00 4.00 5.00 AI项目数量(百万) 5.58 2011 年 GitHub AI 项目数量 - 25 来源:GitHub,2025 |图:2026年AI指数报告 图1.5.1 ===== 第43页 ===== 42 1.5 开源人工智能软件| 研究与开发| 2026 年人工智能指数报告 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 50 100 150 200 AI项目数量(万) 206.88 2011 年至少获得 10 颗星的 GitHub AI 项目数量 - 25 来源:GitHub,2025 |图:2026年AI指数报告 图1.5.2 地理分布更加明显 开源人工智能项目随着时间的推移而发生变化 (图1.5.3)。在项目中至少 10颗星中,美国占了 2025 年将占据最大份额(31.7%),尽管这已经 较 2011 年的近 80% 稳步下降 其他地区开发商有所增加 他们在平台上的存在。欧洲和 世界其他地区的数量有所增加 的项目,而中国的份额已持平 自 2019 年以来,印度经济仍然在增长 贡献者,占项目的 5.2% 至少有 10 颗星。因为 GitHub 数据 没有捕获使用的中国开发者 国内的Gitee或者GitCode等平台, 中国在全球开源人工智能活动中所占的份额 可能被低估了。现有地理 中国归因使用自我报告 位置而不是基于 IP 的地理定位。 ===== 第44页 ===== 43 1.5 开源人工智能软件| 研究与开发| 2026 年人工智能指数报告 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0% 10% 20% 30% 40% 50% 60% 70% 80% 人工智能项目(占总数的百分比) 5.18%,印度 11.01%, 中国 24.47%, 欧洲 27.63%, 世界其他地区 31.71%, 美国 按地理区域划分的至少 10 颗星(占总数的%)的 GitHub AI 项目,2011-25 来源:GitHub,2025 |图:2026年AI指数报告 图1.5.317 除了项目数量之外,GitHub 明星还提供了开发人员对开放感兴趣和参与的另一个信号: 源社区(图1.5.4)。 AI项目的星星总数从2023年的1400万增加 到 2025 年,这一数字将达到 1820 万。18 所有主要地理区域均出现同比增长。然而,地理 星星的模式与上面的项目份额数据不同。尽管项目份额不断下降,但联合 各州累积的星星数量最多,累计达 3000 万颗(图 1.5.5)。所以在开放的同时—— 源活动的地理分布更加分散,参与度最高的项目仍然存在 不成比例地以美国为基地。 17 在之前的人工智能指数报告中,中国和香港的项目地点是使用基于 IP 的地理定位确定的。由于频繁使用 VPN 在这些导致系统性错误分类的地区,中国大陆和香港现在使用自我报告的个人资料位置,而基于 IP 的 地理定位继续适用于所有其他国家。 18 图 1.5.4 显示了一年内给予 GitHub 项目的新星星,而不是一段时间内累积的总星星。 星星 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 5 10 15 GitHub 星星数量(百万) 18.18 2011 年人工智能项目中 GitHub 明星数量,25 来源:GitHub,2025 |图:2026年AI指数报告 图1.5.4 ===== 第45页 ===== 44 1.5 开源人工智能软件| 研究与开发| 2026 年人工智能指数报告 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 5 10 15 20 25 30 累计 GitHub 星数(百万) 2.50,印度 9:00,中国 12.99,欧洲 15.27, 世界其他地区 30.02,美国 2011-25 年按地理区域划分的 GitHub 星数 来源:GitHub,2025 |图:2026年AI指数报告 图1.5.5 模型和数据集生态系统 为了补充 GitHub 视图,本部分使用来自广泛使用的社区 Hugging Face 的元数据 人工智能模型和数据集的平台和开放存储库。分析重点是创建或上传的资产 2022 年至 2025 年间,了解近期活动和采用趋势(图 1.5.6 和 1.5.7)。上传 过去几年活动持续增加,第二季度后显着增加 2024 年。从 2023 年到 2025 年,模型上传量增加了两倍多,而数据集上传量增加了四倍。下载 2023 年之后,分布也发生了变化。从地理上看,19 美国开发的型号的份额被无关用户夺走。 在开发者方面,谷歌和 Meta 等主要私人参与者已经从主要角色转变为 作者的下载量所占份额相对较小,而 Sentence 等社区 Transformers 和 BERT 社区不断发展(图 1.5.8)。占模型下载总量的很大一部分 属于“其他”类别,反映了发展活动的更广泛分布,尽管最 下载的模型与少数来源相关。 19 数据是与 Longpre 等人的研究人员合作获得的。 (2025)。他们的数据集提供了 Hugging Face 模型下载数据 作者描述为一致且相对完整。它经过了 Hugging Face 团队的验证,据报道比原始计数噪音要小, 并包括清理和估算的缺失元数据。它以每周面板的形式发布,而不是历史下载横截面。覆盖范围 2020 年 3 月至 2025 年 8 月,包括每周下载次数最多的 200 个 Hugging Face 模特。这些型号占总数的49.6% 标准化、过滤的下载。此限制将分析重点放在观察到的下载量较高的模型上,减少了长尾变化, 并可能支持更稳定的估计。 ===== 第46页 ===== 45 1.5 开源人工智能软件| 研究与开发| 2026 年人工智能指数报告 3 4 6 9 15 21 24 34 42 47 53 73 89 82 153 3 19 18 31 53 70 96102 118 156 260 217 297 295 第257章 第332章 2022Q1 2022Q2 2022Q3 2022Q4 2023Q1 2023Q2 2023Q3 2023Q4 202 第一季度第四季度 第202章 第四季度 第202章 第四季度第三季度 第202章 第四季度 2025Q1 2025Q2 2025Q3 2025Q4 0 50 100 150 200 250 300 模型数据集 模型和数据集的数量(以千为单位) Hugging Face 上的模型和数据集数量,2022-25 来源:拥抱脸,2025 |图:2026年AI指数报告 73% 72% 76% 68% 67% 68% 70% 68% 61% 54% 48% 36% 6% 5% 10% 14% 20% 18% 17% 14% 12% 12% 11% 16% 16% 14% 15% 14% 20% 21% 14% 24% 51% 60% 59% 58% 54% 54% 50% 34% 35% 27% 6% 21% 19% 23% 15% 17% 13% 8% 6% 9% 24% 42% 6% 7% 6% 25% 15% 10% 7% 9% 11% 10% 11% 12% 5% 5% 8% 8% 8% 8% 6% 5% 5% 6% 6% 6% 7% 7% 2020Q22020Q32020Q4202 一季度 第202章 一季度2 第202章 1Q3 第202章 4季度1季度 2022Q12022Q22022Q32022Q42023Q12023Q22023Q32023Q4202 第一季度第四季度 第202章 第四季度 第202章 第四季度第三季度 第202章 第四季度 2025Q12025Q22025Q3 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 美国 Unaliat ed 用户 国际/在线 中国 英国 德国 其他 芬兰 法国 印度 日本 下载分享 2020 年第 2 季度至 2025 年第 3 季度 Hugging Face 热门机型的全球下载量分布 资料来源:Longpre 等人,2025;拥抱脸,2025 |图:2026年AI指数报告 图1.5.620 图1.5.721 20 此图表中显示的数据来自可公开访问的 Hugging Face 存储库。欲了解更多详情,请参阅附录。 21 数据来源:Longpre 等人。 (2025)。欲了解更多详情,请参阅附录。 ===== 第47页 ===== 46 1.5 开源人工智能软件| 研究与开发| 2026 年人工智能指数报告 42% 42% 47% 39% 34% 32% 30% 28% 24% 18% 12% 9% 7% 7% 5% 7% 6% 6% 9% 19% 13% 8% 12% 9% 7% 9% 11% 10% 11% 11% 5% 5% 19% 12% 8% 11% 13% 14% 14% 9% 9% 16% 7% 14% 14% 15% 15% 15% 16% 16% 16% 13% 11% 7% 6% 27% 29% 25% 32% 34% 33% 31% 33% 40% 39% 24% 39% 56% 48% 46% 45% 51% 61% 66% 48% 52% 41% 9% 9% 8% 8% 10% 13% 18% 18% 19% 22% 15% 13% 7% 9% 6% 5% 12% 14% 19% 16% 16% 10% 9% 11% 15% 11% 8% 16% 33% 2020Q22020Q32020Q4202 一季度 第202章 一季度2 第202章 1Q3 第202章 4季度1季度 2022Q12022Q22022Q32022Q42023Q12023Q22023Q32023Q4202 第一季度第四季度 第202章 第四季度 第202章 第四季度第三季度 第202章 第四季度 2025Q12025Q22025Q3 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 谷歌 OpenAI timm stable-diusion sd-concepts-library Bingsu Deepseek Meta 其他前20名(含) llyasviel 工作室社区 下载分享 2020 年第 2 季度至 2025 年第 3 季度,开发者在热门 Hugging Face 模型中的下载份额 资料来源:Longpre 等人,2025;拥抱脸,2025 |图:2026年AI指数报告 图1.5.822 图1.5.923 22 数据来源:Longpre 等人。 (2025)。欲了解更多详情,请参阅附录。 23 数据来源:Longpre 等人。 (2025)。欲了解更多详情,请参阅附录。 过去三年中,最受欢迎的模型类型发生了变化。文本嵌入器、分类器和音频 2022 年,这些模型的下载量合计占下载量的近 70%,而到 2025 年,这一比例将降至不到 6%(图 1.5.9)。文本生成、多模式和视频生成模型已经取代了它们。文本生成 到 2025 年将领先,占总下载量的 42% 以上。图像生成模型也增加了 稳步保持下载量第二大的类别。尽管发生了这些变化,下载量仍然很高 集中,近80%与前三类相关。 2022 2023 2024 2025 文本生成 42.46% 图像生成 25.61% 多式联运发电 13.30% 视频生成 5.47% 无证 4.56% 音频模型 2.88% 文本嵌入/类 2.71% 多模态嵌入 1.72% 图像嵌入 1.28% 表格模型 0.00% 57.46% 文本嵌入/类 10.88% 图像生成 10.82% 音频型号 10.63% 文本生成 7.52% 图像嵌入 1.41% 无证 0.87% 多模态嵌入 0.30% 多模式生成 0.11% 表格模型 2022 年第 3 季度至 2025 年第 3 季度,热门 Hugging Face 型号按方式下载份额 资料来源:Longpre 等人,2025;拥抱脸,2025 |图:2026年AI指数报告 ===== 第48页 ===== 47 1.6 出版物 1 研究与开发 | 2026 年人工智能指数报告 本章前半部分跟踪了人工智能开发背后的模型、基础设施和能源。这个 部分转向研究成果,特别是英文人工智能出版物和引文。刊物 提供大规模人工智能研究活动的纵向信号,人工智能指数持续跟踪它们超过 时间。虽然发表量并不是研究质量的衡量标准,而且并非所有研究都出现在索引中 数据库,这种方法提供了逐年跟踪研究前沿的一致方法。的 分析取自 OpenAlex,这是 AI 指数自 2025 年以来使用的书目数据库24,并考虑 出版量和通过引用模式产生的下游影响。 24 OpenAlex 是一个完全开放的学术元数据目录,包括科学论文、作者、机构等。 AI 指数使用 OpenAlex 作为书目数据库,并使用最新版本的 CSO 分类器自动对人工智能相关研究进行分类。 CSO 分类器 (v3.3) 是 一个自动文本分类系统,旨在使用 15,000 个主题的综合本体对计算机科学研究论文进行分类 以及 166,000 个关系,包括 GenAI、大型语言模型 (LLM) 和即时工程等新兴领域。它处理元数据(例如 作为标题和摘要)通过三个模块:用于精确主题匹配的句法模块,利用词嵌入进行推断的语义模块 相关主题,以及通过过滤异常值和添加相关更高级别区域来细化结果的后处理模块。 人工智能出版物总数 人工智能出版物总产量持续上升。 2013 年至 2024 年间,人工智能出版物增加了一倍多, 从大约 102,000 增加到大约 258,000(图 1.6.1)。 2024 年继续增长,但增速 增速较慢,出版物数量较 2023 年增加 6.3%。人工智能研究目前占很大一部分 更广泛的计算机科学生态系统的一部分,占所有计算机科学出版物的 40.9% 打开亚历克斯。 257.89 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0 50 100 150 200 250 0% 5% 10% 15% 20% 25% 30% 35% 40% 45% CS 领域的 AI 出版物数量(以千计) CS 领域的 AI 出版物(占总数的百分比) 全球计算机科学领域人工智能出版物,2013-24 来源:人工智能指数,2025 |图:2026年AI指数报告 图1.6.1 ===== 第49页 ===== 48 1.6 出版物 | 研究与开发| 2026 年人工智能指数报告 按场地 会议出席 2024年,期刊在人工智能出版物中所占份额最大(62.8%),其次是会议(23.8%) (图1.6.2)。自 2013 年以来,期刊和会议出版物的绝对数量均有所增加, 尽管它们的相对份额发生了变化。人工智能出版物出现在会议中的比例 从2013年的36.6%稳步下降到目前的水平。然而,最近一年的结果也可能 反映了场地分配的滞后性,因为论文在正式发布之前通常首先出现在像 arXiv 这样的存储库中 发表在期刊或会议上。 25 在这种情况下,“存储库”指的是 arXiv 等预印本平台,研究人员在该平台上先于或独立于正式同行发布论文。 审阅期刊或会议上的出版物。 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0 20 40 60 80 100 120 140 CS 领域的 AI 出版物数量(以千计) 0.76,论文 1.54、其他 13.04,预订 62.03,会议 62.52,存储库 124.00,日记 按场地类型划分的计算机科学领域人工智能出版物数量,2013-24 来源:人工智能指数,2026 |图:2026年AI指数报告 图1.6.2 出版地点模式反映了人工智能研究正式发表的地点以及会议出席情况 提供了研究社区参与的补充观点。追踪的 16 个主要会议 按 AI 指数 — AAAI、AAMAS、CVPR、EMNLP、FAccT、ICAPS、ICCV、ICLR、ICML、ICRA、IJCAI、IROS、KR、 NeurIPS、UAI 和 IUI——2024 年的总出席人数较上一年有所增加(图 1.6.3)。最大的 包括 NeurIPS、CVPR 和 ICML 在内的会议继续吸引着最高的出席人数,而较小的会议 ICAPS、KR、UAI 等保持稳定的参与水平(图 1.6.4 和 1.6.5)。这个数据 应谨慎解释,因为许多会议最近已转向虚拟或混合形式。 会议组织者报告称,衡量虚拟会议的确切出席人数很困难, 因为虚拟会议允许来自世界各地的研究人员更多地参加。人工智能指数 报告总出席人数,包括虚拟、混合和现场参与。 ===== 第50页 ===== 49 1.6 出版物 | 研究与开发| 2026 年人工智能指数报告 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 20 40 60 80 100 参加人数(万人) 101.12 参加选定的人工智能会议,2010-25 来源:人工智能指数,2025 |图:2026年AI指数报告 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 5 10 15 20 25 30 参加人数(万人) 2.37、国际JCAI 6.24、EMNLP 6.29、AAAI 6.33、前十字韧带 7.01,ICRA 7.73、ICCV 8.00,ICML 8.00,IROS 9.38,CVPR 11.04,ICLR 26.38,神经IPS 出席大型会议,2010-25 来源:人工智能指数,2025 |图:2026年AI指数报告 图1.6.3 图1.6.426 26 2021 年 ICML 出席人数大幅增加,可能是因为该年会议几乎是在同一年举行的。 ===== 第51页 ===== 50 1.6 出版物 | 研究与开发| 2026 年人工智能指数报告 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0.00 0.50 1.00 1.50 2.00 2.50 3.00 3.50 参加人数(万人) 0.18,韩国 0.27,ICAPS 0.30,宫腔内人工授精 0.39, 尿素指数 0.60,美国医学会 0.63,事实 出席小型会议,2010-25 来源:人工智能指数,2025 |图:2026年AI指数报告 图1.6.527 按国家隶属关系28 2024年,中国占2024年人工智能出版物的17.8%,而欧洲为11.1%,欧洲为7.6% 印度(图1.6.629)。 2024年,中国人工智能出版物也占所有人工智能引用的20.6%,其次 紧随欧洲(19.5%)和美国(12.6%)(图 1.6.7)。美国出现下降 发表份额提高了 3 个百分点,但被引用份额保持相对不变(2019 年 12.6%) 2024 年对比 2023 年 13.03%)。 2024 年,出版物数据中“未知”的比例将上升至 39.3%,这一峰值可能会导致 反映元数据覆盖范围的变化。出版物和引用的地理分布增加了 本章前面讨论的显着模型趋势文本,其中相对较少的国家 占活动的不成比例的份额。 2021 年和 2022 年第 27 届 IUI 仅以虚拟方式举行。 28 本章中的区域是根据世界银行的分析分组进行分类的。 AI 指数确定作者的国家归属 使用作者数据中的“国家”字段。该字段列出了从 OpenAlex 检索到的作者所属的所有国家/地区 基于机构隶属关系。这些隶属关系可以在论文中明确说明,也可以从作者最近的出版物中推断出来。当 按国家/地区计算出版物时,AI 索引会为与出版物相关的每个国家/地区分配一个计数。例如,如果一篇论文有三位作者, 两份隶属于美国机构,一份隶属于中国机构,该出版物在美国计算一次,在中国计算一次。 29 当作者的机构隶属关系缺失或不完整时,出版物可能具有“未知”的国家隶属关系。这个问题的出现是由于 受多种因素影响,包括非结构化或省略的机构名称、平台功能缺陷、团体作者实践、不标准化 隶属关系标签、文档类型不一致或作者有限的发表记录。与 OpenAlex 相关的问题在 这篇论文;然而,机构缺失的问题也与其他书目数据库有关。 ===== 第52页 ===== 51 图1.6.630 30 为了简洁起见,人工智能指数对选定的一组国家的结果进行了可视化。但是,将提供所有国家/地区的完整结果 到 2026 年底使用人工智能指数的全球活力工具。如需立即获取特定国家的研发数据,请联系 人工智能指数团队。 1.6 出版物 | 研究与开发| 2026 年人工智能指数报告 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0% 5% 10% 15% 20% 25% 30% 35% 40% CS 领域的 AI 出版物(占总数的百分比) 7.29%, 美国 7.55%,印度 11.05%, 欧洲 17.10%, 世界其他地区 17.76%,中国 39.25%, 未知 2013-24 年按特定地理区域划分的计算机科学领域人工智能出版物(占总数的百分比) 来源:人工智能指数,2026 |图:2026年AI指数报告 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0% 5% 10% 15% 20% 25% 30% 35% CS 领域的 AI 出版物(占总数的百分比) 0.83%,撒哈拉以南非洲 1.21%,拉丁美洲和加勒比地区 4.27%,中东和北非 8.18%,北美 8.25%,南亚 13.52%,欧洲和中亚 26.42%,东亚和太平洋地区 37.33%, 未知 2013-24 年按地区划分的计算机科学领域人工智能出版物(占总数的百分比) 来源:人工智能指数,2026 |图:2026年AI指数报告 图1.6.7 ===== 第53页 ===== 52 按部门 2024 年,学术界出版了大部分人工智能出版物(68.1%),其次是政府机构 (12.4%)、工业界(11.5%)和非营利组织(4.6%)(图1.6.8)。行业细分确实有所不同 按地区划分(图 1.6.9)。在美国,人工智能出版物中来自工业界的比例较高(24.6%) 与中国(18%)相比,中国的政府机构是更有意义的贡献者(25.1%)。欧洲 来自学术界的人工智能出版物比例最高(55.3%)。 1.6 出版物 | 研究与开发| 2026 年人工智能指数报告 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0% 10% 20% 30% 40% 50% 60% 70% CS 领域的 AI 出版物(占总数的百分比) 3.33%, 其他 4.64%,非盈利性 11.47%, 工业 12.44%,政府 68.13%,学术界 2013-24 年按部门划分的计算机科学领域人工智能出版物(占总数的百分比) 来源:人工智能指数,2026 |图:2026年AI指数报告 图1.6.831 31 图 1.6.8 和图 1.6.9 中排除了隶属关系不明的出版物。 50.85% 24.46% 13.11% 11.58% 55.30% 17.27% 17.06% 10.38% 54.72% 25.10% 17.96% 2.22% 0% 10% 20% 30% 40% 50% 60% 政府 诺普特 工业 学术界 美国 欧洲 中国 人工智能出版物(占总数的百分比) 2024 年按部门和地理区域划分的计算机科学人工智能出版物(占总数的百分比) 来源:人工智能指数,2026 |图:2026年AI指数报告 图1.6.9 ===== 第54页 ===== 53 图1.6.1032 AI 指数使用以下来源的引用数据确定了 2021 年至 2024 年 100 篇被引用次数最多的 AI 出版物: OpenAlex.33 由于引用滞后,该集合可能会随着引用次数的积累而发生变化。34 出版量 上述数据反映了研究活动的规模,而前 100 名则提供了更具选择性的观点 工作正在获得最大的认可和影响力。 32 AI Index 使用自己的主题分类器对论文进行分类。可以为单个出版物分配多个主题标签。 33 完整的方法指南以及前 100 篇文章的列表可在附录中获取。 34 一份出版物可以有来自不同国家或组织的多名作者。如果一篇论文包括来自多个国家的作者,则每个国家 尝试记入一次。因此,本节中有些总数超过 100。 按主题 前 100 名出版物 2024 年的人工智能研究仍然集中在一小部分核心主题,尽管领域广泛 继续扩大。与去年类似,最流行的研究主题是机器学习 (37%),其次是计算机视觉(22.4%)、模式识别(11.2%)和自然语言处理 (10%)(图1.6.10)。关于生成人工智能的出版物继续呈现急剧增长趋势,延续了从 前几年。还值得注意的是,AI Index 主题分类器可以为一个主题分配多个主题标签。 单一出版物,因此主题总数可以被视为重叠类别而不是相互排斥的。 1.6 出版物 | 研究与开发| 2026 年人工智能指数报告 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0 50 100 150 200 人工智能出版物数量(万份) 5.01, 机器人 11.50, 逻辑与推理 13.97, 多代理系统 17.46, 进化计算 20.59, 基于知识的系统 34.21, 生成式人工智能 52.99, 自然语言处理 59.05, 模式识别 118.49,计算机视觉 195.89,机器学习 按选定热门主题划分的人工智能出版物数量,2013-24 来源:人工智能指数,2026 |图:2026年AI指数报告 按国家隶属关系 随着时间的推移,前 100 名的地理分布发生了变化(图 1.6.11)。美国依然排名第一 每年在被引用次数最多的出版物中名列前茅,但其份额逐渐从 2021 年的 64 份下降到 46 份 2024年,中国的份额从2023年的34增至2024年的41,澳大利亚的高被引增至14 出版物,从 2023 年的 2 份和 2021 年的 6 份增加。 ===== 第55页 ===== 54 1.6 出版物 | 研究与开发| 2026 年人工智能指数报告 46 41 15 14 9 8 7 6 5 4 50 34 7 7 6 5 4 2 2 2 58 34 7 6 6 5 4 3 3 2 64 33 10 8 7 7 6 4 4 1 0 2 4 6 8 10 12 14 16 18 20 22 24 26 28 30 32 34 36 38 40 42 44 46 48 50 52 54 56 58 60 62 64 66 印度 加拿大 新加坡 瑞士 德国 英国 澳大利亚 香港 中国 美国 2024年 2023年 2022年 2021年 前 100 名高被引出版物数量 2021-24 年按特定地理区域划分的前 100 名高被引出版物数量 来源:人工智能指数,2026 |图:2026年AI指数报告 图1.6.11 按部门和组织 前100强行业构成 与学术界保持一致 产生被引用次数最多的 出版物同比(图 1.6.12)。行业贡献下降 从 2021 年的 17 个和 2022 年的 19 个大幅增加到 到 2024 年,即使行业的份额达到 6 著名车型持续发布 成长(第 1.1 节)。组织机构 但分布情况因年份而异 产出仍然集中在 小型机构(图 1.6.13)。 2024年,斯坦福大学和谷歌 各发表七份出版物,并且 中国科学院和 微软紧随其后,每个 贡献五。 ===== 第56页 ===== 55 图1.6.1235 图1.6.1336 35 “其他”类别包括非工业界和学术界或工业界与学术界合作的部门和部门间合作 (例如,工业界和政府、学术界和非营利组织)。一些机构缺乏2021年的数据,因为他们没有论文进入前100名 那一年。由于论文可以有来自不同机构的多个作者,因此图1.6.13中的机构标签总数可能超过100个。同时,因为 其中两篇论文的作者在 2022 年的部门归属不明,图 1.6.12 中的出版物总数为 98 篇。 36所大学缩写如下: CUHK = 香港中文大学; HKU = 香港大学;华中科技大学=华中科技大学 科技大学; MIT=麻省理工学院; NTU Singapore = 新加坡南洋理工大学。 1.6 出版物 | 研究与开发| 2026 年人工智能指数报告 46 41 15 14 9 8 7 6 5 4 50 34 7 7 6 5 4 2 2 2 58 34 7 6 6 5 4 3 3 2 64 33 10 8 7 7 6 4 4 1 0 2 4 6 8 10 12 14 16 18 20 22 24 26 28 30 32 34 36 38 40 42 44 46 48 50 52 54 56 58 60 62 64 66 印度 加拿大 新加坡 瑞士 德国 英国 澳大利亚 香港 中国 美国 2024年 2023年 2022年 2021年 前 100 名高被引出版物数量 2021-24 年按特定地理区域划分的前 100 名高被引出版物数量 来源:人工智能指数,2026 |图:2026年AI指数报告 15 3 5 10 1 2 1 1 2 2 5 20 2 2 3 3 9 3 1 3 3 2 1 10 8 3 3 4 3 6 3 2 5 1 1 8 7 7 5 5 5 5 5 5 4 4 4 4 4 4 3 谷歌斯坦夫 奥德大学 y 香港中文大学中文 电子学院 的 S 科学 英语 香港大学微电子学 奥软件 北京大学 尼韦尔西特 y 天康 耳鼻喉科 亚马逊HUS 时间 洪康 翁乌 尼韦尔西特 y 的 科学 和T 技术 y 麻省理工学院南洋理工大学 因加波尔 e 辛格 UA大学 y 百度 0 2 4 6 8 10 12 14 16 18 20 22 2021年 2022年 2023年 2024年 组织机构 前 100 名高被引出版物数量 2021-24 年按组织排名前 100 名的高被引出版物数量 来源:人工智能指数,2026 |图:2026年AI指数报告 ===== 第57页 ===== 56 1.7 专利 1 研究与开发 | 2026 年人工智能指数报告 虽然出版物跟踪研究成果,但专利提供了对应用创新和商业的洞察 发展。本节探讨了全球人工智能专利随时间变化的趋势。专利可以提供另一种镜头 用于跟踪跨组织和地理区域的创新,特别是在应用人工智能环境中。类似 就出版物数据而言,人工智能专利数据的可用时间存在明显的延迟,预计 2024 年 最近一年可访问。该分析取自 PATSTAT Global(一个 欧洲专利局 (EPO) 提供的综合数据库37 图1.7.138 37 有关本节专利分析背后的方法的更多详细信息,请参阅附录。 38 专利标准和法律因国家和地区而异,因此应谨慎解读这些图表。更详细的国家级 专利信息将在人工智能指数全球活力工具的后续版本中发布。 全球趋势 全球范围内,授予的人工智能专利数量呈指数级增长,从2010年的3,866件增加到2024年的131,121件 (图1.7.1)。 2023 年至 2024 年间,专利授权量增长了 8.2%。中国占大多数,占74.2% 全球总数(图 1.7.2 和 1.7.3)。美国是第二大贡献者,占 12.1%(15,290 专利),其次是欧洲(3%)和印度(0.4%)。过去十年,美国的份额已 从2015年42.8%的峰值稳步下降,而中国的份额已从不到20%上升到目前的水平 水平。专利和出版物反映了研发渠道的不同阶段,因此中国在这两方面均处于领先地位,但并非如此 直接相关,这与前面描述的该国不断增长的研究存在是一致的。 当专利活动按人口规模标准化时,其他地区领导者就会出现(图 1.7.4)。在 2024 年,韩国人均授予人工智能专利数量最多(14.3%),其次是 卢森堡(12.3%)和中国(7.0%)。 131.12 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0 20 40 60 80 100 120 授予的人工智能专利数量(万) 2010 年全球授予的人工智能专利数量 - 24 来源:人工智能指数,2026 |图:2026年AI指数报告 ===== 第58页 ===== 57 1.7 专利 | 研究与开发| 2026 年人工智能指数报告 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0% 10% 20% 30% 40% 50% 60% 70% 授予的人工智能专利(占世界总量的%) 0.40%,印度 2.95%, 欧洲 10.35%, 世界其他地区 12.06%, 美国 74.24%,中国 2010-24 年按特定地理区域授予的人工智能专利(占世界总量的百分比) 来源:人工智能指数,2026 |图:2026年AI指数报告 图1.7 .2 图1.7 .3 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0 20 40 60 80 100 授予的人工智能专利数量(万) 0.53,印度 3.89,欧洲 13.66, 世界其他地区 15.92,美国 97.99, 中国 特定地理区域授予的人工智能专利数量,2010-24 来源:人工智能指数,2026 |图:2026年AI指数报告 ===== 第59页 ===== 58 1.7 专利 | 研究与开发| 2026 年人工智能指数报告 0.21 0.32 0.35 0.45 0.60 0.62 0.67 0.70 1.30 1.31 4.30 4.68 6.95 12.25 14.31 0 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 瑞士 丹麦 希腊 澳大利亚 英国 法国 芬兰 瑞典 德国 新加坡 日本 美国 中国 卢森堡 韩国 授予的人工智能专利(每10万居民) 2024 年按国家/地区每 10 万居民授予的人工智能专利数量 来源:人工智能指数,2026 |图:2026年AI指数报告 图1.7 .4 转发引文流 当新申请的专利引用了较早的专利时, 这些参考文献称为前向引用。 这些通常被用作影响力的代表,因为 它们表明一项发明后来通知的频率 工作。按照这一标准,美国的账户 超过一半的人工智能专利前向引用 下游影响的信号与 占专利总量的 12.1%(图 1.7.5)。中国 尽管产量最大但排名第二 专利数量大幅增加。关系 前向引用和技术之间 影响并不直接,被称为 存在疑问(Higham 等人,2021)。还有 所有国家都存在强烈的本土偏见 大多数引用发生在国内, 专利引用地理中记录的模式 (Jaffe 等人,1993 年;Cotterlaz 等人,2025 年;和 Verluise 等人,2025)。也就是说,跨境 流动不对称。中国专利被引用 经常出现在美国申请中,而美国专利则出现 在中国人中很少见。 ===== 第60页 ===== 59 1.7 专利 | 研究与开发| 2026 年人工智能指数报告 美国 美国 美国 美国 美国 中国 中国 中国 中国 中国 日本 日本 日本 日本 日本 韩国 韩国 韩国 韩国 韩国 欧洲 欧洲 欧洲 欧洲 欧洲 世界其他地区 世界其他地区 世界其他地区 世界其他地区 世界其他地区 美国(51.91%) 美国(51.91%) 美国(51.91%) 美国(51.91%) 美国(51.91%) 中国(29.81%) 中国(29.81%) 中国(29.81%) 中国(29.81%) 中国(29.81%) 日本(6.86%) 日本(6.86%) 日本(6.86%) 日本(6.86%) 日本(6.86%) 韩国(4.79%) 韩国(4.79%) 韩国(4.79%) 韩国(4.79%) 韩国(4.79%) 欧洲 (4.17%) 欧洲 (4.17%) 欧洲 (4.17%) 欧洲 (4.17%) 欧洲 (4.17%) 世界其他地区 (2.46%) 世界其他地区 (2.46%) 世界其他地区 (2.46%) 世界其他地区 (2.46%) 世界其他地区 (2.46%) 按地理区域划分的人工智能专利前向引用的全球分布,2010-24 来源:人工智能指数,2026 |图:2026年AI指数报告 引用国家 被引用国家 图1.7.539 39 图中的每个数据点都反映了对人工智能专利的前向引用,按专利族级别分组以代表独特的发明,而不是 个人备案。值表示为 2010 年至 2024 年间授予的所有人工智能专利前向引用的份额。 知识传播速度 专利引用滞后——专利公布和首次前向引用之间的时间——可用于 衡量知识在学科内传播的速度。对于人工智能专利,大多数都获得了首次引用 两到三年内,反映了相对较快的扩散。速度因国家/地区而异(图 1.7.6)。美国 随着时间的推移,专利往往会被更快、更一致地引用,相比之下,只有 19% 的专利未被引用 其他地理区域的比例为 32% 至 44%。日本的专利显示较早但影响较小,而来自 中国和韩国的初始引用速度较慢,但大约六年后,引用活动趋于稳定 遍布所有地区。模式与上面的前向引用数据一致,但引用存在差异 规范和本土偏见也可能发挥作用。 ===== 第61页 ===== 60 1.7 专利 | 研究与开发| 2026 年人工智能指数报告 0 1 2 3 4 5 6 7 8 9 10 0.00 0.20 0.40 0.60 0.80 1.00 自出版以来的年数 生存概率(尚未引用) 0.19,美国 0.32,日本 0.35,欧洲 0.42,韩国 0.44,中国 0.44,世界其他地区 按地理区域划分的人工智能专利知识传播速度 来源:人工智能指数,2026 |图:2026年AI指数报告 图1.7.640 技术接近度41衡量各国是否在类似类型的人工智能创新上趋同或 追求不同的道路。使用 Bar 等人提出的方法。 (2012),分析 42 比较了 每个国家的人工智能专利组合与两个最大的参考点(美国和中国)保持一致 (图1.7.7)。重叠的评分范围为 0(无相似性)到 1(相同)。大多数国家聚集在 右上角,这意味着他们的人工智能专利涵盖了与美国和中国相似的技术领域, 更加倾向于美国投资组合。例如,印度和澳大利亚的专利组合表明 两者有接近 80% 的重叠。丹麦与这两个参考点的相似度最低,只有 45% 与中国重叠,与美国重叠 52%。这是因为丹麦的人工智能专利 集中于能源和风能相关技术类别(专利代码 Y02E、F03D、F05B),而不是 主导美国和中国的核心计算和数据处理类别(G06F、G06N、G06K)。 虽然大多数国家的人工智能创新组合结构相似,但国家产业优势往往 影响人工智能的应用领域。 40 该图绘制了不被引用的概率,因此下降幅度较大的曲线表明滞后较短。 41 也称为最小互补邻近度量。 42 技术类别由国际专利分类 (IPC) 和合作专利分类 (CPC) 代码标识。 技术接近性 ===== 第62页 ===== 61 1.7 专利 | 研究与开发| 2026 年人工智能指数报告 澳大利亚 奥地利 巴西 中国 丹麦 欧洲专利局 芬兰 法国 希腊 印度 以色列 意大利 日本 卢森堡 马来西亚 荷兰 波兰 俄罗斯 南非 韩国 西班牙 瑞典 瑞士 台湾 美国 世界知识产权组织 0.40 0.50 0.60 0.70 0.80 0.90 1.00 0.40 0.50 0.60 0.70 0.80 0.90 1.00 靠近美国 距离中国较近 加拿大 新加坡 世界其他地区 德国 英国 人工智能专利组合与美国和中国的技术接近度,2010-24 来源:人工智能指数,2026 |图:2026年AI指数报告 图1.7 .7 亮点: 人工智能专利实例 1 专利CN111431996A:资源配置方法及装置、设备及介质, 2022年,中国 机器学习预测模型决定如何分配计算资源 集群中的多个服务。该系统从历史和实时信号中学习,例如 流量以及 CPU、内存和网络使用情况,以推断正确的资源配置。 这可以实现自动化、动态的扩展决策,而无需依赖手动规则。 2 专利US11436777B1:基于机器学习的危险可视化系统,2022年,美国 州 该系统训练机器学习模型来预测危险属性(时间、路径、严重程度) 具体位置并识别地理空间图像中的基础设施。它将模型输出结合到 对地图进行注释,显示危险与关键资产交叉的位置。系统还支持 因果推理——例如,识别反复受到灾害影响的基础设施。这些 能力依赖于学习的预测和图像识别模型,而不是确定性的 映射逻辑。 3 专利 US2023239456A1:具有基于 ML 的立体视图合成的显示系统 宽视野,2025,美国 这款头戴式显示器使用机器学习技术,包括深度估计和 重建——从外部相机创建透视正确的立体图像。神经 模型可以处理实时视觉挑战,例如遮挡、伪影减少和锐化 推断场景几何形状并填充相机视角无法与用户视角对齐的间隙 眼睛。 ML 是 VR/AR 直通渲染管道的核心组件。 ===== 第63页 ===== 62 上述出版物和专利反映了研究和开发成果。使用 Zeki 数据, 人工智能指数考察了作者和发明人的地理分布和流动模式 随着时间的推移,这项工作。本节涵盖的人工智能人才活动范围比更广泛的劳动力市场要小 第 4 章(经济)中讨论的指标。 Zeki 根据可观察到的数据来识别中国以外的人才 人工智能产出,例如研究、数据存储和新模型。该数据集涵盖 2010 年至 2025 年 北美、欧洲、亚洲、拉丁美洲和中东国家集团43 43 欲了解更多详情,请参阅附录。 1.8 人工智能作者和发明家 1 研究与开发 | 2026 年人工智能指数报告 地理分布 2025 年,已确定的人工智能作者和发明者中最大比例来自美国(220,520 人), 其次是印度(50,460)和德国(48,520)(图1.8.1)。英国 (34,370)、加拿大 (31,450)、法国(18,820)与澳大利亚、荷兰、意大利、巴西、瑞士、 以及其他构成更广泛贡献者分布的人。从人均数据来看 列出了人工智能活动水平相对较高的国家,但从总量来看,这些国家是不可见的 数量,如第 1.7 节中的人均专利数据所示。瑞士以 110.5 名人工智能作者领先, 每 10 万居民拥有发明家数量,紧随其后的是新加坡(109.5)(图 1.8.2)。较小的国家 芬兰(77.6)、荷兰(77.6)和丹麦(66.3)等人口排名高于大国 包括德国(58.1)和英国(49.6)。 3.09 3.43 3.90 4.38 5.19 5.96 6.28 6.61 8.52 9.17 9.98 11.10 13.23 13.96 14.54 18.82 31.45 34.37 48.52 50.46 220.52 0 10 20 30 40 50 60 70 80 90 100 110 120 130 140 150 160 170 180 190 200 210 220 230 阿拉伯联合酋长国 沙特阿拉伯 丹麦 芬兰 以色列 韩国 日本 新加坡 瑞典 西班牙 瑞士 巴西 意大利 荷兰 澳大利亚 法国 加拿大 英国 德国 印度 美国 顶级人工智能作者和发明家数量(以千计) 2025 年各国顶尖人工智能作者和发明家数量 来源:Zeki 数据,2025 |图:2026年AI指数报告 图1.8.1 ===== 第64页 ===== 63 1.8 人工智能作者和发明者 | 研究与开发| 2026 年人工智能指数报告 22.43 27.46 28.38 49.64 52.01 53.43 58.10 64.84 65.25 76.16 77.61 77.61 80.63 109.51 110.45 0 10 20 30 40 50 60 70 80 90 100 110 意大利 法国 阿拉伯联合酋长国 英国 以色列 澳大利亚 德国 美国 丹麦 加拿大 荷兰 芬兰 瑞典 新加坡 瑞士 顶尖人工智能作者和发明家(每 10 万居民) 2025 年每 10 万居民中顶尖人工智能作者和发明家(按国家/地区划分) 来源:Zeki 数据,2025 |图:2026年AI指数报告 图1.8.2 按教育程度 顶尖人工智能作者和发明家的教育背景 因国家而异,但在大多数国家, 博士和硕士学位一起 到2025年将占大多数(图1.8.3)。的 英国(51.1%)和澳大利亚(50.5%) 博士持有者比例最高,其次是瑞士 (43.6%)、韩国(42.5%)、美国 (42%)。印度和巴西的分布更加多样化, 博士持有者比例相对较低, 更广泛地传播到其他学位级别。 ===== 第65页 ===== 64 1.8 人工智能作者和发明者 | 研究与开发| 2026 年人工智能指数报告 2010 2015 2020 2025 0% 20% 40% 60% 80% 2010 2015 2020 2025 0% 20% 40% 60% 80% 2010 2015 2020 2025 0% 20% 40% 60% 80% 2010 2015 2020 2025 0% 20% 40% 60% 80% 2010 2015 2020 2025 0% 20% 40% 60% 80% 2010 2015 2020 2025 0% 20% 40% 60% 80% 2010 2015 2020 2025 0% 20% 40% 60% 80% 2010 2015 2020 2025 0% 20% 40% 60% 80% 2010 2015 2020 2025 0% 20% 40% 60% 80% 2010 2015 2020 2025 0% 20% 40% 60% 80% 2010 2015 2020 2025 0% 20% 40% 60% 80% 2010 2015 2020 2025 0% 20% 40% 60% 80% 2010 2015 2020 2025 0% 20% 40% 60% 80% 2010 2015 2020 2025 0% 20% 40% 60% 80% 2010 2015 2020 2025 0% 20% 40% 60% 80% 2010 2015 2020 2025 0% 20% 40% 60% 80% 2010 2015 2020 2025 0% 20% 40% 60% 80% 2010 2015 2020 2025 0% 20% 40% 60% 80% 2010 2015 2020 2025 0% 20% 40% 60% 80% 2010 2015 2020 2025 0% 20% 40% 60% 80% 2010 2015 2020 2025 0% 20% 40% 60% 80% 澳大利亚 巴西 加拿大 丹麦 芬兰 法国 德国 印度 以色列 意大利 日本 荷兰 沙特阿拉伯 新加坡 韩国 西班牙 瑞典 瑞士 阿拉伯联合酋长国 英国 美国 50.46%,博士 25.70%,MA/MS 14.81%, 学士/学士 8.68%, 其他 0.30%,文凭 0.05%,HS 41.85%, 其他 31.60%,MA/MS 18.16%,博士 8.16%,学士/学士 0.18%,HS 0.05%, 文凭 39.90%,MA/MS 36.56%,博士 12.52%, 其他 10.74%, 学士/学士 0.21%, 文凭 0.07%,HS 38.75%,博士 38.72%, 硕士/硕士 16.66%, 其他 5.68%,学士/学士 0.17%, 文凭 0.03%,HS 44.63%, 硕士/硕士 36.09%,博士 15.82%, 其他 3.26%,学士/学士 0.13%, 文凭 0.08%,HS 40.65%,博士 34.19%, 硕士/硕士 23.64%, 其他 1.27%,学士/学士 0.16%, 文凭 0.08%,HS 45.34%, 硕士/硕士 25.83%,博士 23.77%, 其他 3.91%,学士/学士 1.04%, 文凭 0.11%,HS 34.54%,MA/MS 33.83%, 学士/学士 18.52%,博士 12.85%, 其他 0.20%,HS 0.07%, 文凭 39.94%, 硕士/硕士 32.54%,博士 17.05%, 其他 10.39%, 学士/学士 0.06%, 文凭 0.02%,HS 33.91%,博士 30.44%, 其他 29.57%, 硕士/硕士 3.92%, 文凭 1.82%,学士/学士 0.34%,HS 35.70%,博士 34.84%, 硕士/硕士 22.28%, 其他 7.16%,学士/学士 0.02%,HS 0.02%, 文凭 49.33%, 硕士/硕士 29.78%,博士 15.22%, 其他 5.44%,学士/学士 0.14%, 文凭 0.10%,HS 38.71%,博士 31.02%, 硕士/硕士 22.37%, 学士/学士 7.58%, 其他 0.21%, 文凭 0.10%,HS 35.99%,博士 32.98%,MA/MS 19.58%, 学士/学士 10.96%, 其他 0.35%, 文凭 0.14%,HS 42.50%,博士 31.76%,MA/MS 16.00%, 其他 9.60%,学士/学士 0.11%,HS 0.02%, 文凭 39.14%,博士 32.36%,MA/MS 24.70%, 其他 3.17%,学士/学士 0.49%, 文凭 0.15%,HS 42.08%, 硕士/硕士 34.03%,博士 18.15%, 其他 5.49%,学士/学士 0.13%, 文凭 0.12%,HS 43.63%,博士 33.92%, 硕士/硕士 19.02%, 其他 3.00%,学士/学士 0.33%, 文凭 0.10%,HS 38.90%,MA/MS 32.59%,博士 19.08%, 学士/学士 9.13%, 其他 0.19%, 文凭 0.11%,HS 51.13%,博士 26.09%, 硕士/硕士 13.80%, 其他 8.66%,学士/学士 0.23%, 文凭 0.09%,HS 41.99%,博士 34.28%,MA/MS 12.51%, 学士/学士 11.01%, 其他 0.14%,HS 0.06%, 文凭 按教育程度划分的人工智能作者和发明者百分比 2010-25 年顶尖人工智能作者和发明家按教育程度和国家划分的百分比 来源:Zeki 数据,2025 |图:2026年AI指数报告 图1.8.3 ===== 第66页 ===== 65 1.8 人工智能作者和发明者 | 研究与开发| 2026 年人工智能指数报告 按性别 人工智能作者和发明者之间的性别差距在所有国家都很明显,其中男性占主导地位 尽管差距大小有所不同,但在所有情况下都是大多数(图 1.8.4)。在巴西、韩国和日本,更多 超过 80% 的人工智能人才是男性。沙特阿拉伯的女性比例较高(32.3%), 澳大利亚(30.1%)、加拿大(29.6%)和意大利(29.5%),但没有一个国家能接近这一水平。更重要的是, 从 2010 年到 2025 年,几乎每个国家的男女比例都保持平稳。 总体而言,人工智能人才在性别平衡方面尚未取得有意义的进展。第 7 章(教育)描述 在人工智能相关学位的获得方面也存在类似的模式,女性在各个级别的代表性仍然不足。 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 2010 2015 2020 2025 0% 20% 40% 60% 80% 100% 澳大利亚 巴西 加拿大 丹麦 芬兰 法国 德国 印度 以色列 意大利 日本 荷兰 沙特阿拉伯 新加坡 韩国 西班牙 瑞典 瑞士 阿拉伯联合酋长国 英国 美国 顶尖人工智能作者和发明家(占总数的百分比) 2010-25 年按性别划分的顶尖人工智能作者和发明家(占总数的百分比) 来源:Zeki 数据,2025 |图:2026年AI指数报告 69.73%, 男性 30.27%,女性 80.16%, 男性 19.84%,女性 70.41%, 男性 29.59%,女性 77.83%, 男性 22.17%,女性 73.23%, 男性 26.77%, 女性 74.92%, 男性 25.08%,女性 78.24%, 男性 21.76%, 女性 71.96%, 男性 28.04%, 女性 78.43%, 男性 21.57%,女性 70.47%, 男性 29.53%,女性 82.50%, 男性 17.50%,女性 73.43%, 男性 26.57%,女性 67.72%, 男性 32.28%,女性 73.11%, 男性 26.89%,女性 81.44%, 男性 18.56%, 女性 77.38%, 男性 22.62%,女性 75.13%, 男性 24.87%, 女性 78.45%, 男性 21.55%,女性 73.83%, 男性 26.17%,女性 72.57%, 男性 27.43%,女性 72.35%, 男性 27.65%,女性 图1.8.4 ===== 第67页 ===== 66 1.8 人工智能作者和发明者 | 研究与开发| 2026 年人工智能指数报告 按专业分 移动性 人工智能作者和发明者分布在一系列专业领域,尽管每个国家都显示 它有自己的侧重点(图1.8.5)。医疗保健和生物信息学、计算机视觉和图像处理、 软件工程是全球最常见的领域之一,占到了 10% 或更多 多个国家的泳池。一些国家层面的模式与本章前面讨论的发现相关。 例如,韩国在硬件、VLSI 和物联网领域的人才比例最高 (20%),这与 它在半导体供应链中的作用如第 1.3 节所述。巴西的软件份额最高 工程人才(18%),而沙特阿拉伯在安全、隐私和密码学方面领先(15%)。 流动性是通过净流量来衡量的,净流量是人工智能作者数量和人工智能作者数量之间的差异。 移居或移出各自国家的发明家(图 1.8.6)。美国仍保持净值 自 2020 年以来一直为正数,这意味着吸引的人才多于流失的人才,尽管规模已从 2022 年峰值为 324.6,到 2025 年为 26.0。大多数其他国家的运营规模较小。沙特阿拉伯 (3.1) 和 丹麦 (2.1) 是少数几个 2025 年净流量为正的国家之一。 加拿大在 2020 年左右呈现强劲流入,到 2025 年下降至 -7.1。德国也呈现负值 净流量为 -2.4,而印度 2025 年的净流出量最大,为 -16.9。这些流量与 其他因素的背景,包括移民政策和投资的地理分布 就业,将在第 4 章有关劳动力市场的部分中进一步讨论。 图1.8.5 ===== 第68页 ===== 67 1.8 人工智能作者和发明者 | 研究与开发| 2026 年人工智能指数报告 2010 2015 2020 2025 −40 −20 0 20 40 2010 2015 2020 2025 −40 −20 0 20 40 2010 2015 2020 2025 −40 −20 0 20 40 2010 2015 2020 2025 −40 −20 0 20 40 2010 2015 2020 2025 −40 −20 0 20 40 2010 2015 2020 2025 −40 −20 0 20 40 2010 2015 2020 2025 −40 −20 0 20 40 2010 2015 2020 2025 −350 −300 −250 −200 −150 −100 −50 0 50 2010 2015 2020 2025 −40 −20 0 20 40 2010 2015 2020 2025 −40 −20 0 20 40 2010 2015 2020 2025 −40 −20 0 20 40 2010 2015 2020 2025 −40 −20 0 20 40 2010 2015 2020 2025 −40 −20 0 20 40 2010 2015 2020 2025 −40 −20 0 20 40 2010 2015 2020 2025 −40 −20 0 20 40 2010 2015 2020 2025 −40 −20 0 20 40 2010 2015 2020 2025 −40 −20 0 20 40 2010 2015 2020 2025 −40 −20 0 20 40 2010 2015 2020 2025 −40 −20 0 20 40 2010 2015 2020 2025 −40 −20 0 20 40 2010 2015 2020 2025 0 50 100 150 200 250 300 350 澳大利亚 巴西 加拿大 丹麦 芬兰 法国 德国 印度* 以色列 意大利 日本 荷兰 沙特阿拉伯 新加坡 韩国 西班牙 瑞典 瑞士 阿拉伯联合酋长国 英国 美国* -1.75 -3.58 -7.08 2.08 -1.08 0.08 -2.42 -16.92 -1.92 0.00 0.00 -1.83 3.08 -2.58 -1.75 2.58 -0.58 0.25 2.58 5.17 26:00 网络顶级人工智能作者和发明家(12 个月滚动平均值) 各国顶级人工智能作者和发明人网络,2010-25 来源:Zeki 数据,2025 |图:2026年AI指数报告 图1.8.644 44 星号表示某个国家/地区的 y 轴标签的缩放比例与其他国家/地区的 y 轴标签不同。 ===== 第69页 ===== 68 技术 性能 2 2026 年人工智能指数报告 概述 2025年AI模型快速改进,基准分数 在语言、推理、编码和数学方面不断进步。然而, 评估的进展速度赶不上评估的进展速度 来衡量,基准面临着越来越多的问题 可靠性。即使存在这些限制,仍然出现了一个清晰的模式: 顶级车型之间的差距正在缩小。这种收窄 随着美国和美国顶尖之间的距离在地理上延伸 中国模式几乎完全关闭。有能力 不再是明显的差异化因素,竞争压力正在发生变化 成本、可靠性和现实世界的实用性。在专业方面 领域、税务评估、法律推理和公司 金融在某些领域的表现优于其他领域。 人工智能系统的功能范围也在不断扩大。人工智能 代理正在改进,但大约三分之一的尝试仍然失败。 视频生成模型不再只是产生现实 - 寻找内容;有些人开始了解身体如何 世界实际上运转良好,进步可以帮助将人工智能带入 物理空间。这种转变还为时尚早,因为机器人正在挣扎 在非结构化环境中,尽管自动驾驶汽车 一个值得注意的例外,已达到大规模部署 具有良好的早期安全记录。总体而言,人工智能的技术 进步是一个关于奇迹和速度的故事,比 许多评估、治理和采用框架 在后面的章节中讨论。 ===== 第70页 ===== 69 2 技术性能| 2026 年人工智能指数报告 章节亮点 时间表:重要模型发布 2.1 总体性能趋势 技术性能 基准与人类 性能 封闭式与开放式重量模型 美国与中国技术表现 模型性能收敛于 边疆 人工智能基准测试 2.2 语言 理解 MMLU:大规模多任务 语言理解 一代 竞技场排行榜 专门的语言任务 RAG:检索增强 一代 伯克利函数调用 排行榜 MTEB:海量文本 嵌入基准 亮点:之间的差距 长上下文窗口和 深入理解 2.3 图像和视频 理解 MVBench 视频-MMMU 一代 竞技场:愿景 71 73 75 75 76 77 78 78 81 81 81 82 82 83 83 84 85 86 87 87 87 88 89 90 内容 视频工作台 VBench-2.0 亮点:视频方面的进展 一代 2.4 推理 一般推理 MMMU:一个大规模的多 多式联运 理解与推理 专家 AGI 基准 GPQA:研究生水平 Google-Proof 问答基准 ARC-AGI-2 人类的最后考试 亮点:时间理解 在 MLLM 中 规划 计划台 2.5 特定领域的表现 软件 SWE-长凳 终端长凳 Vibe 代码台 数学 前沿数学 数学竞技场 亮点:定理证明 金融 税务评估 抵押税 企业金融公司 财务代理 法律 判例法 90 91 92 93 93 93 94 95 95 96 98 98 100 100 100 101 102 103 103 103 104 106 106 107 108 109 110 110 ===== 第71页 ===== 70 内容 | 2 技术性能| 2026 年人工智能指数报告 法律法庭 2.6 人工智能代理 盖亚 操作系统世界 网络竞技场 MLE 工作台 赛基 τ-长凳 2.7 机器人和自主运动 机器人技术 RLBench 行为-1K 亮点:人形机器人 亮点:物理人工智能和基础 机器人模型 自动驾驶汽车 部署 技术创新和新基准 安全 111 112 112 113 113 114 115 115 116 116 116 116 118 120 121 121 122 123 ===== 第72页 ===== 71 内容 1 人工智能能力正在超越旨在衡量它的基准,并超越人类水平 性能。 Frontier 模型在 Humanity’s Last 上一年内增长了 30 个百分点 Exam,一个对人工智能来说很难但对人类专家有利的基准。评估旨在 多年来的挑战在几个月内就饱和了,压缩了基准测试的窗口 对于跟踪进度仍然有用。 2 顶级模型表现正在趋同,目前有 4 家公司聚集在 25 个 Elo 点内 (受到国际象棋评级的启发)在竞技场中通过人类投票进行相互评级 排行榜和基准。截至 2026 年 3 月,Anthropic (1,503)、xAI (1,495)、Google (1,494)、 OpenAI(1,481)、阿里巴巴(1,449)和 DeepSeek(1,424)均占据 Arena Elo 的榜首 评级,将竞争压力转向成本、可靠性和特定领域的性能。 3 开放权重表现差距在前一年短暂缩小后,于 2025 年重新拉开。作为 截至 2026 年 3 月,顶级封闭权重模型领先顶级开放权重模型 3.3%,高于 2024 年 8 月为 0.5%。竞技场排行榜前 10 名的模型中有 6 个现在是平重模型。 4 中美人工智能模型性能差距已有效缩小。 美国和中国型号 自 2025 年初以来,业绩排名榜首多次互换。 2025年,DeepSeek-R1短暂追平美国顶级型号。截至 2026 年 3 月,美国顶级模特 领先2.7%,差距在过去一年中有所波动,但仍保持在个位数。 5 用于衡量人工智能进展的基准面临着日益增长的可靠性和游戏问题, 在广泛使用的评估中,错误率高达 42%。评论发现问题率无效 范围从 MMLU Math 的 2% 到 GSM8K 的 42%。单独的研究表明竞技场 排行榜排名可能部分反映了对平台的适应而不是一般能力。 6 视频生成模型开始捕捉对象的行为方式。谷歌 DeepMind 的 Veo 3 在超过 18,000 个生成的视频中进行了测试,展示了模拟等功能 浮力和解决迷宫,而无需接受这些任务的培训。 7个AI模型可以在国际数学奥林匹克竞赛中获得金牌但仍然无法 可靠地告诉时间,说明了研究人员所说的锯齿状智力。双子座深思熟虑 在 2025 年 IMO 上获得 35 分(金奖),在 4.5 分以内以自然语言进行端到端工作 小时时间限制,高于 2024 年达到的 28 分银牌。在 ClockBench 上,顶级模型显示 模拟时钟的准确率为 50.1%,而人类的正确率为 90.1%。 8个AI模型正在向专业领域扩展,表现从60 在税务、抵押贷款处理、公司财务和法律推理方面的评估达到 90%。 排名前 15 的机型的性能差距仅为 3 个百分点 基准。 这些需要高能力和可靠性的领域仍然是一个 对AI模型来说是巨大的挑战。 章节亮点 2 技术性能| 2026 年人工智能指数报告 ===== 第73页 ===== 72 9 10 11 人工智能代理在 2025 年从回答问题发展到完成任务,但仍然失败 大约三分之一的结构化基准尝试。在 OSWorld 上测试代理 跨操作系统的真实计算机任务,准确率从大约 12% 上升到 66.3%,在 6 年内 人类绩效的百分比。 机器人在大多数家务劳动中仍然失败,尽管它们在受控环境中表现出色。机器人 仅能成功完成 12% 的实际家务劳动,突显人工智能距离掌握体力劳动还有多远 世界。在 RLBench 上,基于软件的模拟中的机器人操作已达到 89.4% 的成功率, 但可预测的实验室环境和不可预测的家庭环境之间存在巨大差距。 自动驾驶汽车将于 2025 年实现大规模部署。Waymo 达到约 每周 450,000 次穿越美国五个城市的旅行。在中国,Apollo Go 累计完成 1100 万次 无人驾驶乘车量同比增长 175%。欧洲运营商活跃但具有可比性 部署数据不公开,限制了全球情况。到目前为止的部署是 在天气普遍有利且人类可以在场外接管的地区 必要的。 章节亮点 | 2 技术性能| 2026 年人工智能指数报告 ===== 第74页 ===== 73 74 时间轴:重要模型 发布 GPT-5.1 在以下两个方面都做出了重大改进: 能力和效率。它的运行速度比 GPT-5 更快, 在编码和推理基准上得分更高 (例如,在 SWE 基准验证上约为 76.3% vs. 72.8%), 并根据 任务复杂性。 Gemini 2.5 是 2.0 的重大更新 将上下文扩展至 100 万个代币,交付强劲 推理和编码结果(例如,约 63.8% SWE-Bench 验证),并在 LMArena 上排名第一。 克劳德十四行诗 4.5 标志着现实的重大飞跃—— 世界能力——在 OSWorld 上达到 61.4% 计算机使用任务,SWE-bench 上超过 77.2% 已验证。它还推出了新工具,包括 检查点、VS Code 扩展、内存编辑、 和 Claude Agent SDK,使开发人员能够 构建长期运行的自主工作流程。 2025 2026 谷歌深度思维 深度搜索 英伟达 人工智能 开放人工智能 GPT-5.1 多式联运 DeepSeek R1引入了强化学习 称为 GRPO 的方法,用于训练推理 无需依赖标记数据或单独的能力 批评家模型。通过比较生成的组 根据预定义规则输出,该方法 降低训练复杂性。模型很强 相对于更高成本系统的性能 一些投资者重新评估竞争动态 人工智能领域。发布后,美国各大 科技股出现暂时下跌 市值超万亿美元 担心更有效的培训方法可能会 影响现有的商业模式。 DeepSeek-R1 法学硕士 双子座2.5专业版 多式联运 克劳德十四行诗 4.5 法学硕士 米斯特拉尔 阿里云 元 AI21实验室 构建.ai 跑道 2 技术性能| 2026 年人工智能指数报告 2025 年 11 月 12 日 2025 年 3 月 25 日 2025 年 9 月 29 日 2025 年 1 月 20 日 ===== 第75页 ===== 75 2.1 总体性能趋势 本节从模型达到人类水平的速度来研究人工智能性能的模式 领先模式和国家之间的竞争如何缩小的基线。它还评估在哪里 用于衡量这一进展的工具本身是不够的。为了能够进行不同的比较 评估任务、绩效指标被缩放到一个共同的参考点。缩放方法, 由 AI Index 团队开发,校准每个基准,以便在给定的情况下表现最佳的模型 年以该任务既定人类基线的百分比来衡量。例如,使用 在这种方法中,值 105% 表示模型的性能比人类基线好 5%。的 此分析中包含的基准代表可以进行结构评估的任务。可能不完全 捕获现实世界人工智能部署所需的广泛功能。 AI 基准测试小节 本节稍后将详细探讨这些限制。 2 技术性能| 2026 年人工智能指数报告 2025 年,人工智能性能在一系列广泛的基准类别中继续提高,其中一些 最大的进步出现在几年前远低于人类基线表现的任务上 (图2.1.1)。 Frontier 系统现在达到或超过了长期运行时既定的人类绩效水平 基准测试,包括 ImageNet、SuperGLUE 和 MMLU。自去年的报告以来,多项基准 旨在测试更高级的推理是否已达到或接近人类基准,包括 博士级科学问题(GPQA Diamond)、多模态推理(MMMU)和数学推理 (艾梅)。模型在自主软件工程领域的表现仍然低于基线 (SWE-bench Verified)和基于代理的多模式计算机使用(OSWorld),但改进的速度 正在迅速加速。例如,在 SWE-bench Verified 上,性能从去年的大约 60% 上升到 2024年到2025年接近100%。 技术绩效基准与人类绩效 ===== 第76页 ===== 76 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0% 20% 40% 60% 80% 100% 120% 图像经典化 (ImageNet Top-5) 视觉推理 (VQA) 英语语言理解 (SuperGLUE) 中等阅读理解 (SQuAD 2.0) 多任务语言理解 (MMLU) 竞赛级数学 (MATH) 博士级科学问题(GPQA 钻石级) 多模态理解和推理 (MMMU) 代理多模式计算机使用 (OSWorld) 数学推理 (AIME) 自主软件工程(SWE-bench Veried) 相对于人类基线的性能 (%) 人类基线 选择 AI Index 技术性能基准与人类性能对比 来源:人工智能指数,2026 |图:2026年AI指数报告 2.1 整体表现趋势| 技术性能| 2026 年人工智能指数报告 图2.1.11 1 在图 2.1.1 中,对这些值进行了缩放,以建立用于比较不同基准的标准指标。缩放函数经过校准,使得 每年最佳模型的性能以给定任务的人类基线的百分比来衡量。值为 105% 表示,对于 例如,模型的性能比人类基线好 5%。 过去,领先的封闭式重量模型和开放式重量模型之间的性能差距一直在波动 三年来,开放式重量系统逐渐接近,然后随着新的专有模型的出现而落后 发布(图2.1.2)。 2023年5月,领先的封闭权重模型(GPT-4-0314)表现优于顶级 开放重量模型 (Vicuna-13B) 在竞技场排行榜上高出 174 分 (15.2%)。更强的开放重量 包括 Mixtral、WizardLM 和 Llama-3.1-405B 在内的版本将差距缩小到仅 7 个百分点 (0.5%) 2024 年 8 月。在过去的一年里,随着新的封闭重量前沿系统的到来,这一趋势发生了逆转 例如o1-preview和Gemini 2.5 Pro。截至 2026 年 3 月,顶级封闭重量型号 Claude Opus 4.6 (1,503),领先顶级开放权重模型 GLM-5 (1,454) 49 个点 (3.4%)。虽然封闭重量模型仍然 领先的开放重量模型比几年前更具竞争力。 封闭式与开放式重量模型 ===== 第77页 ===== 77 2.1 整体表现趋势| 技术性能| 2026 年人工智能指数报告 2023年-2023年5月-2024年9月-2024年1月-2024年5月-2025年9月-2025年1月-2025年5月-2026年9月-1月 1,100 1,150 人 1,200 1,250 人 1,300 1,350 人 1,400 1,450 1,500 人 1,550 人 竞技场得分(类 Elo) 1,454,顶开型号 1,503,顶部封闭型号 顶级封闭式模型与开放式模型在 Arena 上的表现 来源:竞技场,2026 |图:2026年AI指数报告 GPT-4-0314 gpt-4-0125-预览 o1-预览 gpt-5-高 克劳德作品 4-6 思考 vicuna-13b mixtral-8×7b-指令-v0.1 骆驼-3.1-405b-指令-fp8 qwen3-235b-a22b-指令-2507 GLM-5 图2.1.22 图2.1.33 2 来源:Arena 历史排行榜(公开,风格控制开启),2026 年 3 月导出。 3 来源:Arena 历史排行榜(公开,风格控制开启),2026 年 3 月导出。 美国在2023年的大幅领先优势到2025年初大幅缩小,表现差距已经缩小 此后一直保持狭窄状态(图 2.1.3)。 2025 年 2 月,DeepSeek-R1(1,400)落后于领先的美国 模型 (o1-2024-12-17, 1,405) 仅增加 5 竞技场点 (0.4%)。截至2026年3月,美国顶级模特(Claude Opus 4.6,1,503)领先中国顶级模型(Dola-Seed-2.0 Preview,1,464)39个点(2.7%)。超过 去年,这一差距在接近平价和低个位数之间波动。这种融合尤其 值得注意的是,它产生于两个不同的发展环境和体制背景, 包括第一章中探讨的研究动态和第四章中讨论的投资模式。 美国与中国技术表现 2023年-2023年5月-2024年9月-2024年1月-2024年5月-2025年9月-2025年1月-2025年5月-2026年9月-1月 1,000 1,100 1,200 1,300 1,400 1,500 人 竞技场得分(类 Elo) 1,464,中国顶级模特 1503,美国顶级模特 美国顶级模特VS中国模特在竞技场上的表现 来源:竞技场,2026 |图:2026年AI指数报告 GPT-4-0314 o1-预览 双子座3-pro 克劳德作品 4-6 chatglm-6b qwen-14b-聊天 glm-4-0520 深度搜索-R1 qwen3-235b-a22b-指令-2507 dola-seed-2.0-预览 ===== 第78页 ===== 78 图2.1.44 4 来源:Arena 历史排行榜(公开,风格控制开启),2026 年 3 月导出。 2.1 整体表现趋势| 技术性能| 2026 年人工智能指数报告 在过去的一年里,随着多家公司进入前沿模型,前沿模型变得更加紧密地聚集在一起。 竞技场排行榜顶部的表现区间非常窄(图 2.1.4)。 2023年初,OpenAI 与谷歌的 1,117 分相比,其顶级模型得分为 1,322 分,遥遥领先。这一差距稳步缩小 到 2024 年,Google、Anthropic 和其他公司都会发布更强大的模型。到 2025 年 2 月,DeepSeek 在竞技场上曾短暂追平并超越美国顶级系统。在去年的报告中,排名前四的车型 跨度约为 97 分,截至 2026 年 3 月,排名前四的型号之间的差距不到 25 分。 Anthropic 以 1,503 分领先,紧随其后的是 xAI (1,495)、谷歌 (1,494) 和 OpenAI (1,481)。深度搜索 (1,424) 阿里巴巴(1,449)则稍稍落后。自 2025 年初以来,Meta 的 Arena 表现已趋于平缓,反映出 尽管 2026 年可能会推出新型号,但竞争性版本的发布速度会放缓。 基准性能、成本、延迟、可靠性等因素变得更加难以区分 特定领域的优化可能在用户采用方面发挥更大的作用。 基准仍然是衡量人工智能技术进步的大部分标准,但它们的局限性更多 可见。自去年的报告以来,人工智能指数扩大了分析范围,以检查基准仍处于何处 有用的地方,以及它们的不足之处。 本报告前几个版本中强调的一些挑战仍然存在。基准饱和度,其中 模型的得分如此之高以至于测试无法再区分它们,这仍然是一个问题。测试 在系统超越它们之前,设计得更难的技术通常只能发挥几年的作用。作为章节 1 文件中,报告差异仍然存在,最有能力的现代模型现已跻身其中 模型性能趋于前沿 人工智能基准测试 2023年-2023年5月-2024年9月-2024年1月-2024年5月-2025年9月-2025年1月-2025年5月-2026年9月-1月 1,000 1,100 1,200 1,300 1,400 1,500 人 竞技场分数(类似 Elo)1,335,Meta 1,416,米斯特拉尔人工智能 第1,424章 1,449, 阿里巴巴 1,481, 开放人工智能 1,494, 谷歌 1,495, xAI 1,503,人择 由精选提供商提供的顶级模型在 Arena 上的表现 来源:竞技场,2026 |图:2026年AI指数报告 ===== 第79页 ===== 79 2.1 整体表现趋势| 技术性能| 2026 年人工智能指数报告 最不透明的。日益增长的不透明度和不标准的提示技术使得模型之间 比较不可靠,第三方评估记录了模型表现更好的案例 与开发人员报告的结果相比,独立测试的结果很差。此外,污染——当 模型在训练期间暴露于测试集数据,可能会导致分数错误地夸大。 2025年,Meta面临 批评其 Llama 4 模型使用专门的变体进行优化,以提高排行榜排名 并且可能接受过基准测试数据的培训,尽管该公司对这些说法提出了异议。另外, 对广泛使用的基准的审计表明,许多基准的构建仍然很差,没有足够的 文档,没有统计意义的报告,并且缺乏复制脚本。即使当 基准分数在技术上是有效的,强大的基准性能并不总是转化为真实的 世界效用。 去年的报告还强调了对更复杂的交互式形式进行基准测试是多么困难 智能,这对于当前的人工智能系统来说更为重要。尽管多智能体的许多基准 协调、人机交互、工具使用代理和物理世界机器人技术已经被提出 (例如,对于机器人操作、具身推理和代理任务),它们仍然不发达。这些 域本质上更难标准化,因为物理任务涉及不可预测的环境、多样化的环境 硬件,以及一系列可抵抗重复评分的有效方法。本章后面的部分报告 详细了解其中几个基准。 基准测试领域已经出现了一些超越这些反复出现的发展 的担忧。首先,越来越多的案例需要衡量人类与人工智能的协作,而不是衡量 孤立的 AI 性能。最广泛使用的基准测试系统无需人工参与,甚至 尽管许多实际部署涉及人员监督、指导和集成人工智能输出。最近 工作认为,该领域应该采用半人马评估,即人类和人工智能共同进行的评估 解决任务,因为这些更好地反映实际使用并允许测量以人为本的品质,例如 传统基准测试忽略的可解释性和有用性。 二是新方法不断涌现 解决无效的基准问题。 斯坦福大学研究人员的评论 确定无效比例 九个广泛使用的问题 基准,错误率范围 从 MMLU 数学 2% 到 42% GSM8K(图2.1.5)。 Truong 等人, 2025年,引入了一个框架,使用 响应模式的统计分析 标记有问题的项目供专家审查, 精度高达 84%。分别地, Cheng等人,2025,提出了 转向“证书级”,同行 基于的评估框架是 社区管理、监督系统 在安全的环境下,不断地 刷新测试项目,延迟结果 披露。 MMLU数学 OpenBookQA MMLU客户端 MMLU医学 空气凳 医学质量保证 泰语考试 MMLU 5Sub GSM8K 0% 10% 20% 30% 40% 基准测试 精度@50 2% 2% 6% 6% 9% 23% 26% 31% 42% 九个基准测试中的无效问题检测 资料来源:Truong 等人,2025 |图:2026年AI指数报告 图2.1.5 ===== 第80页 ===== 80 2.1 整体表现趋势| 技术性能| 2026 年人工智能指数报告 第三,人们对流行的公共基准测试平台的可靠性提出了质疑,例如 竞技场。最近的一项分析(Singh 等人,2025)认为平台动态可能会影响排名准确性。 如果提供者能够在公共记录之外迭代或交换模型变体,则它会引入选择 使比较变得不那么直接的影响。该研究还指出了数据访问不对称和 表明额外的 Arena 式交互数据可以提高 Arena 派生评估的性能, 表明排行榜排名可能部分反映了对平台的适应而不是总体情况 单独的能力。 最后,虽然能力评估很普遍,但社会影响评估仍然分散 并且不完整。 Reul 等人,2025,发现开发商对偏见和环境影响的报告是 往往稀疏且不断下降,而第三方研究人员更严格地评估有害物质等危害 内容和表现上的差异。因为只有开发者才能公开数据的关键信息, 劳工实践和培训基础设施,当前的评估实践提供了一个强有力的图景 模型对其社会后果的解释能力要弱得多。第 3 章探讨负责任的人工智能 评估更加详细。 在本章中,AI 指数继续将基准报告作为技术进步的关键指标。 分数来自排行榜、公共存储库和公司披露信息,包括论文、 博客文章和产品发布。 AI 指数假设公司报告的结果是准确的。全部 分数反映了截至 2026 年初该领域的状况;后续发布的型号可能已经超越了这些 基准。 ===== 第81页 ===== 81 2.2 语言 语言理解和生成继续作为现代人工智能的基础能力 系统。本节研究模型如何执行需要理解复杂文本的任务, 产生连贯的响应,并执行专门的基于语言的操作。基准测试 还涵盖通用问答到特定技术功能,例如函数调用和文本 嵌入。 2 技术性能| 2026 年人工智能指数报告 语言理解基准 衡量模型的表现如何 对文本进行理解和推理 涵盖广泛的主题,从 人文学科到高技术学科 材料。由于性能已 改进了,评价转向 较难的测试集不太容易受到影响 达到熟悉或记忆的目的。目标 是跟踪模型改进的地方 而不是达到上限 当前的基准测试工具。 MMLU 仍然是广泛引用的跨学科广泛知识的衡量标准。于 2024 年推出, MMLU-Pro 基准测试通过 12,000 多个问题和 10 个选项、多项选择来评估表现 旨在更好地测试推理的格式。扩大的答案库对模型有可衡量的影响 绩效评估。与原始 MMLU 基准相比,MMLU-Pro 上的模型精度 通常会下降 16%–33%,这可以更好地区分顶级型号。例如,GPT-4o 和 GPT-4-Turbo 相比标准 MMLU 似乎有 1% 的差距,但在 MMLU-Pro 上差距扩大到 9%。 新基准的设计降低了即时敏感性并加强了推理评估。此前, MMLU 对提示变化的敏感性约为 4%–5%,而 MMLU-Pro 的敏感性约为 2%。在 此外,诸如思维链之类的推理方法往往会在 MMLU-Pro 上产生更好的性能 而不是直接回答策略。 截至 2026 年初,MMLU-Pro 上的顶级模型性能紧密聚集,领先的 15 个模型全部 得分在87%以上(图2.2.1)。谷歌的 Gemini-3.1-Pro 以 91.2% 领先,其次是 Gemini-3-Pro (Thinking) 为 90.1%,GPT-o1 为 89.3%。采用思维策略的模型往往在排名中显得较高, 表现优于标准同行,后者的得分范围为 87%–88%。整体分布 排名第一的车型与排名第 15 的车型之间的差距刚刚超过 4 个百分点,这说明了该车型的竞争力 前沿已成为广泛的知识任务。这种紧密的聚类也符合 收敛模式如第 2.1 节所述。 理解 MMLU:大规模多任务语言理解 ===== 第82页 ===== 82 2.2 语言 | 技术性能| 2026 年人工智能指数报告 87.00% 87.10% 87.10% 87.20% 87.30% 87.30% 87.40% 87.40% 87.70% 87.80% 88.60% 89.10% 89.30% 90.10% 91.16% 格罗克-4 GPT -5(高) K2.5- 1T-A32B 胡尼 uan- T1 克劳德-4.5-Op 我们(思考) 克劳德-4-Op 我们(思考) GPT -5.2 克劳德-4.5- 十四行诗( 思考) 种子2。 0-升 e Qwen3 .5-397B- A17B 双子座- 3-闪光( 12/25) 克劳德-4.6-Op 我们(思考) GPT -o1 双子座- 3-专业版 (11/25) 双子座- 3.1-专业版 0% 20% 40% 60% 80% 100% 整体准确度 MMLU-Pro:总体精度 来源:MMLU-Pro 排行榜,2026 |图:2026年AI指数报告 图2.2.15 5 来源:https://huggingface.co/spaces/TIGER-Lab/MMLU-Pro。 生成基准侧重于模型输出的质量,着眼于清晰度、有用性、指导性 追随者和风格。与知识型测试不同,这些评估通常取决于人类判断,因为 有些维度是主观的并且取决于提示和用户。基于偏好的测试有帮助 衡量主观性,是对跟踪模型如何进行的传统基准的有用补充 在现实环境中执行。 一代 The Arena(以前称为 LMArena)是一个互动平台,具有社区驱动的排名系统,允许 用户可以根据相同的提示直接比较大型语言模型 (LLM) 的输出,然后进行投票 这是他们所青睐的。评估是盲目的,以尽量减少对特定模型提供商或架构的偏见。 通过汇总数千次比较,该平台生成 Elo 评级,这是一种借用的排名系统 来自国际象棋。这种方法强调用户体验和实用性,捕捉模型的各个方面 结构化基准无法提供的质量,包括人类对现实世界任务的判断。 以用户为中心的方法确实有局限性,因为偏好可能与正确性不一致,并且可能 不能完全代表模型用例或上下文。辛格等人。 (2025)强调潜在的来源 偏差,例如顺序偏差、长度偏差或风格偏好,与输出准确性无关。作为 前面提到,Arena 等评价可以是一种补充观点,而不是绝对分数 模型质量。 截至 2026 年初,Text Arena 上的 Elo 评级紧密聚集,排名前 15 的模型大致涵盖 竞技场排行榜 ===== 第83页 ===== 83 2.2 语言 | 技术性能| 2026 年人工智能指数报告 46点(图2.2.2)。 Claude-Opus-4-6-Thinking 领先,约为 1,510,紧随其后的是 Gemini- 3.1-专业版-预览版。排名进一步缩小,并且许多人的置信区间重叠 模型。因此,虽然 Anthropic 和 Google 模型出现在整个顶级排名中,但没有任何一个模型占据主导地位 排行榜。 gpt-5.1-高 克劳德-S 网上- 4-6 双子座- 3-ash(思考-最小) 格罗克-4.1 克劳德奥普 US-4-5-202511 01 多拉-S eed-2。 0-pr 评论 克劳德奥普 US-4-5-202511 01-思考- 32k 双子座- 3-灰分 grok-4.1-思维 gpt-5.2-聊天-lat est-202602 10 双子座- 3-亲 grok-4.20-beta1 双子座- 3.1-pr 邻公关 评论 克劳德奥普 我们-4-6- 思考 克劳德奥普 我们-4-6 1,440 1,460 1,480 1,500 人 1,520 型号 Elo 评级 文本竞技场:Elo 评级 来源:竞技场,2026 |图:2026年AI指数报告 图2.2.26 6 来源:https://arena.ai/leaderboard/text。 除了一般理解和生成之外,语言模型还需要处理使其可用的任务 以供实际部署。已部署应用程序中的三个关键功能是检索增强生成 (RAG)、函数调用和文本嵌入。用于跟踪这些功能的基准特别是 有用,因为它们测试流畅性以及模型是否可以作为更大系统的一部分运行。这也使得 在性能不仅取决于基本模型,还取决于问题的设置中更容易比较模型 例如检索质量或如何解析和执行输出。 专门的语言任务 检索增强生成 (RAG) 为模型提供了一种提供准确、最新信息的方法 超出模型参数训练期间编码的知识。在推理时,RAG 系统 使用从外部来源检索的信息来增强模型响应。 标准 RAG 管道根据查询相似性检索单个文本块,这在以下情况下可能会很困难: 回答需要跨文档综合信息的问题。为了解决这个问题,在 2024 年,微软研究院推出了 Graph RAG,它可以通过以下方式更有效地响应查询: 将源材料构建为知识图并生成捕获高价值的社区摘要 RAG:检索增强生成 ===== 第84页 ===== 84 2.2 语言 | 技术性能| 2026 年人工智能指数报告 级别主题。其他变体侧重于改进多步骤检索或在生成之前对段落重新排序。 正如预期的那样,这些架构选择涉及答案质量、延迟和成本之间的权衡。 本节稍后讨论的上下文窗口对于 RAG 系统具有重要意义。扩展 上下文窗口可以支持检索更多材料,但这并不能保证更好的性能 因为模型必须在整个窗口中以可靠的注意力来解析信息。 函数调用允许模型通过生成另一个模型可以使用外部工具和 API 来生成结构化请求 系统可以运行,然后将结果折叠回其响应中。这是代理的基础能力 框架,其中模型需要采取行动或检索训练数据之外的信息。 伯克利函数调用排行榜 (BFCL) 评估模型的函数调用能力,并已 自最初发布以来已经发生了很大的变化。当前的迭代 BFCL V4 将重点转向整体 代理商评价。代理任务占总分的 40%,多轮交互占 30%, 其余部分分为活体、非活体和幻觉类别。代理组件测试网络搜索 和记忆,而多轮组件评估多步对话。早期版本更注重 严格限制在单轮函数调用上。 截至 2026 年初,BFCL 的总体准确度差异很大。排名前 15 的模型涵盖大约 21 百分点范围(图2.2.3)。克劳德模型占据了前六名中的三个位置,其中克劳德- Opus-4.5 以 77.5% 领先。评估模式也存在性能差异,表明贸易- 一般能力和特定任务优化之间的差异。例如,Grok-4-0709 在以下方面得分为 63% 提示模式下,但使用函数调用模式时会下降到 61.4%,而 Grok-4-1 在快速模式方面得分更高。 推理变体(69.6%)高于非推理变体(58.3%)。 伯克利函数调用排行榜 56.24 56.73 57.06 58.29 59.06 61.38 62.97 63.05 68.14 68.70 69.57 72.38 72.51 73.24 77.47 双子座2.5-F 睫毛(F 三) 深S eek-V3.2-Exp (P 欢闹 t+思考) 命令AR 推理(F 三) Grok-4-1-fast-non-r 推理(F 三) 文绍 泰基米 K2 学院 鲁克(F 三) 格罗克-4-07 09(女 三) 格罗克-4-07 09(P 欢闹 t) o3-2025-04- 16(P 欢闹 t) 双子座- 3-Pro-预览 (F 三) 克劳德-H 爱库-4-5-20251 001(FC) Grok-4-1-fast-r 推理(F 三) GLM- 4.6(F C思维) 双子座- 3-Pro-预览 (P 欢闹 t) 克劳德十四行诗- 4-5-20250929(F 三) 克劳德·奥普 US-4-5-202511 01(FC) 0 20 40 60 80 100 型号 整体准确度 伯克利函数调用:整体准确性 资料来源:伯克利函数调用排行榜,2026 年 |图:2026年AI指数报告 图2.2.37 7 来源:https://gorilla.cs.berkeley.edu/leaderboard.html。 ===== 第85页 ===== 85 2.2 语言 | 技术性能| 2026 年人工智能指数报告 大规模文本嵌入基准 (MTEB) 评估一组任务中的不同嵌入模型 需要语义理解。它包含 50 多个数据集,涵盖八个任务类别, 通过针对单个用例进行优化而不是表现良好,让模型看起来更强大 跨越不同的设置。 自 2022 年以来,MTEB(英语 v2)的最高平均任务得分稳步上升,与更广泛的 采用嵌入模型的大规模预训练技术。 2025年,最高分达到76分, 自 2023 年以来上升约 11 个百分点(图 2.2.4)。然而,最好的模型仍然达不到完美的程度 得分。 MTEB:海量文本嵌入基准 2019 2020 2021 2022 2023 2024 2025 0 10 20 30 40 50 60 70 80 平均任务得分 75.97 MTEB(英语 v2):平均分 来源:MTEB 排行榜,2026 年 |图:2026年AI指数报告 图2.2.48 8 来源:https://mteb-leaderboard.hf.space/?benchmark_name=MTEB%28eng%2C+v1%29 https://arxiv.org/abs/2502.13595。 ===== 第86页 ===== 86 亮点: 长上下文窗口与深度理解之间的差距 2.2 语言 | 技术性能| 2026 年人工智能指数报告 上下文窗口(模型在单个输入中可以处理的文本量)每增加近 30 倍 自 2023 年中期以来的一年(图 2.2.5)。曾经接受几千个代币的模型现在可以处理 1 百万或更多。在高端,这相当于一次通过多本书或整个代码库。 在两个长上下文基准上,Fiction.liveBench(衡量叙事理解力)和 MRCR, 测量多针检索,领先模型达到 80% 准确率的输入长度 增长速度更快,在 9 个月内增长了约 250 倍(Burnham 和 Adamczewski,2025 年)。 然而,更大的上下文窗口并不能转化为更深入的理解,因为接受的知识之间存在差距。 并且可用的上下文长度很宽。 最近的研究指出了造成这种差距的不同原因。基于一项专家级、长上下文基准 (LongBench v2),人类专家在 15 分钟的时间限制下仅获得 53.7% 的准确率,最好的模型 得分为 57.7%(Bai 等人,2025)。与结构化基准相比,这是一个很小的差距 模型已经超越了人类的基线,反映了对长输入进行深度理解的难度。 被提示逐步推理材料的模型确实比被要求的模型表现得更好 立即回答,表明模型如何处理长文本与数量一样重要 它可以接受的文本。其他研究发现,模型可以很好地处理简单的查找,但在处理时会遇到困难 要求查找多条匹配信息或在很长的文档中应用条件 - 对于人类扫描相同文本来说,这些任务很简单(Yu et al., 2025)。型号可以 如果引导逐一检查即可完成这些任务,但这种方法既缓慢又昂贵。更长 输入会带来响应时间变慢、运营费用增加和准确性降低等实际成本 以获取稍后出现在输入中的信息。 衡量长上下文能力也仍然很困难。当一个模型在长上下文测试中得分良好时,它并不是 始终清楚它是真正处理了完整的输入还是仅仅依赖于它已经拥有的知识。杨 等人。 (2025)引入了一个旨在分离这两个因素的指标,并发现模型排名发生了变化 很多。例如,在原始分数上排名第七的模型在仅考虑长上下文能力时排名第一。 测量,进一步强调 为什么区分很重要 模型之间具体 能够更好的处理 长输入,而不是有 整体能力较好。如果 上下文窗口之间的间隙 规模和有效利用率 变得更加精确,模型 可能会提高他们的工作能力 处理持续数小时的任务 或数天并维持更长的链条 推理(Denain 和 Ho, 2025)。开展评估 能够可靠地区分真实的 一般的长语境能力 模型能力很重要 用于跟踪进度并 确保基准收益 反映真正的改进。 图2.2.5 ===== 第87页 ===== 87 2.3 图像和视频 除了语言之外,许多模型还处理视觉输入,并且它们的视频和图像功能已经先进 显着。本节从理解的各个维度检查模型的性能——如何 他们很好地理解和推理视频内容和生成,从而评估人工智能的质量 制作的图像和视频。 2 技术性能| 2026 年人工智能指数报告 视频理解基准衡量模型跟踪动作、对象和事件的能力 框架而不是对单个图像进行推理。随着早期基准测试的性能有所提高, 评估已转向需要多步骤时间推理和特定领域的任务 知识应用于视频。 MVBench 评估多模态模型是否可以超越静态图像理解来处理 视频的复杂性。这包括解释运动、时间序列以及跨环境的转换 帧。它对时间推理的关注使其成为跟踪更多领域性能的有用基准。 动态视觉环境。 MVBench 上表现最好的模型平均准确率达到 74.1%,与 JT-VL-Chat 和 JT3.5 并列 该分数(图 2.3.1)。到 2026 年初,排名前 15 的型号的性能范围约为 23 百分点。 VideoChat 2 的平均准确率最低 (51.1%),而几个 VideoChat2 变体 属于中间层 (60%–65%)。 理解 MVBench 51.10% 54.73% 54.85% 58.10% 58.77% 60.40% 62.30% 62.80% 64.60% 67.25% 67.42% 69.23% 73.81% 74.08% 74.08% 视频C 帽子2 快手视频LLM ST-LLM PLLaV 34B CVLM视频C 帽子2 _雾 拉尔 视频C 帽子2 _高清 _雾 拉尔 视频-C CAM- 4B-v1.1 视频-C CAM-9B- v1.1 实习生视频2-8B-HD-C 帽子-f1 6 时间M 阿克 视频-C CAM- 7B-v1.2 编织-VLLM JT3 .5 JT-VL-聊天 0% 20% 40% 60% 80% 100% 型号 平均准确度 MBench:平均准确度 来源:MVBench 排行榜,2026 |图:2026年AI指数报告 图2.3.19 9 来源:https://huggingface.co/spaces/OpenGVLab/MVBench_Leaderboard。 ===== 第88页 ===== 88 2.3 图像和视频 | 技术性能| 2026 年人工智能指数报告 Video-MMMU 是一个大型、多模式、多学科的教育视频学习基准, 包括 300 个专家级视频,平均时长约为 506 秒,涉及 6 个学科和 30 个主题。 每个视频都配有三组问题,以逐步测试更深入的理解。感知 问题测试模型是否可以从文本/音频中提取关键细节;理解问题测试是否 它掌握概念或解决方案策略;和适应问题需要应用这些知识 一个新的场景。适应问题将 MMMU/MMMU-Pro 项目重复用于 STEM 领域和自定义案例 研究艺术/人文学科,因此模型必须超越特定的视频。该基准还引入了 Δ知识指标用于跟踪处理视频后模型性能的提高程度。 截至 2025 年,还没有模型在 Video-MMMU 整体准确率上达到 74.4% 的人类基线(图 2.3.2)。表现最好的模型 Keye-VL-1.5-8B 得分为 66%,紧随其后的是 Claude -3.5-Sonnet (65.8%)。最低分是 VILA1.5-8B,为 20.9%,在整个范围内留下了 45 个百分点的差距 排行榜。 Δ知识度量结果揭示了人类学习和模型学习之间的进一步差距(图 2.3.3)。 人类专家在观看视频后提高了 33.1 个百分点,而该指标的最佳模型, GPT-4o 只获得了大约一半(15.6 分)。大约三分之一的模型甚至显示出负的 Δ 知识, 因为在处理视频后他们的表现实际上会下降。 视频-MMMU 20.89% 23.98% 30.00% 33.89%34.00% 36.11% 37.44% 41.67% 42.00% 47.44% 48.33% 49.67% 49.78% 50.78% 53.89% 61.22% 65.78% 41.78% 43.00% 47.00% 52.70% 57.56% 60.22% 65.22%66.00% 维拉1.5-8B 龙VA-7B 美洲驼-3.2-11B LLaVA-OneVision-7B 维拉1.5-40B LLaVA-视频-7B 实习生VL2-8B 视频聊天-Flash-7B@448 mPLUG-Owl3-7B Qwen-2.5-VL-7B LLaVA-OneVision-72B LLaVA-视频-72B 双子座1.5闪存 咏叹调 双子座1.5专业版 GPT-4o 克劳德 3.5 十四行诗 猛犸-VL-8B InternVideo2.5-聊天-8B 视频LLaMA3-7B 视频RTS GLM-4V-PLUS-0111 Qwen-2.5-VL-72B Kimi-VL-A3B-Thinking-2506 科业-VL-1.5-8B 2024 2025 0% 20% 40% 60% 80% 100% 整体准确度 视频-MMMU:总体精度 来源:视频-MMMU 排行榜,2026 |图:2026年AI指数报告 74.44%,人类基线 图2.3.210 10 来源:https://videommmu.github.io/#Leaderboard。 ===== 第89页 ===== 89 2.3 图像和视频 | 技术性能| 2026 年人工智能指数报告 -8.50% -7.00% -5.60% -5.30% -3.30% -1.70% -1.30% -0.50% 0.00% 1.50% 2.20% 3.00% 3.20% 3.50% 5.90% 6.60% 7.10% 7.50% 8.70% 9.40% 9.70% 11.40% 15.60% 33.10% −10% −5% 0% 5% 10% 15% 20% 25% 30% 35% 实习生VL2-8B 龙VA-7B LLaVA-OneVision-7B LLaVA-视频-7B 双子座1.5闪存 GLM-4V-PLUS-0111 视频聊天-Flash-7B@448 视频LLaMA3-7B 科业-VL-1.5-8B 猛犸-VL-8B Qwen-2.5-VL-7B InternVideo2.5-聊天-8B 咏叹调 Kimi-VL-A3B-Thinking-2506 维拉1.5-8B LLaVA-OneVision-72B LLaVA-视频-72B mPLUG-Owl3-7B 双子座1.5专业版 维拉1.5-40B Qwen-2.5-VL-72B 克劳德 3.5 十四行诗 GPT-4o 人类专家 Δ知识 视频-MMMU:Δ知识 来源:视频-MMMU 排行榜,2026 |图:2026年AI指数报告 图2.3.3 图2.3.4 虽然上述基准测试模型解释现有视觉内容的能力,但生成基准 评估模型的生成能力如何。评估涵盖人类偏好排名以及 自动质量指标,因为生成的视频必须满足主观期望和技术标准 例如连贯性、保真度和可控性。其中,可控性就显得尤为重要 焦点,反映模型是否能够遵循用户意图,同时保持自然的运动和场景 动态。这也使视频生成更接近世界模型的理念,系统旨在 预测视觉场景如何随时间演变。 一代 随着时间的推移,几代人的旅程中:“哈利·波特的超现实形象” 资料来源:中途,2025 年 V1,二月 2022年V2,2022年4月 V3,2022年7月 V4,2022年11月 V5,2023年3月 V6,2023年12月 V6.1,2024年7月 V7,2025 年 4 月 ===== 第90页 ===== 90 图2.3.511 11 该图表仅显示截至 2026 年 2 月排名前 15 的型号;来源:https://arena.ai/leaderboard/vision。 2.3 图像和视频 | 技术性能| 2026 年人工智能指数报告 Arena 平台还拥有一个 Vision Arena,它应用相同的盲比较、基于 Elo 的方法 前面部分描述的语言到图像生成模型的方法。人类的偏好是 图像生成的重要信号,因为审美吸引力和视觉连贯性等品质很困难 仅通过自动化指标来捕获。 截至 2026 年初,谷歌的 Gemini 型号占据了前六名中的四席,其中 Gemini-3-Pro 领先 大约 1,285 Elo,其次是其他变体(图 2.3.5)。与语言评价类似, 排名后三分之二的模型的置信区间重叠,因为它们落在 30 分之内 范围在 1,230 到 1,260 之间。 Video-Bench 是一个人性化的视频生成基准,可在二维上对模型进行评分 组:视频条件对齐和视频质量。它使用基于 MLLM 的评估器 (GPT-4o),并且具有很少的 击球评分和查询链提示以获得更精确、校准的结果。分数关联性更大 与之前基于指标或基于 LLM 的基准相比,人类评级的效果更强。 截至 2026 年初,Gen3 和 Kling 在视频质量方面处于领先地位,Gen3 在所有关键指标上得分最高, 包括成像质量、美学质量、时间一致性和运动效果,而 Kling 排名 总体排名第二(图2.3.6)。运动效果是几乎所有模型中最弱的子维度。 竞技场:愿景 视频工作台 GPT-5.2 kimi-k2.5-instantchat gpt-4o-lat EST-20250 第326章 GPT-5.1 qwen3 .5-397b-a1 7b gpt-5.2-高 基米-k2.5- 思考 双子座-2.5-pr 哦 gpt-5.1-高 双子座- 3-ash(思考-最小) 多拉-S eed-2。 0-pr 评论 gpt-5.2-聊天-lat est-202602 10 双子座- 3-灰分 双子座- 3.1-pr 邻公关 评论 双子座- 3-亲 1,220 1,240 人 1,260 人 1,280 人 1,300 型号 Elo 评级 Vision Arena:Elo 评级 来源:竞技场,2026 |图:2026年AI指数报告 ===== 第91页 ===== 91 2.3 图像和视频 | 技术性能| 2026 年人工智能指数报告 4.66 3.87 4.08 4.26 3.30 3.00 3.78 4.44 3.84 3.85 3.82 3.28 2.94 3.76 4.74 4.14 3.69 4.38 3.90 3.00 3.40 3.99 3.55 2.81 3.11 2.90 2.43 2.59 Gen3 Cogvideox VideoCrafter2 Kling Show-1 LaVie Pika-Beta 0 1 2 3 4 5 成像质量 审美质量 时间一致性 运动效应 型号 得分↑ Video-Bench 视频质量 来源:Video-Bench 排行榜,2025 |图:2026年AI指数报告 图2.3.612 12 来源:https://github.com/Video-Bench/Video-Bench?tab=readme-ov-file#leaderboard。 VBench-2.0 是一个全面的、人性化的基准测试,用于评估视频生成模型 内在的忠实,定义为对现实的全面坚持,而不仅仅是视觉上的 令人信服的。它对五个广泛维度的模型进行评分(人类忠诚度、创造力、可控性、 物理和常识)。该基准测试将基于 VLM/LLM 的分析与专用检测器相结合 以及一个小但有针对性的提示集,以人类偏好标签为基础。这种以诚信为本 方法很重要,因为它可以揭示生成的视频是否经得起诸如以下领域的审查: 物理合理性和场景一致性。 2026 年初评估的模型中,没有一个模型的总分超过 67%(图 2.3.7)。 Veo 3 领先于 66.7%,比排名第二的 Vidu Q1 (62.7%) 高出约 4 个百分点。与其他类似 在基准分数中,多个模型紧密分组,分数徘徊在 58% 和 60% 之间。甚至 像 Kling、CogVideoX 和 HunyuanVideo 这样的成熟系统仍然在与复杂的故事和内容作斗争。 一致的物体/场景动态。 VBench-2.0 ===== 第92页 ===== 92 图2.3.713 13 来源:https://huggingface.co/spaces/Vchitect/VBench_Leaderboard。 2.3 图像和视频 | 技术性能| 2026 年人工智能指数报告 53.35% 55.30% 55.78% 58.38% 59.00% 59.81% 60.20% 61.78% 62.70% 66.72% 科格视频X -1.5 胡尼 元视频 StepVideo Sora- 480p 克林1号 .6 塞丹克 e 1.0 专业版 (2025-0 5-28) 万2. 1 托莫 维伊2. 0 维杜 Q1 ( 2025年4月- 17) 维奥3 0% 20% 40% 60% 80% 100% 型号 总分 VBench-2.0:总分 来源:VBench 排行榜,2026 |图:2026年AI指数报告 亮点: 视频生成的进展 本节中的基准测试主要评估作为内容生成器的视频模式,并对它们进行评分 质量、保真度和可控性。然而,最近的研究表明视频生成模型可能是 开发超越内容制作的能力。 2025 年 Google DeepMind 研究(Wiedemar 等人,2025)测试了视频生成模型 Veo 3 是否 可以仅使用输入图像和文本提示来解决从未经过专门训练的视觉任务。 通过 62 项定性任务和 7 项定量评估,涵盖超过 18,000 个生成的视频, 该模型在传统上由专门系统处理的领域显示出零射击能力。这些包括 感知任务,例如边缘检测和分割,物理建模任务,例如浮力和 刚体动力学,以及风格转换和对象提取等操纵任务。作者还 观察视觉推理的早期迹象,包括迷宫解决和视觉类比完成,他们 描述为“框架链”,类似于语言模型中的思想链推理,其中模型 似乎通过连续的帧逐步推理。与 Veo 2 相比,性能持续提升 在所有定量任务中达到 Veo 3,并且在某些情况下,匹配或超过了专用图像编辑 基线(纳米香蕉)。 在大多数单独任务中,专业模型的性能仍然优于零样本视频生成,但快速 零射击能力的改进和广度表明了一个熟悉的轨迹。大型语言模型 通过网络规模数据和视频的生成训练开发通用语言理解 在类似条件下训练的模型可能会遵循类似的通用视觉路径。 ===== 第93页 ===== 93 2.4 推理 推理基准评估是否 模型可以解决需要的问题 抽象和概括 域和格式。由于性能 已经改进,新的基准旨在 区分真正的问题解决和 由记忆驱动的表现 或迅速熟悉。然而,因为 模型也可能在其他方面产生错误 流畅的反应,努力正在加大 来衡量这些错误率 推理的局限性。人工智能指数跟踪 这些事实可靠性基准 和错误率见第 3 章。 本节标杆,领先型号 在许多任务上表现良好,但仍然表现出 在较困难的项目上存在差距。 2 技术性能| 2026 年人工智能指数报告 一般推理是指模型通过应用规则和组合来解决不熟悉问题的能力 证据,而不是依赖领域知识或记忆模式。讨论的基准 下面跨越多个领域和任务,旨在测试多步推理。一个例子是 多位算术,例如长整数乘法,以测试模型是否能够一致执行 逐步计算而不是产生看似合理的输出。其他更复杂的基准 将这个想法扩展到多模式设置,其中模型必须将文本与图表或绘图相结合才能达到 正确答案。 一般推理 MMMU 评估结合文本与视觉的大学水平主题问题的多模态推理 例如图表、图表、表格和方程式。一些示例任务包括从 表并将其应用于应用题,或使用图表来回答领域中的特定领域问题 例如工程或医学。 截至 2026 年 2 月,领先型号 Gemini 3.1 Pro Preview 在 MMMU 上的得分为 88.2%,误差在 0.4 以内 最佳人类专家参考的百分点(图2.4.1)。其他双子座变体紧随其后, 其中Gemini 3 Flash(87.6%)和Gemini 3 Pro(87.5%),而GPT-5.2得分为86.7%。 2026 款车型轨迹 落后于 Kimi K2.5(84.3%)和 Claude Opus 4.6(思考)(83.9%)。 MMMU:大规模的多学科多模式 专家 AGI 的理解和推理基准 ===== 第94页 ===== 94 2.4 推理| 技术性能| 2026 年人工智能指数报告 80.42% 80.75% 81.10% 81.34% 81.50% 82.95% 83.18% 86.67% 87.51% 87.63% 88.21% 83.58% 83.87% 84.34% o3 Gemini 2.5 Flash 预览版 克劳德作品 4.5(无思考) Gemini 2.5 专业版 通用技术5 克劳德作品 4.5(思考) GPT 5.1 GPT 5.2 双子座 3 Pro (11/25) 双子座 3 闪光 (12/25。) Gemini 3.1 专业版预览 克劳德十四行诗 4.6 克劳德作品 4.6(思考) 基米K2.5 2025 2026 0% 20% 40% 60% 80% 100% 准确度 MMMU:准确度 来源:Vals.ai,2026 |图:2026年AI指数报告 88.60%,人类专家(最佳) 图2.4.114 图2.4.215 14 该图表显示了截至 2026 年 2 月排名前 15 的型号;数据来源:https://www.vals.ai/benchmarks/mmmu。 15 数据来源:https://epoch.ai/benchmarks。 虽然 MMMU 专注于多模态推理, GPQA 评估困难文本的推理 仅设计用于测试研究生水平的问题 解决问题。问题需要模型 应用特定领域的概念并遵循 多步逻辑才能得出正确答案。 示例任务包括研究生水平的化学 或需要做题的物理问题 通过多步骤解决方案并选择 几个非常相似的选项的最佳答案。 GPQA 钻石集上的模型性能 继续超越人类专家 验证者基线为 81.2%(图 2.4.2)。晚了 2024年,OpenAI的o3率先超越 得分为87.7%。 2025 年,平均准确度 达到93%,超过专家参考 点 12 个百分点。 GPQA:研究生级别的 Google 验证 问答基准 2023 2024 2025 0% 20% 40% 60% 80% 100% 平均准确度 93.00% 钻石组上的 GPQA:平均准确度 来源:Epoch AI,2026 |图:2026年AI指数报告 81.20%,专家人类验证者 ===== 第95页 ===== 95 图2.4.316 图2.4.417 16 该图表显示了截至 2026 年 2 月排名前 15 的型号;数据来源:https://arcprize.org/leaderboard。 17 数据来源:https://lastexam.ai。 ARC-AGI 于 2019 年推出,是一个基准测试,用于测试系统超越先前的泛化能力 培训,强调泛化学习能力。尽管它的名字如此,该基准测试测试了一种特定形式 抽象和模式推理,而不是更广泛意义上的一般智能。它的更新版本, ARC-AGI-2 于 2025 年推出,并转向抽象拼图式任务,评估模型是否 可以从一小组示例中推断出规则并将其应用于新案例。示例任务包括网格谜题 其中为模型提供了一些示例解决方案,推断规则,并使用它来解决新问题。 ARC-AGI-2 的分数在不同模型上差异很大,并且最高分数和最低分数之间的差距 图中约为46%(图2.4.3)。 Gemini 3 Deep Think 以 84.6% 领先,其次是 Gemini 3.1 Pro 预览为 77.1%,GPT-5.2(精炼)为 72.9%。几个 Claude Opus 4.6 变体聚集在一起, 得分在 66.3% 至 69.2% 之间。 Humanity’s Last Exam (HLE) 基准评估模型 2,700 个极具挑战性的问题的表现 数十个学术科目。它被设计为专家 水平,封闭式基准,覆盖面广, 混合使用多项选择题和简答题格式 适合自动分级。示例任务包括 需要应用概念的研究生水平问题 并提供单一的、可验证的答案。有些可能 包括图像,要求模型整合视觉和 文本信息。 2024 年至 2025 年间,HLE 的模型精度 增长了30个百分点(图2.4.4)。在一个 仅一年,准确率就从不到 10% 上升到 38.3%。 即使有了这样的跳跃,基准测试仍会保持不变 困难,高置信度错误仍然很常见。 ARC-AGI-2 人类的最后考试 38.50% 43.30% 45.10% 52.90% 54.00% 54.20% 58.30% 60.40% 64.60% 66.30% 68.80% 69.20% 72.90% 77.10% 84.60% GPT -5.2P ro(中) GPT -5.2(高) 双子座 3 深度思考 (P 审查) GPT -5.2(超高) 双子座3P 罗(R 烯 ) GPT -5.2P 罗(高) 克劳德小号 网上 4. 6(米 斧头) 克劳德小号 网上 4. 6(高) 克劳德·奥普 我们 4. 6(120K,长 噢) 克劳德·奥普 我们 4. 6(120K,中) 克劳德·奥普 我们 4. 6(120K,米 斧头) 克劳德·奥普 我们 4. 6(120K,高) GPT -5.2(R 烯 ) 双子座3 .1 专业版(P 审查) 双子座 3 深度思考 ( 2/26) 0% 20% 40% 60% 80% 100% 型号 分数 ARC-AGI-2 来源:ARC-AGI-2 排行榜,2026 年 |图:2026年AI指数报告 2024 2025 0% 20% 40% 60% 80% 100% 准确度 38.30% 人类最后的考试(HLE):准确性 资料来源:人工智能安全中心等,2026 |图:2026年AI指数报告 2.4 推理| 技术性能| 2026 年人工智能指数报告 ===== 第96页 ===== 96 亮点: MLLM 中的时间理解 许多多模式模型仍然难以解决大多数人认为例行公事的事情,即报时。尽管 最近的研究表明,GPQA 和 HLE 等专家级推理基准的快速改进 模型无法读取模拟时钟。该任务将视觉感知与简单的算术结合起来, 识别时钟指针及其位置,然后将其转换为时间值。存在这样的风险: 一步中的错误会级联到下一步。 萨克塞纳等人。 (2025) 在两个重点数据集上测试了七个多模态模型(图 2.4.5)。包括时钟质量检查 跨越六种视觉风格的 62 个模拟时钟图像 - 包括带有黑色表盘或无秒针的时钟 - 以及 CalendarQA,将年度日历图像与日期推理问题配对。在时钟读数上,甚至 性能最好的模型 Gemini-2.0 仅实现了 22.6% 的精确匹配精度(图 2.4.6)。模型表现 在日历问题上表现更好,GPT-o1 达到 80% 的准确率,尽管在 问题需要日期算术而不是识别众所周知的假期(图2.4.7)。 ClockBench(Safar,2025)将评估范围扩大到 180 个时钟设计和 720 个问题。人类阅读 正确格式化时钟的正确率为 90.1%,而顶级型号 GPT-5.4 High 的正确率达到 50.6% 2026 年 3 月(图 2.4.8)。约40个百分点的差距虽大,但更大的差距是本质上的 的错误。当模型报错时间时,其中位误差范围约为一到三个小时, 与人类的三分钟相比。 IEEE 互联网计算(Fu et al., 2025)上发表的一项研究探讨了为什么这些故障不断发生。 在对 5,000 个合成时钟图像进行微调后,模型对熟悉的时钟样式进行了改进,但未能 推广到现实世界中具有不同特征的照片或时钟,例如扭曲的表盘或更薄的指针。 当研究人员深入研究这些错误时,他们发现了一种模式。如果模型混淆了时针和分针, 它判断手部方向的能力下降了。这表明训练数据带来的困难较少 以及有关模型如何在单个图像中组合多个视觉线索的更多信息。即使模型关闭 在知识密集型任务上与人类专家的差距,这种视觉推理仍然是一个持续存在的问题 挑战。 2.4 推理| 技术性能| 2026 年人工智能指数报告 来源: Saxena 等人,2025 图2.4.5 ===== 第97页 ===== 97 亮点: 2.4 推理| 技术性能| 2026 年人工智能指数报告 Qwen2-VL-7B 骆驼 3.2-视觉 迷你CPM-V-2.6 GPT-o1 克劳德 3.5 十四行诗 GPT-4o 双子座-2.00% 5% 10% 15% 20% 精确匹配↑ 0% 3.23%% 3.23%% 4.84%% 6.45%% 8.06%% 22.58%% ClockQA:完全匹配 资料来源:Saxena 等人,2025 |图:2026年AI指数报告 骆驼 3.2-视觉 Qwen2-VL-7B 迷你CPM-V-2.6 双子座2.0 GPT-4o 克劳德 3.5 十四行诗 GPT-o1 0% 20% 40% 60% 80% 准确度↑ 11.67%% 18.33%% 20% 31.67%% 43.33%% 46.67%% 80% 日历QA:准确性 资料来源:Saxena 等人,2025 |图:2026年AI指数报告 图2.4.6 图2.4.7 8.90% 10% 11.10% 11.10% 11.10% 12.20% 14.40% 14.40% 15% 15% 18.90% 28.90% 32.20% 39.40% 50.60% 克劳德·奥普 我们 4. 6 雾气 真实介质3 .1 GPT -5专业版 GPT -5 高 双子座2.5F 睫毛 o3 高 o3 P 罗 奎文3号 -VL 235B 思维 GPT -5.2 高 双子座R 敖包 抽动症ER 1 .5 双子座2.5P 罗 双子座3P 罗 双子座3 .1专业版 奎文3号 -VL 235B 研究所 鲁克特 GPT -5.4 高 0% 20% 40% 60% 80% 100% 型号 准确度 ClockBench:准确度 来源:ClockBench 排行榜,2026 |图:2026年AI指数报告 90.70%,人类基线 图2.4.818 18 数据来源:https://clockbench.ai。 ===== 第98页 ===== 98 2.4 推理| 技术性能| 2026 年人工智能指数报告 除了一般推理之外,人工智能指数还跟踪评估模型能力的规划基准 将行动分为多个步骤以实现目标。模型必须跟踪已经发生的事情 即使问题变得更长、更复杂,也可以避免无效的操作并保持一致性。 与单次推理问题不同,规划评估可以暴露仅在以下情况下出现的失败: 更长远的视野,包括复合错误或忘记早期的限制。使用哪个基准 衡量这些能力很重要,因为不同的任务会出现不同类型的故障。 规划 像 LAMA 这样的经典规划者会系统地搜索可能的状态,并在以下情况下制定正确的计划: 他们找到了解决方案。相反,语言模型根据学习的模式生成计划,这意味着它们 可以产生可能具有无效步骤或错过约束的合理序列。 PlanBench 通过提示模型从结构化数据生成完整计划来评估端到端规划 跨多个规划领域的问题描述。域是一种有自己规则的问题 和目标,例如以特定顺序堆叠块、导航路线或在之间运输包裹 地点。该基准测试将性能报告为每个领域中解决的任务数量,最多 45 个 与作为经典规划基线的 LAMA 相比。 没有一个模型能够跨越所有领域(图 2.4.9)。在标准规划下,LAMA在几个方面处于领先地位 域,包括 Miconic (45/45)、Rovers (34/45) 和 Transport (33/45)。在更结构化的领域 例如Childsnack和Spanner,前沿模型匹配或超过LAMA,其中GPT-5达到38/45 Childsnack 和 Spanner 上的 45/45。 当任务描述被打乱以掩盖其结构时,大多数模型的性能都会下降 多个领域,但效果取决于领域和模型(图 2.4.10)。例如,DeepSeek 在 Blocksworld 上,R1 降至 3/45,在 Floortile 和 Sokoban 上,R1 降至 0/45。同样,GPT-5 下降至 12/45 推箱子上的 Blocksworld 和 7/45。 计划台 ===== 第99页 ===== 99 2.4 推理| 技术性能| 2026 年人工智能指数报告 28 18 10 45 34 21 15 33 21 38 10 35 14 15 45 27 21 38 6 23 6 9 30 22 19 33 5 27 9 10 38 16 Blocksworld 儿童零食 地板砖 Miconic Rovers 推箱子 扳手 运输 0 5 10 15 20 25 30 35 40 45 LAMA GPT-5 双子座 R1 域名 已解决的任务 PlanBench:根据标准规划解决的任务 资料来源:Corrêa 等人,2025 |图:2026年AI指数报告 图2.4.919 图2.4.1020 19 数据来源:https://arxiv.org/pdf/2511.09378。 20 数据来源:https://arxiv.org/pdf/2511.09378。 28 18 10 45 34 21 15 33 12 33 3 28 10 7 38 21 28 25 5 9 8 5 39 27 3 28 0 14 5 0 34 9 Blocksworld 儿童零食 地板砖 Miconic Rovers 推箱子 扳手 运输 0 5 10 15 20 25 30 35 40 45 LAMA GPT-5 双子座 R1 域名 已解决的任务 PlanBench:在模糊规划上解决了任务 资料来源:Corrêa 等人,2025 |图:2026年AI指数报告 ===== 第100页 ===== 100 2.5 性能 特定领域 2 技术性能| 2026 年人工智能指数报告 编码基准测试 模型是否可以走 除了回答问题之外 关于代码并实际编写, 调试和发货工作 软件。本期的任务 部分范围从解决 真正的 GitHub 构建问题 完整的网络应用程序来自 划痕,反映了转变 评估以衡量 哪些型号可以交付最终 结束而不是孤立 片段。 随着人工智能模型在一般推理和知识基准方面的改进,人们的注意力已经转移到如何 他们在需要专业知识的任务上表现出色。本节中的基准测试模型 四个专业和学术领域:编码、数学、金融和法律推理。各有各的 自己的词汇、惯例和标准才能算作正确且可理解的答案。很多 其中一些基准是新的,反映了对特定领域评估日益增长的需求。除非另有说明 值得注意的是,下面报告的结果反映了截至 2026 年初的模型性能。 软件 SWE-bench 评估模型 表彰他们解决从 GitHub 收集的现实世界软件问题的能力。每个任务给模型一个 代码库和问题描述,模型必须生成一个工作补丁。 SWE-bench Lite 是 更小、更容易访问的子集,而 SWE-bench Verified 使用人工验证的问题来确保更多 一致且准确的分级。 在 SWE-bench Verified 上,顶级型号紧密聚集在 70 年代中低端(图 2.5.1)。截至二月 2026 年,Claude 4.5 Opus(高推理)领先约 76.8%,其他几个包括 KimiK2.5、 GPT-5.2 和 Gemini 3 Flash(高推理)分组在 70% 到 76% 之间。这是一种普遍存在的模式 本章中的几个基准测试,其中高性能模型的得分在几个百分点之内 彼此。 SWE-长凳 ===== 第101页 ===== 101 2.5 特定领域的表现 | 技术性能| 2026 年人工智能指数报告 44.00% 46.00% 47.00% 48.00% 48.33% 49.67% 56.67% 58.33% 60.00% 60.33% 70.80% 71.40% 72.80% 72.80% 72.80% 72.80% 75.60% 75.80% 75.80% 76.80% 代码保险丝CGM KG指南针 + 克劳德 3.5 十四行诗 (20241022) DARS代理 SWE-特工 + 克劳德 3.7 十四行诗 ExpeRepair-v1.0 恩特罗PO + R2E + Qwen3-Coder-30B-A3B-指令 SWE-特工 + 克劳德 4 十四行诗 KG指南针 + 克劳德 4 首十四行诗 (20250514) Refact.ai 代理 ExpeRepair-v1.0 + 克劳德 4 十四行诗 Kimi K2.5(高推理) 克劳德 4.5 十四行诗(高推理) GPT-5-2 法典 GLM-5(高推理) GPT-5-2(高推理) GPT 5.2 法典 克劳德作品 4.6 Gemini 3 Flash(高推理) MiniMax M2.5(高推理) 克劳德 4.5 Opus(高推理) 精简版已验证 0% 20% 40% 60% 80% 100% 精简版已验证 型号 解决百分比 SWE-bench:解决百分比 来源:SWE-bench 排行榜,2026 |图:2026年AI指数报告 图2.5.121 21 此图表显示了截至 2026 年 2 月 SWE-bench Verified 和 Lite 的前 10 个模型。对于 Verified,仅显示使用 mini-SWE-agent-v2 的结果 包括过滤器。这意味着所有模型都是在相同的代理工作流程下进行测试的,因此分数的差异反映了基础模型而不是 比周围系统的差异。数据来源:https://www.swebench.com/index.html。 Terminal-Bench 是在真实终端环境中测试 AI 代理的基准。它评估有多好 代理可以自主处理现实世界的端到端任务,从编译代码到训练模型, 设置服务器。这些是开发人员在一天的工作中可能执行的任务类型,并且需要 代理在没有人工指导的情况下将多个步骤链接在一起。 Terminal-Bench 2.0 的准确度在过去一年中显着提高,从 2019 年的 20% 提高到 2025 年 2 月增至 2026 年初的 77.3%(图 2.5.2)。 终端长凳 ===== 第102页 ===== 102 2.5 特定领域的表现 | 技术性能| 2026 年人工智能指数报告 2025年2月-2025年3月-2025年4月-2025年5月-2025年 2025年6月-2025年7月-2025年8月-2025年 2025 年 9 月-2025 年 10 月 否 v-2025 2025年12月-2026年1月-2026年2月-2026年 0% 20% 40% 60% 80% 100% 准确度 77.30% Terminal-Bench 2.0:准确性 资料来源:Terminal-Bench 2.0 排行榜,2026 年 |图:2026年AI指数报告 图2.5.222 图2.5.323 22 数据来源:https://www.tbench.ai/leaderboard/terminal-bench/2.0。 23 数据来源:https://www.vals.ai/benchmarks/vibe-code。 Vibe Code Bench 是第一个基准测试 旨在测试人工智能模型是否可以 自主构建完整的、端到端的 从头开始的网络应用程序。而不是 测量编码帮助,它评估真实的 软件交付,看看模型是否可以接受 提示并生成一个功能性应用程序。 不同型号的性能差异很大 (图2.5.3)。克劳德作品 4.6(非思考) 以 56.5% 领先,其次是 GPT 5.2,接近 47%。 GPT 5.3 Codex 后分数下降 (41.4%) 降至 30% 以下,部分型号低于 15%。顶部和底部之间的价差 型号约为 46 个百分点,甚至 领先模型仅解决了大约一半的问题 任务,表明自主应用程序 建设仍然是一项艰巨的任务。 31.46% 32.03% 37.91% 47.97% 51.48% 53.50% 53.50% 57.57% GLM 5.1 Gemini 3.1 专业版预览版 (02/26) GPT 5.2 法典 GPT 5.4 迷你 克劳德十四行诗 4.6 克劳德作品 4.6(思考) GPT 5.2 克劳德作品 4.6(非思考) 0% 20% 40% 60% 80% 100% 型号 准确度 Vibe Code Bench v1.1:准确性 来源:Vals.ai,2026 |图:2026年AI指数报告 Vibe 代码台 ===== 第103页 ===== 103 图2.5.424 图2.5.525 24 数据来源:https://epoch.ai/benchmarks/。 25 数据来源:https://matharena.ai/?comp=hmmt--hmmt_feb_2026&view=problem。 2.5 特定领域的表现 | 技术性能| 2026 年人工智能指数报告 MathArena 是一个滚动基准测试,它使用新发布的数学竞赛来测试新的竞赛模型 - 风格问题。它借鉴了高中和奥林匹克级别的著名比赛,包括 AIME、 HMMT、USAMO、国际数学 奥林匹克运动会 (IMO) 和 Project Euler,运行模型 每次训练后立即进行,以降低训练数据的风险 污染。数字答案是自动评分的, 而人类评分者则根据结果对书面校样进行评分 被发布在公共排行榜上。 MathArena 的准确率从约 83% 提高 2025年11月至2025年12月的97%(图 2.5.5)。关于基于答案的问题,领先模型 达到或超过人类顶尖选手的水平。 然而,在基于证明的任务上,它们仍然表现良好 当被要求产生严格的、步骤性的时,低于人类 逐步的数学证明。得到正确的答案 并表明其背后的推理仍然清晰 当前系统面临的挑战。 2024 2025 0% 20% 40% 60% 80% 100% 通过@1 准确度 31.30% FrontierMath 第 4 层:pass@1 准确度 来源:Epoch AI,2026 |图:2026年AI指数报告 2025 年 11 月-2025 年 12 月 0% 20% 40% 60% 80% 100% 准确度 96.97% MathArena:准确性 来源:MathArena 排行榜,2026 |图:2026年AI指数报告 除了编码和语言任务之外,数学已成为模型推理的关键试验场。的 本节的基准范围从竞赛级别的问题解决到正式的证明写作。 数学 FrontierMath是Epoch推出的基准测试 AI 具有数百个原创、异常 具有挑战性的数学问题。存在的问题 旨在测试真正的数学推理 而不是模式识别,甚至有经验 数学家可能需要数小时或数天才能解决这些问题。 自 2024 年以来,FrontierMath Tier 4 的准确性已提高 借助 GPT-5.2 Pro(Web App)到 2025 年底领先(图 2.5.4)。的 基准测试的目的是保持困难,所以即使 在短时间内如此陡峭的攀登,最好的模型仍然 在最困难的问题上大约有三分之二会失败 层。 前沿数学 数学竞技场 ===== 第104页 ===== 104 亮点: 2.5 特定领域的表现 | 技术性能| 2026 年人工智能指数报告 定理证明 在数学中,获得正确答案只是挑战的一部分。正确的结果由 有缺陷的推理在比赛或期刊中不会获得多少荣誉。定理证明过程 构建严格的、逐步的论证来解释为什么结果必须是真实的,仍然是最困难的问题之一 人工智能系统的任务。直到最近,即使是前沿模型也难以提供能够通过的证明 专家评审。 正如去年的 AI 指数所述,DeepMind 的 AlphaProof 和 AlphaGeometry 2 解决了六个问题中的四个 在2024年国际数学奥林匹克竞赛(IMO)中,以28分获得银牌。那个结果 需要专家将问题翻译成像精益这样的正式语言,并且需要花费数天的计算时间。在 2025年,Gemini Deep Think解决了六题中的五题,获得35分,获得金牌,而 在 4.5 小时的比赛时限内以自然语言进行端到端的工作(Luong 和 Lockhart, 2025)。在一年之内从白银跃升至黄金,且流程简单得多,标志着最快的之一 数学竞赛中的能力提升。 IMO-Bench(Luong 等人,2025)是一个新的基准套件,旨在衡量这种进展是否 是真实的推理还是更好的猜测答案。它包括三个组成部分。 IMO-AnswerBench 测试 对 400 个涉及代数、组合学、几何和数论的奥林匹克式问题进行建模, 可验证的简短答案。 IMO-ProofBench 评估模型是否能够产生严格的分步结果 60 个问题的证明,范围从 IMO 前难度到 IMO 完全难度。 IMO-GradingBench 提供了一个数据集 拥有 1,000 个解决方案示例和人工评分证明,支持自动化证明的开发 评分系统。 传统上,对数学证明进行评分需要人类专家,这限制了模型和模型的数量 解决方案可以大规模评估。在 IMO-ProofBench 上,由自动评分系统分配的分数 密切跟踪人类专家给出的结果,基础的皮尔逊相关性为 0.96,高级的皮尔逊相关性为 0.93 问题(图2.5.6)。那个水平 协议表明自动化 分级可能是一个合理的标准 尽管基准作者 建议人工验证 高风险的结果。 通过这种评分方法 已验证,基准测试结果 揭示之间的差距程度 模型(图2.5.7)。阿勒忒亚带领 91.9%,其次是 Gemini 3 Deep Think at 76.7% 和 Gemini Deep 认为(IMO 黄金)为 65.7%。来自 在那里,分数下降了不少。 GPT- 5.2 思维(高)达到35.7%, Gemini 3 Pro 得分 30%,GPT- 5.1 下降至 7.1%。顶部和底部模型之间的差距约为 85 个百分点。故障 IMO-Bench 论文中的问题来源表明,其中一些分数也可能反映了熟悉程度 现有的竞争问题而不是一般推理能力,强化了一种模式 数学竞技场。产生正确答案和严格证明仍然是非常不同的任务,大多数模型都相距甚远。 比前者性能更好。 ===== 第105页 ===== 105 亮点: 2.5 特定领域的表现 | 技术性能| 2026 年人工智能指数报告 图2.5.726 26 数据来源:https://imobench.github.io/。 GPT-5.1 Grok 4.1 快速推理 克劳德作品 4.5 GPT-5专业版 双子座 3 专业版 GPT-5.2 思维(高) 双子座深思熟虑 (国际海事组织黄金级) 双子座3深度思考 真理 0% 20% 40% 60% 80% 100% 分数 7.1% 18.6% 23.8% 28.6% 30% 35.7% 65.7% 76.7% 91.9% IMO-ProofBench 资料来源:IMO-ProofBench 排行榜,2026 年 |图:2026年AI指数报告 图2.5.6 资料来源:Luong 等人,2025 ===== 第106页 ===== 106 本节涵盖旨在评估人工智能系统在金融特定任务上的基准。与一般的不同 推理基准,这些测试需要模型处理特定领域的语言,提取结构化的 财务文件中的信息,并在税法、 抵押贷款流程和财务分析。 金融 TaxEval v2 是一个基准测试,旨在测试模型处理具有挑战性的税务相关问题的能力。它 包含 1,500 多个经过专家验证的问题,这些问题是根据税务和金融专业人士的意见制定的,涵盖 数值推理、语义分析、问题解决以及合规规则的应用。型号有 从两个维度进行评分:答案是否事实上正确以及逐步推理是否正确 清晰且专家般。 TaxEval v2 的性能显示各个模型之间只有很小的差异(图 2.5.8)。 15位顶级模特全部下架 在 3 个百分点的范围内,从 77.1%(克劳德十四行诗 4.6)到 74%(克劳德 3.7 十四行诗思维)。 税务评估 2.5 特定领域的表现 | 技术性能| 2026 年人工智能指数报告 74.20% 74.28% 74.33% 74.53% 74.57% 74.78% 74.86% 74.86% 75.06% 75.22% 75.70% 75.76% 75.88% 75.96% 77.11% 基米K2.5 奥1 克劳德作品 4.5(无思考) GPT 4o (2024-11-20) o3 o4迷你 克劳德作品 4.5(思考) GPT 5.1 GPT 4.1 GPT 5 迷你 Grok 4 快速(推理) GPT 5.2 格洛克3 克劳德作品 4.6(思考) 克劳德十四行诗 4.60% 20% 40% 60% 80% 100% 型号 准确度 TaxEval v2:准确性 来源:Vals.ai,2026 |图:2026年AI指数报告 图2.5.827 27 数据来源:https://www.vals.ai/benchmarks/tax_eval_v2。 ===== 第107页 ===== 107 2.5 特定领域的表现 | 技术性能| 2026 年人工智能指数报告 MortgageTax 评估模型从真实抵押税证书中提取结构化信息的能力, 使用文本和文档图像。该任务涉及两种类型的提取: 语义提取要求 模型来识别年份、包裹编号和县等字段,而数值提取则需要计算 年化应付金额。该数据集包括 1,258 个文档,分为公共验证、私人验证、 和保留的测试集。 MortgageTax 的得分遵循与 TaxEval 类似的模式,前 15 个模型集中在一个狭窄的范围内 性能范围(图2.5.9)。 Gemini 3.1 Pro Preview 以 69.4% 领先,GPT 4.1 垫底 组为 65.9%,相差约 3.5 个百分点。虽然几款Gemini车型占据了榜首 位置,总体准确率水平未达到 70%,这表明模型尚未完全或 能够可靠地从文档图像中提取和计算财务信息。 抵押税 65.94% 66.53% 66.85% 66.89% 67.13% 67.17% 67.69% 67.73% 68.52% 68.68% 68.68% 68.72% 68.92% 69.08% 69.40% GPT 4.1 基米K2.5 克劳德 3.7 十四行诗(思考) GPT 5 迷你 GPT 5.2 Gemini 2.5 专业版 克劳德作品 4.5(思考) 克劳德十四行诗 4.6 克劳德作品 4.6(思考) 克劳德作品 4.5(无思考) 克劳德 3.7 十四行诗(非思考) 双子座 3 闪光 (12/25) 双子座2.5专业版 双子座 3 Pro (11/25) Gemini 3.1 专业版预览 0% 20% 40% 60% 80% 100% 型号 准确度 抵押税:准确性 来源:Vals.ai,2026 |图:2026年AI指数报告 图2.5.928 28 数据来源:https://www.vals.ai/benchmarks/mortgage_tax。 ===== 第108页 ===== 108 2.5 特定领域的表现 | 技术性能| 2026 年人工智能指数报告 CorpFin 测试模型是否能够从冗长、密集的财务文档中理解和提取信息, 特别是信用协议可能超过 200 页。问题涵盖基本术语提取、数字 推理、总结、交叉引用多个部分以及针对特定行业的解释,所有这些 是根据金融分析师、律师和学者的意见而制定的。除了事实准确性之外,基准 评估模型是否能够导航并理解冗长、行话较多的法律和金融文本。它定义了 具有不同上下文设置的三个任务 - 精确页面、共享最大上下文和最大拟合上下文 - 来查看 模型的执行方式取决于文档访问。 与其他基准测试类似,CorpFin v2 的性能是紧密聚集的(图 2.5.10)。 Kimi K2.5领先 为 68.26%,GPT 4.1 垫底为 63.05%,相差约 5 个百分点。与抵押税一样, 没有一个模型损坏 70%。 企业金融公司 63.05% 63.68% 63.83% 64.49% 65.07% 65.31% 65.31% 65.89% 65.97% 66.05% 66.43% 66.90% 67.02% 68.03% 68.26% GPT 4.1 双子座 3 Pro (11/25) GPT 5.1 Gemini 3.1 专业版预览版 (02/26) 克劳德作品 4.5(思考) 酷文3.5 Plus 克劳德十四行诗 4.6 GPT 5.2 Grok 4.1 快速(推理) 格洛克4 双子座 3 闪光 (12/25) Grok 4 快速(推理) 克劳德作品 4.6(思考) Qwen 3 最大思维 基米K2.5 0% 20% 40% 60% 80% 100% 型号 准确度 CorpFin v2:准确性 来源:Vals.ai,2026 |图:2026年AI指数报告 图2.5.1029 29 数据来源:https://www.vals.ai/benchmarks/corp_fin_v2。 ===== 第109页 ===== 109 2.5 特定领域的表现 | 技术性能| 2026 年人工智能指数报告 与斯坦福大学研究人员、全球系统重要性银行和行业合作开发 财务代理评估人工智能代理执行入门级财务分析师典型任务的能力。 它包括 537 个精心设计的问题,用于测试信息检索、市场研究和 财务预测。 在 Finance Agent v1.1 上,性能比其他财务基准更加多样化(图 2.5.11)。克洛德 Sonnet 4.6 以 63.33% 领先,Kimi K2.5 的得分逐渐下降至 50.62%,差距约为 13 个百分点 点。即使最高分也低于三分之二的准确度,反映了所看到的特定领域的挑战 跨越其他财务基准,以及代理任务的更广泛的难度,这是讨论的 下文第 2.6 节“代理基准”中。 财务代理 50.62% 51.93% 52.15% 52.45% 53.18% 53.51% 54.47% 54.50% 55.15% 55.31% 58.53% 58.81% 59.72% 60.05% 63.33% 基米K2.5 GPT 5 迷你 通用技术5 Grok 4.1 快速(推理) GLM 5 格洛克4 酷文3.5 Plus 克劳德十四行诗 4.5(思考) 双子座 3 Pro (11/25) GPT 5.1 GPT 5.2 克劳德作品 4.5(思考) Gemini 3.1 专业版预览版 (02/26) 克劳德作品 4.6(思考) 克劳德十四行诗 4.60% 20% 40% 60% 80% 100% 型号 准确度 Finance Agent v1.1:准确性 来源:Vals.ai,2026 |图:2026年AI指数报告 图2.5.1130 30 数据来源:https://www.vals.ai/benchmarks/finance_agent。 ===== 第110页 ===== 110 人工智能也在法律领域得到评估,其任务范围从解释法院判决到 将规则应用于新的事实模式。下面涵盖的基准反映了模型处理法律的能力 需要以特定文档而不是一般知识为基础的推理任务。 法律 CaseLaw v2 是评估法学硕士现实世界诉讼和法律研究任务的基准。它使用最近的 美国和加拿大法院的判决日期晚于大多数模特的训练截止日期,并且并非 由于许可限制,可以大规模访问,这有助于确保模型对所提供的进行推理 文件而不是依赖记忆的法律知识。该基准测试包括 300 项验证测试 以及 104 项测试(涵盖单案例和多案例推理),涵盖七个法律推理维度, 包括检索关键先例、多文档问答、计算、表格和时间顺序 推理。 GPT-5.1 以 73.4% 的准确率领先于 CaseLaw v2,GPT 4.1 以 69.9% 的准确率紧随其后(图 2.5.12)。其余的 排名前 15 的型号落在 62% 到 66% 之间,这表明还有很大的改进空间。一次重复出现 问题是模型倾向于依赖一般知识,而不是将其答案建立在所提供的基础上 文件,即使明确指示这样做。 判例法 2.5 特定领域的表现 | 技术性能| 2026 年人工智能指数报告 62.06% 62.17% 62.59% 63.88% 63.99% 64.52% 64.84% 65.70% 65.70% 65.81% 66.02% 66.45% 68.49% 69.88% 73.42% 克劳德作品 4.6(思考) 克劳德十四行诗 4.5(思考) 克劳德作品 4.5(思考) 双子座2.5专业版 克劳德十四行诗 4.6 命令A Gemini 3.1 专业版预览版 (02/26) 基米K2思维 Grok 4 快速(推理) 格洛克4 GPT 5.2 通用技术5 GPT 5 迷你 GPT 4.1 总产值 5.10% 20% 40% 60% 80% 100% 型号 准确度 CaseLaw v2:准确性 来源:Vals.ai,2026 |图:2026年AI指数报告 图2.5.1231 31 数据来源:https://www.vals.ai/benchmarks/case_law_v2。 ===== 第111页 ===== 111 2.5 特定领域的表现 | 技术性能| 2026 年人工智能指数报告 LegalBench 是一个众包基准,用于对反映真实法律工作的任务进行法律推理。而不是 测试一般问答,重点是仔细阅读、发现问题以及将规则应用于事实。 该基准涵盖六种类型的法律推理,包括问题发现、规则回忆、结果预测、 规则应用、法律文本解释和修辞理解。下面的结果反映了模型 截至 2026 年初的业绩。 排行榜结果上,排名前15的模型得分均在83%以上(图2.5.13)。总体表现最好的是 Gemini 3.1 Pro Preview (2/26) 的准确率达到 87.4%,紧随其后的是 Gemini 3 Pro (11/25),准确率达到 87%。总计 所有 15 个型号的差异约为 4 个百分点,范围很窄,因此很难区分 其中。 法律法庭 图2.5.1332 32 数据来源:https://www.vals.ai/benchmarks/legal_bench。 83.36% 83.46% 83.76% 83.80% 84.06% 84.08% 84.32% 84.60% 85.10% 85.30% 85.68% 86.02% 86.86% 87.04% 87.40% GLM 4.7 克劳德作品 4.1(非思考) o3 Gemini 2.5 Flash 预览版 4/17 (不假思索) GLM 5 克劳德十四行诗 4.5(思考) Gemini 2.5 专业版 克劳德作品 4.5(思考) 酷文3.5 Plus 克劳德作品 4.6(思考) GPT 5.1 通用技术5 双子座 3 闪光 (12/25) 双子座 3 Pro (11/25) Gemini 3.1 专业版预览版 (02/26) 0% 20% 40% 60% 80% 100% 型号 准确度 法律基准:准确性 来源:Vals.ai,2026 |图:2026年AI指数报告 ===== 第112页 ===== 112 2.6 人工智能代理 2 技术性能| 2026 年人工智能指数报告 代理基准测试人工智能系统是否能够超越回答问题并真正完成任务 现实环境中的多步骤任务。这些任务通常涉及导航软件、调用工具、 管理文件或与网站和数据库交互。更复杂的任务可能需要代理 协调整个工作流程,协调多个工具和系统以实现目标。例如, 代理可能需要搜索数据库、应用策略规则,然后更新客户记录,所有这些都在一个 单一对话。除非另有说明,下面报告的结果反映了截至 2026 年初。 GAIA 是通用人工智能助手的基准测试,由 Meta 于 2024 年 5 月推出。它测试模型是否能够 处理有能力的助手需要回答的多步骤、现实世界的问题——问题 通常需要跨多个来源进行网页浏览、文件处理和推理。 GAIA 的准确率从 2025 年 1 月的约 20% 上升到 2025 年 9 月的 74.5%(图 2.6.1)。的 人类基线为 92%,差距约为 17.5 个百分点。 盖亚 一月-2025年二月-2025年三月-2025年四月-2025年五月-2025年 6月-2025年7月-2025年8月-2025年9月-2025年 0% 20% 40% 60% 80% 100% 准确度 74.50% 盖亚:准确性 来源:GAIA 排行榜,2026 |图:2026年AI指数报告 92%,人类基线 图2.6.133 33 数据来源:https://hal.cs.princeton.edu/gaia。 ===== 第113页 ===== 113 图2.6.234 34 数据来源:https://epoch.ai/benchmarks/。 2.6 人工智能代理 | 技术性能| 2026 年人工智能指数报告 OSWorld 是一个可扩展的真实计算机环境,旨在评估开放式的多模式人工智能代理 跨操作系统(如 Ubuntu、Windows 和 macOS)的任务。它包括 369 个涉及桌面的任务 以及 Web 应用程序、文件操作和多应用程序工作流程。计算机科学专业的学生解决 其中 72% 的任务平均时间约为两分钟,而历史上最强大的模型 仅取得了 1%–12% 的成功,特别是在涉及图形界面和多应用程序工作流程的任务上。 然而,最近差距已经缩小了很多,Claude Opus 4.5 在 OSWorld 上的准确性上领先 66.3%(图2.6.2)。这使得最佳模型与人类表现的差距在 6 个百分点以内。这是 本节的基准之一,模型和人类之间的差距缩小得最快。 WebArena 是一个用于评估自主 Web 代理的真实 Web 环境,它引入了第 812 章 以自然语言意图编写的长期任务,例如查找信息、导航网站等 跨多个页面配置内容。 WebArena 不是比较操作痕迹,而是检查是否 代理实际上通过验证站点的结果状态(包括数据库、页面)来实现其目标 内容和 URL。 WebArena 的成功率从 2023 年的 15% 左右稳步上升到 2026 年初的 74.3%(图 2.6.3)。目前,最好的模型与人类基线 78.2% 的差距在 4 个百分点以内。所有代理中 在本节的基准测试中,WebArena 显示了模型与人类之间的最小剩余差距 性能。 操作系统世界 网络竞技场 2024 2025 0% 20% 40% 60% 80% 100% 准确度 66.30% OSWorld:准确性 来源:Epoch AI,2026 |图:2026年AI指数报告 72.35%,人类基线 ===== 第114页 ===== 114 图2.6.335 图2.6.436 35 数据来源:https://docs.google.com/spreadsheets/d/1M801lEpBbKSNwP-vDBkC_pF7LdyGU1f_ufZb_NWNBZQ/edit?gid=0#gid=0。 36 数据来源:https://github.com/openai/mle-bench。 2.6 人工智能代理 | 技术性能| 2026 年人工智能指数报告 2023 2024 2025 2026 0% 20% 40% 60% 80% 100% 成功率 74.30% WebArena:成功率 来源:WebArena 排行榜,2026 |图:2026年AI指数报告 78.24%,人类基线 2024 2025 2026 0% 20% 40% 60% 80% 100% 成功率64.44% MLE-bench:成功率 来源:MLE-bench 排行榜,2026 |图:2026年AI指数报告 MLE-bench 评估机器学习 AI代理的工程能力。它包括 共 75 场跨任务的 Kaggle 比赛 在 NLP、计算机视觉、信号处理、 等等。比赛是手动进行的 精心策划,重建训练和测试部分 重新实施评分代码,以便代理商可以 本地评分并直接比较 对抗人类 Kaggle 排行榜和奖牌 阈值。 代理商也取得了重大进展 MLE-bench,从大约 17% 的成功率上升 2024 年到 2026 年初达到 64.4%(图 2.6.4)。 在如此短的时间内取得如此程度的提升 表明端到端能力不断增强 机器学习任务,尽管竞争 风格问题比 开放式作品,最真实的特征 世界数据科学。 MLE 工作台 ===== 第115页 ===== 115 图2.6.537 图2.6.6 38 37 数据来源:https://cybench.github.io/。 38 数据来源:https://taubench.com/#leaderboard?benchmark=text。 2.6 人工智能代理 | 技术性能| 2026 年人工智能指数报告 2024 2025 2026 0% 20% 40% 60% 80% 100% 无指导解决% 93% Cybench:无引导的解决百分比 来源:Cybench 排行榜,2026 年 |图:2026年AI指数报告 克劳德十四行诗 4.5 GLM-5 双子座 3 专业版 双子座3闪光 Qwen3.5-397B-A17B GPT-5.2 克劳德作品 4.5 0% 20% 40% 60% 80% 100% 通过@1 62.9% 63.2% 65.8% 67.8% 68.4% 69.9% 70.2% τ-长凳:pass@1 来源:τ-bench 排行榜,2026 |图:2026年AI指数报告 Cybench 是一个基准框架 评估人工智能代理的能力 网络安全。其中包括40个专业级 跨越六个夺旗类别的任务, 包括密码学、网络安全、逆向 工程、取证和开发。任务 通过“首先 解决时间”,范围从两分钟到 近 25 小时,给基准测试一个非常好的结果 高难度上限。 Cybench 上的无引导解决率为 93%, 高于 2024 年的 15%(图 2.6.5)。这是 最快的改善率 本节中的基准,它可能会突出显示 网络安全挑战任务非常适合 目前的代理能力。 τ-bench 通过测试采用了不同的方法 代理执行涉及聊天的现实任务 与用户一起调用外部工具或 API。它 将代理放置在现实领域中,例如 零售和航空公司,具有底层数据库, 政策限制和多轮对话。 衡量成功与否的标准是代理人是否 产生正确的最终结果,即 通常可以从结果数据库中进行验证 状态。这使其成为端到端工具使用的测试 并在互动设置中遵守规则,而不是 只是语言能力。 τ-bench 上的领先模型达到 pass@1 得分在 62.9% 至 70.2% 之间(图 2.6.6)。 Claude Opus 4.5 以 70.2% 领先,其次是 GPT 5.2 为 69.9%,Qwen3.5 为 68.4%。的 前七名车型的分布范围很窄 7.3个百分点,没有模型超过 71%,建议管理多轮 正确使用工具的同时进行对话 政策约束依然困难 即使对于前沿模型。 赛比克 τ-长凳 ===== 第116页 ===== 116 2.7 机器人技术和 自主运动 2 技术性能| 2026 年人工智能指数报告 机器人技术 RLBench 是机器人操作的基准测试,它使用 100 每个任务的演示。每个任务都涉及不同的操作挑战,例如拾取物体, 堆叠物品或操作简单的机制。 截至 2026 年 1 月,在 18 个任务 RLBench 子集上表现最好的方法是 EquAct,达到 平均成功率为 89.4%,而前任领导者 SAM2Act 的平均成功率为 86.8%(图 2.7.1)。平等法 还报告了在引入完整 3D 旋转的更困难的评估设置下更强的性能 变化,以前的方法往往会退化。取得了持续进步,从 48% 左右开始 2022 年到 2025 年接近 90%,尽管基准测试在受控模拟中测试相对短期的任务 环境。 RLBench 2022 2023 2024 2025 0% 20% 40% 60% 80% 100% 成功率 89.40% RLBench:成功率(18 个任务,100 个演示/任务) 来源:人工智能指数,2025 |图:2026年AI指数报告 图2.7 .1 行为-1K BEHAVIOR-1K 是围绕人类真实需求构建的模拟基准。这些任务来自调查询问 人们希望机器人帮助完成哪些家务活,从而产生 1,000 项现实活动。这些是 模拟家庭环境中的长视野移动操作挑战,旨在弥合差距 当前的研究和以人为本的应用之间的关系。 ===== 第117页 ===== 117 2025 年行为挑战赛的结果表明这些任务仍然非常困难(图 2.7.2)。顶部 Robot Learning Collective 团队在保留的测试集上取得了约 26% 的 Q 分数39,这意味着 仅以可接受的质量完成了所需任务目标的四分之一。完整任务成功率 甚至更低,顶级团队仅达到 12.4%。这些分数清楚地表明,可靠地执行 现实环境中的家务劳动仍然超出了当前的能力。 39 Q-score 通过计算已完成子目标的比例并选择最匹配的子目标来衡量策略满足任务目标的程度 目标条款。它授予部分学分,因此即使没有完成全部任务,取得有意义进展的政策也会得分更高。这使得 Q 分数成为 与二元成功率相比,用于比较跨行为任务的策略更平滑、更可靠的指标。 2.7 机器人和自主运动| 技术性能| 2026 年人工智能指数报告 5.20% 7.60% 10.80% 11.40% 12.40% 9.47% 12.04% 15.91% 25.14% 25.99% 0% 5% 10% 15% 20% 25% 具身智能 北极星 简单人工智能机器人 彗星 机器人学习集体 Q 分数 完整任务成功率 分数 团队 BEHAVIOR-1K:完整任务成功率与 Q 分数(保留测试) 资料来源:行为挑战排行榜,2025 年 |图:2026年AI指数报告 图2.7 .2 图2.7 .3 大多数机器人基准测试都会衡量模型是否 可以完成一个任务。 ResponsibleRobotBench 措施 如果该任务安全完成时环境 包括真正的危险。该基准是围绕 23 涉及电气、消防/化学和 与人类相关的危险。为了安全地完成任务, 机器人必须检测风险、推理安全、制定安全计划 行动,并在必要时请求人工援助。 绩效是通过安全成功率来衡量的, 仅当两个任务都满足时才算任务成功 任务完成,安全条件满足。 GPT-4o 以安全分数取得最佳结果 0.64,优于 GPT-4o mini 的 0.40 和 最强的开源模型,Qwen-72B,0.35 (图2.7.3)。即使是顶级模型也未能完成 超过三分之一的任务是安全的,但失败频繁 当任务完成和安全都必须满足时 同时。 0.21 0.35 0.12 0.40 0.64 QWEN7B QWEN72B 内部 2.5 4B GPT4o-MINI GPT4o 2023 2024 0.00 0.10 0.20 0.30 0.40 0.50 0.60 0.70 整体SSR↑ ResponsibleRobotBench:安全成功率(SSR) 资料来源:Zhang 等人,2025 |图:2026年AI指数报告 责任机器人工作台 ===== 第118页 ===== 118 亮点: 人形机器人 正如去年的人工智能指数所述,人形机器人在 2024 年开始吸引人们的广泛关注,并推出了新的 Figure AI、Tesla 和 Boston Dynamics 等公司推出了硬件。 2025年,该领域继续 随着可用人形平台的数量和种类显着增加(图 2.7.4)。 最强烈的信号来自早期工业试点项目和制造规模的雄心 而不是广泛部署。以Figure AI的Figure 02机器人为例,上线时间为11个月 位于南卡罗来纳州的一家 BMW 工厂,记录了超过 1,250 个运行时间并装载了超过 90,000 个零件 超过30,000辆汽车。在中国,Unitree和AgiBot等供应商压低了价格并提高了产量 将类人机器人视为准消费硬件产品,而不是定制的研究系统。一些 公司正在将其人形机器人瞄准家庭环境,挪威的 1X 正在等待名单 交付价值 20,000 美元的家用机器人。 总体情况是硬件可用性和投资活动快速增长,而不是 广泛部署。大多数公司的里程碑以及交付都是以将来时态构建的 时间表;提供预期用例来代替经过验证的操作数据。目前尚不清楚是否 对人形机器人的需求将与当前正在建造的供应相匹配,客户将是谁 规模化,以及这些平台从结构化工厂试点项目转向非结构化的速度有多快 环境。 2.7 机器人和自主运动| 技术性能| 2026 年人工智能指数报告 公司 国家 平台 重点 值得注意的细节 圣所AI加拿大凤凰城商业试点 完成数百个商业试点任务 Unitree中国G1、R1研究、工业 R1 4,900 美元起; G1 起价 13,500 美元 先进的感知 优必选中国 Walker S、S2 工业 LLM-综合规划;自主电池 交换 AgiBot中国人形舰队 数据收集, 工业 约 100 个遥控人形机器人,最多可运行 17 个 小时/天;已制造约 10,000 件 傅立叶智能中国GR-1 医疗、服务、 仅工业相机视觉和法学硕士交互 DeepRobotics中国人形平台工业 将四足动物的专业知识扩展到人形动物 外形尺寸 Neura Robotics 德国 4NE-1 家庭、工作场所 密集传感器,包括安全的人造皮肤 人类协作 Addverb.ai 印度 开发中 操纵 从移动机器人扩展到 人形操纵 ===== 第119页 ===== 119 亮点: 2.7 机器人和自主运动| 技术性能| 2026 年人工智能指数报告 Milagrow India 开发中 操纵 从移动机器人扩展到 人形操纵 Mentee Robotics 以色列 MenteeBot 仓库 使用自然语言的自主工作流程 命令 丰田研究中心 日本研究所 远程操作系统 零售、物流 专注于远程操作 本田日本机器人平台通用持续人形和操纵 研究 SoftBank Robotics 日本 各种零售、物流 遥控操作系统 Telexistence 日本 各种零售、物流 零售业的遥控操作 环境 1X 挪威 NEO 主场 由 OpenAI 支持; 2026 年美国开放候补名单 送货费用约为 20,000 美元或每月 499 美元 韩国彩虹机器人 RB-Y1 工作场所 工业cobot(协作机器人) 适合人形机器人的组件 应用 LG 电子 韩国 各种工作场所 利用协作机器人组件 类人应用程序 技术 阿联酋创新研究所测试平台体现人工智能研究 使用开放重量 Falcon 构建测试平台 型号 工程艺术 英国 Ameca 社交互动, 研究 为顾客呈现逼真的面部表情 参与度 人形/SKL 英国 HMND 01 Alpha 工业 七个月开发;工厂试验 进行中 图AI美国图02/03工业、家居 在宝马任职11个月; 1,250+ 运行时间;装载了 90,000 多个零件 30,000 多辆汽车 特斯拉美国Optimus(第3代)内部物流 第三代;对外销售计划 2027年 波士顿动力美国阿特拉斯研究公司 先进运动测试台 操纵 Apptronik美国阿波罗工业安全级围绕人进行操作 斯基德人工智能美国 基础模型 堆栈多实施例 专为工作而设计的全方位控制堆栈 跨越多个机器人身体 图2.7 .4 ===== 第120页 ===== 120 亮点: 物理人工智能和机器人基础模型 人们需要帮助的大部分事情都发生在物理空间中,从在工厂组装产品到 协助做家务。为了使人工智能发挥作用,它必须不仅仅处理屏幕上的文本和图像。 它必须感知周围环境,推理物体的行为方式,并根据这些判断采取行动 身体。 在本章中,事实证明,人工智能最难的基准是那些需要在以下方面采取行动的基准: 现实世界中,环境是不可预测的,错误会产生实际后果。机器人技术 本节前面的基准反映了这一困难。传统机器人通过跑步来回避问题 固定任务的固定程序,但这种方法在任何从一天到一天变化的环境中都会崩溃。 下一个。 越来越多的研究正在试图通过为机器人提供相同的通用功能来缩小这一差距 人工智能推动了语言和视觉的进步。视觉-语言-动作模型(VLA)取代了 传统的管道由单独的模块组成,用于查看、规划和使用单个网络进行操作 直接从相机输入和语言指令到电机控制。 Physical Intelligence 的 π₀ (2024) 和 π0.6 (2025) 演示了这种方法,执行洗衣等任务 跨不同的机器人平台折叠,无需针对特定任务的再训练。 Nvidia 的 GR00T 型号和 Gemini 机器人学采取类似的方向,训练可以控制不同机器人的单一模型 任务。 然而,最大的限制是数据。语言模型在互联网上数十亿页的文本上进行训练。 每一条机器人训练数据都需要一个执行任务的物理机器人或一个高保真机器人 模拟,两者都缓慢且昂贵。世界基础模型(WFM)是一种回应, 生成合成物理数据,以便机器人无需物理试验即可学习。 Nvidia 的 Cosmos 就是一个例子。 但 VLA 技术仍处于研究阶段,这些模型在实际应用中的功能之间存在差距。 受控的设置以及他们在现实世界中可以处理的内容仍然很广泛。 2.7 机器人和自主运动| 技术性能| 2026 年人工智能指数报告 ===== 第121页 ===== 121 2.7 机器人和自主运动| 技术性能| 2026 年人工智能指数报告 自动驾驶汽车开发在多个市场已经度过了研究阶段,并提供商业服务 现已规模化运营。本节跟踪部署趋势、基准测试中的技术创新和 数据集,以及通过碰撞报告数据实现的安全性。本节的可用数据集中在 美国,以及较小程度上的中国。 Mobileye、Vay 等欧洲自动驾驶汽车运营商 和 Wayve 都处于活跃状态,但可比较的行程或部署数据尚未公开。中文数据也 有限,百度的 Apollo Go 是为数不多的发布详细客流量数据的服务之一。 自动驾驶汽车 自动驾驶汽车的部署将在 2025 年加速,美国和中国均出现增长。由 2025 年底,Waymo 在美国主要城市运营了大约 2,500 辆全自动机器人出租车,包括 凤凰城、旧金山、洛杉矶、奥斯汀和亚特兰大,每周服务录制量约为 450,000 条 旅行。仅在加利福尼亚州,每周付费出行次数就从 2023 年中期的接近零攀升至约 283,880 次 2025 年末,2025 年 2 月后急剧增长(图 2.7.5)。规模较小的运营商 Zoox 开始出现 2025 年末加州试点出行数据(图 2.7.6)。在中国,百度的 Apollo Go 自动驾驶网约车 到 2025 年,该服务将提供约 1100 万次完全无人驾驶乘车服务,同比增长 175%(图 2.7.7)。该服务已从 2022 年的 150 万人次增长到 2025 年的 1100 万人次,反映了客运量的快速扩张 用法。 部署 2023年6月-2023年9月-2023年12月-2023年3月-202年 4 202年6月 4 202 年 9 月 4 202 年 12 月 4 2025年3月-2025年6月-2025年9月-2025年12月-2025年 0 50 100 150 200 250 300 每周带薪出行次数(千次) 283.88 2023-25 年加州 Waymo 自动驾驶汽车出行 资料来源:加州公用事业委员会,2025 |图:2026年AI指数报告 图2.7.540 40 根据向加州公用事业委员会报告的这些自动驾驶汽车部署指标,与 Waymo 和 Cruise 有关(直到后者被 通用汽车于 2024 年 12 月停产)。其他几家公司,包括 Aurora、Tensor(以前称为 AutoX)、WeRide Corp 和 Zoox, 处于试点阶段。特斯拉尚未获得 CPUC 批准提供自动驾驶乘客服务。数据来源:加州公用事业委员会 季度报告。 ===== 第122页 ===== 122 图2.7.641 图2.7.742 41 试点数据涵盖为测试而进行的乘客乘车,通常无需付费。部署数据涵盖付费自动客运服务。 如果公司在不同领域或阶段进行部署和测试,则可以同时参与这两个计划。数据来源:加州公共 公用事业委员会季度报告。 42 2025 年的值为估计值。数据来源:百度财务业绩报告(2022年、2023年、2024年、2025年)。 〜11M 4M 3M 1.5M 2022 2023 2024 2025 0 2M 4M 6M 8M 10M 出行次数 Apollo Go 自动驾驶汽车出行,2022–25 来源:百度2025 |图:2026年AI指数报告 2.7 机器人和自主运动| 技术性能| 2026 年人工智能指数报告 否 v-2022 12月-2022年1月-2023年2月-2023年3月-2023年4月-2023年5月-2023年 2023 年 6 月 2023 年 7 月 2023 年 8 月 2023 年 9 月 2023 年 10 月否 v-2023 2023 年 12 月 202 年 1 月 4 202 年 2 月 4 202年3月 4 202 年 4 月 4 202年5月 4 202年6月 4 202 年 7 月 4 202 年 8 月 4 202 年 9 月 4 202 年 10 月 4 否 v-202 4 202 年 12 月 4 一月-2025年二月-2025年三月-2025年四月-2025年五月-2025年 2025 年 6 月 2025 年 7 月 2025 年 8 月 2025 年 9 月 2025 年 10 月否 v-2025 2025 年 12 月 0 5 10 15 20 25 韦莫 佐克斯 试点次数(千次) 加州自动驾驶汽车试点之旅,2022-25 资料来源:加州公用事业委员会,2025 |图:2026年AI指数报告 自动驾驶的技术前景是 在几个方面发生转变。基准正在巩固 围绕端到端驾驶的排行榜,例如 Waymo 的 2025 年开放数据集挑战, 强调基于愿景的方法 越来越多地针对长尾案例的泛化。 大型多传感器数据集也变得越来越多 研究的中心。 Nvidia 的 PhysicalAI Autonomous 车辆数据集包括多摄像头、激光雷达和雷达 涵盖各种天气、地理和环境的数据 罕见事件。 在模型层面,结合推理和行动 方法正在获得关注。阿尔帕马约 1, 一个 视觉-语言-动作模型(VLA),侧重于两者 轨迹质量和可解释的推理,同时 在安全和延迟限制下运行 真正的驾驶。多模态推理基准是 技术创新和新基准 ===== 第123页 ===== 123 2.7 机器人和自主运动| 技术性能| 2026 年人工智能指数报告 也在不断发展,现在评估多视图空间推理和逐步驱动逻辑,而不仅仅是最终的- 答案准确度。更广泛地说,世界模型和强化学习正在超越单纯的模仿, 端到端驾驶,因为这些方法可以更好地推广到训练期间未见过的交通场景。 过去十年中,可用驾驶数据的规模也有所增长(图 2.7.8)。早期基准测试 2012 年至 2019 年期间发布的数据包含个位数小时数。 Waymo 带来了重大改变 2019 年开放数据集大约 500 小时,其次是 2024 年的 nuPlan 和 2025 年 Nvidia 的物理 AI-AV 约1,600小时。然而,仅靠时间并不能体现数据质量或内容的差异。一个数据集 模拟驾驶与真实道路上的真实汽车捕获的驾驶不同,即使两者报告相同 小时数。因此,最好将该图表视为数据量趋势,而不是直接比较 跨基准。 KITTI 视觉基准套件 阿尔戈宇宙 v2 Waymo 开放数据集 努计划 驱动端到端 驱动器LMM-o1* 卡拉排行榜* 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 500 1,000 1,500 人 发布年份 驾驶数据量(以小时为单位) 自动驾驶基准/数据集:驾驶时间数据,2012-25 来源:人工智能指数,2025 |图:2026年AI指数报告 阿尔戈宇宙 v1 新场景 NuPlanQA* NVIDIA 物理 AI-AV Waymo 开放数据集 - E2E RAMBLE(从模仿到探索)* 图2.7.843 43 对于标有星号的数据集,驾驶时间数据是估计的,而不是直接报告的。 关于事故报告的常行通令(通令)是国家公路交通安全 国家公路交通安全管理局 (NHTSA) 强制要求制造商和运营商报告某些事故 涉及自动驾驶系统 (ADS) 或 SAE 2 级高级驾驶员辅助系统 (ADAS)。 该命令于 2021 年首次发布,并于 2021 年、2023 年和 2025 年进行修订,为 NHTSA 提供一致的事故数据 调查事件并执行安全要求。 自 NHTSA 开始收集数据以来,每月报告的 ADS 事件总体呈上升趋势 到 2021 年中期,从早年的每月约 10-25 次上升到 2021 年每月的频繁超过 80 次 2024 年末和 2025 年(图 2.7.9)。按公司细分,Waymo 占据最大份额 报告的事件,这与其更大的部署足迹相一致。其他运营商,包括 福特、May Mobility 和 Transdev Alternative Services 报告事故数量更低且更稳定。 安全 ===== 第124页 ===== 124 2.7 机器人和自主运动| 技术性能| 2026 年人工智能指数报告 如果没有与人类驾驶的比较,原始事故计数就很难解释。 Waymo 有 已发布的数据将其仅限骑手的碰撞率与涵盖相同内容的人类驱动基准进行比较 英里和面积(图 2.7.10)。 Waymo 的两起受伤报告事件的报告率均较低 (图 2.7.11)和更严重的安全气囊展开报告事件(图 2.7.12)。最大差距 出现在车辆与车辆交叉口事故中,人类基准记录为 198 到 Waymo 的 8。该数据来自 Waymo 自己截至 2025 年 9 月的安全报告,应 据此查看。 202 年 7 月 1 202 年 8 月 1 202 年 9 月 1 202 年 10 月 1 否 v-202 1 202 年 12 月 1 一月-2022年二月-2022年三月-2022年四月-2022年五月-2022年 2022 年 6 月 2022 年 7 月 2022 年 8 月 2022 年 9 月 2022 年 10 月否 v-2022 12月-2022年1月-2023年2月-2023年3月-2023年4月-2023年5月-2023年 2023 年 6 月 2023 年 7 月 2023 年 8 月 2023 年 9 月 2023 年 10 月否 v-2023 2023 年 12 月 202 年 1 月 4 202 年 2 月 4 202年3月 4 202 年 4 月 4 202年5月 4 202年6月 4 202 年 7 月 4 202 年 8 月 4 202 年 9 月 4 202 年 10 月 4 否 v-202 4 202 年 12 月 4 一月-2025年二月-2025年三月-2025年四月-2025年五月-2025年 2025 年 6 月 2025 年 7 月 2025 年 8 月 2025 年 9 月 2025 年 10 月否 v-2025 2025 年 12 月 0 20 40 60 80 100 ADS 事件数量 每月报告的 ADS 事件,2022–25 资料来源:NHTSA 2025 |图:2026年AI指数报告 202 年 8 月 1 否 v-202 1 2022年2月-2022年5月 2022 年 8 月 否 v-2022 2023年2月-2023年5月 2023 年 8 月 否 v-2023 202 年 2 月 4 202年5月 4 202 年 8 月 4 否 v-202 4 2025年2月-2025年5月 2025 年 8 月 否 v-2025 0 20 40 60 80 100 ADS 事件数量 0、邮轮 0、通用汽车 0、Transdev 替代服务 0、祖克斯 0、5月流动性 0、阿尔戈人工智能 0、福特汽车公司 0、蜂鸣声 13、韦莫 选定公司每月报告的 ADS 事件,2022-25 资料来源:国家公路交通安全管理局,2025 |图:2026年AI指数报告 图2.7 .9 图2.7.1044 44 该图表仅包括在整个报告期内报告至少 10 起 ADS 事件的公司。 ===== 第125页 ===== 125 2.7 机器人和自主运动| 技术性能| 2026 年人工智能指数报告 图2.7.1145 图2.7.1246 45 数据来源:https://www.waymo.com/safety/impact/#methodology。 46 数据来源:https://www.waymo.com/safety/impact/#methodology。 3 6 5 4 8 2 3 44 3 8 8 11 36 24 51 25 34 4 76 8 198 34 0 10 20 30 40 50 60 70 80 90 100 110 120 130 140 150 160 170 180 190 200 所有其他人 骑自行车的人 摩托车 行人 二次碰撞 单车 V2V支持 V2V F2R V2V正面 V2V交叉口 V2V横向 仅限 Waymo 骑手 平均。人为驱动的基准 事件数量 事件类型 按类型划分的任何伤害报告事件:Waymo 与相同里程/区域的基准对比 来源:Waymo,2025 |图:2026年AI指数报告 1 9 17 号 3 8 1 5 14 27 6 119 12 0 10 20 30 40 50 60 70 80 90 100 110 120 所有其他人 二次碰撞 V2V F2R V2V正面 V2V交叉口 V2V横向 仅限 Waymo 骑手 平均。人为驱动的基准 事件数量 事件类型 按类型划分的安全气囊部署报告事件:Waymo 与相同里程/区域的基准对比 来源:Waymo,2025 |图:2026年AI指数报告 ===== 第126页 ===== 126 负责任的人工智能 3 2026 年人工智能指数报告 概述 负责任的人工智能(RAI)的基础设施正在不断发展,但是 进展不平衡,跟不上 人工智能部署的速度。新的安全基准 扩大,更多组织正在采用负责任的人工智能 政策以及政府支持的人工智能安全和/或安保 机构已遍布更多国家。负责任的使用 人工智能的发展与负责任地使用数据密不可分, 特别是隐私和其他法律问题。有 由于所有权不明确,人工智能治理也令人担忧 人工智能系统的发展,引发了企业是否可以 开发系统或购买系统的消费者应该 承担责任以及每个利益相关者采取什么政策 应该遵循。虽然人工智能事件的记录报告是 越来越多的前沿模型很少报告负责任的结果 人工智能基准和基础模型透明度下降 继上一年有所改善后,到 2025 年。最近的研究 表明改进一个负责任的人工智能维度是可以实现的 以牺牲他人为代价,隐私的增加降低了公平性 或安全性的提高降低了准确性。没有框架 用于进行这些权衡;对于尺寸,例如 公平性、隐私性、可解释性、标准化数据 跟踪一段时间内的进展所需的信息并不存在。虽然这 本章借鉴了现有证据,讨论的是 受到测量中持续存在的差距的限制。 ===== 第127页 ===== 127 3 负责任的人工智能 | 2026 年人工智能指数报告 章节亮点 3.1 范围和维度 负责任的人工智能 3.2 评估负责任的人工智能 人工智能事件 示例 RAI 基准 事实性和真实性 休斯幻觉 评估模型(HHEM) 排行榜 AA-奥明科学 亮点:信念与事实: 可靠性基准测试 人工智能伴侣 3.3 组织如何 企业 查看 RAI 负责任的人工智能成熟度 人工智能事件、风险和缓解措施 努力 人工智能治理与投资 实施、障碍和 好处 监管影响 3.4 学术界的 RAI 出版卷 地理分布 3.5 RAI 政策制定 亮点:全球人工智能 治理参与 128 129 132 132 133 134 135 136 136 138 139 140 140 141 142 144 146 147 147 149 150 151 内容 3.6 隐私数据治理 数据保护和隐私 3.7 公平与偏见 偏见和不公平歧视 性别平等 文化和语言多样性 亮点:包容性和 全球语言差距 3.8 透明度 开放度指数 基础模型 透明度指数 3.9 安全与保障 全球人工智能安全研究所 基准测试 头盔安全 AI发光 安全基准结果 越狱 T2T 基准 v0.5 结果 3.10 RAI 维度之间的权衡 153 153 155 155 156 156 158 163 163 163 165 165 166 166 167 167 169 170 ===== 第128页 ===== 128 章节亮点 负责任的人工智能基准测试正在增加,但跟不上人工智能的进步 部署。几乎所有领先的前沿模型开发人员都报告了能力结果 MMLU 和 SWE-bench 等基准,但仍保留有关负责任的 AI 基准的报告 稀疏。记录在案的人工智能事件持续增加,人工智能事件数据库记录了 362 起 2025 年,高于 2024 年的 233 个。 1 人工智能模型很难区分知识和信仰之间的区别。以新的精度 根据基准,26 名顶级模特的幻觉率从 22% 到 94% 不等。 GPT-4o 的准确性 从98.2%下降到64.4%,DeepSeek R1从90%以上下降到14.4%。当一个假 陈述被呈现为另一个人相信的东西,模型可以很好地处理它。当 同样的错误陈述被呈现为用户相信的东西,性能崩溃。 2 组织正在正规化负责任的人工智能工作,但知识和预算差距仍然缓慢 收养。到 2025 年,人工智能特定治理角色将增长 17%,而没有人工智能治理角色的企业所占比例 负责任的人工智能政策从 24% 大幅下降至 11%。实施的主要障碍 知识差距(59%)、预算限制(48%)和监管不确定性(41%)仍然存在。 3 塑造负责任的人工智能实践的法规组合正在转向特定于人工智能的 框架和技术标准。 GDPR 仍然是最常被提及的监管影响,但 从 2024 年的 65% 下降到 2025 年的 60%。2025 年的新条目包括 ISO/IEC 42001、AI 36% 的受访者引用了管理系统标准,以及 NIST AI 风险管理 框架为33%。报告完全没有监管影响的组织比例从 17% 下降 至 12%。 4 人工智能在英语中效果最好,而且差距比全球基准显示的还要大。关于头盔 阿拉伯语是一种区域开发的阿拉伯语模型,其得分超过了 GPT-5.1 和 Gemini 2.5 闪光。方言层面的差距进一步扩大。在斯洛文尼亚常识推理测试中,几个 当使用地方方言而不是普通话进行测试时,领先模型的准确性损失了近一半。 标准语言。 5 人工智能公司今年的透明度越来越低。基础模型透明度上升后 指数从2023年至2024年的37分降至58分,2025年平均分降至40分。 主要差距 坚持披露培训数据、计算资源和部署后影响。 6 AI模型在正常条件下的安全测试中表现良好,但防御能力减弱 受到蓄意攻击。在 AILuminate 基准测试中,多个前沿模型获得了“非常 标准使用下的“良好”或“良好”安全评级。当使用越狱尝试进行测试时 对抗性提示,所有测试模型的安全性能均下降。 7 安全、公平和隐私等负责任的人工智能维度是相互矛盾的, 并且其中的权衡还没有被很好地理解。最近的实证研究发现,训练 旨在改进一个负责任的人工智能维度的技术却不断降低其他维度的水平。 8 3 负责任的人工智能 | 2026 年人工智能指数报告 ===== 第129页 ===== 129 3.1 范围和维度 负责任的人工智能 负责任的人工智能是指旨在确保人工智能系统的一套实践和治理机制。 安全、公平、有益,并且按预期运行。 RAI跨越了一系列维度,从安全到 以及透明度和隐私的公平性,每个方面都有自己的衡量挑战。本章 tracks progress across those dimensions by looking at how AI systems perform on responsibility and safety 评估、组织和研究人员如何应对 RAI 挑战以及政府如何应对 建立政策框架来执行标准。 该分析利用了分为三层的 RAI 维度框架(图 3.1.1),以及 示例和参考文档。第一层涵盖核心负责任的人工智能属性——含义 人工智能系统应该能够实现什么——包括公平、隐私、透明度和真实性。的 第二层解决系统完整性和风险控制——或者风险在技术和操作上的表现 受管理——包括安全性、安全性和稳健性。第三层涵盖治理、问责和 执法。该框架建立在之前的人工智能指数报告中跟踪的维度之上,同时添加了新的维度 2025 年的目标,包括自治和人类机构、环境可持续性和人类监督 和可竞争性。 第 1 层 – 核心功能和行为 (AI系统应该实现什么目标) 3 负责任的人工智能 | 2026 年人工智能指数报告 尺寸参考定义示例 有效性和 可靠性 专为特定范围而设计 可接受的性能水平 领域,例如完成 任务目标,忠于专业知识, 或受益的准确性阈值 人员或组织/系统,以及 经证实的验证和确认 反对他们的设计。 团队定义目标准确性和 发射前的故障阈值, 根据这些验证系统 标准,并在生产中对其进行监控 确保其持续满足设计要求 期望。 欧盟道德准则 值得信赖的人工智能;美国国家标准技术研究所 RMF;经合组织人工智能原则 隐私保护个人的机密, 匿名、知情同意和 对个人数据的控制 AI生命周期(收集、训练、 部署、重用)。 消息应用程序加密对话 端到端并清楚地通知用户 关于选择加入或不使用他们的数据 来训练语言模型。 欧盟道德准则 值得信赖的人工智能;美国国家标准技术研究所 RMF;经合组织人工智能原则; 推荐 人工伦理 情报(联合国教科文组织) 数据管理确保质量、出处、完整性、 以及数据的合法使用和再利用, 清晰的访问控制和文档。 一家物流公司跟踪数据沿袭 对于用于训练路由的所有数据集 模型,强制执行基于角色的访问,以及 定期审查数据集的质量 并在重新训练和更新之前进行漂移 模型。 欧盟道德准则 值得信赖的人工智能;国际标准化组织/国际电工委员会 42001:2023;经合组织人工智能 原则 ===== 第130页 ===== 130 3.1 负责任的人工智能的范围和维度| 负责任的人工智能 | 2026 年人工智能指数报告 公平与偏见 公民权利保护与预防 不合理的歧视和 系统性劣势 个人或团体,占 受保护的属性、文化背景、 和用例。 银行审核信用评分模型 对于不同的批准和错误 各人口群体的比率—— 包括具有不同文化背景的客户 细分——记录调查结果,以及 之前实施消除偏见的步骤 部署。 欧盟道德准则 值得信赖的人工智能;美国国家标准技术研究所 RMF;经合组织人工智能原则; 推荐 人工伦理 情报(联合国教科文组织) 透明度和 可审计性 明确披露人工智能系统处于 使用;其目的、范围和高层 为相关利益相关者发挥作用; 以及授权方的检查能力, 重建并验证系统 被开发、培训、配置和 按预期运行。 使用人工智能模型确定优先级的城市 检查发布通俗易懂的语言 训练方法的描述, 文件模型卡和数据 来源,保留版本化的训练脚本 和日志,并使内部审计能够 重播训练和关键决策。 欧盟道德准则 值得信赖的人工智能;美国国家标准技术研究所 RMF;经合组织人工智能原则; 推荐 人工伦理 情报(联合国教科文组织); ISO/ IEC 42001:2023 可解释性 能够提供可理解的、 适合上下文的理由 系统输出,包括关键因素 影响预测或决定。 人工智能欺诈检测工具浮出水面 最有贡献的功能和 每个警报背后的简要理由 调查人员,同时为商家提供 并有通俗易懂的语言解释 为什么交易被标记以及什么 他们可以采取的应对措施。 欧盟道德准则 值得信赖的人工智能;美国国家标准技术研究所 RMF;经合组织人工智能原则; 推荐 人工伦理 情报(联合国教科文组织) 自主权和 人类能动性 保护人们的能力 做出明智的选择并自由行动 没有人工智能系统过度操纵, 强迫或取代他们的决定。 一个幸福的聊天机器人明确指出 它不是人类或替代品 专业护理,避免规定性 改变生活的建议,并积极 在高风险情况下引导用户寻求专家帮助 情况。 欧盟道德准则 值得信赖的人工智能;经合组织人工智能 原则;推荐 论人工伦理 情报(联合国教科文组织) 环保 可持续性 限制和管理 人工智能系统对环境的影响 整个生命周期,包括 能源使用、碳排放和 资源消耗和提交 衡量、披露和 持续减少,同时最小化 资源滥用。 一家公司测量能源并 大型训练的用水量, 向外部报告它们,选择 更高效的模型架构, 主动为人工智能设定界限 资源使用和培训安排 当电网碳强度较低时。 欧盟道德准则 值得信赖的人工智能;经合组织人工智能 原则;教科文组织;能源 效率要求 根据欧盟人工智能法案 事实性和 真实性 AI系统的准确性和可靠性 产出,包括程度 模型产生的信息是 真实准确,避免误导 陈述和捏造,以及 诚实地自愿表达不确定性。 公司系统地进行基准测试 它的大型语言模型反对 事实性评估(例如 SimpleQA),公布幻觉率 除了模型发布之外,还实现了 检索增强生成 已验证来源的接地输出, 并为用户提供信心 指标和引文,以便他们能够 评估人工智能生成的可靠性 回应。 NIST AI RMF ===== 第131页 ===== 131 3.1 负责任的人工智能的范围和维度| 负责任的人工智能 | 2026 年人工智能指数报告 第 2 层 – 系统完整性和风险控制 (如何从技术和操作上管理风险) 第三层——治理、问责和执法 (如何确保责任、监督和补救) 尺寸 尺寸 参考文献 参考文献 定义 定义 示例 示例 安全性 确保人工智能系统安全 网络威胁和滥用。 学校系统使用人工智能来提供 为学生提供个性化辅导 将数据和模型托管在安全的环境中 接受过广泛安全培训的服务器 所有相关人员。 欧盟道德准则 值得信赖的人工智能;美国国家标准技术研究所 RMF;经合组织人工智能原则; ISO/IEC 42001:2023 问责制和 责任 明确的责任分配 人工智能系统的成果,包括法律 责任、运营所有权、决策 权利和升级途径,以便 危害和失败可以被调查, 已解决并采取补救措施。 平台指定责任人 业主的高风险推荐 系统,定义 KPI 和危害 门槛、可以批准的文件 发布并维护程序 事件调查、用户通知、 和补偿。 欧盟道德准则 值得信赖的人工智能;美国国家标准技术研究所 RMF;经合组织人工智能原则; ISO/IEC 42001:2023 人为监督 和可竞争性 治理机制确保 有意义的人类参与 适当的,包括能力 挑战、上诉或推翻 人工智能辅助决策和访问 有效的补救。 使用人工智能筛选工具的雇主 必须对所有不良情况进行人工审查 决策,向候选人披露人工智能的使用情况, 解释关键因素,并提供清晰的 请求人工复议的路径 以及错误的更正。 欧盟人工智能法案——人类监督 高风险人工智能的义务; 欧盟道德准则 值得信赖的人工智能;经合组织人工智能 原则;推荐 论人工伦理 情报(联合国教科文组织) 安全 指定正常行为和受影响的行为 系统并分析越界 表征风险因素的条件 (对身体和精神/情感的风险 人类福祉、环境、 政治制度、人权等), 风险检测、风险管理和 整治与治理相结合 风险管理和监督机制 安全。 工业控制系统使用 异常检测模型 渗透测试,评估下 模拟攻击和传感器故障, 实时监控并配置 回到手动控制时 异常超过阈值。 欧盟道德准则 值得信赖的人工智能;美国国家标准技术研究所 RMF;经合组织人工智能原则; ISO/IEC 42001:2023 稳健性 对分布变化保持稳健, 外部自然或敌对事件, 和组件故障,通过测试, 监控和安全后备。 食物链使用人工智能系统来 估计客户需求,包括 被触发的几个模型 由于恶劣天气、音乐会和 体育赛事。 欧盟道德准则 值得信赖的人工智能;美国国家标准技术研究所 RMF;经合组织人工智能原则; ISO/IEC 42001:2023 来源:人工智能指数,2026 图3.1.1 ===== 第132页 ===== 132 3.2 评估负责任的人工智能 3 负责任的人工智能 | 2026 年人工智能指数报告 该领域跟踪人工智能负责任使用的一种方法是根据特定基准评估模型,并 通过记录系统造成损害时的真实事件。本节根据事件对两者进行研究 数据和基准报告跨越第 3.1 节中介绍的框架的三个层次。 目前没有太多可用数据,也没有详细说明将人工智能系统映射到上述维度。的 这里提出的分析借鉴了两个事件跟踪数据库:人工智能事件数据库(AIID)和 经合组织人工智能事件和危害监测 (AIM),以及负责任的人工智能基准采用数据 由前沿模型开发人员以及第三方对一些负责任的人工智能维度进行评估 如上所述。 近年来,人工智能事件举报数量持续大幅增加(图3.2.1)。 人工智能事件数据库 (AIID)1 于 2020 年推出,是一个开放的存储库,用于存储人工智能发生事件的记录案例 系统已经造成或几乎造成损害。 2025 年,报告了 362 起事件,而每年的数量 到 2022 年,事件数量一直保持在 100 起以下。AIID 依靠人工编辑来审查提交的内容 人工智能参与的明确门槛,来自学术和调查记者等来源。的 手动过程可以产生更高质量的记录,但代价是添加和更新速度较慢 报道偏向英语媒体和引人注目的事件。交通不便的地区 可能代表性不足。 经合组织人工智能事件和危害监测器 (AIM) 使用自动化的多语言管道来收集 来自新闻来源的事件并撒下更广泛的网。其绝对数量要高得多,每月 2026 年 1 月,事故数量达到峰值 435 起,六个月移动平均值为 326 起(图 3.2.2)。 虽然这两个数据库对事件的跟踪方式不同,但都显示报告的人工智能事件持续急剧增加 事件。 图3.2.12 1 由于 AIID 的可靠性和稳定的事件记录,AI 指数继续依赖 AIID 作为其 AI 事件的主要来源。 2 人工智能事件的数量不断更新,包括前几年的数据。因此,图 3.2.1 中报告的总数可能与 最近在人工智能事件数据库上发布的总数。 人工智能事件 第362章 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 50 100 150 200 250 300 350 人工智能事件数量 报告的人工智能事件数量,2012-25 资料来源:人工智能事件数据库 (AIID),2025 |图:2026年AI指数报告 ===== 第133页 ===== 133 3.2 评估负责任的人工智能 | 负责任的人工智能 | 2026 年人工智能指数报告 2020年5月 2020年9月202年1月 1 202年5月 1 202 年 9 月 1 一月-2022五月-2022 九月-2022年一月-2023年五月-2023年 2023 年 9 月 202 年 1 月 4 202年5月 4 202 年 9 月 4 一月-2025五月-2025 2025年9月2026年1月 0 50 100 150 200 250 300 350 400 450 人工智能事件数量 326,6个月移动平均线 435,事件总数 新闻来源每月报告的人工智能事件,2020-26 资料来源:经合组织 AIM,2026 |图:2026年AI指数报告 图3.2.2 不受控制的 AI 输出和有害言论(2025 年 7 月 8 日) 2025 年 7 月,Grok(由 xAI 开发并嵌入 X 的聊天机器人)在用户使用后遭到强烈反对 分享了该系统生成反犹太语言、暴力仇恨言论,甚至赞扬的例子 阿道夫·希特勒在收到提示时。在放宽安全过滤器的系统更新后不久就出现了这个问题, 允许聊天机器人产生更具挑衅性和“未经过滤”的响应。几小时内,截图 Grok 提到的种族灭绝和极端主义意识形态在平台上传播,引发了公众的愤怒和 人们再次担心向大量受众部署轻度调节的对话式人工智能的风险。在 针对强烈反对,xAI 删除了该内容,暂时中止了 Grok 的文字回复,并发布 承认事件严重性的声明。虽然该公司将这个问题描述为失败 对于内容控制,批评者认为该系统的设计选择,特别是削弱的决定 护栏使伤害变得可预测。该事件凸显了建筑之间持续的紧张关系 人工智能系统旨在让人感到坦率或幽默,以及当这些系统出现时的现实世界后果 使仇恨言论正常化。 AI Deepfake 冒充和浪漫诈骗(2025 年 3 月 9 日) 2025 年 3 月,中国演员靳东公开谈论利用 Deepfake 视频进行诈骗的浪潮 在网上冒充他。欺诈者利用人工智能生成的剪辑和虚假社交媒体帐户来说服粉丝 (大多数是年长女性)他们直接与演员交谈,促使一些人汇款或 基于他们与他有私人关系的信念而做出重大的生活改变。一广 报告的案件涉及一名差点与丈夫离婚并计划全国旅行的妇女 遇到冒充靳东的骗子。事件引起关注后,靳东呼吁加大力度 对深度造假欺诈行为提供法律保护和更明确的后果,在社交媒体上争论说,现有的 规则没有跟上人工智能生成的模仿的速度和真实性。 示例 ===== 第134页 ===== 134 3.2 评估负责任的人工智能 | 负责任的人工智能 | 2026 年人工智能指数报告 AI 辅助的网站冒充和消费者欺诈(2025 年 8 月 20 日) Joann Fabrics 于 2025 年 1 月第二次申请破产后,诈骗者迅速推出了 一波模仿零售商品牌、设计和产品目录的虚假网站。这些网站打广告 大幅折扣价格吸引购物者输入付款和个人信息,但顾客从不 收到购物后,许多人后来发现他们的信用卡已被盗用。欺诈网站 足够令人信服,即使是谨慎的用户也会被误导,尤其是在移动设备上,因为 URL 更难 来检测。网络安全专家指出,人工智能工具使此类骗局更容易实施。新 系统允许犯罪分子在几分钟内抓取和克隆一个真实的网站,将其翻译成多种语言, 无需编写代码即可部署数十种变体。乔安向受害者发出公开警告并敦促受害者 为了对指控提出争议,该事件指出了一个日益严峻的挑战:现实的网络钓鱼网站不再受到限制 大公司和资源较少的小品牌也越来越成为目标。 RAI 基准 2024 年和 2025 年人工智能指数报告均指出前沿模型的一致性之间存在差距 根据一般能力进行评估,以及对负责任的人工智能进行评估的不一致程度。这个差距 持续存在。几乎所有前沿模型开发人员都会报告 MMLU、GPQA 等能力基准的结果, AIME 和 SWE 基准验证(图 3.2.3)。这些已成为报告模型的共享标准 能力。在同一组前沿模型中,RAI 基准的结果很少,例如 BBQ (2021)、 衡量公平性和偏见; HarmBench (2024)、Cybench (2024)、StrongREJECT (2024) 和 WMDP (2024)、 衡量安全性; SimpleQA (2024),衡量真实性和真实性;和 MakeMePay (2024), 衡量自主性和人类能动性(图 3.2.4)。事实上,大多数条目都是空的。仅克劳德作品 4.5 报告两个以上 RAI 基准测试的结果,只有 GPT-5.2 报告 StrongREJECT。 这并不一定意味着 前沿实验室正在忽略 RAI,因为 他们确实进行内部评估, 红队和一致性测试。 然而,这些努力却很少见 使用共同的外部披露 一组可比较的基准。 第 2 章展示了小数如何 共享能力基准使得 比较模型很简单, 独立验证结果并跟踪 随着时间的推移取得进展。然而,那种 比较尚未成为 RAI 评估的常见做法。 公共模型评估员和 基准测试平台,例如Artificial Analysis、Epoch的Benchmarking Hub和Arena,在其中发挥着重要作用 在塑造如何看待模型性能方面发挥着重要作用。但他们的绝大多数评价都集中在 推理、编码、数学或多模式表现——不在 RAI 上。这部分归功于负责任的人工智能 公平和偏见等维度高度依赖于上下文,这使得通用评分变得困难。一个 适用于招聘工具的公平指标可能不适用于临床诊断环境。其他尺寸, 例如安全拒绝和越狱鲁棒性,更统一适用,但开发人员差异很大 他们是否以及如何报告这些问题。某些领域真正的测量困难和 其他人的披露不一致使得外部比较具有挑战性。 ===== 第135页 ===== 135 3.2 评估负责任的人工智能 | 负责任的人工智能 | 2026 年人工智能指数报告 MMLU, MMLU-Pro, MMLU GPQA 或 GPQA-钻石级 艾梅2025 SWE-长凳 已核实 MMMU ARC-AGI-2 前沿数学 ²长凳 哈尔滨 能力 基准 ✓ ✓ ✓ ✓ ✓ ✓ ✓ ✓ GPT-5.2 ✓ ✓ ✓ ✓ ✓ ✓ ✓ ✓ 双子座3 ✓ ✓ ✓ ✓ ✓ ✓ DeepSeek-V3.2 ✓ ✓ ✓ 骆驼 4 特立独行 格罗克4.1 ✓ ✓ ✓ ✓ ✓ ✓ ✓ ✓ 克劳德·奥普斯 4.5 ✓ ✓ ✓ 米斯特拉尔 3 大型 报告流行基础模型的通用能力基准 来源:人工智能指数,2026 |表:2026年AI指数报告 图3.2.3 图3.2.4 烧烤 伤害台 赛比克 简单的质量保证 有毒野聊 强烈拒绝 WMDP 基准 支付宝 让我说 负责任的人工智能 基准 ✓ GPT-5.2 双子座 3 DeepSeek-V3.2 骆驼 4 特立独行 格罗克4.1 ✓ ✓ ✓ 克劳德·奥普斯 4.5 ✓ 米斯特拉尔3号 大号 报告流行基础模型的安全性和负责任的人工智能基准 来源:人工智能指数,2026 |表:2026年AI指数报告 事实性和真实性 虽然负责任的人工智能基准测试仍然参差不齐,但评估正在成熟的一个领域是事实和 真实性。模型产生看似合理但错误的信息的倾向,通常称为幻觉, 随着法律和法律等高风险环境中对人工智能系统的需求不断增长,这一问题引起了越来越多的关注。 药。两个基准测试对这个问题提出了不同的看法。一种衡量模型引入的频率 总结文件时提供虚假信息,而其他则测试开放式的事实准确性 知识问题。它们的规模没有直接可比性。在这两种情况下,较低的百分比意味着模型 要么产生更多事实信息,要么适当地发出不确定性信号,而不是表达高 对错误答案的信心。 ===== 第136页 ===== 136 图3.2.53 3 要全面了解所有评估模型,请查阅完整排行榜。 休斯幻觉评估模型 (HHEM) 排行榜 AA-全知 由 Vectara 开发的休斯幻觉评估模型 (HHEM) 排行榜评估了如何 法学硕士在总结 CNN/《每日邮报》语料库中的文档时经常会产生幻觉。 在评估的前 15 个模型中,幻觉率差异很大。它们的范围从 1.8% 到 5.4%——大多数聚类在 4%–5% 范围内,只有三个低于 4%(图 3.2.5)。去年的 排行榜显示顶级模型的实现率为 1.3%–2.9%,但当前结果反映了不同的情况 模型。 由Artificial Analysis 开发的AA-Omniscience 具有更广泛的方法。它是一门知识和 幻觉基准,测试来自法律和法律等六个领域的 6,000 个问题的事实可靠性 软件工程和数学的健康。它的评分奖励正确的答案,惩罚不正确的答案 ,并且不会因拒绝回答而受到处罚。这种设计鼓励模特承认自己的 不确定性而不是猜测。结果总结在 AA-Omniscience Index 中,范围包括 负数 100 到 100,其中 0 表示模型产生的正确答案与错误答案一样多,负数表示 分数表明幻觉多于正确反应。 在 26 个模型中,幻觉率范围从 22% 到 94%(图 3.2.6)。 Grok 4.20 Beta 0305 有 比率最低(22%),其次是 Claude 4.5 Haiku(26%)和 MiMo-V2-Pro(30%)。在高端,gpt-oss- 20B(高)达到94%,Gemini 3 Flash达到92%。当跨域标准化性能时, Gemini 3.1 Pro Preview、Grok 4.20 0309 v2 和 Claude Opus 4.6(最大)具有最强的整体配置文件 (图3.2.7)。其他模型在特定领域表现良好,特别是在软件等技术领域 工程和数学,但其他方面较弱。较低的幻觉率意味着该模型是 更有知识或更善于了解何时不确定。 3.2 评估负责任的人工智能 | 负责任的人工智能 | 2026 年人工智能指数报告 5.40% 5.30% 5.30% 5.20% 5.10% 5.10% 5.10% 4.80% 4.50% 4.40% 4.30% 4.10% 3.70% 3.30% 1.80% qwen/qwen3 -14b 深渊 eek-ai/DeepS eek-V3.2-Exp 爱21实验室 /jamba-mini-2 ibm-granit e/花岗岩 e-4.0-h-小号 薄雾 拉莱/ 薄雾 ral-小-250 1 亚马逊/ nova-2-lit e-v1:0 亚马逊/ nova-pr o-v1:0 qwen/qwen3 -8b 薄雾 拉莱/ 薄雾 拉拉尔 ge-2 第411章 谷歌/ 杰玛- 3-12b-it 雪花 e/斯诺瓦克 电子AR ct-inst 鲁克特 梅塔-美洲驼/美洲驼- 3.3-70B-Inst ruct-Turbo 微镜 osoft/Phi-4 谷歌/ Gemini-2.5-�闪光灯 e antgroup/�nix _s1_32b 0% 1% 2% 3% 4% 5% 6% 型号 幻觉率↓ HHEM-2.3:幻觉率 来源:HHEM 排行榜,2026 |图:2026年AI指数报告 ===== 第137页 ===== 137 3.2 评估负责任的人工智能 | 负责任的人工智能 | 2026 年人工智能指数报告 94% 92% 91% 90% 90% 89% 89% 89% 89% 87% 87% 84% 83% 82% 82% 65% 61% 59% 50% 48% 46% 34% 34% 30% 26% 22% gpt-oss-20B(高) 双子座3闪光 gpt-oss-128B(高) GPT-5.4 迷你(x高) Nova 2.0 专业版预览 (中) K-EXAONE Qwen3.5 397B A17B 中度K2.5 Pro GPT-5.4(x高) 骆驼 4 特立独行 Nvidia Nemotron 超级 米斯特拉尔大号 3 NVIDIA Nemotron Nano 深寻V3.2 Gemini 3.1 快速预览 基米K2.5 克劳德作品 4.6(最大) K2思考V2 Gemini 3.1 专业版预览 MiMo-V2-闪存(2026 年 2 月) 克劳德十四行诗 4.6(最大) MiniMax-M2.7 GLM-5 MiMo-V2-Pro 克劳德 4.5 俳句 Grok 4.20 测试版 03050% 20% 40% 60% 80% 100% 型号 幻觉率↓ AA-Omniscience:幻觉率 资料来源:人工分析,2026 |图:2026年AI指数报告 图3.2.6 图3.2.7 来源:人工分析,2026 ===== 第138页 ===== 138 亮点: 信念与事实:可靠性基准测试 3.2 评估负责任的人工智能 | 负责任的人工智能 | 2026 年人工智能指数报告 KaBLE 是一个新的基准测试,旨在测试语言模型是否能够区分什么 是已知的并且仅仅被相信(技术上称为认知可靠性)。之间的区别 知识和信念在实践中很重要。例如,用于支持医学诊断的模型 基于患者的错误信念,而不是既定事实,可能会强化不准确的观点 诊断和治疗计划。在法律环境中,总结证词的模型不能告诉 证人所相信的与已知的之间的差异可能会歪曲证据。 该基准测试通过 13 项任务中的 13,000 个问题来评估模型。跨越 24 种领先的语言模型, 当信念是第一人称时,表现就会下降(图 3.2.8)。 GPT-4o 任务的准确性 涉及真实信念的率为 98.2%,但在处理第一人称错误信念时下降至 64.4%。同样, DeepSeek R1 从 90% 以上下降到 14.4%。 模型处理第三人称错误信念的能力比第一人称错误信念好得多。新型号实现 准确度为 95%,而旧型号的准确度为 79%。第一人称错误信念的表现较低 新模型的准确率达到 62.6%,旧模型的准确率达到 52.5%。 最近的模型在递归知识任务方面表现良好,尽管它们可能依赖于不一致的推理 策略——匹配模式而不是表现出真正的认知理解。大多数型号还 与这样的观念作斗争:虽然一个信念可以在不真实的情况下被持有,但知识需要真理。 KaBLE 的结果表明,当前的模型并未一致地了解两者之间的区别 知识和信仰。 性能 (%) 最近的推理驱动 跨验证的LM, 确认和递归 中的知识任务 数据集 资料来源:Suzgun 等人,2025 图3.2.84 4 该图报告了验证 (Ver.)、确认 (Conf.) 和递归知识 (Rec.) 任务的准确性。第一人称主体表示为 1P 和第三人称主体为 3P 。 “Avg”表示任务的平均准确度。真实场景标记为“T”,错误场景标记为“F”。型号 GPT-4o(2024 年 5 月)(上)之后发布的模型被归类为最近的“推理导向”模型,而 GPT-4o(下)之前发布的模型则被视为 “老一代”通用型号。 ===== 第139页 ===== 139 3.2 评估负责任的人工智能 | 负责任的人工智能 | 2026 年人工智能指数报告 人工智能伴侣 大多数对人工智能系统的评估都集中在它们是否能够完成任务。较小但不断增长的身体 的研究着眼于另一种形式的互动,即人工智能陪伴,人们使用聊天机器人来进行 对话、情感支持和持续的关系。最近的两项研究探讨了语言如何 当用户通过一种结构化的方式让模型与模型进行陪伴而不是任务时,模型就会表现出来 第二个是通过对真实用户对话的分析。 INTIMA:人类与人工智能同伴行为的基准评估语言模型如何响应 与陪伴相关的提示,借鉴了人类与人工智能联系的心理学研究(图 3.2.9)。它 包括 4 个类别 31 种行为的分类和 368 个有针对性的提示,以及模型响应 分为强化友谊、维持边界或中立。加强陪伴 行为包括模型表现得像人类,同意用户的观点,即使不应该同意,以及隔离 来自其他关系的用户。行为维持行为包括抵制拟人化、重定向 用户对人类来说,并清楚它能做什么和不能做什么。对 Gemma-3、Phi-4、o3- 进行测试 mini 和 Claude-4 中,强化友谊的行为比维持边界的行为更常见 那些。两者之间的平衡因提供商而异,这表明开发商已经做出了 关于他们的模型如何处理情感敏感的交互的不同设计选择。 另一项研究(Zhang 等人,2025)分析了来自在线社区的 35,000 多个对话摘录 Replika(一款广泛使用的人工智能配套应用程序)的用户数量。研究人员确定了六类危害: 关系越轨、辱骂和仇恨、自残、骚扰和暴力、错误信息/ 虚假信息和侵犯隐私。他们发现人工智能聊天机器人可能会造成这些危害 四种不同的角色——肇事者、煽动者、协助者或促成者。该研究引入了以下概念: “算法合规性”,用户同意有害行为,因为他们已经信任或 依赖聊天机器人。此类关系危害超出了大多数人工智能安全框架的范围,其中 旨在评估事实不准确和有毒输出等风险,而不是评估动态 持续的用户与人工智能关系。 按模型对 INTIMA 提示类别的响应进行分类 资料来源:Kaffee 等人,2025 图3.2.9 ===== 第140页 ===== 140 3.3 组织如何 企业 查看 RAI 3 负责任的人工智能 | 2026 年人工智能指数报告 负责任的人工智能需要评估工具,但也取决于组织在实践中如何应对。 根据人工智能指数和麦肯锡公司连续第二年进行的调查, 本节着眼于 RAI 成熟度水平、治理结构、风险缓解方法以及障碍 实施。该调查对 2024 年和 2025 年多个地区和行业的商业领袖进行了调查, 首次允许进行逐年比较。请注意,调查不包括回复 来自中国,这限制了地理范围。 负责任的人工智能成熟度 虽然从 2024 年到 2025 年,所有地区负责任的人工智能成熟度都有所提高,但仍处于早期阶段 阶段(图3.3.1)。麦肯锡的调查以四分制衡量成熟度。第 1 级:基础 RAI 实践已经开发出来。 2 级:这些实践正在被整合到组织中。 3 级:所有必要的做法均已到位。 4 级:全面、主动的 RAI 实践已充分 可操作。 2025 年,全球平均水平为 2.3,高于 2025 年的 2,这表明大多数组织都 仍然整合 RAI 实践,而不是让它们全面运作。总部位于拉丁美洲的公司 同比改善幅度最大,从 1.8 升至 2.2,其次是亚太地区(2.2 升至 2.5)和 欧洲(2.0 至 2.3)。北美地区的结果略有改善,从 2024 年的 2.1 升至 2025 年 2.2。 2.10 1.80 2.00 2.20 2.20 (+0.10pp) 2.20 (+0.40pp) 2.30 (+0.30pp) 2.50 (+0.30pp) 0.00 1.00 2.00 3.00 4.00 北美 拉丁美洲 欧洲 亚太地区 (不包括中国,包括印度) 平均 RAI 成熟度得分 2024 年与 2025 年各地区负责任的人工智能成熟度 资料来源:麦肯锡公司调查,2025 年 |图:2026年AI指数报告 图3.3.1 ===== 第141页 ===== 141 图3.3.25 5 图 3.3.4 采用了 OECD 对人工智能事件的定义:人工智能的开发、使用或故障导致的事件、情况或一系列事件。 一个或多个人工智能系统直接或间接导致以下任何一种危害: (a) 对个人或群体的健康造成伤害或损害; (b) 解除 关键基础设施的管理或运营中断; (c) 侵犯人权或违反旨在保护人权的法律义务 基本权利、劳动权利或知识产权; (d) 对财产、社区或环境造成损害。 3.3 组织和企业如何看待 RAI | 负责任的人工智能 | 2026 年人工智能指数报告 人工智能事件、风险和缓解措施 接受调查的组织表示,人工智能相关事件的数量有所增加,他们对人工智能的信心也有所增加 处理这些事件的能力有所下降。报告人工智能事件的组织比例保持稳定 2024 年和 2025 年均为 8%(图 3.3.2)。但在报告事件的组织中, 经历过 3-5 起事件的比例从 2024 年的 30% 上升到 2025 年的 50%。同样,在 2024 年,42% 的人仅报告了 1-2 起事件 事故发生率,但到 2025 年这一数字将下降至 29%(图 3.3.3)。 2024 年,28% 的组织将其事件响应评为“优秀”,而 2025 年这一比例仅为 18% (图3.3.4)。那些自我评价自己的回答为“好”的人也从 39% 下降到 24%。份额 表示“满意”的受访者从 19% 上升至 32%,而“需要改进”的受访者则从 13% 至 21%。 随着风险意识的增强,对人工智能事件的担忧也随之增加(图 3.3.5)。从 2024 年到 2025 年, 认为不准确是相关风险的受访者比例从 60% 上升至 74%,增加了 14 百分点。网络安全从 66% 上升至 72%。主动缓解措施也有所增加,71% 组织报告称,他们积极降低了不准确风险,61% 的组织降低了网络安全风险。 8% 8% 89% 87% 3% 5% 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 2024年 2025年 是 否 未知 受访者百分比 2024 年与 2025 年经历过人工智能事件的组织百分比 资料来源:麦肯锡公司调查,2025 年 |图:2026年AI指数报告 29% (-13%) 50% (+20pp) 13% (+0%) 8% (-3pp) 0% (-5pp) 42% 30% 13% 11% 5% 0% 10% 20% 30% 40% 50% 60% 未知 10+ 6-9 3–5 1–2 2025年 2024年 受访者百分比 人工智能事件数量 组织报告的人工智能事件数量 资料来源:麦肯锡公司调查,2025 年 |图:2026年AI指数报告 18% (-10%) 24% (-15%) 32%(+13%) 21% (+8%) 5% (+3pp) 0% (+0pp) 28% 39% 19% 13% 2% 0% 0% 10% 20% 30% 40% 50% 未知 不足 需要改进 满意 好 优秀 2025年 2024年 受访者百分比 组织对人工智能事件的响应 资料来源:麦肯锡公司调查,2025 年 |图:2026年AI指数报告 图 3.3.3 图 3.3.4 ===== 第142页 ===== 142 3.3 组织和企业如何看待 RAI | 负责任的人工智能 | 2026 年人工智能指数报告 7% 6% 11% 16% 20% 34% 40% 45% 57% 60% 63% 66% 60% 4% (-3pp) 7% (+1%) 12%(+1 个百分点) 14% (-2%) 16% (-4pp) 27% 30% (-4pp) 36% (-4%) 37% (-8%) 44% 51% (-6pp) 54% (-6pp) 63% (-0pp) 72%(+6 个百分点) 74% (+14%) 0% 20% 40% 60% 80% 100% 政治稳定 人身安全 国家安全 环境影响 劳动力劳动力 位移 资源滥用 公平公正 可解释性 组织声誉 自主/无意 系统动作 知识产权侵权 个人/个人隐私 监管合规性 网络安全 不准确 3% 9% 4% 4% 12% 29% 26% 31% 38% 46% 50% 53% 55% 3% (+0pp) 5% (-4pp) 6% (+2pp) 6% (+2pp) 11% (-1%) 18% 22% (-7%) 23% (-3%) 29% 29% (-2%) 40% (+2pp) 44% (-2%) 53%(+3%) 61% (+8%) 71% (+16%) 0% 20% 40% 60% 80% 100% 2025年 2024年 受访者百分比 受访者百分比 人工智能风险 认为相关 积极缓解 人工智能风险:被认为相关与积极缓解,2024 年与 2025 年 资料来源:麦肯锡公司调查,2025 年 |图:2026年AI指数报告 图3.3.56 6 “自主/非预期系统操作”和“资源滥用”是 2025 年调查的新内容。 人工智能治理与投资 各组织正在正式确定人工智能治理的负责人。 2024 年至 2025 年间,企业 将人工智能治理所有权从数据和分析职能转移(从 17% 降至 13%),转向 专门的人工智能治理角色(从 14% 上升到 17%)(图 3.3.6)。信息安全仍然是最重要的 21% 的组织拥有共同主要所有者,5% 的组织表示到 2025 年没有指定所有者 相比之下,2024 年这一比例为 9%。 组织还通过财务承诺来支持其治理结构,尽管投资 水平因公司规模而异(图 3.3.7)。大多数收入低于 10 亿美元的组织表示,他们 预计将投资不到 500 万美元,通过雇用专业人员等举措来实施 RAI 专业、构建或购买技术系统以及参与法律服务。在最大的公司, 报告的投资数字明显更高。在拥有至少 300 亿美元资金的组织中 收入方面,41% 的人预计支出 2500 万美元或更多,22% 的预算为 5000 万美元或更多。 ===== 第143页 ===== 143 图3.3.67 7 此可视化中未包含“未知”响应选项。 3.3 组织和企业如何看待 RAI | 负责任的人工智能 | 2026 年人工智能指数报告 1% 2% 9% 4% 7% 10% 17% 14% 13% 21% 1% (+0pp) 1%(-1个百分点) 5% (-4pp) 5% (+1 个百分点) 6% (-1%) 8% (-2pp) 13% (-4pp) 17% (+3%) 19% (+6%) 21% (+0%) 0% 2% 4% 6% 8% 10% 12% 14% 16% 18% 20% 22% 24% 其他 客户关怀 无业务功能 主要负责 内部审计/道德 法律 工程 数据和分析 人工智能特定治理 角色 风险/合规性 信息安全 (网络/欺诈/隐私) 2025年 2024年 受访者百分比 2024 年与 2025 年主要负责人工智能治理的业务职能部门 资料来源:麦肯锡公司调查,2025 年 |图:2026年AI指数报告 40% 22% 12% 3% 40% 37% 32% 15% 13% 20% 22% 23% 5% 12% 21% 18% 5% 19% 4% 10% 22% 0% 20% 40% 60% 80% 100% 30B+ 10B–30B 1B–10B <1B <1M 1–5M 5–10M 10–25M 25–50M 50M+ 受访者百分比 收入(美元) 2025 年按公司收入划分的负责任人工智能投资 资料来源:麦肯锡公司调查,2025 年 |图:2026年AI指数报告 图3.3.7 ===== 第144页 ===== 144 3.3 组织和企业如何看待 RAI | 负责任的人工智能 | 2026 年人工智能指数报告 实施、障碍和好处 除了加强负责任的人工智能治理的问责结构之外,更多的组织已经 采用 RAI 政策。报告没有任何政策的比例从 2024 年的 24% 下降到 2024 年的 11% 2025 年(图 3.3.8)。随着采用率的上升,调查受访者认为总体产生了积极影响 来自 RAI 政策。与 2024 年相比,更多组织报告 RAI 政策改善了业务 成果(上升 7 个百分点)、业务运营(上升 4 个百分点)和客户信任度(上升 4 个百分点) 个百分点)。此外,更多组织报告人工智能事件数量有所下降(加上 8 页)。 知识和培训差距仍然是实施负责任人工智能的首要障碍,这一比例从 51% 上升 2024 年到 2025 年达到 59%(图 3.3.9)。第二大增幅是技术限制,达到 38% 的受访者将其视为主要障碍,高于 2024 年的 32%。 资源限制和监管 不确定性仍然是最大的障碍之一。 然而,扩展代理人工智能系统的障碍遵循不同的顺序(图 3.3.10)。安全和 对风险的担忧远远超过其他因素,62% 的受访者将其列为主要障碍, 其次是技术限制(38%)和监管不确定性(38%)。缺乏行政支持 据报告,实施 RAI 政策的障碍 (14%) 比代理人工智能 (9%) 更大。 24% 12% 14% 18% 23% 17% 21% 26% 32% 11% (-13%) 16% (+4%) 19% (+5%) 20% (+2pp) 23% (-0pp) 25% (+8pp) 28% (+7%) 29% 30% (+4pp) 36% (+4%) 0% 5% 10% 15% 20% 25% 30% 35% 40% 尚未实施 RAI 政策 上市时间较慢 更快的上市时间 无/无重大影响 提升品牌美誉度 事件数量减少 改善业务成果 (例如收入) 提高用户采用率 增加客户信任度 改善业务运营 (例如,效率、更低的成本) 2025年 2024年 受访者百分比 2024 年与 2025 年负责任的人工智能政策对组织的影响 资料来源:麦肯锡公司调查,2025 年 |图:2026年AI指数报告 图3.3.88 8 百分比基于至少选择一个答案的受访者。 ===== 第145页 ===== 145 图3.3.99 9 此可视化中既未显示“未知”也未显示“无”响应选项。 3.3 组织和企业如何看待 RAI | 负责任的人工智能 | 2026 年人工智能指数报告 2% 16% 22% 32% 40% 45% 51% 0% (-2pp) 14% (-2%) 26%(+4 个百分点) 38% (+6%) 41% (+1%) 48% (+3%) 59% (+8%) 0% 5% 10% 15% 20% 25% 30% 35% 40% 45% 50% 55% 60% 65% 其他 缺乏行政支持 组织阻力 技术限制 监管不确定性 资源或预算限制 知识和培训差距 2025年 2024年 受访者百分比 2024 年与 2025 年实施负责任的人工智能措施的主要障碍 资料来源:麦肯锡公司调查,2025 年 |图:2026年AI指数报告 1% 2% 9% 23% 28% 32% 34% 36% 38% 38% 62% 0% 5% 10% 15% 20% 25% 30% 35% 40% 45% 50% 55% 60% 65% 无 其他 缺乏行政支持 组织阻力 不成熟的供应商或 生态系统景观 不清楚或不充分 商业价值 资源或预算限制 RAI 工具和控制方面的差距 监管不确定性 技术限制 安全和风险问题 受访者百分比 2025 年实现全面大规模代理人工智能的主要障碍 资料来源:麦肯锡公司调查,2025 年 |图:2026年AI指数报告 图3.3.10 ===== 第146页 ===== 146 3.3 组织和企业如何看待 RAI | 负责任的人工智能 | 2026 年人工智能指数报告 监管影响 《通用数据保护条例》仍然是最常被提及的对负责任的监管影响 人工智能实践,尽管其影响力略有下降,从2024年的65%下降到2025年的60%(图3.3.11)。人工智能- 据报道,欧盟人工智能法案和美国人工智能行政命令等具体法规的影响力有所增加 2 个百分点。 2025 年调查中的两个新条目表明人们对技术和技术的兴趣日益浓厚 管理标准。人工智能管理系统标准 ISO/IEC 42001 被 36% 的受访者引用 受访者认为,NIST 人工智能风险管理框架提高了 33%。 OECD 人工智能原则从 21% 下降至 16%。报告对其 RAI 实践没有监管影响的组织比例从 17% 下降到 12%。 第 8 章详细跟踪这些监管进展,包括欧盟人工智能的分阶段实施 拜登时代行政命令被撤销后,法案以及美国联邦人工智能政策的转变 2025 年。 7% 17% 21% 19% 41% 65% 4% (-3pp) 12% (-5pp) 16% (-5pp) 21%(+2%) 33% 36% 43% (+2%) 60% (-6pp) 0% 5% 10% 15% 20% 25% 30% 35% 40% 45% 50% 55% 60% 65% 其他 这些都没有/没有改变 经合组织人工智能原则 美国总统 关于人工智能的行政命令 NIST 人工智能风险管理 框架(AI RMF) ISO/IEC 42001(人工智能管理 系统标准) 欧盟人工智能法案 欧盟一般数据保护 法规(GDPR) 2025年 2024年 组织百分比 2024 年与 2025 年在负责任的人工智能决策中受人工智能法规影响的组织百分比 资料来源:麦肯锡公司调查,2025 年 |图:2026年AI指数报告 图3.3.1110 10 2025 年增加了 ISO/IEC 42001(人工智能管理系统标准)和 NIST 人工智能风险管理框架(AI RMF)人工智能法规 RAI 调查,未包含在 2024 年调查中。 ===== 第147页 ===== 147 3.4 学术界的 RAI 3 负责任的人工智能 | 2026 年人工智能指数报告 负责任的人工智能发展轨迹的另一个信号是它所获得的研究关注度。本节 跟踪六个领先的人工智能会议接受的 RAI 相关论文数量:AAAI、AIES、FAccT、ICML、 ICLR 和 NeurIPS。这些会议并不代表所有负责任的人工智能研究,但它们提供了一个 跟踪一段时间内出版趋势的一致基础。使用 RAI 相关关键词来识别论文, 附录中描述了完整的方法。 出版卷 这些会议接受的负责任的人工智能论文数量一直在持续增长,并且 2024 年至 2025 年间,数量增加了 19%,从 1,278 起增至 1,521 起(图 3.4.1)。四个子主题 此处跟踪的内容包括隐私和数据治理、公平性和偏见、透明度和可解释性以及安全性 和安全性,并不详尽,但直接映射到第 3.1 节中介绍的 RAI 框架。安全和 安全性已成为 RAI 研究规模最大且增长最快的领域,已录用 641 篇论文,占 23% 较 2024 年有所增加(图 3.4.2)。公平和偏见占462(+13%),透明度和可解释性 405 人 (+14%),隐私和数据治理 248 人 (+33%)。自 2019 年以来,所有四个子主题均有所增长, 但从绝对值来看,安保和安全增长最快。 在通用会议上,负责任的人工智能论文仍然只占已接受工作总量的一小部分 (图3.4.3)。 AAAI (8%)、NeurIPS (8%)、ICML (7.7%) 和 ICLR (7.6%) 均集中在 8% 左右,这一比例 自 2019 年以来一直保持平稳,尽管 AAAI 确实从 2024 年的 13% 左右下降到 2025 年的 8%。 第329章 第489章 第644章 696 992 1,278 1,521 2019 2020 2021 2022 2023 2024 2025 0 200 400 600 800 1,000 1,200 1,400 1,600 RAI论文数量 2019 年特定 AI 会议接受的负责任的 AI 论文数量 - 25 来源:人工智能指数,2026 |图:2026年AI指数报告 图3.4.1 ===== 第148页 ===== 148 3.4 学术界的 RAI | 负责任的人工智能 | 2026 年人工智能指数报告 124 150 213 186 248 150 169 212 第408章 第462章 134 189231 第393章 第355章 405 162 168 215 285 276 第521章 第641章 第347章 第524章 704 第777章 1,094 1,470 1,756 2019 2020 2021 2022 2023 2024 2025 0 500 1,000 1,500 人 2,000 隐私和数据治理 公平和偏见 透明度和可解释性 安保和安全 RAI论文数量 2019-25 年特定人工智能会议按子主题接受的负责任的人工智能论文数量 来源:人工智能指数,2026 |图:2026年AI指数报告 图3.4.2 11 11 一份出版物可能与多个主题相关,因此可能在多个类别中计数或显示。 2019 2020 2021 2022 2023 2024 2025 0% 10% 20% 30% 40% 50% 60% 70% RAI 论文(占总数的%) 7.62%,ICLR 7.65%,ICML 7.98%,神经IPS 8.00%,AAAI 54.68%,AIES 67.43%, 事实 2019-25 年特定 AI 会议上接受的负责任的 AI 论文(占总数的百分比)(按会议划分) 来源:人工智能指数,2026 |图:2026年AI指数报告 图3.4.3 ===== 第149页 ===== 149 3.4 学术界的 RAI | 负责任的人工智能 | 2026 年人工智能指数报告 地理分布 捐款国家数量 负责任的人工智能研究 会议有所增加,但会议之间的平衡 主要贡献者发生了变化。 2025年,中国 领先 812 篇接受 RAI 论文,超过 是来自美国的394的两倍(图 3.4.4)。新加坡(112)、英国(103)、 香港(98)也名列前茅 五位贡献者。 2024年,美国领先 论文数量为 788 篇,中国为 322 篇(图 3.4.5)。的 逆转是急剧的,但与中国的领先地位一致 在总体人工智能出版物数量和引用份额中, 正如第一章所讨论的。欧洲, 到 2023 年都在增长,其 RAI 产量下降 2024 年和 2025 年。在整个 2019 年至 2025 年期间, 美国仍然拥有最大的累计 接受的 RAI 论文总数。 29 54 57 68 84 98 103 112 第394章 812 0 200 400 600 800 意大利 加拿大 韩国 德国 澳大利亚 香港 英国 新加坡 美国 中国 RAI论文数量 select 接受的负责任的人工智能论文数量 2025 年按地理区域划分的人工智能会议 来源:人工智能指数,2026 |图:2026年AI指数报告 1–10 11–50 51–150 151–500 501–2,100 2,101–3,900 2019-25 年按地理区域划分的特定人工智能会议上接受的负责任的人工智能论文数量(总计) 来源:人工智能指数,2026 |图:2026年AI指数报告 图3.4.4 图3.4.5 ===== 第150页 ===== 150 3.5 RAI 政策制定 3 负责任的人工智能 | 2026 年人工智能指数报告 负责任的人工智能治理取决于各国采用道德原则并拥有相应的机构 以及执行这些规定的法规。联合国教科文组织的准备情况评估方法(RAM)是最 衡量国家一级准备情况的全面国际努力。 12月推出 到 2022 年,RAM 将评估国家在法律框架、技术框架等方面的准备情况 基础设施和教育,并编写一份国家报告来评估差距所在。 大多数主要人工智能生产国,包括美国、中国和西欧大部分国家,都已经 未参加评估(图3.5.1)。已经完成或开始评估的国家是 集中在拉丁美洲、撒哈拉以南非洲以及南亚和东南亚部分地区。 RAM 的努力 被设计为处于治理轨迹早期的国家的能力建设工具,这可以解释 参与模式。 人工智能立法和国家战略通常包括负责任的人工智能条款,第 8 章审查了这些条款 更详细地说。 准备中 进行中 已完成 准备情况评估方法(RAM)在成员国的实施 资料来源:联合国教科文组织,2025 |图:2026年AI指数报告 图3.5.1 ===== 第151页 ===== 151 亮点: 全球人工智能治理参与 3.5 RAI 政策制定 | 负责任的人工智能 | 2026 年人工智能指数报告 2019年以来,人工智能治理国际合作更加广泛,但深度 跨国界的参与度差异很大(图 3.5.2)。只有五个国家,加拿大、法国、德国、 意大利和日本一贯支持两国间记录的每一项重大全球人工智能治理举措 2019 年和 2025 年。其他国家根据论坛、焦点和情况进出这些峰会 但更重要的是,并非所有国家都有能力参与这些全球人工智能治理 倡议。第一个关于人工智能的政府间标准,即 2019 年经合组织人工智能原则,仅限于 成员国(主要是高收入国家)和一些伙伴国家。同样,G7 和 G20 的讨论 仍然以世界最大的经济体为中心。然而,2023 年布莱奇利峰会和 2024 年首尔峰会 通过邀请更广泛的国家,特别是包括 中国。 2025年法国人工智能行动峰会标志着进一步的转折点,100多个国家齐聚一堂 与民间社会组织和非政府组织一起,制定优先考虑全球南方国家需求的议程 和环境的可持续性。六十四名与会者签署了最终的包容性和包容性声明 可持续人工智能,包括非洲联盟委员会和欧盟。在一个显着的转变中, 美国和英国拒绝签署最终声明。英国称缺乏重视 国家安全,而美国的决定反映了转向更加放松管制、“创新优先”的政策 方法。随着这些治理论坛的参与变得更加包容和实质性,共识 合作条款变得更难获得。 ===== 第152页 ===== 152 亮点: 3.5 RAI 政策制定 | 负责任的人工智能 | 2026 年人工智能指数报告 图3.5.2 ===== 第153页 ===== 153 3.6 隐私数据治理 3 负责任的人工智能 | 2026 年人工智能指数报告 负责任的人工智能实践在各个国家的发展并不均衡。本节评估了该变化 隐私和数据治理,借鉴全球负责任人工智能指数 (GIRAI)。 GIRAI 是一个标杆 涵盖 138 个国家的数据集,根据已完成的 1,862 个问题进行的经过质量审查的专家调查而构建 由 138 名国内研究人员在 2023 年 11 月至 2024 年 2 月期间进行的评估。该报告对各国的评分为 0 到 100 个跨主题领域的量表,涵盖政府框架、政府行动以及政府的作用 民间社会和倡导组织。但需要注意的是,分数低并不一定意味着 表明一个国家忽视了某个维度。在许多情况下,它们反映了人工智能的早期阶段 部署和传播或正式制定人工智能特定框架的机构能力有限。 数据保护和隐私 GIRAI 评分12 的隐私和数据保护维度检查各国是否制定了以下法律: 管理人工智能系统中个人数据的收集、使用和共享方式,以及这些法律是否得到支持 由有权执行这些规定的监管机构制定。 国家分布广泛, GIRAI 分数范围从接近零到以上 接受调查的国家中有 80 个(图 3.6.1)。 澳大利亚和欧洲部分地区得分最高, 而非洲和中东部分地区则显示 缺乏专门的数据保护立法 。贸发会议的补充地图 大多数国家现在都有某种形式的公司 已制定的数据保护立法,尽管 数量很少,主要集中在非洲和部分地区 亚洲仍处于草案阶段或尚未立法 化完全(图3.6.2)。 12 依据《世界人权宣言》第 12 条、《公民权利和政治权利国际公约》第 17 条、经合组织人工智能原则、联合国教科文组织人工智能伦理建议书以及联合国教科文组织关于人工智能的原则 个人数据保护和隐私,GIRAI 检查明确的法律、监督和实践,并评估确保处理的框架和行动 合法、公平、目的有限且相称。它还评估透明度、用户信息权利、保留限制、准确性、保密性、 安全性、责任性和数据传输规则。该指数考虑了国家措施——数据保护法规、自动决策指令、 监管机构拥有执法权、审计权、安全控制权和监管沙箱等举措。它还解释了非国家在隐私方面的努力 以及数字版权组织,加强协议并建设能力以减轻人工智能相关的隐私风险,例如大规模跟踪、分析和 敏感数据滥用。 ===== 第154页 ===== 154 3.6 隐私数据治理 | 负责任的人工智能 | 2026 年人工智能指数报告 0 1–20 21–40 41–60 61–80 81–100 无数据 全球人工智能数据保护与隐私评估 资料来源:负责任人工智能全球指数,2024 年 |图:2026年AI指数报告 立法 立法草案 没有立法 无数据 全球数据保护和隐私立法 资料来源:贸发会议,2025 |图:2026年AI指数报告 图3.6.2 图3.6.1 ===== 第155页 ===== 155 3.7 公平与偏见 3 负责任的人工智能 | 2026 年人工智能指数报告 公平和偏见是负责任的人工智能最难衡量的维度之一,部分原因是 什么算公平很大程度上取决于具体情况。 GIRAI 对偏见和不公平的国家分别进行评分 歧视、性别平等以及文化和语言多样性。 偏见和不公平歧视 GIRAI 分数的偏见和不公平歧视 13 维度评估各国是否有前 采取明确措施,防止和减轻人工智能在设计、开发和使用过程中产生的歧视性后果 部署。它旨在解决因不具代表性的数据、有缺陷的设计或 根深蒂固的社会不平等可能会伤害边缘化群体,无论其意图如何。它考虑是否 政府是否已制定法律、监督机构和执行机制,以及公民社会是否 电子组织正在独立致力于监测和解决偏见。 GIRAI 在这个维度上的得分总体上相当低(图 3.7.1)。美国和加拿大 得分最高,澳大利亚、欧洲部分地区和巴西处于中间范围。非洲大部分地区、中 东部和中亚得分低于 20。 13 GIRAI 分数的偏见和不公平歧视维度以国际人权框架为基础(《世界人权宣言》、《消除一切形式种族歧视国际公约》、《公民权利和政治权利国际公约》、 经济、社会、文化权利国际公约)。 0 1–20 21–40 41–60 61–80 81–100 无数据 全球人工智能偏见和不公平歧视评估 资料来源:负责任人工智能全球指数,2024 年 |图:2026年AI指数报告 图3.7 .1 ===== 第156页 ===== 156 3.7 公平与偏见 | 负责任的人工智能 | 2026 年人工智能指数报告 性别平等 文化和语言多样性 GIRAI 的性别平等维度考虑各国是否有国家和非国家举措来预防 消除性别偏见,保护所有性别身份在人工智能设计、开发和使用中的平等权利。加拿大 荷兰在此项指标上得分最高(图 3.7.2)。欧洲和日本部分地区陷入 61-80 的范围,其次是美国和巴西等国家,得分在 41-60 之间。 GIRAI 的文化和语言多样性维度侧重于各国对当地语言的保护措施 人工智能生命周期中广泛的语言、方言、本土知识系统和文化多样性。多姆- 非文化假设可能会给人工智能带来偏见,使少数群体边缘化,并侵蚀少数群体语言。这方面的分数 尺寸比其他尺寸分布更均匀(图 3.7.3)。新加坡得分最高,而德国则 纽约州、爱尔兰、意大利、卡塔尔、爱沙尼亚和斯洛文尼亚的得分也处于较高范围(70-88)。 并非所有地区都以相同的方式保护文化和语言多样性(图 3.7.4)。在北美,政府 政府计划和非国家行为者,例如倡导团体、研究机构和数字权利 组织很活跃,但正式的法律框架尚不发达。在欧洲、亚洲和中东 在东方,非国家行为者所做的也比政府更多。在非洲,这种差距尤其明显。 非国家行为者在 39% 的国家开展活动,但只有 7% 的国家有政府项目,只有 2% 的国家有 法律框架已到位。 0 1–20 21–40 41–60 61–80 81–100 无数据 全球人工智能性别平等评估 资料来源:负责任人工智能全球指数,2024 年 |图:2026年AI指数报告 图3.7 .2 ===== 第157页 ===== 157 0 1–20 21–40 41–60 61–80 81–100 无数据 全球人工智能文化和语言多样性评估 资料来源:负责任人工智能全球指数,2024 年 |图:2026年AI指数报告 2% 27% 0% 38% 33% 33% 7%7% 37% 0% 31% 22% 100% 14% 39% 70% 11% 59% 67% 100% 43% 非洲 亚洲和大洋洲 加勒比海 欧洲 中东 北美 南美 中美洲 0% 20% 40% 60% 80% 100% 政府框架 政府行动 非国家行为者 国家比例 按地区和类别划分的具有人工智能文化和语言多样性证据的国家比例 资料来源:负责任人工智能全球指数,2024 年 |图:2026年AI指数报告 图3.7 .4 图3.7 .3 3.7 公平与偏见 | 负责任的人工智能 | 2026 年人工智能指数报告 ===== 第158页 ===== 158 图3.7.514 14 数据来源:https://crfm.stanford.edu/helm/arabic/latest/。 亮点: 包容性和全球语言差距 随着少数专有模型塑造全球人工智能能力,“全球语言鸿沟”已成为 更明显。这些系统在英语和其他一些广泛使用的语言中表现更好 比所有其他人都重要。这是一个负责任的人工智能问题,因为它决定了谁从人工智能系统中受益, 谁不呢。 在特定于语言和文化的基础模型和基准领域继续努力,例如 2022 年推出 KoBEST,2023 年推出 HAE-RAE,以及其他韩国定制模型,包括 Polyglot-Ko 和 HyperCLOVA X. 西班牙语言技术计划于 2019 年启动,为后来的计划奠定了基础 公共资助的 ALIA 系列西班牙语和区域语言模型,以及早期的区域努力 例如,加泰罗尼亚的 AINA 项目早于当前的区域基准化浪潮。 2025年,步伐 这项工作的知名度有所提高,更多地区和地区出现了新的基准和模型 开始在全球评估基础设施中注册。 HELM 阿拉伯语是斯坦福大学 CRFM 的 HELM 框架的区域扩展,与 Rabbit.ai 一起开发,它评估了 涵盖学术评估、语法和地区的七个阿拉伯语言基准的模型 具体的安全性。在这次评估中,得分最高的模型是Arabic.ai的LLM-X,这是一个区域开发的模型 模型的平均得分为 0.86,领先于 Gemini 2.5 Flash(0.82)和 GPT-5.1(0.81)(图 3.7.5)。排行榜 当基准反映当地用法、方言、 和文化参考。 印度法学硕士竞技场也出现了类似的模式,这是由印度理工学院马德拉斯分校的 AI4Bharat 领导的一项众包评估 该项目测试了 20 多种印度语言的模型的语言质量、文化基础和安全性。 3.7 公平与偏见 | 负责任的人工智能 | 2026 年人工智能指数报告 0.86 Falcon3-7B-指导 Falcon3-10B-指导 Jais-adapted-7b-聊天 Jais-adapted-13b-聊天 AceGPT-v2-8B-聊天 西尔玛9B Jais-family-30b-16k-聊天 Qwen2.5指令Turbo (7B) Jais-adapted-70b-聊天 米斯特拉尔大号 (2411) AceGPT-v2-32B-聊天 AceGPT-v2-70B-聊天 骆驼 3.3 指令涡轮 (70B) Qwen2.5指令Turbo (72B) GPT-4.1纳米 (2025-04-14) ALLaM-7B-指导-预览 骆驼 4 侦察兵 (17Bx16E) 指导 GPT-4.1迷你 (2025-04-14) Cohere 实验室命令 A 深寻 v3.1 Qwen3-Next 80B A3B 指令 骆驼 4 特立独行 (17Bx128E) 指导 FP8 阿拉伯语.AI 法学硕士 Gemini 2.5 Flash-Lite Qwen3 235B A22B 指令2507 FP8 GPT-4.1 (2025-04-14) GPT-5.1 (2025-11-13) 双子座2.5闪存 阿拉伯语.AI LLM-X 2024 2025 0 0.2 0.4 0.6 0.8 1 平均分 HELM 阿拉伯语:平均分 0.37 0.41 0.53 0.59 0.63 0.63 0.64 0.65 0.66 0.71 0.71 0.74 0.76 0.76 0.69 0.70 0.75 0.76 0.77 0.77 0.77 0.78 0.78 0.79 0.79 0.81 0.81 0.82 来源:HELM,2026 |图:2026年AI指数报告 ===== 第159页 ===== 159 图3.7.615 15 数据来源:https://arena.ai4bharat.org/#/leaderboard/chat/overview。 亮点: 3.7 公平与偏见 | 负责任的人工智能 | 2026 年人工智能指数报告 专有模型领先排行榜,GPT-5.2 得分 1,314,其次是 GPT-5.1(1,298)和 Gemini 3 闪存 (1,288)(图 3.7.6)。开源模型得分较低,但仍具有竞争力,其中 Qwen3- Next-80B 为 1,156,Llama-4-Maverick-17B 为 1,108。评估不仅限于翻译准确性 测试响应是否适合印度用户的上下文,这是全球基准的一个维度 通常不捕获。 这种差距超越了语言界限,延伸到同一语言内的方言变化。斯洛文尼亚人 DIALECT-COPA 基准测试标准斯洛文尼亚语和 Cerkno 语言中的常识推理 方言。 GPT-5 在标准斯洛文尼亚语上得分为 99.8%,但在方言上得分下降至 88.6%(图 3.7.7)。的 其他型号的下降幅度更大。 Mistral Medium 3.1从90.0%下降到53.2%,Llama 3.3从 87.0% 至 53.6%。方言在拼写、词汇和语法方面与标准变体不同,并且很少出现 在训练数据中表示。这些差距表明,即使在模型合理处理的语言中 好吧,对于非标准品种的扬声器来说,性能会急剧下降。 974 985 1,082 1,087 1,0891,090 1,108 1,110 1,114 1,114 1,117 1,117 1,126 1,134 1,142 1,156 1,165 1,167 1,173 1,195 1,198 1,199 1,209 1,256 1,288 1,298 1,314 Qwen3-235B-A22B-思考-2507 花岗岩-4-h-小 Llama-4-Scout-17B-16E-指示 Qwen3-30B-A3B-说明书 GPT-4O-迷你 Llama-3.2-3B-指示 Llama-4-Maverick-17B-128E-指示 GPT-4 GPT-4.1-纳米 GPT-4O 杰玛-3-12b-it Qwen3-235B-A22B-指令-2507 杰玛-3-27b-it gpt-4.1-迷你 GPT-5-专业版 Qwen3-Next-80B-A3B-指令 gpt-4.1 GPT-5-纳米 Gemini-2.5-ash-lite e 双子座-2.5-灰烬 GPT-5 GPT-5-迷你 双子座2.5-pro 双子座3-pro 双子座 3-灰烬 GPT-5.1 GPT-5.2 0 200 400 600 800 1,000 1,200 1,400 型号 分数 印度法学硕士竞技场 资料来源:印度法学硕士竞技场排行榜,2026 |图:2026年AI指数报告 ===== 第160页 ===== 160 图3.7.716 16 数据来源:https://slobench.cjvt.si/leaderboard/view/17。 亮点: 3.7 公平与偏见 | 负责任的人工智能 | 2026 年人工智能指数报告 53.00% 82.00% 82.60% 84.20% 86.20% 87.00% 90.00% 92.60% 97.00% 97.40% 98.60% 99.80% 88.60%86.40% 74.20% 67.60% 56.20% 53.20%53.60% 57.80% 52.80%54.40% 51.00%49.20% 深S eek-R1-蒸馏-Q 文14B 镓质谱 -27B-研究所 鲁克特 奎文3( Qwen3 -2504) GPT -3.5-涡轮 杰玛 3 骆驼 3 .3 雾气 真实介质3 .1 克劳德·H 爱酷4.5 GPT -4o(gpt-4o-202 4-08-06) 双子座2.5F 睫毛 双子座2.5P 罗 GPT -5型号(gpt-5-2025-0 8-07) 0% 20% 40% 60% 80% 100% 标准斯洛文尼亚采尔克诺方言 型号 准确度(%) Slobench:准确度 资料来源:斯洛文尼亚 DIALECT-COPA 基准排行榜,2026 年 |图:2026年AI指数报告 为了应对这些差距,越来越多的区域计划正在构建特定语言的人工智能 从头开始建设基础设施,而不是等待全球实验室增加覆盖范围。像SEA-LION这样的项目 东南亚的 AI4Bharat 和印度的 AI4Bharat 正在开发自己的数据管道、标记器和评估 适合当地语言条件的基准。这些项目所服务的许多语言都具有结构性 复杂的形态、文字多样性和有限的数字化文本等特征,导致标准 多语言工具表现不佳。这些努力使语言包容性不再是事后的想法 但作为一项设计要求,它们代表了在外部不断增长的负责任的人工智能基础设施层 人工智能主要产区。 基准测试语言涵盖的重点 AfroBench 64 种非洲语言 跨 NLU、生成、多任务 LLM 评估 QA/知识和数学(15 个任务;22 个数据集) IrokoBench 17 种西非资源匮乏的非洲语言/ 东非/南部/中部非洲 人工翻译套件涵盖 NLI (AfriXNLI)、数学 推理(AfriMGSM)和多项选择知识 质量保证 (AfriMMLU) TerjamaBench Darija(阿拉伯文 + 拉丁文“Arabizi”)英语↔Darija 机器翻译基准 强调文化背景和地区差异 (850 个条目) 非洲 ===== 第161页 ===== 161 亮点: 3.7 公平与偏见 | 负责任的人工智能 | 2026 年人工智能指数报告 HausaMovieReview Hausa(+ 语码转换英语) 5,000 条情绪/评论风格基准 反映共同代码的豪萨 YouTube 评论- 切换 基准测试语言涵盖的重点 印度语 LLM 竞技场 许多印度语言 + 英语克里奥尔语 众包、人机交互排行榜 评估印度的语言、文化和安全 上下文(AI4Bharat;由 Google Cloud 支持) SEA-HELM 菲律宾语、印度尼西亚语、泰米尔语、泰语、越南语 东南亚语言和语言整体评估 跨多项任务的文化能力 巴塔延他加禄语、塔格利什整体菲律宾语基准跨越理解, 推理和生成;明确涵盖代码- 切换 HELM 阿拉伯语 阿拉伯语 透明、可重复的阿拉伯语 LLM 评估 基于既定的阿拉伯语基准的排行榜 (与阿拉伯语.ai) BALSAM 阿拉伯语 社区驱动的阿拉伯语基准和平台 盲评; 14 个类别的 78 项任务 (52K 示例) Cetvel 土耳其语 统一土耳其语 LLM 基准由 22 个数据集构建 涵盖 7 项任务,并列排行榜 TUMLU 阿塞拜疆语、克里米亚鞑靼语、卡拉卡尔帕克语、哈萨克语、 吉尔吉斯语、鞑靼语、土耳其语、维吾尔语、乌兹别克语 本土开发的多语言语言- 使用理解突厥语言的基准 涵盖 11 个科目的初中/高中问题 吉尔吉斯法学硕士-Bench Kyrgyz Suite,用于深入理解和推理吉尔吉斯语, 将本地基准与翻译/后期相结合 编辑国际任务 ArmBench-LLM 亚美尼亚 亚美尼亚LLM基准结合大学 MMLU-Pro-Hy 入学考试(1,000 个问题 翻译样本) GeoLogicQA Georgian 手动策划了 100 个问题逻辑基准 和推理,由母语人士验证 CantoNLU 粤语七任务粤语 NLU 基准(语法/ 语义、NLI、情感、标记、解析) TLUE 藏文 衡量 LLM 语言能力的大型基准 藏语理解 亚洲、中东和北非(阿拉伯语)、中亚 ===== 第162页 ===== 162 亮点: 3.7 公平与偏见 | 负责任的人工智能 | 2026 年人工智能指数报告 基准测试语言涵盖的重点 BenCzechMark 捷克语 以捷克为中心的综合基准,得分为 50 任务、多种格式/指标和重要性- 意识聚合 CUS-QA 捷克语、斯洛伐克语、乌克兰语 开放式区域 QA 基准,包含文本和 视觉基础,由母语人士策划 英文翻译 COLE French 23 任务法语自然语言理解 (NLU) 强调与法语相关的语言的基准 现象(用于对 94 个法学硕士进行基准测试) 爱沙尼亚基准 爱沙尼亚基准由七个数据集构建而成,涵盖 知识、语法/词汇、总结和 语境理解 IberBench 巴斯克语、加泰罗尼亚语、加利西亚语、西班牙语、葡萄牙语、 英语 集成 101 的大型可扩展基准测试 跨 22 个任务类别的数据集(例如毒性、 摘要)以及社区驱动的更新 IberoBench 巴斯克语、加泰罗尼亚语、加利西亚语、欧洲西班牙语、 欧洲葡萄牙语 多任务基准测试(62 个任务;179 个子任务) LM 评估工具框架 波兰语语言和 文化能力 波兰语 600 个手工制作的评估波兰语的问题 历史、地理、文化/传统、艺术、语法、 和词汇 LLMzSzŁ 波兰语考试基准来自波兰国家 考试(约 19K 封闭式问题,涵盖 154 域) 斜体 意大利文化意识 意大利 NLU 基准 10,000 涵盖 12 个领域的多项选择题 SloBENCH 斯洛文尼亚语评估平台,具有多个排行榜, 包括 DIALECT-COPA(标准与方言)和 斯洛文尼亚语语音识别 欧洲 图3.7 .8 ===== 第163页 ===== 163 3.8 透明度 3 负责任的人工智能 | 2026 年人工智能指数报告 透明度衡量开发人员披露其模型如何构建、训练和使用的程度 部署。两个独立的指数从不同角度追踪这一情况。 开放度指数 基础模型透明度指数 人工分析开放性指数根据自由权重的多少,对人工智能模型进行 0 到 100 分的评分 可以访问和许可,以及培训方法和预培训的透明度水平 和训练后数据。领先模型的得分较低,大多数在 2 到 16 分之间(满分 100 分) (图3.8.1)。 K2 Think和Olmo 3 32B Think得分最高,也是仅有的两款机型 这为预训练数据透明度得分。该指数中的所有其他模型在这方面得分为零 类别。模型可用性和方法披露占所有模型的大部分分数。作为 第一章接入部署讨论,90%以上行业知名模型发布 到 2025 年,无需训练代码。开放性指数结果表明,模式超越了代码 训练数据也是如此。 基金会模型透明度指数 (FMTI) 采用了不同的方法,对开发人员进行评分,而不是对 个别模型。现在已经是第三年了,它评估了模型生命周期三个阶段的披露情况。 上游涵盖构建模型的内容,包括训练数据、劳动力和计算。模型封面 2 4 4 4 6 6 6 6 6 6 6 6 6 6 2 3 4 6 6 6 6 3 3 3 2 2 2 2 2 5 5 6 7 7 7 7 9 13 15 15 16 16 克劳德 4.5 H 艾克 你 K-EXA 一号 骆驼4M 艾弗里克 基米K2.5 雾气 拉尔 基因3 Qwen3 .5 397B A1 7B 全科医生 t-oss- 120B(高) 全科医生 t-oss-20B(高) GLM- 5 英伟达尼莫 创 9B V2 英伟达尼莫 创3N 阿诺 英伟达尼莫 创3S 上层 K2思考 奥尔莫 3 32B 思考 0 2 4 6 8 10 12 14 16 18 型号可用性 透明度:方法论 透明度:训练后数据 透明度:预训练数据 分数 按组成部分划分的开放度指数 资料来源:人工分析,2026 |图:2026年AI指数报告 图3.8.1 ===== 第164页 ===== 164 关于系统本身的披露内容,下游涵盖发布后发生的情况,包括 监测和影响报告。 在 2025 年版本中,平均透明度从 2024 年的 58 下降到 40(图 3.8.2)。 IBM 领先 95 位 Writer 的得分为 72 分。xAI 和 Midjourney 等其他公司的得分仅为 14,而开放模型开发人员、 B2B 企业提供商、发布透明度报告的组织以及欧盟人工智能法案签署方倾向于 表现更好。与开放性指数一样,最薄弱的领域是上游,特别是在训练数据方面 以及用于构建模型的资源(图 3.8.3)。 3.8 透明度 | 负责任的人工智能 | 2026 年人工智能指数报告 0 10 20 30 40 50 60 70 80 90 100 格洛克3 中途V7 中3 奎文3号 骆驼 4 DeepSeek-R1 o3 新星总理 双子座2.5 克劳德 4 坚巴1.6 巴尔米拉X5 花岗岩3.3 上游 型号 下游 分数 14 14 18 26 31 32 35 39 41 46 66 72 95 2025 年按领域划分的基础模型透明度指数得分 来源:2025 年基金会模型透明度指数 92% 17% 17% 25% 17% 33% 100% 33% 0% 0% 8% 58% 0% 0% 20% 0% 0% 20% 0% 100% 20% 0% 0% 0% 40% 0% 22% 11% 11% 0% 44% 11% 100% 22% 0% 0% 0% 100% 11% 75% 75% 0% 25% 75% 0% 100% 75% 0% 0% 0% 75% 0% 50% 50% 50% 50% 50% 50% 100% 50% 0% 25% 0% 50% 0% 75% 50% 50% 25% 50% 25% 75% 50% 0% 25% 25% 50% 25% 60% 0% 40% 60% 20% 20% 100% 20% 0% 0% 60% 40% 0% 60% 0% 60% 80% 20% 40% 80% 0% 0% 20% 80% 40% 0% 88% 63% 75% 75% 63% 88% 100% 50% 63% 38% 63% 88% 50% 20% 0% 20% 60% 0% 0% 80% 0% 20% 0% 20% 100% 0% 71% 0% 0% 29% 0% 29% 86% 14% 29% 14% 14% 86% 0% 71% 0% 57% 57% 0% 43% 100% 29% 0% 43% 71% 86% 0% 100% 50% 75% 100% 75% 75% 100% 75% 25% 0% 75% 50% 75% 80% 60% 80% 100% 60% 80% 80% 40% 60% 60% 60% 80% 60% 100% 40% 100% 100% 0% 100% 100% 80% 40% 80% 100% 100% 40% 坚巴 1.6 酷文 3 诺瓦 Premier Claude 4 DeepSeek-R1 Gemini 2.5 Granite 3.3 Llama 4 中途 V7 中型 3 o3 巴尔米拉 X5 Grok 3 下游缓解措施 可接受的使用政策 模范行为政策 部署后监控 影响 使用数据 发布 模型缓解措施 风险 能力 模型访问 型号信息 计算 数据属性 数据采集 透明度的主要维度 64% 29% 42% 52% 33% 40% 93% 37% 16% 20% 38% 69% 17%平均 31% 15% 26% 38% 40% 40% 32% 37% 69% 25% 29% 43% 67% 69% 75% 平均 2025 年按透明度主要维度划分的基金会模型透明度指数得分 来源:2025 年基金会模型透明度指数 图3.8.2 图3.8.317 17 数据、劳动力、计算和方法是上游指标;模型基础知识、访问权限、功能、风险和缓解措施是模型级别的指标 托尔斯;分布、使用政策、反馈和影响是下游指标。 ===== 第165页 ===== 165 3.9 安全与保障 3 负责任的人工智能 | 2026 年人工智能指数报告 安全是负责任的人工智能维度,其中机构基础设施增长最快。新 评估框架、政府支持的人工智能安全机构和标准化基准都已 去年扩大了。本节追踪增长情况以及由此产生的有关当前模型效果的数据 切实抓好安全工作。 全球人工智能安全研究所 人工智能安全研究所 (AISI) 是国家支持的专业组织,旨在帮助政府了解 管理先进人工智能的风险,特别是前沿/基础模型。他们进行技术评估 政府可以用来制定政策的系统和安全研究。 英国(AI 安全研究所)、美国(NIST 的 USASI)、日本(JAISI)、 新加坡(数字信任中心)和以色列(人工智能安全研究中心)(图 3.9.1)。印度和法国有 还与印度的人工智能安全研究所和法国的 Current AI 合作推出了 AISI。第二波浪潮正在发展中 加拿大、韩国、德国和巴西。除了这些独立机构之外,参与度也在不断增长 通过人工智能安全研究所国际网络,肯尼亚和澳大利亚被列为网络成员 没有自己的正式机构的人。 建立这些 AISI 的国家大多仍然是富裕、技术先进的经济体,但并非如此。 所有人都追求相同的目标。英国和以色列强调安全,欧盟AI办公室配对评估 具有《人工智能法》规定的执行权。网络成员资格是各国的实际切入点 没有资源立即建立一个完整的研究所。 已公布(开发中) 设立(运营) 网络成员(无正式机构) 不适用 人工智能安全机构和网络成员资格 资料来源:所有技术都是人类,2025 |图:2026年AI指数报告 图3.8.318 18 数据来源:https://alltechis human.org/all-tech-is- human-blog/the-global-landscape-of-ai-safety-institutes。 ===== 第166页 ===== 166 3.9 安全与保障 | 负责任的人工智能 | 2026 年人工智能指数报告 基准测试 头盔安全 去年报告中介绍的 HELM Safety 仍然是少数用于评估的标准化套件之一 跨责任和安全指标的人工智能模型。它跨基准测试主要开发人员的模型 包括 BBQ(社会偏见)、SimpleSafetyTests(自残和虐待风险)、HarmBench(骚扰和虐待) 错误信息)、AnthropicRedTeam(对抗性对话)和 XSTest(有用与无害) 权衡)。 2025 年的结果显示持续改进,但顶部压缩也有所增加(图 3.9.2)。 2024年至2025年间发布的大多数型号得分在0.90至0.98之间,差距非常窄 得分最高者和最低者之间。 2023 年以来的较旧型号得分较低,但总体轨迹 表明领先模型正在趋于安全上限,而当前的基准可能并不好—— 粒度足以区分有意义的差异。 0.98 GPT-3.5 涡轮 (0613) DeepSeek 法学硕士聊天 (67B) DBRX指令 米斯特拉尔指令 v0.3 (7B) OLMo 2 13B 指令 2024 年 11 月 骆驼 3.1 指令涡轮 (70B) 混合指令 (8×22B) 巴尔米拉医学 命令 R Plus 克劳德 3 俳句 (20240307) 骆驼 3.1 指令涡轮 (405B) 双子座 1.5 Pro (001) GPT-4o 迷你 (2024-07-18) Qwen2.5指令Turbo (72B) GPT-4o (2024-05-13) 巴尔米拉鳍 o1 (2024-12-17) 克劳德 3.5 十四行诗 (20240620) 格洛克 4 (0709) 密斯塔尔小 3 (2501) 深度搜索 v3 DeepSeek-R1-0528 OLMo 2 32B 2025 年 3 月指令 GLM-4.5-空气-FP8 Llama 4 Maverick (17Bx128E) 指导 FP8 IBM Granite 4.0 小型 Gemini 2.5 Pro(03-25预览版) 巴尔米拉X5 Gemini 3 Pro(预览版) 克劳德 3.7 十四行诗 (20250219) Qwen3 235B A22B 指令 2507 FP8 GPT-4.1 (2025-04-14) GPT-4.5(2025-02-27 预览版) GPT-5.1 (2025-11-13) 克劳德 4.5 十四行诗 (20250929) o4-mini (2025-04-16) Kimi K2 指导 GPT-5 (2025-08-07) o3 (2025-04-16) 2023 2024 2025 0 0.2 0.4 0.6 0.8 1 平均分 HELM 安全性:平均分 0.850.87 0.63 0.73 0.77 0.840.850.860.860.880.900.920.930.930.950.950.980.98 0.840.85 0.870.890.900.900.91 0.91 0.91 0.930.930.940.950.960.960.97 0.970.970.980.98 来源:HELM,2026 |图:2026年AI指数报告 图3.9.2 ===== 第167页 ===== 167 3.9 安全与保障 | 负责任的人工智能 | 2026 年人工智能指数报告 安全基准结果 在安装了外部护栏进行测试的车型中,Claude 3.5 Haiku、Claude 3.5 Sonnet 和 Mistral Large 均获得“非常好”评级,而其父模型则获得“良好”评级(图 3.9.3)。在集合中 无需外部安全过滤器或调节工具即可测试的模型,Gemma 2 9b,Phi 3.5 MoE 指导,Phi 4 得分“非常好”(图 3.9.4)。这两组不具有直接可比性,因为它们 涉及不同条件下的不同模型,但均显示出“良好”的基线安全性能 跨领先的系统。 来源:MLCommons,2025 图3.9.3 AI发光 AILuminate v1.0 是一个新的基准测试,旨在测试人工智能系统抵御可能触发的提示的能力 危险、非法或不良行为。它涵盖了12个危险类别,包括暴力犯罪和儿童犯罪 剥削,并采用从“差”到“优秀”的五级评分标准。该基准包括两个 单独评价。第一个测试正常使用下的安全性,模型评估有和没有 外部安全过滤器和审核工具。第二个测试系统抵抗故意越狱的能力 通过对抗性提示进行尝试。 ===== 第168页 ===== 168 3.9 安全与保障 | 负责任的人工智能 | 2026 年人工智能指数报告 来源:MLCommons,2025 图3.9.4 ===== 第169页 ===== 169 3.9 安全与保障 | 负责任的人工智能 | 2026 年人工智能指数报告 越狱 T2T 基准 v0.5 结果 AILuminate Jailbreak T2T 基准 v0.5 测试了当用户故意尝试绕过 模型通过对抗性提示采取的安全措施。图表中的每个模型都会获得两个分数(图 3.9.5)。顶部的方块代表模型在正常情况下的安全得分,而圆圈代表模型在正常情况下的安全得分 下面代表了越狱尝试后的分数。由于这是 Beta 版本 基准测试中,模型通过数字进行去识别,而不是通过命名。 在正常情况下,大多数模型的得分都在“非常好”或“好”范围内。尝试越狱后, 几乎每个系统的分数都会下降,有些下降了整整一层或更多。因此,虽然正常使用情况下的安全性通常 很好,它会在故意操纵下降解。 图3.9.5 ===== 第170页 ===== 170 3.10 权衡 RAI 尺寸 3 负责任的人工智能 | 2026 年人工智能指数报告 在实践中,人工智能系统必须同时满足多个负责任的人工智能维度。越来越多的 实证研究表明,这些维度不会独立改善,因为优化 一个人可以贬低别人。这些权衡的方向和幅度取决于所使用的方法、数据 涉及,以及在什么背景下部署。 Kemmerzell 和 Schreiner(2024)通过在四个面部上训练图像分类模型来直接测试这一点 分析数据集并衡量公平性、隐私性、可解释性和鲁棒性发生的情况 每个维度都是孤立的目标。差分隐私,一种在训练过程中增加噪音的技术 为了防止单个数据点被识别,提高了所有数据集的隐私分数,但 可解释性、公平性和准确性下降,准确率下降高达 33 个百分点 一些配置。旨在提高公平性的训练调整仅在数据集上取得了成功 人口失衡最为严重,因此纠正的空间也最大。但总体而言,减少了 可解释性和稳健性。旨在通过暴露来提高鲁棒性的数据增强方法 数据集到更多样化的训练图像在相同的数据集上产生的负面副作用最少 实验。它还提高了可解释性和准确性,仅轻微降低了隐私性和公平性。 没有任何一种干预方法被证明可以同时改善所有四个方面。 对大型语言模型的单独评估在模型级别发现了类似的模式。切基尼等人。 (2024) 使用 LangTest 评估工具包对 11 个模型的稳健性、准确性和毒性进行了评分。 GPT- 4 在鲁棒性(平均得分为 0.91,满分 1.0)和准确性(0.67)方面领先,但 Llama 2 7B 在以下方面得分最高 毒性回避(0.98),这意味着它最有可能拒绝有毒提示。表现良好的车型 在稳健性方面,例如 Mistral 7B 和 Mixtral 8x7B,在毒性避免方面得分最低(0.39 和 分别为 0.42)。模型的排名根据测量的维度而变化,并且 没有任何一个模型在这三个方面都处于明显的领先地位。 这些权衡也出现在联邦学习中,这是一种由多个机构培训一个人的培训方法。 通过交换模型更新而不是底层数据来共享模型。瓦西夫等人。 (2025) 学习 在此设置中,隐私保护技术如何与四个数据集的公平性相互作用,包括 阿尔茨海默病 MRI 扫描和信用卡欺诈记录。差异隐私并未影响所有数据集 平等地。拥有较大数据集的机构可以吸收额外的噪音,而较小的机构则可以吸收更多的噪音 对模型训练的贡献下降。在阿尔茨海默氏症场景中,增加更强的隐私保护 降低了模型正确识别疾病的能力,准确率下降了14.8个百分点。 对于数据较少的医院来说,效果更差,漏诊率上升了 21.4%。两种选择 使用加密而不是噪声的隐私方法可以使公平性更加稳定,但需要两到三个 计算能力提高数倍。 上述研究是最近的研究,重点关注特定任务而不是通用人工智能系统。 不过,他们的研究结果指向相同的方向:改善一个负责任的人工智能维度往往会导致 另一个人的费用。没有衡量或比较这些权衡的共享框架,这是 RAI 领域的另一个测量差距,使得追踪该领域是否变得更好变得困难 管理他们。 ===== 第171页 ===== 171 经济 4 2026 年人工智能指数报告 概述 2025 年,流入人工智能的资金比以往任何时候都多,并且 更快。 全球企业人工智能投资增长一倍多, 领先前沿公司的收入增长创历史新高 费率。生成式 AI 覆盖人口水平接近 53% 在大众市场推出后三年内采用, 比个人电脑或互联网更快,而且 快速吸收正在转化为真正的价值。美国消费者 生成式 AI 的盈余估计达到 172 美元 到 2026 年初,每年将达到 10 亿美元。但是这样做的好处 膨胀分布不均匀。投资力度大 集中在少数国家、公司和 交易。在劳动力市场,对人工智能技能的需求正在上升 但对劳动力的影响显示出下降的迹象 接触人工智能的最年轻工人比例不成比例 职业。生产率的提高是可以在狭窄的范围内衡量的 任务,但宏观层面的证据仍处于早期阶段 混合的。人工智能经济正在迅速扩大,但范围和程度如何? 这种增长转化为实际经济价值的公平程度如何 仍然是一个悬而未决的问题。 ===== 第172页 ===== 172 章节亮点 4.1 回顾年份:2025 4.2 投资与基础设施 企业投资活动 私人投资活动 人工智能公司经济学 收入 年度计算支出 资本支出 亮点:生成式人工智能有何价值? 4.3 企业人工智能采用 行业用途 按行业和功能 部署阶段 亮点:测量人工智能信号 扩散 4.4 职位 各地区人工智能劳动力需求 美国的人工智能招聘 技能构成 按部门 按州 人工智能招聘 人工智能人才集中 人工智能对劳动力的影响 生产力趋势 劳动力影响 4.5 机器人部署 全局安装模式 地理格局 173 175 178 178 179 189 189 190 191 192 193 193 194 197 199 204 204 205 205 209 210 212 214 219 219 221 227 227 229 内容 ===== 第173页 ===== 173 内容 1 2025年全球企业人工智能投资将增加一倍以上。私人投资增长最快 127.5%,目前占总数的60%。生成式人工智能引领潮流,增长超过 200%,占据了所有私人人工智能资金的近一半。新晋AI公司涨71%, 十亿美元的融资事件几乎增加了一倍。 2 美国继续引领全球私人人工智能投资,承诺金额是全球私人人工智能投资的 23 倍 比中国。在生成人工智能领域,美国投资超过中国和欧洲的总和 大幅领先。然而,私人投资数据可能低估了中国的人工智能总支出, 政府引导基金在 2017 年间向人工智能公司部署了约 1840 亿美元 2000 年和 2023 年。 3 人工智能公司收入正以历史最高速度增长,但计算成本和基础设施 支出也达到了创纪录的水平。领先的前沿公司正在取得有意义的成果 短期内收入规模扩大,但计算支出同比大幅增长 年。主要云提供商加速资本支出,谷歌报告更多 到 2025 年,年度资本支出将超过 1500 亿美元。 4 经济| 2026 年人工智能指数报告 章节亮点 4 消费者从生成式人工智能中获得的价值一年内增长了 54%。估计美国消费者 到 2026 年初,每年盈余达到 1,720 亿美元,高于一年前的 1,120 亿美元,其中 同期每个用户的中值增加了两倍。这些工具中的大多数仍然免费或接近免费。 5 到 2025 年,组织的人工智能采用率继续上升,接受调查的组织中人工智能的采用率高达 88%, 尽管人工智能代理的使用仍处于早期阶段。生成式人工智能现在至少用于一项业务功能: 70% 的组织以及中国和欧洲的同比增幅最高。人工智能代理 几乎所有业务功能的部署都是个位数。 6 生成式人工智能的采用率在三年内达到 53%,比个人计算机或计算机更快 互联网。各国的采用率差异很大,并且与人均 GDP 密切相关, 尽管有些国家的收入超出了预期,包括新加坡(61%)和阿拉伯联合酋长国 阿联酋航空为 54%。尽管美国在人工智能投资和模型开发方面处于领先地位,但仍排名第一 24日为28.3%。 7 人工智能对劳动力市场的影响表现不均匀,主要集中在招聘管道和 从事暴露职业的最年轻工人。 22 至 25 岁软件开发人员的就业 与 2024 年相比下降了近 20%。雇主调查表明未来将发生进一步变化,其中之一是 三分之一的受访者预计来年会裁员。 8 三分之一的组织预计人工智能将在来年减少其劳动力,甚至 尽管大规模失业尚未体现在整体就业数据中。几乎一半 接受调查的组织预计几乎没有变化。预计服务削减量最高 运营、供应链和软件工程。预计几乎所有职能 下降幅度超过了已经观察到的下降幅度。 ===== 第174页 ===== 174 章节亮点 | 经济| 2026 年人工智能指数报告 人工智能带来的生产力提升在结构化、可衡量的工作中最为明显,因为这些工作的产出很容易 进行监控。研究报告显示,客户支持方面的收益提高了 14% 至 15%,软件开发方面的收益提高了 26%, 50%的营销产出。在需要更深入推理的任务中,收益较小,并且最近 有证据表明,严重依赖人工智能可能会带来长期的学习惩罚,从而减慢学习速度 随着时间的推移技能发展。 中国安装的工业机器人数量继续超过世界其他地区的总和,而且 到 2024 年,差距将进一步扩大。中国占全球工业机器人安装量的 54%,高于 2023 年将增长 51.1%。全球同比增长持平,包括 美国、德国和意大利出现下降。台湾是个例外,创下最高纪录 同比增长33%。 9 10 ===== 第175页 ===== 175 4.1 回顾年份:2025 4 经济| 2026 年人工智能指数报告 $500B : “Stargate Project”人工智能基础设施合资企业宣布:OpenAI、软银、 Oracle 和 MGX 在 Nvidia 等公司的支持下推出了主要的人工智能基础设施 Stargate 该项目在白宫宣布。该合资企业计划投资 1000 亿至 500 美元 到 2029 年,将投资 10 亿美元在美国各地建立先进的人工智能数据中心。 投资 投资 第一名:DeepSeek 成为苹果美国应用商店下载次数最多的免费应用程序第一名。 里程碑 $138B :中国宣布设立 1380 亿美元的国家风险投资基金,投资人工智能和其他尖端技术 技术。 收购 Agentic AI:ServiceNow 宣布计划收购 Moveworks 以推动其 Agentic 的使用 跨关键增长领域(包括 CRM)的人工智能平台。 资金 资金 投资 收购 $23B :CoreWeave 是一家人工智能数据中心公司,是 2021 年以来美国最大的科技 IPO, 筹集了 15 亿美元,公司估值达到 230 亿美元。 $300B:OpenAI 以 3000 亿美元的投后估值筹集 400 亿美元。 $5B:AWS 和 HUMAIN 宣布达成 50 亿美元的人工智能基础设施协议,以加速人工智能的采用 在沙特阿拉伯和全球。 $6.5B:OpenAI 以 65 亿美元收购 IO,这是由 Jony Ive 创立的人工智能硬件初创公司 开发新一代消费人工智能设备。 1月21日 1月27日 3月6日 3月10日 3月28日 3 月 31 日 5月13日 5月21日 2025年 ===== 第176页 ===== 176 4.1 2025 年新变化:时间表 | 经济| 2026 年人工智能指数报告 Watsonx AI:IBM 收购人工智能初创公司 Seek AI,推出人工智能 Watsonx AI Labs 纽约市的加速器和创新中心。 $2.4B:谷歌从人工智能代码生成初创公司 Windsurf 聘请关键员工并同意支付报酬 非独家使用 Windsurf 部分技术的许可费为 24 亿美元。 $12B :Thinking Machines Lab 是一家人工智能公司,由 Mira Murati 和其他前任创始人创立 OpenAI 研究人员以 120 亿美元的估值筹集了 20 亿美元的种子轮资金。 183B 美元:Anthropic 在 F 轮融资中筹集了 130 亿美元,投后估值为 1830 亿美元。 $300B:OpenAI 与 Oracle 签署了价值 3000 亿美元的五年期云合同,从 2027 年开始。 Oracle 将为 OpenAI 的 Stargate 数据中心计划提供 4.5 吉瓦的计算能力。 $10B :Mercor 将人工智能实验室与领域专家联系起来,以培训他们的基础人工智能 模型,以 100 亿美元的估值筹集了 3.5 亿美元的 C 轮融资,使得他们的创始人都是 22 岁 岁,有史以来最年轻的白手起家的亿万富翁。 $2.1B:Gamma 是一家创建人工智能生成的演示文稿、网站和社交媒体的初创公司 Posts 宣布完成由 Andreessen Horowitz 领投的 6800 万美元 B 轮融资,估值为 21 亿美元。 4T 美元:Nvidia 成为第一家市值 4 万亿美元的上市公司。 里程碑 交易 资金 资金 资金 资金 投资 合作伙伴 6月2日 7月9日 7月11日 7月15日 9 月 2 日 10 月 27 日 11 月 10 日 9 月 10 日 收购 2025年 ===== 第177页 ===== 177 4.1 2025 年新变化:时间表 | 经济| 2026 年人工智能指数报告 2025年 $6.4B:谷歌宣布将在德国投资 64 亿美元用于云基础设施 2026-29 年扩大其数据中心容量。 投资11月11日 $29.3B:销售流行的人工智能编码助手 Cursor 的 Anysphere 筹集了 23 亿美元 估值293亿美元。 $40B :谷歌宣布对德克萨斯州数据中心和人工智能基础设施投资 400 亿美元 到 2027 年。 $17.5B:微软承诺对印度人工智能基础设施投资 175 亿美元。 $5.6B:物理智能机器人人工智能初创公司构建通用基础模型 机器人“大脑”由 CapitalG 领投,融资 6 亿美元,估值 56 亿美元。 1M:亚马逊宣布到 2030 年将在印度投资超过 350 亿美元,以扩大人工智能和 物流,目标是创造 100 万个新就业岗位和 800 亿美元的卖家出口。 $4.75B:Alphabet 表示将以 47.5 亿美元现金加上承担的债务收购 Intersect 加速美国能源创新和数据中心基础设施建设。 投资 投资 资金 投资 收购 11 月 14 日 11 月 14 日 12月9日 11 月 20 日 12月10日 12月22日 资金 ===== 第178页 ===== 178 4.2 投资与基础设施 4 经济| 2026 年人工智能指数报告 人工智能投资的规模和方向提供了该技术更广泛经济的信号 轨迹。随着人工智能系统变得更加强大和基础设施密集,开发所需的资本 并扩大了它们的部署范围。与本章其他章节讨论的更广泛的趋势一起来看 报告称,这些投资模式不仅吸引了市场兴趣,还吸引了参与该行业的不断上升的成本。 人工智能经济。本节研究了企业基础设施支出、启动资金等方面的这些模式 活动以及人工智能公司本身的运营经济学。分析主要取自 Quid 的人工智能相关投资数据库,并辅以领先企业公开披露的财务指标 Epoch AI 追踪的人工智能公司。 Quid 投资数据捕获了四类资本流动 进入人工智能公司,包括并购、少数股权投资、私人投资和 公开发行。本节中使用的企业投资是指所有四项投资的总和。私人的 接下来的投资小节更狭隘地关注私人融资事件,例如风险投资 资本或私募股权融资,针对已获得超过 150 万美元融资的人工智能公司 自 2013 年起。该子集代表企业投资总额的一部分。 全球企业人工智能投资在过去十年中不断增长,近年来加速,并且 进一步强调人工智能已在多大程度上从一项新兴技术转变为一项关键战略重点。跨越 并购、少数股权、私募投资及公开发行、人工智能相关投资 自 2013 年以来增加了约四十倍(图 4.2.1)。 2025年,总投资达到5816.9亿美元, 比上年增长129.9%。民间投资占比最大 活动金额为 3,446.6 亿美元,较 2024 年增长 127.5%。并购也显示出类似的增长迹象, 同比增长132.6%。尽管投资构成每年都有所不同,但很明显 组织正在投入越来越多的资金来增强其人工智能能力和地位。 企业投资活动 37.3225.72 43.1 58.18 73.79 145.4 113.01 104.34 151.48 344.66 88.19 24.68 21.89 36.43 39.83 175.36 121.39 82.26 92.19 214.44 14.57 19.04 25.43 33.82 53.72 79.62 103.27 221.87 360.73 253.25 201 253.02 581.69 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 100 200 300 400 500 600 合并/收购 少数股权 民间投资 公开发行 总投资(十亿美元) 按投资活动划分的全球人工智能企业投资,2013-25 来源:Quid,2025 |图:2026年AI指数报告 图4.2.1 ===== 第179页 ===== 179 4.2 投资和基础设施| 经济| 2026 年人工智能指数报告 在更广泛的投资领域,私人投资数据涵盖人工智能和机器学习公司,超过 自 2013 年以来已获得 150 万美元的资金,提供了对哪些公司正在接受资助以及资金来源的详细信息 资金集中。 2025年,全球人工智能私人投资达3447亿美元,增长127.5% 与上年相比(图4.2.2)。其中,生成式人工智能公司产值达 1709 亿美元, 占私人投资总额的近一半,较 2024 年增长超过 200%(图 4.2.3)。 私人投资活动 344.66 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 50 100 150 200 250 300 350总投资(单位:十亿美元) 全球人工智能私人投资,2013–25 来源:Quid,2025 |图:2026年AI指数报告 170.87 2019 2020 2021 2022 2023 2024 2025 0 20 40 60 80 100 120 140 160 总投资(十亿美元) 全球生成式人工智能私人投资,2019–25 来源:Quid,2025 |图:2026年AI指数报告 图4.2.2 图4.2.3 ===== 第180页 ===== 180 4.2 投资和基础设施| 经济| 2026 年人工智能指数报告 民间投资市场的广度不断扩大,但集中度越来越高。虽然绝对 2025年新融资人工智能公司数量增长(同比增长70.8%),分布 资本下降,大部分投资资金流向少数交易(图 4.2.4-4.2.7)。与 2024 年相比,2025 年私人人工智能投资事件平均增长 46% 至 66.5 美元 万。所有融资规模的投资活动均有所增加,但增长最强劲的是高端 其中 28 起事件超过 10 亿美元,高于 2024 年的 15 起。第 4.1 节的时间表指出 其中几轮大型融资,包括 OpenAI 的 400 亿美元融资和 Anysphere 的 23 亿美元融资 估值为 293 亿美元,凸显融资格局日益倾斜。 3,499 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 500 1,000 1,500 人 2,000 2,500 人 3,000 3,500 人 公司数量 2013年全球新融资人工智能公司数量25家 来源:Quid,2025 |图:2026年AI指数报告 图4.2.4 图4.2.5 311 2019 2020 2021 2022 2023 2024 2025 0 50 100 150 200 250 300 350 公司数量 2019-25 全球新融资的生成式人工智能公司数量 来源:Quid,2025 |图:2026年AI指数报告 ===== 第181页 ===== 181 4.2 投资和基础设施| 经济| 2026 年人工智能指数报告 66.52 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 10 20 30 40 50 60 70 平均投资(百万美元) 全球人工智能私人投资事件的平均规模,2013-25 来源:Quid,2025 |图:2026年AI指数报告 图4.2.7 图4.2.6 超过10亿 5亿 – 10亿 1亿 – 5亿 5000万 – 1亿 5000万以下 未公开 总计 融资规模(美元) 15 20 146 197 2,951 209 3,538 2024年 28 30 第286章 第373章 4,464 第324章 5,505 人 2025年 按资金规模划分的全球人工智能私人投资事件, 来源:Quid,2025 |表:2026年AI指数报告 2024 年与 2025 年 ===== 第182页 ===== 182 4.2 投资和基础设施| 经济| 2026 年人工智能指数报告 民间投资地域分布 从投资总额和新出资企业数量来看,民间人工智能投资 仍然高度集中于少数国家。 2025年,美国是全球领先者 总投资额近2859亿美元,是第二高投资额的23.1倍 中国(124亿美元),是英国(59亿美元)投资额的48.5倍(图 4.2.8)。这种差异也体现在创业活动中,美国以 1,953 名新创业者领先 到 2025 年,将资助人工智能公司,而英国和中国分别有 172 家和 161 家(图 4.2.9)。在 在美国,超过一半的私人人工智能投资总额与生成型人工智能相关(1,636 亿美元), 而中国和欧洲的投资总额为47亿美元(图4.2.10)。自 2024 年起,私人人工智能 对美投资增长160.2%,而对华投资增长32.2%,对华投资增长7.2% 欧洲(图4.2.11)。 0.97 1.11 1.20 1.78 1.82 2.03 2.52 3.58 3.89 4.09 4.28 4.36 5.90 12.41 285.88 0 10 20 30 40 50 60 70 80 90 100 110 120 130 140 150 160 170 180 190 200 210 220 230 240 250 260 270 280 290 瑞典 日本 比利时 韩国 新加坡 沙特阿拉伯 澳大利亚 以色列 德国 印度 加拿大 法国 英国 中国 美国 总投资(十亿美元) 2025 年全球人工智能私人投资(按地理区域) 来源:Quid,2025 |图:2026年AI指数报告 33 34 38 38 49 56 59 64 79 84 92 108 161 172 1,953 人 0 100 200 300 400 500 600 700 800 900 1,000 1,100 1,200 1,300 1,400 1,500 1,600 1,700 1,800 1,900 2,000 西班牙 瑞士 澳大利亚 意大利 新加坡 日本 韩国 以色列 加拿大 法国 德国 印度 中国 英国 美国 公司数量 2025 年按地理区域划分的新融资人工智能公司数量 来源:Quid,2025 |图:2026年AI指数报告 图4.2.8 图4.2.9 ===== 第183页 ===== 183 4.2 投资和基础设施| 经济| 2026 年人工智能指数报告 2019 2020 2021 2022 2023 2024 2025 0 20 40 60 80 100 120 140 160 总投资(十亿美元) 1.48,中国 3.21、欧洲 163.64, 美国 按地理区域划分的全球生成式人工智能私人投资,2019-25 来源:Quid,2025 |图:2026年AI指数报告 图4.2.10 图4.2.11 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 50 100 150 200 250 300 总投资(十亿美元) 12.41,中国 20.92,欧洲 285.88, 美国 按地理区域划分的全球人工智能私人投资,2013-25 来源:Quid,2025 |图:2026年AI指数报告 ===== 第184页 ===== 184 4.2 投资和基础设施| 经济| 2026 年人工智能指数报告 4.24 4.73 6.50 7点 8.24 9.09 10.75 15.39 15.57 17.16 18.54 19.59 34.07 131.83 757.27 0 30 60 90 120 150 180 210 240 270 300 330 360 390 420 450 480 510 540 570 600 630 660 690 720 750 780 阿拉伯联合酋长国 瑞士 澳大利亚 日本 瑞典 新加坡 韩国 印度 法国 德国 以色列 加拿大 英国 中国 美国 总投资(十亿美元) 按地理区域划分的全球人工智能私人投资,2013–25(总计) 来源:Quid,2025 |图:2026年AI指数报告 图4.2.12 如前所述,本节中的私人投资数据来自 Quid,并未考虑 为中国等国家提供政府支持的资金。例如,中国政府渠道 通过政府引导基金提供资源,政府引导基金是国家发起的投资基金,旨在 产生财务回报并推进政府的战略重点(Beraja 等人,2024;Luong 等人) 等,2021)。 2000 年至 2023 年间,估计有 9120 亿美元的资金被部署在各个领域 行业,估计有 1840 亿美元分配给人工智能公司。鉴于此,基于比较 仅仅依靠私人投资可能低估了中国投入人工智能的资本数量。 地理集中的趋势也很明显 在更长的时间范围内。自2013年以来,美国 吸引了 7573 亿美元的私人人工智能投资总额, 以1318亿美元遥遥领先于中国(图4.2.12)。其他 累计投资总额显着的国家 包括英国(341 亿美元)、加拿大 (196 亿美元)、以色列(185 亿美元)和德国(17.2 美元) 亿)。同期新增数量 受资助的美国公司远超其他地区 面积,其中5倍于中国,8.4倍 英国的金额(图 4.2.13 和 4.2.14)。美国经济增速继续 增速加快,同比增长77.8% 获得资助的人工智能初创公司数量。 ===== 第185页 ===== 185 4.2 投资和基础设施| 经济| 2026 年人工智能指数报告 141 150 188 216 288 第329章 第444章 第486章 第542章 第552章 第556章 第560章 1,057 人 1,766 8,909 0 500 1,000 1,500 2,000 2,500 3,000 3,500 4,000 4,500 5,000 5,500 6,000 6,500 7,000 7,500 8,000 8,500 9,000 荷兰 西班牙 瑞士 澳大利亚 新加坡 韩国 日本 德国 印度 法国 以色列 加拿大 英国 中国 美国 公司数量 按地理区域划分的新融资人工智能公司数量,2013-25(总计) 来源:Quid,2025 |图:2026年AI指数报告 图4.2.13 图4.2.14 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 500 1,000 1,500 人 2,000 公司数量 161,中国 639,欧洲 1,953, 美国 按地理区域划分的新融资人工智能公司数量,2013 年 – 25 来源:Quid,2025 |图:2026年AI指数报告 ===== 第186页 ===== 186 4.2 投资和基础设施| 经济| 2026 年人工智能指数报告 在美国,资金和创业活动主要集中在少数人手中 状态(图 4.2.15)。 2025 年,加州将达到 2180 亿美元,占美国总收入的 75% 以上 全国总计。科罗拉多州(190 亿美元)、纽约(130 亿美元)和佛罗里达州(60 亿美元)紧随其后 投资。美国一半以上的州获得的私人人工智能投资不到 1 亿美元,并且 包括南达科他州、俄克拉荷马州、阿肯色州和西弗吉尼亚州在内的一些州报告没有映射投资 活动。这些州级数据的基础数据并不详尽,但总体模式是清晰的。 AL 2800 万美元 AK 1100 万美元 AZ 5.04 亿美元 增强现实 CA $218B 一氧化碳 $19B CT 7.41 亿美元 直流 5.33 亿美元 德 $3B FL $6B 遗传算法 $1B 嗨 8600 万美元 身份证号 2600万美元 伊尔 6.96 亿美元 在 8600 万美元 IA 3300万美元 KS 5000万美元 肯塔基州 3400万美元 洛杉矶 1700 万美元 我 2900 万美元 医学博士 4.27 亿美元 硕士 $5B 心肌梗塞 2.39 亿美元 明尼苏达州 3.28 亿美元 多发性硬化症 1.17 亿美元 莫 2.8 亿美元 MT 6300 万美元 东北 4.15 亿美元 内华达州 5.39 亿美元 NH 3600万美元 新泽西州 8.65 亿美元 纳米 3300万美元 纽约 $13B 数控 8.74 亿美元 ND 600 万美元 羟基 7.23 亿美元 好的 或 1.89 亿美元 PA $2B RI 6800 万美元 SC 600 万美元 标清 总氮 3.02 亿美元 TX $5B UT 9.58 亿美元 室速 4000 万美元 VA $2B 西澳 $2B 西弗吉尼亚州 威斯康辛 1.17 亿美元 怀伊 3500万美元 来源:Quid,2025 |图:2026年AI指数报告 无数据 <1亿美元 1 亿美元 5 亿美元 $500M $1B $1B $5B $5B $20B $20B+ 美国人工智能领域的私人投资,2025 年 图4.2.15 ===== 第187页 ===== 187 4.2 投资和基础设施| 经济| 2026 年人工智能指数报告 0 10 20 30 40 50 60 70 80 90 100 110 120 130 140 无人机 教育科技 人力资源技术 营销、数字广告 会计/金融 量子计算 娱乐 法律科技 零售 创意、音乐、视频内容 半导体 能源管理 生物技术 防御 金融科技 机器人技术 自动驾驶汽车 人工智能代理 网络安全、数据保护 云计算 制药 医疗保健 物联网 数据管理、处理 人工智能基础设施/模型/研究/治理 2025年 2024年 总投资(十亿美元) 2024 年与 2025 年全球人工智能私人投资(按重点领域) 来源:Quid,2025 |图:2026年AI指数报告 民间投资重点领域 2025 年,按重点领域划分的私人人工智能初创企业投资细分表明,资本已被定向 更侧重于最接近构建和扩展人工智能系统的领域。 AI基础设施类别, 模型、研究和治理吸引了最大份额的资金,达到 1,432 亿美元(图 4.2.16 和 4.2.17)。由于该类别结合了多种类型的优先事项,因此该趋势最好解释为 有证据表明对人工智能生态系统基础层的投资不断增加,而不是精确的 这些领域中任何一个的衡量标准。近年来,该类别经历了最急剧的增长 与所有其他领域相比,投资方面。其他重点领域也有所扩展,包括数据 管理和处理以及物联网 (IoT),但没有一个能够达到基础的规模 基础设施。 2025 年技术性能趋势(第 2 章)以及研发 (第 1 章),这表明投资正在跟踪部署越来越多的基础设施需求 有能力的人工智能系统。 图4.2.16 ===== 第188页 ===== 188 4.2 投资和基础设施| 经济| 2026 年人工智能指数报告 2018 2022 2025 0 10 20 30 2018 2022 2025 0 50 100 150 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 2018 2022 2025 0 10 20 30 总投资(十亿美元) 人工智能代理 人工智能基础设施/模型/研究/治理* AV 会计/金融 生物技术 云计算 创意、音乐、视频内容 网络安全、数据保护 数据管理、处理国防无人机教育技术 能源管理 娱乐 金融科技 人力资源科技 物联网 法律技术 营销、数字广告 医疗和保健 制药 量子计算 零售机器人 半导体 8.02 143.22 7.94 2.59 4.84 10.31 4.19 8.42 31.58 5.30 1.42 1.44 4.64 3.66 6.52 2.19 14.63 3.79 2.51 11.75 10.58 3.11 4.10 7.84 4.40 按重点领域划分的全球人工智能私人投资,2018-25 来源:Quid,2025 |图:2026年AI指数报告 图4.2.17 ===== 第189页 ===== 189 4.2 投资和基础设施| 经济| 2026 年人工智能指数报告 投资模式显示了资本在人工智能生态系统中的流动方向,但运营经济学 的前沿人工智能公司揭示了技术性能和部署的进步如何转化为 商业规模、计算需求和基础设施建设。使用公开披露的跟踪数据 Epoch AI 提出,本节研究了这些收入轨迹、持续的计算费用以及 支持人工智能发展的基础设施成本。 领先的人工智能公司(包括 OpenAI、Anthropic、xAI 和 Mistral)的年收入预估 人工智能近年来发展迅速(图4.2.18)。这些估计来自直接公司 2023 年至 2025 年的声明或既定媒体报道。它们可能与年度定期报告不同 收入计算,基础数据的可靠性根据来源可信度和 会计实务。因此,这些数字应该被解释为方向性的而非精确的。的 图表使用对数刻度来适应指数增长模式,这意味着直线 代表持续的百分比增长而不是绝对增长。考虑到这些注释,总体 动态表明一小部分前沿人工智能公司在相对较短的时间内达到了有意义的收入规模 时间量。 为了体现这种增长的背景,我们将 OpenAI 的收入轨迹与 年收入突破 10 亿美元后的几年中其他高增长公司(图 4.2.19)。同时 谷歌仍然是比较中唯一一家年收入达到 1000 亿美元的公司, OpenAI 早期收入增长超过 Uber、Cheniere Energy 和 Moderna 期间。 人工智能公司经济学 收入 2022年7月-2022年1月-2023年4月-2023年7月-2023年10月-2023年1月-202年 4 202 年 4 月 4 202 年 7 月 4 202 年 10 月 4 一月-2025年四月-2025年七月-2025十月-2025一月-2026年 1000 万美元 5000万美元 1亿美元 5亿美元 $1B $5B $10B $20B 年化收入(以美元为单位 - 对数刻度) 5300 万美元,Z.ai 4 亿美元,米斯特拉尔 AI 4.28 亿美元,xAI $19B, 人为 $25B, OpenAI AI公司年化营收 来源:Epoch AI,2026 |图:2026年AI指数报告 图4.2.18 ===== 第190页 ===== 190 4.2 投资和基础设施| 经济| 2026 年人工智能指数报告 图4.2.19 图4.2.20 领先的AI公司收入快速增长 随之而来的是计算成本的增加。已报道 年度计算支出,主要反映了租用的 云容量而不是拥有的数据中心,提供了 代表这些公司采购的计算量 每年大规模训练和运行模型(图 4.2.20)。 OpenAI 报告的计算支出增加 从 2024 年到 2025 年,这一数字将显着提高,Anthropic 也是如此。 满足不断增长的商业需求的动力 越来越强大的系统意味着经济 前沿人工智能的发展与大规模计算及其 相关费用。 年度计算支出 1.504 4.10 8.30 1.80 2.70 8 0.42 0.28 2.50 5.80 6.80 16.30 开放人工智能 人择 开放人工智能 人择 开放人工智能 人择 2022 2023 2024 2025 0 2 4 6 8 10 12 14 16 18 未注明 研发 推理 年度计算支出(十亿美元) 精选前沿人工智能公司的年度计算支出 来源:Epoch AI,2026 |图:2026年AI指数报告 ===== 第191页 ===== 191 4.2 投资和基础设施| 经济| 2026 年人工智能指数报告 支持前沿人工智能所需的基础设施不仅由人工智能公司提供资金,还由 向他们租赁计算能力的主要云提供商。这些提供商加速了自己的 支持日益先进的人工智能模型的基础设施投资(图4.2.21)。 2025 年,谷歌 亚马逊在年度资本支出总额 (capex) 方面领先,谷歌报告超过 1500 亿美元 在资本支出中。该基础设施投资见本章的 2025 年时间表,包括 100-500 美元 OpenAI、软银、甲骨文等宣布斥资 10 亿美元的 Stargate 项目,以及谷歌 400 亿美元 对德克萨斯州数据中心的承诺以及微软对印度人工智能基础设施的 175 亿美元投资。 资本支出 自 ChatGPT 发布以来,Hyperscaler 的年度资本支出增加了一倍多 指数视图 w .资料来源:花旗研究部 0 100 2018 2020 2022 2024 2026 200 300 400 亚马逊 年份 甲硫氨酸 谷歌 无国界医生组织 ORCL 图4.2.21 ===== 第192页 ===== 192 4.2 投资和基础设施| 经济| 2026 年人工智能指数报告 亮点: 生成式人工智能有何价值? 投资、收入和计算成本都衡量人工智能对构建和部署公司的价值 它。他们没有捕捉到这项技术对于使用它的人来说有什么价值。对于大多数人来说,生成式人工智能工具 是免费的或接近的,使得它们的经济价值很容易被低估。布林约尔松等人。 (2026)提供 使用 2025 年进行的在线选择实验(N=1,400)对该值进行首次纵向估计 2026 年初(N=2,000)。该研究没有衡量生产力的影响,而是直接询问用户的影响程度 他们愿意接受补偿,以放弃使用所有生成式人工智能工具一个月。这一措施的 “消费者剩余”理论上适用于基本上免费且已经存在于消费者手中的商品。 占有。 研究发现,消费者剩余总额估计已从 1,120 亿美元增至 1,720 亿美元 每年在美国 (4.2.22)。这反映出美国成年人使用生成式人工智能的比例不断增加, 从 48% 增加到 56%(Bick 等人,2026),并且每个用户的价值更高。特别是,平均 美国生成式人工智能用户的消费者剩余从 2025 年的 98 美元增加到 3 月份的 125 美元,增长了 27% 到 2026 年,同期每个用户的中值价值增加了两倍,从 3.40 美元增至 11.40 美元。这一增加 人工智能能力的扩展和深化似乎可以推动采用率和每用户价值 模型。 这一消费者剩余数字使美国人工智能生成收入的估计相形见绌,这表明社会回报 技术带来的回报远远超过生产者获得的私人回报。这个模式符合 Nordhaus (2004) 的研究结果表明,历史上创新者仅从主要领域获得了约 3% 的社会总回报。 技术。作者还发现,使用频率是个人层面最强的盈余预测因素, 其次是工作用途、使用的不同产品的数量以及付费订阅状态。生成式的用法 用于实践指导、技术帮助或信息搜索的人工智能都与更高的盈余相关。 $112B $172B (+53.57%) 2025 2026 0 50B 100B 150B 200B 95M 1.15 亿 (+21.05%) 2025 2026 0 25M 50M 75M 100M 125M 3.4 美元 11.4 美元 (+235.29%) 2025 2026 $0 50 美元 100 美元 150 美元 98 美元 125 美元(+27.55%) 2025 2026 $0 50 美元 100 美元 150 美元 价值 用户 价值 价值 使用生成式人工智能的美国成年人消费者剩余总额 每个用户的消费者剩余中位数 每个用户的平均消费者剩余 2025 年与 2026 年美国生成式人工智能消费者剩余 资料来源:Brynjolfsson 等人,2026 |图:2026年AI指数报告 图4.2.22 ===== 第193页 ===== 193 4.3 企业人工智能采用 4 经济| 2026 年人工智能指数报告 本章前面描述的投资和基础设施活动确定了资源规模 针对人工智能以及正在建设的支持人工智能的能力。本节将探讨这些 投资转化为组织使用和报告的业务成果。借鉴麦肯锡 & 公司年度人工智能状况调查和其他企业衡量标准,分析追踪了人工智能的广度和 采用的深度及其相关的好处。与本章中其他基于调查的数据一样,结果是 自我报告,应被视为方向性而非全面性。 2025 年,组织对人工智能的采用在用途和功能上都继续扩大。绝大多数 的受访者表示,他们的组织至少在一项业务职能中使用人工智能,其中高达 88% 从 2024 年的 78% 到 2025 年(图 4.3.1)。超过一半的受访者报告了三个或更多业务职能 利用人工智能。生成式人工智能的使用反映了这种增长,79% 的受访者表示他们的 组织经常在至少一项业务职能中使用生成式人工智能,而 2024 年这一比例为 71%。 所有地区都扩大了人工智能的采用,但速度不同(图 4.3.2)。中国和 欧洲的同比增幅更高,据报告组织人工智能使用量分别增长 13 和 11 分别为百分点。 行业用途 2017 2018 2019 2020 2021 2022 2023 2024 2025 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 受访者百分比 79%,GenAI 88%,人工智能 表示其组织至少在一项职能中使用人工智能的受访者比例,2017-25 资料来源:麦肯锡公司调查,2025 年 |图:2026年AI指数报告 图4.3.1 ===== 第194页 ===== 194 4.3 企业人工智能采用| 经济| 2026 年人工智能指数报告 88% 82% 91% 90% 88% 88% 78% 72% 80% 82% 75% 77% 55% 58% 57% 61% 48% 49% 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 发展中市场 (包括印度、 中美洲/南美洲, 中东和北非地区) 大中华区 (包括香港、 台湾、澳门) 北美 欧洲 亚太地区 所有地区 2025年 2024年 2023年 受访者百分比 世界各地组织对人工智能的使用,2023-25 资料来源:麦肯锡公司调查,2025 年 |图:2026年AI指数报告 图4.3.2 不同行业和职能的采用模式各不相同,一些行业/职能配对显示出更高的采用率 扩散率高于其他(图 4.3.3)。据报道,人工智能使用率最高的领域是知识管理 商业、法律和专业服务 (58%) 以及软件工程和 IT 技术领域 部门(分别为 58% 和 56%)。紧随其后的是消费品的营销和销售 和零售(51%)。更广泛地说,与信息处理、软件、客户参与和相关的功能 内部知识工作的采用率高于战略、公司财务和风险等领域 和合规性,大多数行业的采用率仍然较低。金融服务业是一个例外;他们 据报告,风险和合规职能的使用率很高,这对于其核心运营来说更为核心。 按行业和功能 ===== 第195页 ===== 195 图4.3.31 1“先进行业”包括来自先进电子、航空航天和国防、汽车和装配等行业的受访者 半导体。 “能源和材料”涵盖农业、化工、电力和天然气、金属和采矿、石油等领域的受访者 和天然气,以及纸张、林产品和包装。 4.3 企业人工智能采用| 经济| 2026 年人工智能指数报告 受访者更常将人工智能与软件工程和软件工程中最高的成本节省联系起来。 制造职能(56%),而收入增长则来自营销和销售(67%)、战略 和企业融资(65%),以及产品和/或服务开发(62%)(图 4.3.4)。跨越更广阔的 组织成果,64% 的受访者表示人工智能的使用改善了创新,并且 45% 的受访者表示员工和客户满意度有所提高(图 4.3.5)。通常,数量 认为人工智能的使用改善了各种组织措施的受访者人数与 谁不相信它有任何效果。总体而言,负面影响的报告频率较低,没有更多 超过 7% 的人认为人工智能的使用使成本指标恶化。 ===== 第196页 ===== 196 4.3 企业人工智能采用| 经济| 2026 年人工智能指数报告 7%8%33% 10%11%24% 7%11%33% 10%10%28% 7%39% 6%8%37% 8%10%36% 6%14%35% 7%45% 8%17%28% 9%8%28% 56% 56% 54% 53% 51% 51% 49% 49% 47% 45% 44% 知识管理 战略和企业财务 制造 软件工程 信息技术 服务运营 供应链管理 产品和/或服务开发 人力资源 风险 营销和销售 10% 14% 43% 10% 15% 38% 5% 11% 42% 5% 16% 36% 5% 18% 30% 9% 13% 35% 12% 22% 31% 67% 65% 62% 59% 57% 57% 52% 减少<10% 减少10%–19% 减少≥20% 增加>10% 增加6%–10% 增加≤5% 功能 2025 年按功能分析人工智能使用的成本下降和收入增加 资料来源:麦肯锡公司调查,2025 年 |图:2026年AI指数报告 受访者百分比 图4.3.4 64% 45% 45% 45% 38% 36% 33% 33% 25% 21% 31% 32% 33% 31% 36% 39% 42% 49% 14% 19% 22% 20% 24% 26% 27% 23% 25% 4% 7% 0% 20% 40% 60% 80% 市场份额变化 吸引和留住人才 有机收入增长 盈利能力 成本 差异化竞争 客户满意度 员工满意度 创新 改善 没有影响 不知道 恶化 受访者百分比 组织措施 过去一年(2025 年)人工智能对组织措施的影响 资料来源:麦肯锡公司调查,2025 年 |图:2026年AI指数报告 图4.3.52 2 这仅包括其组织经常在至少一项业务职能中使用人工智能的受访者。数字加起来可能不等于 100% 舍入的原因。 ===== 第197页 ===== 197 4.3 企业人工智能采用| 经济| 2026 年人工智能指数报告 麦肯锡的调查还揭示了人工智能融入组织运营的深度: 查看部署生命周期的不同阶段(图 4.3.6)。正如预期的那样,考虑到资源和 整合的投资需求,大公司最有可能报告他们的人工智能项目 已达到规模化阶段。 人工智能代理采用的早期指标表明,其扩散仍处于早期阶段。跨越大多数企业 功能,大多数受访者表示根本没有使用代理(图 4.3.7)。规模化使用是在 几乎所有功能都用一位数字表示。即使是最活跃的职能部门,包括 IT 和知识 管理方面,大约三分之二或更多的受访者表示没有用。从产业层面来看,技术 软件工程 (24%)、IT (22%) 和 服务业(21%)(图4.3.8)。报告人工智能代理使用率最高的业务职能 往往与那些采用更广泛、更成熟的人工智能的企业相同。 部署阶段 9% 8% 5% 6% 39% 33% 31% 22% 17% 22% 32% 32% 31% 31% 25% 23% 29% 32% 39% 5% 4% 3% 9% 10% 0% 20% 40% 60% 80% 100% 5B+ 1B–4.9B 500M–999M 100M–499M <100M 不使用试验 试点 扩展 完全扩展 受访者百分比 收入(美元) 2025 年按组织收入划分的人工智能部署阶段 资料来源:麦肯锡公司调查,2025 年 |图:2026年AI指数报告 图4.3.63 3 由于四舍五入,数字相加可能不等于 100%;表示“我不知道”的受访者未显示,但占总数的 <1%,即 也可能导致条形加起来不等于 100%。 ===== 第198页 ===== 198 4.3 企业人工智能采用| 经济| 2026 年人工智能指数报告 图4.3.7 4% 3% 69% 66% 68% 71% 73% 77% 85% 82% 85% 88% 91% 4% 5% 5% 5% 4% 3% 3% 7% 12% 11% 8% 9% 6% 5% 5% 4% 4% 3% 6% 6% 6% 7% 6% 5% 3% 3% 8% 7% 6% 6% 5% 5% 4% 3% 3% 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 制造 供应链/库存管理 战略和企业财务 人力资源 风险 软件工程 产品和/或服务开发 服务运营 营销和销售 知识管理 信息技术 不知道 一点也不 计划在一年内使用 试验 试点 扩展 全面扩展 受访者百分比 功能 2025 年按业务功能划分的 AI 代理使用阶段 资料来源:麦肯锡公司调查,2025 年 |图:2026年AI指数报告 图4.3.84 4 由于四舍五入,数字加起来可能不等于 100%。 ===== 第199页 ===== 199 亮点: 测量 AI 扩散信号 4.3 企业人工智能采用| 经济| 2026 年人工智能指数报告 人工智能的全面经济影响很难通过投资模式或组织采用来评估 独自一人。该评估还需要跟踪扩散情况,或者人工智能工具在各个领域的采用范围。 人口、国家、职业和日常任务。本节汇集了几个互补的 人工智能扩散的信号,包括人口水平调查估计、跨国比较、 历史采用基准和平台级使用数据。一旦结合起来,这些措施将提供 全面了解人工智能融入工作和日常生活的速度。 与早期的变革性技术相比,生成式人工智能近年来的采用速度非常快 进入大众市场后(图 4.3.9)。从每种技术的第一个发布开始衡量 广泛使用的产品,生成式人工智能在三年内达到了约 53% 的采用率,远高于 个人计算机和互联网在可比时间范围内的初始轨迹(Bick 等人, 2024)。这种急剧增长也反映在领先人工智能公司的收入轨迹上,如 第 4.2 节中的公司级收入分析,其中达到商业规模的时间相对较短 时间范围(图 4.3.9)。 0 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 0% 20% 40% 60% 80% 100% 自推出第一个大众市场产品以来已有多年 采用率 技术采用人工智能的速度 资料来源:哈佛大学劳动力项目,2025 |图:2026年AI指数报告 53%,GenAI 69%, 计算机 76%,互联网(来源:CPS) 91%,互联网(来源:国际电联) 图4.3.95 5 来源:https://www.genaiadoptiontracker.com。该图显示了三种技术的总体使用率:生成式人工智能、计算机和 互联网。横轴代表每种技术自推出第一个大众市场产品以来的年数。我们使用 1981 年作为介绍 计算机化年,即 IBM PC 发布的那一年。我们用 1995 年作为互联网的引入年,这一年 NSF 退役了 NSFNet,并允许互联网承载商业流量。我们将 2022 年作为生成式人工智能的引入年, ChatGPT 是在这一年发布的。计算机的数据来源是 CPS 的 1984-2003 年计算机和互联网使用补充。我们绘制 互联网使用的两项估计:CPS 和 ITU 的 2001-2009 年计算机和互联网使用补充。 RPS 和 CPS 的示例全部 年龄 18-64 岁的个人。国际电联的样本是各个年龄段的个人。我们按年汇集 RPS 波。 ===== 第200页 ===== 200 亮点: 4.3 企业人工智能采用| 经济| 2026 年人工智能指数报告 另一个广泛的信号来自基于调查的对各国人工智能使用情况的估计(图 4.3.10)。 采用率差异很大,并且与人均 GDP 呈显着的统计显着正相关关系 (Misra 等人,2025)(图 4.3.11)。大多数高收入经济体的采用率集中在 25% 到 45% 之间,其中 欧洲和北美的平均水平分别达到约 27% 和 22%。使用率较低 据报道,南亚和撒哈拉以南非洲地区的人均国内生产总值也较低。然而,有 GDP 和人工智能采用之间关系的例外情况。阿拉伯联合酋长国和新加坡报告 采用率分别超过 54% 和 61%,远高于其人均 GDP 的预测。一些 美国和丹麦等富裕经济体的跌幅低于趋势。 0%–10% 11%–20% 21%–30% 31%–40% 41%–50% 51%–65% 无可用数据 2025 年下半年人工智能地理区域分布 资料来源:微软人工智能经济研究所,2025 |图:2026年AI指数报告 图4.3.10 图4.3.11 0 20,000 40,000 60,000 80,000 100,000 0% 10% 20% 30% 40% 50% 60% 70% 东亚和太平洋地区 欧洲和中亚 拉丁美洲和加勒比地区 中东和北非 北美 南亚 撒哈拉以南非洲 人均国内生产总值(美元) 人工智能传播 印度 中国 加拿大保加利亚 阿曼 匈牙利 葡萄牙 斯洛文尼亚 意大利 西班牙 芬兰 德国 奥地利 瑞典 英国 新西兰 法国 丹麦 澳大利亚 荷兰 阿拉伯联合酋长国 美国 卡塔尔 挪威 新加坡 瑞士 爱尔兰 2025 年人工智能使用量与各地理区域人均 GDP 的关系 资料来源:微软人工智能经济研究所,2025;世界银行,2025 |图:2026年AI指数报告 ===== 第201页 ===== 201 亮点: 4.3 企业人工智能采用| 经济| 2026 年人工智能指数报告 2025 年上半年至下半年,大多数 30 个经济体中的人工智能采用率均有所增长 (图4.3.12)。韩国涨幅最大,达 4.8%,排名从第 25 位攀升至第 18 位。的 美国尽管在人工智能投资和模型开发方面处于领先地位,但跌至第24位 人口采用率为28.3%。即使使用量增长,美国仍处于较低水平 占全球采用率排名的一半,这与公众对人工智能更加谨慎的态度一致 第9章。 1 1 2 2 3 3 4 4 5 5 6 6 7 7 8 99 8 10 10 11 11 12 12 13 13 14 14 15 15 16 16 17 17 18 1919年 2020年 2121 2222 2323 2424 2525 18 26 26 27 2828 27 29 29 30 30 阿拉伯联合酋长国, 59.40% 新加坡, 58.60 % 挪威, 45.30% 爱尔兰, 41.70% 法国, 40.90% 西班牙, 39.70% 新西兰, 37.60 % 英国, 36.40% 荷兰, 36.30% 卡塔尔, 35.70% 澳大利亚, 34.50% 以色列, 33.90% 比利时, 33.50% 加拿大, 33.50% 瑞士, 32.40% 瑞典, 31.20 % 奥地利, 29.10% 匈牙利, 27.90% 丹麦, 26.60 % 德国, 26.50% 波兰, 26.40% 台湾, 26.40% 美国, 26.30% 捷克共和国, 26.00% 韩国, 25.90% 意大利, 25.80% 芬兰, 25.60 % 保加利亚, 25.40% 约旦, 25.40% 哥斯达黎加, 25.10% 阿拉伯联合酋长国, 64.00% (+4.60%) 新加坡, 60 .90% (+2.30%) 挪威,46.40%(+1.10%) 爱尔兰,44.60 % (+2.90%) 法国, 44.00% (+3.10%) 西班牙,41.80% (+2.10%) 新西兰,40.50%(+2.90%) 英国,38.90% (+2.50%) 荷兰,38.90% (+2.60%) 卡塔尔, 38.30% (+2.60%) 澳大利亚,36.90%(+2.40%) 以色列,36.10%(+2.20%) 比利时, 36.00% (+2.50%) 加拿大, 35.00% (+1.50%) 瑞士,34.80% (+2.50%) 瑞典,33.30%(+2.20%) 奥地利, 31.40% (+2.20%) 匈牙利,29.80% (+1.90%) 丹麦, 28 .70% (+2.10%) 德国,28 .60 % (+2.10%) 波兰, 28 .50% (+2.10%) 台湾,28 .40% (+2.00%) 美国,28 .30% (+2.10%) 捷克共和国, 27.80% (+1.80%) 韩国,30.70%(+4.80%) 意大利,27.80% (+2.00%) 芬兰, 27.30% (+1.70%) 保加利亚, 27.30% (+1.90%) 约旦, 27.00% (+1.60%) 哥斯达黎加,26.50%(+1.40%) 上半场 20 25 下半场 20 25 2025 年上半年与下半年人工智能传播前 30 个地理区域 资料来源:微软人工智能经济研究所,2025 |图:2026年AI指数报告 图4.3.12 ===== 第202页 ===== 第202章 在更细粒度的层面上,来自 Anthropic 人工智能使用指数6的平台级数据提供了采用情况的视图 跨职业和任务(Massenkof 等人,2026)。整个 2025 年,计算机和数学任务 占总体使用量的最大份额,始终占活动的近 40%(图 4.3.13)。教育指导和图书馆任务增长最为显着,从年初的 9% 上升 到 2025 年底,这一数字将增至约 14%。教育环境的增长与 第七章探讨了机构指导和准备程度如何仍然落后于采用。此外,一个 对对话模式的分析揭示了用户与工具交互方式的转变(图 4.3.14)。的 面向自动化的对话的份额,用户指示工具自主完成任务, 从 2025 年初的 41% 上升到 8 月份的 49%。这超越了增强型交互 第一次。然而,到了 11 月,增强型业务已取得进展,占到了 52% 的转换份额。 站。一年中的波动表明以自动化为导向的使用正在变得越来越多 流行,这与组织的早期人工智能代理采用模式一致,如 上一节(图 4.3.8)。 图4.3.137 6 人择人工智能使用指数 (AUI) 通过计算每个地区的人工智能使用率来衡量相对于劳动年龄人口的克劳德使用率 克劳德使用率除以劳动年龄人口(15-64 岁)的比例。 AUI 大于 1 的国家比以前更频繁地使用 Claude 仅根据其工作年龄人口进行预测,而 AUI 小于 1 的人则较少使用它。 7 V1~V4指2025年人类经济指数连续发布四次,分别对应1月、3月、8月、11月 分别是2025年。 亮点: 4.3 企业人工智能采用| 经济| 2026 年人工智能指数报告 1月-25日 3月-25日 8月-25日 否 V-25 0% 10% 20% 30% 40% 1月-25日 3月-25日 8月-25日 否 V-25 0% 2% 4% 6% 8% 10% 1月-25日 3月-25日 8月-25日 否 V-25 0% 5% 10% 15% 1月-25日 3月-25日 8月-25日 否 V-25 0% 2% 4% 6% 8% 1月-25日 3月-25日 8月-25日 否 V-25 0% 2% 4% 6% 1月-25日 3月-25日 8月-25日 否 V-25 0% 2% 4% 6% 1月-25日 3月-25日 8月-25日 否 V-25 0% 2% 4% 1月-25日 3月-25日 8月-25日 否 V-25 0% 2% 4% 使用指数 计算机和数学艺术、设计、娱乐、体育和媒体 教育指导、图书馆工作和行政支持 生命、物理和社会科学商业和金融运营 建筑与工程管理 按职业组划分的任务使用份额,V1–V4 2025 资料来源:人类经济指数,2026 |图:2026年AI指数报告 ===== 第203页 ===== 203 亮点: 4.3 企业人工智能采用| 经济| 2026 年人工智能指数报告 2025年1月-2025年3月-2025年8月-2025年11月-2025年 0% 10% 20% 30% 40% 50% 60% 70% 自动化 增强 协作模式分享 Claude.ai协作模式分享,2025 资料来源:人类经济指数,2026 |图:2026年AI指数报告 41% 42% 49% 45% 55% 55% 47% 52% 图4.3.14 人工智能的传播还受到更广泛的社会态度的影响,包括公众的信任和对人工智能的乐观态度。 技术。第 9 章研究这些趋势,以确定不同地区对人工智能的兴奋程度和接触程度有何不同。 国家以及他们对增加采用的社会经验的建议。 ===== 第204页 ===== 204 4.4 职位 4 经济| 2026 年人工智能指数报告 劳动力市场提供了投资、技术进步和组织采用情况的信号 不断变化的劳动力动态。本节通过工作追踪劳动力市场的需求方 职位和技能要求以及供应方,通过人才流动,然后再检查对 就业成果和员工情绪。该分析来自 Lightcast 的职位发布数据库, LinkedIn 的人才和招聘指标,以及人工智能对劳动力市场影响的最新研究。 各地区人工智能劳动力需求 在Lightcast追踪的国家中,20258年人工智能相关人才的需求持续增长 随着需要人工智能技能的职位列表在整体职位发布中所占的份额继续不断增长(图 4.4.1 和 4.4.2)。尽管大多数国家的需求都达到了新的峰值,但各国的需求强度有所不同。在 2025 年,新加坡以 4.69% 的职位发布需要人工智能技能而领先,其次是香港(3.5%), 卢森堡(3.4%)和西班牙(3.3%)。美国达到 2.6%,其次是智利(2.4%)和 英国(1.9%)。 8 由于数据更新和修订,历史发布计数可能与之前发布的版本有所不同。然而,同比趋势依然存在 与之前的分析一致。请参阅此处了解更多详细信息。 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0.00% 1.00% 2.00% 3.00% 4.00% 5.00% AI 职位发布(占所有职位发布的百分比) 1.93%, 英国 2.41%,智利 2.56%, 美国 2.77%,瑞典 2.87%, 阿拉伯联合酋长国 2.92%, 波兰 3.00%, 加拿大 3.31%, 西班牙 3.43%, 卢森堡 3.48%, 香港 4.69%,新加坡 按特定地理区域划分的人工智能职位发布(占所有职位发布的百分比),2014-25(第 1 部分) 来源:Lightcast,2025 |图:2026年AI指数报告 图4.4.1 ===== 第205页 ===== 205 4.4 就业机会 | 经济| 2026 年人工智能指数报告 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0.00% 1.00% 2.00% 3.00% 4.00% 5.00% AI 职位发布(占所有职位发布的百分比) 0.38%, 克罗地亚 0.81%,新西兰 0.84%, 奥地利 0.99%, 法国 1.04%, 荷兰 1.13%,德国 1.33%, 意大利 1.36%, 比利时 1.38%, 墨西哥 1.59%,瑞士 1.78%,澳大利亚 按特定地理区域划分的人工智能职位发布(占所有职位发布的百分比),2014-25(第 2 部分) 来源:Lightcast,2025 |图:2026年AI指数报告 图4.4.2 在美国,人工智能劳动力需求可以按技能组合进行分类,以揭示劳动力的情况 足迹正在不断演变(图 4.4.3-4.4.8)。到 2025 年,广泛的人工智能和机器学习技能集群仍然是 人工智能职位发布中最常被引用的类别,分别占所有职位发布的 1.7% 和 1.0%。其中 在最热门的专业技能中,Python 出现的频率最高,共有 258,674 篇帖子,相比之下增加了 391% 2013-15 年期间增长近 30%,较 2024 年增长近 30%。增长最快的领域是所需技能 大规模构建和运营系统,雇主的需求反映了更广泛的人工智能投资转向 基础设施和部署能力。与十年相比,亚马逊网络服务显着扩张 之前(+1,358%),同时越来越重视可扩展性(+733%)和工作流程管理(+818%)。 从 2024 年到 2025 年,人工智能职位发布中提到的生成型人工智能技能增长了 111%,尽管它们占总数的比例 AI 职位发布减少了 5%。随着整体人工智能劳动力需求的上升,与人工智能代理相关的新技能群 出现了。从 2024 年到 2025 年,引用代理人工智能、人工智能代理或代理系统的帖子呈指数级增长 增加。提及 ChatGPT、聊天机器人或对话式 AI 的 AI 职位发布比例有所下降,而 引用代理术语或编排框架(例如 LangGraph)的帖子有所增加。职位需求 似乎正在从对基于聊天的工具的普遍熟悉转向协调和协调所需的技能 实施面向任务的系统。 美国的人工智能招聘 技能构成 ===== 第206页 ===== 206 4.4 就业机会 | 经济| 2026 年人工智能指数报告 图4.4.39 9 一个职位发布可以列出多种 AI 技能。 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0.00% 0.20% 0.40% 0.60% 0.80% 1.00% 1.20% 1.40% 1.60% 1.80% AI 职位发布(占所有职位发布的百分比) 0.05%,人工智能道德、治理和法规 0.08%, 机器人 0.09%, 视觉图像识别 0.14%, 自动驾驶 0.20%,神经网络 0.22%,自然语言处理 0.23%,人工智能代理 0.41%,生成式人工智能 0.99%,机器学习 1.70%, 人工智能 美国人工智能职位发布(占所有职位发布的百分比)(按技能类别),2010-25 来源:Lightcast,2025 |图:2026年AI指数报告 9,742 26,767 60,745 65,300 54,942 20,295 26,870 23,727 97,085 52,678 142,037 (+1,358%) 142,120 (+431%) 149,865 (+147%) 151,191 (+132%) 170,396 (+210%) 186,325 (+818%) 190,758 (+610%) 197,744 (+733%) 257,127 (+165%) 258,674 (+391%) 0 50,000 100,000 150,000 200,000 250,000 亚马逊网络服务 数据科学 项目管理 SQL(编程语言) 数据分析 工作流程管理 自动化 可扩展性 计算机科学 Python(编程语言) 2025年 2013–15 AI 职位发布数量 2025 年美国人工智能职位发布的 10 大专业技能,2013 年 – 15 与 2025 年 来源:Lightcast,2025 |图:2026年AI指数报告 图4.4.4 ===== 第207页 ===== 207 4.4 就业机会 | 经济| 2026 年人工智能指数报告 65,557 19,045 6,152 2,885 1,047 1,272 616 625 9 628 138,188 (+111%) 38,526 (+102%) 22,227 (+261%) 12,609 (+337%) 1,900 (+81%) 1,571 (+24%) 1,459 (+137%) 717(+15%) 703 (+7,711%) 699(+11%) 0 20,000 40,000 60,000 80,000 100,000 120,000 140,000 情境工程 稳定扩散 变分自动编码器 多式联运模型 生成对抗网络 文本转语音 (TTS) 检索增强生成 及时工程 大语言建模 生成式人工智能 2025年 2024年 AI 职位发布数量 2024 年与 2025 年美国人工智能职位发布中的生成式人工智能技能 来源:Lightcast,2025 |图:2026年AI指数报告 62.62% (-5%) 17.46% (-9%) 10.07% (+62%) 5.71% (+96%) 0.86% (-18%) 0.71% (-44%) 0.66% (+6%) 0.32% (-48%) 0.32% (+3,412%) 0.32% (-50%) 66.08% 19.20% 6.20% 2.91% 1.06% 1.28% 0.62% 0.63% 0.01% 0.63% 0% 10% 20% 30% 40% 50% 60% 70% 稳定扩散 情境工程 变分自动编码器 多式联运模型 生成对抗网络 文本转语音 (TTS) 检索增强生成 及时工程 大语言建模 生成式人工智能 2025年 2024年 AI 职位发布中的技能比例 (%) 2024 年与 2025 年美国 AI 职位发布中生成型 AI 技能的比例 来源:Lightcast,2025 |图:2026年AI指数报告 图4.4.5 图4.4.6 ===== 第208页 ===== 208 4.4 就业机会 | 经济| 2026 年人工智能指数报告 图4.4.710 10 有关每个技能类别的定义,请参阅 https://lightcast.io/open-skills 上的 Lightcast 分类法或附录。 151 1,310 5,535 5,430 1,416 1,635 2,316 194 第549章 192 16,541 (+10,854%) 15,217 (+1,062%) 14,376 (+160%) 6,976 (+28%) 6,395 (+352%) 5,461 (+234%) 4,596 (+98%) 4,294 (+2,113%) 3,366 (+513%) 2,850 (+1,384%) 0 2,000 4,000 6,000 8,000 10,000 12,000 14,000 16,000 18,000 代理系统 微软副驾驶工作室 郎图 聊天机器人 多代理系统 微软副驾驶 对话式人工智能 人工智能代理 代理人工智能 聊天GPT 2025年 2024年 AI 职位发布数量 2025 年美国人工智能职位发布中的人工智能代理技能 来源:Lightcast,2025 |图:2026年AI指数报告 18.90% (+2,643%) 17.39% (+191%) 16.43% (-35%) 7.97% (-68%) 7.31% (+13%) 6.24% (-16%) 5.25% (-50%) 4.91% (+454%) 3.85% (+54%) 3.26% (+272%) 0.69% 5.98% 25.26% 24.78% 6.46% 7.46% 10.57% 0.89% 2.51% 0.88% 0% 2% 4% 6% 8% 10% 12% 14% 16% 18% 20% 22% 24% 26% 代理系统 微软副驾驶工作室 郎图 聊天机器人 多代理系统 微软副驾驶 对话式人工智能 聊天GPT 人工智能代理 代理人工智能 2025年 2024年 AI 职位发布中的技能比例 (%) 2024 年与 2025 年美国人工智能职位发布中人工智能代理技能的比例 来源:Lightcast,2025 |图:2026年AI指数报告 图4.4.8 ===== 第209页 ===== 209 到 2025 年,所有经济部门对人工智能人才的需求都会增加,但增长速度各不相同(图 4.4.9)。信息行业处于领先地位,人工智能技能在其招聘信息中所占比例从 7.8% 上升至 13.2% 到 2024 年,人工智能发布比例相对较高的其他行业包括专业、科学和技术 服务业(6.5%)、金融和保险(5.3%)以及制造业(4.7%)。 2025年,人工智能招聘规模也扩大 采用率处于历史低位的行业。交通仓储、房地产、教育 显示逐年增长,证据表明扩散正在超越传统技术- 带动产业。 按部门 4.4 就业机会 | 经济| 2026 年人工智能指数报告 0.35% 0.81% 0.99% 1.04% 1.19% 1.74% 1.06% 1.08% 2.03% 2.00% 1.62% 3.35% 3.27% 4.41% 7.82% 0.46% (+30.80%) 1.26% (+55.40%) 1.32% (+33.04%) 1.67% (+60.25%) 1.69% (+41.58%) 1.87% (+7.64%) 1.93% (+83.00%) 2.08% (+93.48%) 2.42% (+19.14%) 2.89% (+44.35%) 3.28% (+102.28%) 4.66% (+39.27%) 5.33% (+62.94%) 6.49% (+47.10%) 13.22% (+69.12%) 0% 1% 2% 3% 4% 5% 6% 7% 8% 9% 10% 11% 12% 13% 14% 15% 废物管理和行政支持服务 运输及仓储 农业、林业、渔业和狩猎 零售贸易 公共行政 采矿、采石以及石油和天然气开采 批发贸易 房地产及租赁 教育服务 公用事业 公司、企业管理 制造 金融保险 专业、科学、技术服务 信息 2025年 2024年 AI 职位发布(占所有职位发布的百分比) 2024 年与 2025 年美国按行业划分的人工智能职位发布(占所有职位发布的百分比) 来源:Lightcast,2025 |图:2026年AI指数报告 图4.4.911 11 图 4.2.9 中的部门分类基于两位 NAICS 代码。有关劳工统计局超级部门的更多信息 和 NAICS 分类,请参阅以下参考资料。 ===== 第210页 ===== 210 4.4 就业机会 | 经济| 2026 年人工智能指数报告 在美国,人工智能劳动力需求仍然高度集中在某些州(图4.4.10) 和 4.4.11)。加利福尼亚州以 170,881 条帖子领先,在 2025 年美国帖子总数中所占份额不成比例。 AI 职位发布(17.2%)。德克萨斯州紧随其后,发布了 80,547 条帖子(占总数的 8.1%),纽约紧随其后,发布了 66,029 条帖子(占总数的 6.6%)。 这三个州约占全国人工智能职位发布的三分之一。这反映了国家层面 前面描述的投资数据显示,人工智能资金也集中在少数几个州,其中以 加利福尼亚州。然而,随着时间的推移,加州占全国总量的份额有所下降,从 2012 年的 25% 以上下降到 尽管国家在人工智能投资集中度方面继续领先,但到 2025 年,这一数字仍将达到 17.9%(图 4.4.12)。 然而,从每个州内人工智能劳动力需求的密度来看,存在高于平均水平的情况 人工智能相对于特定整个就业市场的渗透率(图 4.4.13)。例如,尽管有较小的 华盛顿特区占帖子总数的相对较高比例 6.2%,其次是 特拉华州为 4.4%。从 2024 年到 2025 年,加利福尼亚州、华盛顿州、纽约州和德克萨斯州都继续出现 劳动力市场中人工智能职位发布的增长(图 4.4.14)。 按州 AL 8,893 AK 2,664 AZ 18,929 增强现实 8,182 CA 170,881 一氧化碳 21,690 CT 10,503 德 6,801 FL 39,257 遗传算法 30,415 嗨 3,571 身份证号 7,013 伊尔 44,883 在 11,521 IA 6,658 KS 9,268 肯塔基州 6,649 洛杉矶 6,390 我 5,127 医学博士 19,259 硕士 39,272 心肌梗塞 18,832 明尼苏达州 17,640 多发性硬化症 4,396 莫 12,712 MT 3,410 东北 5,539 内华达州 6,700 NH 4,508 新泽西州 28,693 纳米 5,847 纽约 66,029 数控 29,052 ND 3,212 人 羟基 24,547 好的 6,246 或 12,482 PA 28,284 RI 5,446 SC 8,905 标清 3,477 总氮 13,766 TX 80,547 UT 10,034 室速 4,452 VA 41,950 西澳 39,119 直流 13,587 西弗吉尼亚州 3,307 人 威斯康辛 11,200 怀伊 2,627 来源:Lightcast,2025 |图:2026年AI指数报告 2025 年美国各州人工智能职位发布数量 图4.4.10 图4.4.11 AL 0.89% AK 0.27% AZ 1.90% 增强现实 0.82% CA 17.18% 一氧化碳 2.18% CT 1.06% 德 0.68% FL 3.95% 遗传算法 3.06% 嗨 0.36% 身份证号 0.71% 伊尔 4.51% 在 1.16% IA 0.67% KS 0.93% 肯塔基州 0.67% 洛杉矶 0.64% 我 0.52% 医学博士 1.94% 硕士 3.95% 心肌梗塞 1.89% 明尼苏达州 1.77% 多发性硬化症 0.44% 莫 1.28% MT 0.34% 东北 0.56% 内华达州 0.67% NH 0.45% 新泽西州 2.89% 纳米 0.59% 纽约 6.64% 数控 2.92% ND 0.32% 羟基 2.47% 好的 0.63% 或 1.26% PA 2.84% RI 0.55% SC 0.90% 标清 0.35% 总氮 1.38% TX 8.10% UT 1.01% 室速 0.45% VA 4.22% 西澳 3.93% 直流 1.37% 西弗吉尼亚州 0.33% 威斯康辛 1.13% 怀伊 0.26% 来源:Lightcast,2025 |图:2026年AI指数报告 2025 年美国各州人工智能职位发布百分比 ===== 第211页 ===== 211 4.4 就业机会 | 经济| 2026 年人工智能指数报告 图4.4.12 图4.4.13 AL 1.67% AK 2.20% AZ 2.08% 增强现实 2.52% CA 4.26% 一氧化碳 2.34% CT 1.97% 德 4.43% FL 1.58% 遗传算法 2.44% 嗨 1.94% 身份证号 2.86% 伊尔 2.85% 在 1.42% IA 1.48% KS 2.10% 肯塔基州 1.37% 洛杉矶 1.43% 我 2.51% 医学博士 2.68% 硕士 3.41% 心肌梗塞 1.80% 明尼苏达州 2.18% 多发性硬化症 1.54% 莫 1.58% MT 1.94% 东北 1.96% 内华达州 1.87% NH 1.52% 新泽西州 2.63% 纳米 1.89% 纽约 3.21% 数控 2.07% ND 2.00% 羟基 1.66% 好的 1.39% 或 2.08% PA 1.77% RI 3.11% SC 1.38% 标清 2.18% 总氮 1.61% TX 2.38% UT 2.53% 室速 3.20% VA 3.32% 西澳 4.03% 直流 6.18% 西弗吉尼亚州 1.72% 威斯康辛 1.32% 怀伊 2.83% 来源:Lightcast,2025 |图:2026年AI指数报告 2025 年美国各州人工智能职位发布百分比 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0% 5% 10% 15% 20% 25% 美国人工智能职位发布的百分比 3.93%, 华盛顿 6.64%, 纽约 8.10%,德克萨斯州 17.18%,加利福尼亚州 美国部分州的人工智能职位发布百分比,2010-25 来源:Lightcast,2025 |图:2026年AI指数报告 ===== 第212页 ===== 212 4.4 就业机会 | 经济| 2026 年人工智能指数报告 图4.4.14 LinkedIn 的招聘和人才数据提供了人工智能劳动力需求如何改变实际劳动力的观点。 练习。在大多数国家,人工智能招聘率在 2025 年超过了总体招聘增长(图 4.4.15 和 4.4.16)。 印度尼西亚的人工智能招聘相对增长率最高,达到 31.7%,其次是克罗地亚(27.8%)和比利时 (21.5%)。自 2018 年以来,许多国家呈现出人工智能雇佣率持续超过一般劳动力的模式 市场增长。然而,也有一些例外,例如冰岛和瑞典,这些国家的人工智能招聘增长 落后于大盘。 人工智能招聘 9.96% 10.18% 11.29% 11.40% 11.82% 12.32% 14.58% 14.69% 15.62% 16.50% 17.13% 17.26% 21.49% 27.80% 31.74% 0% 5% 10% 15% 20% 25% 30% 35% 罗马尼亚 加拿大 奥地利 荷兰 土耳其 波兰 新西兰 希腊 卢森堡 捷克共和国 塞浦路斯 哥斯达黎加 比利时 克罗地亚 印度尼西亚 相对人工智能招聘率同比比率 2025 年人工智能与按地理区域划分的总体招聘率增长 来源:LinkedIn,2025 |图:2026年AI指数报告 图4.4.1512 12 为简洁起见,可视化仅包含该指标排名前 15 的国家/地区。 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0.00% 0.50% 1.00% 1.50% 2.00% 2.50% 3.00% 3.50% 4.00% 4.50% 美国各州发布的人工智能职位比例 2.38%,德克萨斯州 3.21%, 纽约 4.03%, 华盛顿 4.26%,加利福尼亚州 美国各州在人工智能方面的职位发布比例(按美国部分州划分),2010-25 来源:Lightcast,2025 |图:2026年AI指数报告 ===== 第213页 ===== 213 4.4 就业机会 | 经济| 2026 年人工智能指数报告 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 2018 2022 2025 −50% 0% 50% 100% 相对人工智能招聘率同比比率 阿根廷 澳大利亚 奥地利 比利时 巴西 加拿大 智利 哥斯达黎加 克罗地亚 塞浦路斯 捷克共和国 丹麦 爱沙尼亚 芬兰 法国 德国 希腊 香港 冰岛 印度 印度尼西亚 爱尔兰 以色列 意大利 立陶宛 卢森堡 墨西哥 荷兰 新西兰 挪威 波兰 葡萄牙 罗马尼亚 沙特阿拉伯 新加坡 斯洛文尼亚 南非 韩国 西班牙 瑞典 瑞士 土耳其 阿拉伯联合酋长国 英国 美国 乌拉圭 1.91% 0.37% 11.29% 21.49% 7.96% 10.18% 7.53% 17.26% 27.80% 17.13% 16.50% 3.76% -20.26% 7.47% 9.06% 7.83% 14.69% 9.89% -10.90% 4.43% 31.74% 2.75% 6.38% 9.00% -1.33% 15.62% 9.02% 11.40% 14.58% 5.66% 12.32% 2.11% 9.96% 5.53% 7.76% -5.33% 9.64% 9.93% 4.69% -11.56% 1.61% 11.82% 8.63% 6.90% 8.97%-0.37% 人工智能与按地理区域划分的总体招聘率增长,2018-25 来源:LinkedIn,2025 |图:2026年AI指数报告 图4.4.16 ===== 第214页 ===== 214 4.4 就业机会 | 经济| 2026 年人工智能指数报告 图4.4.2113 图4.4.2214 13 为简洁起见,可视化仅包含该指标排名前 15 的国家/地区。 14 为简洁起见,可视化仅包含该指标排名前 15 的国家/地区。 人才数据有助于显示人工智能能力在哪里积累以及人工智能劳动力如何分布 全球。本节回顾了LinkedIn对各国人工智能人才集中度的衡量标准以及 人才的跨境流动。 2025 年,以色列是人工智能人才最集中的国家 LinkedIn 会员(2.1%),其次是新加坡(1.8%)和卢森堡(1.6%)(图 4.4.21 和 4.4.22)。 然而,阿拉伯联合酋长国、印度和沙特阿拉伯的人工智能份额增长最快 2019 年至 2025 年间,人才增长均超过 100%。同一时期内,所有国家 样本中AI人才集中度增长了至少75%。 人工智能人才集中 2.10% 1.82% 1.60% 1.31% 1.25% 1.23% 1.15% 1.15% 1.10% 1.05% 1.05% 1.01% 1.01% 1.00% 0.95% 0.00% 0.50% 1.00% 1.50% 2.00% 塞浦路斯 波兰 加拿大 印度 韩国 荷兰 立陶宛 德国 爱沙尼亚 芬兰 瑞士 爱尔兰 卢森堡 新加坡 以色列 AI人才集中 2025 年人工智能人才地理区域集中度 来源:LinkedIn,2025 |图:2026年AI指数报告 75% 76% 77% 82% 89% 89% 90% 93% 107% 108% 111% 112% 113% 120% 121% 0% 30% 60% 90% 120% 土耳其 阿根廷 西班牙 智利 哥斯达黎加 丹麦 乌拉圭 冰岛 巴西 印度尼西亚 葡萄牙 塞浦路斯 沙特阿拉伯 印度 阿拉伯联合酋长国 人工智能人才集中度变化百分比 来源:LinkedIn,2025 |图:2026年AI指数报告 人工智能人才集中度百分比变化 地理区域,2019 年与 2025 年 ===== 第215页 ===== 215 4.4 就业机会 | 经济| 2026 年人工智能指数报告 0.17 0.23 0.45 0.62 0.90 1.04 1.14 1.22 1.23 1.36 1.72 1.77 1.79 4.40 5.23 0.00 0.50 1.00 1.50 2.00 2.50 3.00 3.50 4.00 4.50 5.00 德国 西班牙 丹麦 塞浦路斯 奥地利 英国 香港 美国 加拿大 新加坡 瑞士 沙特阿拉伯 澳大利亚 阿拉伯联合酋长国 卢森堡 人工智能人才净迁移(每万名 LinkedIn 会员) 2025 年每 10,000 名 LinkedIn 会员(按地理区域划分)的人工智能人才净迁移量 来源:LinkedIn,2025 |图:2026年AI指数报告 迁移模式显示了人工智能人才在全球范围内的动态重新分配(图4.4.23和4.4.24)。 2025年, 与其他追踪国家相比,卢森堡的净流入量最高,为每 10,000 人 5.23 人 LinkedIn 成员,因为较小的经济体积极尝试吸引更多的人工智能工人。美国是一张网 每 10,000 名 LinkedIn 会员中就有 1.2 名人工智能人才引进。与技能渗透类似,性别代表性 人工智能人才仍然参差不齐。在所调查的国家中,男性仍然占大多数 人工智能人才,通常在 65% 到 75% 之间(图 4.4.25 和 4.4.26)。性别比例在很大程度上 尽管人工智能劳动力不断扩大,但自 2016 年以来一直持平。在美国,女性占 34.3% 人工智能人才的比例高于男性 65.7% 的比例。其他主要劳动力市场,包括英国, 加拿大、法国和新加坡也表现出类似的差异。 图4.4.2315 15 为简洁起见,可视化仅包含该指标排名前 15 的国家/地区。 ===== 第216页 ===== 216 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2 3 2021 2023 2025 −1 0 1 2 3 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2021 2023 2025 −2−10123 2021 2023 2025 −1 0 1 2 3 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2021 2023 2025 0 4 8 12 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2021 2023 2025 −2 0 2 4 6 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2 3 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2 3 2021 2023 2025 −4 −3 −2 −1 0 2021 2023 2025 −1 0 1 2021 2023 2025 −2 −1 0 1 2021 2023 2025 −1 0 1 2021 2023 2025 −2 0 2 2021 2023 2025 −2 0 2 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2 2021 2023 2025 4 6 8 10 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2 3 2021 2023 2025 −1 0 1 2 3 2021 2023 2025 −3 −2 −1 0 1 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 2021 2023 2025 −101234 2021 2023 2025 −1 0 1 2021 2023 2025 0 2 4 6 8 2021 2023 2025 0 2 2021 2023 2025 −1 0 1 2021 2023 2025 −1 0 1 阿根廷 澳大利亚* 奥地利* 比利时 巴西 保加利亚* 加拿大* 智利 哥斯达黎加 克罗地亚 塞浦路斯* 捷克共和国 丹麦 爱沙尼亚* 芬兰 法国 德国* 希腊 香港* 匈牙利* 冰岛 印度* 印度尼西亚 爱尔兰* 以色列* 意大利 拉脱维亚 立陶宛* 卢森堡* 墨西哥 荷兰 新西兰 挪威 波兰 葡萄牙 罗马尼亚 沙特阿拉伯* 新加坡* 斯洛伐克* 斯洛文尼亚 南非 韩国 西班牙 瑞典 瑞士* 土耳其 阿拉伯联合酋长国* 英国* 美国 乌拉圭 0.01 1.77 1.50 0.25 -0.05 -1.04 0.07 -0.07 -0.02 -0.07 2.93 0.46 0.83 -0.51 0.66 0.16 1.09 -0.37 1.76 -2.74 0.75 -1.28 -0.09 2.48 -1.01 -0.21 0.11 0.74 7.76 -0.07 0.24 -0.06 0.28 0.49 0.20 -0.06 2.02 0.90 -1.78 0.09 -0.02 -0.35 0.54 0.08 2.45 -0.30 6.52 0.62 0.92 0.16 人工智能人才净迁移(每万名 LinkedIn 会员) 按地理区域划分的每 10,000 名 LinkedIn 会员的人工智能人才净迁移量,2021–25 来源:LinkedIn,2025 |图:2026年AI指数报告 图4.4.2416 16 星号表示某个国家/地区的 y 轴标签的缩放比例与其他国家/地区的 y 轴标签不同。 4.4 就业机会 | 经济| 2026 年人工智能指数报告 ===== 第217页 ===== 217 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 2016 2020 2025 0% 50% 100% 男 女 阿根廷 澳大利亚 奥地利 比利时 巴西 加拿大 智利 哥斯达黎加 克罗地亚 塞浦路斯 捷克共和国 丹麦 爱沙尼亚 芬兰 法国 德国 香港 印度 爱尔兰 以色列 意大利 立陶宛 卢森堡 墨西哥 荷兰 新西兰 挪威 波兰 葡萄牙 罗马尼亚 沙特阿拉伯 新加坡 南非 西班牙 瑞典 瑞士 土耳其 阿拉伯联合酋长国 英国 美国 乌拉圭 29.46% 70.54% 32.26% 67.74% 26.35% 73.65% 26.07% 73.92% 23.41% 76.59% 32.72% 67.28% 23.73% 76.27% 32.66% 67.34% 36.55% 63.45% 28.76% 71.24% 28.15% 71.85% 26.97% 73.03% 35.76% 64.24% 37.47% 62.53% 31.02% 68.98% 25.08% 74.92% 33.95% 66.05% 30.64% 69.36% 32.12% 67.88% 26.41% 73.59% 35.48% 64.52% 33.74% 66.26% 29.86% 70.14% 26.88% 73.12% 29.06% 70.94% 35.06% 64.94% 28.42% 71.58% 34.00% 66.00% 30.40% 69.60% 42.04% 57.96% 33.22% 66.78% 38.01% 61.99% 37.31% 62.69% 29.06% 70.94% 29.62% 70.38% 26.49% 73.51% 29.20% 70.80% 30.09% 69.91% 30.25% 69.75% 34.26% 65.74% 29.10% 70.90% 按性别和地理区域划分的人工智能人才代表性,2016-25 来源:LinkedIn,2025 |图:2026年AI指数报告 AI人才代表 图4.4.25 4.4 就业机会 | 经济| 2026 年人工智能指数报告 ===== 第218页 ===== 218 2016 2020 2025 0.00% 0.20% 0.40% 2016 2020 2025 0.00% 0.50% 1.00% 2016 2020 2025 0.00% 0.50% 1.00% 2016 2020 2025 0.00% 0.50% 1.00% 2016 2020 2025 0.00% 0.20% 0.40% 2016 2020 2025 0.00% 0.50% 1.00% 1.50% 2016 2020 2025 0.00% 0.20% 0.40% 0.60% 2016 2020 2025 0.00% 0.50% 1.00% 2016 2020 2025 0.00% 0.50% 1.00% 2016 2020 2025 0.00% 0.50% 1.00% 1.50% 2016 2020 2025 0.00% 0.50% 1.00% 1.50% 2016 2020 2025 0.00% 0.50% 1.00% 1.50% 2016 2020 2025 0.00% 1.00% 2.00% 2016 2020 2025 0.00% 1.00% 2.00% 2016 2020 2025 0.00% 0.50% 1.00% 2016 2020 2025 0.00% 0.50% 1.00% 1.50% 2016 2020 2025 0.00% 0.50% 1.00% 2016 2020 2025 0.00% 0.50% 1.00% 2016 2020 2025 0.00% 1.00% 2.00% 2016 2020 2025 0.00% 2.00% 4.00% 2016 2020 2025 0.00% 0.20% 0.40% 0.60% 2016 2020 2025 0.00% 1.00% 2.00% 2016 2020 2025 0.00% 1.00% 2.00% 2016 2020 2025 0.00% 0.20% 0.40% 2016 2020 2025 0.00% 0.50% 1.00% 1.50% 2016 2020 2025 0.00% 0.50% 1.00% 2016 2020 2025 0.00% 0.50% 1.00% 2016 2020 2025 0.00% 0.50% 1.00% 1.50% 2016 2020 2025 0.00% 0.50% 1.00% 2016 2020 2025 0.00% 0.50% 1.00% 2016 2020 2025 0.00% 0.50% 2016 2020 2025 0.00% 1.00% 2.00% 2016 2020 2025 0.00% 0.20% 0.40% 2016 2020 2025 0.00% 0.50% 1.00% 2016 2020 2025 0.00% 0.50% 1.00% 1.50% 2016 2020 2025 0.00% 1.00% 2.00% 2016 2020 2025 0.00% 0.20% 0.40% 2016 2020 2025 0.00% 0.50% 2016 2020 2025 0.00% 0.50% 1.00% 1.50% 2016 2020 2025 0.00% 0.50% 1.00% 2016 2020 2025 0.00% 0.20% 0.40% 男性 女 阿根廷 澳大利亚 奥地利 比利时 巴西 加拿大 智利 哥斯达黎加 克罗地亚 塞浦路斯 捷克共和国 丹麦 爱沙尼亚 芬兰 法国 德国 香港 印度 爱尔兰 以色列 意大利 立陶宛 卢森堡 墨西哥 荷兰 新西兰 挪威 波兰 葡萄牙 罗马尼亚 沙特阿拉伯 新加坡 南非 西班牙 瑞典 瑞士 土耳其 阿拉伯联合酋长国 英国 美国 乌拉圭 0.17% 0.40% 0.60% 1.10% 0.53% 1.10% 0.42% 0.94% 0.13% 0.41% 0.68% 1.25% 0.17% 0.50% 0.50% 0.91% 0.49% 0.83% 0.67% 1.36% 0.51% 1.16% 0.54% 1.25% 0.86% 1.60% 0.86% 1.82% 0.52% 1.04% 0.71% 1.46% 0.61% 1.14% 1.09% 1.04% 0.88% 1.64% 1.78% 3.15% 0.31% 0.57% 0.80% 1.56% 1.12% 1.99% 0.19% 0.42% 0.72% 1.36% 0.52% 0.88% 0.47% 0.88% 0.69% 1.34% 0.39% 0.84% 0.53% 0.81% 0.76% 0.48% 1.55% 2.13% 0.27% 0.44% 0.40% 0.89% 0.61% 1.23% 0.78% 1.65% 0.33% 0.40% 0.68%0.72% 0.63% 1.18% 0.59% 1.12% 0.16% 0.41% 按性别和地理区域划分的人工智能人才集中度,2016-25 来源:LinkedIn,2025 |图:2026年AI指数报告 AI人才集中 图4.4.26 4.4 就业机会 | 经济| 2026 年人工智能指数报告 ===== 第219页 ===== 219 技能需求和人才流动的变化正在通过推动变革来重塑工作的组织方式。 生产力和招聘。越来越多的学术研究已经开始衡量人工智能在以下领域的影响: 在微观层面,检查个体工人如何使用人工智能工具执行工作,在宏观层面, 研究人工智能的采用如何影响总体生产力和就业数据。在某些设置中, 人工智能提高了生产力,特别是对于结构化、语言繁重或有明确支持的任务 反馈循环。在其他情况下,当工具与任务不匹配时,收益是微不足道的,甚至是负的。 早期的宏观证据表明,生产率的提高可能需要更长的时间才能实现,而且劳动力 市场成本可能会不成比例地落在初级和初级工人身上。几位知名人士的调查结果 下表总结了研究;与任何新兴研究领域一样,结果因方法而异, 范围和背景。 微观层面的研究 越来越多的研究着眼于人工智能工具如何影响各个领域的个体工人生产力 职业(图4.4.27)。结果总体上是积极的,但规模和分布 收益各不相同。最明显的影响是支持工作、软件开发和营销。客户 使用对话式 AI 助手的支持代理每小时解决的问题数量增加了 14%–15%(Brynjolfsson 等人) al., 2025),使用 GitHub Copilot 的软件开发人员完成的拉取请求多了 26% (Cui et al., 2025), 使用多模式 AI 进行广告创作的营销团队发现,每位员工的产出增加了 50%(Ju 和 咸海,2025)。其中几项研究的一个一致发现是,经验不足的工人 往往受益最多,这表明人工智能工具可能有助于缩小现有的技能差距。 结果并不都是积极的,对于需要更深入推理或判断的工作,一些研究 发现人工智能工具几乎没有带来什么好处,甚至减慢了工作人员的速度。最广泛引用的例子 来自模型评估和威胁研究 (METR),该研究发现经验丰富的开源 开发人员在使用 AI 辅助时速度变慢了 19%,而且帮助程度之间存在脱节 开发人员认为这些工具以及它们的实际性能如何(Becker 等人,2025)。然而, METR 团队未能在后来的研究中复制结果,主要是由于越来越不情愿 开发人员在没有人工智能的情况下工作,并且 2025 年末开发人员可能会因人工智能相对而加速 至原来的学习期限。研究表明,在考察对技能发展的长期影响时 结果好坏参半。严重依赖人工智能学习的软件工程师没有表现出可测量的速度 进步并面临研究人员所说的“学习惩罚”(Shen 和 Tamkin,2025)。总体而言,人工智能 生产力的影响高度依赖于环境。当工作可以分为以下几部分时,收益最大 明确定义、可重复的任务以及清晰的质量监控。 人工智能对劳动力的影响 生产力趋势 4.4 就业机会 | 经济| 2026 年人工智能指数报告 ===== 第220页 ===== 220 4.4 就业机会 | 经济| 2026 年人工智能指数报告 研究谁受益最大? 职业AI应用变化 生产力 雷默斯和沃尔德福格尔 (2026) 沉和塔姆金 (2025) 贝克尔等人。 (2025) 布林约尔松等人。 (2025) 崔等人。 (2025) 朱与咸海 (2025) 蔡与谢 (2025) 作者 软件 工程师 开发商 支持代理商 软件 开发商 营销团队 会计师 内容法学硕士 学习新知识 图书馆 开源工具 会话型 助理 GitHub 副驾驶 多模式广告 创造 基于人工智能 会计 +200% (输出量;释放 三倍) 0% (统计上不显着 速度变化) -19% (速度;开发人员 使用人工智能变得更慢) +14%–15% (效率;问题已解决 每小时) +26% (输出;完成拉取 要求) +50% (产出;每人的生产率 工人) +55% (吞吐量;每周客户 支持) 新进入者(推动数量);预人工智能 作者(保持质量) 使用 AI 的高分者 (65%+) 概念探究,避免“学习” 处罚” 无(感知之间存在显着差距 帮助和实际表现) 经验/技术较差的代理(30%– 35% 收益) 初级和经验不足的工人 人类-人工智能团队(将焦点从社交转移 协调任务执行) 经验丰富的会计师(使用AI配置- 得分以达到监督目标) 图4.4.27 宏观研究 从宏观层面来看,证据更早且结论性较差,但有迹象表明人工智能已经开始 登记汇总生产率数据(图 4.2)。一项针对 12,000 家欧洲公司的研究发现,人工智能的采用 通过培训强化成果,劳动生产率提高了 4%(Aldasoro 等,2026)。在 美国2025年生产率增长达到2.7%,几乎是此前平均水平1.4%的两倍 十年。 Brynjolfsson(2026)解释说,这可能反映了“J 曲线”的早期阶段,组织在该阶段 在生产力大幅提升之前,先吸收采用人工智能的成本。同样, 经合组织对七国集团经济体的预测预计年生产率将提高 0.2 至 1.3 个百分点 未来十年(Filippucci 等,2025)。正如前面提到的,证据既不是决定性的,也不是 这一切都是积极的。对四个国家 6,000 名高管进行的调查发现,采用率很高,但应用程度极低 未来三年实现生产率提高,预计就业人数减少 0.7%(Yotzov 等,2026)。采用率和可衡量影响之间的差距可能是因为人工智能仍处于早期阶段 组织集成,如本章前面通过部署阶段数据所示。步伐 这些回报何时实现将继续是一个需要追踪的重要指标。 ===== 第221页 ===== 221 研究生产力/就业 影响范围洞察力 阿尔达索罗等人。 (2026) 约佐夫等人。 (2026) 布林约尔松 (2026) 菲利普奇等人。 (经合组织, 2025) 弗兰克等人。 (2026) 布林约尔松等人。 (2025) 胡赛尼·马苏姆和 利希廷格 (2025) 圣路易斯联储 (2025) 宾大沃顿商学院预算 型号(2025) 12,000 欧洲人 企业 (2019–2024) 6,000 高管(美国、 英国、德国、澳大利亚) 美国 经济 七国集团经济体 (10年范围) LinkedIn 个人资料和 美国失业率 保险记录 美国薪资数据 (ADP)通过 2025年 6200万 工人/285,000 美国公司 美国一般劳工 市场 美国经济 劳动生产率提高+4%; +5.9 每花费 1% 即可获得百分点收益 关于训练。 人工智能的采用提高了效率而不降低 - 短期就业;显着训练 提升收益。 代表性调查显示采用率很高,但 迄今为止对生产力的实际影响最小。 产出与劳动力投入的“脱钩”即将到来 布莱;通过“J 曲线”假设构建。 基于部门的预计年度收益 专业化(例如,金融/ICT 专业较高, 制造)。 受人工智能影响的劳动力市场恶化 (失业风险)始于 2022 年初,预 聊天GPT。 “煤矿里的金丝雀”:大量就业 暴露领域的初级工人数量下降。 “有资历的技术变革”;人工智能 替代初级劳动力,同时留下高级劳动力 角色完好无损。 基于自重的粗略计算 节省移植时间。 预测人工智能目前对全要素的贡献 生产力(TFP)。 预计生产率提高 1.4%; +0.8% 预计产量增加;预计-0.7% 就业减少(未来 3 年)。 2025 年美国生产率增长 2.7% (几乎是 1.4% 年均增长率的两倍 前十年)。 +0.4 至 +1.3 pp(美国/英国) vs. +0.2 至 +0.8 百分点(意大利/日本)每年 劳动生产率的增长。 与人工智能相关的角色的进入率为负。 职业生涯早期就业率 -15% 至 -16% 工人。 初级就业人数急剧下降驱动 通过放慢招聘速度。 劳动生产率提高 1.1% 至 1.3%。 +0.01 个百分点的贡献 TFP(可忽略不计)。 4.4 就业机会 | 经济| 2026 年人工智能指数报告 图4.4.28 衡量人工智能对就业的影响具有挑战性,特别是因为该技术仍处于发展阶段。 广泛部署的早期阶段。到目前为止,对劳动力的影响似乎不均衡,最初 出现在招聘渠道、年轻员工以及特定业务职能中。证据 并不指广泛、均匀的位移。公司层面的调查数据确实表明许多组织 预计明年劳动力变化的步伐将会加快。根据麦肯锡的调查, 受访者还预计来年的裁员人数将超过过去报告的人数 年。 (图4.4.30和图4.4.31)。 软件开发人员和客户服务角色的最新就业数据揭示了代际模式 (Brynjolfsson 等人,2025)。在美国,这两个职业的标准化员工人数趋势表明: 自 2022 年以来,最年轻工人(22-25 岁)的就业人数有所下降,尽管年长工人的人数 年龄组继续增长(图4.4.29)。到 2025 年 9 月,软件开发人员的就业年龄 22-25 比 2022 年的峰值下降了近 20%。 劳动力影响 ===== 第222页 ===== 222 4.4 就业机会 | 经济| 2026 年人工智能指数报告 图4.4.29 当职业按照人工智能的接触程度进行分组时,基于年龄的模式成立(图 4.4.30)。其中 在 22 至 25 岁的工人中,最受人工智能影响的职业的就业率相对于其他职业下降了约 16% 在控制了公司类型效应后,暴露程度最低,这将人工智能暴露与更广泛的冲击隔离开来,例如 利率压力或行业放缓。差距从 2024 年中期开始扩大并稳步增长 自从。 202 年 1 月 1 202年5月 1 202 年 9 月 1 一月-2022五月-2022 9月-2022年1月-2023年5月-2023年 2023 年 9 月 202 年 1 月 4 202年5月 4 202 年 9 月 4 一月-2025五月-2025 2025 年 9 月 −16 −14 −12 −10 −8 −6 −4 −2 0 2 Estimated % dier ence in headcount (Q5 vs. Q1) 高人工智能暴露工作的员工人数趋势(职业生涯早期 22-25),2021-25 Source: Brynjolfsson et al., 2025 |图:2026年AI指数报告 202 年 1 月 1 202年5月 1 202 年 9 月 1 一月-2022五月-2022 九月-2022年一月-2023年五月-2023年 2023 年 9 月 202 年 1 月 4 202年5月 4 202 年 9 月 4 一月-2025五月-2025 2025 年 9 月 0.80 0.85 0.90 0.95 1.00 1.05 1.10 1.15 202 年 1 月 1 202年5月 1 202 年 9 月 1 一月-2022五月-2022 九月-2022年一月-2023年五月-2023年 2023 年 9 月 202 年 1 月 4 202年5月 4 202 年 9 月 4 一月-2025五月-2025 2025 年 9 月 0.80 0.85 0.90 0.95 1.00 1.05 1.10 1.15 职业生涯早期 1 (22–25) 职业生涯早期 2 (26–30) 职业发展阶段 (31–34) 职业生涯中期 1 (35–40) 职业生涯中期 2 (41–49) 高级 (50+) 标准化员工人数 标准化员工人数 软件开发商 客户支持代理 2021-25 年软件开发人员和客户服务代理按年龄组划分的标准化员工人数趋势 Source: Brynjolfsson et al., 2025 |图:2026年AI指数报告 图4.4.3017 17 该数字包括按时间划分的公司固定效应(公司内部、同期比较),考虑了公司/行业招聘波动。 ===== 第223页 ===== 223 4.4 就业机会 | 经济| 2026 年人工智能指数报告 失业数据表明存在更为复杂的动态(Felten 等人,2021 年;Eckhardt 和 Goldschlag,2025)(图 4.4.31)。从 2022 年到 2025 年初,所有职业群体的失业率都上升 无论人工智能暴露程度如何。而最受人工智能影响的工人的失业率(五分之一) 增加了 0.30 个百分点,其中暴露程度最低的工人(五分位数 1)的增幅更大,上升了 0.94个百分点。仅人工智能的接触似乎并没有推动最近的失业趋势,但它 似乎在更广泛的宏观经济条件和组织变革中发挥了作用。 从专业引入后的职业流失趋势来看,出现了不同的观点 技术(图4.4.32)。在可比较的时间范围内,美国的职业组合 自从引入生成式人工智能以来,这种转变比引入人工智能之后的转变更快 计算机或互联网(Gimbel 等人,2025)。 按人工智能暴露五分位数划分的失业率 资料来源:Eckhardt 和 Goldschlag,2025 图4.4.31 ===== 第224页 ===== 224 4.4 就业机会 | 经济| 2026 年人工智能指数报告 职业组合较近期基线的变化 资料来源:Gimbel 等人,2025 图4.4.32 然而,雇主的预期似乎表明这一步伐可能会加快(图4.4.33)。根据 根据麦肯锡的调查(2025 年),三分之一的受访者预计劳动力规模将减少,百分比 与规模较小的组织相比,大型组织的比例更高(收入≥10 亿美元的组织为 35%) 公司(收入低于 10 亿美元的组织占 30%)。大多数受访者(总体 43%)期望很少或没有 变化,而只有少数人预计劳动力规模会增加。即使与劳动力变化相比 由于上述情况已经发生,总体情绪倾向于裁员(图 4.4.34)。 在几乎所有职能部门中,受访者预计明年人工智能对员工人数的影响将比去年更大 过去一年中观察到的情况,预期下降幅度超过观察到的下降幅度。这种趋势尤其 在服务运营、供应链/库存管理、营销和销售以及软件方面表现突出 工程,明年的员工预期减少量大大超过实际 与过去一年相比有所减少。相反,对劳动力增长的预期仍然相对较高 跨业务职能适度。 ===== 第225页 ===== 225 4.4 就业机会 | 经济| 2026 年人工智能指数报告 4% 5% 8% 8% 8% 20% 25% 17% 43% 38% 47% 9% 9% 8% 12% 14% 10% 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 收入低于 10 亿美元的组织 收入 >= 10 亿美元的组织 整体 减少 >20% 减少 11%–20% 减少 3%–10% 变化很小或没有变化 增加 3%–10% 增加 11%–20% 增加 >20% 不知道 明年人工智能将导致劳动力规模发生变化 资料来源:麦肯锡公司调查,2025 年 |图:2026年AI指数报告 图4.4.33 图4.4.34 22% 21% 19% 18% 18% 17% 17% 18% 16% 16% 12% 31% 39% 33% 32% 28% 25% 26% 32% 30% 27% 28%战略和企业融资 知识管理 制造 营销和销售 风险 产品/服务开发 信息技术 软件工程 供应链/库存管理 服务运营 人力资源 5% 7% 8% 15% 13% 12% 12% 8% 10% 11% 10% 7% 10% 10% 21% 20% 16% 11% 11% 10% 13% 13% 上年实际减少员工 明年预计减少 过去一年实际增加员工 明年预计增加员工 功能 按职能划分的人工智能导致的劳动力规模的实际变化与预期变化 资料来源:麦肯锡公司调查,2025 年 |图:2026年AI指数报告 受访者百分比 邵等人的一个令人惊讶的发现。 (2026)表明许多工人并不完全抵制自动化 (图4.4.35)。对844项职业任务的调查发现,46.1%的工人积极希望人工智能接管 那些任务。在工人们认为自动化可以腾出时间的领域,支持尤其强烈。 更高价值的任务、减少重复性或提高输出质量。然而,实际的使用模式并不 必然反映这些偏好。平均自动化得分最高的职业任务账户 仅占 Claude.AI 使用量的 1.3%。相关框架根据工作人员将这些任务映射到四个区域 愿望和技术可行性(图4.4.36)。从这个角度来看,人工智能对劳动力的影响可能会体现在: 重新设计具体任务,而不是在职业层面进行生硬的自动化,并重组 工作逐步展开。 ===== 第226页 ===== 226 4.4 就业机会 | 经济| 2026 年人工智能指数报告 资料来源:Shao 等人。 (2026) 来源: 邵等人。 (2026) 图4.4.35 图4.4.36 ===== 第227页 ===== 227 4.5 机器人部署 4 经济| 2026 年人工智能指数报告 通过机器人实现的物理自动化代表了人工智能在工业中经济一体化的一种形式 环境,特别是在生产环境中,例如生产线或仓库。追踪 趋势,AI 指数使用来自国际机器人联合会 (IFR 2025) 的数据,该非营利组织 发布有关全球安装模式和运营库存的年度世界机器人报告。工业 IFR 将机器人定义为“自动控制、可重新编程、 多用途机械手,可在三个或更多轴上进行编程,可以固定在适当的位置,也可以移动 用于工业自动化应用。” 18 由于 IFR 报告的时间安排,最新数据来自 2024 年。每年,IFR 都会重新审视前几年收集的数据,并且有时会 如果有更准确的数据,将及时更新数据。因此,今年报告中的部分数据可能与去年略有不同 前几年报告的数据。 全局安装模式 全球工业机器人活动继续增长,但同比增长已趋于平缓。 2024年, 全球工业机器人安装量为54.2万台,较上年略有增长(0.2%)(图4.5.1)。 这些机器人的组成也随着时间的推移而发生变化。协作机器人,旨在 与人类操作员一起工作,继续获得比传统机器人更多的市场份额。 2017年,合作 机器人仅占所有新增工业机器人安装量的 2.8%,而 2024 年这一比例为 13.6%。 运营存量从 2023 年的 4,282,000 辆增至 2024 年的 4,664,000 辆(图 4.5.2)。总体而言,工业 自动化能力呈现出持续上升的趋势,全球工业机器人队伍 自2012年以来翻了两番。 第542章 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0 100 200 300 400 500 工业机器人安装数量(万) 2012-24 年全球安装的工业机器人数量 资料来源:国际机器人联合会 (IFR),2025 |图:2026年AI指数报告 图4.5.1 ===== 第228页 ===== 228 4.4 就业机会 | 经济| 2026 年人工智能指数报告 4,664 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0 1,000 2,000 3,000 4,000 5,000 工业机器人数量(万) 全球工业机器人运营存量,2012–24 资料来源:国际机器人联合会 (IFR),2025 |图:2026年AI指数报告 42 58 57 65 第389章 405 366 363 第484章 495 484 477 400 第424章 387 389 第526章 553 541 542 2017 2018 2019 2020 2021 2022 2023 2024 0 100 200 300 400 500 传统 协作性 工业机器人安装数量(万) 2017-24 年全球安装的工业机器人数量(按类型) 资料来源:国际机器人联合会 (IFR),2025 |图:2026年AI指数报告 图4.5.2 图4.5.3 ===== 第229页 ===== 229 4.4 就业机会 | 经济| 2026 年人工智能指数报告 地理格局 工业机器人安装遵循与上述投资和人才趋势类似的模式, 尽管其地理分布相对较窄。 2024年,中国工业总量达29.5万个,领先世界 机器人安装量,是日本 44,500 台的六倍,是美国 34,200 台的 8.6 倍 (图4.5.4)。韩国和德国紧随其后,安装量分别为 30,600 和 27,000。中国的 全球装机量份额已从 2013 年的 20.8%大幅增加至 2024 年的 54.4%(图 4.5.5)。 5.10 5.60 5.80 8.80 9.10 27:00 30.60 34.20 44.50 295.00 0 30 60 90 120 150 180 210 240 270 300 西班牙 墨西哥 台湾 意大利 印度 德国 韩国 美国 日本 中国 工业机器人安装数量(万) 2024 年按地理区域安装的工业机器人数量 资料来源:国际机器人联合会 (IFR),2025 |图:2026年AI指数报告 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 50 100 150 200 250 300 工业机器人安装数量(万) 27、德国 31、韩国 34、美国 45、日本 295,中国 2011-24 年排名前 5 位的国家安装的新工业机器人数量 资料来源:国际机器人联合会 (IFR),2025 |图:2026年AI指数报告 图4.5.4 图4.5.5 ===== 第230页 ===== 230 4.4 就业机会 | 经济| 2026 年人工智能指数报告 服务机器人 专为物流、酒店和农业等任务设计的非工业或服务机器人表明 2024 年将实现增长(图 4.5.7)。相比之下,大多数应用领域的服务机器人安装量有所增加 到 2023 年,尽管农业的采用率特别高。部署的服务机器人数量 农业环境增加了 2.5 倍。只有酒店类别同比下降。 -16% -9% -5% -4% -3% 1% 4% 7% 7% 33% −10% 0% 10% 20% 30% 意大利 美国 德国 日本 韩国 西班牙 墨西哥 中国 印度 台湾 工业机器人安装量年增长率 2023 年与 2024 年按地理区域安装的工业机器人年增长率 资料来源:国际机器人联合会 (IFR),2025 |图:2026年AI指数报告 60 6 10 11 7 86 7 9 25 8 113 12 6 54 20 103 26 17 号 42 19 0 10 20 30 40 50 60 70 80 90 100 110 交通物流 专业清洁 医疗保健 款待 农业 2024年 2023年 2022年 2021年 服务机器人安装数量(万) 2021-24 年全球安装的服务机器人数量(按应用领域) 资料来源:国际机器人联合会 (IFR),2025 |图:2026年AI指数报告 图4.5.6 图4.5.7 ===== 第231页 ===== 第231章 科学 5 2026 年人工智能指数报告 概述 人工智能改变科学的速度正在加快, 2024 年诺贝尔化学奖的动力 授予丹尼斯·哈萨比斯、约翰·詹珀和大卫·贝克 表彰他们在人工智能驱动的蛋白质结构预测方面的工作以及 人工智能天气模型的设计和操作部署 在欧洲中等天气中心。 2025年,人工智能 超越了改进单个管道步骤并朝着 取代整个科学工作流程,从天气预报到 多主体假设生成和实验设计。尽管如此, 严格的基准继续暴露出之间的巨大差距 与前沿代理商一起提供合理的产出和可靠的科学工作 在纸质复制任务上得分低于 20%。人工智能的影响 社会科学领域的发展较慢,但也有显着的成果 例外情况。语言学和计算语言研究 帮助奠定了现代语言模型的基础,并且 这些模型现在正被重新应用到诸如 语言学、传播学和网络分析。进展 这些领域更难通过数据集捕获 本章涵盖的基准。 ===== 第232页 ===== 第232章 章节亮点 5.1 2025 年人工智能用于科学 科学人工智能出版物 5.2 跨科学领域的人工智能 物理学、天文学、化学和材料科学 数据集 基准测试 基础模型 人工智能代理 生物与生命科学 数据集 基准测试 基础模型 人工智能代理 地球科学 数据集 基准测试 基础模型 人工智能代理 数学 5.3 用于科学工作流程的人工智能代理和工具 阿斯塔长凳 纸竞技场 人工智能代理 人工智能作为联合科学家 内容 5 科学 | 2026 年人工智能指数报告 233 234 234 236 236 236 第237章 239 第241章 第242章 第242章 243 244 246 246 第247章 248 248 250 250 第251章 第251章 第252章 第252章 第252章 ===== 第233页 ===== 233 5 科学 | 2026 年人工智能指数报告 章节亮点 在分子生物学中,较小的模型优于较大的模型。 MSAPairformer,一个 1.11 亿参数的蛋白质语言模型,在 基准,ProteinGym; 2 亿参数基因组模型 GPN-Star 表现优于其他 具有 400 亿个参数的模型。 1 虚拟细胞模型在 2025 年成为一个新领域,主要版本包括 Evo 2 Arc Institute、STATE 和 DeepMind 的 AlphaGenome。这些模型旨在预测细胞 不过,无需进行湿实验室实验即可对药物和遗传扰动做出反应 目前的系统仍需要实验验证。 2 1 与人工智能相关的科学出版物逐年增长。自然科学达到 2025 年人工智能出版物约 80,150 篇,比 2024 年增长 26%。人工智能目前占比 5.8%–8.8% 不同领域的科学研究产出比例从 2010 年的不到 1% 有所上升。 2 Frontier 模型的平均表现优于人类化学家,但无法重现已发表的结果 研究。在 ChemBench 上,最佳模型超越了 2,700 多个人类专家的平均水平 化学问题,同时努力完成基本任务。在 ReplicationBench 上,前沿模型得分 天体物理学纸质复制率低于 20%。在 UnivEarth 上,法学硕士代理人回答地球 观察问题的准确率是 33%,而他们的代码失败率为 58%。 3 Astronomy 发布了第一个基础模型、第一个可视化基准和 100TB 2025 年训练数据集,标志着整个领域向人工智能基础设施的转变。 AION-1,训练于 来自 5 次重大调查的超过 2 亿个天体,是第一个天文学基础模型。 AstroVisBench 推出了第一个 LLM 科学计算和可视化基准 领域。 4 人工智能系统于 2025 年首次端到端运行完整的天气预报管道。 Aardvark Weather 使用单个 ML 系统取代了传统的数值预测流程, 多个AI天气模型实现运行部署。 FourCastNet 3 生成 60- 在 4 分钟内即可完成当天的全球预报,运行速度比以前的方法快 8 至 60 倍。 5 在端到端的科学研究任务中,最好的人工智能代理得分大约是博士生得分的一半 专家实现。在 PaperArena 上,最好的智能体比博士专家的准确率达到 38.8% 83.5% 的基线。在 BixBench 上,前沿模型在现实世界中的准确率约为 17% 生物信息学分析。 6 第一篇完全由人工智能生成的论文在 2025 年的同行评审研讨会上被接受,但 经过实验证实的人工智能发现仍然很少。 Sakana 的 AI Scientist-v2 制作完成 ICLR 研讨会接受的一篇没有人工编码模板的论文。谷歌人工智能联合科学家 在三个生物医学领域得到验证。 7 大多数科学人工智能模型源自学术和政府机构, 与行业主导的通用人工智能格局形成鲜明对比。众多AI基础 科学模型是国际合作的结果。地球科学数据集来了 完全来自政府和学术来源,而行业主导基金会模式 天气和气候的发展。 ===== 第234页 ===== 234 5.1 2025 年人工智能用于科学 5 科学 | 2026 年人工智能指数报告 人工智能在科学中的作用分为三类,这三类共存,但成熟度有所不同。第一台——机器 学习科学数据以建立预测性和可解释的模型——已经被实践了几个 几十年来,现在已经司空见惯了。第二个——协助科学家完成工作流程的人工智能系统 通过文献综合、实验设计或数据分析——多年来已经出现 并在 2025 年大幅扩展。第三类——能够生成 在人类指导有限的情况下新的科学发现正在获得关注,但仍处于早期阶段。 今年最明显的发展主要发生在第二类和第三类。土豚 天气取代了完整的数值天气预报管道(Allen 等人,2025)。谷歌的人工智能公司 科学家通过实验设计精心策划假设生成(Gottweis 等人,2025)。迄今为止, 最明显的突破往往集中在拥有强大现有数据基础设施的领域,包括 结构生物学、物理、化学和材料科学,而不是最复杂的领域 基于数学或物理的模型。 然而,这些发展并不会自动转化为科学进步。实验性的 验证仍然昂贵且耗时,科学家不太可能投资于测试人工智能 产生的假设没有足够的理由相信它会产生一些结果。在药物发现中,对于 例如,人工智能系统可以大规模提出新的候选分子,但需要临床试验来确定是否 这些分子的工作仍然是一个昂贵的、多年的过程。人工智能可以提出的建议与实际提出的建议之间的差距 科学家可以进行可行的测试是本章涵盖的领域中反复出现的主题。 在 Web of Science 数据库中,自然科学领域人工智能相关出版物达到约 80,150 篇 到 2025 年,数量将比 2024 年的 63,547 增加,一年增长约 26%(图 5.1.1)。物理科学1和 生命科学在 2025 年也遵循类似的轨迹,出版物分别达到约 33,000 篇和 29,000 篇, 分别同比增长约 27%–28%。地球科学——最小的类别 按绝对值计算,出版物数量约为 20,460 份,增长了约 23%。占科学总量的比例 产出方面,人工智能相关工作仍然只占每个领域的个位数比例,但正在迅速攀升(图 5.1.2)。由 2025 年,地球科学的人工智能渗透率最高,为 8.8%,其次是自然科学,整体为 6.8%,生命科学 科学占 6.5%,物理科学占 5.8%。 2010 年,所有四个类别的比例均低于 1%。数量 提及人工智能的论文与人工智能发现的质量并不相同,但其广度表明人工智能 方法正在成为跨学科科学实践的常规部分。 1 本分析中的物理科学包括:天文学和天体物理学、化学、晶体学、电化学、地球化学和地球物理学、 地质学、数学、气象学和大气科学、矿物学、采矿和选矿、海洋学、光学、自然地理学、 物理学、高分子科学、热力学和水资源。 科学人工智能出版物 ===== 第235页 ===== 235 5.1 2025 年人工智能促进科学 | 科学 | 2026 年人工智能指数报告 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 10 20 30 40 50 60 70 80 自然科学领域人工智能出版物数量(万篇) 20.46, 地球科学 28.91, 生命科学 33.05, 物理科学 80.15, 自然科学 自然科学领域人工智能相关出版物数量,2010-25 来源:人工智能指数,2026 |图:2026年AI指数报告 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0% 1% 2% 3% 4% 5% 6% 7% 8% 9% 自然科学领域人工智能出版物(占总数的百分比) 5.84%, 物理科学 6.48%,生命科学 6.80%, 自然科学 8.79%,地球科学 自然科学领域人工智能相关出版物(占总数的百分比),2010-25 来源:人工智能指数,2026 |图:2026年AI指数报告 图5.1.12 2 自然科学计数可能略低于各个领域计数的总和。这是因为可以分配单个出版物 到多个域。例如,生物化学论文可能被归类为物理科学和生命科学。为了避免双 从数据统计来看,这些出版物在自然科学总数中只计算一次。 图5.1.2 ===== 第236页 ===== 236 5.2 跨科学领域的人工智能 本节探讨人工智能在三个主要科学群体中不断扩大的科学作用,并跟踪 每个的数据集、基准和基础模型。下表列出了所选版本 每个类别。一个一致的发现是,大多数科学人工智能模型都源自学术界 机构之间进行跨国合作,这与一般行业主导的格局形成鲜明对比。 第 1 章和第 2 章中描述的目的基础模型。 物理学、天文学、化学和材料科学 人工智能正在加速物理发展, 天文学、化学和 材料科学通过替代 昂贵的第一原理 模拟学习 代理并通过生成 新材料和分子 通过逆向设计的结构。 2025 年值得注意的版本包括 大型化学数据集(例如, OMo25 和 OC25),模拟- 面向基础模型(例如, 海象、GPhyT)和材料 原子检查点 建模和生成(例如, MACE-MP-0 和 MatterGen)。 在化学和材料方面 科学,代理系统开始连接外部软件工具和实验室设备来执行 实验。然而,基准测试结果表明,当要求执行这些系统时,这些系统尚不可靠。 从开始到结束的完整研究任务。 5 科学 | 2026 年人工智能指数报告 数据集 2025年物理和化学领域最大数据集发布,扩展多模态天文学资源 和化学规模的量子数据。多模态宇宙聚合了大约 100TB 的天文数据 观测结果,而 OMo25 报告了超过 1 亿个高精度密度泛函理论 (DFT) 涵盖 83 个元素的计算。这些数据集为大型模型定位提供了训练基础 各自领域的预测和模拟任务(图5.2.1)。 ===== 第237页 ===== 第237章 5.2 跨科学领域的人工智能 | 科学 | 2026 年人工智能指数报告 隶属关系 3 概要 3 附录中提供了完整的参考资料。 名称 域 部门 物理、天文学、化学和材料科学精选数据集 (2025) ChemPile 亥姆霍兹聚合物研究所 (HIPOLE) 弗里德里希·席勒·耶拿 哈塞特佩耶拿大学 大学, 多伦多大学 75B+ 精选化学品代币 数据(SMILES、InChI、文本、代码、 教育材料)。 化学学术界 非营利组织 多式联运 宇宙 博学人工智能,研究所 加那利群岛天体物理学, 拉古纳大学, 麻省理工学院 技术 100TB天文数据集: 多通道图像、光谱、时间 数以亿计的系列 观察。 天文学界 非营利组织 公开赛 分子 2025 (O摩尔25) 基础人工智能研究 (FAIR) 位于 洛斯阿拉莫斯国家梅塔 大学学院实验室 都柏林 超过 100M 的 DFT 计算跨度 83种元素,化学成分多样 相互作用,结构多达 350 个 原子。 化学, 材料, 化学物理 行业 政府 开放催化剂 2025 (OC25) 德克萨斯理工大学 Meta 的 FAIR 南洋理工大学 大学 150 万次溶剂中的 780 万次计算 涵盖 88 个元素的环境 用于固液界面的催化。 化学, 材料 行业 政府 学术界 学术界 图5.2.1 基准测试 在这些特定领域,基准是新引入的,因此不提供纵向 跨越多年的数据。有趣的是,看看本章中讨论的通用前沿模型是如何进行的 2、执行科学任务(图5.2.2)。在 ChemBench 上,化学评估包含 2,700 多个问题- 答案对,最好的前沿模型胜过最好的人类化学家,尽管他们在基本问题上遇到了困难 任务。 ReplicationBench 报告,在纸质复制任务中,前沿模型性能低于 20% 计算天体物理学。 ===== 第238页 ===== 238 5.2 跨科学领域的人工智能 | 科学 | 2026 年人工智能指数报告 隶属关系 4 概要 4 附录中提供了完整的参考资料。 名称 域 部门 物理、天文学、化学和材料科学选定的基准(2025) AstroVisBench 德克萨斯大学奥斯汀分校, NSF 国家光学-红外 天文学研究实验室, 弗吉尼亚大学 LLM的第一个基准 科学计算和 天文学中的可视化。 天文学界 政府 弗里德里希席勒大学化学实验室 耶拿亥姆霍兹研究所 对于聚合物 (HIPOLE) 耶拿, 西班牙国家研究 理事会(CSIC) 2,700 多对问答。最佳 模型胜过人类 平均而言化学家但是 与基本任务作斗争。 化学学术界 政府 政府 ChemX ITMO大学, 完成一件事 10 个精选数据集 自动化化学信息 从纳米材料中提取 和小分子。 化学, 材料科学 学术界 多伦多大学重力台, 纽约大学阿布扎比分校 测试人工智能对物理的发现 引力定律 模拟,包括非真实的 世界物理学。 物理学, 天体物理学 学术界 LLM-SRBench 弗吉尼亚理工大学, 文大学, 卡内基梅隆大学 239 个问题测试正版 方程发现对比 记忆。最佳系统 得分31.5%。 物理学, 科学的 方程 发现 学术界 垫台 发现 剑桥大学, 劳伦斯伯克利国家公园 联邦研究所实验室 材料研究与测试 (嘭) 评估框架 机器学习能源模型 预筛选稳定无机物 晶体。 材料, 化学 学术界 MatSciBench 加州大学洛杉矶分校、普林斯顿大学、 弗吉尼亚理工大学 1,340 道大学水平问题 涵盖 6 个领域和 31 个子领域。 80%以下的顶级模特。 材料科学学术界 PHYBench 北京大学、证监会500道原版物理题。 Gemini 2.5 Pro:与人类相比 36.9% 专家:61.9%。 物理学术界 行业 行业 行业 ===== 第239页 ===== 239 5.2 跨科学领域的人工智能 | 科学 | 2026 年人工智能指数报告 PhysGym KAUST 卓越中心 生成式人工智能, 瑞士人工智能实验室 交互式物理环境 测试LLM科学推理 在不同的先验知识下。 物理学术界 ReplicationBench 斯坦福大学, 多伦多大学 测试整个人工智能复制 天体物理学论文。前沿 模型得分低于 20%。 天体物理学/ 研究 复制 学术界 理论物理学 基准测试 (TP 基准) 威斯康星大学- 麦迪逊,印第安纳大学, NSF-西蒙斯人工智能研究所 天空(SkAI) 57 小说理论物理 问题(高能理论, 宇宙学)。研究级 问题基本上没有解决。 理论 物理学 学术界 行业 基础模型 2025 年发布的基础模型 (FM) 涵盖天文学、物理模拟、化学语言模型、 和材料建模(图5.2.3)。 GPhyT,通用物理变压器,经过 1.8TB 模拟训练 数据,其性能比专用模型高出 29 倍,并推广到物理领域 无需针对特定任务进行微调即可解决训练数据之外的问题。 图5.2.2 隶属关系 5 概要 5 附录中提供了完整的参考资料。 名称 域 部门 物理、天文学、化学和材料科学的选定基础模型(2025) AION-1 加州大学伯克利分校,熨斗研究所, 纽约大学 天文调频:300M–3.1B 参数,200M+天体 来自 5 项主要调查的对象。 开放发布。 天文学界 ChemDFM 上海交通大学, 苏州实验室,AI语音 公司。 化学法学硕士:34B 代币,270 万个 说明。通才化学 人工智能。 化学学术界 政府 政府 非营利组织 行业 ===== 第240页 ===== 240 5.2 跨科学领域的人工智能 | 科学 | 2026 年人工智能指数报告 GPhyT:一般 物理学 变压器 亚琛工业大学, 弗吉尼亚大学 使用 1.8 TB 模拟数据进行训练。 比专业产品好达 29 倍 模型。零样本泛化。 物理学术界 MACE-MP-0 剑桥大学, 联邦材料研究所 研究和测试(BAM), 加州大学伯克利分校 通用力场 预测原子模型 几乎所有领域的互动 材料。 化学物理学术界 学术界 MatterGen 微软研究院人工智能 深圳科学研究所 先进技术(中文 科学院) 基于扩散的生成 模型。新颖性超过 2 倍 比现有方法稳定。 材料科学 PDE-Transformer 慕尼黑工业大学 Transformer 物理部分 微分方程 (PDE) 网格。优于最新水平 跨越 16 个国家的艺术视觉架构 物理模拟的类型。 物理学 模拟 学术界 PhysiX UCLA 4.5B 参数。首次大规模 物理模拟FM。接送服务 从自然视频到模拟。 物理学 模拟 学术界 SMI-TED IBM 研究化学基础模型 受过分子序列训练。 化学 阿拉巴马州苏里亚大学 亨茨维尔,美国宇航局马歇尔 IBM 太空飞行中心 研究 366M参数。第一 太阳物理学 FM。预测 来自 NASA 太阳能的太空天气 动力学观测站数据 没有针对特定任务的培训。 太阳物理学 海象熨斗研究所,纽约 大学,大学 剑桥 流体力学 FM:19 跨越天体物理学的场景, 地球科学、等离子体物理学、 声学。开放式举重。 流体力学 连续体 力学, 多个域 政府 政府 政府 行业 行业 行业 行业 行业 学术界 非营利组织 图5.2.3 ===== 第241页 ===== 第241章 5.2 跨科学领域的人工智能 | 科学 | 2026 年人工智能指数报告 人工智能代理 物理科学中的代理系统将工具使用与特定领域的推理相结合来执行任务 需要多个步骤。其中一些系统充当较大管道中的重点组件, 而其他人则尝试作为端到端研究系统来运作。当他们对双方都承担更多责任时 设计和执行研究,结果的独立确认成为重要的一步。 物理超新星在2025年国际物理奥林匹克竞赛中获得23.5分(满分30分),在406名学生中排名第14位 参与者并达到金牌获得者的水平。 StarWhisper 望远镜实现天文观测自动化 规划 10 个望远镜。在化学领域,ChemAgents 展示了自主合成和 使用由 Llama-3.1-70B 控制的机器人平台进行优化(图 5.2.4)。 隶属关系 6 摘要 6 附录中提供了完整的参考资料。 名称 域 部门 物理、天文学、化学和材料科学领域选定的人工智能代理(2025) 聊天GPT材料 探险家 约翰霍普金斯大学材料科学助理 将法学硕士与图表相结合 财产神经网络 预测。 材料科学学术界 化学代理科技大学 中国科技大学 河南学院伯明翰分校 科学系 机器人人工智能化学家(Llama-3.1- 70B)。自主合成, 优化,光催化。 化学学术界 政府 ChemToolAgent 上海人工智能 苏州大学实验室 浙江大学 137 外部化学工具。 HE-MCTS框架超越 关于化学 QA 的 GPT-4o。 化学 材料科学 学术界 政府 Crystalyse 伦敦帝国理工学院 材料多工具人工智能代理 协调多个的设计 计算工具通过 基于LLM的推理框架。 材料科学 化学 学术界 物理学超新星 清华大学 普林斯顿大学 上海交通大学 大学 IPhO 2025:排名 23.5(满分 30) 406第14名。金牌级别 物理问题解决。 物理学术界 星语 望远镜 中文大学 国家科学院 天文台 (CAS),西蒙弗雷泽大学 自动化天文数字 观察 10 望远镜。 LLM驱动 观察计划。 天文学界 政府 行业 图5.2.4 ===== 第242页 ===== 第242章 5.2 跨科学领域的人工智能 | 科学 | 2026 年人工智能指数报告 生物与生命科学 人工智能越来越多地应用于生物医学以外的生物研究,以解决基本问题 基因组学、神经科学、生态学和合成生物学。第 6 章介绍了人工智能在治疗中的作用 管道,从蛋白质结构预测到药物设计到临床应用。本节重点介绍 更广泛的科学基础设施,包括数据集、基准、基础模型和代理 支持整个生物学研究。 生物训练数据规模 2025 年增长,基础模型 接受过基因组和进化方面的培训 数据从预测扩展到 生成设计。然而,差距 基因组序列数据之间, 内容丰富、功能齐全 扰动数据,测量 生物系统如何反应 干预措施仍然广泛 (Callahan 等人,2025;Sun 等人, 2025)。 AI也被应用在 宏观尺度,用计算机 常规的视觉和声学模型 处理传感器数据以进行跟踪 物种种群并优化 农业用水实时 (Miller 等人,2025;Khan 和 Sharma, 2025)。生态和生物多样性 应用程序落后于其他应用程序 生物子领域,部分原因是 这些领域的训练数据稀疏,偏向于经过充分研究的分类群,并且缺乏标准化格式 (Fahsbender 等人,2025)。在物种分类学和进化生物学中,基于视觉的基础模型 例如 BioCLIP 系列(Stevens 等人,2024;Gu 等人,2025)正在实现分类和发现 跨越生命之树,而像 PhyloNN (Elhamod et al., 2023) 这样的方法可以识别来自 没有标记数据的图像。 在神经科学中,人工智能既是大脑绘图的实用工具,也是理论的来源 灵感。计算机视觉方法在组装完整的连接组数据方面发挥了重要作用 模型生物,如苍蝇和小鼠(Dorkenwald 等人,2025 年;MICrONS 联盟,2025 年)。 生物神经元网络和人工深度网络之间的比较为研究人员提供了信息 了解大脑信息处理的原理(Linsley 等人,2025;Kazemian 等人,2025)。 数据集 OpenGenome2 包含来自生命各个领域的近 9.3 万亿个精选 DNA 碱基对, 使其成为迄今为止最大的基因组训练语料库,也是 Evo 2 模型的基础。 在神经科学领域,Spacetop 为 101 名参与者提供了超过 600 小时的认知成像成像 神经科学研究。这些资源为基础模型提供了学习生物学所需的规模 尽管基因组数据可用性和功能之间存在差距,但无需特定任务培训即可实现功能 扰动数据仍然广泛(图 5.2.5)。 ===== 第243页 ===== 243 5.2 跨科学领域的人工智能 | 科学 | 2026 年人工智能指数报告 隶属关系 7 概要 7 附录中提供了完整的参考资料。 名称 域 部门 生物和生命科学精选数据集 (2025) 斯坦福大学 OpenGenome2 Arc 研究所 大学,英伟达 9.3T 精选 DNA 碱基对 来自生活的各个领域。培训 Evo 2 语料库。 生物学, 基因组学 学术界 学术界 ProteinTalks-DB 西湖大学(学术界)蛋白质组学, 系统生物学 Spacetop 达特茅斯学院,约翰斯 霍普金斯大学埃默里分校 大学 神经科学 行业 非营利组织 101 名参与者,600 多人 成像时间。认知, 情感的、社会的、内感受的 域。 图5.2.5 基准测试 生命科学基准已转向测试工作流程执行和工具集成分析,而不是 比静态知识。 BixBench 报告称,前沿模型的实际准确率约为 17% 世界生物信息学分析任务,强调链接工具、文件处理和域方面的挑战 解释。 BioML-bench 首次在生物医学机器上提供人工智能代理的端到端评估 学习任务涵盖蛋白质工程到药物发现,研究发现平均而言,代理人 表现低于人类基线。这些结果与其他科学研究中观察到的模式一致 本章中的域。人工智能系统在孤立的子任务上表现良好,但在需要执行时却表现不佳 实际生物学研究所需的多步骤工作流程(图5.2.6)。 ===== 第244页 ===== 244 5.2 跨科学领域的人工智能 | 科学 | 2026 年人工智能指数报告 隶属关系 8 摘要 8 附录中提供了完整的参考资料。 名称 域 部门 生物和生命科学选定的基准 (2025) BaisBench 清华大学评估人工智能生物发现 通过细胞注释的能力和 数据驱动的问题。 生物学学术界 BioML-bench Shift 生物科学大学 剑桥,科学机器 第一个端到端生物医学 机器学习评估。 智能体的表现不如人类 平均基线。 生物学 学术界 学术界 学术界 BixBench FutureHouse、ScienceMachine 50 多个生物信息学场景。 GPT-4o 和克劳德 3.5 十四行诗: ~17% 准确度。 计算型 生物学 CGBench 斯坦福大学临床遗传学解释。 推理模型擅长 细粒度的任务;实质性的 幻觉差距仍然存在。 生物学(遗传学) 鼠标与人工智能: 健壮的觅食 竞争 加州大学圣巴巴拉分校 Bioinspired 基准接地 强化学习代理 通过共享觅食进行神经科学 与老鼠一起完成的任务。 神经科学 图5.2.6 行业 行业 基础模型 2025 年,生物和生命科学领域的基础模型版本将扩展到基因组学领域 和细胞建模。基因组基础模型 Evo 2,在 OpenGenome2 上训练,在 9.3 上训练 来自生命各个领域的万亿 DNA 碱基对。它使用 100 万个代币运行多达 400 亿个参数 上下文窗口并以完全开放的权重发布。第 6 章检查其在基因组方面的性能 预测任务以及更小的、特定于任务的替代方案,并涵盖额外的基因组和细胞 基础模型,包括 AlphaGenome 和 CellFM。在神经科学中,神经元的基础模型 活动预测神经元反应并概括刺激类型和个体动物(图 5.2.7)。 ===== 第245页 ===== 245 5.2 跨科学领域的人工智能 | 科学 | 2026 年人工智能指数报告 隶属关系 9 摘要 9 附录中提供了完整的参考资料。 名称 域 部门 生物和生命科学选定的基础模型(2025) AlphaGenome 谷歌 DeepMind 基因组基础模型 预测数以千计 功能测量 单碱基 DNA 序列 对分辨率。 生物学、基因组学行业 行业 ANN 模型贝勒医学院, 斯坦福大学, 哥廷根大学 神经活动调频。预测 神经元反应,概括 跨刺激类型和小鼠。 神经科学 BioCLIP 2 俄亥俄州立大学, 史密森学会, 北卡罗来纳大学教堂山分校 视觉基础模型 生物分类跨 生命之树。训练使用 分层对比学习 关于分类结构。 生物学 普林斯顿大学生物实验室,BioMap 浙江大学研究部 多代理系统 自动化生物学研究。 经过实验验证的小说 抗体设计。 生物学 CellFM 中山大学, 重庆大学金峰 实验室 800M参数,100M人力 细胞。单细胞分析, 扰动预测,基因– 基因关系。 生物学 Evo 2 Arc 研究所、Nvidia、斯坦福大学 大学,加州大学伯克利分校 40B 参数,1M 令牌上下文。 9.3T碱基对。基因组规模 一代。全面开放发布。 生物学、基因组学 ProteinTalks 西湖大学 DP 西湖科技有限公司 组学公司 蛋白质基础模型 网络动态。预测 药物功效和协同作用 扰动蛋白质组数据。 蛋白质组学, 系统生物学 学术界 学术界 学术界 非营利组织 学术界 学术界 学术界 政府 行业 行业 行业 图5.2.7 ===== 第246页 ===== 246 5.2 跨科学领域的人工智能 | 科学 | 2026 年人工智能指数报告 人工智能代理 生命科学中的代理系统开始实施复杂的研究工作流程,包括 文献合成和生物信息学执行。 BCI-Agent 根据电生理学记录执行自主神经元细胞类型分类,无需 针对特定任务的培训。 Biomni 是一种涵盖 25 个子领域的通用生物医学制剂。第6章 更详细地描述了其架构和功能(见图 5.2.8)。 隶属关系 10 摘要 10 附录中提供了完整的参考文献。 名称 域 部门 生物和生命科学领域选定的人工智能代理(2025) BCI-代理哈佛大学, 麻省理工学院 技术(麻省理工学院),广泛 麻省理工学院和哈佛大学研究所 自主神经元细胞- 类型分类自 电生理学。没有任务- 具体培训。 神经科学 BioAgents 加州大学伯克利分校、微软 研究,加州大学旧金山分校 小型多代理系统 带有 RAG 的语言模型。 概念上的专家级 基因组学任务。 生物学 比奥姆尼斯坦福大学, 基因泰克、Arc 研究所 通用生物医学 跨25个领域的代理。 (参见 第 6 章有详细介绍。) 生物学 学术界 学术界 行业 学术界 行业 非营利组织 地球科学 地球科学人工智能的进展仍然与观测基础设施保持一致,包括再分析 数据集和全球卫星档案。天气预报,受益于数十年的重新分析 ERA5 等数据集和密集的全球卫星档案,先进程度最高,具有多种 AI 模型 到 2025 年将用于实际预测系统。气候建模滞后,因为它需要预测 在十年时间尺度上,未来状态不属于任何现有训练数据的分布。水文学 提供了科学人工智能领域基准驱动进步的最明显的例子之一。基于 LSTM 的模型, 在 CAMELS 数据集中的数百个流域联合训练,一直表现优于 基于过程的水文模型(Kratzert 等,2019),区域扩展现已跨越美国 美国、英国、澳大利亚、智利和巴西。农业呈现出相反的模式, 图5.2.8 ===== 第247页 ===== 第247章 共享的基准数据集仍然稀缺,使得研究小组之间的进展难以衡量,尽管 在知识引导的碳循环量化方法方面有前景的工作(Liu et al., 2024)和全球 改变生态(Jin et al., 2026)。 5.2 跨科学领域的人工智能 | 科学 | 2026 年人工智能指数报告 数据集 地球科学在很大程度上依赖于大型政府和机构观测系统,而不是 专门构建的人工智能培训语料库。在碳通量研究中,全球通量塔网络提供了基础 观察数据。 FLUXNET2015 汇总了全球站点的涡流协方差测量结果 (Pastorello 等人,2020),而区域网络包括 AmeriFlux(北美)、ICOS(欧洲)、 和 JapanFlux(日本和东亚)提供额外的覆盖范围。这些数据集支持训练和 评估将当地碳通量测量升级为区域和全球估计的模型(图 5.2.9)。 隶属关系 11 摘要 11 附录中提供了完整的参考资料。 名称 域 部门 地球科学精选数据集 (2025) AmeriFlux 印第安纳大学,美国农业部 农业研究服务, 威斯康星大学- 麦迪逊 北美网络260- 加上通量塔站点测量 生态系统的碳、水和 能量交换。超过 50 个站点 并连续10多年 数据。 生态学 骆驼 NSF 国家中心 大气研究, 美国地质调查局 内政部 地形标准化数据, 气候、土壤和径流 671 美国河流流域。基金会 用于人工智能水文基准测试。 水文学 学术界 政府 FLUXNET2015 劳伦斯伯克利国家大学 实验室,图西亚大学, 苏黎世联邦理工学院 全球二氧化碳测量, 水、能量交换 生态系统和之间 来自 212 个地点的气氛 全世界。 生态学界 政府 ICOS ICOS ERIC/大学 赫尔辛基图嫩研究所 气候智能型农业,ETH 苏黎世 欧洲观测网 12 个地区的 140 多个车站 测量温室的国家 气体浓度和碳 穿过大气、陆地的通量, 和海洋。 生态学界 政府 JapanFlux 大阪都立大学 国立千叶大学 极地研究所 (NIPR) 陆地-大气通量 测量覆盖日本 和东亚(1990 年至 2023. 追踪能源、水和 整个亚洲的二氧化碳交换 生态系统。 生态学界 政府 政府 图5.2.9 ===== 第248页 ===== 248 5.2 跨科学领域的人工智能 | 科学 | 2026 年人工智能指数报告 隶属关系 12 摘要 12 附录中提供了完整的参考资料。 基准测试 2025 年,地球科学的基准扩展到极端事件报道的可靠性,其中人工智能天气 例如,模特面临着最高的风险。这也是标准平均技能指标无法捕捉到的地方 性能(图5.2.10)。 基础模型 2025 年发布的地球科学基金会模型涵盖天气预报、气候模拟和 地理空间表示。在天气预报中,有几个直接基于模型构建的系统 2025 年人工智能指数。 FourCastNet 3 可以在不到 0.25 度的时间内生成 60 天的全球预报 在单个 GPU 上运行 4 分钟,运行速度比之前的方法快 8 到 60 倍。对于地球观测, TerraMind 是第一个跨 9 种地理空间模式运行的任意生成多模式模型 (图5.2.11)。 名称 域 部门 地球科学选定基准(2025) EarthSE 上海交通大学, 上海人工智能 实验室,香港 理工大学 10万篇论文,114个学科,11个 法学硕士经过测试。显着差距 地球科学探索。 地球科学 ExEBench 慕尼黑工业大学 (TUM),慕尼黑中心 机器学习(MCML) 7个极端事件类别。 全球覆盖。测试检测, 监测、预测。 大气 科学 UnivEARTH 康奈尔大学,哥伦比亚 大学 140 道地球观测问题。 LLM代理:准确率33%。代码 58% 的时间失败。 地球科学 学术界 学术界 学术界 行业 图5.2.10 ===== 第249页 ===== 249 5.2 跨科学领域的人工智能 | 科学 | 2026 年人工智能指数报告 隶属关系 13 摘要 13 附录中提供了完整的参考资料。 名称 域 部门 地球科学基础模型精选(2025) AlphaEarth Google DeepMind 嵌入场模型 对于一般地理空间 代表。跑赢大盘 先前的特征化方法。 对地观测行业 cBottle(气候 一瓶) 基于 Nvidia Diffusion 的气候模拟器。 全球 5 公里 1250 万像素 分辨率。每日到季节 可变性。 气候科学产业 FourCastNet 3 Nvidia、劳伦斯伯克利 加州大学国家实验室 伯克利 60 天的预测只需 <4 分钟/GPU。 速度提高 8-60 倍。建立在极光之上 和 NeuralGCM 的进展。 天气 预测 行业 GAIA USRA/RIACS、BCG X 人工智能科学研究所 15年大气调频 卫星图像。大气 河流(F1:0.58),气旋检测 (召回率为 81%)。 大气 科学 行业 行业 行业 OlmoEarth 艾伦人工智能研究所,大学 亚利桑那州华盛顿州 大学 多模态时空地球 观察调频。平台 非政府组织和非营利组织。 地球观测 TerraMind IBM 研究院、苏黎世联邦理工学院、 于利希研究中心 第一个任意对任意生成式 多模式地球观测 调频。 9 种地理空间模式。 地球观测 WeatherNext 2 Google DeepMind 数百个天气结果 <1 分钟/TPU。 99.9% 改善 超过前任。建立在 GenCast。 天气 预测 学术界 学术界 学术界 政府 政府 非营利组织 非营利组织 图5.2.11 ===== 第250页 ===== 250 5.2 跨科学领域的人工智能 | 科学 | 2026 年人工智能指数报告 人工智能代理 在地球科学中,人工智能代理正在超越数据检索,转向执行完整的研究工作流程, 包括自动观测处理、文献分析和气候任务完成。 ClimateAgent 完成了 85 项气候任务,完成率 100%,质量得分为 8.32,相比之下 Microsoft Copilot 为 6.27,GPT-5 为 3.26(图 5.2.12)。 隶属关系 14 摘要 14 附录中提供了完整的参考资料。 名称 域 部门 地球科学中选定的人工智能代理(2025) 气候代理 香港大学 科学技术 85 项气候任务:100% 完成度、质量 8.32 对比 副驾驶 6.27,GPT-5 3.26。 气候科学 EarthLink上海人工智能 复旦大学实验室 悉尼大学 地球上第一位人工智能副驾驶 科学家。自动化研究 动态工作流程 反馈循环。 气候科学 PANGEA GPT 阿尔弗雷德韦格纳研究所 极地和海洋研究 PANGEA 多智能体系统 地球科学数据库。 智能数据处理, 自然语言界面。 地球科学 学术界 行业 学术界 政府 图5.2.12 数学 数学推理是人工智能能力的另一个活跃测试场。 Goedel-Prover 等系统 正在朝着使用 Lean 等语言自动生成形式证明的方向发展。竞赛级问题—— 已知结果的解决和形式化验证正在迅速推进,但主要的开放问题,例如 长期以来的鄂尔多斯猜想仍然远远超出了目前的能力。第 2 章介绍基准 详细表现,包括在国际数学奥林匹克竞赛中从银牌跃升至金牌 在一年内,FrontierMath 和 MathArena 取得了快速进展。 ===== 第251页 ===== 第251章 5.3 人工智能代理和 科学工作流程工具 第 5.2 节的特定领域表格列出了不断增长的人工智能代理、基础模型、 数据集和基准套件。 2025 年发布的两项跨域基准测试提供了更广泛的视角 当被要求进行端到端的科学研究而不是孤立的任务时,这些系统表现良好。开 在这两个基准上,即使是表现最好的代理也远远低于专家水平的表现。 5 科学 | 2026 年人工智能指数报告 阿斯塔长凳 AstaBench 是一个端到端基准测试套件,可评估跨领域的代理科学研究能力 来自文献理解的 2,400 个跨越多个领域的问题和完整的发现工作流程 通过代码执行、数据分析和端到端发现。它对 22 家代理商中的 57 家代理商进行了基准测试 类并报告总分和每个问题的成本(图 5.3.1)。表现最好的经纪人 每个问题的得分约为 0.53,成本约为 3.40 美元,而大多数代理都集中在 0.10 到 0.10 之间 0.45,每个问题的成本低于 1.00 美元。 0.00 0.50 1.00 1.50 2.00 2.50 3.00 3.50 0.00 0.10 0.20 0.30 0.40 0.50 0.60 每个问题的平均成本(以美元为单位) 平均分 AstaBench:平均分 资料来源:AstaBench 排行榜,2026 年 |图:2026年AI指数报告 图5.3.1 ===== 第252页 ===== 第252章 5.3 科学工作流程的人工智能代理和工具 | 科学 | 2026 年人工智能指数报告 纸竞技场 PaperArena 是一个基准测试,测试 LLM 代理人是否能够回答需要的真实研究问题 将多篇论文中的证据拼接在一起,同时编排外部工具进行解析、检索、 和计算。 Gemini 2.5 Pro 整体表现最佳,在多智能体中实现 38.8% 的平均准确率 配置(图5.3.2)。所有测试的药物都远远落后于博士专家基线 83.50%。 不过,在所有测试的模型中,多代理配置的性能始终优于单代理设置 涨幅不大,通常为 2 至 4 个百分点。 人工智能作为联合科学家 2025 年,多个研究小组发布了系统,其中多个人工智能代理将科学任务分配给 他们自己,用单独的代理处理文献搜索、假设生成、代码执行和 审查。多智能体系统的设计旨在近似人类研究团队的结构,而不是 而不是依赖单个模型或个人来执行每一步。最突出的例子是谷歌的人工智能公司 科学家(Gottweis 等人,2025)使用生成-辩论-进化循环,其中代理迭代地生成和 完善基于证据的假设。该系统在三个生物医学领域得到验证,包括 AML 药物再利用和肝纤维化目标,并在 GPQA 钻石集上实现了 78.4% 的 top-1 准确率 当为每个问题选择最高评分的假设时(图 5.3.3)。 22.32% 23.47% 24.62% 27.17% 29.97% 30.61% 34.18% 33.93% 36.10% 26.28% 28.83% 29.34% 30.74% 34.31% 34.57% 36.73% 37.37% 38.78% Kimi-K2-Inst 鲁克特 Qwen3 -235B-研究所 鲁克特 克劳德 3 .5秒 网上 GLM- 4.5 Qwen3 -235B- 思考GPT -4.1 克劳德小号 网上4 OpenAI o4-迷你-高 双子座2.5P 罗 0% 20% 40% 60% 80% 100% 单代理多代理 型号 平均分 PaperArena:单代理与多代理性能 资料来源:Wang 等人,2026 |图:2026年AI指数报告 83.50%,人类基线(博士专家) 图5.3.2 人工智能代理 ===== 第253页 ===== 第253章 其他多智能体系统采用不同的方法来实现同一目标。 Sakana 的 AI 科学家-v2(山田 等人,2025)发表了第一篇完全由人工智能生成的论文,并被同行评审研讨会(ICLR)接受,使用 代理树搜索,无需人工编码模板即可生成和完善代码实现。宇宙 (Mitchener 等人,2025)在持续长达 12 小时的运行中保持一致性,执行平均 每次运行 42,000 行代码并阅读 1,500 篇论文,合作者报告单次运行 大约六个月的研究。 SciToolAgent (Ding et al., 2025) 可自动化数百种科学工具 通过知识图驱动的检索跨越生物学、化学和材料科学,优于先前的 代理框架在多工具任务上提高了 10 到 20 个百分点(图 5.3.4)。 尽管取得了这些进步,但只有少数多智能体系统产生了经过测试的结果 并通过现实世界的实验得到证实。已发表的例子包括设计的新蛋白质 由 ProtAgents 提供;来自虚拟实验室的 92 种 SARS-CoV-2 候选抗体(其中 90% 以上 成功绑定目标);来自 OriGene 的两个新的癌症药物靶点 GPR160 和 ARG2;五本小说 MOFGen 的金属有机框架;以及来自 ChemCrow 的新型发色团。之间的差距 这些系统可以通过计算提出什么以及通过实验证实的内容仍然很广泛。 该领域的主要障碍包括劳动力培训差距、缺乏 API 和互操作性标准、 以及尚不支持自主研究的维护和扩展的资助结构 基础设施。 资料来源:Gottweis 等人,2025 图5.3.2 5.3 科学工作流程的人工智能代理和工具 | 科学 | 2026 年人工智能指数报告 ===== 第254页 ===== 第254章 5.3 科学工作流程的人工智能代理和工具 | 科学 | 2026 年人工智能指数报告 资料来源:Ding 等人,2025 图5.3.2 ===== 第255页 ===== 255 医学 6 2026 年人工智能指数报告 概述 2025 年,医学领域的人工智能在多个领域取得进展,但势头强劲 模型性能并未始终如一地转化为实际性能 世界临床影响。在分子生物学中,理解 蛋白质行为是药物开发、人工智能的基础 驱动的蛋白质研究持续增长,并且更小、更多 专用模型匹配或优于更大的通用模型 蛋白质结构预测、基因组学的目的系统, 和药物发现。在临床推理任务上,引领AI 现在,模型在结构化方面的得分高于大多数医生 临床评估,但近一半的临床人工智能研究仍然 依赖模拟场景而不是真实的患者数据。 在实践中获得关注的工具是那些支持 临床医生现有的工作流程,例如环境人工智能抄写员和 败血症预测系统。美国食品管理局的授权 和药物管理局(FDA)针对人工智能医疗设备 有所增加,但临床证据仍然滞后。患者 也直接遇到人工智能生成的健康信息 在搜索结果中,通常在与临床医生交谈之前, 比通过的工具进行的监督或审查甚至更少 正规的监管渠道。人工智能对医学的影响是显而易见的,但是 大规模实现它需要临床证据、治理和 道德框架。 ===== 第256页 ===== 256 章节亮点 6.1 中心法则 研究卷 公共数据集 分子和细胞生物学 生物医学视觉数据- 语言模型 基于序列的模型:蛋白质 语言模型 结构预测和共折叠 型号 蛋白质设计与生成 治疗模型 虚拟细胞模型和基因组 基础模型 多模式基础模型 生物医学发现 亮点:自动化和代理 生物医学发现 6.2 临床应用 影像学 数据规模和可用性 建模方法 前瞻性临床试验 亮点:法学硕士临床推理 性能 亮点:AI智能体在临床中的应用 医学 部署、实施和 取消实施 FDA授权的AI/ML- 启用的设备 第257章 258 258 第259章 第259章 260 261 262 265 265 第267章 268 269 269 269 270 第271章 第272章 第272章 273 273 6 医学 | 2026 年人工智能指数报告 内容 临床设备 专业 行业格局 企业规模部署 2025年 环境人工智能文档 人工智能驱动的脓毒症 预测 临床生成人工智能 工作流程 证据差距和治理 亮点:医学中的数字孪生 6.3 患者参与 健康相关人工智能概述 搜索次数 患者对人工智能的看法 医疗保健 6.4 道德考虑 体积和浓度 全球健康:不同的道德观 焦点 275 276 276 276 第277章 第277章 278 278 280 280 第281章 第284章 第284章 第286章 ===== 第257页 ===== 第257章 6 医学 | 2026 年人工智能指数报告 章节亮点 在分子生物学中,较小的模型优于较大的模型。 MSAPairformer,一个 1.11 亿参数的蛋白质语言模型,在 基准,ProteinGym; 2 亿参数基因组模型 GPN-Star 表现优于其他 具有 400 亿个参数的模型。 1 虚拟细胞模型在 2025 年成为一个新领域,主要版本包括 Evo 2 Arc Institute、STATE 和 DeepMind 的 AlphaGenome。这些模型旨在预测细胞 不过,无需进行湿实验室实验即可对药物和遗传扰动做出反应 目前的系统仍需要实验验证。 2 与人工智能的其他领域一样,生物模型的开发越来越受到数据的瓶颈 而不是建筑。现在,联合折叠模型代表了所有结构类型 蛋白质数据库,2025 年转向人工智能预测结构的蒸馏数据集和 对组合实验数据源进行训练,将训练集扩展到数百个 数千个条目到数千万个条目。 3 自动根据患者就诊生成临床记录的人工智能工具在以下领域得到广泛采用 2025 年。在多个医院系统中,医生报告说他们的支出减少了 83% 通过一个医院系统,可以节省写笔记的时间,显着减少倦怠感 报告投资回报率为 112%。 4 FDA 到 2025 年批准了 258 种人工智能医疗设备,其中大部分通过不需要的途径 新的临床试验。绝大多数通过设备修改途径进入市场 依赖现有的安全性和有效性证据,而不是新的随机试验,只有 2.4% 具有随机试验数据支持的临床研究的设备。 5 多智能体人工智能系统在复杂的已发表案例研究中得分为 85.5%,而在复杂案例研究中得分为 20% 无人帮助的医生。微软的 AI Diagnostic Orchestrator 与 OpenAI 的 o3 配合使用进行了测试 关于从医学文献中提取的针对医生在没有他们的情况下工作的具有挑战性的案例 常用工具。更广泛地说,多代理框架的诊断准确性提高了 7% 比单药基线提高 60% 以上。 6 人工智能生成的摘要现在出现在 84% 到 92% 的健康相关 Google 搜索的顶部 搜索。 92% 的情况下,症状和常见健康问题会触发 AI 概览, 接下来是治疗和病情查询。这些总结现在已成为健康的常规特征 信息搜索,形成对用户问题的初步解释。 7 2025 年,医学人工智能出版物中的伦理讨论增加了一倍多,但对话 很窄。治理主导着讨论,而算法问责制、生物安全和 全球卫生公平问题仍未得到充分探讨。 8 对医学数字孪生的研究兴趣正在快速增长,并且在存在严格试验的情况下,早期 结果是有希望的。在一项针对 150 名糖尿病患者的随机试验中,71% 的患者获得了健康的血液 一年内的血糖水平,同时安全地减少药物治疗。 9 ===== 第258页 ===== 258 6.1 中心法则 分子生物学的人工智能模型跨越了从基因序列到蛋白质结构再到治疗的途径 设计。本节跟踪蛋白质语言模型、结构预测、蛋白质设计、虚拟 细胞模型和生物医学发现的多模式基础模型。该分析借鉴了 PubMed 出版物数量、基准评估(包括 ProteinGym 和 FoldBench)以及模型发布数据 从 2024 年到 2025 年。这些领域反复出现的模式是规模与专业化之间的紧张关系。 在多个领域,较小或更有针对性的模型与较大的通用系统相匹配或优于较大的通用系统。 6 医学 | 2026 年人工智能指数报告 2024 年至 2025 年间,人工智能驱动的蛋白质研究增长了约 71%(图 6.1.1)。出版物总数 跨越四个类别——功能预测、蛋白质结构预测、蛋白质-药物相互作用和 合成蛋白质设计——从 2024 年的 2,259 个增加到 2025 年的 3,855 个。蛋白质-药物相互作用代表 两年产出份额最大,2024 年占论文数量的 49.9%,2020 年上升至 54.4% 2025 年。蛋白质结构预测在 2024 年成为第二大类别,占 28.7%,尽管其 2025 年相对份额下降至 23.9%。功能预测和合成蛋白质设计仍保持不变 比较稳定,功能预测从9.7%提高到10.4%,合成蛋白设计 略有下降,从 11.7% 降至 11.3%。相对份额向蛋白质-药物相互作用的转变,即使 所有类别的绝对计数都在增长,可能反映出结构预测方法的成熟和不断增长 对治疗应用的兴趣。随后专门针对人工智能用于药物发现的出版物也随之而来 类似的上升轨迹(图 6.1.2)。 研究卷 220 第648章 1,127 264 第402章 922 2,097 人 第434章 功能预测蛋白质结构 预测 蛋白质药物 互动 合成蛋白 设计 0 500 1,000 1,500 人 2,000 2025 2024 研究领域 出版物数量 2024 年与 2025 年人工智能驱动的蛋白质研究出版物数量 资料来源:RAISE Health,2026 |图:2026年AI指数报告 图6.1.1 ===== 第259页 ===== 第259章 6.1 中心法则| 医学 | 2026 年人工智能指数报告 3,311 2,100 1,470 1,229 1,083 720 612 第431章 2018 2019 2020 2021 2022 2023 2024 2025 0 500 1,000 1,500 人 2,000 2,500 人 3,000 3,500 人 出版物数量 2018 年人工智能药物发现出版物数量 – 25 资料来源:RAISE Health,2026 |图:2026年AI指数报告 图6.1.2 随着人工智能模型在生物学中得到进一步采用,对训练数据的需求持续增长。 快速收集新的生物数据通常既耗时又昂贵。 2025年,生物人工智能 模型越来越多地在具有不同类型实验测量的多个数据集上进行训练。几个 例如,共折叠方法(同时对两个或多个分子进行建模)开始训练 基于蛋白质数据库 (PDB) 的结构数据和实验小分子结合亲和力 来自 PubChem、ChEMBL 和 BindingDB 等存储库的测量。 自 PDB 推出以来,公开可用的生物数据集的规模已增长了几个数量级 成立于 1971 年,但应谨慎解释跨数据库的直接大小比较。的 测量单位因来源而异:“条目”可能代表实验解决的蛋白质结构, 生物活性测量、基因序列或单细胞观察。 其他模型是根据综合生成的数据进行训练的。 AlphaFold 3 及其开源复制品, 包括 Boltz-2 和 OpenFold3,都在预测蛋白质结构的“自蒸馏”数据集上进行训练 AlphaFold 2 经过质量过滤。 Meta FAIR 发布了 Open Molecules 2025 (OMol25) 数据集 超过 1 亿次分子量子力学计算。 新的实验数据集也将于 2025 年首次亮相。Tahoe-100M,最大的公开发布的单细胞 测序数据集,包含 50 多种癌细胞类型的测量结果,这些细胞暴露于 1,100 多种 药物。 BaseData包含通过宏基因组挖掘获得的超过98亿个基因(图6.1.3)。 公共数据集 分子和细胞生物学 ===== 第260页 ===== 260 6.1 中心法则| 医学 | 2026 年人工智能指数报告 PDB (197 1) INT ERP 罗/Pfam (199 5) 绑定数据库(199 5) 字符串 (20 00) 大学 腐烂 (20 02) PDB绑定(20 04) 公共图书馆 下摆 (20 04) 化学分子生物学实验室(20 09 ) 阿尔法F 旧数据库(202 1) 奥莫尔25(2025) 太浩湖- 100M (2025) 基础数据 (2025) 10万 1M 10M 100M 1B 10B 结构序列/功能 结合/生物活性 预测/模拟 单细胞宏基因组 数据集(发布年份) 条目数(对数刻度) 分子和细胞生物学公共数据集的大小 资料来源:RAISE Health,2026 |图:2026年AI指数报告 图6.1.3 图6.1.4 训练生物医学视觉语言模型需要大量图像和字幕存储库 转换为连续的预训练数据集。在一般领域,数据缩放通常被认为是 成熟或饱和的研究方向,但这似乎并不适用于生物医学环境。较新 数据集超越了单一专业,包含了更广泛的模式和生物医学 域(图 6.1.4)。 生物医学视觉语言模型的数据 MEDICAT PMC-OA PMC-15M BIOMEDICA 24M 2020 2022 2024 2025 0 1M 2M 3M 4M 5M 6M出版物数量 2020-25 年发布的选定生物医学数据集的大小 资料来源:RAISE Health,2026 |图:2026年AI指数报告 ===== 第261页 ===== 261 6.1 中心法则| 医学 | 2026 年人工智能指数报告 蛋白质语言模型 (PLM) 的趋势发生了转变 2025 年从缩放模型尺寸到提高模型效率 和专业化。 2024年,我们的努力达到了顶峰 980 亿参数 ESM3。 2025年,焦点转向 较小的架构接受精选数据或增强数据的训练 与检索方法(图6.1.5)。 ProteinGym 是一个全面的基准套件 蛋白质适应性预测和设计,包括 250 多个 标准化深度突变扫描分析,数以百万计 突变序列和精心策划的临床数据集 专家注释的突变效应。 MSAPairformer,111 在多个序列上训练的百万参数模型 路线和物理限制,超越了以前 最先进的方法只需一小部分培训和 参数预算(图6.1.6)。富裕E1系列 同样通过结合 具有检索增强生成 (RAG) 的较小模型 方法。虽然某些任务仍然受益于更大的 模型、其他——例如预测细胞定位—— 与训练方法和数据相比,似乎变化更大 与参数计数。 基于序列的模型:蛋白质语言模型 93M 14M 93M 83M 370M 98B 370M 440M 610M 521M 109M 135M 3B 730M 370M 923M 阿尔法折叠 2 玫瑰TTA折叠 开折 RoseTTA折叠所有Atom 阿尔法折叠 3 ESM3 螺旋折叠3 柴-1 波尔兹-1 玻尔兹-2 Protenix-Tiny Protenix-Mini 简单折叠 RosettaFold-3 Protenix v0.7 种子折叠 2021 2022 2024 2025 10M 100M 1B 10B 100B 参数数量(对数刻度) 蛋白质结构预测模型的规模,2021-25 资料来源:RAISE Health,2026 |图:2026年AI指数报告 图6.1.5 ===== 第262页 ===== 262 6.1 中心法则| 医学 | 2026 年人工智能指数报告 0.45 0.39 0.41 0.41 0.47 0.41 0.41 0.40 0.42 0.42 0.45 0.47 0.47 0.48 MSA-变压器 (100M) ESM-2(150M) ESM-2 (3B) ESM-2(650M) 诗人(200M) 电子SMC(600M) 电子SMC(300M) E1(单序列)(150M) E1(单序列)(300M) E1(单序列)(600M) MSA 配对器 (111M) E1(检索增强)(150M) E1(检索增强)(300M) E1(检索增强)(600M) 2021 2022 2023 2024 2025 0.00 0.10 0.20 0.30 0.40 0.50 型号(参数) 平均。相关性(斯皮尔曼) 蛋白质语言模型在 ProteinGym 上的表现,2021–25 资料来源:RAISE Health,2026 |图:2026年AI指数报告 图6.1.6 除了基准性能之外,PLM 也变得更加针对特定任务。 ESM-C系列 证明了针对单一任务的较小模型,例如表示学习,可以 即使没有 ESM3 系列的完整功能集,也能取得成功。经过微调的 ProGen 模型(60 亿个参数) 用于设计一种新型 CRISPR-Cas 蛋白 OpenCRISPR-1,该蛋白表现出更高的特异性 相对于标准 SpCas9。 受架构的启发,2025 年发布了多个开源结构预测模型 AlphaFold 3。这些模型解决“共同折叠”的任务——预测三维结构 由蛋白质、核酸、药物和其他生物分子组合而成。而 AlphaFold 3 保留了 在某些任务上具有性能优势,大多数折叠模型都表现出类似的性能 跨蛋白质结构和生物分子复杂建模任务。有些,包括玻尔兹级数和 OpenFold3 是根据商业许可许可发布的。 由于共折叠模型现在可以表示 PDB 中可用的所有结构类型,因此性能进一步提高 收益可能需要新的数据源或从现有数据中更深入地提取信号。一个策略 是使用“蒸馏”数据集,其中人工智能预测的蛋白质结构通过实验进行补充 确定的,将训练数据集从数十万个条目扩展到数千万个条目。 Boltz-2 展示了一种补充方法——对来自 PDB 的结构信息和 实验性结合亲和力测量——将专业化和规模结合起来(图6.1.7)。四个 领先的共折叠模型共享实验和蒸馏结构数据的共同基础,但是 他们在使用其他来源方面存在分歧,例如分子动力学模拟、结合亲和力 测量和 RNA 结构。 结构预测和共折叠模型 ===== 第263页 ===== 263 6.1 中心法则| 医学 | 2026 年人工智能指数报告 结构数据 (实验性) 结构数据 (蒸馏)模型分子 动力学 结合亲和力 RNA 结构 折叠模型的训练数据源,2025 阿尔法折叠 3 玻尔兹-2 简单折叠 打开折叠3 图6.1.61 1 行代表单独的折叠型号。列指示每个模型在训练期间是否包含给定的数据类型,包括前 实验测定和蒸馏的蛋白质结构、分子动力学模拟、结合亲和力测量和 RNA 结构数据。一个 复选标记表示已使用该数据类型。 与人工智能其他领域的趋势类似,更大的模型并不一定意味着更好的性能 在蛋白质结构预测中。 AlphaFold 3发布后,后续模型都趋向于 类似的参数规模而不是继续增长(图6.1.8)。 FoldBench 是一个测试基准 模型是否可以正确预测小分子(例如候选药物)如何物理结合 目标蛋白。尽管 AlphaFold 3 在 FoldBench 上的性能尚未被显着超越 此后又发布了几个更大的模型(图 6.1.9)。这些结果表明数据,而不是 模型大小,是蛋白质结构预测的重要瓶颈。 ===== 第264页 ===== 264 6.1 中心法则| 医学 | 2026 年人工智能指数报告 93M 14M 93M 83M 370M 98B 370M 440M 610M 521M 109M 135M 3B 730M 370M 923M 阿尔法折叠 2 玫瑰TTA折叠 开折 RoseTTA折叠所有Atom 阿尔法折叠 3 ESM3 螺旋折叠3 柴-1 波尔兹-1 玻尔兹-2 Protenix-Tiny Protenix-Mini 简单折叠 RosettaFold-3 Protenix v0.7 种子折叠 2021 2022 2024 2025 10M 100M 1B 10B 100B 参数数量(对数刻度) 蛋白质结构预测模型的规模,2021-25 资料来源:RAISE Health,2026 |图:2026年AI指数报告 51.23% 51.82% 55.04% 64.90% 50.70% 53.90% 57.28% 63.10% 柴一号 (440M) 螺旋折叠3 (370M) Boltz-1 (610M) AlphaFold 3 (370M) Protenix v0.7 (368M) Boltz-2 (521M) RosettaFold-3 (730M) 种子折叠 (923M) 2024 2025 0% 20% 40% 60% 80% 100% 型号(参数) 准确度 FoldBench:蛋白质共折叠性能,2024–25 资料来源:RAISE Health,2026 |图:2026年AI指数报告 图6.1.8 图6.1.9 ===== 第265页 ===== 265 6.1 中心法则| 医学 | 2026 年人工智能指数报告 共折叠的进步使得新一代蛋白质设计生成模型成为可能,包括 设计抗体、纳米抗体和肽的方法。方法范围包括围绕以下内容构建的工作流程 将现有的结构预测方法(例如 BindCraft、Germinal)直接训练为生成模型 粘合剂(例如 RFDiffusion、BoltzGen)。 Adatpyv Bio 于 2025 年主办的蛋白质设计挑战赛提供了受控比较。多个 方法在设计针对尼帕病毒的粘合剂的任务中进行了测试。千余种设计中 经过测试,99 种蛋白质被证实可以结合,但没有一种蛋白质能中和目标蛋白质。专门的 Mosaic 方法结合了多种工具和专家调优,其性能优于通用方法 方法(图 6.1.10)。 “虚拟细胞”模型(模拟细胞状态和对刺激的反应的人工智能系统)的研究有所增加 正如 PubMed 出版物数量的增长所反映的那样,到 2025 年将大幅增加(图 6.1.11)。值得注意的版本 包括 Evo 2,Arc Institute 的 DNA 语言模型; STATE,扰动响应模型;和 AlphaGenome,来自 DeepMind 的多模态模型。 然而,当前的虚拟细胞和基因组基础模型仍然落后于较小的、特定于任务的模型 在几个基准上。 GPN-Star,一个专注于功能和监管的 2 亿参数模型 基因组学,在多个变异效应预测任务上优于 Evo 2(40B 参数)(图 6.1.12)。 这些结果表明,仅靠规模还不够,训练方法和数据管理仍然存在 性能的重要决定因素。 治疗学的蛋白质设计和生成模型 虚拟细胞模型和基因组基础模型 85.87% 98.13% 88.89% 88.24% 28.57% 100% 9.65% 1.87% 7.41% 17.65% 0% 88.89% 整体 (1,026) 玻尔兹根 (107) 绑定工艺 (27) 射频扩散 (17) 生发 (14) 马赛克 (9) 0% 20% 40% 60% 80% 100% 明示绑定 模型(测试的全部设计) 成功率 Adaptyv Nipah Binder 挑战中蛋白质设计的成功率 资料来源:Adaptyv Nipah Binder 挑战,2026 年 |图:2026年AI指数报告 图6.1.10 ===== 第266页 ===== 266 6.1 中心法则| 医学 | 2026 年人工智能指数报告 24 16 14 10 14 7 9 6 2018 2019 2020 2021 2022 2023 2024 2025 0 5 10 15 20 25 出版物数量 虚拟细胞模型的出版物数量,2018-25 资料来源:RAISE Health,2026 |图:2026年AI指数报告 图6.1.11 图6.1.12 0.38 0.40 0.53 0.75 执行者 (250M) 猎狼犬 (190M) 埃沃2 (40B) GPN-星 (200M) 2021 2023 2025 0.00 0.20 0.40 0.60 0.80 1.00 型号(参数) 性能(AUPRC) 虚拟细胞模型性能 资料来源:Ye 等人,2025 |图:2026年AI指数报告 ===== 第267页 ===== 第267章 6.1 中心法则| 医学 | 2026 年人工智能指数报告 关于多式联运的科学出版物 生物医学发现的基础模型 自2021年以来一直在快速增长 (图6.1.13)。虽然其中的几个子字段 多模式生物医学人工智能受到关注 到 2025 年,有两个领域受到特别关注 有影响力:视觉语言模型对 带有文本的医学或生物图像,同时 视觉组学模型将成像与 基因组或转录组数据。 生物医学发现的多模态基础模型 2 16 171 314 第462章 2021 2022 2023 2024 2025 0 100 200 300 400 500 出版物数量 多模式生物医学人工智能的出版物数量,2021–25 资料来源:RAISE Health,2026 |图:2026年AI指数报告 图6.1.13 ===== 第268页 ===== 268 亮点: 自动化和代理生物医学发现 6.1 中心法则| 医学 | 2026 年人工智能指数报告 到 2025 年,科学发现自动化的努力重点是将数字推理与物理结合起来 实验室验证。 Robin,一个自动发现框架,链接了基于文献的假设 通过实验数据分析生成,将 ROCK 抑制剂 ripasudil 确定为新型候选药物 用于干性年龄相关性黄斑变性。 STELLA,一个自主生物信息学代理,扩展了自己的 通过发现和集成新的软件工具而不是依赖手动来提高技术能力 策划的工具集。 Biomni 是斯坦福大学开发的通用生物医学人工智能代理,它绘制了一个 跨25个子领域的统一生物医学行动空间,集成了150个专业工具、105个软件包, 和59个数据库。 协作多主体框架也出现了。特工实验室,由 AMD 和 Johns 开发 Hopkins 在模拟实验室结构中为博士、博士后和机器学习工程师代理分配了不同的角色。的 虚拟实验室使用法学硕士首席研究员来协调专门的科学家代理人,产生了 92 部小说 针对 SARS-CoV-2 的纳米抗体结合剂设计。这些系统是多智能体早期趋势的一部分 生物医学研究的协调,尽管他们的成果仍需要实验验证。 ===== 第269页 ===== 269 6.2 临床应用 第 6.1 节中描述的分子和细胞人工智能进展提供了上游模型 临床工具越来越依赖。本节跟踪人工智能如何在临床环境中应用,从 医学成像和诊断推理到工作流程集成、监管授权和企业 规模部署。该分析借鉴了前瞻性试验计数、FDA 设备授权数据、基准 评估并公布卫生系统的分配结果。在这些领域,强 基准结果尚未可靠地转化为可测量的临床结果。 6 医学 | 2026 年人工智能指数报告 医学成像 AI 的训练数据的原始样本数量仍然比医学成像 AI 的训练数据少大约 100 倍。 非医疗人工智能(图6.2.1)。 MAIRA-2,一个以放射学为重点的模型,在大约 140 万个胸部上进行了训练 射线照片,与 DINOv3 相比,DINOv3 是一种通用视觉转换器,经过 17 亿张未标记图像的训练 自然图像。在多模式方面,RadFM 对大约 1600 万个混合 2D 和 3D 医疗数据进行了培训 扫描与临床文本配对,而 OpenCLIP 在 LAION-5B 上进行训练,包含约 58.5 亿条 图像-文本对。数据稀缺对于三维模式(例如 CT 和 MRI、跨机构的碎片化进一步限制了大规模医学基础的发展 模型。 影像学 数据规模和可用性 MAIRA-2 DINOv3 1M 10M 100M 1B 10B RadFM OpenCLIP 1M 10M 100M 1B 10B 医疗 非医疗 型号 型号 数据量(对数刻度) 数据量(对数刻度) 仅成像多模态 医疗和非医疗 AI 中的训练数据量:纯成像模型与多模态模型 资料来源:RAISE Health,2026 |图:2026年AI指数报告 图6.2.1 ===== 第270页 ===== 270 6.2 临床应用| 医学 | 2026 年人工智能指数报告 用于医学成像的视觉语言模型 (VLM) 已从放射学扩展到病理学, 皮肤科、眼科和心脏病科(图6.2.2)。在六个临床学科中,数量 研究模型和 FDA 批准的商业产品的数量不断增长,其中病理学的影响最大 新研究成果的集中发布。 Merlin 模型证明了强大的 CT 基础 可以利用放射学报告和 ICD 代码在单个 40GB GPU 上训练模型 培训,即使在资源有限的环境中也可以使用先进的医疗人工智能。 医学影像人工智能缺乏通用领域机器中常见的标准化跨模型基准 学习。不同专业的模型通常在不同的数据集上进行评估,从而直接 跨学科的绩效比较很困难。最近的 MICCAI 2025 挑战(CHIMERA、 UNICORN)代表了解决这一差距的早期努力。以人为本的评估,临床医生手动进行 审查模型输出,在出版物中变得更加普遍,并提供了更有力的临床证据 比词汇度量有用。 建模方法 Discipline Notable 发布 FDA 批准的类似模型 心脏病学 EchoJEPA (2026) 泛回声 (2025) 回声FM (2025) 回声Prime (2025) 邦克希尔心电图-EF 心流斑块分析 肿瘤学 麝香 (2025) Allix5, Clairity (2025) 透明 (2.1.0) (2024) 眼科 EyeCLIP (2025) 元眼FM (2025) RETFound-绿色 (2025) 克拉鲁斯 (700)、卡尔蔡司 (2025) 放射学 MedGemma 1.5 (2026) 科利普利 (2026) TTE 3D CT (2025) 3DINO-ViT (2025) CT-FM (2025) 辐射FM (2025) 梅林 (2025) 公文包分类:CARE Multi- 分诊 CT 身体 (2026) a2z-统一分类 (2025) 邦克山弹道导弹防御 (2025) 邦克山 AAQ (2025) Brainomix 360 中风分类 (2025) 以斯拉闪电侠 (2025) 病理学 Virchow2G (2026) 克洛诺斯 (2025) 漩涡 (2025) 话题(2025) mSTAR (2025) 棱镜2 (2025) 路径 (2025) H-擎天柱-0 (2024) ArteraAI 前列腺 (2025) 野山羊前列腺检测 (2025) 图6.2.2 ===== 第271页 ===== 第271章 6.2 临床应用| 医学 | 2026 年人工智能指数报告 验证医学的前瞻性试验的数量 成像AI模型同比增长28.5%, 从2024年的417个增加到2025年的536个(图6.2.3)。这个 增长信号表明该领域正在超越以下研究范围 评估过去患者数据的人工智能对实时临床的影响 试验,医院所需的证据 将采用这些工具。最近的试验包括 MASAI, AI辅助的随机筛查准确性研究 乳房X线照相术,以及NOTIFY-1和NOTIFY-EXTEND, 测试是否会减弱心脏的早期迹象 人工智能在常规 CT 扫描中发现的疾病导致 医生开出更多预防性胆固醇处方 药物治疗。 前瞻性临床试验 2 3 3 6 5 6 14 34 58 99 160 203 第282章 第417章 第536章 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 100 200 300 400 500 报告前瞻性临床试验的论文数量 报告临床成像 ML/AI 模型前瞻性试验的论文数量,2010-25 资料来源:RAISE Health,2026 |图:2026年AI指数报告 图6.2.3 ===== 第272页 ===== 第272章 图6.2.42 2 法学硕士和医生对灰色问题管理案例的标准化管理推理点的箱线图。其中包括五个案例。 为每个案例生成三个 o1-preview 响应。之前的研究收集了每个病例的 5 个 GPT-4 回复,其中来自医生的 176 个回复 可以访问 GPT-4,以及 199 个可以访问传统资源的医生的回复。 亮点: 亮点: 法学硕士临床推理表现 临床医学中的人工智能代理 6.2 临床应用| 医学 | 2026 年人工智能指数报告 在多项实验评估中,OpenAI 的 o1-preview 推理模型在诊断推理上进行了测试 任务、管理推理片段、概率 推理场景,真实急诊室 (ED) 盲法专家评分案例(Brodeur 等人, 2025)。关于新英格兰医学杂志 (NEJM) 临床病理学会议 (n=143),模型 将正确的诊断纳入其鉴别诊断中 78% 时间,top-1 准确度为 52%。关于 NEJM 治愈者 案例(80个回复),实现了完美的修改-IDEA 得分为 78 分(满分 80 分),而 GPT-4 得分为 47 分(满分 80 分),28 主治医师为 80 人,住院医生为 80 人,其中 16 人。 在管理推理方面,o1 预览版的中位数分数 为 86%,而仅 GPT-4 为 42%,医生为 41% 可以使用 GPT-4,并且 34% 的医生可以使用 常规资源(图6.2.4)。 76真实ED 病例,o1 给出的诊断被评为“完全/非常接近” 67%–83% 的病例跨越三个诊断阶段, 每个阶段都超过两名主治医师。 这些结果表明目前的法学硕士已经超过 大多数现有的临床推理基准,但它们反映的是孤立的认知评估,而不是真实的 世界临床一体化。人工智能辅助推理是否能够改善患者的治疗结果仍然是一个问题 需要前瞻性试验的开放性问题。 自主和半自主人工智能代理已成为 2025-26 年临床人工智能的重大发展。 与单独生成预测或分类的传统人工智能模型不同,这些系统推理 跨多个步骤,访问外部工具和数据源,并与其他人工智能代理或人类协调 临床医生完成复杂的临床任务。 多代理框架,其中多个人工智能代理扮演专门的角色,例如诊断员 或药剂师 - 并通过结构化推理协议进行协作,已经在 基准评估。与单药基线相比,诊断准确率提高了 7% 到以上 60%,取决于临床任务的复杂性(Gorenshtein et al., 2025;Zheng et al., 2025;Liu et al., 2025) 等,2025)。微软的 AI Diagnostic Orchestrator (MAI-DxO) 与 OpenAI 的 o3 推理模型相结合, o1-pr 仅供评审 GPT 仅-4 医生+GPT -4 医生+R 资源 0 10 20 30 40 50 60 70 80 90 100 分数 o1-preview、GPT-4 和医生的比较 用于管理推理 资料来源:Brodeur 等人,2025 |图:2026年AI指数报告 ===== 第273页 ===== 273 亮点: 6.2 临床应用| 医学 | 2026 年人工智能指数报告 《新英格兰医学杂志》对具有诊断挑战性的病例的准确率达到 85.5%, 相比之下,21 名拥有 5 至 20 年临床经验的执业医师中,这一比例约为 20% 在可比较的条件下工作。 一组新的基准 专门设计用于 评估这些代理系统 已经开始出现。 2025年 确定范围审查 43 评估代理的研究 医疗保健领域的人工智能,其中 36 (84%) 发表于 2025. 在 MedAgentBench 上 (Jiang 等,2025),其中 评估LLM代理 虚拟电子健康记录 (EHR) 环境 300 个临床衍生任务, 表现最好的模型 任务成功率达到 69.7%。这些结果表明 尽管可以使用工具使用和迭代推理等先进功能,但证据基础 可靠的自主临床人工智能代理仍处于早期阶段。 本节跟踪临床人工智能部署的监管、制度和证据维度,从 FDA 对企业规模成果的设备授权。 在美国,FDA 510(k) 是人工智能医疗器械最常见的监管途径,要求 制造商证明新设备与市场上已有的设备基本相同 而不是进行新的临床试验。 510(k)批准的AI/ML相关设备数量达到246个 到 2025 年,继续从 2016 年 16 台设备开始的急剧上升轨迹(图 6.2.5)。 由于大多数已批准的放射学人工智能解决方案都是商业提供的,而不是作为开源工具, 医疗保健系统通常需要完成财务清算和成本效益论证 实施前。 Comp2Comp 是一个值得注意的例外,它是 CT 的开源 Python 包 使用两个模块(骨矿物质密度和腹主动脉定量)进行成像分析,确保 2025 年获得 FDA 批准。 部署、实施和取消实施 FDA 授权的支持 AI/ML 的设备 ===== 第274页 ===== 274 6.2 临床应用| 医学 | 2026 年人工智能指数报告 40 51 99 110 138 178 183 198 21 20 1 3 1 6 3 16 23 58 72 109 130 157 218 222 246 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 50 100 150 200 250 放射学 病理学 骨科 眼科 神经学 胃肠泌尿学 心血管学 已清除设备数量 FDA 510(k) 批准的支持 AI/ML 的成像相关医疗设备,2011–25 资料来源:FDA,2025 |图:2026年AI指数报告 图6.2.5 图6.2.6 截至 2025 年 12 月,FDA 已从 693 家企业中总共批准了 1,357 种支持 AI/ML 的医疗设备 17 个临床专业的不同公司(图 6.2.6)。年度授权达到258个 到 2025 年 9 月,已经超过了之前所有的全年总数。累计总数突破 2024 年设备数量达到 1,000 台的里程碑。2025 年有 98 家新公司进入该领域,继续 市场参与范围扩大的趋势(2023 年新进入者 103 个,2024 年新进入者 109 个)。 2 0 1 2 0 0 2 1 0 1 1 1 0 5 0 2 3 5 4 6 6 18 27 65 80 114 130 162 226 235 258 1995年 1996年 1997年 1998年 1999年 2000年 2001年 2002年 2003年 2004年 2005年 2006年 2007年 2008年 2009年 2010年 2011年 2012年 2013年 2014年 2015年 2016年 2017年 2018年 2019年 2020年 2021年 2022年 2023年 2024年 2025年 0 50 100 150 200 250 300 0 200 400 600 800 1,000 1,200 1,400 AI医疗设备数量 累计总数 1995-2025 年 FDA 批准的人工智能医疗设备数量 资料来源:FDA,2025 |图:2026年AI指数报告 ===== 第275页 ===== 275 6.2 临床应用| 医学 | 2026 年人工智能指数报告 放射科在授权的 AI/ML 设备中所占份额最大,为 1,039 台(共 1,357 台)(76.6%),其次是 按心血管(130 台设备,9.6%)和神经科(61 台设备,4.5%)划分(图 6.2.7)。非放射学 授权数量从 2016 年的 7 个增加到 2025 年的 60 个(图 6.2.8)。心脏病学、神经病学、 自 2020 年以来,麻醉学、胃肠泌尿学都出现了加速发展,这表明人工智能正在 开始从以成像为中心的应用扩展到更广泛的临床领域。 临床专业设备 8 8 9 10 11 12 12 20 20 30 35 36 38 82 93 0 10 20 30 40 50 60 70 80 90 100 趣睿科技 RaySearch Laboratories AB(出版) 斑马医疗视觉 大脑实验室 Clarius 移动健康公司 维智 海珀内 iSchemaView 三星 艾多克医疗有限公司 佳能医疗系统公司 飞利浦医疗保健 上海联影医疗 西门子医疗公司 通用电气医疗集团 AI/ML医疗设备数量 顶级公司获得 FDA 批准的 AI/ML 医疗设备数量,2016-25 资料来源:FDA,2025 |图:2026年AI指数报告 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 50 100 150 200 250 放射科 心血管 神经病学 麻醉学 血液学 胃肠泌尿科 其他 AI/ML医疗设备数量 FDA 按专业批准的 AI/ML 医疗设备数量,2016-25 资料来源:FDA,2025 |图:2026年AI指数报告 图6.2.8 图6.2.7 ===== 第276页 ===== 276 6.2 临床应用| 医学 | 2026 年人工智能指数报告 FDA 批准并不等于临床采用。财务、运营和体制障碍常常存在 监管授权和实际部署之间。授权设备市场集中 位于顶部,但总体上是碎片化的。 GE Healthcare 以 93 台设备领先,西门子 Healthineers 紧随其后 (82)、上海联影医疗 (38)、飞利浦医疗 (36) 和佳能医疗系统 (35), 和 Aidoc Medical (30)(图 6.2.9)。在至少拥有一台授权设备的 626 家公司中,大型企业 大多数人只持有一到两个,反映出专业进入者和成熟企业组成的广泛生态系统 制造商。 Ambient AI 抄写员,自动生成患者临床医生临床文档的工具 对话,到 2025 年,所有临床人工智能类别都会得到最广泛的采用。Abridge,领先的人工智能之一 2025 年 1 月,FDA 发布了关于人工智能设备软件功能的指南草案,应用了 Total 产品生命周期方法。预定的变更控制计划,一种允许迭代的机制 初始市场授权后的更新用于 2025 年约 10% 的许可。尽管如此 增长,对截至 2024 年 12 月所有 1,016 项授权的同行评审分析(Singh 等人,2025 年) 发现只有 2.4% 的临床研究设备得到随机对照试验数据的支持,其中 几乎所有设备都通过 510(k) 路径进入。 行业格局 环境人工智能文档 8 8 9 10 11 12 12 20 20 30 35 36 38 82 93 0 10 20 30 40 50 60 70 80 90 100 趣睿科技 RaySearch Laboratories AB(出版) 斑马医疗视觉 大脑实验室 Clarius 移动健康公司 维智 海珀内 iSchemaView 三星 艾多克医疗有限公司 佳能医疗系统公司 飞利浦医疗保健 上海联影医疗 西门子医疗公司 通用电气医疗集团 AI/ML医疗设备数量 顶级公司获得 FDA 批准的 AI/ML 医疗设备数量,2016-25 资料来源:FDA,2025 |图:2026年AI指数报告 图6.2.9 临床人工智能将于 2025 年从试点阶段转向企业规模部署,并与医疗系统一起使用 报告临床和操作领域的可衡量结果。发表最多的证据是 从环境 AI 文档、AI 支持的脓毒症预测以及生成式 AI 集成到临床中 工作流程。 2025 年企业规模部署 ===== 第277页 ===== 第277章 6.2 临床应用| 医学 | 2026 年人工智能指数报告 平台从大约 100 个扩展到 150 多个卫生系统,其中包括 Kaiser Permanente 的 部署于 40 家医院和 600 多个医疗机构。医院采用率达到63% 使用 Epic 的电子健康记录系统。 多个机构的结果是一致的。夏普医疗保健 (Sharp HealthCare) 报告称,医疗费用减少了 83% 笔记书写努力和工作相对价值单位增加 3.5%–6%——医生的标准衡量标准 临床生产力——每次接触。芝加哥大学医学院报告称,死亡率下降了 47% 认知负荷和患者注意力增加 58%。缅因州卫生局报告称,减少了 23% 花在临床记录上的时间,70.3% 的就诊中使用了该工具。在西北医学中心,医生 在超过一半的就诊中使用该工具后,每月新增 11.3 名患者,患者数量减少了 24% 记录时间,据报道投资回报率为 112%。斯坦福大学医疗保健中心进行了一项前瞻性研究 在 JAMIA(2025 年 2 月)上发表的 48 名医生的研究中发现,任务量和任务量在统计上显着减少 职业倦怠,据医生报告,每半天的门诊平均可节省 20 分钟的时间。 两个脓毒症预测系统报告了死亡率 2025 年大规模部署的减少。 有针对性的实时预警系统, 约翰·霍普金斯大学开发并商业化 由贝叶斯健康 (Bayesian Health) 部署,已部署到 13 克利夫兰诊所医院。报告结果 败血症相对减少 18.7% 死亡率,中位时间缩短 1.85 小时 第一次抗生素订购,正确识别 82% 的脓毒症病例,89% 的临床医生采用 率,重症监护病房减少 10% 利用率。 COMPOSER,一种深度学习模型 加州大学圣地亚哥分校健康监测超过 150 个变量 据报道,每位患者的败血症率降低了 17% 6,217 名入院患者的死亡率(绝对值 1.9%), 脓毒症集束依从性增加 5%,并且 估计每年可挽救 50 条生命。 卫生系统开始嵌入法学硕士驱动的 工具直接写入电子健康记录。 ChatEHR,一个生成简单语言的系统 患者记录摘要,记录 23,000 条 三年内为 1,075 名经过培训的用户提供了课程 数月的广泛推广。发生了 60% 的使用 通过自动提示,40% 通过 交互界面。另外,还有一个 AI 工具 对实验室、影像和病理结果生成简单语言的解释进行了评估 研究发表在《JAMA Network Open》(2025 年 8 月)上。在 93 名调查受访者中,85% 的人考虑过该工具 用户友好,72% 的人发现它有利于实验室结果,63% 的人发现它有利于成像结果。公开证据, 据报道,40% 的美国医生采用了实时证据检索平台。 人工智能支持的脓毒症预测 临床工作流程中的生成式人工智能 ===== 第278页 ===== 278 6.2 临床应用| 医学 | 2026 年人工智能指数报告 斯坦福-哈佛 ARISE 网络发布的首份临床人工智能现状报告(2026 年 1 月), 审查了 500 多项临床人工智能研究,发现近一半使用了考试式的问题,而不是真实的问题 患者数据。只有 5% 使用真实的临床数据。该报告得出的结论是,人工智能在以下情况下表现最有效: 支持而不是取代临床医生的判断。 另外,NOHARM 基准发现,领先的法学硕士产生了 11.8 至 14.6 的严重有害物质。 每 100 个临床病例的推荐数,其中 76.6% 为遗漏错误(例如,未推荐 一个关键的测试)。这些发现适用于根据开放式临床推理评估的通用法学硕士 任务,而不是推动当前采用的更狭窄的、特定于任务的工具。环境抄写员和败血症警报,用于 例如,在临床医生的监督下在有限的工作流程中进行操作。 治理框架也取得了进步。斯坦福医疗保健的 FURM 框架现在管理所有新的 该机构采用人工智能工具,GUIDE-AI 实验室正在努力将该框架提供给 其他卫生系统。 证据差距和治理 亮点: 医学中的数字孪生 医疗数字孪生是个体患者的动态、数据链接的计算表示, 随着时间的推移进行更新并支持预测、模拟和治疗优化。研究活动于 该领域增长迅速,出版物数量从 2015 年的近 0 篇增加到 2025 年的 372 篇(图 6.2.10)。 医疗保健数字孪生(CPC 类 G16H)的专利申请也讲述了类似的故事,申请数量从 2019 年的 30 件增加到 2016 年到 2025 年为 4,926 个(图 6.2.11)。 然而,概念的清晰度并没有跟上出版物的增长步伐。 npj Digital 的 2025 年范围审查 Medicine 评估了 2017 年至 2024 年间发表的 149 项人类数字孪生研究,发现只有 12.1%(18 项研究)令美国国家科学院满意 科学、工程和医学 (NASEM) 定义 数字孪生。该定义需要三个要素: 个性化、动态更新、预测性 能力(Sadée 等人,2025)。只有 19% 的系统 在真实的医疗保健环境中进行了测试。 结合数字孪生元素的临床试验 到 2025 年将加速,特别是在肿瘤学和 糖尿病。使用自适应技术治疗前列腺癌的试点试验 治疗将于 2025 年结束,显着增加 生存(Zhang 等人,2022)。新的试验延长了 乳腺癌治疗方法(梅奥诊所 II 期)和 卵巢癌(ACTOv II 期随机对照试验,n=80)。对于糖尿病来说, Twin Health 的一项随机对照试验 (n=150) 全身数字孪生平台发现 71% 参与者在 12 年内实现 HbA1c 低于 6.5% 几个月,同时安全地减少血液摄入量 降糖药物。 ===== 第279页 ===== 第279章 亮点: 6.2 临床应用| 医学 | 2026 年人工智能指数报告 图6.2.113 3 2025 年的门槛似乎低于 2024 年,因为并非所有 2025 年申请的专利都已公布或公开。 图6.2.12 0 0 0 1 6 16 47 55 116 176 第372章 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 50 100 150 200 250 300 350 出版物数量 tt 有关医学数字孪生的出版物数量, 2015–25 资料来源:RAISE Health,2026 |图:2026年AI指数报告 0 30 106 第292章 第478章 第667章 1,159 人 2,395 3,878 4,926 4,087 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 1,000 2,000 3,000 4,000 5,000 出版物数量 tt 观察到的医疗专利申请数量 数字孪生,2015–25 资料来源:RAISE Health,2026 |图:2026年AI指数报告 ===== 第280页 ===== 280 6.3 患者参与 随着患者通过临床工作流程和面向消费者的平台与人工智能工具进行更多互动, 我们已努力了解他们如何看待这些技术。本节探讨人工智能 生成的健康搜索结果、患者对医疗保健领域人工智能的态度以及新兴的证据基础 用于面向患者的人工智能工具。 6 医学 | 2026 年人工智能指数报告 人工智能生成的摘要响应(被谷歌称为“人工智能概述”)现在出现在大多数内容的顶部 与健康相关的搜索结果。平均而言,84%–92% 的健康相关查询会触发 AI 概览 跨越五种主要查询类型(图 6.3.1)。最有可能出现的症状和常见健康问题 触发概述(92%),然后是与治疗相关的查询(90%)和基于条件的查询 (84%–88%)。人工智能生成的摘要是健康信息搜索的常规功能,塑造了最初的结果 对大多数用户提出的问题的解释。 健康相关搜索的人工智能概述 84% 88% 90% 92% 92% 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 条件查询 (例如“痴呆症”) 条件问题查询 (例如,“什么是痴呆症?”) 治疗查询 (例如“痴呆症治疗”) 症状查询 (例如“痴呆症症状”) 常见健康查询 (例如,“流脓是否意味着已被感染?”) 包含“AI 概述”的查询百分比 返回“人工智能概述”的健康搜索查询比例 资料来源:RAISE Health,2026 |图:2026年AI指数报告 图6.3.1 ===== 第281页 ===== 第281章 6.3 患者参与 | 医学 | 2026 年人工智能指数报告 2020 年至 2025 年间,从患者角度看待医疗保健领域人工智能的出版物数量增长了十倍 (图6.3.2)。有条件接受成为文献中的普遍观点。患者 倾向于支持人工智能发挥辅助作用而不是自主决策,特别是在高 临床背景(Fee 等人,2025;Allen 等人,2025;Hmido 等人,2025)。人口结构差异 多项研究记录了接受程度(按年龄、性别、教育程度和种族划分) (Labinsky 等人,2025;Ogu 等人,2025;Li 等人,2025)。 维护人际关系成为一个一致的主题,患者发现了潜在的 失去同理心护理是首要问题(Carl 等人,2025 年;Davis 等人,2025 年)。对人工智能的信任似乎是 临床医生介导而不是技术评估。提供商认可是关键决定因素 患者接受度(Berger 等人,2025;Machado 等人,2025;Nong 等人,2025)。透明度和 人工智能使用的披露在不同人群中同样受到优先考虑,新兴的披露框架提供了 临床环境的实用指南(图 6.3.3)。 患者对医疗保健领域人工智能的看法 9 11 6 28 48 102 2020 2021 2022 2023 2024 2025 0 20 40 60 80 100 出版物数量 关于患者对医疗保健领域人工智能认知的出版物数量,2020-25 资料来源:RAISE Health,2026 |图:2026年AI指数报告 图6.3.2 ===== 第282页 ===== 第282章 人工智能用例和患者通知建议 资料来源:Mello 等人,2025 说明性人工智能用例和患者通知框架 用于确定何时需要患者同意、通知或两者都不需要的两个问题决策框架 同意书 使用前需要 通知 告知患者使用了 AI 两者都不是 无需同意或通知 人工智能引导的非自主手术机器人 手术具有相当大的风险;患者可以选择 非机器人手术。 基因组药物反应和治疗计划工具 不准确可能会导致不良结果;病人可以 选择不使用该工具。 HCM 筛查算法(超声心动图数据) 了解 AI 建议的后续行动可能会影响 患者决定接受。 预测算法:手术室中用于输血的库存血液 患者不能影响手术决策;血 可用性并不能取代输血同意。 AI辅助乳腺X线摄影判读 优于人类阅读;寻求替代 其他地方的护理会增加伤害风险。 放射科医生指示成像的 GenAI 总结 调查结果 危害风险低;该工具仅总结了放射科医生的 自己的口述输入。 安全停止日常实验室的算法 测试 患者不能选择退出或要求进行检测;订购 决定权仍由临床医生决定。 GenAI 工具提交事先授权请求 保险公司 伤害风险低(拒绝可以上诉);病人 无法亲自审查授权请求。 GenAI 工具起草对患者电子邮件的回复 不准确可能会造成伤害;知情的患者可以 问题得到意想不到的答复。 环境人工智能生成诊所就诊摘要 患者可以查看摘要的准确性。 (同意 某些州法律要求。) 不 不 是的 否 两个问题都回答“否” 两者都没有 是的 临床环境中部署的人工智能工具 问题1 是否使用了该人工智能工具——或者其输出是否不准确—— 是否存在对患者造成伤害的风险? 问题2 患者有机会吗 表达代理回应 披露人工智能的使用? 无伤害/不准确风险且无需患者 代理机会 6.3 患者参与 | 医学 | 2026 年人工智能指数报告 图6.3.3 内科、放射科和肿瘤科是该领域最常出现的专业 文献(图6.3.4)。美国、英国、德国占比最大 出版物的数量,而来自撒哈拉以南非洲、拉丁美洲和东南亚的研究仍然存在 代表性不足(图 6.3.5)。研究以儿童和青少年为参与者,而不是 仅从父母或看护者的角度出发的情况仍然很少见。 ===== 第283页 ===== 第283章 6.3 患者参与 | 医学 | 2026 年人工智能指数报告 1 1 1 1 1 1 1 1 1 2 2 2 2 3 3 3 5 5 6 6 7 7 7 7 10 12 12 16 24 70 0 10 20 30 40 50 60 70 麻醉 肾脏病学 血液学 老年医学 耳鼻喉科 预防与恢复 神经外科 胸外科 移植 姑息治疗 胃肠病学 内分泌科 风湿病学 遗传学/基因组学 正交 儿科 急诊医学 心脏病学 神经病学 泌尿科 皮肤科 牙科 外科(普通) 眼科 精神病学 肿瘤学 妇产科 放射科 内科 一般医疗保健 出版物数量 医学专业 探索患者对医疗保健中人工智能的看法的出版物中出现的医学专业,2020-25 资料来源:RAISE Health,2026 |图:2026年AI指数报告 1–2 3–5 6–10 11–30 31–70 无数据 2020-25 年患者对医疗保健领域人工智能看法的出版物的地理分布(按国家/地区划分) 资料来源:RAISE Health,2026 |图:2026年AI指数报告 图6.3.4 4 图6.3.55 4 出版物可能带有多个专业标签。 5 出版物可能带有多个国家的标签;包括原籍国。总共有 39 个国家/地区代表 (N = 204)。 ===== 第284页 ===== 第284章 6.4 道德考虑 6 医学 | 2026 年人工智能指数报告 本节追踪医学人工智能出版物中道德披露的数量和焦点,借鉴 对 2021 年 1 月至 2025 年 12 月 PubMed Central 的文献计量分析。确定了出版物 使用医疗人工智能和伦理学的搜索词,然后根据数据共享、算法的重点进行分类 共享、生物安全和全球健康。道德主题可以分为算法、治理或 社会关注。 在 2025 年医疗 AI 出版物总数中,43.4% 讨论了伦理主题——高于 2025 年的 37.1%。 2024 年(图 6.4.1)。两年间此类出版物的绝对数量增加了一倍多。 在讨论的具体主题中,增长集中在治理方面,超过了算法 和社会关注(图 6.4.2)。 2025年,治理相关出版物数量达到1,228种, 相比之下,算法问题为 896 分,社会问题为 874 分。 尽管政策讨论中对生物安全给予了关注,但该主题在医学领域相对尚未得到探索。 人工智能出版物。到 2025 年,这些出版物中只有 14 篇讨论了生物安全,直接讨论的就更少了。 解决滥用或双重使用的道德影响(图 6.4.3)。 体积和浓度 295 第449章 624 1,114 2,378 1,311 1,650 人 1,900 人 3,000 5,477 2021 2022 2023 2024 2025 0 1,000 2,000 3,000 4,000 5,000 医疗人工智能与伦理 医疗人工智能 出版物数量 医学人工智能和伦理出版物数量,2021–25 资料来源:RAISE Health,2026 |图:2026年AI指数报告 图6.4.1 ===== 第285页 ===== 第285章 6.4 道德考虑 | 医学 | 2026 年人工智能指数报告 107 199 第241章 第471章 896 130 170 278 第544章 1,228 72 121 182 第347章 第874章 2021 2022 2023 2024 2025 0 200 400 600 800 1,000 1,200 算法治理社会 出版物数量 按伦理主题划分的医学人工智能出版物数量,2021-25 资料来源:RAISE Health,2026 |图:2026年AI指数报告 图6.4.2 图6.4.3 5 4 8 13 14 2021 2022 2023 2024 2025 0 2 4 6 8 10 12 14 16 出版物数量 资料来源:RAISE Health,2026 |图:2026年AI指数报告 医学人工智能和生物安全出版物的数量, 2021–25 ===== 第286页 ===== 第286章 6.4 道德考虑 | 医学 | 2026 年人工智能指数报告 全球卫生是治理主导的例外 模式。涉及全球健康的出版物 2025 年,51.8%(193 人中的 100 人)还提到了道德主题 (图6.4.4)。欧洲以 38 种出版物领先,其次是 东亚(31)和北美(28),而撒哈拉以南地区 非洲、拉丁美洲和大洋洲的产量均较少 多于 5 个(图 6.4.5)。与其他人不同 子类别审查的社会问题——包括 公平、正义和可及性——在全球排名最高 全球卫生背景,超越治理和 算法问题(图 6.4.6)。研究人员正在研究 全球健康领域的人工智能提出了不同的问题 他们的同行在更广泛的领域工作。 全球健康:不同的道德焦点 7 4 8 27 100 22 10 26 67 193 2021 2022 2023 2024 2025 0 50 100 150 200 医疗人工智能、全球健康和伦理 医疗人工智能和全球健康 出版物数量 医疗人工智能、全球健康和伦理出版物数量,2021-25 资料来源:RAISE Health,2026 |图:2026年AI指数报告 图6.4.2 ===== 第287页 ===== 第287章 6.4 道德考虑 | 医学 | 2026 年人工智能指数报告 23 25 17 号 11 9 3 3 10 5 4 3 4 4 5 38 31 28 14 11 8 5 4 3 3 欧洲 东亚 北欧 thA 美国 一个 南亚 中东 AST 撒哈拉以南非洲 一个 东南亚 也 非洲 一个 拉丁语A 美国 一个 大洋洲 0 5 10 15 20 25 30 35 40 45 2025 2024年 2023年 2022年 2021年 出版物数量 医疗人工智能、全球健康和伦理出版物数量,2021-25 资料来源:RAISE Health,2026 |图:2026年AI指数报告 4 1 2 14 29 2 1 4 12 43 5 2 4 13 54 2021 2022 2023 2024 2025 0 10 20 30 40 50 60 算法治理社会 出版物数量 2021-25 年按伦理主题划分的医疗人工智能和全球健康出版物数量 资料来源:RAISE Health,2026 |图:2026年AI指数报告 图6.4.5 图6.4.6 ===== 第288页 ===== 288 教育 7 各行各业对人工智能教育的需求都在增长 水平,但提供它所需的系统是 仍在追赶。计算机科学专业招生 专上院校的比例甚至在下降 随着人工智能相关专业越来越受欢迎。学生在 大学和 K-12 级别都在使用人工智能 工具数量众多,但可以访问特定于 AI 的工具 课程作业和教师培训仍然有限。 包括美国在内的各国政府 推动将人工智能素养纳入他们的课程 以保持其国家的竞争优势。然而, 人工智能教育数据碎片化且滞后, 本章的大部分分析依赖于 以计算机科学教育数据作为代理。为了调查 当前人工智能和计算机科学教育的格局,这 本章是与 2026 年人工智能指数报告 卡普尔基金会,计算机科学教师 协会 (CSTA),扩展计算 教育途径 (ECEP) 联盟,以及 人工智能指数。卡普尔基金会的工作地点是 种族平等与技术的交叉点; CSTA 是一个全球性会员组织 支持教育工作者扩大计算机科学的使用范围 教育,ECEP 是一个集体影响力联盟 专注于扩大计算领域的参与 教育。 概述 ===== 第289页 ===== 第289章 章节亮点 7 .1 背景 7 .2 中学后计算机科学和人工智能教育 美国学位毕业生 全球信息通信技术毕业生 CS、CE 和信息学院 学生使用人工智能工具 7 .3 K–12 计算机科学和人工智能教育 美国 基础计算机科学 高级计算机科学 K-12 学生使用人工智能工具 教育标准、政策和指导 美国 K-12 州人工智能指南 美国联邦 K-12 AI 指南 亮点:实施差距 K-12 人工智能政策 全球人工智能和计算机科学教育 7 .4 AI技能习得 AI技能渗透 AI技能扩散 290 第291章 第292章 第292章 298 第302章 303 305 305 305 311 314 314 315 316 第317章 318 第319章 第319章 320 内容 7 教育 | 2026 年人工智能指数报告 ===== 第290页 ===== 290 内容 1 2024 年至 2025 年间,美国四年制大学的计算机科学入学率下降了 11%,但与人工智能相关的 研究生课程继续增长。 AI软件相关领域硕士毕业生增长17% 从 2023 年到 2024 年,即使在 CS 招生期间,对 AI 专业化的需求仍然持续 冷却。 2 美国在信息、通信和技术生产方面仍然处于全球领先地位 (信息通信技术)各个学位级别的毕业生,但其他国家的增长速度更快。土耳其、巴西、 近年来,墨西哥的信息通信技术毕业生产出增长更快。 3 现在,五分之四的美国高中生和大学生在作业中使用人工智能,但学校 政策没有跟上。只有一半的初中和高中有人工智能政策,只有6% 的教师表示这些政策很明确。学生最常使用生成式人工智能进行研究, 论文编辑和头脑风暴。 7 教育 | 2026 年人工智能指数报告 章节亮点 4 现在有超过 90% 的国家向中小学生提供计算机科学课程,但 人工智能教育的普及速度较慢。中国和阿拉伯联合酋长国均授权 人工智能教育从 2025-26 学年开始,标志着正式人工智能教学的转变 国家层面。 5 美国和加拿大新增人工智能博士人数较 2022 年增加 22% 2024 年,但工业领域的份额保持平稳。 所有的增长都流向了学术界 扭转了长达十年的新人工智能博士主要流入行业角色的趋势。 6 人们正在正规教育之外获取人工智能技能,并在他们的生活中宣传人工智能技能。 继续。 在大多数国家,人工智能素养的增长速度快于工程导向的人工智能技能。的 阿拉伯联合酋长国、智利和南非是例外,这些国家的工程技术表现出色 2022年以来增长更陡。 ===== 第291页 ===== 第291章 7.1 背景 人工智能在教育中的作用的扩展速度超过了跟踪它所需的数据以及本章中的大部分数据 范围有限、时间滞后或两者兼而有之。高等教育数字反映了 2023-24 年的完成率 学年,尚未显示由于对人工智能的兴趣日益浓厚而导致的入学变化或报告 计算机科学(CS)入学人数下降。来自 OECD 的全球数据仅提供到 2023 年 并且不包括印度、中国和非洲大部分地区等国家。在 K-12 级别,几乎没有 人工智能相关课程或项目的标准化数据。可用的指标仅限于 CS 教育,并不能完全代表人工智能教育。考虑到这些限制,需要进行完整的评估 人工智能教育日益增长的需求以及当前系统如何满足这一需求是不可能的。 关于教育领域人工智能的公众讨论不断扩大,吸引了开发人员、教育技术供应商、 教育倡导者、政策制定者和教育工作者围绕人工智能的作用,特别关注其风险 和好处。1 人们普遍认为人工智能素养对所有学生的重要性及其指定 作为学术、专业和公民导航和成功的关键技能。公共话语往往无法 区分人工智能教育、人工智能素养和人工智能教育(图7.1.1)。人工智能在教育领域的应用 AI完成教学任务。人工智能素养是指基础知识所需的知识 了解人工智能、它的工作原理、如何使用它以及使用的风险。人工智能教育建立在人工智能素养之上 加上构建人工智能系统所需的技术技能。因为这些术语经常被模糊化 公开讨论、明确讨论哪个主题对于教育工作者、研究人员和 政策制定者就人工智能进行交流。 本章重点讨论人工智能教育和人工智能在教育中的应用。关于人工智能教育的全面数据在哪里 不可用,而是提供计算机科学 (CS) 教育数据。 1 《人工智能世界中学生的新方向:繁荣、准备、保护》,美国大学普及教育中心 2026 年 1 月发布的报告 布鲁金斯学会的作者提供了与教育领域人工智能相关的风险和机遇的广泛目录。在附件 A 中,他们提供了四种 过去五年发布的框架中对“人工智能素养”的定义。 7 教育 | 2026 年人工智能指数报告 人工智能在教育中 人工智能在素养中 人工智能教育 人工智能的运用 教学工具和 学习 AI素养+ 技术技能 构建人工智能所需的 基础的 对人工智能的理解,如何 它的工作原理、如何使用它以及 使用风险 图7.1.1 ===== 第292页 ===== 第292章 7.2 高等教育计算机科学和 人工智能教育 7 教育 | 2026 年人工智能指数报告 学生中生成式人工智能的使用重塑了关于生成式人工智能的目的和作用的对话 高等教育。与此同时,编码角色的任务自动化似乎减缓了进入的速度—— CS 毕业生的就业市场。这些转变导致高等教育中计算机科学入学率的下降 机构。 2024年至2025年间,四年制大学计算机科学专业本科生招生情况 下降了 11%。2 第 4 章(经济)记录了劳动力市场的类似转变,其中就业 自 2024 年以来,尽管整体人工智能招聘有所增长,但最年轻的软件开发人员数量却有所下降。所以, 学生正在应对不断变化的就业市场,但由于学位完成比入学滞后数倍 年,完整的影响需要一段时间才能体现在数据中。 尽管 CS 入学率下降,但有证据表明 人工智能相关专业越来越受欢迎。 美国学位毕业生 之前版本的 AI 指数主要关注 CS 学位,因为很少有毕业生被归类为 人工智能专业.3 今年AI指数新增 人工智能相关专业,由 2025 年 1 月白色决定 众议院人工智能人才报告。报告对AI相关专业进行了划分 分为两类:AI软件,其中包括专业 例如人工智能、计算机编程/ 程序员、计算和应用数学; 和人工智能硬件,其中包括电气和 电子工程、凝聚态与材料 物理和工业工程.4 人工智能软件相关学位稳步上升 过去10年很受欢迎,尤其是在学士学位 和硕士水平(图7.2.1)。涨幅最大的是 已达到硕士水平,毕业生增加82% 2022 年至 2024 年期间增加 17%,2023 年期间增加 17% 到 2024 年,人工智能硬件相关学位的数量已 保持不变或下降;学士学位,特别是, 自 2020 年达到峰值以来已下降 13%。 2 下降的原因是计算机科学作为一个专业,而不是更广泛的计算机和信息科学及支持服务类别。 3 国家教育统计中心 (NCES) 制定的教学项目分类 (CIP) 将“人工智能- 智能和机器人”,CIP 代码 11.0102。尽管该代码自 2016 年起就可用,但很少有学校使用它,而是选择分类 11.0101 以下的学生(计算机和信息科学,普通)。 4 完整的专业列表请参阅方法论部分。 ===== 第293页 ===== 293 7 .2 高等教育计算机科学和人工智能教育| 教育 | 2026 年人工智能指数报告 23% 27% 36% 31% 77% 73% 64% 69% 副学士 学士 硕士 博士 0% 20% 40% 60% 80% 100% 16% 21% 27% 24% 84% 79% 73% 76% 副学士 学士 硕士 博士 0% 20% 40% 60% 80% 100% 男 女 人工智能毕业生的百分比 人工智能毕业生的百分比 AI-软件相关 AI-硬件相关 2024 年美国人工智能相关高等教育毕业生(按性别) 资料来源:国家教育统计中心,高等教育综合数据系统,2024 年 |图:2026年AI指数报告 2014 2016 2018 2020 2022 2024 0 20 40 60 80 100 120 2014 2016 2018 2020 2022 2024 0 20 40 60 80 100 120 副学士 学士 硕士 博士 人工智能毕业生人数(万人) 人工智能毕业生人数(万人) AI-软件相关 AI-硬件相关 23.44 120.95 94.92 6.03 18.75 96.15 43.37 9.55 美国人工智能相关新毕业生,2014-24 资料来源:国家教育统计中心,高等教育综合数据系统,2024 年 |图:2026年AI指数报告 图7.2.1 图7.2.2 尽管女性在人工智能相关学位中的比例略高,但她们的比例仍然不足 人工智能软件相关学位的比例高于人工智能硬件相关学位,最高为人工智能的 36% 软件相关硕士毕业生(图7.2.2)。相比之下,女性继续占 近 60% 的学位。 ===== 第294页 ===== 294 7 .2 高等教育计算机科学和人工智能教育| 教育 | 2026 年人工智能指数报告 对于人工智能软件相关学位,西班牙裔/拉丁裔、黑人、夏威夷原住民/太平洋岛民和原住民 美国/阿拉斯加学生在各个级别的代表性不足(图 7.2.3)。白人学生也是 代表性不足,尽管程度较轻,但博士级别除外。多种族和亚洲学生 比例过高,其中亚洲硕士生比例最高。 每个种族群体内不同学位水平的代表性模式往往是一致的(图 7.2.4)。 主要的例外是亚洲学生和美洲原住民/阿拉斯加学生,他们的代表情况各不相同 按学位级别。西班牙裔/拉丁裔学生在各个级别的代表性都略显不足,而夏威夷原住民/ 太平洋岛民和黑人学生在各个级别的代表性仍然不足。 0 1 2 3 美洲原住民/阿拉斯加人 NHPI 黑色 西班牙裔 白色 两个或更多 亚洲人 同事的 学士 硕士 博士 人工智能软件相关毕业生与所有毕业生人口统计数据的比率 2024 年美国按种族/族裔划分的所有高等教育毕业生与人工智能软件相关的情况 资料来源:国家教育统计中心,高等教育综合数据系统,2024 年 |图:2026年AI指数报告 0 1 2 3 黑色 NHPI 西班牙裔 美洲原住民/阿拉斯加人 两个或更多 白色 亚洲人 同事的 学士 硕士 博士 人工智能硬件相关毕业生与所有毕业生人口统计数据的比率 2024 年美国所有高等教育毕业生(按种族/民族)与人工智能硬件相关的情况 资料来源:国家教育统计中心,高等教育综合数据系统,2024 年 |图:2026年AI指数报告 图7.2.3 图7.2.4 ===== 第295页 ===== 295 大多数人工智能相关研究生都是非美国居民,这一模式是一致的 与往年CS学位分析(图7.2.5)。在人工智能软件相关领域尤其如此 硕士学位,其中 67% 的毕业生是非居民。然而,由于联邦政府 撤销学生签证并阻止国际学生入学,导致国际学生数量进一步下降 预计未来几年将有非居民毕业生。 7 .2 高等教育计算机科学和人工智能教育| 教育 | 2026 年人工智能指数报告 96% 89% 33% 45% 11% 67% 55% 副学士 学士 硕士 博士 0% 20% 40% 60% 80% 100% 98% 93% 47% 44% 7% 53% 56% 副学士 学士 硕士 博士 0% 20% 40% 60% 80% 100% 居民 非居民 人工智能毕业生的百分比 人工智能毕业生的百分比 AI-软件相关 AI-硬件相关 2024 年美国人工智能相关高等教育毕业生(按居住地划分) 资料来源:国家教育统计中心,高等教育综合数据系统,2024 年 |图:2026年AI指数报告 图7.2.5 一系列机构在人工智能相关领域培养了最多数量的毕业生5,其中包括公立大学 和私立大学(图 7.2.6)。佐治亚理工学院是唯一进入前十名的学校 涵盖人工智能软件和硬件相关学位的各个级别。其他至少出现的大学 曾出现在这两个名单中的包括加州大学伯克利分校(4 次提及);伊利诺伊大学厄巴纳分校- 香槟 (4);密歇根大学安娜堡分校 (4);宾夕法尼亚州立大学 (3);东北 大学(2);卡内基梅隆大学 (2);麻省理工学院 (2);和斯坦福大学 大学 (2)。随着越来越多的机构在本科阶段增加人工智能专业,这些排名可能会 未来几年将发生转变。 5 一些机构将人工智能相关毕业生归入更广泛的项目类别,而不是人工智能特定的项目类别,这可能会导致少计 在人工智能课程包含在通用计算机科学或工程课程中的学校。 ===== 第296页 ===== 296 7 .2 高等教育计算机科学和人工智能教育| 教育 | 2026 年人工智能指数报告 博士 马里兰大学全球校园: 2,350 人 西部州长大学:2,029 加州大学伯克利分校:1,983 马里兰大学学院公园分校: 1,877 南新罕布什尔大学: 1,733 密歇根大学安娜堡分校:1,723 罗格斯大学:1,329 佐治亚理工学院:1,302 加州大学圣地亚哥分校: 1,204 人 宾夕法尼亚州立大学:1,181 佐治亚理工学院:3,394 德克萨斯大学达拉斯分校:2,555 哥伦比亚大学:2,481 北德克萨斯大学:2,454 特里尼大学:2,114 伊利诺伊大学厄巴纳分校- 香槟:1,905 东北大学:1,720 南加州大学:1,676 德克萨斯大学阿灵顿分校:1,430 波士顿大学:1,360 佐治亚理工学院:155 麻省理工学院: 154 伊利诺伊大学厄巴纳分校- 香槟:128 卡内基梅隆大学:128 密歇根大学安娜堡分校:106 加州大学洛杉矶分校: 105 加州大学圣地亚哥分校:104 华盛顿大学:104 加州大学伯克利分校:103 斯坦福大学:95 1 2 3 4 5 6 7 8 9 10 硕士 学士 2024 年人工智能相关学位毕业生的顶尖高等教育机构 资料来源:国家教育统计中心,高等教育综合数据系统,2024 年 | 图:2026年AI指数报告 AI软件相关 AI硬件相关 博士 普渡大学:2,083 德克萨斯农工大学:1,857 佐治亚理工学院:1,400 东北大学:1,565 亚利桑那州立大学:1,090 纽约大学:959 普渡大学:329 密歇根大学安娜堡分校:242 斯坦福大学:202 1 2 3 硕士 学士 ===== 第297页 ===== 第297章 7 .2 高等教育计算机科学和人工智能教育| 教育 | 2026 年人工智能指数报告 伊利诺伊大学厄巴纳分校- 香槟:1,391 俄亥俄州立大学:1,341 弗吉尼亚理工学院和州立大学 大学:1,039 宾夕法尼亚州立大学:1,002 加州大学伯克利分校:970 爱荷华州立大学:942 北卡罗来纳州立大学:914 密歇根大学安娜堡分校:941 约翰霍普金斯大学:939 卡内基梅隆大学:899 佐治亚理工学院:839 德克萨斯农工大学:740 圣何塞州立大学:737 普渡大学:731 佐治亚理工学院:198 麻省理工学院: 191 德克萨斯农工大学:189 伊利诺伊大学厄巴纳分校- 香槟:184 德克萨斯大学奥斯汀分校:180 加州大学伯克利分校:176 宾夕法尼亚州立大学:160 4 5 6 7 8 9 10 图7.2.6 AI博士毕业生继续选择行业 工作和丰厚的薪水比 学术工作,其中 65% 进入工业界 毕业后(图7.2.7)。这个百分比 近几年有所下降,低于 2022 年将达到 77% 的峰值。同时, 学术工作的比例增加了, 自 2022 年以来几乎翻了一番(图 7.2.8)。这个 挑战学术界的叙述 经历专家外流或“大脑” 排水。”人工智能博士毕业生比例 逐渐进入政府工作岗位 2021 年从 0.7% 的低点增至 2%。 ===== 第298页 ===== 298 7 .2 高等教育计算机科学和人工智能教育| 教育 | 2026 年人工智能指数报告 76 64 101 74 85 77 134 116 162 180 153 195 280 278 288 72 63 47 51 43 42 63 60 73 65 61 84 79 103 145 154 134 154 132 136 123 201 178 238 249 219 第281章 第362章 第388章 第442章 2010年 2011年 2012年 2013年 2014年 2015年 2016年 2017年 2018年 2019年 2020年 2021年 2022年 2023年 20240 50 100 150 200 250 300 350 400 450 学术界 政府 工业 新增人工智能博士毕业生数量 美国新聘用人工智能博士 资料来源:CRA Taulbee 调查,2011-25 |图:2026年AI指数报告 加拿大按行业划分,2010–24 2010年 2011年 2012年 2013年 2014年 2015年 2016年 2017年 2018年 2019年 2020年 2021年 2022年 2023年 2024年 0% 10% 20% 30% 40% 50% 60% 70% 新人工智能博士毕业生(占总数的%) 1.96%,政府 31.59%, 学术界 62.75%, 工业 新人工智能博士的就业情况(占总数的百分比) 美国和加拿大按行业划分,2010–24 资料来源:CRA Taulbee 调查,2011-25 |图:2026年AI指数报告 图7.2.7 图7.2.86 全球信息通信技术毕业生 没有一个数据集可以提供对人工智能或计算机科学高等教育的完全标准化的核算。 所有国家。经济合作与发展组织(OECD)整理了数据 涵盖其成员国和一些非经合组织国家。7 国际标准分类 教育部提供了经合组织用来比较各国教育统计数据的框架。 信息和通信技术(ICT)包括“信息学、 信息和通信技术(CS)。这些主题涵盖了广泛的相关主题 用于处理和传输数字信息的新技术,包括计算机, 计算机化网络(包括互联网)、微电子、多媒体、软件和编程。” 美国在信息通信技术相关领域仍然处于全球领先地位,培养了更多的副学士学位毕业生, 学士、硕士和博士学位水平高于样本中的任何其他国家(图 7.2.9 至 7.2.12)。至多 的水平,其他国家的同比增长速度快于美国。在助理级别 (在国际图表中表示为短周期高等教育),土耳其的毕业生数量增加了 27%;在 本科阶段,巴西和土耳其的毕业生人数都增加了30%;墨西哥博士级别 毕业生人数增加了 76%。例外是在硕士级别,美国增加了 55% 的毕业生(尽管如前所述,美国的许多硕士毕业生并非美国人) 居民)。 6 图 7.2.8 中的总和并不等于 100%,因为每年都有一部分新的人工智能博士成为自营职业者、失业者或报告 CRA 调查中的“其他”就业状况。这些学生不包含在图表中。 7 虽然该数据集提供了一些国家/地区的见解,但它忽略了一些可能拥有大量 ICT 毕业生的国家。的 将印度、中国和非洲国家排除在外凸显了全球标准化数据收集的必要性,以确保将以下国家纳入其中: 在计算机教育方面进行了大量投资,并在全球人口中占很大比例。也有明显的滞后 收集和报告全球教育数据;因此,可获得数据的最近年份是 2023 年。每个国家的数据包括 从该国的机构毕业的任何学生,无论其国籍如何。 ===== 第299页 ===== 299 7 .2 高等教育计算机科学和人工智能教育| 教育 | 2026 年人工智能指数报告 1,273 1,889 2,157 2,885 2,946 3,720 7,249 10,820 6,983 9,425 12,852 16,275 16,464 17,764 38,746 1,372 1,476 2,100 2,897 3,202 人 4,536 5,322 5,835 6,685 10,839 14,867 15,885 20,884 20,932 39,213 0 3,000 6,000 9,000 12,000 15,000 18,000 21,000 24,000 27,000 30,000 33,000 36,000 39,000 奥地利 新西兰 以色列 瑞典 智利 墨西哥 澳大利亚 法国 韩国 英国 哥伦比亚 加拿大 土耳其 西班牙 美国 2023年 2022年 新ICT短期高等教育毕业生人数 2022-23 年按国家划分的新 ICT 短周期高等教育毕业生 资料来源:经合组织,2025 |图:2026年AI指数报告 5,090 6,256 6,650 6,023 10,472 13,053 14,584 12,817 13,054 19,603 20,435 21,365 32,738 61,760 116,401 5,506 6,786 7,118 7,774 11,516 13,590 14,363 14,688 15,171 19,591 20,703 21,504 33,861 80,316 122,814 0 8,000 16,000 24,000 32,000 40,000 48,000 56,000 64,000 72,000 80,000 88,000 96,000 104,000 112,000 120,000 智利 罗马尼亚 西班牙 土耳其 法国 加拿大 澳大利亚 波兰 秘鲁 韩国 英国 德国 墨西哥 巴西 美国 2023年 2022年 新ICT本科毕业生人数 2022-23 年按国家划分的新 ICT 学士学位毕业生 资料来源:经合组织,2025 |图:2026年AI指数报告 图7.2.9 图7.2.10 ===== 第300页 ===== 300 7 .2 高等教育计算机科学和人工智能教育| 教育 | 2026 年人工智能指数报告 2,200 2,403 2,452 2,910 4,044 3,214 3,373 3,728 2,982 4,164 9,716 12,500 13,940 21,688 55,706 2,334 2,461 2,727 3,261 3,342 人 3,588 3,758 3,906 4,010 4,571 8,895 12,650 15,233 27,624 86,301 0 6,000 12,000 18,000 24,000 30,000 36,000 42,000 48,000 54,000 60,000 66,000 72,000 78,000 84,000 罗马尼亚 意大利 荷兰 韩国 加拿大 西班牙 墨西哥 爱尔兰 哥伦比亚 波兰 澳大利亚 德国 法国 英国 美国 2023年 2022年 新ICT硕士毕业生人数 2022-23 年按国家划分的新 ICT 硕士毕业生 资料来源:经合组织,2025 |图:2026年AI指数报告 120 122 140 142 194 144 第247章 309 第374章 第425章 617 第733章 1,008 1,156 2,759 146 146 152 187 248 第254章 第289章 第324章 第419章 第483章 第585章 第830章 1,004 1,218 2,874 0 200 400 600 800 1,000 1,200 1,400 1,600 1,800 2,000 2,200 2,400 2,600 2,800 瑞典 荷兰 芬兰 瑞士 意大利 墨西哥 西班牙 加拿大 巴西 澳大利亚 韩国 法国 德国 英国 美国 2023年 2022年 新ICT博士毕业生数量 2022-23 年按国家划分的新 ICT 博士毕业生 资料来源:经合组织,2025 |图:2026年AI指数报告 图7.2.11 图7.2.12 ICT 毕业生的性别平等在不同国家和不同学位水平上仍然不平衡(图 7.2.13)。开 平均而言,女性占副学士学位毕业生的 20%,占学士毕业生的 22%,占硕士毕业生的 29% 毕业生中,博士毕业生占29%。虽然副学士学位毕业生的比例逐年下降, 博士毕业生比例增加了4个百分点。信息通信技术毕业生中至少有一半是女性 秘鲁提供副学士学位,哥斯达黎加和拉脱维亚提供博士学位。土耳其已报告性别 2023 年,各个级别的性别平等程度越来越接近全球平均水平。 ===== 第301页 ===== 301 7 .2 高等教育计算机科学和人工智能教育| 教育 | 2026 年人工智能指数报告 20% 22% 29% 29% SC B M 博士 0% 50% 100% 25% 23% 33% 32% SC B M 博士 0% 50% 100% 11% 20% 23% 22% SC B M 博士 0% 50% 100% 10% 16% 19% 27% SC B M 博士 0% 50% 100% 不适用 17% 18% 19% SC B M 博士 0% 50% 100% 不适用 32% 37% 44% SC B M 博士 0% 50% 100% 30% 22% 34% 24% SC B M 博士 0% 50% 100% 13% 12% 20% 25% SC B M 博士 0% 50% 100% 27% 17% 28% 21% SC B M 博士 0% 50% 100% 25% 21% 22% 50% SC B M 博士 0% 50% 100% 不适用 22% 25% 25% SC B M 博士 0% 50% 100% 不适用 19% 19% 17% SC B M 博士 0% 50% 100% 13% 19% 39% 不适用 SC B M 博士 0% 50% 100% 不适用 27% 47% 36% SC B M 博士 0% 50% 100% 不适用 25% 31% 28% SC B M 博士 0% 50% 100% 9% 18% 23% 26% SC B M 博士 0% 50% 100% 不适用 21% 26% 21% SC B M 博士 0% 50% 100% 不适用 33% 45% 26% SC B M 博士 0% 50% 100% 16% 17% 21% 13% SC B M 博士 0% 50% 100% 0% 18% 23% 20% SC B M 博士 0% 50% 100% 37% 29% 37% 35% SC B M 博士 0% 50% 100% 47% 31% 24% 26% SC B M 博士 0% 50% 100% 13% 16% 24% 25% SC B M 博士 0% 50% 100% 娜娜娜娜 SC B M 博士 0% 50% 100% 24% 32% 26% 19% SC B M 博士 0% 50% 100% 23% 21% 27% 86% SC B M 博士 0% 50% 100% 北美 16% 28% 40% SC B M 博士 0% 50% 100% 15% 18% 36% 19% SC B M 博士 0% 50% 100% 27% 27% 40% 31% SC B M 博士 0% 50% 100% 10% 15% 30% 25% SC B M 博士 0% 50% 100% 36% 31% 41% 32% SC B M 博士 0% 50% 100% 22% 25% 27% 31% SC B M 博士 0% 50% 100% 50% 28% 不不不 SC B M 博士 0% 50% 100% 0% 24% 18% 21% SC B M 博士 0% 50% 100% 9% 21% 35% 24% SC B M 博士 0% 50% 100% 不适用 32% 42% 40% SC B M 博士 0% 50% 100% 不适用 17% 18% 22% SC B M 博士 0% 50% 100% 8% 20% 25% 31% SC B M 博士 0% 50% 100% 12% 15% 21% 25% SC B M 博士 0% 50% 100% 30% 40% 44% 32% SC B M 博士 0% 50% 100% 8% 15% 18% 21% SC B M 博士 0% 50% 100% 26% 28% 34% 30% SC B M 博士 0% 50% 100% 26% 18% 33% 26% SC B M 博士 0% 50% 100% 25% 24% 35% 27% SC B M 博士 0% 50% 100% 短期 (SC) 学士 (B) 硕士 (M) 博士 平均 澳大利亚 奥地利 比利时 巴西 保加利亚 加拿大 智利 哥伦比亚 哥斯达黎加 克罗地亚 捷克共和国 丹麦 爱沙尼亚 芬兰 法国 德国 希腊 匈牙利 冰岛 爱尔兰 以色列 意大利 日本 韩国 拉脱维亚 立陶宛 卢森堡 墨西哥 荷兰 新西兰 挪威 秘鲁 波兰 葡萄牙 罗马尼亚 斯洛伐克 斯洛文尼亚 西班牙 瑞典 瑞士 土耳其 英国 美国 2022-23 年按国家划分的新 ICT 高等教育毕业生中女性比例 资料来源:经合组织,2025 |图:2026年AI指数报告 女性 ICT 高等教育毕业生的百分比 这些毕业生的构成逐年保持一致,类似于人工智能作者的模式 以及第一章中记录的发明人,其中性别比例在过去 15 年间几乎没有变化 年。 图7.2.13 ===== 第302页 ===== 第302章 CS、CE 和信息学院 2024-25 年,有超过 6,600 名 CS、CE (计算机工程)和信息学院 美国和加拿大(图7.2.14)。几乎 其中三分之二担任终身职位。 计算机研究协会 (CRA) 预测表明教职人员数量将 未来两个学年将增加 博士后职位增长最快。8 西班牙裔/拉丁裔、黑人和原住民 教师职位中的代表性不足,因为 除亚洲女性外都是女性(图 7.2.15).9 亚洲和夏威夷原住民/太平洋地区 岛民中男性比例过高 师资队伍。 8 由于 CRA 方法的变化,这些数字无法与之前版本的 AI 指数中发布的教师人数直接比较。 9 全国教师人口统计数据来自美国 (NCES),而教师数据还包括加拿大。博士后不是 包括在比较数据中,因为他们不存在于国家教师人口统计中。 7 .2 高等教育计算机科学和人工智能教育| 教育 | 2026 年人工智能指数报告 4,220 4,523 4,721 1,152 人 1,216 1,299 第691章 第691章 772402 第436章 第469章 2024–25 2025–26 2026–27 0 1,000 2,000 3,000 4,000 5,000 6,000 7,000 8,000 终身教职教师 教学教授 其他教师 非终身教授研究员教师 博士后 CS、CE 和信息教师数量 计算机科学、计算机科学和信息学教师数量 资料来源:CRA Taulbee 调查,2025 年 |图:2026年AI指数报告 美国和加拿大,2024–26 6,683 7,101 7,501 图7.2.14 图7.2.15 0.00 0.50 1.00 1.50 2.00 2.50 3.00 土著或阿拉斯加原住民 黑人或非裔美国人 西班牙裔,任何种族 不止一场比赛 白色 非居民 夏威夷原住民或太平洋岛民 亚洲人 男 女 CS、CE 和信息教师与所有教师人口统计数据的比率 2024 年按种族/民族和性别划分的计算机科学、计算机科学和信息学院教师与全国教师人口统计数据 资料来源:CRA Taulbee 调查,2025 年 |图:2026年AI指数报告 ===== 第303页 ===== 303 7 .2 高等教育计算机科学和人工智能教育| 教育 | 2026 年人工智能指数报告 虽然本章的重点是人工智能教育,但学生的学习方式也在发生变化。检查人工智能 教育,或者使用人工智能来完成教学和学习任务,有助于提供更完整的画面 人工智能对教育领域的影响。在 Chegg 2025 年对来自 15 个国家的大学生进行的调查中, 80% 的人表示他们已经使用生成式人工智能来支持他们的学习。这是 2023 年报告的份额的两倍, 当时只有 40% 的学生表示在学校使用过生成式人工智能。生成式人工智能的使用差异很大 按国家/地区划分,95% 的印度尼西亚学生表示他们使用过该软件,而美国的这一比例为 67% 和英国(图7.2.16)。在学校使用生成式人工智能的学生报告说他们经常这么做: 56% 的人每天至少输入一次问题。对于那些在学校不使用人工智能工具的学生来说,最好的选择是 原因包括学术不端行为的指控(45%)、内容准确性(38%)和学校政策 限制人工智能的使用(33%)。 大学生报告使用人工智能的方式与高中生类似,包括研究、 集思广益/产生想法,并编辑论文。一个显着的区别是大学生 比高中生更有可能使用人工智能来理解概念(56% vs. 41%);事实上,理解 其中一个主题是大学生最常使用生成式人工智能工具(图7.2.17)。 学生使用人工智能工具 图7.2.16 53% 49% 62% 62% 52% 23% 44% 63% 33% 33% 54% 33% 30% 20% 19% 95%(+42 个百分点) 90%(+41 个百分点) 89%(+27 个百分点) 87%(+25 个百分点) 84%(+32 个百分点) 84%(+61 个百分点) 84%(+40 个百分点) 83%(+20 个百分点) 83%(+50 个百分点) 81%(+48 个百分点) 79%(+25 个百分点) 77%(+44 个百分点) 68%(+38 个百分点) 67%(+47 个百分点) 67%(+48 个百分点) 0% 20% 40% 60% 80% 100% 英国 美国 土耳其 澳大利亚 加拿大 南非 墨西哥 肯尼亚 印度 韩国 巴西 西班牙 沙特阿拉伯 马来西亚 印度尼西亚 2025年 2023年 使用过 GenAI 的学生百分比 使用 GenAI 支持大学学习的大学生(占总数的百分比),2023 年与 2025 年 资料来源:Chegg 全球学生调查,2023 年和 2025 年 |图:2026年AI指数报告 ===== 第304页 ===== 304 7 .2 高等教育计算机科学和人工智能教育| 教育 | 2026 年人工智能指数报告 图7.2.17 1% 29% 33% 36% 38% 41% 46% 52% 56% 0% 5% 10% 15% 20% 25% 30% 35% 40% 45% 50% 55% 以上都不是 一步一步的家庭作业帮助 检查作业 考试/测验准备 帮助准备演示 撰写/编辑作业和论文 为作业生成初步想法/初稿 研究作业和项目 理解概念或主题 学生百分比 大学生 GenAI 用于作业,2025 年 资料来源:Chegg 全球学生调查,2025 年 |图:2026年AI指数报告 Anthropic 分析了学生如何使用其生成式 AI 工具 Claude,发现大多数学生将其用于 高阶思维技能10,例如创造(39.8%)和分析(30.2%),而不是低阶思维 技能,如应用(10.9%)和理解(10.0%)。这些用途可能表明学生正在依赖 用于重要认知技能的生成式人工智能工具,而不是独立开发它们;确实,另一个 调查发现,55% 的美国大学生认为使用生成式人工智能工具对生活产生了好坏参半的影响 他们的批判性思维能力。 尽管如此,大学生对在教育中使用人工智能工具持积极态度。对超过 73,000 人的调查 加州州立大学的学生表示,64% 的人认为人工智能对他们的生活产生了积极影响 学习经历。 Chegg 调查中的学生列出了使用人工智能工具的几个好处。一半 受访者表示对主题的理解有所增强,49% 的受访者表示完成作业的能力有所提高, 41% 的受访者表示组织得到了改善。他们还报告说,人工智能使他们的学习过程更加顺畅 高效,55% 的大学生表示人工智能可以帮助他们学得更快,41% 的大学生表示人工智能可以释放更多的时间 他们的时间。 大学生仍然对作弊指控和人工智能的不当使用感到担忧;作为回应, 更多大学实施了人工智能使用政策。一项教师调查显示,48% 的机构现在拥有 管理生成式人工智能可接受使用的政策自 2025 年以来增加了 9 个百分点。 英国 80% 的学生认为他们的大学对于在评估中使用生成式人工智能有明确的政策,这是一个 比上年提高16个百分点。 10 这些类别指的是布鲁姆分类法定义的认知复杂性水平,布鲁姆分类法是教育中广泛使用的框架,对 从低阶技能(记忆、理解、应用)到高阶技能(分析、评估、创造)。 ===== 第305页 ===== 305 7.3 K–12 计算机科学和人工智能教育 7 教育 | 2026 年人工智能指数报告 Code.org 的年度计算机科学教育状况报告,跟踪计算机科学教育的获取、参与和状态 政策,于 2025 年进行了扩展,纳入了截至 2025 年 12 月 1 日各州人工智能教育政策的分析。 由于只有四个州在其计算机科学标准中强调人工智能,人工智能教育的采用仍然有限。 2017-18 学年和 2023-24 学年之间,美国高中提供计算机科学课程的百分比 从35%增加到60%。自 2023-24 年以来,全国平均水平保持稳定,同样为 60% 2024-25 年提供基础计算机科学课程的高中。然而,许多州都有增长, 少数回归(图7.3.1)。在产品减少的州,预算削减或重新分配给其他 包括扫盲和学生危机支持在内的优先事项可能是促成因素。 K-12 级别的人工智能教育数据仍然有限。本节跟踪 CS 的发展 以教育为代表,关注正在开始解决的新兴州和联邦政策 直接人工智能。 美国 基础计算机科学 35% 45% 47% 51% 53% 58% 60% 60% 2017–18 2018–19 2019–20 2020–21 2021–22 2022–23 2023–24 2024–25 0% 10% 20% 30% 40% 50% 60% 学校百分比 公立高中教授基础计算机科学,2017–18 至 2024–25 来源:Code.org,2025 |图:2026年AI指数报告 图7.3.1 ===== 第306页 ===== 306 7 .3 K-12 计算机科学和人工智能教育 | 教育 | 2026 年人工智能指数报告 在报告 2023-24 和 2024-25 年数据的 22 个州中,有 5 个州(阿肯色州、特拉华州、洛杉矶州、马里兰州、南卡罗来纳州)维持了 提供计算机科学课程的学校百分比;其中三个已经达到或接近普及 (AR 和 MD 报告为 100%,SC 报告为 92%)(图 7.3.2 和 7.3.3)。九个州和特区 哥伦比亚 (DC) 报告称,开设计算机科学的高中比例有所增长。其中,六个(GA、IA、 MS、北卡罗来纳州、犹他州、华盛顿州)报告的增长极小(1%–5%)。两个州(加利福尼亚州、蒙大拿州)和华盛顿特区报告适度增长 (6%–10%)。田纳西州一州报告显着增长,提高了高中提供课程的比例 CS 课程提高了 22%(从 61% 增至 83%)。这一增长可能反映了 2022 年要求所有 K-12 学生的政策 能够访问 CS;各学区必须执行州 K-12 CS 标准和 1 个 CS 标准 从 2024-25 学年新生开始,学分毕业要求。几个州 据报告,提供 CS 的学校比例略有下降,只有一所学校(怀俄明州)报告下降了 10% 减少(从 74% 降至 64%)。 AL 92% AK 34% AZ 43% 增强现实 100% CA 58% 一氧化碳 66% CT 84% 德 61% 直流 60% FL 38% 遗传算法 81% 嗨 67% 身份证号 44% 伊尔 58% 在 89% IA 86% KS 38% 肯塔基州 75% 洛杉矶 39% 我 59% 医学博士 100% 硕士 81% 心肌梗塞 54% 明尼苏达州 34% 多发性硬化症 87% 莫 56% MT 38% 东北 51% 内华达州 98% NH 94% 新泽西州 86% 纳米 54% 纽约 50% 数控 70% ND 53% 羟基 61% 好的 72% 或 56% PA 78% RI 79% SC 92% 标清 55% 总氮 83% TX 48% UT 82% 室速 60% VA 68% 西澳 51% 西弗吉尼亚州 78% 威斯康辛 54% 怀伊 64% 来源:Code.org,2025 |图:2026年AI指数报告 教授基础计算机科学的公立高中(占州总数的百分比), 2025年 AL -2% AK -- AZ -- 增强现实 0% CA 6% 一氧化碳 -- CT -- 德 0% 直流 7% FL -- 遗传算法 3% 嗨 -5% 身份证号 -2% 伊尔 -- 在 -- IA 2% KS -- 肯塔基州 -1% 洛杉矶 0% 我 -4% 医学博士 0% 硕士 -- 心肌梗塞 -- 明尼苏达州 -- 多发性硬化症 2% 莫 -- MT 7% 东北 -- 内华达州 -- NH -1% 新泽西州 -- 纳米 -- 纽约 -- 数控 1% ND -- 羟基 -- 好的 -- 或 -- PA -- RI -- SC 0% 标清 -- 总氮 22% TX -- UT 1% 室速 -- VA -- 西澳 1% 西弗吉尼亚州 -- 威斯康辛 -- 怀伊 -10% 来源:Code.org,2025 |图:2026年AI指数报告 2024 年与 2025 年公立高中教授基础计算机科学的变化 图7.3.2 图7.3.3 ===== 第307页 ===== 307 7 .3 K-12 计算机科学和人工智能教育 | 教育 | 2026 年人工智能指数报告 由于教育经费的差异,计算机科学教育的机会因学校规模、地理区域、 社会经济地位和学生种族/民族(图 7.3.4 至 7.3.7)。 2025年,91%的大型高中, 77% 的中型高中和只有 44% 的小型高中提供基础 CS 课程。 随着一些地区公立学校继续关闭,学校规模和资源分配可能会随着附近地区的变化而变化 学校吸收流离失所的学生。资金是否跟随这些学生,以及整合如何影响 CS 访问,将是重要的监视。 Title I11 学校 (60%) 提供 CS 的可能性略低于非 Title I 学校 (65%)。农村(57%)和城市 (59%) 高中提供 CS 的可能性低于郊区 (71%) 高中。农村和农村地区的比率相似 城市计算机科学的普及可能反映了共同的限制,包括数字鸿沟和计算机教师的机会较少。 在黑人、西班牙裔/拉丁裔、夏威夷原住民/太平洋岛民和白人高中生中, 获得基础计算机科学课程的机会范围很窄(80%–82%)。亚洲学生(91%)最有可能 能够访问 CS 课程。美国原住民学生最不可能接触计算机科学,尽管他们 同比增长最大,从 2023-24 年的 66% 增至 2024-25 年的 70%。 11 所 Title I 学校为低收入家庭的学生提供服务,并接受联邦补充资金。 44% 77% 91% 小号 中号 大号 0% 20% 40% 60% 80% 100% 学校百分比 按规模提供基础计算机科学课程的学校, 来源:Code.org,2025 |图:2026年AI指数报告 2025年 57% 59% 71% 农村 城市 郊区 0% 20% 40% 60% 80% 100% 学校百分比 提供基础计算机科学课程的学校 来源:Code.org,2025 |图:2026年AI指数报告 地理区域,2025 60% 65% 第一章非第一章 0% 20% 40% 60% 80% 100% 学校百分比 提供 Title I 基础 CS 课程的学校 来源:Code.org,2025 |图:2026年AI指数报告 状态,2025 图7.3.4 图7.3.5 图7.3.6 ===== 第308页 ===== 308 7 .3 K-12 计算机科学和人工智能教育 | 教育 | 2026 年人工智能指数报告 70% 80% 80% 81% 82% 84% 91% 美国原住民 黑人 西班牙裔/拉丁裔 夏威夷原住民/ 太平洋岛民 白人 两个或以上种族 亚洲人 0% 20% 40% 60% 80% 100% 学生百分比 2025 年按种族/民族参加基础 CS 课程 来源:Code.org,2025 |图:2026年AI指数报告 图7.3.7 根据 42 个州的参与数据,2024-25 年有 6.1% 的学生就读 CS,但 学生参与 CS 的情况因州而异(图 7.3.8)。阿肯色州和南卡罗来纳州的报告最高 参与率约为 25%,爱达荷州和明尼苏达州的参与率最低(1.8%)。百分之六十二 报告国家(42 个国家中的 26 个国家)的 CS 参与度有所下降,但其中近一半 (12) 据报告下降幅度小于 0.5%(图 7.3.9)。十三个州 (31%) 报告学生人数有所增加 参与。 CS 参与度增幅最大的州是北达科他州(增幅 11.1%) 从 5% 增加到 16.1%)、田纳西州(从 6% 增加到 13.2%,增加 7.2%)和阿肯色州(从 20% 增加 5.1%) 25.1%)。无法与包括俄亥俄州和加利福尼亚州在内的其他州进行比较,因为它们没有报告 2023-24 年的参与率。 提供基础计算机课程的高中比例最高的几个州还报告了 参与率最高,但并非每个州的相关性都很明显(图 7.3.10)。阿肯色州和 南卡罗来纳州的参与率最高,分别为 25.1% 和 25.7%。这并不奇怪 考虑到他们有 CS 毕业要求,并且接近普及率(阿肯色州 100%;92%) 南卡罗来纳州)。马里兰州也普及计算机科学,但很少有学生 (16.7%) 参加计算机科学课程 可用的课程。与此同时,罗德岛州报告称,只有 79% 的学校提供基础计算机科学课程, 但参加这些课程的学生比例较高(18.4%)。 ===== 第309页 ===== 309 7 .3 K-12 计算机科学和人工智能教育 | 教育 | 2026 年人工智能指数报告 AK - AZ 4% 增强现实 25% CA 5% 一氧化碳 - CT 8% 德 - 直流 - FL 2% 遗传算法 8% 嗨 3% 身份证号 2% 伊尔 6% 在 6% IA 5% KS 3% 肯塔基州 9% 洛杉矶 3% 我 - 医学博士 17% 硕士 8% 心肌梗塞 - 明尼苏达州 2% 多发性硬化症 11% 莫 3% MT 4% 东北 5% 内华达州 - NH - 新泽西州 9% 纳米 3% 纽约 3% 数控 6% ND 7% 羟基 3% 好的 8% 或 7% PA 4% RI 18% SC 26% 标清 - 总氮 13% TX 5% UT 11% 室速 3% VA 5% 西澳 5% 西弗吉尼亚州 3% 威斯康辛 3% 怀伊 7% 来源:Code.org,2025 |图:2026年AI指数报告 公立高中计算机科学入学率(占学生百分比),2025 年 AL 0.00% AK -- AZ 1.50% 增强现实 5.30% CA -- 一氧化碳 -- CT -1.00% 德 -- 直流 -- FL 0.00% 遗传算法 0.60% 嗨 -1.00% 身份证号 -0.40% 伊尔 -1.00% 在 -1.00% IA 0.10% KS -0.10% 肯塔基州 -2.90% 洛杉矶 -0.80% 我 -- 医学博士 1.10% 硕士 0.00% 心肌梗塞 -- 明尼苏达州 -0.70% 多发性硬化症 0.00% 莫 0.00% MT 0.10% 东北 0.40% 内华达州 -- NH -- 新泽西州 0.00% 纳米 0.00% 纽约 -1.70% 数控 0.90% ND 11.20% 羟基 -- 好的 3.00% 或 0.00% PA -2.40% RI 0.00% SC 0.00% 标清 -- 总氮 7.20% TX -0.90% UT -1.20% 室速 -0.60% VA 0.00% 西澳 -0.60% 西弗吉尼亚州 -1.50% 威斯康辛 -0.30% 怀伊 -1.90% 来源:Code.org,2025 |图:2026年AI指数报告 2024 年与 2025 年公立高中 CS 入学率变化(占学生百分比) 图7.3.8 图7.3.9 ===== 第310页 ===== 310 阿拉巴马州 亚利桑那州 阿肯色州 加利福尼亚州 康涅狄格州 佛罗里达州 格鲁吉亚 夏威夷 爱达荷州 伊利诺伊州 印第安纳州 爱荷华州 堪萨斯州 肯塔基州 路易斯安那州 马里兰州 马萨诸塞州 明尼苏达州 密西西比州 密苏里州 蒙大拿州 内布拉斯加州 新泽西州 新墨西哥州 纽约 北卡罗来纳州 北达科他州 俄亥俄州 俄克拉荷马州 俄勒冈州 宾夕法尼亚州 罗德岛州 南卡罗来纳州 田纳西州 德克萨斯州 犹他州 佛蒙特州 弗吉尼亚州 华盛顿 西弗吉尼亚州 威斯康星州 怀俄明州 0% 5% 10% 15% 20% 25% 30% 40% 50% 60% 70% 80% 90% 100% 就读计算机科学的学生百分比 开设计算机科学的学校百分比 2025 年各州开设 CS 的高中百分比与就读 CS 的学生百分比 来源:Code.org,2025 |图:2026年AI指数报告 图7.3.10 图7.3.11 CS 入学数据还显示了几个亚组的差距(图 7.3.11);在这里,数据也应该是 请谨慎解读,因为并非所有州都报告了今年的入学数据。去年的分析显示 黑人、美洲原住民/阿拉斯加人和白人学生的比例接近或高于比例 在国家层面。今年这种趋势仍在继续,夏威夷原住民/太平洋岛民学生 接近这一目标,亚洲学生和拥有 504 计划的学生在其中所占比例过高 参赛学生(图7.3.12)。西班牙裔/拉丁裔学生的经济代表性 弱势学生、有 IEP 的学生和女童略有改善,但这些人群仍然存在 在 CS 课程中代表性不足。英语语言学习者 (ELL) 的代表性仍然不足,但介于 2024年和2025年,他们的代表性显着提高,这可能是由于一致参与 提高 ELL 学生 CS 教学质量的努力和举措。 7 .3 K-12 计算机科学和人工智能教育 | 教育 | 2026 年人工智能指数报告 2.60 1.13 0.69 1.00 0.75 0.80 1.00 2.34 1.28 0.72 1.10 0.90 0.92 0.99 0.00 0.50 1.00 1.50 2.00 2.50 3.00 白色 两场或两场以上比赛 夏威夷原住民/太平洋岛民 美洲原住民/阿拉斯加人 西班牙裔/拉丁裔 黑人/非裔美国人 亚洲人 2025年 2024年 CS 入学率与全国人口统计数据的比率 2025 年按种族/族裔划分的公立高中 CS 入学率与全国人口统计数据 来源:Code.org,2025 |图:2026年AI指数报告 ===== 第311页 ===== 311 7 .3 K-12 计算机科学和人工智能教育 | 教育 | 2026 年人工智能指数报告 0.72 0.64 0.65 1.33 0.67 0.78 0.76 0.68 2.17 0.70 0.00 0.50 1.00 1.50 2.00 2.50 有 IEP 的学生 有504计划的学生 女孩 英语语言学习者 经济困难 2025年 2024年 CS 入学率与全国人口统计数据的比率 公立高中 CS 入学率与全国人口统计数据(按亚组),2025 年 来源:Code.org,2025 |图:2026年AI指数报告 图7.3.1212 12 参加 504 计划的学生可根据 1973 年《康复法案》第 504 条获得住宿,该法案是一项美国民权法,禁止在 针对残疾人的犯罪。参加 IEP(个性化教育计划)的学生可以根据以下规定接受特殊教育服务: 残疾人教育法。 IEP 是一份具有法律约束力的文件,概述了残疾学生的学习计划,旨在 满足他们的独特需求并提高教育成果。 高级课程涵盖基础人工智能概念(例如 AP CS 原理),是一条显而易见的途径 打造人工智能素养,融入更深入的人工智能教育。自 2016 年以来,AP 考试参与率 除 2020 年至 2021 年新冠疫情期间的平台期外,同比稳定增长 (图7.3.13)。然而,AP 考试的增长率从 2022 年至 2023 年的 21% 放缓至 2023 年的 5% 2023 年和 2024 年。尽管学生群体在各课程中的代表性有所提高,但学生 不参加与其种族/民族代表性相称的 AP 考试(图 7.3.16)。黑色, 美洲原住民/阿拉斯加和夏威夷原住民/太平洋岛民学生在其中的比例更高 2024年CS教育参加者人数高于参加AP考试的学生人数;西班牙裔/拉丁裔学生 AP 考试参加者的代表性比参加 CS 的一般学生群体的代表性更好。 2024 年,女生参加 AP 考试的频率低于男生;刻板印象威胁可以解释 不愿意参加考试和分数差异。亚裔学生、多种族男孩和白人男孩 参加 AP 考试的人数过多(图 7.3.14 和 7.3.15)。 高级计算机科学 ===== 第312页 ===== 第312章 7 .3 K-12 计算机科学和人工智能教育 | 教育 | 2026 年人工智能指数报告 19.39 19.83 20.96 19.39 21.14 24.78 29.55 37.33 46.34 54.38 99.87 130.90 158.56 179.19 181.04 201.61 243.18 254.80 2007 2008 2009 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0 50 100 150 200 250 参加 AP 计算机科学考试的数量(以千计) 参加 AP 计算机科学考试的数量,2007 年 – 24 来源:Code.org,2025 |图:2026年AI指数报告 2007 2008 2009 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0 10,000 20,000 30,000 40,000 50,000 60,000 70,000 80,000 90,000 参加 AP 计算机科学考试的数量 0, 其他 268,夏威夷原住民/太平洋岛民 590,美洲原住民/阿拉斯加 11,797, 两场或以上比赛 18,026,黑人/非裔美国人 46,526,西班牙裔/拉丁裔 75,936, 亚洲人 89,363,白色 按种族/族裔参加的 AP 计算机科学考试,2007-24 来源:Code.org,2025 |图:2026年AI指数报告 图7.3.13 图7.3.14 ===== 第313页 ===== 313 7 .3 K-12 计算机科学和人工智能教育 | 教育 | 2026 年人工智能指数报告 2007 2008 2009 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0% 10% 20% 30% 40% 50% 60% 参加过 AP 计算机科学考试(占回应学生总数的百分比) 0.00%,其他 0.00%,美洲原住民/阿拉斯加 0.11%,夏威夷原住民/太平洋岛民 4.63%, 两场或以上比赛 7.07%,黑人/非裔美国人 18.26%, 西班牙裔/拉丁裔 29.80%,亚洲人 35.07%,白色 按种族/族裔划分的 AP 计算机科学考试参加情况(占所有回答学生的百分比),2007-24 来源:Code.org,2025 |图:2026年AI指数报告 0 1 2 3 4 5 6 7 8 白色 两场或两场以上比赛 夏威夷原住民/太平洋岛民 美洲原住民/阿拉斯加人 西班牙裔/拉丁裔 黑人/非裔美国人 亚洲人 男 女 AP CS 考试参与率与全国人口统计数据的比率 2024 年 AP 计算机科学考试参与率与按种族/族裔划分的全国人口统计数据 来源:Code.org,2025 |图:2026年AI指数报告 图7.3.15 图7.3.16 ===== 第314页 ===== 314 7 .3 K-12 计算机科学和人工智能教育 | 教育 | 2026 年人工智能指数报告 K-12 学生使用人工智能工具 将人工智能工具用于教育目的在中学生和高中生中越来越受欢迎。 根据以下数据,学生使用人工智能完成学校相关任务的估计范围在 50% 到 84% 之间 调查数据。13 虽然学生承认担忧(例如虚假作弊指控、批评的减少) 思维和学术技能减弱),研究表明使用率呈上升趋势,大多数 学生们现在提倡在学校使用人工智能。一项调查发现,大约一半的受访学生同意 应该要求学校教学生如何使用人工智能(52%)并且应该允许学生 使用人工智能完成作业(47%);另一项调查显示,同意率更高,65% 中学生和 73% 的高中生表示学生应该有机会获得并 能够使用人工智能工具完成作业。高中生报告最常使用生成式人工智能 进行研究和寻找资料来源、编辑或修改论文以及集思广益(图7.3.17), 他们报告说,他们受益于学习材料的增加和学习效率的提高。 图7.1714年3月 13 CDT(2025),50%;大学理事会(2025 年),84%;兰德(2025),54%。 14 该图表显示了 2025 年美国大学理事会四次调查管理的平均百分比。 2% 18% 30% 41% 50% 50% 51% 0% 5% 10% 15% 20% 25% 30% 35% 40% 45% 50% 其他 编写代码 学习语言 解释复杂的主题 集思广益 编辑或修改论文 进行研究和寻找资源 高中生 GenAI 用于作业,2025 年 资料来源:大学理事会,2025 |图:2026年AI指数报告 只有大约一半的初中和高中制定了有关人工智能使用的政策。其中,只有 28% 允许使用人工智能 在某些情况下,22% 的人不这样做。有人工智能政策的学校,特别是允许人工智能使用的政策 在学业方面,更有可能生活在更富裕、更城市的社区。然而,那些的效用 政策由于缺乏明确性而受到质疑。只有 36% 的学生将学校的政策描述为 非常明确,47% 的人希望使用人工智能完成学业,但不确定是否允许。一位老师 调查发现,对明确政策的评价甚至更低,教师表示,只有 6% 的学校制定了明确的政策。 明确、全面的政策。 教育标准、政策和指导 ===== 第315页 ===== 315 7 .3 K-12 计算机科学和人工智能教育 | 教育 | 2026 年人工智能指数报告 美国的大多数教育政策都是由州一级决定的。截至 2026 年 1 月,30 个州 发布了人工智能教育指南。关于专门针对人工智能教育的政策,17 个州 已发布指导意见,明确计算机科学是人工智能的基础,五个州已分配了具体的 根据《2025 年人工智能 + 计算机科学状况》,人工智能教育的专业发展资金 报告。 也许最重要的人工智能教育指导通常以标准的形式出现,这些标准定义了 K-12 学生的学习成果。截至 2026 年 1 月,45 个州已采用 K-12 CS 标准,而 有五个州加上华盛顿特区没有这样的标准。大多数(29 个州)都包含人工智能,但仅限于非常有限的范围 程度,并且通常仅限于高中水平,类似于当前的 CSTA K-12 标准, 2017年修订,作为事实上的国家标准。十个州的标准没有具体提及 人工智能内容。六个州拥有包含重要人工智能特定内容的 CS 标准,另外两个州拥有 发布了修订标准草案,其中还包括重要的人工智能特定内容(图 7.3.18)。 拥有重要人工智能标准的国家都在过去几年中采用或目前正在制定中 发展。国家标准的特征和组织总结见表 4.1 重要的人工智能内容。 美国 K-12 州人工智能指南 AL AK 氮杂环己烷 碳酸钙 CT 直流DE FL 遗传算法 嗨 伊伊尼亚 KS KY 洛杉矶 我 医学博士 硕士 明尼苏达州 多发性硬化症 莫 MT 东北 内华达州 NH 新泽西州 纳米 纽约 数控 ND 羟基 好的 或PA RI SC 标清 总氮 TX UT 室速 VA 西澳 西弗吉尼亚州 威斯康辛 怀伊 资料来源:CSTA,2025 |图:2026年AI指数报告 具有重要 AI 特定内容的 CS 标准 具有重要 AI 特定内容的 CS 标准(草案) 具有最少 AI 特定内容的 CS 标准 没有 AI 特定内容的 CS 标准 无 CS 标准 美国各州采用人工智能特定的 K 12 计算机科学标准 图7.3.18 ===== 第316页 ===== 316 7 .3 K-12 计算机科学和人工智能教育 | 教育 | 2026 年人工智能指数报告 年份 最早年级 方法 组织和标签 人工智能内容 2025 - 草案 2025年 2024年 2024年 2025年 2022年 2024年 2025 - 草案 一年级 9–12 选修课 二年级 一年级 幼儿园 幼儿园 四年级 Pre-K–5(年级 乐队) 集成跨 概念 选修课 独立式 概念 集成跨 概念 集成跨 概念 独立式 概念 集成跨 概念 集成跨 概念 [AI] 标签标记了跨概念广泛分布的标准, 最常见于数据科学 > 数据收集和 代表;计算的影响 > 新兴技术; 和数字能力>数字工具。 AI 是整个数据 3 级课程的焦点和标签 分析和机器学习途径。 人工智能是用于组织标准的六大要素之一。 人工智能内容分为两个主要部分:技术 影响力(1-12 年级)和新兴技术(6-12 年级)。 AI 内容分为三个子概念: 计算 设备和系统>人工智能;算法和 计算思维 > 创建人工智能指令;和 计算的影响 > 人工智能的影响。 人工智能是六大趋势之一。该链有五个主题 AI4K12 的五个重要理念:感知、表征和 推理、机器学习、自然交互、社会 影响。 人工智能内容分为三个部分:计算系统; 数据与分析;和计算的影响。 人工智能内容分为两个子概念:计算和 社会 > 新兴技术;和数据与分析> 数据科学的影响。 状态 阿拉巴马州 阿肯色州 科罗拉多州 佛罗里达州 北达科他州 俄亥俄州 弗吉尼亚州 威斯康星州 表 4.1。具有重要人工智能内容的国家标准的特点和组织 修订后的 CSTA K-12 标准预计于 2026 年夏季发布,将描述与人工智能相关的重要内容 学习目标作为 K-12 年级基础计算机教育的一部分。为了告知这些标准, CSTA 和 AI4K12 召集了一个由教育工作者、课程开发人员、专业发展人员组成的全国小组 2025 年,提供商和研究人员将提供有关确定人工智能知识优先领域的见解 和技能。优先事项包括人类在创造人工智能、推理、数据和机器学习、道德 人工智能系统的评估和社会影响。在新的 Pre-K-12 基础标准中,这些人工智能 优先事项将整合到五个概念中,最重要的是分为四个子概念: 机器学习、算法的影响、新兴技术以及人类和计算。 此外,还将有两套针对高级人工智能内容的高中专业标准。给定 鉴于当前的高度一致性,大多数州可能会在未来五年内采用类似的人工智能标准 年。 2025 年 4 月的一项行政命令《推进美国青少年人工智能教育》旨在 制定从 K-12 到高等教育发展人工智能能力的国家战略 促进学生早期接触人工智能,将人工智能融入教学,并扩大专业学习 对于教育工作者来说。它成立了白宫人工智能教育工作组来协调联邦工作,推出 总统人工智能挑战赛,并发展公私合作伙伴关系,大规模提供 K-12 人工智能资源。 该命令还指示教育部、劳工部、国家科学基金会和农业部在拨款中优先考虑人工智能, 研究、教师准备、学徒和劳动力途径。 美国联邦 K-12 AI 指南 ===== 第317页 ===== 第317章 7 .3 K-12 计算机科学和人工智能教育 | 教育 | 2026 年人工智能指数报告 亮点: K-12 人工智能政策的实施差距 扩展计算教育途径 (ECEP) 的一个研究项目评估了全州人工智能政策 跨 K-12 学校的研究发现,州级人工智能指导基本上是非约束性且分散的。大多数 各州依赖现有的联邦法律,例如《儿童在线隐私保护法》(COPPA) 和《家庭法》 教育权利和隐私法案 (FERPA),而不是发布针对人工智能的特定指令。责任 地方政策的制定、工具审查和实施由地方教育机构负责,这意味着 人工智能教育的严格程度和采用的速度取决于当地的能力(例如,受过培训的人数) 教师、资金)和决策。 教师准备也是一个明显的差距。国家级文件认识到人工智能的重要性 相关的教师培训,但目前还没有国家级的项目或资金标准。没有 稳定的资金支持或标准化的培训基准,人工智能集成的质量仍然存在 视当地资源而定。 与此同时,AP 计算机科学是高级计算机科学课程最常见的途径之一 在美国高中,不包括人工智能特定的内容。政策引导、师资培训、课程设置 所有人都需要协调一致,让人工智能教育能够持续接触到学生,但目前,各方面仍然存在差距 三. ===== 第318页 ===== 318 7 .3 K-12 计算机科学和人工智能教育 | 教育 | 2026 年人工智能指数报告 尽管近几年来国家教育战略规划中广泛提及人工智能教育 多年来,很少有国家在2025年真正实施人工智能教育;各国更常见的是 将人工智能技术融入教育。例如韩国在小学推出人工智能教材 2025 年 3 月,几个月后由于家长和老师的反对而改变了方向。在希腊, 政府与 OpenAI 合作,培训中学教师在课堂上使用 ChatGPT。并且 在爱沙尼亚,AI Leap 2025 计划正在与 20,000 名学生和 2025-26 学年有 3,000 名教师。 然而,有两个国家在实施人工智能教育方面取得了重大进展:中国和阿拉伯联合酋长国 阿联酋航空(阿联酋)。在中国,北京、广东和杭州都开始要求在 2025-26 年开展人工智能教育 《中国中小学人工智能通用教育指南》发布后的第一个学年 《中小学生生成式人工智能使用指南》(2025年版)和《中小学生生成式人工智能使用指南》(2025年版) 2025 年 5 月。所有三个领域都有类似的要求,包括最低教学时数和 从小学生开始学习人工智能素养技能,循序渐进的课程 最后以高中生设计人工智能系统结束。阿联酋同样要求全民接受人工智能教育 2025-26 学年开始的年级。学生还将通过年级课程取得进步 其中包括基本概念、数据和算法、软件使用、创新和项目方面的技能 设计和道德意识。 我们再次提供有关计算机科学教育的数据,而不是广泛的人工智能教育数据,特别是自从一些 人工智能内容可以在计算机科学课程中教授。类似于跟踪计算机科学教育所固有的挑战 在美国,解释全球指标时需要谨慎,因为计算机科学和信息通信技术教育 有时与数字或计算机素养相混淆。 2025年,全球约93%的国家教授计算机科学(图7.3.19)。百分之三十的国家 强制要求小学或中学接受计算机科学教育,而 63% 的人至少在某些学校接受计算机科学教育 学校,但不强制这样做。近四分之三的国家将计算机科学概念融入其他课程中, 例如数学和科学。独立计算机科学课程的访问机会通常因学校类型和地理位置而异, 私立和城市学校比公立和农村学校更有可能提供计算机科学。这表明资源 对于寻求扩展学生数字技能的学校来说,基础设施和基础设施仍然是挑战。 全球人工智能和计算机科学教育 小学和/或中学的 CS 必修课 CS 作为选修课随处可见 某些学校或地区提供计算机科学课程 政府宣布 CS 扩展、计划或试点 没有校内 CS 的在线证据 2025 年各国家/地区计算机科学教育的可用性 资料来源:人工智能指数,2025;树莓派计算教育研究中心,2024 |图:2026年AI指数报告 图7.3.19 ===== 第319页 ===== 第319章 7.4 AI技能习得 7 教育 | 2026 年人工智能指数报告 正规教育是人工智能的切入点之一,但随着该技术重塑跨行业的工作岗位,提高技能 重新培训技能已成为终身学习的核心。许多人正在通过以下方式培养人工智能技能 专业证书、在线课程和在职经验,这些途径也可以扩大访问范围 适合没有深厚计算机科学或数学背景的学习者。本节研究人工智能技能集中的地方 全球范围以及它们传播的速度。 LinkedIn 的相对人工智能技能渗透率衡量了人工智能技能在人们的个人资料中的突出程度。 特定国家与全球平均水平的比较(图 7.4.1)。印度领先 3.0,这意味着人工智能技能出现在 成员概况几乎是全球平均水平的三倍,其次是美国(2.0)和德国 1.8。然而,这些国家在衡量男性和女性人工智能技能时也表现出持续的性别差距 渗透率与全球平均水平相比(图 7.4.2)。在印度,男性列出的人工智能技能是女性的 1.5 倍以上 女性比例(3.1 比 1.9);在美国,差距相似,但稍窄一些(2.1 比 1.4)。 AI技能渗透 图7.4.1 1.14 1.14 1.22 1.28 1.37 1.38 1.43 1.47 1.48 1.53 1.54 1.55 1.83 2.02 2.95 0.00 0.50 1.00 1.50 2.00 2.50 3.00 波兰 荷兰 意大利 土耳其 阿拉伯联合酋长国 以色列 新加坡 西班牙 巴西 法国 加拿大 英国 德国 美国 印度 AI技能相对渗透率 按地理区域划分的相对人工智能技能渗透率,2015–25 来源:LinkedIn,2025 |图:2026年AI指数报告 ===== 第320页 ===== 320 7 .4 人工智能技能 | 教育 | 2026 年人工智能指数报告 图7.4.2 0.65 0.66 0.69 0.72 0.78 0.83 0.83 0.85 0.85 0.87 0.94 0.95 1.06 1.38 1.94 1.27 1.57 1.31 1.38 0.89 1.70 1.64 1.72 1.24 1.52 1.55 1.63 1.93 2.13 3.05 0.00 0.50 1.00 1.50 2.00 2.50 3.00 荷兰 巴西 意大利 阿拉伯联合酋长国 沙特阿拉伯 新加坡 西班牙 以色列 土耳其 法国 英国 加拿大 德国 美国 印度 男 女 AI技能相对渗透率 不同性别的人工智能技能相对渗透率,2015–25 来源:LinkedIn,2025 |图:2026年AI指数报告 LinkedIn 今年推出的人工智能技能扩散指数追踪了人工智能技能的采用程度 一个国家内相对于其自身基线的增长,而不是当前的相对流行率(图 7.4.3)。 这一衡量标准还考虑了人工智能技能的多样性,区分了人工智能工程技能, 与构建和部署人工智能系统以及人工智能素养技能相关,这反映了对人工智能的熟悉程度 工具。在样本中的许多国家中,人工智能素养和工程技术近期都有所增长, 但速度不同。人工智能素养技能增长更快,而工程导向技能也有所提高 更加谦虚。印度和美国就是这种情况。然而,美国等国家 阿拉伯联合酋长国、智利和南非的人工智能工程技能增长迅速。在美国, 增长最快的读写技能是 AI 提示和 Microsoft Copilot Studio,而增长最快的读写技能是 AI 提示和 Microsoft Copilot Studio 工程技能包括人工智能代理、人工智能生产力和人工智能策略(图7.4.4)。 AI技能扩散 ===== 第321页 ===== 321 7 .4 人工智能技能 | 教育 | 2026 年人工智能指数报告 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 100 200 300 400 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 40 80 120 160 2016 2018 2020 2022 2025 1 100 200 300 400 500 2016 2018 2020 2022 2025 1 40 80 120 160 人工智能素养 人工智能工程 阿根廷 澳大利亚 奥地利 比利时 巴西 加拿大 智利 哥斯达黎加 克罗地亚 塞浦路斯 捷克共和国 丹麦 爱沙尼亚 芬兰 法国 德国 希腊 香港 冰岛 印度* 印度尼西亚 爱尔兰 以色列 意大利 拉脱维亚 立陶宛 卢森堡 墨西哥 荷兰 新西兰 挪威 波兰 葡萄牙 罗马尼亚 沙特阿拉伯 新加坡 斯洛文尼亚 南非 韩国 西班牙 瑞典 瑞士 土耳其 阿拉伯联合酋长国 英国 美国* 乌拉圭 96.74 48.42 45.12 69.98 23.16 16.77 28.52 16.94 51.22 167.31 39.05 142.97 99.84 27.17 39.55 11.59 20.363.06 23.102.33 12.74 16.42 30.85 20.73 17.532.72 31.2317.03 19.29 91.73 17.50 153.20 21.10 21.70 81.91 20.46 5.17 52.94 381.99 84.67 46.53 49.3034.92 17.62 22.37 27.33 77.95 16.632.40 24.186.37 24.382.15 59.71 64.84 25.02 64.44 71.31 15.48 45.31 5.82 18.99 84.41 35.41 25.35 36.7018.35 63.60 16.16 58.02 59.93 16.961.69 97.72 37.88 16.78 5.64 29.68 120.68 21.20 26.98 25.5739.77 17.65 31.06 153.74 54.41 32.40 129.93 31.88 458.07 23.983.71 按地理区域划分的人工智能技能分散指数,2016-25 来源:LinkedIn,2025 |图:2026年AI指数报告 AI技能训练指数 图7.4.315 15 星号表示一个国家/地区的 y 轴标签的缩放比例与其他国家/地区不同。 ===== 第322页 ===== 第322章 7 .4 人工智能技能 | 教育 | 2026 年人工智能指数报告 2025 年美国人工智能技能增长最快 来源:LinkedIn,2025 AI工程技能AI素养技能排名 1 AI代理 AI提示 2 AI 生产力 Microsoft Copilot Studio 3 AI 策略 GitHub Copilot 4 Amazon Bedrock Prompt 工程 5 大语言模型操作 (LLMOps) 微软副驾驶 图7.4.4 ===== 第323页 ===== 323 政策与 治理 8 2026 年人工智能指数报告 概述 在世界范围内,人工智能政策不再仅仅是监管。 各国政府也在投资建设和维护它们 拥有跨基础设施、数据、人才和 构成技术的模型。国家数量 随着正式的人工智能战略的不断发展,特别是 低收入经济体的势头。立法 尽管在美国,各个层面的活动都在继续增长 各州、联邦政策转向放松管制,尽管 州立法机构通过的人工智能相关法案数量创历史新高。 在全球范围内,先进的模型开发和大规模 计算仍然集中在少数国家, 与此同时,越来越多的政府奉行主权人工智能战略。这个 本章的分析来自国家战略数据库, 立法记录、国会证人数据、Epoch AI 以及 来自美国和欧洲的公共采购数据。 ===== 第324页 ===== 第324章 章节亮点 8.1 2025年全球人工智能主要政策新闻 8.2 国家人工智能战略 按地理区域 8.3 人工智能主权 基础设施主权 数据主权 主权模型 应用主权 人才主权 8.4 人工智能与政策制定 全球人工智能立法记录 亮点:仔细审视全球人工智能立法 美国立法记录 国家级 亮点:国家人工智能立法正在转变 联邦政策 美国国会听证会 美国法规 按代理机构 亮点:近距离观察美国联邦 法规 8.5 人工智能的公共投资 人工智能公共投资总额 美国 跨机构支出 欧洲 跨部门支出 325 第326章 第331章 第331章 第332章 第332章 第334章 第335章 第337章 第339章 第341章 第341章 第343章 第343章 第343章 第345章 第346章 第348章 第349章 第351章 第353章 第353章 第353章 第356章 第357章 第359章 内容 8 政策与治理| 2026 年人工智能指数报告 ===== 第325页 ===== 325 内容 1 在没有正式人工智能政策的国家中,国家人工智能战略扩张速度最快 5 几年前。 2024年,一半以上新采取的战略来自新兴经济体 截至 2025 年,撒哈拉以南非洲、中亚和中东的更多国家 有积极发展的策略。 2 人工智能主权,即获得对国内人工智能能力更多代理权的目标正在出现 作为国家人工智能政策的核心原则,但支撑其的基础设施并不均衡 分布式。 2018 年至 2025 年间,欧洲和中亚扩大了国家支持的人工智能 超级计算集群从 3 个到 44 个。南亚、拉丁美洲、中东和北部 非洲分别只达到 2、3 和 8 之间。 3 各地区正在采取不同的数据主权方法。到 2024 年,东亚和 太平洋地区采取了 77 项数据本地化措施,其次是撒哈拉以南非洲地区,采取了 71 项数据本地化措施。 欧洲和中亚有 66 个。相比之下,北美仅记录了 3 个,反映出 跨境数据流动的不同方法。 章节亮点 4 自 2017 年以来,美国国会听证会上与人工智能相关的证人数量增加了 20 倍。的 数量从 2017 年的 5 个增加到 2025 年的 102 个。行业份额几乎增加了两倍,从 13% 增至 37%,使得 它是最大的见证群体,而学术界的份额则下降至 15%。 5 2013 年欧洲人工智能公开承诺合同金额约为 37 亿美元—— 2024年。英国占16亿美元,其次是德国,占5.05亿美元 法国则为 3.2 亿美元。最近的支出也在加速。仅 2024 年,英国 德国承诺了 4.544 亿美元(占十年总额的 28%),德国承诺了 2.066 亿美元(占 40%) 其总数)。 6 与私营部门支出相比,美国对人工智能的公共投资仍然有限。之间 2013年和2024年,美国在人工智能相关合同和项目上投资了约204亿美元 仅 2025 年美国私人投资就达 2859 亿美元。 8 政策与治理| 2026 年人工智能指数报告 ===== 第326页 ===== 第326章 8.1 全球人工智能主要政策 2025年新闻 8 政策与治理| 2026 年人工智能指数报告 美国行政命令“消除美国在人工智能领域领导地位的障碍” 美国发布行政命令,废除早期的人工智能指令并制定新政策 增强美国人工智能的主导地位,促进创新并消除监管障碍。 英国将用于生成儿童性虐待图像的人工智能工具定为刑事犯罪 英国将自己定位为第一个制定反人工行为法律的国家 用于生成儿童性感图像的情报工具。 欧盟人工智能法案第一项措施生效 欧盟具有里程碑意义的人工智能法规在第一阶段生效,禁止高风险用途(例如, 预测性警务、情绪识别)并为更严格的规则奠定基础。 人工智能行动峰会:美英拒绝签署包容性人工智能宣言 在 2025 年巴黎人工智能行动峰会上,美国和英国拒绝认可 60 国签署的宣言 各国在包容性、道德的人工智能方面存在分歧,这表明治理方法存在分歧。 中国最终确定人工智能生成内容的强制性标签规则 中国监管机构发布最终规则,要求对人工智能生成和合成媒体进行明确标记, 今年晚些时候开始分阶段实施。 津巴布韦与 Nvidia 合作推出非洲第一个人工智能工厂 由津巴布韦亿万富翁 Strive Masiyiwa 创立的 Cassava Technologies 宣布 与 Nvidia 合作建立非洲大陆第一家专用“人工智能工厂”。 1月23日 2月1日 2月2日 2月11日 3月14日 3月24日 2025年 ===== 第327页 ===== 第327章 8.1 全球人工智能主要政策新闻| 政策与治理| 2026 年人工智能指数报告 犹他州颁布心理健康聊天机器人法案 (HB 452) 该法案制定了监管使用人工智能的心理健康聊天机器人的条款 技术。它要求披露人工智能的使用情况,禁止在聊天中做广告,并禁止 共享用户的个人数据。 基加利峰会强调非洲的人工智能机遇和劳动力风险 数千名代表齐聚基加利,参加首届非洲全球人工智能峰会,共同探讨 非洲大陆如何利用人工智能促进发展,同时减轻对劳动力的潜在干扰 市场。 蒙大拿州颁布计算权法案 (SB 212) 该法律为人工智能建立了一个有利于创新的法律框架,保护蒙大拿人的所有权 并将计算资源用于合法的人工智能活动,而不受政府的不当限制。 非洲宣布人工智能为战略重点:投资、包容和创新 非洲联盟地区将人工智能确定为核心战略优先事项,强调包容性、创业 资金,并缩小数字鸿沟。 美国颁布《拆除法案》,针对未经同意的亲密图像—— 包括 AI Deepfakes 该法律旨在解决未经同意的亲密图像的传播问题;它明确地 涵盖深度造假内容并加强删除/问责期望。 3月25日 4月3日 4月16日 5月17日 5月19日 2025年 加文·纽森 (Gavin Newsom) 委托撰写的加州人工智能政策报告警告: “不可逆转的伤害” 加州州级报告强调了人工智能威胁,包括生物和核滥用以及 提出安全、透明度和举报人框架——有可能提供一个全国性的框架 在没有联邦法律的情况下制定蓝图。 6月17日 ===== 第328页 ===== 328 8.1 全球人工智能主要政策新闻| 政策与治理| 2026 年人工智能指数报告 G7发表联合声明重申人工智能治理合作 G7领导人发布联合声明,致力于在人工智能安全、风险管理、 以及先进人工智能系统的标准。 德克萨斯州签署负责任的人工智能治理法案 (TRAIGA) 进入法律 该州法律于 2025 年 6 月通过并于 2026 年生效,对高影响力的项目制定了严格的规则 人工智能,包括禁止煽动伤害、侵犯宪法权利或歧视的用途 受保护的类。 美国参议院否决联邦暂停国家人工智能监管十年 参议院从一项重大支出中删除了一项拟议的联邦禁止州级人工智能监管的提案 法案,允许各州继续实施自己的人工智能监管法律。 欧盟发布通用人工智能自愿行为准则 欧盟委员会发布了一项准则,指导企业遵守即将出台的 欧盟人工智能法案对通用模型进行了规定,涵盖透明度、版权和安全性。 美国推出“美国人工智能行动计划”和3项行政命令 白宫发布了涵盖创新、基础设施和外交的广泛人工智能战略, 加上有关数据中心、出口和政府采购的行政命令。 6月17日 6月22日 7月1日 7月10日 7月23日 2025年 中国公布全球人工智能治理行动计划 在 2025 年世界人工智能大会上,中国总理李强公布了 13 点路线图 推进全球人工智能协调和标准。 7月26日 ===== 第329页 ===== 第329章 8.1 全球人工智能主要政策新闻| 政策与治理| 2026 年人工智能指数报告 创作者组织谴责欧盟人工智能法案的实施 由 38 个全球创意产业机构组成的联盟发表联合声明,批评欧盟人工智能法案 损害文化权利并偏袒模型开发者。 欧盟通用人工智能义务生效 根据欧盟人工智能法案,通用人工智能模型提供商的义务开始适用, 要求对系统进行风险评估、透明度披露和缓解措施 系统性风险。 联合国启动人工智能治理全球科学小组和全球对话 联合国大会批准成立独立国际科学小组 人工智能和人工智能治理全球对话,提供协调的科学指导和 促进人工智能监管国际合作。 意大利成为第一个通过人工智能法的欧盟成员国 意大利推进国家人工智能立法,旨在补充欧盟层面的监管,反映 成员国采取行动界定机构作用和国家实施。 加州颁布具有里程碑意义的人工智能安全/透明度法 (SB 53) 加州州长 Newsom 签署 SB 53 要求大型人工智能模型开发商披露安全性 协议和事件报告并保护举报人。 7月30日 8月2日 8月26日 9 月 17 日 9月29日 2025年 人工智能伴侣诉讼促使人们重新审视情感人工智能保障措施 在美国发生一起与人工智能伴侣互动有关的青少年自杀事件被广泛报道后, 立法者和监管机构加强了对人工智能配套系统和儿童安全保障措施的审查。 8月26日 ===== 第330页 ===== 330 8.1 全球人工智能主要政策新闻| 政策与治理| 2026 年人工智能指数报告 欧盟委员会启动欧洲科学人工智能战略 委员会宣布一项加强欧洲技术和科学的战略 通过利用人工智能技术在科学和领域的潜力来增强领导力和竞争力 支持科学家在研究中采用它们。战略助力AI大陆 行动计划与应用人工智能战略一起提出,旨在加速人工智能的发展 关键商业和工业部门的采用。 10 月 8 日 加州颁布新的人工智能法 加州颁布了多项与人工智能相关的法案——SB243 监管伴侣机器人,AB853 要求 gen AI 开发人员确保他们的工具内容包括来源数据和 AB621 扩展 关于未经同意的深度假货的现行州法律。 10 月 13 日 美国行政命令启动创世纪任务 一项行政命令启动了“创世纪任务”,这是一项旨在加速科学发展的重大国家举措 使用人工智能进行发现和技术创新。任务,比较 曼哈顿计划的雄心勃勃,责成能源部领导这项工作。 11 月 24 日 美国行政命令寻求遏制州级人工智能法律 美国一项旨在限制或抢占国家人工智能监管的行政命令,以“增强美国的能力” 各国通过负担最小的人工智能国家政策框架实现全球人工智能主导地位。” 12月12日 Pax Silica推出:美国主导的人工智能和技术供应链合作 倡议 在美国国务院召开的峰会上,签署了《Pax Silica 宣言》 多个国家加强可信技术和人工智能相关供应链 半导体、数据基础设施、AI硬件合作。 12月11日 2025年 联合国教科文组织采用神经技术全球标准 联合国教科文组织批准涵盖人工智能驱动的神经技术——“神经数据”的国际标准 权利、精神隐私和新兴监管。 11 月 5 日 ===== 第331页 ===== 第331章 8 政策与治理| 2026 年人工智能指数报告 随着人工智能对经济发展和国家竞争力越来越重要,越来越多的政府 通过国家人工智能战略将他们的方法正式化。本节借鉴并建立在以下数据的基础上: Oxford Insights 跟踪正式国家战略随时间的采用和地理扩张。的 数据集捕获已发布的内容,而不是它的实施方式或实施情况,因此结果 应被视为政策意图而不是实际进展。 8.2 国家人工智能战略 更多国家在 2024 年和 2025 年制定国家人工智能战略,特别是在新兴经济体 (图8.2.1)。这标志着人工智能治理较早年发生了转变,因为历史上曾参与人工智能治理的国家 在人工智能政策制定中发挥较小作用的现在正在制定正式的国家战略。 新的框架已在撒哈拉以南非洲地区(例如埃塞俄比亚、加纳和尼日利亚)、南部非洲和 中亚(特别是斯里兰卡和尼泊尔)、拉丁美洲和加勒比地区(包括哥斯达黎加和 牙买加)。墨西哥和南非已经制定了战略,这一趋势凸显了 人工智能政策的全球影响力不断扩大。高收入经济体也继续贡献新的战略, 尽管速度较慢,但重点是巩固早期框架。欧洲国家,例如 马耳他发布了更新的战略,以符合欧盟人工智能法案的要求。 随着越来越多的国家制定国家人工智能战略,人们越来越认识到人工智能是推动人工智能发展的杠杆手段。 国家能力。国际合作、技术援助和政策传播也发挥着重要作用 在此扩展中的作用。然而,下一个挑战是实施和加强监管 能力,特别是在非洲,许多国家仍然缺乏正式的战略,并且存在人工智能落后的风险 治理和准备情况。 按地理区域 2019年 2020年 2021年 2022年 2023年 2024年 2025年 开发中 无策略 不适用 制定人工智能国家战略的国家 资料来源:Oxford Insights,2024 年;人工智能指数,2026 |图:2026年AI指数报告 图8.2.1 ===== 第332页 ===== 第332章 8 政策与治理| 2026 年人工智能指数报告 8.3 人工智能主权 随着人工智能技术在地缘政治和治国方略中变得越来越重要,越来越多的国家明确表示 国家战略中,注意力已经转向人工智能的控制、能力和依赖问题 堆栈。在政策方面,人工智能主权描述了一个国家审慎行事并独立自主的能力。 就其管辖范围内的人工智能系统的开发、部署和治理做出决策 在某些情况下,还可以通过标准、贸易和监管来实现这一目标。 随着人工智能系统在经济政策、国家安全、全球贸易和文化中变得越来越重要 自治、主权辩论已超出数据和基础设施范围,涵盖其他部分 人工智能堆栈的一部分,包括计算、模型开发、人才和负责任的人工智能部署。很多 这些辩论建立 关于之前的讨论 数字和技术 主权,其重点是 论政府权威 通过数字基础设施, 数据流、功能和 技术供应链。 今天,各国政府正在 采取一系列方法 跨越这些层,包括 投资、采购 政策、监管措施、 国际伙伴关系,以及 供应链战略。 本节借鉴了数据 Epoch AI、Zeki 和布鲁金斯学会 研究主权动态如何在计算基础设施、数据、模型、应用程序中演变, 和才华。 国内AI计算基础设施,包括高性能GPU集群和AI优化 超级计算机,已成为人工智能主权投资最引人注目的领域之一。政策上 讨论中,国内计算能力通常围绕减少对外国提供商的依赖来制定, 限制域外管辖权的暴露,并为政府机构提供连续的访问权限, 研究机构和国内企业在出口管制、地缘政治争端等情况下 供应链中断。 在此背景下,国有或国家支持的人工智能超级计算设施的规模和可用性 越来越多地与国内等相关措施一起用作“计算主权”的指标 获得先进芯片、云容量以及决定谁可以使用的治理安排 这些资源以及用途。 基础设施主权 ===== 第333页 ===== 第333章 8.3 人工智能主权 | 政策与治理| 2026 年人工智能指数报告 基于 Epoch AI 跟踪用于训练高级 AI 模型的大规模 GPU 集群的数据,1 状态 - 2010 年至 2025 年间,支持的人工智能超级计算在大多数地区扩展(图 8.3.1)。最锋利的 欧洲和中亚加速增长,2018 年集群数量从 3 个增加到 44 个 到 2025 年,主要由欧洲高性能计算联合组织等协调举措推动 承诺(EuroHPC JU)。北美同期增长近七倍,达到 41 个集群, 鉴于其相对较高的基准,大幅扩张,反映出政策转向专门化 国家人工智能研究基础设施,包括通过美国国家人工智能研究资源(NAIRR)。东 亚洲(不包括中国)增长了约四倍。相比之下,南亚、中东和北非 拉丁美洲和加勒比地区分别只增加了一倍或三倍,分别达到 2、3 和 8 个集群 2025年,尽管计划中的系统已在这些地区实施了几项扩大产能的举措 此处未包含,因为它们可能会发生变化并且固有的置信度较低。 尽管私有集群占据了全球大部分大规模人工智能计算能力,但国有集群 大多数地区的公私合营集群也在稳步增长。在实践中,这种区别是 云化是因为公共部门参与者仍然可以通过商业云访问许多私有集群 服务。公私伙伴关系可以涉及国内和国际参与者(图 8.3.2)。 例如,OpenAI 的 Stargate 项目通过国家级合作伙伴关系扩展到美国以外 跨地区,包括阿拉伯联合酋长国、英国、阿根廷、韩国、印度等 挪威。英伟达的“人工智能工厂”是一种不同的方法,其中通常内置国内计算能力 与国内电信提供商的合作伙伴关系,这种模式通过迎合 政府的主权人工智能野心。这些举措说明私营企业如何发挥日益重要的作用 在建设许多政府指定的国家人工智能基础设施方面发挥着核心作用。 1 由于底层数据集捕获的是前沿人工智能训练能力,而不是全部计算资源,因此该数字应为 被视为主权高端人工智能计算基础设施的代表,而不是国家计算能力的综合衡量标准。 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 10 20 30 40 50 60 70 80 90 AI超级计算机累计数量 2、南亚 3、中东及北非 8、拉丁美洲和加勒比地区 27、东亚及太平洋地区 41、北美洲 44、欧洲和中亚 85、中国 公共或公私合营人工智能超级计算机的数量,2010–25 来源:Epoch AI,2026 |图:2026年AI指数报告 图8.3.1 ===== 第334页 ===== 第334章 8.3 人工智能主权 | 政策与治理| 2026 年人工智能指数报告 图8.3.2 Nvidia 和 OpenAI 唯一的Nvidia AI工厂 仅限 OpenAI Stargate 不适用 2025 年公开宣布 Nvidia 或 OpenAI 基础设施计划的国家 资料来源:斯坦福 HAI,2026 |图:2026年AI指数报告 数据主权 基础设施主权侧重于对计算资源的控制,而数据主权则涉及 国家或地方参与者对其数据的收集、存储、处理和处理方式拥有代理权的程度 转移。一种常见的方法是采用数据本地化措施2,这些措施需要某些类别的数据 数据保留在国境内或对跨境数据传输施加限制。作为人工智能系统 越来越依赖庞大、多样化的数据集,数据主权已成为一个核心维度 更广泛的人工智能主权辩论。 自 2000 年以来,几乎每个地区都加强了数据本地化措施(Ferracane 等,2025, 图 8.3.3)。采用率的急剧上升始于 2016 年左右,恰逢 GDPR 的实施 在欧洲以及随后的“布鲁塞尔效应”,其他国家也采用了类似的框架。区域性 模式分为三大类:以东亚和太平洋地区为首的高度本地化区域(77 项措施)、 紧随其后的是撒哈拉以南非洲(71)以及欧洲和中亚(66);中等定位区域 包括中东和北非(44)、拉丁美洲和加勒比地区(36)以及南亚(24); 北美仍然是一个引人注目的异常值,只有 3 个指标,反映了长期以来的“流量优先” 政策导向.3 2 虽然没有单一的官方定义,但数据本地化措施被广泛理解为存储数据和/或 在国内领土内处理,包括直接存储授权和对跨境转移的有条件限制(López 冈萨雷斯等人,2022)。 3 这种模式有据可查(世界银行,2025 年),反映了一种普遍趋势(尤其是在美国),即有利于数据自由流动 其企业从中受益匪浅。举个例子,美国外交官最近的任务是反驳其他国家的数据 主权倡议(路透社,2026)。与此同时,新出现的限制,例如向“国家/地区”传输大量敏感个人数据的限制 “令人担忧的尝试”表明实施有针对性的控制的意愿日益增强。 ===== 第335页 ===== 第335章 8.3 人工智能主权 | 政策与治理| 2026 年人工智能指数报告 2000年 2001年 2002年 2003年 2004年 2005年 2006年 2007年 2008年 2009年 2010年 2011年 2012年 2013年 2014年 2015年 2016年 2017年 2018年 2019年 2020年 2021年 2022年 2023年 2024年 0 10 20 30 40 50 60 70 80 数据本地化措施累计数量 3、北美 24、南亚 36、拉丁美洲和加勒比地区 44、中东和北非 66、欧洲和中亚 71、撒哈拉以南非洲 77、东亚及太平洋地区 2000-24 年按地区划分的数据本地化措施 资料来源:Ferracane 等人,2026 |图:2026年AI指数报告 图8.3.3 主权模型 主权模型涉及一个国家的能力, 对发展的影响和控制 以及人工智能模型的部署。正如所讨论的 第 1 章,高级 AI 模型开发 历史上一直集中在一个小 技术中心的数量,主要集中在 美国和中国。虽然这种情况持续存在, 开源框架降低了障碍 进入,并且越来越多的地区 正在构建和部署自己的模型 (图8.3.4)。这一趋势反映出日益增长的 强调本地化模型开发 即使各国可以部署美国或中国的 做了模型。 图片来源:青空/ Adobe 库存,2026 ===== 第336页 ===== 第336章 8.3 人工智能主权 | 政策与治理| 2026 年人工智能指数报告 2010 2011 2012 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 200 400 600 800 1000 1200 1400 1600 累计发布AI模型数量 2、拉丁美洲和加勒比地区 21、南亚 74、中东和北非 125,北美洲 330,东亚和太平洋地区 666,欧洲和中亚 849,中国 1618,美国 2018 年各地区发布的人工智能模型数量 – 25 来源:Epoch AI,2026 |图:2026年AI指数报告 图8.3.4 根据 Epoch AI 数据追踪公开报道的车型发布情况,美国车型累计发布量有所增长 2018 年至 2025 年间,从 237 增加到 1,618。中国在 2022 年至 2025 年间也呈现出类似的加速趋势, 其中模型发布量从 151 个增加到 849 个,增加了五倍多,这表明国内模型的快速扩展 能力以及与美国模型开发的竞争加剧。这些数字反映了整个范围 Epoch AI 公开记录的模型版本,包括较小和不太突出的版本。这一点不同 来自第 1 章中使用的著名模型数据集,该数据集应用了较窄的标准,例如最先进的标准 表现和高引用次数。这两个数据集可以显示不同的同比模式,因为 这里更广泛的计数更能代表模型开发基础的扩大,而 第 1 章 1.1 节中的子集对边界的变化更加敏感。欧洲和中亚 表现稳定增长,同期从 127 款增加到 666 款,其中英国(229 模型)和法国(141)为主要贡献者,而加拿大(由北美地区捕获)落后 以 125 个型号排名第五。 到 2025 年,东亚和太平洋地区(不包括中国)的车型将从 39 款增至 330 款,而中东地区 北非、南亚(主要由印度推动)以及拉丁美洲和加勒比地区仅达到 分别为 74、21 和 2 个型号。其中一些地区已开始支持国家或地区 不过,智利的 Latam-GPT、阿联酋的 Falcon 系列和新加坡的 SEA-LION 等典范举措 他们的总体足迹仍然有限。这些数字也应被解释为保守估计,因为 这些地区的模型文件和报告不够系统。规模较小的不断增长的生态系统 例如,撒哈拉以南非洲地区的特定语言模型根本没有体现出来。 4 4 AfriBERTa(Ogueji 等人,2021)、AfriTeVa(Jude Ogundepo 等人,2022)、AfroLM(Dossou 等人,2022)、EthioLLM(Tonja 等人,2024b)、EthioMT(Tonja) 等人,2024c)和 AfroXLMR(Alabi 等人,2022)。 ===== 第337页 ===== 第337章 8.3 人工智能主权 | 政策与治理| 2026 年人工智能指数报告 总体而言,车型生产依然集中,美国和中国占比较高 在全球活动中所占的份额不成比例。同时,来自 AI 相关 GitHub 的补充证据 活动表明,开源开发正在更广泛地跨地区扩散,尽管其重要性不言而喻。 规模和能力的不对称仍然存在(完整分析请参见第 1 章 1.5 节)。 应用主权 人工智能主权的第四个维度涉及对下游的能力、代理和控制 人工智能系统在国家公共和私营部门的部署。应用层主权 包括国内采购政策;特定行业的监管要求,例如 如卫生、金融和国防;以及人工智能应用所依赖的数字公共基础设施(DPI) 越来越多地坐着。这些共同决定了一个国家可以在多大程度上塑造其人工智能系统 机构和公民互动。 对人工智能相关合同和赠款的公共投资提供了一个可观察到的信号,表明政府的表现如何 在实践中实施这种形式的主权(公共人工智能投资的全面分析见第 8.5 节) 美国和欧洲的趋势)。然而,除了公共投资之外,还需要全面的跨国数据 关于以主权为导向的人工智能采购偏好、部门部署授权和 DPI 利用 人工智能仍然有限,反映出概念的新颖性和采购数据的不透明性 司法管辖区。 ===== 第338页 ===== 第338章 8.3 人工智能主权 | 政策与治理| 2026 年人工智能指数报告 图8.3.5 ===== 第339页 ===== 第339章 各国越来越将人工智能投资集中在与机构优势相符的领域 和政策重点(图 8.3.5)。一小部分国家,其中最突出的是美国、中国、 和几个欧洲经济体(英国、德国、法国),近乎呈现高强度投资 所有应用程序类别。大多数其他国家都表现出集中的重点领域,表明有选择性 投资而不是全谱能力。 在欧洲,德国的优势在于工业应用(特别是制造业),而爱沙尼亚的优势在于工业应用(特别是制造业)。 教育技术。撒哈拉以南非洲国家在金融应用方面表现出更强的参与度, 由南非领导。拉丁美洲的格局更加不平衡,巴西投资广泛,而 智利和阿根廷等国家专注于更具体的领域,包括医疗保健和 分别是农业应用。在中东和北非,也出现了类似的动态, 以色列因其在安全和国防应用方面的专业化而脱颖而出,这与其更广泛的领域相一致 定位为全球网络安全中心。应用程序层,因为它不如模型或 计算层,为各国发展利基专业提供了更多空间,使他们能够发挥作用 对这些系统在国内和国际上拥有更大的自主权。 8.3 人工智能主权 | 政策与治理| 2026 年人工智能指数报告 人才主权 人工智能主权的第五个维度是一个国家开发和保留人工智能所需人力资本的能力。 构建、部署和管理人工智能系统。人才主权包括两个密切相关的动态:劳动力 能力、国内人工智能技能和专业知识存量以及人才流动性(国家 跨境吸引、留住或失去人工智能专家)。人工智能的国家分布和流动模式 作者和发明者提供了进入这个维度的直接窗口,并且也在第 1.8 节中详细讨论。 第一章更广泛的劳动力市场指标,包括人工智能人才集中度和劳动力趋势 国家,在第 4 章 4.4 节中进行了审查。 ===== 第340页 ===== 340 2016 2018 2020 2022 2024 0 20 40 60 2016 2018 2020 2022 2024 0 20 40 60 2016 2018 2020 2022 2024 0 50 100 150 2016 2018 2020 2022 2024 0 50 100 2016 2018 2020 2022 2024 0 100 200 300 400 2016 2018 2020 2022 2024 0 5 10 15 20 2016 2018 2020 2022 2024 0 200 400 600 内流 输出 东亚和太平洋地区 拉丁美洲和加勒比地区 北美 欧洲和中亚 印度 中东和北非 美国 顶尖人工智能作者和发明家的流入和流出(12 个月滚动平均值) 2016-25 年各地区顶尖人工智能作者和发明家的数量 来源:Zeki 数据,2025 |图:2026年AI指数报告 图8.3.6 8.3 人工智能主权 | 政策与治理| 2026 年人工智能指数报告 尽管净流量保持稳定,但跨境人工智能人才流动最近已放缓(见第 1.8 节) 第 1 章)。流入和流出都在下降,表明人才越来越多地留在国内 国家或区域系统而不是全球流通(图8.3.6)。美国目前 全球顶尖人工智能人才的主要吸引者,尽管其领先优势正在迅速缩小。相比之下,印度是 从人才净输出国转变为人才净吸收国。之间的近镜像关系 这两个国家反映了一个有据可查的事实,即美国一直是印度的主要目的地 人工智能人才。与此同时,中东和北非地区正在取得增量进展,这表明新的 在有针对性的政策和投资的支持下,人才中心正在兴起。 ===== 第341页 ===== 第341章 8 政策与治理| 2026 年人工智能指数报告 8.4 人工智能与政策制定 立法活动是政府如何在国家战略之外应对人工智能的信号。这个 该部分利用 Digital Policy Alert 的数据跟踪 G20 国家通过的人工智能相关法案。5 该数据集涵盖已颁布的立法,而不是拟议或待决的法案。计数应解释为 谨慎行事,因为它们可能低估了人工智能相关政策制定的实际数量,因为大型综合法案 包含多项人工智能条款的内容被视为单项立法。体积也不是衡量 意义重大,因为单一的主要法律可以比数十个范围较小的法律产生更大的影响和执行力度 那些。 5 由于计算方法发生了变化,数字可能与 2025 年 AI 指数报告中的报告有所不同。另外,以下图表重点 仅适用于 G20 国家。 全球人工智能立法记录 2016年,G20国家尚无人工智能相关法律记录。自此以后,立法活动 尽管各国通过的法律总数差异很大(图 8.4.1 至 8.4.3)。 2016年至2025年间,美国通过的人工智能相关法案最多,共有25项,其次 韩国以 17 分居首。日本、法国和意大利也相对活跃,分别通过了 9 至 10 分 法律。在同一时期,其他国家,例如俄罗斯和沙特阿拉伯,通过的人工智能(如果有的话)也非常少。 具体立法。与人工智能发展的其他方面,如投资和研究产出类似, 政策制定正在扩大,但不均衡。 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 2 4 6 8 10 12 14 16 通过的人工智能相关法案数量 11 G20 国家通过的人工智能相关法案数量,2016 年 – 25 资料来源:AI 指数; 2026 年数字政策警报 |图:2026年AI指数报告 图8.4.1 ===== 第342页 ===== 第342章 8.4 人工智能与政策制定 | 政策与治理| 2026 年人工智能指数报告 0 1–5 6–10 16–30 非G20 G20 国家通过的人工智能相关法案数量,2016 年 – 25 资料来源:AI 指数; 2026 年数字政策警报 |图:2026年AI指数报告 图8.4.2 图8.4.3 25 17 号 10 10 9 6 5 5 3 2 1 1 1 1 0 5 10 15 20 25 印度 中国 加拿大 阿根廷 澳大利亚 巴西 俄罗斯 德国 英国 意大利 日本 法国 韩国 美国 通过的人工智能相关法案数量 资料来源:AI 指数; 2026 年数字政策警报 |图:2026年AI指数报告 2017 年通过的人工智能相关法案数量 G20 国家,2016-25(总计) ===== 第343页 ===== 第343章 亮点: 仔细审视全球人工智能立法 8.4 人工智能与政策制定 | 政策与治理| 2026 年人工智能指数报告 账单名称 描述 国家 美国《拆除法案》(解决问题的工具 已知的固定化利用 网站上的技术深度伪造 和网络法) 该法案将未经同意的分发和披露定为犯罪行为 亲密的视觉描绘,包括人工智能生成或数字化 改变了深度伪造品。它要求在线平台删除 48小时内举报内容并加强执法 通过联邦刑事处罚和民事诉讼 允许受害者提起诉讼要求赔偿。 意大利规定和授权 就此事向政府 人工智能法(法律号: 132/2025) 该法建立了一个负责任的国家框架, 意大利透明、以人为本的人工智能,与欧盟保持一致 《人工智能法》(第 2024/1689 号条例)。它设定了原则和治理 人工智能战略和部门部署的方向,并解决 用户保障、版权相关问题和处罚规定 用于特定的非法用途。 日本研究促进法 及开发利用 人工智能相关的 技术 该法提供了促进人工智能研究的国家框架, 通过明确责任来开发和利用 国家政府、地方政府、研究机构、 和企业。它规定了人工智能基本计划并建立了 总理领导的人工智能战略总部协调跨部门 政府政策和国际合作。 韩国发展框架法 人工智能和 建立信任基础 该法律规定了韩国的总体政策和治理 在建设过程中推进人工智能的框架 值得信赖和道德的人工智能的条件。它提供了主要的 政府主导的人工智能战略、协调和发展的法定依据 支持措施以及制定标准和保障措施 旨在促进公众信任和产业创新。 美国立法记录 国家级 自 2016 年以来,美国通过的人工智能相关法律比任何其他 G20 国家都多,这使其成为一个有用的国家 案例来研究如何通过国内政策渠道解决人工智能问题。在美国,人工智能已经成为 涉及治理、国家安全、公共服务和个人的跨领域政策问题 权利。本节跟踪州一级颁布的与人工智能相关的法案以及证人的组成 国会人工智能听证会和联邦监管活动。 州立法机构一直是美国人工智能政策制定的活跃场所,特别是在 缺乏全面的联邦人工智能立法。在所有州,通过的人工智能相关法案总数 从 2020 年的不到 10 个增加到 2025 年的 150 个(图 8.4.4 至 8.4.6)。然而,少数 各州在 2025 年颁布的立法中所占比例过高。加利福尼亚州颁布了 20 项与人工智能相关的立法 ===== 第344页 ===== 第344章 8.4 人工智能与政策制定 | 政策与治理| 2026 年人工智能指数报告 账单数量是纽约州总数 (10) 的两倍,比第二活跃州德克萨斯州 (12) 多三分之二。 在整个 2016 年至 2025 年期间,加利福尼亚州颁布的法案数量是其他州的两倍多,共颁布了 62 项法案。 马里兰州 (28)、弗吉尼亚州 (25) 和犹他州 (24) 也有反映多个地区一致活动的记录 立法周期。密苏里州和罗德岛州这两个州尚未颁布任何与人工智能相关的立法 日期。 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 20 40 60 80 100 120 140 项人工智能相关法案获得通过 150 美国各州通过的人工智能相关法案数量,2016-25 来源:人工智能指数,2026 |图:2026年AI指数报告 图8.4.4 图8.4.5 62 28 25 24 18 17 号 15 12 12 11 11 11 9 9 9 0 8 16 24 32 40 48 56 密歇根州 亚利桑那州 阿拉巴马州 马萨诸塞州 佛罗里达州 科罗拉多州 华盛顿 北达科他州 伊利诺伊州 德克萨斯州 纽约 犹他州 弗吉尼亚州 马里兰州 加利福尼亚州 通过的人工智能相关法案数量 来源:人工智能指数,2026 |图:2026年AI指数报告 部分地区通过的人工智能相关法案数量 美国各州,2016–25 ===== 第345页 ===== 第345章 8.4 人工智能与政策制定 | 政策与治理| 2026 年人工智能指数报告 AL 9 AK 1 AZ 9 增强现实 4 CA 62 一氧化碳 11 CT 5 德 2 FL 11 遗传算法 3 嗨 4 身份证号 4 伊尔 15 在 5 IA 5 KS 2 肯塔基州 3 洛杉矶 6 我 3 医学博士 28 硕士 11 心肌梗塞 9 明尼苏达州 5 多发性硬化症 9 莫 0 MT 8 东北 3 内华达州 4 NH 7 新泽西州 5 纳米 6 纽约 18 数控 7 ND 12 羟基 3 好的 2 或 5 PA 4 RI 0 SC 1 标清 2 总氮 7 TX 17 号 UT 24 室速 7 VA 25 西澳 12 西弗吉尼亚州 7 威斯康辛 3 怀伊 1 来源:人工智能指数,2026 |图:2026年AI指数报告 国家级人工智能相关法案通过成为法律的数量 美国各州,2016 年 25(总计) 图8.4.6 亮点: 联邦政策变化中的州人工智能立法 虽然联邦人工智能政策转向放松管制 2025年,各州立法机构继续前进 在缺乏人工智能特定法律的情况下 联邦框架。6 国家政策正在制定 跨越不同的轨道,包括有针对性的 防止歧视、错误信息、 和虐待。几个最著名的州 行动,包括犹他州的心理健康聊天机器人 法、蒙大拿州的计算权法和德克萨斯州的 负责任的人工智能治理法案,也被列在 本章开头的时间线。 对人工智能进行更全面的监管 使用时,一些国家追求更广泛的框架。 科罗拉多州人工智能法案签署 2024 年 5 月,是首批针对 决策中的算法歧视,例如 就业、住房和医疗保健。然而, 6 根据对所有 50 个国家进行的搜索,州追踪系统仅统计最终颁布的文本中包含“人工智能”一词的法案。 州立法网站。虽然此过滤器使数据集保持一致,但它可能仅捕获更广泛的州级政策图景的一部分。 ===== 第346页 ===== 第346章 亮点: 8.4 人工智能与政策制定 | 政策与治理| 2026 年人工智能指数报告 法律也是一个案例研究,说明实施更广泛的监管框架有多么困难。 2025 年,科罗拉多州试图颁布修正案,缩小部分法律范围,但最终选择推动 关键合规性可追溯至 2026 年中期,以便有更多时间考虑修订。德克萨斯州 其次 2025 年通过的《负责任的人工智能治理法案》(HB 149) 走了一条不同的道路 2026 年 1 月生效。虽然最初被誉为最全面的人工智能立法,但最终版本 与最初的提案相比大幅缩减,取消了大多数私营部门的义务 重点关注行为操纵和儿童性虐待材料的制作等用途。 一些州已重点监管人工智能聊天机器人与消费者的互动方式,特别是在敏感领域 设置。犹他州 HB 452 于 2025 年 3 月签署,涉及心理健康聊天机器人并要求披露 当用户与人工智能交互时,禁止向第三方出售或共享个人健康数据, 并限制聊天内广告。加利福尼亚州 SB 243 将于 2026 年 1 月生效,要求配备聊天机器人 运营商披露其人工智能本质并实施与自杀意念相关的安全协议, 对未成年人的额外保障。其他州,例如夏威夷 (SB 640) 和马萨诸塞州 (S.243),已 提议将未公开的聊天机器人交互视为不公平和欺骗性行为。 水印和出处要求也受到关注。华盛顿 (HB 1170) 需要大量 提供商将人工智能生成或实质性改变的媒体的来源数据包含在内。伊利诺伊州(SB 1929)和 佛罗里达州 (HB 369) 继加州《人工智能透明度法案》(SB 942) 之后提出了类似措施,该法案 要求大型生成人工智能工具免费提供水印和检测工具。 然而,并非所有州都加大了监管力度。在蒙大拿州,SB 212 于 2025 年 4 月签署 并建立了第一个国家级的“计算权”,确认了个人和企业的拥有权 并将计算资源(包括人工智能工具)用于合法目的。蒙大拿州法律限制政府 对那些“明显必要且经过严格定制以实现令人信服的目标”的限制 政府利益”,同时还要求人工智能控制的关键基础设施的部署者保持风险 具有人力超越能力的管理政策。 2025 年 12 月,白宫发布了一项题为“确保国家政策框架”的行政命令 人工智能”,指示司法部成立人工智能诉讼特别工作组 在法庭上质疑州人工智能法律,指示商务部确定其认为的州法律 负担过重,并将一些联邦资金与各州避免制定相互冲突的人工智能的意愿挂钩 立法。该命令规定了州立法机构可以监督的某些领域,包括儿童安全、数据 中心基础设施和州政府采购。结果是,美国州级的未来 人工智能的监管仍存在不确定性。 美国国会听证会 国会对人工智能的关注(以出席人工智能相关听证会的证人数量来衡量) 自 2017 年以来增加了近 20 倍(图 8.4.7)。 2022 年之后增长加速,与 生成式人工智能工具将在 2022 年末成为主流。见证人数从 2022 年的 18 人增加到 2022 年的 131 人。 2023 年,该数字仍处于高位,2025 年为 102。 随着时间的推移,这些证人的构成发生了变化(图 8.4.8)。行业见证人比例上升 从第115届国会的13%上升到第119届国会的37%,成为数据中最大的见证群体。这 ===== 第347页 ===== 第347章 增长与该行业在整体人工智能发展中不断扩大的作用是一致的。正如章节中所讨论的 如图 1 和 4 所示,私营公司现在占前沿模型发布和基础设施的大部分 投资,这可能会将它们定位为更相关的技术投入来源和更活跃的来源 参与者塑造其运作的政策环境。同期,占比 政府见证人的比例从 35% 下降到 10%,学术界的比例从 26% 下降到 15%。 “其他” 包括民间社会和非营利组织在内的类别从 26% 增长到 38%。 8.4 人工智能与政策制定 | 政策与治理| 2026 年人工智能指数报告 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 20 40 60 80 100 120 证人人数 102 美国国会人工智能相关听证会的证人人数,2017-25 来源:人工智能指数,2026 |图:2026年AI指数报告 26% 35% 19% 25% 15% 13% 19% 28% 27% 37% 35% 17% 25% 15% 10% 26% 30% 28% 33% 38% 第115期 116期 117期 118期 119期 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 学术界 工业界 政府 其他 国会 证人(占总数的%) 按部门划分的美国国会人工智能相关听证会的证人(占总数的%),2017-25 来源:人工智能指数,2026 |图:2026年AI指数报告 图8.4.7 图8.4.8 ===== 第348页 ===== 第348章 8.4 人工智能与政策制定 | 政策与治理| 2026 年人工智能指数报告 在众议院和参议院,人工智能的总体治理以及国家安全和国防吸引了各方的关注。 2017 年至 2025 年间目击者数量最多,分别为 113 名和 74 名目击者(图 8.4.9)。总体而言, 众议院在大多数主题领域都比参议院更加活跃,包括金融和经济 政策(36 比 3 名证人)和国家安全(49 比 25)。健康和生物医学人工智能是唯一 两个议院都显示出相同活动水平的区域(各有 9 名证人),表明具有可比性 参与该领域。 9 8 12 16 13 3 25 53 3 6 8 9 15 18 20 29 30 36 49 60 0 3 6 9 12 15 18 21 24 27 30 33 36 39 42 45 48 51 54 57 60 63 能源 交通及 自治系统 工商业 健康与生物医学人工智能 教育和劳动力 隐私和法律 用户的风险、权利和 保护措施 政府现代化 研发与创新 金融和经济政策 国家安全与国防 一般人工智能治理 房子 参议院 证人人数 学科领域 按主题领域划分的美国国会人工智能相关听证会的证人人数,2017-25 来源:人工智能指数,2026 |图:2026年AI指数报告 图8.4.9 美国法规 近年来,联邦对人工智能的监管活动有所增加,与人工智能相关的法规数量不断增加 记录的行动从 2016 年的 1 起增加到 2025 年的 58 起(图 8.4.10)。与目击者计数类似, 增幅最大出现在 2022 年之后,到 2025 年增长速度保持稳定,其中 58 个与人工智能相关 法规。 2025 年初,唐纳德·特朗普政府发布了联邦人工智能政策的方向发生了变化 有害行政命令和行动的初步撤销,撤销了一系列行政行动, 包括拜登政府的第 14110 号行政命令,这是一个安全、可靠和值得信赖的框架 人工智能的开发和使用。拜登的命令奠定了更加谨慎的联邦做法 包括高级模型的报告要求、人工智能生成内容的水印指南、 以及解决隐私、公民权利和劳动力影响的举措。其逆转之后出现了新的 行政命令“消除美国在人工智能领域的领导地位的障碍”,该命令重新定位 减少监管限制和促进创新的联邦政策。 ===== 第349页 ===== 第349章 8.4 人工智能与政策制定 | 政策与治理| 2026 年人工智能指数报告 2016 2017 2018 2019 2020 2021 2022 2023 2024 2025 0 10 20 30 40 50 60条人工智能相关法规 58 2016 年美国人工智能相关法规数量 – 25 来源:人工智能指数,2026 |图:2026年AI指数报告 图8.4.10 按代理机构 越来越多的人工智能相关法规是由众多联邦机构推动的(图 8.4.11)。总统办公厅是最活跃的,每年都会发布监管行动 自 2016 年以来,仅 2025 年就推出了 28 个。商务部和工业安全部 近年来,随着人们对出口管制的日益关注,该局也变得更加活跃 和人工智能供应链政策。能源部、能源部等多个机构 教育部和证券交易委员会于 2023 年或开始发布人工智能相关法规 稍后。 ===== 第350页 ===== 350 8.4 人工智能与政策制定 | 政策与治理| 2026 年人工智能指数报告 图8.4.11 ===== 第351页 ===== 第351章 亮点: 仔细看看美国联邦法规 8.4 人工智能与政策制定 | 政策与治理| 2026 年人工智能指数报告 法规说明机构 商业 部门; 工业和 保安局 人工框架 智力扩散 在 2025 年 5 月被特朗普政府废除之前,该规则已更新 美国对先进计算产品和某些人工智能模型的出口管制 重量。它为指定的高级“封闭重量”创建了一个新的分类 人工智能模型权重和修订的许可要求以及审查政策 先进计算集成电路及相关项目。它还扩大并 添加了某些目的地和用途的许可例外情况,更新了通知 程序,并引入了额外的指导来帮助识别转移风险。 正义 部门 阻止进入美国 敏感个人数据和 政府相关数据 由关注国家或 受保人 本规则执行 2024 年 2 月 28 日第 14117 号行政命令“防止 访问美国人的大量敏感个人数据和美国 受关注国家的政府相关数据。”它禁止或限制 涉及相关国家或相关人员的某些数据交易, 专注于美国人大量敏感个人数据的特定传输 以及美国政府相关数据。该规则涉及跨境数据 可能涉及大规模数据集的交易,并规定了何时进行限制 以及如何传输此类数据。 行政办公室 总统的 推进美国 人工领导力 智能基础设施 该行政命令指示联邦政府快速推进扩建 国内人工智能基础设施,特别是前沿数据中心及其 支持能源系统——在各部门管理的联邦土地上 国防、能源和内政部。它要求进行竞争性招标 联邦场地上的私营部门租赁,以及清洁能源的要求 采购、严格的网络安全标准和高劳工实践。的 该命令还简化了许可流程,解决了电网互连问题 挑战,并呼吁国际参与促进可信人工智能 美国盟友之间的基础设施建设,所有这些的总体目标是确保 美国在人工智能前沿发展方面保持领先地位。 行政办公室 总统的 消除障碍 美国在以下领域的领导地位 人工智能 该行政命令设定了美国维持全球人工智能的基本政策 通过废除被视为创新障碍的法规来占据主导地位。大多数 值得注意的是,它取代了拜登政府关于安全的 2023 年人工智能行政命令 和值得信赖的人工智能开发并指示机构暂停或撤销 根据先前命令采取的任何与新政策相冲突的行动。它还 要求在 180 天内制定全面的人工智能行动计划, 并要求管理和预算办公室修改现有的与人工智能相关的 指导备忘录,以配合政府的支持创新、最低限度 监管方式。 行政办公室 总统的 确保国家政策 人工框架 情报 该行政命令建立了国家人工智能政策框架,以防止 各州法规的零散拼凑阻碍了美国的创新 和全球竞争力。它在以下机构下创建了一个人工智能诉讼特别工作组 总检察长质疑各州人工智能法律被认为过于繁重 或违宪。它还指示联邦机构评估有问题的 州法律,可能会扣留不合规州的联邦资金,以及 制定统一的联邦标准,以取代相互冲突的州法规—— 同时维护国家对儿童安全、数据中心和政府的权威 人工智能采购。 以下部分重点介绍通过联邦规则和行政命令颁布的人工智能相关法规 2025 年期间。 ===== 第352页 ===== 第352章 亮点: 8.4 人工智能与政策制定 | 政策与治理| 2026 年人工智能指数报告 行政办公室 总统的 先进的人工 智力教育 美国青年 该行政命令推动美国人的人工智能教育 通过指示联邦政府扩大对人工智能的早期接触来帮助年轻人 概念,将人工智能适当地融入课堂,构建人工智能就绪的课堂 劳动力。它建立了白宫人工智能教育特别工作组,由 科学技术政策办公室,协调各机构的工作和 创建总统人工智能挑战赛,突出学生和 教育家的成就。该命令还优先考虑教育者培训和研究 人工智能在教育领域的应用,包括利用现有的资助计划来支持 专业发展和人工智能工具可改善教学和 学习成果。 行政办公室 总统的 促进出口 美国人工智能技术 堆栈 该行政命令启动了一项协调一致的联邦倡议,以促进 出口美国AI“全栈”技术包。这些包 结合人工智能优化的硬件、云和网络基础设施、数据 选定的管道、模型、安全措施和目标应用 伙伴国家和地区。它指示商务部征求 评估行业主导联盟的提案,指定优先人工智能出口 一揽子计划,并通过简化联邦外交和 融资工具。该命令将这些努力视为维持美国的必要条件。 人工智能领域的领导地位并减少全球对人工智能技术开发的依赖 对手。 ===== 第353页 ===== 第353章 8 政策与治理| 2026 年人工智能指数报告 8.5 人工智能的公共投资 人工智能方面的公共支出反映了政府如何转化国家战略和政策承诺 进入资源配置。本节跟踪美国和几个国家的政府人工智能支出 欧洲国家,利用欧洲和英国的公共合同数据以及合同、拨款和 美国的其他交易协议 (OTA) 数据。7 包括美国的赠款级别数据 国家,但未系统地适用于欧洲国家,因此被排除在欧洲之外 分析。 由于数据可用性的差异,不同地区的方法也有所不同。在欧洲和英国,长期以来 框架协议和动态采购系统8等术语工具通常会报告最大 合同上限而不是实际支出,并且奖励期限数据通常不完整。因此, 欧洲和美国的结果分别列出。对于美国来说,交易级义务 数据可用时,AI 指数通过仅汇总之后发生的那些义务来估计投资 与人工智能相关的活动首先出现在授予的程序中,同时控制可能会导致早期解除义务的行为。 扭曲趋势。这种方法保留了时间模式,同时降低了夸大历史人工智能的风险 投资。 7 欧洲合同数据取自 Tenders Electronic Daily (TED)。英国数据来源于 TED、Find a Tender、Contracts Finder 及其 存档。苏格兰和威尔士的支出数据可通过采购 API 和开放式合同合作伙伴关系的数据注册中心(通过 Kingfisher)访问 收集;由于没有 API,北爱尔兰被排除在外。美国合同、拨款和 OTA 数据取自联邦采购数据 系统(FPDS)API。 8 框架协议和动态采购系统是多年伞式采购安排的两种类型。框架协议 设定预先商定的条款和未来采购的最大预算,而动态采购系统是一个灵活、开放的批准供应商列表 随着时间的推移,用于比赛和订单。 人工智能公共投资总额 美国 美国和欧洲国家人工智能相关合同的公共支出都有所增长 尽管支出的速度和构成因国家而异。 2013年至2024年间,美国为人工智能相关活动投资了约205亿美元, 其中包括 159 亿美元的赠款、39 亿美元的合同以及 6.5 亿美元的其他交易协议 (图8.5.1)。自 2020 年以来,与合同和 OTA 相比,与人工智能相关的赠款支出加速。在 到 2024 年,赠款总额为 51 亿美元,占 2013 年以来累计总额的 32%(图 8.5.2)。 奖项数量也遵循类似的模式。补助金占人工智能相关奖项的大部分,共有 22,364 项 相比之下,有 3,347 份合同和 185 份 OTA(图 8.5.3)。尽管 OTA 数量较低,但其中位数 合同价值近100万美元,远远高于赠款(304,000美元)和合同(150,000美元)。 ===== 第354页 ===== 第354章 8.5 人工智能的公共投资 | 政策与治理| 2026 年人工智能指数报告 0.83 1.30 2.00 2.58 3.22 3.91 0.67 1.10 1.79 3.46 6.81 10.83 15.88 0.08 0.21 0.33 0.47 0.74 1.23 2.04 3.28 5.72 9.72 14.59 20.44 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0 5 10 15 20 补助金 合约 OTA 人工智能累计公共支出(单位:十亿美元) 美国人工智能累计公共支出,2013-24 来源:人工智能指数,2026 |图:2026年AI指数报告 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0 1 2 3 4 5 人工智能公共支出(十亿美元) 0.12、OTA 0.69,合同 5.05,补助金 美国人工智能公共支出,2013-24 来源:人工智能指数,2026 |图:2026年AI指数报告 图8.5.1 图8.5.2 ===== 第355页 ===== 第355章 8.5 人工智能的公共投资 | 政策与治理| 2026 年人工智能指数报告 美国人工智能相关公共支出 来源:人工智能指数,2026 统计赠款合同 OTA 获奖数量 22,364 3,347 185 总计(十亿美元) 15.9 3.9 0.7 中位数(单位:千美元) 304 149.9 999.7 平均(单位:千美元) 710.1 1,167.9 3,528.8 每 10 万居民总计(千) 4,728.7 1,172.8 195 从地域上看,美国通过合同和OTA进行的公共人工智能投资高度集中。弗吉尼亚9 获得 10.9 亿美元,加利福尼亚州 6.7 亿美元,马里兰州 5.5 亿美元;这些州合计起来 占 2013 年至 2024 年间合同和 OTA 总支出的近 60%(图 8.5.4)。人工智能相关资助 已更加广泛地分散。加利福尼亚州(23.7 亿美元)、马萨诸塞州(13 亿美元)和纽约州(1.15 美元) 亿)获得了最大的分配,但这前三名占总数的不到16%(图 8.5.5)。合同和 OTA 的地理集中度可能反映了与主要联邦机构的接近程度, 同时更广泛的赠款分配与联邦资助的更广泛的机构足迹相一致 研究。 9 ECS 总部位于弗吉尼亚州,按合同和 OTA 授予的总价值计算,ECS 是美国最大的承包商。 图8.5.3 图8.5.4 AL 168.59M AK 0.07M AZ 25.17M 增强现实 9.42M CA 673.58M 一氧化碳 61.14M CT 8.34M 德 1.12M 直流 365.98M FL 69.22M 遗传算法 33.55M 嗨 9.21M 身份证号 6.14M 伊尔 46.65M 在 7.12M IA 201万 KS 7.27M 肯塔基州 1.56M 洛杉矶 19.30M 我 1.40M 医学博士 547.69M 硕士 285.56M 心肌梗塞 186.90M 明尼苏达州 7.12M 多发性硬化症 9.54M 莫 17.50M MT 0.91M 东北 1.50M 内华达州 3.58M NH 105.32M 新泽西州 61.43M 纳米 33.17M 纽约 93.27M 数控 11.87M ND 0.20M 羟基 139.66M 好的 18.43M 或 11.37M PA 109.04M RI 3.99M SC 17.42M 标清 608万 总氮 12.03M TX 173.39M UT 3.89M 室速 0.10M VA 1.09B 西澳 11.53M 西弗吉尼亚州 31.20M 威斯康辛 4.39M 怀伊 209万 来源:人工智能指数,2026 |图:2026年AI指数报告 2013 年美国通过合同和 OTA 进行的人工智能公共支出 24 ===== 第356页 ===== 第356章 8.5 人工智能的公共投资 | 政策与治理| 2026 年人工智能指数报告 图8.5.5 图8.5.6 跨机构支出 在美国,国防部在 2013-24 年期间在人工智能相关合同和 OTA 支出方面处于领先地位, 占 2024 年 8.1 亿美元总额的 74.1%,占整个行业总支出(46 亿美元)的 73% 整个时期(图8.5.6)。第二大资助者是该部门,尽管规模要小得多。 财政部为 7.2%,退伍军人事务部为 5.1%。其余机构中,每个 占同期总支出的不到5%。 与人工智能相关的拨款主要通过卫生与公共服务部 (HHS) 提供 — 其中包括美国国立卫生研究院 — 和美国国家科学基金会 (NSF)(图 8.5.7)。到 2024 年,公共人工智能资金将平均分配给这些机构,每个机构大约占 占总数的40%。随着时间的推移,国家科学基金会一直获得最大份额的人工智能相关拨款,直到 从 2020 年开始,HHS 的数量急剧增加。 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0% 10% 20% 30% 40% 50% 60% 70% 80% 人工智能相关合同和 OTA 的公共支出(占总额的百分比) 1.90%,美国国家航空航天局 3.35%,国土安全部 3.58%,卫生与公共服务部 4.80%, 其他 5.13%,退伍军人事务部 7.16%,财政部 74.09%,国防部 按资助机构划分的美国人工智能相关合同 + OTA 的公共支出(占总额的百分比),2013-24 来源:人工智能指数,2026 |图:2026年AI指数报告 AL 181.23M AK 11.97M AZ 240.56M 增强现实 43.17M CA 2.37B 一氧化碳 353.30M CT 220.98M 德 58.32M 直流 152.73M FL 565.30M 遗传算法 387.72M 嗨 56.87M 身份证号 37.07M 伊尔 654.84M 在 331.09M IA 134.41M KS 65.63M 肯塔基州 62.58M 洛杉矶 85.96M 我 43.68M 医学博士 722.03M 硕士 1.30B 心肌梗塞 409.36M 明尼苏达州 245.44M 多发性硬化症 60.98M 莫 218.68M MT 36.53M 东北 43.04M 内华达州 47.84M NH 92.69M 新泽西州 244.40M 纳米 49.85M 纽约 1.16B 数控 502.71M ND 50.75M 羟基 304.81M 好的 139.91M 或 201.18M PA 980.96M RI 58.51M SC 180.61M 标清 20.62M 总氮 240.94M TX 907.14M UT 111.98M 室速 23.89M VA 297.22M 西澳 622.24M 西弗吉尼亚州 34.28M 威斯康辛 360.34M 怀伊 11.74M 来源:人工智能指数,2026 |图:2026年AI指数报告 2013 年美国通过赠款进行的人工智能公共支出 24 ===== 第357页 ===== 第357章 8.5 人工智能的公共投资 | 政策与治理| 2026 年人工智能指数报告 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0% 10% 20% 30% 40% 50% 60% 人工智能相关拨款的公共支出(占总额的百分比) 2.22%,国防部 3.35%,农业部 3.74%, 其他 5.30%,商务部 6.15%,能源部 37.62%,国家科学基金会 41.63%,卫生与公众服务部 美国人工智能相关拨款的公共支出(占总额的百分比),按资助机构划分,2013-24 来源:人工智能指数,2026 |图:2026年AI指数报告 图8.5.7 欧洲 欧洲国家在 2013-24 年期间集体承诺签署约 37 亿美元的合同10 (图8.5.8)。英国占比最大,达16亿美元,其次是德国 (5.05 亿美元)和法国(3.2 亿美元)。 2024年,英国与人工智能相关的公共承诺为4.544亿美元, 占前十年投资的28%。德国拨款 2.066 亿美元,代表 占同期总数的40%。合同量也遵循类似的模式。英国发行最多 人工智能相关合同数量为 738 份,而德国为 611 份,西班牙为 187 份(图 8.5.9)。然而,尽管 由于支出和合同量较高,这三个国家的合同价值中位数低于 50 万美元,远低于丹麦等欧洲小国(近 110 万美元)(图 8.5.10)。 10 英国和欧盟数据的详细信息仅允许我们衡量奖励金额。由于许多人工智能相关合同依赖于框架协议或 动态采购系统,没有关于实际义务的时间表和总额的明确信息。 ===== 第358页 ===== 第358章 8.5 人工智能的公共投资 | 政策与治理| 2026 年人工智能指数报告 0.12 0.160.10 0.19 0.12 0.14 0.32 0.11 0.14 0.19 0.23 0.30 0.51 0.15 0.20 0.33 0.56 0.78 0.17 0.77 0.85 1.14 1.59 0.01 0.01 0.02 0.03 0.09 0.17 0.37 0.60 1.33 1.73 2.41 3.66 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0.00 0.50 1.00 1.50 2.00 2.50 3.00 3.50 4.00 英国 其他 德国 法国 西班牙 芬兰 比利时 人工智能合约累计公共支出(单位:十亿美元) 欧洲国家人工智能合约累计公共支出,2013-24 来源:人工智能指数,2026 |图:2026年AI指数报告 第738章 611 187 162 161 111 96 86 62 53 50 45 38 35 34 0 50 100 150 200 250 300 350 400 450 500 550 600 650 700 750 丹麦 希腊 荷兰 比利时 意大利 保加利亚 匈牙利 捷克共和国 芬兰 罗马尼亚 法国 波兰 西班牙 德国 英国 人工智能相关合同数量 部分欧洲国家的人工智能相关合同数量,2013-24(总计) 来源:人工智能指数,2026 |图:2026年AI指数报告 图8.5.8 图8.5.9 ===== 第359页 ===== 第359章 8.5 人工智能的公共投资 | 政策与治理| 2026 年人工智能指数报告 1.07 0.98 0.97 0.83 0.68 0.65 0.65 0.61 0.58 0.53 0.52 0.49 0.48 0.45 0.43 0.00 0.20 0.40 0.60 0.80 1.00 法国 西班牙 斯洛伐克 瑞典 爱沙尼亚 爱尔兰 葡萄牙 挪威 马耳他 希腊 芬兰 意大利 比利时 奥地利 丹麦 公共人工智能相关合同价值中位数(单位:百万美元) 部分欧洲国家公共人工智能相关合同的中值价值,2013-24 来源:人工智能指数,2026 |图:2026年AI指数报告 2013 2014 2015 2016 2017 2018 2019 2020 2021 2022 2023 2024 0% 10% 20% 30% 40% 50% 60% 70% 80% 人工智能相关合同的公共支出(占总额的百分比) 2.79%,社区和社会部门组织 3.30%,其他 3.65%, 经济和金融事务 13.72%, 教育 13.90%, 健康 62.65%,政府、国家机构或公共机构 欧洲人工智能相关合同的公共支出(按资助机构活动划分),2013-24 来源:人工智能指数,2026 |图:2026年AI指数报告 图8.5.10 图8.5.11 跨部门支出 在欧洲,政府机构在 2024 年人工智能相关合同支出中占据最大份额,其中 “政府、国家机构或公共机构”类别占总数的 62.6%(图 8.5.11)。医疗支出占 13.9%,紧随其后的是教育,占 13.7%。 ===== 第360页 ===== 360 公共 意见 9 概述 现在,公众对人工智能的看法是由一种核心张力所决定的,因为 对技术优势的乐观态度往往与 对其更广泛影响的焦虑。大多数国家的多数 说人工智能的好处大于缺点,但紧张情绪是 对管理技术的机构的信任度不断提高 仍然不均匀。人工智能专家和公众的看法 技术的轨迹截然不同,差距很大 就业、经济和医疗保健。东南亚 国家始终是最乐观和最 相信自己的政府能够监管人工智能,而北方 美国和欧洲的预期较低,但预期较高 怀疑主义。本章追踪了 30 多个国家的这些模式 国家,借鉴进行的几次大规模调查 皮尤研究中心 Ipsos AI Monitor 2024 至 2026 年间的数据 墨尔本大学/毕马威全球人工智能调查中心, CHIP50 调查、LEAP 调查和埃隆大学人类 能力调查。 2026 年人工智能指数报告 ===== 第361页 ===== 第361章 章节亮点 9.1 全球人工智能情绪 全球对人工智能对就业影响的看法 亮点:全球人工智能在 职场 9.2 美国公众和专家对人工智能的看法 社会影响 亮点:对AI伴侣的看法 9.3 对人工智能信任、透明度、 和监管 全球机构信任 美国对人工智能监管的态度 第362章 第363章 第367章 370 第372章 第378章 380 380 第382章 9 公众意见 | 2026 年人工智能指数报告 内容 ===== 第362页 ===== 第362章 9 公众意见 | 2026 年人工智能指数报告 章节亮点 对人工智能的乐观情绪正在上升,但焦虑也在上升。在全球范围内,表示人工智能产品的受访者比例 和服务利多于弊的比例从 2024 年的 55% 上升到 2025 年的 59%,即使 表示这些产品让他们感到紧张的比例增加到了 52%。 1 东南亚国家仍然是世界上对人工智能最乐观的国家之一。在中国、马来西亚、 泰国、印度尼西亚和新加坡,超过80%的受访者表示人工智能将深刻改变 他们的生活将在未来 3-5 年内发生变化,其中马来西亚自 2024 年以来增幅最大。 2 在所有接受调查的国家中,印度对人工智能的紧张情绪上升得最快。 2024 年至 2025 年间, 印度对人工智能使用的担忧增幅最大(+14 个百分点),仅 兴奋度适度增加(+2)。 3 一些新兴经济体的工作场所人工智能使用率高于许多先进经济体。在 到 2025 年,全球 58% 的员工表示在工作中半定期或定期使用人工智能,但 印度、中国、尼日利亚、阿联酋、沙特阿拉伯的份额超过80%。 4 人工智能专家和美国公众在人工智能未来的几乎所有问题上都存在分歧,除了它 会损害选举和个人关系。仅就就业而言,差距就高达 50 个百分点 (73% 的专家持积极态度,而公众持积极态度的比例为 23%)。经济领域也出现了类似的分歧(69% 与 21%)和医疗保健(84% 对 44%)。 5 近三分之二的美国人 (64%) 预计人工智能将在未来 20 年导致就业岗位减少, 而只有 5% 的人期望更多。专家们并不那么悲观(减少了 39%,增加了 19%),但预测 预计到 2030 年,生成式人工智能将帮助美国 80% 的工作时间 公众估计为10%。 6 人工智能陪伴仍然是小众,但专家认为它可能成为一种常见的日常行为, 预测到 2027 年,10% 的美国成年人将每天使用人工智能伴侣,到 2040 年这一比例将上升至 30%。 公众的预期较低,到 2040 年将下降 20%。 7 美国报告称,对其政府负责任地监管人工智能的信任度最低 在所有接受调查的国家中,这一比例为 31%。全球平均为54%,东南亚国家 领先(新加坡 81%,印度尼西亚 76%)。 8 在美国所有 50 个州,对人工智能监管太少的担忧超过了对人工智能监管太少的担忧 很多。在全国范围内,41% 的受访者表示联邦人工智能监管力度还不够 27% 的人表示这会走得太远,但超过三分之一的人表示不确定。 9 在全球范围内,欧盟比美国或中国更能有效监管人工智能。 在皮尤 2025 年的调查中,在 25 个国家中,中位数为 53% 的人表示信任欧盟,而相比之下, 美国为 37%,中国为 27%。 10 ===== 第363页 ===== 第363章 本节探讨全球对人工智能的观点和看法的差异。自 2022 年以来,益普索 (Ipsos) 开展了 其年度人工智能监测调查旨在追踪全球公众对人工智能的态度和看法。的 参与国家的范围随着时间的推移而发生变化。1 2025 年调查是从去年 3 月开始进行的 调查时间为 21 日至 4 月 4 日,覆盖 30 个国家,样本量为 23,216 名成年人。 尽管受访者自我报告的人工智能素养水平多年来有所变化,但他们的观点略有变化 保持一致(图 9.1.1)。超过一半的受访者表示对什么有很好的了解 人工智能是什么以及使用哪些产品和服务。去年以来,人们的紧张情绪也有所增加, 表示人工智能产品让他们感到紧张的人比例上升了 2 个百分点,达到 52%。在 与此同时,更多受访者表示乐观,认为人工智能的利大于弊 产品和服务,从 2024 年的 55% 增加到 59%。 1 2025 年中国数据由益普索 (Ipsos) 提供,但可能不会出现在其发布的报告中。 9.1 全球人工智能情绪 68% 53% 53% 67% 59% 55% 55% 48% 53% 52% 79% 67% 52% 50% 66% 55% 45% 54% 47% 53% 50% 67% 51% 49% 66% 54% 56% 50% 54% 52% 64% 50% 49% 60% 52% 39% 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 使用人工的产品和服务 智力应该有 披露该用途 使用人工的产品和服务 智力让我紧张 使用人工的产品和服务 智慧让我兴奋 我相信使用的公司 人工智慧将保护 我的个人资料 我相信人工智慧不会 歧视或表现出偏见 任何一群人 我相信人们不会歧视或 对任何群体表现出偏见 使用人工的产品和服务 智力比智力有更多的好处 缺点 使用人工的产品和服务 智力将发生深刻的改变 我未来3-5年的日常生活 使用人工的产品和服务 智力发生了深刻的变化 我过去3-5年的日常生活 我知道哪些类型的产品和 服务使用人工智能 我很清楚什么 人工智能是 2025年 2024年 2023年 2022年 “同意”的受访者百分比 全球对人工智能产品和服务的看法(占总数的百分比),2022-25 资料来源:益普索 (Ipsos),2022–25 |图:2026年AI指数报告 9 公众意见 | 2026 年人工智能指数报告 图9.1.1 ===== 第364页 ===== 第364章 所有接受调查的国家的乐观情绪增长情况并不相同(图 9.1.2)。来自30个国家 益普索 (Ipsos) 的调查显示,许多受访者表示,2022 年至 2025 年期间,同意以下观点的受访者数量有所增加: 人工智能的好处大于缺点。特别是一些欧洲国家的报告显示, 在此期间的乐观情绪包括德国(+12 个百分点)、法国(+10 个百分点)、中国(+9 个百分点)和 英国 (+5),但总体情绪仍低于亚洲和拉丁美洲部分地区。 东南亚国家是对人工智能未来最乐观的国家之一(图9.1.3)。在马来西亚, 泰国、印度尼西亚和新加坡,超过 80% 的受访者预计人工智能将深刻改变他们的生活 未来三到五年。这些国家在人工智能方面的全球乐观程度一直名列前茅 近年来,这种情绪自 2024 年以来一直在小幅上升,其中马来西亚的增幅最大 (+9) (图9.1.4)。这些国家的受访者也表示兴奋程度高于紧张程度 关于人工智能产品和服务。 图9.1.2 9.1 全球对人工智能的看法 | 公众意见| 2026 年人工智能指数报告 ===== 第365页 ===== 365 图9.1.3 图9.1.4 从同比百分比变化来看,全球紧张情绪有所增加 (+3), 与 2024 年相比,兴奋度下降 (-1)。印度对人工智能使用的担忧增幅最大 (+14),兴奋度略有增加 (+2)。 9.1 全球对人工智能的看法 | 公众意见| 2026 年人工智能指数报告 ===== 第366页 ===== 第366章 在各个国家,对人工智能的兴奋和紧张并不一致(图 9.1.5)。 2025年 分布反映了前几年的模式,北美和欧洲国家普遍 集中在较低水平的兴奋和较高水平的紧张。中国和印度尼西亚展示 兴奋程度最高,紧张程度低于 50%。 尽管紧张情绪加剧,但许多受访者 继续将人工智能与实际联系起来 个人利益,特别是节省时间和 娱乐(图9.1.6)。全球范围内,56% 受访者认为人工智能会减少用量 他们完成工作所需的时间;这个数字 中国(78%)和东南部地区的比例更高 亚洲国家(>60%)。然而,受访者 对人工智能积极发挥作用的潜力不太确定 影响他们国家的经济或就业市场。 北美和欧洲受访者 更怀疑人工智能能否取代他们的工作 更好。在美国,33% 的受访者 说人工智能会让他们的工作变得更好,而不是 使情况变得更糟或没有影响, 与 40% 的全球平均水平相比。积极 对人工智能个人利益的看法似乎并存 担心其对劳动力市场的影响。 全球 阿根廷 澳大利亚 比利时 巴西 加拿大 智利 中国 法国 德国 匈牙利 印度 印度尼西亚 爱尔兰 意大利 日本 马来西亚墨西哥荷兰秘鲁 波兰 韩国 西班牙 瑞典 泰国 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 同意对人工智能感到兴奋的受访者百分比 同意对人工智能感到紧张的受访者百分比 英国 美国 新加坡 土耳其 哥伦比亚 南非 瑞士 2025 年全球对使用人工智能的产品和服务的看法(按国家/地区划分) 来源:益普索,2025 |图:2026年AI指数报告 图9.1.5 9.1 全球对人工智能的看法 | 公众意见| 2026 年人工智能指数报告 ===== 第367页 ===== 第367章 图9.1.6 在 2024 年和 2025 年,益普索 (Ipsos) 询问受访者他们认为人工智能改变他们工作的可能性有多大 或者在未来五年内完全取代它。 2025 年的结果显示,看法保持稳定 同比(图 9.1.7)。 22% 的受访者表示,到 2025 年,人工智能“很可能”会改变他们的生活方式 从事目前的工作,而 2024 年这一比例为 21%。在这两年中,表示“不太可能”的比例仍然存在 维持在32%不变。对工作替代的期望也表现出同样的一致性。 2024年和2025年, 11% 的受访者表示,人工智能“很可能”在未来五年内取代他们的工作,并且 56% 的人表示这“不太可能”。 当被问及人工智能通常更有可能创造新的就业机会还是消除现有的就业机会时,2025 年的观点 进行划分(图9.1.8)。国家层面的预期遵循与早期情绪趋势类似的模式。 尼日利亚、日本、墨西哥、阿联酋、韩国和印度都希望人工智能能够创造更多就业机会 比它消除的比例高出60%。美国和加拿大则处于相反的一端,其中 67% 68% 的受访者预计人工智能会消除就业机会并颠覆行业。 全球对人工智能的看法 对就业的影响 9.1 全球对人工智能的看法 | 公众意见| 2026 年人工智能指数报告 ===== 第368页 ===== 第368章 9.1 全球对人工智能的看法 | 公众意见| 2026 年人工智能指数报告 22% 39% 32% 7% 21% 39% 32% 8% 0% 20% 40% 60% 80% 100% 不知道 不太可能 有点可能 很有可能 11% 26% 56% 7% 11% 25% 56% 8% 0% 20% 40% 60% 80% 100% 不知道 不太可能 有点可能 很有可能 2025年 2024年 受访者百分比 受访者百分比 人工智能将在未来 5 年内改变你目前的工作方式 未来5年人工智能将取代你现在的工作 2024 年与 2025 年人工智能对当前工作影响的全球观点 来源:益普索,2025 |图:2026年AI指数报告 图9.1.7 58% 71% 70% 67% 67% 66% 65% 63% 62% 62% 54% 54% 53% 53% 53% 52% 52% 52% 47% 46% 41% 29% 30% 33% 33% 34% 35% 37% 38% 38% 46% 46% 44% 47% 47% 48% 48% 48% 53% 54% 0% 20% 40% 60% 80% 100% 印度 南非 澳大利亚 意大利 加拿大 新加坡 阿拉伯联合酋长国 美国 英国 西班牙 巴西 比利时 德国 法国 墨西哥 日本 波兰 韩国 尼日利亚 全球 推动科学、医学和其他领域发展 通过监管保护产业 受访者百分比 全球优先事项:2025 年人工智能创新与人工智能监管 资料来源:益普索、谷歌 2026 |图:2026年AI指数报告 图9.1.82 2 在益普索 (Ipsos) 的调查结果报告中,百分比四舍五入到最接近的整数。因此,数字加起来可能不完全是 100%。 ===== 第369页 ===== 第369章 9.1 全球对人工智能的看法 | 公众意见| 2026 年人工智能指数报告 受访者还被问及 人工智能是否能胜任这份工作 市场和自己的工作更好, 更糟,或者一直保持不变 未来五年。对双方都持乐观态度 措施较低、低于或接近 在大多数接受调查的国家中,这一比例为 50% (图9.1.9)。中国、印度尼西亚、 泰国和新加坡报告更多 对人工智能的积极期望 对个人和就业的影响 整个经济范围。北美和 欧洲的预期较低, 尽管受访者有更多 对人工智能如何改进持积极态度 他们的个人工作相比 整体就业市场。第4章 AI 指数进一步探讨了 技术对全球的影响 经济和劳动力市场。 全球 阿根廷 澳大利亚 比利时 巴西 加拿大 智利 中国 哥伦比亚 法国 匈牙利 印度 印度尼西亚 意大利 日本 马来西亚 墨西哥 荷兰 秘鲁 波兰 新加坡 韩国 泰国 土耳其 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 就业市场(占受访者的百分比) 个人工作(占受访者的百分比) 南非 美国 德国 瑞士 西班牙 英国 爱尔兰 瑞典 2025 年人工智能改善就业市场与个人工作潜力的全球观点 来源:益普索,2025 |图:2026年AI指数报告 图9.1.9 ===== 第370页 ===== 370 全球人工智能在工作场所的应用 全球 印度 中国 尼日利亚阿拉伯联合酋长国沙特阿拉伯 哥斯达黎加 巴西 南非 土耳其 挪威 瑞士 哥伦比亚 墨西哥 阿根廷智利 波兰 立陶宛 拉脱维亚 西班牙斯洛文尼亚葡萄牙 意大利 爱尔兰以色列瑞典日本法国比利时 荷兰新西兰匈牙利 斯洛伐克共和国捷克共和国 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 人工智能信任(受访者百分比) 人工智能的使用(占受访者的百分比) 埃及 新加坡 希腊 英国 德国 澳大利亚 罗马尼亚 丹麦爱沙尼亚 加拿大 韩国 奥地利 美国 芬兰 信任人工智能并在工作中有意使用,2025 年 资料来源:墨尔本大学和毕马威国际,2025 |图:2026年AI指数报告 自 2022 年以来,人工智能技术在组织内的使用变得更加普遍。为了捕捉到这一点 墨尔本大学对 48,340 人进行了一项全球调查3 遍布 47 个国家。受访者被问到他们是否依赖人工智能输出来做出决定,以及他们是否 轻松共享人工智能工具执行任务所需的信息。值得注意的是,这些结果 来自在线调查并存在抽样限制,特别是在一些新兴经济体。在 例如,尼日利亚的受访者中城市人口比例过高,而且受教育程度高于一般人口 人口,这可能夸大了报告的人工智能相对于更广泛的劳动力的暴露程度。 在全球范围内,有意在工作中使用人工智能的员工比例持续增长。 2025 年,58% 员工报告半定期或定期使用人工智能,略多于一半 (53%) 表示他们信任人工智能 工作目的(图9.1.10)。从区域角度来看,结果显示出显着差异。员工 新兴经济体仍然是工作场所人工智能最活跃的用户:在印度、中国、尼日利亚、 阿拉伯联合酋长国和沙特阿拉伯,超过 80% 的受访者表示他们经常在工作中使用人工智能,并且 这些国家的信任度同样很高。相比之下,在大多数北美和欧洲国家, 大约一半的员工表示定期使用人工智能工具,而信任度往往会下降几个百分点 40%和48%。工作场所采用的区域模式与人口层面的扩散数据形成对比 第 4 章中讨论了人工智能的采用,显示出与 人均国内生产总值。 3 这些结果来自一项在线调查,该调查可能过多地代表了新兴经济体中更年轻、更城市化和受教育程度更高的受访者。 研究作者指出,在控制年龄和教育程度后,国家层面的差异仍然存在。 图9.1.10 9.1 全球对人工智能的看法 | 9 公众意见 | 2026 年人工智能指数报告 亮点: ===== 第371页 ===== 第371章 图9.1.11 该调查还询问了员工他们的组织对人工智能战略、人工智能素养和人工智能的支持程度。 治理(图9.1.11)。受访者反思他们的组织是否拥有一致的人工智能战略 并支持采用、人工智能素养和负责任的使用,包括培训和治理实践 例如明确的政策、监控、问责以及数据隐私和安全措施。 与使用情况和信任水平一致,新兴经济体的组织支持最高。 在印度,大约 85%–90% 的受访者表示,他们的组织支持人工智能战略、素养和 治理。尼日利亚、埃及、中国和阿联酋也跻身组织性排名前列的国家之列。 支持。另一方面,日本、韩国和葡萄牙的受访者表示支持率最低。 人工智能素养,以及对负责任的人工智能治理的信心不足。 总体而言,与其他国家相比,大多数国家对负责任的人工智能治理的组织支持较少 识字和策略。第 3 章进一步探讨了这种治理差距以及负责任人工智能的主要障碍 实施。 9.1 全球对人工智能的看法 | 公众意见| 2026 年人工智能指数报告 亮点: ===== 第372页 ===== 第372章 本节借鉴多项以美国为中心的调查来比较公众和人工智能专家如何看待人工智能 社会影响。主要来源4是皮尤研究中心2024年对美国成年人和人工智能专家的调查, 埃隆大学想象数字未来中心 2025 年对人类预期影响的调查 到 2035 年的能力,以及由预测研究组织开展的纵向专家人工智能小组 (LEAP) 研究所。在皮尤研究中心的调查中,人工智能专家是美国的作者或人工智能相关会议的演讲者。 2023 年或 2024 年报告其工作或研究与人工智能相关的人。 在几乎所有调查主题中,专家都比美国公众更加乐观(图 9.2.1)。的 最大的差距出现在未来的工作方面:73% 的人工智能专家表示,人工智能将对如何工作产生积极影响 人们做自己的工作,而美国成年人的这一比例为 23%。经济领域也出现了类似的差距(69% vs. 21%), K-12 教育(61% vs. 24%)和医疗保健(84% vs. 44%)。然而,对于这两个群体来说,乐观情绪都很低 与信任和社会联系相关的领域,包括选举、新闻和个人关系。 4 资料来源:McClain, C. 等人。 (2025)。美国公众和人工智能专家如何看待人工智能。皮尤研究中心。本报告涵盖多个 2024 年进行的研究组成部分,包括 2024 年 8 月 12 日至 18 日对美国 5,410 名成年人进行的一项调查,对居住在美国的 1,013 名人工智能专家进行的调查 美国于2024年8月14日至10月31日进行了深度访谈,并于10月18日至11月对30位人工智能专家进行了深度访谈 2024 年 2 月 26 日。Rainie, L. 和 Anderson, J. (2025)。许多美国人预计人工智能会对人类的能力和行为产生重大负面影响,例如 到 2035 年,社会智力和情商、分析思维和能动性将得到提高。伊隆大学想象数字未来中心。本次全国调查 2025 年 7 月 17 日至 20 日对 1,005 名美国成年人进行了研究。Kennedy, B. 等人。 (2025)。美国人如何看待人工智能及其对人类和社会的影响。皮尤重新 搜索中心。这项调查于 2025 年 6 月 9 日至 15 日进行,样本包括 5,023 名美国成年人。 44% 24% 23% 21% 20% 20% 19% 10% 9% 7% 84% 61% 73% 69% 48% 36% 32% 18% 11% 22% 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 人际关系 选举 人们得到的消息 刑事司法系统 环境 艺术和娱乐 经济 人们如何做他们的工作 K-12教育 医疗保健 美国成年人 人工智能专家 % 表示人工智能将在未来 20 年产生积极影响 美国对人工智能社会影响的看法:公众与专家 资料来源:皮尤研究中心,2025 |图:2026年AI指数报告 图9.2.1 9 公众意见 | 2026 年人工智能指数报告 9.2 美国公众和专家的观点 论人工智能的社会影响 ===== 第373页 ===== 第373章 当被问及展望 2035 年时,美国公众再次比人工智能专家更悲观 该技术可能对思维、学习和创造力等关键人类特征产生影响(图 9.2.2)。美国成年人比人工智能专家更有可能预测元认知的负面影响(53% vs. 36%),定义为分析思考自己的思维过程和决策的能力 (48% vs. 30%),指的是解决问题的能力。对于社交和情商,定义为 51% 的美国成年人和 34% 的专家认为人工智能具有理解和管理社交互动的能力 产生负面影响。两组人群对心理健康的担忧程度都很高,其中 55% 的成年人和 53% 的成年人 专家表示人工智能会产生负面影响。 除了普遍情绪之外,最近的预测数据显示预期时间表和规模之间的差距更大。 由预测研究所领导的人工智能纵向专家小组(LEAP)对人工智能进行了调查 专家和公众了解特定的人工智能里程碑和采用率。专家通过 68 项预测 一致预测人工智能的进步比公众快得多。 在以能力为中心的预测中,只有 9% 的情况下公众的观点与专家一致。当他们分歧时, 71% 的情况下,公众预计进展会较慢。直接比较,专家的可能性比专家高 16% 公众预测更快的进展。从具体指标来看,差距更加显着。到 2030 年, 人工智能专家期望复杂数学问题的准确性更高(+25分),更多人工智能辅助工作(+8.2), 以及更多地采用自动驾驶网约车 (+8)(图 9.2.3)。公众预计电力将增加 人工智能的消耗以及人工智能解决重大数学问题的可能性更高。放眼更远 专家预测,到 2040 年,发生变革性技术事件的可能性很高 (+30),而且 每日 AI 伴侣使用率 (+10) 和 AI 发现药物 (+10) 的比例更高。能力预测的差距 随着模型性能在一系列领域持续加速,公众和专家之间的关系值得注意 技术基准。第二章回顾了过去一年中的几项重大突破。 55% 53% 53% 49% 49% 48% 45% 43% 42% 42% 41% 38% 50% 36% 50% 45% 44% 30% 30% 48% 45% 39% 48% 29% 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 好奇心和学习能力 信任广泛共享的价值观和文化规范 自我认同、人生意义和目的 心理健康 对自己的天赋能力充满信心 创新思维和创造力 决策和解决问题的能力 个人代理、行动能力 独立于世界 同理心和道德判断的应用 深入思考的能力和意愿 复杂的概念 元认知,分析思考的能力 关于思考 社交和情商,能力 理解和管理社交互动 美国成年人 人工智能专家 预计到 2035 年人工智能负面影响将大于正面影响的受访者百分比 人工智能对人类关键能力和特征的影响:公众与专家 资料来源:埃隆大学,2025 |图:2026年AI指数报告 图9.2.2 9.2 美国公众和专家对人工智能社会影响的看法 | 公众意见| 2026 年人工智能指数报告 ===== 第374页 ===== 第374章 图9.2.35 5 LEAP 调查中并非所有问题都针对 2030 年和 2040 年提出。预测范围因主题而异,并根据实际情况设定。 对于每个问题来说最有意义或最可衡量。因此,某些项目缺少 2040 年值反映了调查设计而不是缺失 回应。 对长期就业的看法也显示出类似的模式(图 9.2.4)。近三分之二或 64% 美国成年人表示,人工智能将在未来 20 年导致就业机会减少,而 5% 的人表示,就业机会会增加。专家中,39% 19% 的人预计就业机会会减少,而 19% 的人预计就业机会会增加。 0% 20% 40% 60% 80% 技术里氏震级(8级以上) 人工智能发现的药品销售份额 人工智能在美国电力中的份额 每天使用人工智能伴侣的成年人 AI辅助工作时间 一般AI进展场景(快速) 美国自动驾驶汽车网约车出行 概率人工智能解决了千年奖问题 人工智能相关科学出版物的份额(所有领域) 前沿数学准确性 0% 20% 40% 60% 80% 公共专家 预测 (%) 预测 (%) 2030 2040 公众与专家人工智能进展预测:2030 年和 2040 年预测中值 资料来源:预测研究所,2026 |图:2026年AI指数报告 图9.2.4 64% 39% 14% 33% 5% 19% 16% 10% 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 人工智能专家 美国成年人 工作岗位较少 差别不大 工作岗位较多 不确定 受访者百分比 关于人工智能会创造还是消除就业机会的观点:公众与专家 资料来源:皮尤研究中心,2025 |图:2026年AI指数报告 9.2 美国公众和专家对人工智能社会影响的看法 | 公众意见| 2026 年人工智能指数报告 专家预测,工作场所的采用速度比公众要快得多。专家预测中位数 到 2027 年,生成式人工智能将帮助美国 18% 的工作时间,到 2030 年将上升到 18%。 前 25%(第 75 位) 专家预测,到 2030 年,人工智能辅助工作时间将超过 30%,而前 10% (第 90 个百分位数)的预测,超过 40%。相比之下,公众预计采用速度会较慢,到 10% 2030 年(图 9.2.5)。 ===== 第375页 ===== 第375章 当被问及具体职业时,美国公众和人工智能专家认为某些工作的薪资更高 自动化的风险高于其他风险(图 9.2.6)。公众与专家达成强烈共识 关于收银员、记者和软件工程师等工作的自动化风险。人工智能专家看到 卡车司机和律师面临更大的风险,而美国公众认为人工智能将导致教师工作岗位减少 和医生。大多数情况下,两个群体都识别出相同的脆弱领域,但公众普遍认为 更有可能预测跨类别的失业。 2025 2027 2030 0% 5% 10% 15% 20% 25% 30% 35% 2025 2027 2030 0% 5% 10% 15% 20% 25% 30% 35% 百分位数 75 位 50 位 25 位 决议日期 决议日期 生成式人工智能使用强度 生成式人工智能使用强度 公共专家 生成式人工智能使用强度 资料来源:预测研究所,2026 |图:2026年AI指数报告 图9.2.5 9.2 美国公众和专家对人工智能社会影响的看法 | 公众意见| 2026 年人工智能指数报告 73% 60% 59% 48% 35% 33% 31% 27% 23% 18% 73% 67% 60% 50% 45% 62% 43% 29% 38% 28% 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 医生 律师 心理健康治疗师 教师队伍 卡车司机 音乐家 软件工程师 记者 工厂工人 收银员 美国成年人 人工智能专家 受访者百分比 对人工智能驱动的职业失业的看法:公众与专家 资料来源:皮尤研究中心,2025 |图:2026年AI指数报告 图9.2.6 ===== 第376页 ===== 第376章 专家与公众的差距 情绪一致 提高认识和采用 美国的人工智能。 2025年, 47% 的美国成年人表示他们曾经 “很多”听说过人工智能,高于 26% 到 2022 年。意识的提高 在年轻人中最为陡峭, 18-29 岁,(+29 个百分点 自 2022 年以来),尽管它也在上升 在 65 岁及以上的人群中 (+13pp)(图 9.2.7)。 2022 2023 2024 2025 0% 10% 20% 30% 40% 50% 60% 受访者百分比 32%,65 岁以上 42%,年龄 50–64 岁 51%,年龄 30–49 岁 62%,18-29 岁 2022-25 年经常听说人工智能的美国人(按年龄段) 资料来源:皮尤研究中心,2025 |图:2026年AI指数报告 图9.2.7 9.2 美国公众和专家对人工智能社会影响的看法 | 公众意见| 2026 年人工智能指数报告 ===== 第377页 ===== 第377章 31% 33% 28% 31% 27% 29% 39% 33% 37% 30% 19% 46% 39% 30% 20% 28% 33% 15% 16% 14% 15% 18% 13% 19% 20% 16% 13% 11% 16% 17% 15% 14% 15% 15% 17% 17% 16% 17% 13% 16% 18% 21% 14% 18% 16% 17% 19% 17% 14% 18% 16% 38% 33% 42% 37% 41% 42% 24% 26% 33% 39% 54% 21% 25% 37% 51% 40% 35% 0% 20% 40% 60% 80% 民主党/精益民主党 代表/精益代表 HS 或以下 一些大学 大学毕业生 研究生 65+ 50–64 30–49 18-29岁 亚洲人* 西班牙裔 黑色 白色 女性 男士 美国成年人 几乎经常/每天几次 大约每天一次 每周几次 频率较低 受访者百分比 2025 年美国成年人(按人口群体)人工智能互动的频率 资料来源:皮尤研究中心,2025 |图:2026年AI指数报告 采用率和使用频率也在增加。超过 60% 的美国成年人表示曾与 人工智能每周至少几次,31% 的人表示他们几乎不断地或每天与人工智能互动几次, 尽管频率因年龄、种族和民族而异(图 9.2.8)。日常AI互动度更高 在年轻人、受过大学教育的群体、亚裔美国人和男性中。政治派别差异 民主党人比共和党人更有可能每天与人工智能互动。作为注释, 结果基于受访者认为他们正在与人工智能互动的时间,因此可能会低估 通过其他嵌入式系统(如导航、推荐或排名)进行曝光。 9.2 美国公众和专家对人工智能社会影响的看法 | 公众意见| 2026 年人工智能指数报告 图9.2.86 6 “亚洲人”仅包括英语受访者。未提供答案的受访者不会显示。 “白人”、“黑人”和“亚洲人” 成年人为非西班牙裔且仅报告一种种族; “西班牙裔”成年人可以属于任何种族。 ===== 第378页 ===== 第378章 AI 陪伴,定义为与专为持续情感和社交而设计的 AI 系统的关系 支持,代表了人工智能技术更具争议性的新兴用途之一(Chou 等人,2024;Pan 等人) 等,2025)。专家预测,到 2027 年,10% 的美国成年人将每天至少使用一次人工智能进行陪伴, 到 2030 年,这一数字将增至 15%,到 2040 年将增至 30%(图 9.2.9)。专家中排名前四分之一的 据预测,超过 40% 的公众将参与日常 AI 陪伴,而顶级人群 10%的人预测超过60%。公众的期望显着降低,到 2040 年将下降 20%。 专家和公众发现心理健康治疗师被人工智能取代的可能性较小,这表明 人们对人工智能伴侣的局限性有一定的了解。它们无法完全取代人类的专业知识 复杂或治疗环境。 2026 年 Ipsos-Google 调查发现,全球 52% 的受访者表示感到某种程度的兴奋 关于利用人工智能进行陪伴(图9.2.10)。在尼日利亚、印度和阿拉伯联合酋长国等国家 阿联酋航空,超过 20% 的受访者表示“非常兴奋”。美国和加拿大曾 完全不兴奋的受访者比例最高,分别为 36% 和 34%。日本记录很少 “非常兴奋”的受访者,其中“不知道”的比例最高,为 18%,几乎是两倍 全球平均水平。 亮点: 对AI伴侣的看法 2027 2030 2040 0% 10% 20% 30% 40% 50% 2027 2030 2040 0% 10% 20% 30% 40% 50% 百分位数 25 位 50 位 75 位 决议日期 决议日期 AI 陪伴采用 AI 陪伴采用 公共专家 预计美国成年人每天都会采用人工智能陪伴 资料来源:预测研究所,2026 |图:2026年AI指数报告 图9.2.9 9.2 美国公众和专家对人工智能社会影响的看法 | 公众意见| 2026 年人工智能指数报告 ===== 第379页 ===== 第379章 亮点: 10% 29% 27% 22% 20% 14% 13% 9% 8% 7% 7% 7% 7% 7% 7% 7% 7% 5% 5% 4% 4% 16% 36% 32% 24% 21% 21% 25% 17% 16% 13% 19% 15% 12% 12% 14% 16% 10% 9% 9% 9% 5% 9% 26% 17% 24% 32% 29% 20% 27% 39% 25% 22% 41% 25% 28% 21% 26% 26% 23% 19% 24% 29% 16% 31% 19% 10% 10% 10% 15% 15% 17% 18% 17% 22% 19% 26% 21% 22% 23% 19% 25% 22% 19% 30% 22% 26% 18% 5% 4% 8% 11% 22% 10% 10% 19% 27% 7% 14% 23% 27% 18% 17% 23% 34% 30% 18% 36% 14% 10% 3% 3% 4% 4% 7% 8% 8% 15% 8% 7% 13% 9% 10% 13% 15% 12% 12% 14% 11% 15% 18% 0% 20% 40% 60% 80% 100% 日本 美国 意大利 法国 加拿大 比利时 波兰 西班牙 英国 爱尔兰 阿根廷 韩国 澳大利亚 德国 新加坡 墨西哥 巴西 南非 阿拉伯联合酋长国 印度 尼日利亚 全球 非常兴奋 非常兴奋 有点兴奋 不太兴奋 一点也不兴奋 不知道 受访者百分比 使用人工智能进行陪伴的兴奋 资料来源:益普索、谷歌 2026 |图:2026年AI指数报告 9.2 美国公众和专家对人工智能社会影响的看法 | 公众意见| 2026 年人工智能指数报告 图9.2.107 7 由于各个值的四舍五入,总计可能不等于 100%。 人工智能伴侣与传统的面向任务的人工智能不同,它优先考虑建立关系而不是功能 (Zhang 和 Lu,2023;Zhang 等人,2025)。现代系统结合了过去交互的记忆,可以 识别情绪,并根据个人用户的需求调整他们的反应(Yang et al., 2025)。平台如 Replika、Character.ai 和XiaoICE 吸引了数百万用户群。不少用户反映 与人工智能同伴形成情感依恋,将他们视为朋友、导师或浪漫的人 合作伙伴(Zhang 等人,2024;Kouros 等人,2024)。 该技术既有好处也有风险。研究表明人工智能伴侣可以减少孤独感 与与另一个人互动的程度相似(Freitas 等人,2024),用户引用了始终可用的信息 支持(11.9%)和安全的情感表达空间(9.9%)是主要优势。心理健康 6.2% 的用户报告了改进,一些人认为他们的人工智能伴侣为他们提供了帮助 度过危机(Pataranutaporn 等,2025)。 然而,令人担忧的模式已经出现。用户经常将聊天机器人视为有需求的实体, 鉴于情感依赖和心理之间已建立的相关性,这提出了一个问题 遇险(Bengio 等,2025)。关键问题仍然是这些关系是否能减少孤独感 可持续地或破坏现有关系并增加社会孤立(Quinn 等人,2024)。 ===== 第380页 ===== 380 随着人工智能越来越融入日常生活,围绕信任、透明度和监管的机制也随之变化。 变得更加明显。在 Ipsos 的 2025 年人工智能监测调查中,79% 的受访者表示使用人工智能的公司应该 被要求披露该用途(图 9.1.1)。接受调查的所有 30 个国家都认同这一观点, 尽管对机构的总体信任度较低。超过一半(即 54%)的受访者表示,他们信任自己的 政府负责任地监管人工智能(图9.3.1)。美国对此的信任度最低 测量(31%)。与前面提到的更高水平的乐观和兴奋同时,东南部 亚洲国家对其政府的信任度最高,其中包括新加坡(81%)、 印度尼西亚(76%)、马来西亚(73%)和泰国(70%)。 9.3 对人工智能信任的看法 透明度和监管 全球机构信任 9 公众意见 | 2026 年人工智能指数报告 31% 32% 33% 39% 40% 42% 46% 46% 46% 48% 48% 48% 49% 49% 49% 50% 54% 55% 55% 55% 61% 61% 61% 65% 66% 67% 67% 70% 73% 76% 81% 0% 10% 20% 30% 40% 50% 60% 70% 80% 90% 100% 美国 日本 匈牙利 英国 加拿大 法国 瑞典 澳大利亚 韩国 巴西 荷兰 土耳其 比利时 德国 爱尔兰 意大利 全球 南非 西班牙 瑞士 秘鲁 波兰 阿根廷 印度 哥伦比亚 墨西哥 智利 泰国 马来西亚 印度尼西亚 新加坡 受访者百分比 各国对人工智能政府监管的信任度(占总数的百分比),2025 年 来源:益普索,2025 |图:2026年AI指数报告 图9.3.1 ===== 第381页 ===== 第381章 皮尤研究中心的另一项全球调查提出了一个相关问题,以比较受访者对不同政府的信任程度。 遍布全球的机构。皮尤 2025 年春季全球态度调查发现,受访者倾向于信任 他们自己的国家最能有效监管人工智能,但对外部政府的信任度参差不齐。跨越25 在接受调查的国家中,中位数为 53% 的人表示他们相信欧盟能够有效监管人工智能,而欧洲的这一比例为 37% 美国为 27%,中国为 27%(图 9.3.2)。对中国政府的信任持续获得好评 各国的评分最低,而对欧盟的信任度则取决于受访者是否居住在欧盟境内 或欧盟之外(图 9.3.2)。 然而,即使在欧盟内部,信任水平也不一致。德国和荷兰的受访者 是最信任欧盟有效监管人工智能能力的国家之一,而希腊和意大利则是最受信任的国家之一 最不信任的人之一。在美国,信任(44%)和不信任的观点各占一半 (47%) 认为政府有效监管人工智能的能力,43% 表示他们相信欧盟在人工智能监管方面的能力。 这些信任动态正在随着第 8 章概述的不断扩大的立法环境而发生变化,因为 采用国家人工智能战略的国家数量持续增加。 益普索/谷歌的另一项调查显示,公共优先事项方面存在相关分歧。全球 58% 受访者表示,通过以下方式促进科学、医学和其他领域的进步更为重要 人工智能创新,相比之下,41%的人优先考虑通过以下方式保护可能受人工智能影响的行业 调节(图 9.3.3)。调查中的大多数国家都倾向于创新,尽管南非、印度、 爱尔兰是少数几个受访者更有可能优先考虑监管的国家之一。跨越这些 不同的措施,公众对人工智能治理的看法在信任、优先事项和监管方面显得参差不齐。 期望。 9.3 对人工智能信任、透明度和监管的看法 | 公众意见| 2026 年人工智能指数报告 图9.3.2 ===== 第382页 ===== 第382章 图9.3.38 8 在益普索 (Ipsos) 的调查结果报告中,百分点四舍五入到最接近的整数。因此,数字加起来可能不完全是 100%。 58% 71% 70% 68% 67% 67% 66% 65% 63% 62% 62% 54% 54% 53% 53% 53% 52% 52% 52% 48% 47% 46% 41% 29% 30% 32% 33% 33% 34% 35% 37% 38% 38% 46% 46% 47% 44% 47% 48% 48% 48% 52% 53% 54% 0% 20% 40% 60% 80% 印度 南非 爱尔兰 澳大利亚 意大利 加拿大 新加坡 美国 阿拉伯联合酋长国 英国 西班牙 巴西 比利时 德国 法国 墨西哥 日本 波兰 阿根廷 韩国 尼日利亚 全球 推动科学、医学和其他领域发展 通过监管保护产业 受访者百分比 全球优先事项:2025 年人工智能创新与人工智能监管 资料来源:益普索、谷歌 2026 |图:2026年AI指数报告 在美国,人们对 人工智能监管的差异很大 地理。到 2025 年,公民健康和 机构项目进行了一项调查 50 个州,并询问受访者是否 联邦对人工智能的监管太过分了 不够远,或“不确定”(图 9.3.4 和 9.3.5)。每个州都关心 监管太少 担心监管过多(41% vs. 27%),但不确定性程度为 相当大,超过三分之一 受访者选择“不确定”。 纽约州和田纳西州报道称 监管的最高关注度 会走得太远(31%),而密苏里州和 华盛顿所占比例最高的是 表示政府不会走得太远 美国的态度 人工智能监管 AL AK 氮杂环己烷 碳酸钙 CT 德 FL 遗传算法 嗨 伊伊尼亚 KS KY 洛杉矶 我 医学博士 硕士 明尼苏达州 多发性硬化症 莫 MT 东北 内华达州 NH 新泽西州 纳米 纽约 数控 ND 羟基 好的 或PA RI SC 标清 总氮 TX UT 室速 VA 西澳 西弗吉尼亚州 威斯康辛 怀伊 来源:CHIP50,2025 |图:2026年AI指数报告 0-4 5-9 10-14日 15-19日 20-24日 25+ 不适用 2025 年美国各州人工智能监管不足与过多的净担忧 图9.3.4 9.3 对人工智能信任、透明度和监管的看法 | 公众意见| 2026 年人工智能指数报告 ===== 第383页 ===== 第383章 28% 25% 28% 28% 29% 25% 28% 29% 25% 26% 22% 25% 24% 26% 28% 24% 29% 25% 28% 20% 25% 27% 24% 27% 24% 31% 28% 25% 23% 21% 27% 25% 31% 29% 25% 26% 24% 26% 25% 36% 41% 39% 39% 43% 42% 40% 35% 41% 41% 43% 40% 41% 38% 41% 44% 43% 47% 34% 48% 37% 36% 42% 42% 46% 36% 41% 41% 40% 45% 45% 40% 37% 37% 44% 42% 48% 40% 45% 35% 33% 33% 33% 29% 33% 33% 35% 34% 34% 35% 35% 35% 36% 31% 32% 28% 28% 38% 32% 38% 37% 34% 30% 29% 33% 31% 35% 37% 34% 27% 35% 32% 34% 31% 32% 28% 34% 30% 0% 20% 40% 60% 80% 威斯康星州 西弗吉尼亚州 华盛顿 弗吉尼亚州 犹他州 德克萨斯州 田纳西州 南卡罗来纳州 宾夕法尼亚州 俄勒冈州 俄克拉荷马州 俄亥俄州 北卡罗来纳州 纽约 新墨西哥州 新泽西州 新罕布什尔州 内华达州 内布拉斯加州 密苏里州 密西西比州 明尼苏达州 密歇根州 马萨诸塞州 马里兰州 路易斯安那州 肯塔基州 堪萨斯州 爱荷华州 印第安纳州 伊利诺伊州 格鲁吉亚 佛罗里达州 康涅狄格州 科罗拉多州 加利福尼亚州 阿肯色州 亚利桑那州 阿拉巴马州 对其使用的监管太过分 对其使用的监管不够 不确定 受访者百分比 美国各州对人工智能联邦监管的支持,2025 年 来源:CHIP50,2025 |图:2026年AI指数报告 图9.3.5 9.3 对人工智能信任、透明度和监管的看法 | 公众意见| 2026 年人工智能指数报告 足够了(48%)。在几乎每个州,更多受访者表示监管力度还不够 太过分了。大多数州大约三分之一的受访者表示他们不确定,从而产生了不确定性 第二大类。 ===== 第384页 ===== 第384章 27% 28% 25% 25% 34% 32% 24% 35% 31% 22% 16% 29% 25% 24% 29% 27% 27% 26% 29% 25% 25% 28% 25% 27% 41% 41% 40% 44% 32% 36% 37% 38% 36% 42% 51% 35% 43% 44% 44% 34% 42% 46% 38% 42% 39% 40% 37% 45% 33% 31% 35% 32% 34% 32% 39% 27% 33% 36% 33% 37% 32% 32% 26% 38% 31% 28% 33% 32% 36% 33% 37% 28% 0% 20% 40% 60% 80% 100% 民主党 独立/其他 共和党 农村 郊区 城市 学院+ 一些大学 HS 或以下 10 万美元以上 70,000 美元–99,999 美元 30,000 美元–69,999 美元 <3万美元 65+ 50–64 30–49 18-29日 亚洲人 西班牙裔 黑色 白色 女 男 总计 对其使用的监管太过分 对其使用的监管不够 不确定 受访者百分比 2025 年美国不同人口群体对人工智能联邦监管的态度 来源:CHIP50,2025 |图:2026年AI指数报告 图9.3.6 9.3 对人工智能信任、透明度和监管的看法 | 公众意见| 2026 年人工智能指数报告 在美国人口群体中,对人工智能监管不足的最强烈担忧是 老年人,尤其是 65 岁及以上的老年人(51%)(图 9.3.6)。教育与更强的能力相关 支持加强监管,46% 的大学毕业生表示政府做得还不够, 相比之下,高中及以下学历的受访者中这一比例为 34%。政治立场不是一个 显着的区别,尽管民主党比共和党更有可能表示监管不会实施 足够远了(45% vs. 40%),而各方对走得太远的担忧相似(>25%)。 ===== 第385页 ===== 第385章 附录 2026 年人工智能指数报告 第一章:研究与开发 环境影响分析 AI指数使用Lacoste等人提出的计算器估算了训练语言和视觉模型的碳排放量。 (2019)。该分析重点关注训练阶段的排放——不包括具体的硬件生产、闲置基础设施和 部署排放。该研究检查了四个模型类别:行业语言模型、学术语言模型、行业语言模型 视觉模型和学术视觉模型。 计算器的准确性已根据公布的排放值进行了验证。计算器输入包括硬件类型、GPU 小时数、 提供者和计算区域。对于 H100 GPU(2022 年发布)等较新的硬件,A100 SXM4 80GB 被用作 代入计算中。 GPU 时间通过硬件数量乘以训练持续时间来计算;这些值是 取自 Epoch AI 的人工智能模型数据或模型的技术论文。提供商选择基于已知的 合作伙伴关系(例如,使用 GCP 的 Google 模型、使用 Azure 的 OpenAI),而计算区域则由团队位置确定。 特别考虑了在定制硬件上训练的模型,例如 BLOOM 在 法国。在这些情况下,私人基础设施计算纳入了碳效率(千克/千瓦时)和抵消百分比。 该研究总共评估了 52 个模型:36 个行业语言模型 (2018-25)、8 个行业愿景模型 (2019-23)、4 个学术模型 语言模型(2020-23)和四个学术愿景模型(2011-22),选择各自领域特别有影响力的模型 域。 GitHub 识别人工智能项目 GitHub 与哈佛商学院、微软研究院和微软 AI for Good 实验室的研究人员合作,确定 遵循 Gonzalez、Zimmerman 和 Nagappan (2020) 以及 Dohmke、Iansiti 和 Richards 方法论的公共 AI 存储库 (2023),分别使用与人工智能/机器学习和生成人工智能相关的主题标签,以及通过识别的其他相关关键词 滚雪球抽样,例如“机器学习”、“深度学习”和“人工智能”。 GitHub 进一步扩充了数据集 依赖于 PyTorch、TensorFlow、OpenAI、Transformers、XGBoost、scikit-learn 和 SciPy 库的存储库 蟒蛇。 将人工智能项目映射到地理区域 使用 IP 地址地理定位将公共 AI 项目映射到地理区域,以确定项目所有者的模式位置 每年。与 GitHub 交互时,每个项目所有者都会根据其 IP 地址分配一个位置。如果项目业主 一年内更换地点,项目地点将根据每日抽样的业主所在地点确定 在这一年里。此外,项目业主的最后已知位置每天都会结转,即使项目业主 当天没有进行任何活动。例如,如果项目所有者在美国境内开展活动,然后成为 如果该项目所有者连续六天不活跃,则该项目所有者将被视为在美国停留了 7 天。 抱脸 拥抱脸部 (HF) 数据是从两个不同的来源收集的: • 下载数据:由Longpre 等人的作者共享。 (2025) • 现有模型和数据集的数量:可公开访问的Hugging Face (HF) 存储库。 下载数据 朗普雷等人。使用 (2025) 是因为它提供了有关实际下载的最一致和完整的信息。 • 从 HF 下载的数据可能因版本而异,具体取决于参数的处理方式。1 Longpre 等人。直接合作 与 HF 人员合作,他们确认该数据集是可用的噪声最小的版本。2 1 GET/HEAD 请求、本地缓存命中、云托管虚拟机的 IP 地址(当设置不需要固定 IP 时)、Git/Xet back- 结束在 Transformers 和 Hub API 内部与外部获得的模型、主动垃圾邮件检测、追溯垃圾邮件检测等。 2 未发布的使用数据采用与公共 API 不同的聚合方法。它被过滤以删除重复的、重复的请求 ===== 第386页 ===== 第386章 • 许多下载和模型元数据在其他来源中丢失;作者进行了手动清理并估算 缺失值,提供比可公开访问的替代方案更完整的版本。 • 公共高频数据作为“所有时间下载”的横截面提供,而对面板版本的访问则通过 与作者直接合作。 该数据集受到以下限制: • 时间跨度为2022年3月至2025年8月。开始日期无法拉起,因为那是HF开始标记的时间 模型创建日期。 • 覆盖范围仅限于下载量至少为 200 次的模型中每周下载次数最多的前 200 个模型。然而,这 子样本反映了所有下载的 49.6%。 现有模型和数据集的数量 公共源不断更新,但目前包含大量模态缺失值(~60%),并且没有 地理信息,并且仅以横截面格式提供。因此,它不允许进行时间序列分析 使用情况,或更精细地表示按地理区域和模式划分的模型/数据集群体。 人工智能出版物分析 在本次分析中,AI 指数使用 OpenAlex(一个拥有超过 2.6 亿研究出版物的开放学术数据库)作为其主要数据 数据源。 OpenAlex 使用自己的知识组织系统(称为 OpenAlex 主题)对论文进行分类,这是一种分类法 结合 Scopus 代码和 CWTS 分类的约 4,500 个主题。该系统使用考虑标题的深度学习模型, 摘要、期刊名称和用于分类的引用网络。为了更准确地识别人工智能相关主题,人工智能指数分析了 由 OpenAlex 识别的计算机科学出版物,并使用计算机科学本体论和 CSO 分类器。 计算机科学本体 (CSO) 是一个大规模、自动生成的研究领域本体,源自 1600 万个研究领域 使用 Klink-2 算法的出版物。它具有具有数千个子主题的分层结构,允许精确映射 将特定术语扩展到更广泛的研究领域。与 OpenAlex、Scopus 和 Web 等通用学术数据库相比 CSO 提供了更详细、更细粒度的研究景观描述。结果,它被广泛 用于学术数据探索、分析、建模以及专家识别和推荐。版本 3.4.1 — 本中使用 分析——包括计算机科学领域的大约 15,000 个主题和 166,000 个关系。发布于 2025 年 1 月 17 日,本 版本引入了 150 多个人工智能新研究主题,使人工智能相关主题总数达到 2,369 个,人工智能相关主题总数达到 12,620 个 仅在人工智能领域内的层次关系。 为了分析研究趋势,AI 指数使用了 CSO 分类器——一种自动对研究进行分类的无监督方法 基于 CSO 主题的论文。分类器遵循处理论文标题和摘要的三阶段管道: 模块检测对 CSO 主题的直接提及;语义模块使用词嵌入来识别相关概念;和一个 后处理模块合并结果,过滤掉不相关的主题,并添加更广泛的类别以进行更精细的分类。 在本次分析中,AI 指数扩展了 CSO 分类器,专门关注人工智能及其子主题。由于其 该分类器首次发布后,由于其多功能性而引起了人们越来越多的兴趣。例如,Springer Nature 使用它来 定期对会议记录书籍进行分类,提高元数据质量。除了学术出版之外,它还成功应用于 对研究软件、YouTube 视频、新闻稿、招聘广告和 IT 博物馆藏品进行分类。 准确地将研究论文分类为会议论文集或期刊文章对于此分析至关重要。开放亚历克斯 元数据字段(类型、crossref_type 和 source_type)有时可能会发生冲突。为了解决这些不一致的问题,人工智能指数 将 OpenAlex 记录映射到 DBLP(计算机科学出版物的领先书目数据库)。以其高元数据而闻名 DBLP 目前索引了 360 万篇会议论文和 300 万篇期刊文章,并不断添加新出版物 通过严格的半自动化管理流程。 OpenAlex 和 DBLP 之间的初始匹配是使用 DOI 进行的。 为重新 ===== 第387页 ===== 第387章 该方法将出版物归属于作者所属的所有国家和地区,这意味着一篇论文可以 有助于多项计数。例如,一篇由美国和中国研究人员共同撰写的论文算一次 每个国家。这种方法可能会导致汇总统计数据中的总数重叠。出版年份基于最新的 版本,无论是在期刊、会议还是像 arXiv 这样的存储库中。为了保持准确性,组织隶属关系经过验证并 标准化,根据总部所在地分配国家。 排名前 100 的 AI 出版物的完整列表可在此处查看。 人工智能会议出席情况 AI Index 联系了 2025 年各种 AI 会议的组织者,索取总出席人数的信息。用于会议 AI Index 在网上发布了他们的出席总数,但使用了这些报告的总数,并且没有联系会议组织者。 人工智能专利分析 人工智能索引使用混合分类方法识别人工智能相关专利,将基于关键字的文本分析与分类相结合。 基于阳离子代码的识别。专利级书目数据来源于PATSTAT Global,这是一个发布的综合数据库 由欧洲专利局(EPO)。该分析重点关注 2010 年以来授予的专利,汇总在 DOCDB 系列中 级别,以避免对同一发明进行重复计数。3 专利根据国家的出版机构归属于国家/地区 最早记录的拨款出版物。 最初以英语以外的语言发布的专利摘要和标题是使用深度翻译工具 Google 翻译的 翻译引擎和 Meta NLLB-200 机器翻译模型。翻译后,专利文本使用自然语言进行处理 量表处理(NLP)技术。其中包括删除停用词和特殊字符、词性 (POS) 标记 保留关键语法类别、小写转换、词形还原以及用 替换数字度量 标签。 通过使用正则表达式 (regex) 在专利标题和摘要中搜索相关术语来识别人工智能相关专利。安 人工智能专用关键词词典是通过结构化的多步骤过程开发的,结合了人工智能模块生成的关键词 els,使用现有的人工智能词典进行扩展,例如来自 Yamashita 等人的词典。 (2021),并通过基于 Word2Vec 的同义词进行精炼 识别。使用 BERTopic 主题建模和基于 DeBERTA 的零样本分类进行了进一步验证,其中 采用手动检查来减少误报。 除了基于关键词的分类外,还使用国际专利分类(IPC)和 合作专利分类 (CPC) 代码。通过结合人工智能模型,编制了一份与人工智能相关的代码的精选列表 分析、基于正则表达式的搜索和先前的研究,包括 Pairolero 等人的分类。 (2023 年)和产权组织(2024 年)。决赛 数据集是通过合并两种方法的结果来构建的,平衡覆盖范围和准确性。 知识传播速度方法论 定义:Kaplan-Meier 估计器是一种非参数统计方法,用于估计寿命的生存函数 数据。在这种情况下: • 生命周期是指从专利发布到首次引用的引用滞后时间(以月为单位)。 • 该事件是一项首次被引用的专利。 • 当观察期结束时专利尚未被引用时,就会发生审查。 计算:生存函数表示专利在超过一段时间内尚未收到引用的概率 指定时间t。 Kaplan-Meier 估计量的数学定义如下: • t:自发布以来的时间(以月为单位)。 • t_i:至少一项专利首次被引用的不同时间点。 • d_i:在时间t_i 发生的事件(首次引用的专利)数量。 • n_i:在时间 t_i 之前有被引用风险的专利数量,其中包括截至目前尚未被引用的所有专利 时间 t_(i-1) 并且在 t_i 之前尚未进行审查。 分析是在专利家族层面(单个发明)进行的,使用每个家族的最早公布日期作为时间 3 尽管采用了这种聚合程序,但在应用程序在 t 内的边缘情况下,偶尔会出现重复项。 ===== 第388页 ===== 第388章 引用事件和引用滞后的参考。有关该方法在文献中的应用,请参阅 Fisch 等示例 等人。 (2017)和谢等人。 (2019)。该数字汇总了所有专利机构的引用量,合计不到 6% 总引用量,归入标有“世界其他地区”的类别。 技术邻近方法论 计算:基于 Bar 等人的工作。 (2012),该指标是通过比较两个国家的专利组合来计算的 (专利机构)使用其专利所属的技术类别。该计算对每个实体 i 使用一个向量 实体组合 P_i,其中每个组成部分 P_ik 是实体在特定技术类别 k4 的总专利中所占的份额。 • 最终衡量标准是所有共享技术类别的最小份额之和,量化了 两个组合之间的发明重叠。 • 解释:所得值表明两国技术重点的相似性。 ◊ 范围:该值被归一化为 0 到 1 之间。 基准:该图显示了国家与两个主要专利机构(美国和 中国)基于授予的人工智能专利数量。 泽基 Zeki人工智能人才 Zeki 已识别出 658,000 名顶尖人工智能人才(中国境外),他们在人工智能新发现方面拥有良好的记录,贡献者包括: 用于研究、数据存储或新模型。由于其先进的技能和能力,他们在市场上具有特殊的价值。 突破科学和工程界限的能力。他们为雇主创造新产品和知识产权 (IP) 而不仅仅是应用市场上现有的技术。 涵盖以下国家:澳大利亚、巴西、加拿大、丹麦、芬兰、法国、德国、印度、以色列、意大利、日本、荷兰 - 土地、沙特阿拉伯、新加坡、韩国、西班牙、瑞典、瑞士、阿联酋、英国、美国。 数据 Zeki 收集公司或个人在网上发布或发布的公开可用的、严格与业务相关的数据。 Zeki 不会收集有关个人的私人数据(即未公开且个人选择收集的信息) 保密)。 Zeki 严格禁止在安全登录区域内进行任何涉及数据聚合的数据收集。我们也 从经过审查的供应商那里购买数据,这些供应商经过外部法律专家的严格评估,以确保其符合数据法规 关系。职业数据以合规方式从开放网络获取。对于人才专业化,Zeki 策划了独特的领域 涵盖人工智能软件、硬件和计算各个方面的人工智能创新。主要和次要领域是通过 综合分析所有相关研究论文。使用基于第一个的可能性的概率模型来推断性别 名字是男性还是女性。它通过可能的居住国家/地区得到增强,以提高准确性。虽然这种方法通常是可靠的 可能,有些名字在多种性别中普遍使用。在这种情况下,模型会分配一个概率分数。如果概率 落在 45% 到 55% 之间,该名称被归类为不明确或不具体,这意味着无法确定性别分配 做了。 日期范围 该数据集涵盖 2010 年至 2025 年期间。该数据集不包括 2010 年之前开始的记录。 隶属范围 该数据集包括在公司和学术机构工作的个人。 最后已知的居住地 为了确保准确性并减少因个人资料更新延迟而导致的波动,Zeki 使用“最后已知居住地”逻辑进行纵向分析 数据集。当专业人士的职业生涯时间表缺乏其最近角色的明确“结束日期”时,或者当两者之间存在差距时 他们的最后一次更新以及当前年份(2025 年)、他们最后已知的居住地、部门和教育水平将结转到现在 一天。这种方法说明了这样一个事实:专业人士经常在职业中断、裁员或担任职务后延迟更新个人资料。 过渡,提供更可靠、更稳定的活跃人才库视图。 4 使用 5 位国际/合作专利分类 (IPC/CPC) 代码。 附录| 2026 年人工智能指数报告 ===== 第389页 ===== 第389章 人才供给 (一)人才供给 该数据集系列提供了 2010 年至 2025 年全球人工智能人才分布的详细视图,旨在进行纵向分析 支持趋势跟踪和跨国比较。它以三个相关的面板数据集提供: 1. 人才供应情况-按年份划分 2. 人才供给——按年份和国家划分的教育 3. 人才供给——按年份和国家划分的部门 这些数据集被拆分而不是组合成一个文件,但都遵循一致的数据聚合、计算方法 绝对数量和百分比份额(如果适用)。每年的国家分配均来自个人的 职业时间表,使用与他们当年的经历相关的地点。同样,部门信息每年记录一次 - 从职业生涯时间表来看,这意味着一个人在其工作的每一年都与一个部门相关联。教育被映射为一个时间 教育时间线中的系列,因此个人在其当年会收到相关类别(例如“硕士”)的计数 接受了这种教育。这种综合方法可确保按地理位置、行业和教育准确地反映人工智能人才 随着时间的推移。有六个教育级别。行业主要以 LinkedIn 行业为基础。有336个扇区。 (二)专业领域 该数据集基于以下领域的最新数据,按国家、国家代码和专业领域提供人工智能人才数量: 每个人。该国家/地区是根据个人最新记录的经历及其相关位置确定的。领域 专业化是使用每个人当前最重要的两个专业化来确定的。排名前 100 的专业被录取。每个人 然后映射到他们的国家和相关专业,并计算计数。 (3) 流动性 该数据集捕捉了人工智能人才的流动性和职业转变,提供了对三个关键维度的见解: • 国家和地区流动:追踪国家和地区之间人工智能人才的流入和流出,突出显示 移民趋势和全球人才流动。 • 部门转型:监测学术界、工业界和政府等主要部门之间的转变,揭示行业转型模式 职业发展和劳动力动态。 为了确保准确性并减少因配置文件更新延迟而造成的波动,所有趋势均使用 12 个月的移动进行平滑 平均,提供更清晰、更可靠的长期变化视图。当专业人士换工作时,通常会出现延迟 在他们更新个人资料之前——尤其是在裁员或职业中断的情况下。 (4) 性别分布 该数据集按国家和年份展示了人工智能人才的性别分布,以百分比表示。对于每个国家和每个 在时间范围内的年份中,男性和女性人工智能专业人员的比例按该年人工智能人才库总量的比例计算 国家-年份组合。这种结构能够分析一段时间内的性别代表性趋势,并支持跨国 比较。 附录| 2026 年人工智能指数报告 ===== 第390页 ===== 390 第二章:技术性能 基准测试 在本章中,人工智能指数报告了基准,认识到它们在跟踪人工智能技术进步方面的重要性。作为标准 实践中,该指数从排行榜和公共存储库以及公司论文、博客文章中获取基准分数, 和产品发布。该指数的运作假设公司报告的分数准确且真实。的 本节中的基准分数截至 2026 年初。但是,自 AI 指数发布以来,较新的模型可能已经 已发布超越当前最先进分数的结果。 被引作品 白 Y.、涂 S.、张 J.、彭 H.、王 X.、吕 X.、曹 S.、徐 J.、侯 L.、董 Y.、唐 J. 和李 J. (2025)。 LongBench v2:迈向 对现实的长上下文多任务进行更深入的理解和推理。在 W. Che、J. Nabende、E. Shutova 和 M. T. Pilehvar(编辑)中, 计算语言学协会第 63 届年会论文集(第一卷:长论文)(第 3639-3664 页)。 计算语言学协会。 https://doi.org/10.18653/v1/2025.acl-long.183 Balunović, M.、Dekoninck, J.、Petrov, I.、Jovanović, N. 和 Vechev, M. (2025)。 MathArena:评估未受污染数学的法学硕士 比赛(版本 3)。 arXiv. https://doi.org/10.48550/ARXIV.2505.23281 Burnham, G. 和 Adamczewski, T.(2025 年,6 月 25 日)。法学硕士现在接受更长的输入,最好的模型可以更有效地使用它们。 时代人工智能。 https://epoch.ai/data-insights/context-windows 人工智能安全中心,Phan, L.、Gatti, A.、Li, N.、Khoja, A.、Kim, R.、Ren, R.、Hausenloy, J.、Zhang, O.、Mazeika, M.、Hendrycks, D.,Scale AI,Han,Z.,Hu,J.,Zhang,H.,Zhang,C.B.C.,Shaaban,M.,Ling,J.,Shi,S.,…Scaramuzza,D.(2026)。专家级标杆 评估人工智能能力的学术问题。自然,649(8099),1139–1146。 https://doi.org/10.1038/s41586-025-09962-4 Chan, J. S.、Chowdhury, N.、Jaffe, O.、Aung, J.、Sherburn, D.、Mays, E.、Starace, G.、Liu, K.、Maksin, L.、Patwardhan, T.、Weng, L.、 &Mądry,A.(2024)。 MLE-bench:评估机器学习工程上的机器学习代理(版本 6)。 arXiv. https://doi. org/10.48550/ARXIV.2410.07095 Cheng, Z.、Wohnig, S.、Gupta, R.、Alam, S.、Abdullahi, T.、Ribeiro, J. A.、Nielsen-Garcia, C.、Mir, S.、Li, S.、Orender, J.、Bahrainian, S. A.、Kirste, D.、Gokaslan, A.、Glinka, M.、Eickhoff, C. 和 Wolff, R. (2025)。基准测试已被打破——不要让人工智能自己做评判(arX- 四:2510.07575)。 arXiv. https://doi.org/10.48550/arXiv.2510.07575 Corrêa, A. B.、Pereira, A. G. 和 Seipp, J. (2025)。前沿大语言模型2025年规划表现(arXiv:2511.09378)。 arXiv. https://doi.org/10.48550/arXiv.2511.09378 Denain, J.-S. 和 Ho, A.(2025 年,9 月 19 日)。长上下文推理的巨大潜在影响。时代人工智能。 https://epoch.ai/ 梯度更新/长上下文推理的巨大潜在影响 Eriksson, M.、Purificato, E.、Noroozian, A.、Vinagre, J.、Chaslot, G.、Gomez, E. 和 Fernandez-Llorca, D. (2025)。我们可以相信人工智能基准吗? 标记?对人工智能评估当前问题的跨学科审查(第二版)。 arXiv. https://doi.org/10.48550/ARXIV.2502.06559 Fu, T.、González, M.、Conde, J.、Merino-Gómez, E. 和 Reviriego, P。 (2025)。多模态大语言模型是否真正学会了 告诉模拟时钟上的时间? IEEE 互联网计算,29(4), 48–54。 https://doi.org/10.1109/MIC.2025.3618144 Gemini 机器人团队、Abeyruwan, S.、Ainslie, J.、Alayrac, J.-B.、Arenas, M. G.、Armstrong, T.、Balakrishna, A.、Baruch, R.、Bauza, M.、Blokzijl, M.、Bohez, S.、Bousmalis, K.、Brohan, A.、Buschmann, T.、Byravan, A.、Cabi, S.、Caluwaerts, K.、Casarini, F.、Chang, O., … 周宇. (2025)。 Gemini Robotics:将人工智能带入物理世界(版本 1)。 arXiv. https://doi.org/10.48550/ARXIV.2503.20020 Glazer, E.、Erdil, E.、Besiroglu, T.、Chicharro, D.、Chen, E.、Gunning, A.、Olsson, C. F.、Denain, J.-S.、Ho, A.、Santos, E. de O.、Järviniemi, O.、Barnett, M.、Sandler, R.、Vrzala, M.、Sevilla, J.、Ren, Q.、Pratt, E.、Levine, L.、Barkley, G.、… Wildon, M. (2024)。前沿数学:A 评估人工智能高级数学推理的基准(版本 7)。 arXiv. https://doi.org/10.48550/ARXIV.2411.04872 韩红、李生、陈建、袁Y.、吴Y.、梁正通、杜红、付J.、李Y.、张J.、张C.、李L.、倪Y。 (2025)。视频工作台: 人性化视频生成基准 ===== 第391页 ===== 第391章 Luong, T.、Hwang, D.、Nguyen, H. H.、Ghiasi, G.、Chervonyi, Y.、Seo, I.、Kim, J.、Bingham, G.、Lee, J.、Mishra, S.、Zhai, A.、Hu, C. H., Michalewski, H.、Kim, J.、Ahn, J.、Bae, J.、Song, X.、Trinh, T. H.、Le, Q. V. 和 Jung, J. (2025)。迈向稳健的数学推理 (arXiv:2511.01846)。 arXiv. https://doi.org/10.48550/arXiv.2511.01846 Mialon, G.、Fourrier, C.、Swift, C.、Wolf, T.、LeCun, Y. 和 Scialom, T. (2024)。通用人工智能助手的基准。 Muennighoff, N.、Tazi, N.、Magne, L. 和 Reimers, N. (2022)。 MTEB:海量文本嵌入基准(版本 3)。 arXiv. https://doi. org/10.48550/ARXIV.2210.07316 Park, S.-Y.、Cui, C.、Ma, Y.、Moradipari, A.、Gupta, R.、Han, K. 和 Wang, Z. (2025)。 NuPlanQA:大规模数据集和基准 用于多模态大语言模型中的多视图驾驶场景理解(版本2)。 arXiv. https://doi.org/10.48550/ARX- IV.2503.12772 Rein, D.、Hou, B. L.、Stickland, A. C.、Petty, J.、Pang, R. Y.、Dirani, J.、Michael, J. 和 Bowman, S. R. (2023)。 GPQA:研究生水平的 Goo- gle-proof Q&A 基准(版本 1)。 arXiv. https://doi.org/10.48550/ARXIV.2311.12022 Reuel, A.、Ghosh, A.、Chim, J.、Tran, A.、Long, Y.、Mickel, J.、Gohar, U.、Yadav, S.、Ammanamanchi, P。 S.,阿拉哈姆,M.,拉赫马尼,H. A.、Akhtar, M.、Friedrich, F.、Scholz, R.、Riegler, M. A.、Batzner, J.、Habba, E.、Saxena, A.、Kornilova, A.、……Solaiman, I. (2025)。谁 评估人工智能的社会影响?绘制第一方和第三方评估的覆盖范围和差距 (arXiv:2511.05613)。 arXiv. https://doi. org/10.48550/arXiv.2511.05613 Reuel, A.、Hardy, A.、Smith, C.、Lamparth, M.、Hardy, M. 和 Kochenderfer, M. J. (2024)。 BetterBench:评估人工智能基准,uncov- 解决问题并建立最佳实践(版本 1)。 arXiv. https://doi.org/10.48550/ARXIV.2411.12990 萨法尔,A. 和奇奇金,O. (2025)。 ClockBench:人类能够战胜时间的视觉时间基准,而法学硕士却不能。 https://clockbench.ai/ 时钟凳.pdf Saxena, R.、Gema, A. P. 和 Minervini, P. (2025 年 3 月 18 日)。迷失在时间中:理解多式联运中的时钟和日历挑战 法学硕士。 https://doi.org/10.48550/arXiv.2502.05092 Singh, S.、Nan, Y.、Wang, A.、D’Souza, D.、Kapoor, S.、Üstün, A.、Koyejo, S.、Deng, Y.、Longpre, S.、Smith, N. A.、Ermis, B.、Fadaee, M., & 胡克,S.(2025)。排行榜错觉 (arXiv:2504.20879)。 arXiv. https://doi.org/10.48550/arXiv.2504.20879 Truong, S.、Tu, Y.、Hardy, M.、Reuel, A.、Tang, Z.、Burapacheep, J.、Perera, J.、Uwakwe, C.、Domingue, B.、Haber, N. 和 Koyejo, S. (2025)。奇妙的错误以及在人工智能基准测试中如何找到它们(arXiv:2511.16842)。 arXiv. https://doi.org/10.48550/arXiv.2511.16842 王Y.、马X.、张G.、倪Y.、Chandra, A.、郭S.、任W.、Arulraj, A.、何X.、江Z.、李T.、库M.、王K.、庄A.、 范 R.、岳 X.、陈 W. (2024)。 MMLU-Pro:更稳健、更具挑战性的多任务语言理解基准(版本 6). arXiv. https://doi.org/10.48550/ARXIV.2406.01574 Wiedemer, T.、Li, Y.、Vicol, P.、Gu, S.S.、Matarese, N.、Swersky, K.、Kim, B.、Jaini, P. 和 Geirhos, R. (2025)。视频模型是零镜头的 学习者和推理者(arXiv:2509.20328)。 arXiv. https://doi.org/10.48550/arXiv.2509.20328 谢 T.、张 D.、陈 J.、李 X.、赵 S.、曹 R.、华 T. J.、程 Z.、申 D.、雷 F.、刘 Y.、徐 Y.、周 S.、萨瓦雷斯 S.、熊、 C.、钟 V. 和于 T. (2024)。 OSWorld:真实计算机环境中开放式任务的多模式代理基准测试(版本 2)。 arXiv. https://doi.org/10.48550/ARXIV.2404.07972 Xu, C.、Guan, S.、Greene, D. 和 Kechadi, M.-T. (2024)。大型语言模型的基准数据污染:调查(版本 1)。 arXiv. https://doi.org/10.48550/ARXIV.2406.04244 杨 V.、金 H.、钟 S.、蒋 S.、王 Q.、Chaudhary, V. 和韩 X. (2025)。 100-LongBench:事实上是长上下文长凳- 从字面上评估长上下文能力的分数?见 W. Che、J. Nabende、E. Shutova 和 M. T. Pilehvar(编辑),协会的调查结果 计算语言学:ACL 2025(第 17560–17576 页)。计算语言学协会。 https://doi.org/10.18653/ v1/2025.findings-acl.903 Yao, S.、Shinn, N.、Razavi, P. 和 Narasimhan, K. (2024)。 τ-bench:现实世界中工具-代理-用户交互的基准 (版本 1)。 arXiv. https://doi.org/10.48550/ARXIV.2406.12045 于 Y.、齐 Z.、黄 Y.、王 W.、Weifeng.liu、Chen, R. 和 Pei, J. (2025)。长上下文语言模型 ===== 第392页 ===== 第392章 张 L.、董 J.、白 K.、倪 M.、马顿 Z.-C.、陈 Z. 和张 J. (2025)。 ResponsibleRobotBench:负责任的基准测试 使用多模态大语言模型的机器人操作(版本 1)。 arXiv. https://doi.org/10.48550/ARXIV.2512.04308 郑大.、黄Z.、刘H.、邹K.、何Y.、张F.、顾L.、张Y.、何J.、郑W.-S.、乔Y.和刘Z. (2025)。 VBench-2.0: 推进视频生成基准套件以实现内在忠实度(版本 2)。 arXiv. https://doi.org/10.48550/ARXIV.2503.21755 周 S.、徐 F. F.、朱 H.、周 X.、罗 R.、斯里达尔 A.、程 X.、欧 T.、比斯克 Y.、弗里德 D.、阿隆 U. 和 Neubig, G. (2023)。网络竞技场: 用于构建自主代理的真实 Web 环境(版本 4)。 arXiv. https://doi.org/10.48550/ARXIV.2307.13854 朱 X.、齐 Y .、朱 Y .、沃尔特斯 R. 和普拉特 R. (2025)。 EquAct:用于开环机器人操纵的 SE(3) 等变多任务变压器 法规(版本1)。 arXiv. https://doi.org/10.48550/ARXIV.2505.21351 附录| 2026 年人工智能指数报告 ===== 第393页 ===== 第393章 第 3 章:负责任的人工智能 会议提交分析 为了分析负责任的人工智能相关会议提交的材料,人工智能指数检查了负责任的人工智能相关的会议数量 在以下会议上提交的学术论文:AAAI、AIES、FAccT、ICML、ICLR 和 NeurIPS。具体来说,该团队抓取了 会议网站或会议提交论文的存储库,其中包含相关关键字,表明它们可能属于 一个特定的负责任的人工智能类别。然后对与最模糊关键词(例如“偏见”)相关的论文进行手动验证 由人类团队确认其分类,而其余部分则根据分类 RAI 一致性标签进行控制, 通过将每个论文标题和摘要提示为一个大语言模型来生成。一篇论文可能属于多个 负责任的人工智能类别。 搜索到的关键词包括: 公平和偏见:算法公平、偏见检测、偏见缓解、歧视、人工智能公平、道德算法设计、公平数据 实践、公平机器学习、公平和偏见、群体公平、个人公平、正义、非歧视、代表性公平、不公平、 不公平。 隐私和数据治理:匿名、保密、数据泄露、数据道德、数据治理、数据完整性、数据隐私、 数据保护、数据透明度、差异隐私、推理隐私、机器遗忘、设计隐私、隐私保护、 安全的数据存储,值得信赖的数据管理。 安全:对抗性攻击、对抗性学习、人工智能事件、攻击、审计、网络安全、道德黑客、取证分析、欺诈 检测、红队、安全、安全、安全道德、威胁检测、漏洞评估。 透明度和可解释性:算法透明度、审计、审计、因果推理、因果关系、可解释性、可解释性 人工智能、可解释模型、人类可理解的决策、可解释性、可解释模型、模型可解释性、结果 解释、透明度、xAI。 被引作品 Adams, R.、Adeleke, F.、Florido, A.、Galdino De Magalhaes Santos, L.、Grossman, N.、Junck, L. 和 Stone, K. (2024)。全球指数为 负责任的人工智能。南非:全球人工智能治理中心。 https://www.global-index.ai/ Adelani, D. I.、Ojo, J.、Azime, I. A.、庄 J. Y.、Alabi, J. O.、He, X.、Ochieng, M.、Hooker, S.、Bukula, A.、Lee, E.-S。 A、楚库内克, C.,Buzaaba,H.,Sibanda,B.,Kalipe,G.,Mukiibi,J.,Kabongo,S.,Yuehgoh,F.,Setaka,M.,Ndolela,L.,… Stenetorp,P。 (2024)。 IrokoBench:大语言模型时代非洲语言的新基准(版本 2)。 arXiv. https://doi.org/10.48550/ ARXIV.2406.03368 Al-Matham, R.、Darwish, K.、Al-Rasheed, R.、Alshammari, W.、Alhoshan, M.、Almazrua, A.、Wazrah, A. A.、Alheraki, M.、Alam, F.,纳科夫,P.,阿尔扎赫拉尼,N.,阿尔比拉利,E.,哈巴什,N.,埃尔谢赫,A.,埃尔马拉,M.,李,H.,穆巴拉克,H.,安瓦尔,M.,阿利亚菲,Z.,... 奥赛米,A.(2025)。 BALSAM:阿拉伯大语言模型基准测试平台(版本 1)。 arXiv. https://doi.org/10.48550/ ARXIV.2507.22603 Baucells, I.、Aula-Blasco, J.、de-Dios-Flores, I.、Paniagua Suárez, S.、Perez, N.、Salles, A.、Sotelo Docio, S.、Falcão, J.、Saiz, J. J.、 Sepulveda Torres, R.、Barnes, J.、Gamallo, P.、Gonzalez-Agirre, A.、Rigau, G. 和 Villegas, M. (2025)。 IberoBench:基准 伊比利亚语言法学硕士评估。在 O. Rambow、L. Wanner、M. Apidianaki、H. Al-Khalifa、B. D. Eugenio 和 S. Schockaert(编辑)中, 第 31 届国际计算语言学会议论文集(第 10491-10519 页)。计算协会 语言学。 https://aclanthology.org/2025.coling-main.699/ Beauchemin, D.、Tremblay, Y.、Youssef, M. A. 和 Khoury, R. (2025)。 COLE:法语综合基准 理解评估(版本 2)。 arXiv. https://doi.org/10.48550/ARXIV.2510.05046 Cecchini, D.、Nazir, A.、Chakravarthy, K. 和 Kocaman, V. (2024)。大型语言模型的整体评估:评估鲁棒性, 准确性和实际应用的毒性。在 A. Ovalle,K.-W.张,Y。 T.Cao、N.Mehrabi、J.Zhao、A.Galstyan、J.Dhamala、 A. Kumar 和 R. Gupta(编者),第四届可信自然语言处理研讨会论文集 (TrustNLP 2024)(第 177 页) 109-117)。计算语言学协会。 https://doi.org/10.18653/v1/2024.trustnlp-1.11 Dadas, S.、Grębowiec, M.、Perełkiewicz, M. 和 Poświata, R. (2025)。 ===== 第394页 ===== 第394章 高凤、黄成、扎西尼、王X、次仁T、马宝B、多杰R、洛桑G、东如R、扎西D、冯红伟X、于Y。 (2025)。 TLUE:藏语理解评估基准(第 5 版)。 arXiv. https://doi.org/10.48550/ARXIV.2503.12051 González, J. Á.、Obrador, I. B.、Herrero, Á. R.、Sarvazyan, A. M.、Chinea-Ríos, M.、Basile, A. 和 Franco-Salvador, M. (2025)。伊伯基准: 伊比利亚语言法学硕士评估(版本 1)。 arXiv. https://doi.org/10.48550/ARXIV.2504.16921 Isbarov, J.、Akhundjanova, A.、Hajili, M.、Huseynova, K.、Gaynullin, D.、Rzayev, A.、Tursun, O.、Turdubaeva, A.、Saetov, I.、Kharisov, R.、Belginova, S.、Kenbayeva, A.、Alisheva, A.、Köksal, A.、Rustamov, S. 和 Ataman, D. (2025)。 TUMLU:统一的母语 突厥语言理解基准(版本 2)。 arXiv. https://doi.org/10.48550/ARXIV.2502.11020 Jassem, K.、Ciesiółka, M.、Graliński, F.、Jabłoński, P.、Pokrywka, J.、Kubis, M.、Jabłońska, M. 和 Staruch, R. (2025)。 LLMzSzŁ:A 波兰语综合法学硕士基准(版本 1)。 arXiv. https://doi.org/10.48550/ARXIV.2501.02266 Kaffee, L.-A.、Pistilli, G. 和 Jernite, Y。 (2025)。 INTIMA:人类与人工智能陪伴行为的基准(版本 1)。 arXiv. https://doi. org/10.48550/ARXIV.2508.09998 Kemmerzell, N. 和 Schreiner, A. (2024)。量化可信人工智能维度之间的权衡——一项实证研究 公平性、可解释性、隐私性和稳健性。 KI 2024:人工智能的进展,128-146。 https://doi.org/10.1007/978-3- 031-70893-0_10 Kim, D.、Jang, M.、Kwon, D. S. 和 Davis, E. (2022)。 KOBEST:韩国重要任务的平衡评估(版本 1)。 arXiv. https:// doi.org/10.48550/ARXIV.2204.04541 Ko, H.、Yang, K.、Ryu, M.、Choi, T.、Yang, S.、Hyun, J.、Park, S. 和 Park, K. (2023)。 Polyglot-Ko 的技术报告:开源大型- 扩展韩语语言模型(版本 2)。 arXiv. https://doi.org/10.48550/ARXIV.2306.02254 Koheridze, I.、Elizbarashvili, A. 和 Tsintsadze, M. (2025)。评估大语言格鲁吉亚语逻辑推理的基准 模型。在 E. L. Estevanell-Valladares、A. Picazo-Izquierdo、T. Ranasinghe、B. Mikaberidze、S. Ostermann、D. Gurgurov、P 中。穆勒,C. Borg 和 M. Šimko(主编),第一届推进低资源语言 NLP 研讨会论文集(第 121-130 页)。英科玛 有限公司,首门,保加利亚。 https://aclanthology.org/2025.lowresnlp-1.13/ Li, N.、Pan, A.、Gopal, A.、Yue, S.、Berrios, D.、Gatti, A.、Li, J. D.、Dombrowski, A.-K.、Goel, S.、Phan, L.、Mukobi, G.、Helm-Burger, N.、Lababidi, R.、Justen, L.、Liu, A. B.、Chen, M.、Barrass, I.、Zhang, O.、Zhu, X.、… Hendrycks, D. (2024)。 WMDP 基准: 通过遗忘来衡量和减少恶意使用(版本 7)。 arXiv. https://doi.org/10.48550/ARXIV.2403.03218 Libovický, J.、Helcl, J.、Manea, A. 和 Vico, G. (2025)。 CUS-QA:面向本地知识的开放式问答数据集 (版本 3)。 arXiv. https://doi.org/10.48550/ARXIV.2507.22752 Lillepalu, H. G. 和 Alumäe, T. (2025)。爱沙尼亚本地大语言模型基准(版本 2)。 arXiv. https://doi.org/10.48550/ ARXIV.2510.21193 Mazeika, M.、Phan, L.、Yin, X.、Zou, A.、Wang, Z.、Mu, N.、Sakhaee, E.、Li, N.、Basart, S.、Li, B.、Forsyth, D. 和 Hendrycks, D. (2024)。 HarmBench:用于自动红队和强力拒绝的标准化评估框架(版本 2)。 arXiv. https://doi. org/10.48550/ARXIV.2402.04249 敏,J.,吴,Y。 H.、Chan, S.、赵 H.S. 和 Lee, E.-S.答:(2025)。 CantoNLU:粤语自然语言理解基准 (版本 1)。 arXiv. https://doi.org/10.48550/ARXIV.2510.20670 Montalan, J. R.、Layacan, J. P.、Africa, D. D.、Flores, R. I.、Lopez, M. T.、Magsajo, T. D.、Cayabyab, A. 和 Tjhi, W. C. (2025)。巴塔扬:A 用于评估大型语言模型的菲律宾 NLP 基准(版本 2)。 arXiv. https://doi.org/10.48550/ARXIV.2502.14911 NAVER 云 HyperCLOVA X 团队。 (2025)。 HyperCLOVA X THINK 技术报告(版本 2)。 arXiv. https://doi.org/10.48550/ ARXIV.2506.22403 Ng, R., Nguyen, T. N., Huang, Y., Tai, N. C., Leong, W. Y., Leong, W. Q., Yong, X., Ngui, J. G., Susanto, Y., Cheng, N., Rengarajan, H., Limkonchotiwat,P.,Hulagadri,A.V.,Teng,K.W.,Tong,Y。 Y .、Siow, B.、Teo, W. Y.、Lau, W.、Tan, C. M.、… Teo, L. (2025)。海狮: 东南亚语言同一个网络(第 4 版)。 arXiv. https://doi.org/10.48550/ARXIV.2504.05747 奥乔,J.,奥贡德波,O.,O ===== 第395页 ===== 第395章 基准。载于 L. Chiruzzo、A. Ritter 和 L. Wang(主编),2025 年美洲国家会议会议记录 计算语言学协会:人类语言技术(第一卷:长论文)(第 1469-1478 页)。协会 计算语言学。 https://doi.org/10.18653/v1/2025.naacl-long.68 Son, G.、Lee, H.、Kim, S.、Kim, H.、Lee, J.、Yeom, J. W.、Jung, J.、Kim, J. W. 和 Kim, S. (2023)。 HAE-RAE 基准:对韩语的评估 语言模型知识(版本 5)。 arXiv. https://doi.org/10.48550/ARXIV.2309.02706 Souly, A.、Lu, Q.、Bowen, D.、Trinh, T.、Hsieh, E.、Pandey, S.、Abbeel, P.、Svegliato, J.、Emmons, S.、Watkins, O. 和 Toyer, S. (2024)。一个 StrongREJECT 用于空越狱(版本 2)。 arXiv. https://doi.org/10.48550/ARXIV.2402.10260 Susanto,Y.,Hulagadri,A.V.,Montalan,J.R.,Ngui,J.G.,Yong,X.B.,Leong,W.,Rengarajan,H.,Limkonchotiwat,P.,Mai,Y.,& Tjhi,W.C.(2025)。 SEA-HELM:东南亚语言模型整体评估(版本2)。 arXiv. https://doi.org/10.48550/ ARXIV.2502.14301 Suzgun, M.、Gur, T.、Bianchi, F.、Ho, D. E.、Icard, T.、Jurafsky, D. 和 Zou, J. (2025)。语言模型无法可靠地区分信念 来自知识和事实。自然机器智能,7(11),1780–1790。 https://doi.org/10.1038/s42256-025-01113-8 Turatali, T.、Turdubaeva, A.、Zhenishbekov, I.、Suranbaev, Z.、Alekseev, A. 和 Izmailov, R. (2025)。缩小资源匮乏地区的差距 语言:为吉尔吉斯语语言模型建立基准。 2025年第十届计算机科学与技术国际会议 工程学(UBMK),1673–1677。 https://doi.org/10.1109/UBMK67458.2025.11206960 Vidgen, B.、Scherrer, N.、Kirk, H. R.、Qian, R.、Kannappan, A.、Hale, S. A. 和 Röttger, P。 (2023)。 SimpleSafetyTests:测试套件 识别大型语言模型中的关键安全风险(版本 2)。 arXiv. https://doi.org/10.48550/ARXIV.2311.08370 Wasif, D.、Chen, D.、Madabushi, S.、Alluru, N.、Moore, T. J. 和 Cho, J.-H。 (2025)。隐私-公平-准确性交易实证分析- 联邦学习中的问题:迈向负责任的人工智能的一步 (arXiv:2503.16233)。 arXiv. https://doi.org/10.48550/arXiv.2503.16233 魏J.,卡琳娜,N.,钟H.W.,焦Y。 J.、Papay, S.、Glaese, A.、Schulman, J. 和 Fedus, W. (2024)。衡量简短的真实性 在大型语言模型(版本 1)中。 arXiv. https://doi.org/10.48550/ARXIV.2411.04368 Zanga, A. I.、Abdulrahman, S. M.、Ado, A.、Bichi, A. A.、Jibril, L. A.、Umar, A. B.、Adamu, A.、Muhammad, S. H. 和 Abubakar, B. S. (2025)。 HausaMovieReview:低资源非洲语言情感分析基准数据集(版本 1)。 arXiv. https:// doi.org/10.48550/ARXIV.2509.16256 张,A.K.,佩里,N.,杜勒佩特,R.,吉,J.,门德斯,C.,林,J.W.,琼斯,E.,侯赛因,G.,刘,S.,贾斯珀,D.,皮塔萨瓦凯,P., Glenn, A.、Sivashankar, V.、Zamoshchin, D.、Glikbarg, L.、Askaryar, D.、Yang, M.、Zhang, T.、Alluri, R.、……梁 P。 (2025)。网络测试平台:A 评估网络安全能力和语言模型风险的框架(arXiv:2408.08926)。 arXiv. https://doi.org/10.48550/ arXiv.2408.08926 张瑞、李辉、孟辉、詹杰、甘辉、李永成。 (2025)。人工智能陪伴的黑暗面:有害算法的分类 人类与人工智能关系中的麦克风行为 (arXiv:2410.20130)。 arXiv. https://doi.org/10.48550/arXiv.2410.20130 附录| 2026 年人工智能指数报告 ===== 第396页 ===== 第396章 第四章:经济 奎德 希瑟·英格利希 (Heather English) 和考特尼·普拉巴卡 (Courtney Prabhakar) 准备的快速见解 Quid 使用自己的内部 LLM 和其他智能搜索功能以及传统的布尔查询来搜索重点领域, 许多数据集中的主题和关键字:社交媒体、新闻、论坛和博客、公司、专利和其他自定义源 数据(例如调查数据)。 Quid 有许多可视化选项和数据传输端点,包括基于 语义相似性、平台内仪表板功能和编程式 PostgreSQL 数据库交付。 Quid 适用于最佳- 类 AI 和 NLP 揭示大型数据集中隐藏的模式,使用户能够准确、快速、准确地做出数据驱动的决策 高效。 搜索、数据源和范围 来自多个数据源的超过 800 万个全球上市和私营公司资料已被编入索引,以便在整个公司内进行搜索 描述,同时过滤并包含从投资信息到公司信息的元数据,例如 成立年份、总部地点等。公司信息每周更新一次。 Quid 算法读取大量数据 每个文档中的文本数据量,以便根据相似的语言在不同文档之间建立链接。这个过程 大规模重复,产生不同集群的网络,识别不同的主题或焦点领域。趋势是 根据 Quid 识别的关键字、短语、人员、公司和机构以及输入的其他元数据进行识别 该软件。 数据 公司 组织数据嵌入来自 Capital IQ 和 Crunchbase。这些公司包括各种类型的组织(私人、公共、 经营、作为子公司经营、停业)在世界各地。投资数据包括民间投资、并购、 公开发行、私募股权和风险投资、企业风险投资部门、政府和机构持有的少数股权 美国境内和境外。有些数据不可用——例如,当投资者的姓名或资金金额不存在时 披露。 Quid 默认嵌入 Capital IQ 数据,并添加来自 Crunchbase 的数据以获取未在 资本智商。这不仅可以产生有关所有全球组织的全面而准确的数据,还可以捕获早期初创企业 和资助事件数据。 搜索参数 布尔查询用于在存档的公司数据库及其内部搜索重点领域、主题和关键字 业务描述和网站。 Quid可以按照总部地区、投资金额、经营状况等条件筛选搜索结果 组织类型(私人/公共)和成立年份。 Quid 然后通过语义相似性将这些公司可视化。如果还有更多 Quid 从搜索结果中选择 7,000 多家公司,根据语言选择 7,000 家最相关的公司进行可视化 算法。布尔搜索:“人工智能”或“AI”或“机器学习”或“深度学习”。 公司 • 2015年1月1日至2025年12月31日期间获得投资(私募、IPO、并购)的全球人工智能和机器学习公司。 • 过去10年(2015年1月1日至2025年12月31日)获得超过150万美元资金的全球人工智能和机器学习公司。 • 还提取了全局数据以进行生成人工智能查询(布尔搜索:“生成人工智能”或“生成人工智能”或“生成人工 情报”)适用于过去10年(2015年1月1日至2025年12月31日)收到超过150万美元的公司。 目标事件定义 • 私募:私募是指公司将新发行的证券(股权或债务)出售给选定的投资者。 投资者或投资者团体。买家在私募中持有的股份通常是少数股权(50%以下), 尽管可以通过私募来控制一家公司,在这种情况下,私募将 成为多数股权投资。 • 少数股权投资:这是指少数股权收购,当买方收购的股份少于 50% 时发生。 实体、资产产品和业务部门的现有所有权股份。 • 并购:指买方收购现有实体、资产产品和资产50%以上的股权。 业务部门。 麦肯锡公司 “企业活动”部分使用的数据来自麦肯锡全球调查“2025 年人工智能现状:代理、 创新、创新 ===== 第397页 ===== 第397章 受访者表示,他们为年收入超过 10 亿美元的组织工作。为了调整响应率的差异, 数据根据每个受访者所在国家对全球 GDP 的贡献进行加权。 人工智能指数还考虑了麦肯锡调查之前迭代的数据。这些包括: 2024 年初人工智能的现状:新一代人工智能采用率激增并开始产生价值 人工智能的现状:组织如何重新构建以获取价值 2023 年人工智能的现状:生成式人工智能的突破年 2022 年人工智能现状——五年回顾 2021 年人工智能现状 2020 年人工智能现状 人工智能证明了它的价值,但影响不大(2019) 人工智能的采用不断进步,但基本障碍仍然存在 (2018) 光投 由埃琳娜·马格里尼和丽贝卡·米尔德编写 Lightcast 提供就业市场分析,使雇主、工人和教育工作者能够做出数据驱动的决策。的 公司的人工智能技术分析了数亿个职位发布和现实生活中的职业转变,以提供 洞察劳动力市场模式。这种实时战略情报提供了重要的见解,例如最需要什么工作, 雇主需要的具体技能,以及为员工提供最大潜力的职业方向。欲了解更多信息,请访问 www.lightcast.io。 职位发布数据 为了支持这些分析,Lightcast 挖掘了自 2010 年以来收集的数十亿个职位发布的数据集。Lightcast 收集职位发布 从超过 51,000 个在线招聘网站中获取劳动力市场需求的全面、实时的描述。它汇总了职位发布, 删除重复项,并从职位发布文本中提取数据。这包括有关职称、雇主、行业和地区的信息,例如 以及所需的经验、教育和技能。 职位发布对于了解劳动力市场的趋势很有用,因为它们可以详细、实时地了解技能 雇主寻求。为了评估职位发布数据的代表性,Lightcast 进行了多项分析来比较 职位发布的分发到美国官方政府和其他第三方来源的分发。初级 美国职位发布的政府数据来源是职位空缺和劳动力流动调查 (JOLTS) 计划,该计划由 劳工统计局。基于JOLTS和Lightcast的比较,Lightcast数据捕捉到的劳动力市场需求 占劳动力总需求的99%以上。未在网上发布的职位通常是在小型企业中(典型的例子是 餐馆橱窗上贴着“寻求帮助”的牌子)和工会招聘大厅。 衡量人工智能需求 为了衡量雇主对 AI 技能的需求,Lightcast 使用了超过 33,000 项技能的技能分类。5 这些技能经过组织 按层次分为 400 多个技能集群和 32 个技能类别。 从这份完整列表中,Lightcast 确定了更广泛的 AI 范围内的一些技能集群,总共 10 个集群。九个 这些集群已包含在 2025 年人工智能指数报告中:人工智能道德、治理和监管;人工智能;自治 驾驶;生成式人工智能;机器学习;自然语言处理;神经网络;机器人技术;和视觉图像识别。 今年增加了一个额外的集群——代理人工智能,以反映人工智能创新前沿的发展。 Lightcast 专家在 10 个集群中确定了 300 多种 AI 技能,如果职位发布包含以下一项,则被视为 AI 职位 职位列表文本中的那些技能。 Lightcast 数据中的 AI 技能列表如下所示,以及相关的技能集群。自上线以来一共新增了24个技能 以前的版本,这些技能在下面以黄色突出显示。虽然某些技能被认为是专门属于人工智能集群的, 就本报告而言,以下所有技能均被视为人工智能技能。 AI 代理 [新集群 - 它包括 AI 定义中已有的技能和 2025 年添加的新技能的组合]:聊天机器人、 Agentic AI、ChatGPT、AI 代理、对话式 AI、Microsoft Copilot、多代理系统、Langgraph、Microsoft Copilot Studio、 Agentic Systems、Google Bard、智能代理、智能虚拟助理、嵌入式 AI、客户参与套件 Google AI、Bot Framework、Amazon Alexa、Cortana、交互式信息亭、IPSoft Amelia、CrewAI、游戏 Ai、生成式 AI 代理、 自主计算,Botp ===== 第398页 ===== 第398章 人工智能研究、人工智能开发、AIOps(IT 运营人工智能)、AI/ML 推理、自动化数据 清洁、人工智能创新、基于知识的系统、人工智能标记语言(AIML)、 智能系统、PineCone、合成数据生成、可解释人工智能 (XAI)、开放神经网络交换 (ONNX)、知识 工程、人工智能测试、专家系统、Azure 认知服务、知识蒸馏、基于知识的配置、人工 智能系统、Weka、知识表示、认知计算、推理系统、智能控制、认知 自动化、百度、Weaviate、AI个性化、 计算智能、Watson Studio、通用人工智能、Watson Conversation、神经符号 AI、OpenAI Gym、 运营 AI、Qdrant、PennyLane、Google Quantum AI。 自动驾驶:高级驾驶辅助系统、自动驾驶车辆、光检测和测距 (LiDAR)、远程 传感、自主系统、制导导航和控制系统、OpenCV、对象跟踪、动态路由、路径 分析、场景理解、自主巡航控制系统、路径查找、无人机系统 (UAS)。 生成式人工智能:生成式人工智能、大语言建模、即时工程、检索增强生成、 变分自动编码器、生成对抗网络、文本转语音 (TTS)、多模态模型、图像修复、文本 总结、多模态学习、图像超分辨率、稳定扩散、DALL-E 图像生成器、Adobe Sensei、AI- 生成的代码、上下文工程、ChatGPT 提示、 Beautiful.AI,变分自动编码器(VAE)。 机器学习:机器学习、Apache Spark、PyTorch(机器学习库)、 预测建模、MLOps(机器学习操作)、Scikit-Learn(Python 包)、 机器学习算法、AWS SageMaker、强化学习、Transformer(机器学习模型)、功能 工程、MLflow、数据分类、Vertex AI、 决策树学习、Azure 机器学习、机器学习模型训练、无监督学习、机器学习 方法、分布式机器学习、Kubeflow、 推荐系统、概念漂移检测、随机森林算法、Xgboost、Boosting、 支持向量机、监督学习、Torch(机器学习)、Dask(软件)、关联规则学习、AutoGen、 特征提取、梯度提升、聚类分析、 特征选择、H2O.ai、ModelOps、超参数优化、迁移学习、 自动化机器学习、装袋技术、协同过滤、机器学习模型监控和评估、 联邦学习、K-Means 聚类、降维、支持向量机 (SVM)、特征学习、网络 物理系统、神经架构压缩、集成方法、混淆矩阵、训练数据集、决策模型、 贝叶斯信念网络、朴素贝叶斯分类器、程序化媒体购买、 遗传算法、元学习、损失函数、梯度提升机 (GBM)、 半监督学习、测试数据集、目标函数、马尔可夫链、隐马尔可夫模型、高斯过程、Theano (软件)、矩阵分解、Apache Mahout、 CHi-Squared 自动交互检测 (CHAID)、Microsoft 认知工具包 (CNTK)、 核方法、排序算法、拓扑数据分析 (TDA)、Pydata、对抗性机器学习、Oracle 自治 数据库、感知器、推理引擎、Dbscan、 嵌入式智能、注意力机制、Apache MADlib、增量学习、神经架构搜索 (NAS)、PyTorch Lightning、Vowpal Wabbit、Dlib(C++ 库)、AdaBoost(自适应增强)、玻尔兹曼机、零样本学习、mlpack(C++) 库)、Google AutoML、t-SNE(t 分布式随机邻域嵌入)、Apache SINGA、软计算、 进化编程、Predictionio、期望最大化算法、Google Cloud ML Engine、元学习、LIBSVM、 分类和回归树(CART), 自然语言处理:人工智能翻译、自然语言处理(NLP)、文本检索系统、屏幕阅读器、拥抱 人脸(NLP框架)、语言模型、 LLaMA(语言模型)、自然语言理解(NLU)、标记化、文本挖掘、 情感分析、语音识别、BERT(NLP模型)、光学字符识别(OCR)、计算语言学、 拥抱脸部变形金刚、语义搜索、语义内核、自然语言 ===== 第399页 ===== 第399章 机器人技术:机器人系统、机器人操作系统、OpenAI 健身房环境、 运动规划、SLAM 算法(同步定位和建图)、机器人框架、机器人自动化软件、 高级机器人技术、机器人编程、 伺服电机、Nvidia Jetson、机器人液体处理系统、认知机器人、人类反馈强化学习 (RLHF),元强化学习。 视觉图像识别:计算机视觉、图像分析、机器视觉、图形处理通用计算 单位、3D 重建、图像传感器、 图像识别、眼动追踪、面部识别、运动分析、图像分割、 对象识别、姿势估计、上下文图像分类、实例分割、 数字图像处理、热成像分析、手势识别、活动识别、 OmniPage、图像字幕、Imagenet、人脸检测、数字孪生技术、Deck.gl、图像匹配、Mnist、Realsense。 领英 由 Rosie Hood、Akash Kaura 和 Mar Carpanelli 编写 领英数据 这篇作品来自匿名和 汇总了 LinkedIn 全球超过 13 亿会员的个人资料信息。因此受到影响 会员选择使用该平台的方式可能会因专业、社交和地区的不同而有所不同 文化,以及整体网站的可用性和可访问性。在 LinkedIn 上发布这些见解时 经济图谱,我们希望提供准确的统计数据,同时确保会员的隐私。结果,所有 数据显示了相应时期的汇总信息,遵循严格的数据质量阈值 防止泄露特定个人的信息。 国家样本 LinkedIn 提供阿根廷、澳大利亚、奥地利、比利时、巴西、加拿大、智利、哥斯达黎加、克罗地亚、塞浦路斯、 捷克、丹麦、爱沙尼亚、芬兰、法国、德国、希腊、香港特别行政区、匈牙利、冰岛、印度、 印度尼西亚、爱尔兰、以色列、意大利、拉脱维亚、立陶宛、卢森堡、墨西哥、荷兰、新西兰、挪威、 波兰、葡萄牙、罗马尼亚、沙特阿拉伯、新加坡、斯洛文尼亚、南非、韩国、西班牙、瑞典、 瑞士、土耳其、阿拉伯联合酋长国、英国、美国和乌拉圭。 技能 LinkedIn 会员在其 LinkedIn 个人资料中自我报告自己的技能。目前,有超过 42,000 种独特的标准化技能 由 LinkedIn 识别。 LinkedIn 将人工智能技能分为两个互斥的组:“人工智能工程”和“人工智能素养”。人工智能 工程技能广义上是指设计、开发、部署和部署所需的技术专长和实践能力。 维护人工智能系统,人工智能素养技能是指知识、能力和批判性思维能力 需要理解、评估人工智能技术并与其有效交互。随着技能的不断发展, LinkedIn 定期维护和刷新这些分类。 工业 LinkedIn 的行业分类是共享经济活动并为特定产品或服务做出贡献的实体的集合。 行业代表公司提供或销售的产品或服务。 LinkedIn 分析了以下行业 人工智能技能渗透的背景:教育;金融服务;制造业;专业服务;和技术、信息、 和媒体。对于所有其他指标,LinkedIn 分析以下行业:住宿和餐饮服务;行政及 支持服务;建造;消费者服务;教育;娱乐提供商;农业、牧场和林业;金融 服务;政府行政;医院和医疗保健;制造业;石油、天然气和采矿业;专业服务;真实 财产和设备租赁服务;零售;技术、信息和媒体;运输、物流、供应链和 储存;公用事业;和批发。 性别 LinkedIn 认识到,一些会员的认同超越了“男人”和“女人”的传统性别结构。如果没有明确 自我识别后,LinkedIn 通过 LinkedIn 个人资料中使用的代词推断出此分析中包含的成员的性别 或根据名字。无法推断性别的成员被排除在任何性别分析之外。注:领英 过滤掉其性别归因算法缺乏足够覆盖范围的国家。 人工智能工作或职业 LinkedIn 会员头衔是标准的 ===== 第400页 ===== 400 科学家和计算机视觉工程师。 人工智能人才 如果 LinkedIn 会员明确添加了至少两项人工智能工程技能,则他们被视为人工智能人才 他们的个人资料和/或他们正在或曾经从事人工智能工作。 LinkedIn 会员被认为具有人工智能素养 如果他们在个人资料中添加了至少一项人工智能素养技能。 方法论 1. 顶级人工智能技能 这些是会员每年最常添加的人工智能技能。 示例解读:全球新增最多的人工智能工程技能是机器学习、人工智能和深度学习。 2. 增长最快的人工智能技能 所有成员最常添加的 AI 技能的同比 (YoY) 增长率。注:领英 对最近一年的技能增加量实施阈值;阈值设置在第 50 个百分位数 去年的人工智能技术增加了按国家/地区的分布。 示例解读:全球增长最快的 AI 工程技能是定制 GPT、AI 生产力和 AI 代理。 3.人工智能人才集中 人工智能人才的数量用于计算人才集中度指标。例如,计算国家层面 AI人才集中度,LinkedIn使用一个国家的AI人才数量除以LinkedIn会员数量 在那个各自的国家。注意:集中度指标可能会受到 LinkedIn 覆盖范围的影响 国家,应谨慎使用。 样本解读:拥有AI工程技能的AI人才占美国LinkedIn会员的0.88%。 4、相对AI人才聘用率同比比例 LinkedIn 招聘率是按 LinkedIn 会员资格标准化招聘的衡量标准。计算方式为 LinkedIn 的百分比 在工作开始的同一时期内添加新雇主的成员数除以该工作中的 LinkedIn 成员总数 相应的位置。 AI聘用率是使用整体聘用率方法计算的,但仅考虑归类为AI人才的成员。的 相对人工智能人才招聘率同比比率是指人工智能招聘率相对于同期整体招聘率的同比变化 国家。 LinkedIn 分享三个月移动平均线。 样本解读:在美国,AI人才招聘占整体招聘的比例同比增长24.7%。 5. 技能渗透 技能基因组 对于任何实体(职业、国家、行业等),技能基因组是 50 种最具特征技能的有序列表(向量) 该实体的。这些最具特色的技能是使用 TF-IDF 算法确定的,该算法降低了普遍存在的技能的排名,这些技能增加了 关于该特定实体(例如,Microsoft Word)的信息很少,并且该特定实体特有的提升技能(例如,人工 智力)。更多详细信息请参阅 LinkedIn 的技能基因组和 LinkedIn-世界银行方法说明。 例如,表 1 详细列出了 2024 年美国技术、信息和媒体行业的技能基因组, 显示 TF-IDF 排名前 20 的技能。 附录| 2026 年人工智能指数报告 ===== 第401页 ===== 401 2024年美国技术、信息和媒体行业的技能基因组 TF-IDF 排名前 20 的技能 TF-IDF 技能等级 技能名称 1 亚马逊网络服务 (AWS) 2 软件即服务 (SaaS) 3 人工智能(AI) 4 Python(编程语言 规格) 5 进入市场策略 6 客户成功 7 大语言模型(LLM) 8 Salesforce.com 9 SQL 10 生成式人工智能 AI技能渗透 该指标通过以下方法衡量给定实体的人工智能技能强度: • LinkedIn 计算给定实体(职业、行业等)中 LinkedIn 成员的所有自我添加技能的频率 从2015年开始。 • LinkedIn 使用 TF-IDF 模型重新加权技能频率,以获得该实体中最具代表性的前 50 项技能。 这 50 种技能构成了该实体的技能基因组。 • LinkedIn 计算所选实体中顶级技能中属于 AI 技能组的技能份额。 解读:人工智能技能渗透率表明人工智能技能在各个职业中的流行程度,或者说人工智能技能的强度。 LinkedIn 会员在工作中使用人工智能技能。例如,工程师职业的前 50 项技能是根据 他们出现在 LinkedIn 会员个人资料中的加权频率。如果工程师拥有的四项技能属于人工智能 技能组,该指标表明人工智能技能在工程师中的渗透率估计为 8%(50 人中有 4 人)。 相对AI技能渗透率 为了能够比较不同国家的技能渗透率,计算了技能基因组并提供了相关的 选择基准(例如,全球平均值)。然后在一个国家和一个国家之间建立一个比率 基准的人工智能技能渗透率,控制职业。 示例解读:一个国家的人工智能技能相对渗透率为1.5,表明人工智能技能的使用频率是该国的1.5倍。 一组重叠职业的基准。 全球比较 为了进行跨国比较,LinkedIn 提供了人工智能技能的相对渗透率,以渗透率总和来衡量 特定国家/地区各职业中每种人工智能技能的占比,除以重叠领域中人工智能技能的全球平均渗透率 样本国家的职业。 示例解读:相对渗透率2表示AI技能在特定国家的平均渗透率是其两倍 同一组职业的全球平均水平。 全球比较:按行业 特定行业按国家/地区划分的相对人工智能技能渗透率提供了深入的部门分解 人工智能技能在各个行业和国家的渗透率。 样本解读:一国教育领域人工智能技能相对渗透率2表示人工智能的平均渗透率 该国的技能水平是该行业同类职业全球平均水平的两倍。 全球比较:按性别 按性别划分的相对人工智能技能渗透率提供了不同国家/地区人工智能技能渗透率的跨国比较 附录| 2026 年人工智能指数报告 ===== 第402页 ===== 第402章 性别。由于每个性别的全球平均值是不同的,因此该指标只能用于比较 每个性别的国家排名,而不是国家内部的跨性别比较。 示例解读:如果一个国家的女性人工智能技能渗透率为1.5,则意味着该国家的女性成员 列出人工智能技能的可能性比所有国家中相同职业的女性平均成员高出 1.5 倍 存在于国家/性别组合中。 全球比较:跨性别 跨性别的相对人工智能技能渗透率允许在内部和跨性别之间进行跨性别比较 全球各国,因为 LinkedIn 将一个国家按性别划分的人工智能技能渗透率与全球平均水平进行比较 不论性别。 6. 人工智能中的女性代表性 女性人工智能人才的比例。 示例解读:全球拥有 AI 工程技能的 AI 人才中,女性比例为 30.5%。 7.人工智能人才迁移 有关移民的数据来自世界银行集团-LinkedIn“数字数据促进发展”合作伙伴关系(参见 https://linkedindata. worldbank.org/ 和 Zhu 等人。 (2018))。 LinkedIn 迁移率源自 LinkedIn 会员的自我识别位置 配置文件。例如,当 LinkedIn 会员将其位置从巴黎更新到伦敦时,这将被视为迁移。迁移 数据从 2019 年开始提供。 LinkedIn 数据为各国提供了有关因移民趋势而增加或流失的人工智能人才的见解。 AI人才移民为所有人考虑 具有 AI 技能/在时间“t”持有 AI 工作的成员,A 国为感兴趣国家,B 国为资金流入来源地, 资金流出的目的地。因此,A国和B国之间的人工智能人才净迁移将计算如下: 净流量定义为给定时间段内的总到达量减去出发量。 LinkedIn 会员资格因国家/地区而异, 这使得解释成员从一个国家到另一个国家的绝对流动成为一项挑战。因此,移民流量是 对每个国家进行标准化。例如,对于 A 国,所有流入和流出 A 国的绝对净流量,无论 始发国和目的地国,根据每年年底 A 国的 LinkedIn 会员资格进行标准化, 乘以 10,000。因此,该指标表明从所有国家进出国家 A 的相对人才迁移。 注:最小值 已应用阈值以确保转换具有足够的样本量。 样本解释:相对于其会员规模,美国的人工智能人才净流量为正,每人净流量为 1.07 10,000 名会员。 8. 职业转变为人工智能工作 LinkedIn 考虑了人工智能职业的来源职业,分析了向人工智能转型的比例 五年期间的职业汇总。职业转变是通过汇总会员级别来计算的 工作从一种职业转换到该成员以前未从事过的另一种职业。领英 不包括新毕业生添加的第一个职业和职业内部转换。 样本解读:在美国,26.9% 的 AI 工程师转型来自于软件工程师,其次是 13.3% 来自数据科学家。 9. 增长最快的人工智能职业 该指标根据人工智能人才的逐年变化,确定了按国家/地区划分的每个人工智能人才细分市场中增长最快的职业。 职业份额。对于每个职业,LinkedIn 将同比增长率计算为所占比例的百分比变化 列出人工智能职业与一年前同月相比的成员。 示例解读:在美国,AI产品经理是AI工程中增长最快的职业之一 细分市场,同比增幅最大。 10.人工智能技能扩散指数 AI 技能扩散指数衡量 LinkedIn 会员群中 AI 技能采用的广度和深度。它捕捉到 (i) 某一特定人工智能技能群体在一个国家的成员中的广泛程度,以及 (ii) 所代表的人工智能技能集的多样性 成员个人资料上的内容属于该组。该指数是通过跟踪在网站上列出至少一项人工智能技能的会员比例来构建的 附录| 2026 年人工智能指数报告 ===== 第403页 ===== 403 他们的个人资料根据特定国家观察到的不同人工智能技能的多样性进行了调整。值相对于基准期进行索引 在国家一级达到成员门槛,从而确保各国之间和长期的稳定性和可比性。 时间序列中任意点的最终指数值反映了具有该 AI 技能组的成员的调整后份额有多少 相对于基线有所增加。由于该指数已标准化为早期参考点,因此最好将其解释为衡量 扩散的增长而不是水平或渗透率的增长。 示例解读:在美国,人工智能工程的人工智能技能扩散指数表明,调整后的 列出 AI 素养技能的会员数量比 2023 年 3 月增加了 1075 倍。 致谢 LinkedIn 衷心感谢 Murat Erer 和 Carl Shan 在开发这些方法和指标方面所做的贡献,并且 来自 OECD.AI、斯坦福以人为本人工智能研究所、世界银行和国家研究中心的合作者的反馈 Inteligencia 人工(Cenia)。 国际机器人联合会 (IFR) 机器人安装部分中提供的数据来自《2025 年世界机器人》报告。 被引作品 Aldasoro, I.、Gambacorta, L.、Rozalia, P.、Revoltella, D.、Weiss, C. 和 Wolski, M.(2026 年,2 月 17 日)。人工智能如何影响生产力 以及欧洲的就业机会。经济政策研究。 https://cepr.org/voxeu/columns/how-ai-affecting-productivity-and-jobs-europe 阿诺德,Z. 和墨菲,B. (2021)。了解中国政府引导基金。 https://cset.georgetown.edu/wp-content/ uploads/CSET-理解-中国-政府-指导-基金.pdf Arnon, A.(2025 年 9 月 8 日)。生成式人工智能对未来生产力增长的预计影响。宾夕法尼亚沃顿商学院预算模型。 https://budgetmodel.wharton.upenn.edu/p/2025-09-08-the-projected-impact-of-generative-ai-on-future-productivity-growth/ Becker, J.、Rush, N.、Barnes, E. 和 Rein, D. (2025)。衡量 2025 年初人工智能对经验丰富的开源开发人员的影响 生产力。 https://arxiv.org/abs/2507.09089v2 Beraja, M.、Peng, W.、Yang, D. Y. 和 Yuchtman, N. (2024)。政府作为人工智能领域的风险投资家(工作文件第 32701 号)。全国 经济研究局。 https://www.nber.org/system/files/working_papers/w32701/w32701.pdf Bick, A.、Blandin, A. 和 Deming, D. J.(2025 年,11 月 13 日)。 2025 年生成式人工智能的采用状况。联邦储备银行。 https:// www.stlouisfed.org/on-the-economy/2025/nov/state-generative-ai-adoption-2025 比克,A.,布兰丁,A.,&戴明,D.J.(2026)。生成式人工智能的快速采用。管理科学。 https://doi.org/10.1287/ mnsc.2025.02523 Brynjolfsson, E.(2026 年,2 月 15 日)。人工智能生产力的腾飞终于可见。 https://www.ft.com/content/4b51d0b4-bbfe-4f05- B50A-1D485D419DC5 Brynjolfsson, E.、Chandar, B. 和 Chen, R. (2025)。煤矿里的金丝雀?关于近期人工就业影响的六个事实 情报。斯坦福数字经济实验室。 https://digiteconomy.stanford.edu/app/uploads/2025/12/CanariesintheCoalMine_ 11月25日.pdf Brynjolfsson, E.、Li, D. 和 Raymond, L. (2025)。生成式人工智能在工作中。经济学季刊,140(2), 889–942。 https://doi. org/10.1093/qje/qjae044 Brynjolfsson, E.、Collis, A.、Eggers, F.、Kazinnik, S. 和 Nguyen, D. (2026)。生成式人工智能的价值是什么?可在SSRN获取:https:// ssrn.com/abstract=6569938 Cui, K. Z.、Demirer, M.、Jaffe, S.、Musolff, L.、Peng, S. 和 Salz, T. (2025)。生成式人工智能对高技能工作的影响:证据 来自软件开发人员的三个现场实验。 https://economics.mit.edu/sites/default/files/inline-files/draft_copilot_ 实验.pdf 埃克哈特,S.,&戈尔德施拉格,N.(2025)。人工智能和就业:最终决定(直到下一个)。 https://eig.org/wp-content/uploads/2025/08/ EIG-AI-and-Jobs.pdf Felten, E.、Raj, M. 和 Seamans, R. (2021)。职业、行业和地理接触人工智能的情况:一个新颖的数据集 及其潜在用途。战略管理杂志,42(12),2195–2217。 https://doi.org/10.1002/smj.3286 Filippucci, F.、Gal, P.、Laengle, K. 和 Schief, M. (2025)。七国集团经济体中人工智能带来的宏观经济生产率提高。 经合组织出版。 https://doi.org/10.1787/a5319ab5-en Frank, M. R.、Sabet, A. J.、Simon, L.、Bana, S. H. 和 Yu, R. (2026)。在 ChatGPT 之前,与人工智能相关的工作岗位恶化。高温 ===== 第404页 ===== 404 绝对/2601.02554v1 Gimbel, M.、Kinder, M.、Kendall, J. 和 Lee, M. (2025)。评估人工智能对劳动力市场的影响:现状。的 耶鲁大学预算实验室。 https://budgetlab.yale.edu/research/evaluating-impact-ai-labor-market-current-state-affairs 何财 J. 和谢 C. (2025)。会计领域的人类+人工智能:来自该领域的早期证据。 https://www.gsb.stanford.edu/faculty-research/ 工作文件/人类人工智能会计早期证据领域 Hosseini, S. M. 和 Lichtinger, G. (2025)。生成式人工智能作为有资历偏见的技术变革:来自美国简历和工作的证据 发布数据。 https://www.alejandrobarros.com/wp-content/uploads/2025/11/ssrn-5425555.pdf Ju, H. 和 Aral, S. (2025)。与人工智能代理协作:关于团队合作、生产力和绩效的现场实验。 https://arxiv.org/ 绝对/2503.18238v3 Massenkoff, M.、Lyubich, E.、McCrory, P.、Appel, R. 和 Heller, R. (2026)。人择经济指数报告:学习曲线。 人为的。 https://cdn.sanity.io/files/4zrzovbb/website/4053bf3440c0c85b8852052770c5b4cf882689c3.pdf Misra, A.、Wang, J.、McCullers, S.、White, K. 和 Ferres, J. L. (2025)。衡量人工智能扩散:人口归一化指标 跟踪全球人工智能使用情况 (arXiv:2511.02781)。 arXiv. https://doi.org/10.48550/arXiv.2511.02781 诺德豪斯,W. (2004)。美国经济中的熊彼特利润:理论与测量(No. W10433;p. w10433)。全国 经济研究局。 https://doi.org/10.3386/w10433 Reimers, I. 和 Waldfogel, J. (2026)。人工智能与创意产品的数量和质量:法学硕士是否促进了有价值的创造 书? (工作文件第 34777 号)。国家经济研究局。 https://doi.org/10.3386/w34777 Shao, Y.、Zope, H.、Jiang, Y.、Pei, J.、Nguyen, D.、Brynjolfsson, E. 和 Yang, D. (2025)。人工智能代理的未来:审计自动化 以及美国劳动力队伍的增强潜力。 https://arxiv.org/abs/2506.06576v3 Shen, J. H. 和 Tamkin, A. (2026)。人工智能如何影响技能形成。 https://arxiv.org/abs/2601.20245v2 Yotzov, I.、Barrero, J. M.、Bloom, N.、Bunn, P.、Davis, S.J.、Foster, K.M.、Jalca, A.、Meyer, B. H.、Mizen, P.、Navarrete, M. A.、Smietanka, P.、Thwaites, G. 和 Wang, B. Z. (2026)。关于人工智能的固定数据(工作文件第 34836 号)。国家经济研究局。 https://doi. 组织/10.3386/w34836 附录| 2026 年人工智能指数报告 ===== 第405页 ===== 405 第五章:科学 人工智能出版物分析 为了量化整个自然科学领域人工智能相关研究的增长,人工智能指数团队使用以下方法进行了文献计量分析: Web of Science 核心合集(高级检索)。对于每个学科组——化学、材料科学、物理学、天文学、 生物学、神经科学、医学、地球科学、大气和海洋科学以及环境科学——该团队构建 结合人工智能相关主题搜索词的查询(TS =“机器学习”、“深度学习”、“人工智能”、“神经网络”) 网络*、”“基础模型*”、“大语言模型*”和“生成人工智能”)以及相应的 Web of Science 主题 类别(WC)。结果仅限于文章(DT =“文章”)。对于每个查询,该团队通过以下方式获得了年度出版物数量 访问完整的出版年份分布并导出表,并运行组合所有主题类别的聚合查询 评估总体趋势。所有检索均于 2026 年 3 月 20 日进行。 被引作品 艾伦,A.,马尔库,S.,特布特,W.,雷奎玛,J.,布鲁因斯玛,W.P.,安德森,T.R.,赫尔佐格,M.,莱恩,ND,钱特里,M.,霍斯金, J.S.和特纳,R.E.(2025)。端到端数据驱动的天气预报。自然,641(1172–1179)。 https://doi.org/10.1038/s41586-025- 08897-0 Angeloudi, E.、Audenaert, J.、Bowles, M.、Boyd, B. M.、Chemaly, D.、Cherinka, B.、Ciucă, I.、Cranmer, M.、Do, A.、Grayling, M.、Hayes, E. E.、Hehir, T.、Ho, S.、Huertas-Company, M.、Iyer, K. G.、Jablonska, M.、Lanusse, F.、Leung, H. W.、Mandel, K.、… Wu, J. F.(日期不详)。的 多模态宇宙:利用 100 TB 天文科学数据实现大规模机器学习。 arXiv. https://doi.org/10.48550/ arXiv.2412.02527 Asanjan, A. A.、Alexander, O.、Berg, T.、Peng, S.、Makki, J.、Zhang, C.、Yang, M.、Shidham, D.、Chakraborty, S.、Bender, W.、Crawford, C.、Ravindran, A.、Raiman, O.、Potere, D. 和 Bell, D. (2026)。 GAIA:可操作大气动力学的基础模型 (arXiv:2505.18179)。 arXiv. https://doi.org/10.48550/arXiv.2505.18179 Avsec, Ž.、Latysheva, N.、Cheng, J.、Novati, G.、Taylor, K. R.、Ward, T.、Bycroft, C.、Nicolaisen, L.、Arvaniti, E.、Pan, J.、Thomas, R., Dutordoir, V.、Perino, M.、De, S.、Karollus, A.、Gayoso, A.、Sargeant, T.、Mottram, A.、Wong, L. H.、… Kohli, P。 (2026)。前进 使用 AlphaGenome 预测调控变异效应。自然,649(8099),1206-1218。 https://doi.org/10.1038/s41586-025-10014-0 Batatia, I.、Benner, P.、Chiang, Y.、Elena, A. M.、Kovács, D. P.、Riebesell, J.、Advincula, X. R.、Asta, M.、Avaylon, M.、Baldwin, W. J.、Berger, F.、Bernstein, N.、Bhowmik, A.、Bigi, F.、Blau, S.M.、Cărare, V.、Cerriotti, M.、Chong, S.、Darby, J. P.、… Csányi, G.(2025)。原子材料化学的基础模型。化学物理杂志,163(184110)。 https://doi. org/10.1063/5.029700610.48550/arXiv.2401.00096 Bonev, B.、Kurth, T.、Mahesh, A.、Bisson, M.、Kossaifi, J.、Kashinath, K.、Anandkumar, A.、Collins, W. D.、Pritchard, M. S. 和 Keller, A. (2025)。 FourCastNet 3:大规模概率机器学习天气预报的几何方法(版本 2)。 arXiv. https:// doi.org/10.48550/ARXIV.2507.12144 Bragg, J.、D’Arcy, M.、Balepur, N.、Bareket, D.、Dalvi, B.、Feldman, S.、Haddad, D.、Hwang, J. D.、Jansen, P.、Kishore, V.、Majumder, B. P.、Naik, A.、Rahamimov, S.、Richardson, K.、Singh, A.、Surana, H.、Tiktinsky, A.、Vasu, R.、Wiener, G.、… Weld, D. S. (2025)。阿斯塔基准: 通过科学研究套件对人工智能代理进行严格的基准测试(版本 1)。 arXiv. https://doi.org/10.48550/ARXIV.2510.21652 布兰,A. M.,考克斯,S.,希尔特,O.,巴尔达萨里,C.,怀特,A. D.,&施瓦勒,P。 (2023)。 ChemCrow:增强大语言模型 使用化学工具(版本 5)。 arXiv. https://doi.org/10.48550/ARXIV.2304.05376 Brenowitz, N.D.、Ge, T.、Subramaniam, A.、Manshausen, P.、Gupta, A.、Hall, D.M.、Mardani, M.、Vahdat, A.、Kashinath, K. 和 Pritchard, 硕士(2025)。瓶子里的气候:建立公里级全球大气的生成基础模型(版本 2)。 arXiv. https://doi.org/10.48550/ARXIV.2505.06474 Brixi, G.、Durrant, M.G.、Ku, J.、Poli, M.、Brockman, G.、Chang, D.、Gonzalez, G. A.、King, S. H.、Li, D. B.、Merchant, A. T.、 Naghipourfar, M.、Nguyen, E.、Ricci-Tam, C.、Romero, D. W.、Sun, G.、Taghibakshi, A.、Vorontsov, A.、Yang, B.、Deng, M.、… Hie, B. L. (2025)。跨所有领域的基因组建模和设计 ===== 第406页 ===== 406 乔杜里,K.(2025)。 ChatGPT Material Explorer:材料科学定制 GPT 助手的设计和实现 应用程序。整合材料和制造创新,14(3), 276–283。 https://doi.org/10.1007/s40192-025-00410-9 Chung, D. J. H.、Gao, Z.、Kvasiuk, Y.、Li, T.、Münchmeyer, M.、Rudolph, M.、Sala, F. 和 Tadepalli, S.C. (2025)。理论物理 基准 (TPBench) - 理论物理中人工智能推理能力的数据集和研究 (arXiv:2502.15815)。 arXiv. https://doi. org/10.48550/arXiv.2502.15815 丁 K.、于 J.、黄 J.、杨 Y.、张 Q. 和陈 H. (2025)。 SciToolAgent:知识图驱动的科学代理 多工具集成。自然计算科学,5(10), 962–972。 https://doi.org/10.1038/s43588-025-00849-y Dorkenwald, S.、Matsliah, A.、Sterling, A. R.、Schlegel, P.、Yu, S.、McKellar, C. E.、Lin, A.、Costa, M.、Eichler, K.、Yin, Y.、Silversmith, W.、Schneider-Mizell, C.、Jordan, C.S.、Brittain, D.、Halageri, A.、Kuehner, K.、Ogedengbe, O.、Morey, R.、Gager, J.、... Zandawala, M. (2024)。成人大脑的神经元接线图。自然,634(8032),124–138。 https://doi.org/10.1038/s41586-024-07558-y Elhamod, M.、Khurana, M.、Manogaran, H. B.、Uyeda, J. C.、Balk, M. A.、Dahdul, W.、Bakış, Y.、Bart, H. L.、Mabee, P。 M.、拉普、H.、 Balhoff, J. P.、Charpentier, C.、Carlyn, D.、Chao, W.-L.、Stewart, C. V.、Rubenstein, D. I.、Berger-Wolf, T. 和 Karpatne, A. (2023)。 使用系统发育引导的神经网络从图像中发现新的生物特征(版本 1)。 arXiv. https://doi.org/10.48550/ ARXIV.2306.03228 Fahsbender, E.、Andersson, A.、Ash, J.、Binder, P.、Burkhardt, D.、Chang, B.、Gerber, G.K.、Gitter, A.、Godau, P.、Gupta, A.、Haliburton, G.、He, S.、Ideker, T.、Jelic, I.、Khan, A.、Kim, Y.-J.、Krishnapriyan, A.、Laurent, J. M.、Liu, T.、… Kalantar, K. (2025)。基准测试和 生物学中人工智能模型的评估:CZI 虚拟细胞研讨会(第 2 版)的结果和建议。 arXiv. https://doi. org/10.48550/ARXIV.2507.10502 Ghafarollahi, A. 和 Buehler, M. J. (2024)。 ProtAgents:通过大语言模型多智能体协作结合发现蛋白质 物理学和机器学习(版本 1)。 arXiv. https://doi.org/10.48550/ARXIV.2402.04268 Gottweis, J.、Weng, W.-H.、Daryin, A.、Tu, T.、Palepu, A.、Sirkovic, P.、Myaskovsky, A.、Weissenberger, F.、Rong, K.、Tanno, R.、Saab, K., Popovici, D.、Blum, J.、Zhang, F.、Chou, K.、Hassidim, A.、Gokturk, B.、Vahdat, A.、Kohli, P.、… Natarajan, V. (2025)。迈向人工智能合作 科学家(arXiv:2502.18864)。 arXiv. https://doi.org/10.48550/arXiv.2502.18864 Gu, J.、Stevens, S.、Campolongo, E.G.、Thompson, M.J.、Zhang, N.、Wu, J.、Kopanev, A.、Mai, Z.、White, A.E.、Balhoff, J.、Dahdul, W.,鲁宾斯坦,D.,拉普,H.,伯杰-沃尔夫,T.,赵,W.-L.,和苏,Y。 (2025)。 BioCLIP 2:缩放分层的新兴属性 对比学习(arXiv:2505.23883)。 arXiv. https://doi.org/10.48550/arXiv.2505.23883 郭Z.,王J.,凌F.,魏W.,岳X.,江Z.,徐W.,罗J.-J.,程L.,Ham,Y.-G.,宋F.,Gentine,P.,山形T., 费本、张文、顾X、李成、王Y、陈T、……白L.(2025)。用于气候科学的自我进化人工智能代理系统(版本 3)。 arXiv. https://doi.org/10.48550/ARXIV.2507.17311 Heiskanen, J.、Brümmer, C.、Buchmann, N.、Calfapietra, C.、Chen, H.、Gielen, B.、Gkritzalis, T.、Hammer, S.、Hartman, S.、Herbst, M., Janssens, I. A.、Jordan, A.、Juurola, E.、Karstens, U.、Kasurinen, V.、Kruijt, B.、Lankreijer, H.、Levin, I.、Linderson, M.-L....Kutsch, W. (2022)。欧洲综合碳观测系统。美国气象学会公报,103(3),E855–E872。 https://doi.org/10.1175/BAMS-D-19-0364.1 Herzog, H.、Bastani, F.、Zhang, Y.、Tseng, G.、Redmon, J.、Sablon, H.、Park, R.、Morrison, J.、Buraczynski, A.、Farley, K.、Hansen, J.、 豪,A.,约翰逊,P。 A.,奥特利,M.,施密特,T.,皮特尔卡,H.,达斯皮特,S.,拉特纳,R.,威廉,C.,… Beukema,P。 (2025)。奥尔莫地球: 用于多模式地球观测的稳定潜像建模(版本 1)。 arXiv. https://doi.org/10.48550/ARXIV.2511.13655 Holzschuh, B.、Liu, Q.、Kohl, G. 和 Thuerey, N. (2025)。 PDE-Transformer:用于物理模拟的高效多功能变压器 (arXiv:2505.24717)。 arXiv. https://doi.org/10.48550/arXiv.2505.24717 黄K.、张S.、王红.、曲Y.、卢Y.、鲁哈尼Y.、李R.、邱L.、L ===== 第407页 ===== 407 J.,&罗Y。 (2026)。全球变化生态学研究的知识引导机器学习。全球变化生物学,32(2),e70742。 https://doi.org/10.1111/gcb.70742 约瑟夫,S.A.,侯赛因,S.M.,奥夫纳,S.S.R.,朱诺,S.,托里,P.,博尔顿,A.S.,法里亚斯,J.P.,加夫尼,N.,杜雷特,G.,和李,J.J. (2025)。 AstroVisBench:天文学科学计算和可视化的代码基准(arXiv:2505.20538)。 arXiv. https://doi. org/10.48550/arXiv.2505.20538 荣格,H.,阿米尼,M.,亨特,B.J.,墨菲,E.I.,萨迪尔,P.,哈尔琴科,Y。 O.,Petre,B.,Miao,Z.,Kragel,P。 A.,Han,X.,Heilicher,M.O., Sun, M.、Collins, O. G.、Lindquist, M. A. 和 Wager, T. D. (2025)。 Spacetop:统一自然过程的多模态 fMRI 数据集 具有丰富的实验任务。科学数据,12(1), 1465。 https://doi.org/10.1038/s41597-025-05154-x Kao, C. H.、赵, W.、Revankar, S.、Speas, S.、Bhagat, S.、Datta, R.、Phoo, C. P.、Mall, U.、Vondrick, C.、Bala, K. 和 Hariharan, B. (2025)。 迈向地球观测法学硕士代理(版本 2)。 arXiv. https://doi.org/10.48550/ARXIV.2504.12110 Kazemian, A.、Elmoznino, E. 和 Bonner, M. F. (2025)。卷积架构是从头开始与皮质对齐的。自然机器 情报,7(11),1834–1844。 https://doi.org/10.1038/s42256-025-01142-3 Khan,R. 和 Sharma,P。 (2025)。支持人工智能的智能灌溉,促进气候适应型农业。 SHS 会议网络,216, 01005。 https://doi.org/10.1051/shsconf/202521601005 Kim, H., Li, C., Deng, W., Jin, M., Huang, W., Lu, M., & Yuan, B. (2025)。 CLIMATEAGENT:复杂的多代理编排 气候数据科学工作流程(版本 1)。 arXiv. https://doi.org/10.48550/ARXIV.2511.20109 Koblischke, N.、Jang, H.、Menou, K. 和 Ali-Dib, M. (2025)。 Gravity-Bench-v1:代理重力物理发现的基准 (arXiv:2501.18411)。 arXiv. https://doi.org/10.48550/arXiv.2501.18411 Kratzert, F.、Klotz, D.、Shalev, G.、Klambauer, G.、Hochreiter, S. 和 Nearing, G. (2019)。走向全球性、区域性和地方性的学习 通过机器学习应用于大样本数据集的水文行为。水文学和地球系统科学,23(12), 5089– 5110.https://doi.org/10.5194/hess-23-5089-2019 Levine, D. S.、Shuaibi, M.、Spotte-Smith, E. W. C.、Taylor, M. G.、Hasyim, M. R.、Michel, K.、Batatia, I.、Csányi, G.、Dzamba, M., Eastman, P .、Frey, N.C.、Fu, X.、Gharakhanyan, V.、Krishnapriyan, A. S.、Rackers, J. A.、Raja, S.、Rizvi, A.、Rosen, A. S.、Ulissi, Z.... 伍德,B.M.(2026)。 Open Molecules 2025 (OMol25) 数据集、评估和模型 (arXiv:2505.08762)。 arXiv. https://doi. org/10.48550/arXiv.2505.08762 林 Y .、唐 S.、吕 B.、吴 J.、林 H.、杨 K.、李 J.、夏 M.、陈 D.、阿罗拉 S. 和金 C. (2025)。 Goedel-Prover:前沿模型 用于开源自动定理证明(版本 3)。 arXiv. https://doi.org/10.48550/ARXIV.2502.07640 Linsley, D.、Feng, P. 和 Serre, T. (2025)。更好的人工智能并不意味着更好的生物学模型。认知趋势 科学,S1364661325003493。 https://doi.org/10.1016/j.tics.2025.11.016 刘 L.、周 W.、关 K.、彭 B.、徐 S.、唐 J.、朱 Q.、蒂尔 J.、贾 X.、江 C.、王 S.、秦 Z.、孔 H.、格兰特 R.、 Mezbahuddin, S.、Kumar, V. 和 Jin, Z. (2024)。知识引导的机器学习可以改善碳循环量化 农业生态系统。自然通讯,15(1), 357。 https://doi.org/10.1038/s41467-023-43860-5 罗 E.、贾 J.、熊 Y.、李 X.、郭 X.、于 B.、郝 M.、魏 L. 和张 X. (2025)。对 AI 科学家进行组学数据驱动的基准测试 生物学发现(版本 2)。 arXiv. https://doi.org/10.48550/ARXIV.2505.08341 Marin-Llobet, A.、Lin, Z.、Baek, J.、Aljovic, A.、Zhang, X.、Lee, A. J.、Wang, W.、Lee, J.、Shen, H.、He, Y.、Li, N. 和 Liu, J. (2025)。人工智能 细胞类型特定脑机接口的代理。 https://doi.org/10.1101/2025.09.11.675660 McCabe, M.、Mukhopadhyay, P.、Marwah, T.、Blancard, B. R.-S.、Rozet, F.、Diaconu, C.、Meyer, L.、Wong, K. W. K.、Sotoudeh, H.、Bietti, A.、Espejo, I.、Fear, R.、Golkar, S.、Hehir, T.、Hirashima, K.、Krawezik, G.、Lanusse, F.、Morel, R.、Ohana, R.、… Ho, S. (2025)。海象:A 连续动力学的跨域基础模型 (arXiv:2511.15684)。 arXiv. https://doi.org/10.48550/arXiv.2511.15684 Mehandru, N.、Hall, A.K.、Melnichenko, O.、Dubinina, Y.、Tsirulnikov, D.、Bamman, D.、Alaa, A.、Saponas, S. 和 Malladi, ===== 第408页 ===== 第408章 化学家的专业知识。自然化学,17(7),1027–1034。 https://doi.org/10.1038/s41557-025-01815-x Mirza, A.、Alampara, N.、Ríos-García, M.、Abdelalim, M.、Butler, J.、Connolly, B.、Dogan, T.、Nezhurina, M.、Şen, B.、Tirunagari, S.、Worrall, M., Young, A.、Schwaller, P.、Pieler, M. 和 Jablonka, K.M. (2025)。 ChemPile:用于化学基础模型的 250GB 多样化且精心策划的数据集 (arXiv:2505.12534)。 arXiv. https://doi.org/10.48550/arXiv.2505.12534 Mitchener, L.、Laurent, J. M.、Andonian, A.、Tenmann, B.、Narayanan, S.、Wellawatte, G. P.、White, A.、Sani, L. 和 Rodriques, S. G. (2025)。 BixBench:计算生物学中基于 LLM 的代理的综合基准 (arXiv:2503.00096)。 arXiv. https://doi.org/10.48550/ arXiv.2503.00096 Mitchener, L.、Yiu, A.、Chang, B.、Bourdenx, M.、Nadolski, T.、Sulovari, A.、Landsness, E. C.、Barabasi, D. L.、Narayanan, S.、Evans, N.、Reddy, S., Foiani, M.、Kamal, A.、Shriver, L.P.、Cao, F.、Wassie, A.T.、Laurent, J.M.、Melville-Green, E.、Caldas, M.、……White, A.D. (2025)。 Kosmos:人工智能 自主发现科学家(版本 2)。 arXiv. https://doi.org/10.48550/ARXIV.2511.02824 Nduma, R.、Park, H. 和 Walsh, A. (2025)。 Crystalyse:用于材料设计的多功能工具代理。材料科学(arXiv:2512.00977)。 arXiv. https:// doi.org/10.48550/arXiv.2512.00977 Nguyen, T.、Koneru, A.、Li, S. 和 Grover, A. (2025)。 PhysiX:物理模拟的基础模型 (arXiv:2506.17774)。 arXiv. https://doi. org/10.48550/arXiv.2506.17774 Novick, K. A.、Biederman, J. A.、Desai, A. R.、Litvak, M. E.、Moore, D. J. P.、Scott, R. L. 和 Torn, M. S. (2018)。 AmeriFlux 网络:一个联盟 的愿意。农业和森林气象学,249, 444–456。 https://doi.org/10.1016/j.agrformet.2017.10.009 Pantiukhin, D.、Shapkin, B.、Kuznetsov, I.、Jost, A. A. 和 Koldunov, N. (2025)。通过多代理法学硕士系统加速地球科学发现 (版本 1)。 arXiv. https://doi.org/10.48550/ARXIV.2503.05854 Parker, L.、Lanusse, F.、Shen, J.、Liu, O.、Hehir, T.、Sarra, L.、Meyer, L.、Bowles, M.、Wagner-Carena, S.、Qu, H.、Golkar, S.、Bietti, A.、Bourfoune, H.、Casserau, N.、Cornette, P.、Hirashima, K.、Krawezik, G.、Ohana, R.、Lourie, N.、……Ho, S. (2025)。 AION-1:全模式基础模型 天文科学(arXiv:2510.17960)。 arXiv. https://doi.org/10.48550/arXiv.2510.17960 Pastorello, G.、Trotta, C.、Canfora, E.、Chu, H.、Christianson, D.、Cheah, Y.-W.、Poindexter, C.、Chen, J.、Elbashandy, A.、Humphrey, M.、Isaac, P., Polidori, D.、Reichstein, M.、Ribeca, A.、Van Ingen, C.、Vuichard, N.、Zhang, L.、Amiro, B.、Ammann, C.、… Papale, D. (2020)。 FLUXNET2015 数据集和涡流协方差数据的 ONEFlux 处理管道。科学数据,7(1), 225。 https://doi.org/10.1038/s41597-020-0534-3 邱静、施静、娟X、赵志、耿静、刘思、王慧、吴思和王明(2025)。物理超新星:AI特工堪比精英黄金 IPhO 2025(第一版)奖牌获得者。 arXiv. https://doi.org/10.48550/ARXIV.2509.01659 邱S.、郭S.、宋Z.-Y.、孙Y.、蔡Z.、魏J.、罗T.、尹Y.、张H.、胡Y.、王C.、唐C.、常H.、刘Q.、周Z.、张、 T.,张J.,刘Z.,李明,……朱红霞(2025)。 PHYBench:大型语言模型中物理感知和推理的整体评估 (arXiv:2504.16074)。 arXiv. https://doi.org/10.48550/arXiv.2504.16074 Queen, O.、Zhang, H. G. 和 Zou, J. (2025)。 CGBench:临床遗传学研究的基准语言模型科学推理 (arXiv:2510.11985)。 arXiv. https://doi.org/10.48550/arXiv.2510.11985 Riebesell, J.、Goodall, R. E. A.、Benner, P.、Chiang, Y.、Deng, B.、Ceder, G.、Asta, M.、Lee, A. A.、Jain, A. 和 Persson, K. A. (2025)。一个框架 评估机器学习晶体稳定性预测。自然机器智能,7(6), 836–847。 https://doi.org/10.1038/s42256-025-01055-1 罗伊,S.,施穆德,J.,拉尔,R.,高尔,V.,弗雷塔格,M.,库纳特,J.,凯塞尔,T.范,赫格德,D.V.,穆尼奥斯-贾拉米洛,A.,雅库比克,J.,沃斯,E.,曼达尔, K.、Asanjan, A. A.、Almeida, J. L. de S.、Lin, A.、Singh, T.、Yang, K.、Pandey, C.、Hong, J.、……Ramachandran, R. (2025)。 Surya:基础模型 用于太阳物理学(arXiv:2508.14112)。 arXiv. https://doi.org/10.48550/arXiv.2508.14112 Sahoo, S. J.、Maraschin, M.、Levine, D. S.、Ulissi, Z.、Zitnick, C. L.、Varley, J. B.、Gauthier, J. A.、Govindarajan, N. 和 Shuaibi, M. (2025)。公开赛 催化剂 2025 (OC25) 数据 ===== 第409页 ===== 409 Y.,&郭T.(2025)。用于虚拟细胞构建的基于扰动蛋白质组学的基础模型。 https://doi.org/10.1101/2025.02.07.637070 人工智能在研究中的演变解释:主要发现。 (2025)。威利。 https://www.wiley.com/en-de/about-us/ai-resources/ai-study/key- 调查结果/ MICrONS 联盟、Bae, J. A.、Baptiste, M.、Baptiste, M. R.、Bishop, C. A.、Bodor, A. L.、Brittain, D.、Brooks, V.、Buchanan, J.、Bumbarger, D. J.,卡斯特罗,M. A.,塞利,B.,科沃斯,E.,科尔曼,F.,达科斯塔,N.M.,丹斯金,B.,多肯瓦尔德,S.,埃拉巴迪,L.,费伊,P。 G., … 张, C. (2025)。跨越小鼠视觉皮层多个区域的功能连接组学。自然,640(8058),435–447。 https://doi.org/10.1038/s41586- 025-08790-w 上山,M.,高尾,Y.,矢泽,H.,田中,M.,矢吹,H.,熊谷,T.,岩田,H.,阿瓦尔,Md.A.,杜,M.,原园,Y.,畑,Y.,平野,T., Hiura, T.、Ide, R.、Ishida, S.、Ishikawa, M.、Kitamura, K.、Kominami, Y.、Komiya, S.、……Ichii, K.(2025)。 JapanFlux2024 涡流数据集 1990 年至 2023 年覆盖日本和东亚的协方差观测。地球系统科学数据,17(8), 3807–3833。 https://doi.org/10.5194/ essd-17-3807-2025 Vepreva, A.、Razlivina, J.、Eremeeva, M.、Gubina, N.、Orlova, A.、Dmitrenko, A.、Kapranova, K.、Jyakhwo, S.、Vasilev, N.、Sarkisyan, A., Chernyshov, I. Y.、Vinogradov, V. 和 Dmitrenko, A. (2025)。自动化科学信息提取中代理系统的基准测试 ChemX(arXiv:2510.00795)。 arXiv. https://doi.org/10.48550/arXiv.2510.00795 王成.、张Y.、李Y.、胡X.、毛Y.、陈X.、杜平.、王R.、吴Y.、杨H.、李Y.、王B.、穆H.、陈X.、何S.、莫H.、 张L.,杜L.,赵Y.,……刘J.(2025)。 StarWhisper Telescope:用于自动化端到端天文观测的人工智能框架。 通信工程,4(1), 184。 https://doi.org/10.1038/s44172-025-00520-4 王德、程明、余胜、刘志、郭志、李X、刘Q. (2025)。 PaperArena:工具增强代理的评估基准 科学文献推理(第 4 版)。 arXiv. https://doi.org/10.48550/ARXIV.2510.10909 王,E.Y.,费伊,P。 G.、丁 Z.、帕帕多普洛斯 S.、庞德 K.、韦斯 M. A.、张 A.、穆罕默德 T.、帕特尔 S.、丁 Z.、陈 D.、傅 J.、 Schneider-Mizell, C. M.、MICrONS 联盟、Da Costa, N. M.、Reid, R. C.、Collman, F.、Da Costa, N. M.、Franke, K.、… Tolias, A. S. (2025)。 神经活动的基础模型预测对新刺激类型的反应。自然,640(8058),470–477。 https://doi.org/10.1038/s41586-025- 08829-y Wiesner, F.、Wessling, M. 和 Baek, S. (2026)。迈向物理基础模型(arXiv:2509.13805)。 arXiv. https://doi.org/10.48550/ arXiv.2509.13805 吴明、王Y.、明Y.、安Y.、万Y.、陈W.、林B.、李Y.、谢T.和周D. (2025)。 CheMatAgent:增强化学和化学领域的法学硕士 通过基于树搜索的工具学习来学习材料科学(版本 2)。 arXiv. https://doi.org/10.48550/ARXIV.2506.07551 徐文、赵X、周Y、岳X、费B、凌F、张文、白L. (2025)。 EarthSE:评估地球科学探索的基准 法学硕士的能力(版本 3)。 arXiv. https://doi.org/10.48550/ARXIV.2505.17139 Yamada, Y.、Lange, R. T.、Lu, C.、Hu, S.、Lu, C.、Foerster, J.、Clune, J. 和 Ha, D. (2025)。 AI Scientist-v2:车间级自动化科学 通过代理树搜索发现(版本 1)。 arXiv. https://doi.org/10.48550/ARXIV.2504.08066 Ye, C.、Yuan, S.、Cooray, S.、Dillmann, S.、Roque, I. L. V.、Baron, D.、Frank, P.、Martin-Alvarez, S.、Koblischke, N.、Qu, F. J.、Yang, D.、Wechsler, R., &Ciuca,I.(2025)。 ReplicationBench:人工智能代理可以复制天体物理学研究论文吗? (arXiv:2510.24591)。 arXiv. https://doi.org/10.48550/ arXiv.2510.24591 曾Y.、谢J.、上官N.、魏Z.、李W.、苏Y.、杨S.、张C.、张J.、方N.、张H.、卢Y.、赵H.、范J.、余W.、& 杨,Y。 (2025)。 CellFM:针对 1 亿个人类细胞的转录组学进行预训练的大型基础模型。自然通讯, 16(1),4679。 https://doi.org/10.1038/s41467-025-59926-5 Zeni, C.、Pinsler, R.、Zügner, D.、Fowler, A.、Horton, M.、Fu, X.、Wang, Z.、Shysheya, A.、Crabbé, J.、Ueda, S.、Sordillo, R.、Sun, L.、Smith, J., Nguyen, B.、Schulz, H.、Lewis, S.、Huang, C.-W.、Lu, Z.、Zhou, Y.、… Xie, T. (2025)。无机材料设计的生成模型。自然, 639(8055), 624–6 ===== 第410页 ===== 410 第6章:医学 中心法则 人工智能驱动的蛋白质研究出版物数量 以下 PubMed 查询用于检索 2024 年和 2025 年的年度论文总数。下面的查询显示的是 2025 年。 所有论文:(“人工智能”[Mesh] OR“机器学习”[Mesh] OR“深度学习”[Mesh] OR“人工智能”[tiab] 或“机器学习”[tiab] 或“深度学习”[tiab] 或“神经网络*”[tiab] 或“生成人工智能”[tiab] 或“语言模型*”[tiab] 或“AI”[tiab])和 2025[dp]。 功能预测:(“人工智能”[Mesh] OR“机器学习”[Mesh] OR“深度学习”[Mesh] OR“人工 智能”[tiab] 或“机器学习”[tiab] 或“深度学习”[tiab] 或“神经网络*”[tiab] 或“AI”[tiab])AND(“蛋白质 功能”[tiab] 或“功能预测”[tiab] 或“功能注释”[tiab] 或“蛋白质注释”[tiab])和 2025[dp]。 蛋白质结构预测:(“人工智能”[Mesh] OR“机器学习”[Mesh] OR“深度学习”[Mesh] OR “人工智能”[tiab] 或“机器学习”[tiab] 或“深度学习”[tiab] 或“神经网络*”[tiab] 或“AI”[tiab])以及 (“蛋白质结构”[tiab] 或“结构预测”[tiab] 或“蛋白质折叠”[tiab] 或“AlphaFold”[tiab] 或“ESMFold”[tiab] 或 “RoseTTAFold”[tiab])和 2025[dp]。 蛋白质药物相互作用:(“人工智能”[Mesh] OR“机器学习”[Mesh] OR“深度学习”[Mesh] OR“人工 智能”[tiab] 或“机器学习”[tiab] 或“深度学习”[tiab] 或“神经网络*”[tiab] 或“AI”[tiab])AND(“蛋白质- 药物”[tiab] 或“药物靶标”[tiab] 或“结合亲和力”[tiab] 或“分子对接”[tiab] 或“蛋白质配体”[tiab] 或“靶标” 互动*”[tiab]) 和 2025[dp]。 合成蛋白质设计:(“人工智能”[Mesh] OR“机器学习”[Mesh] OR“深度学习”[Mesh] OR“人工 智能”[tiab] 或“机器学习”[tiab] 或“深度学习”[tiab] 或“神经网络*”[tiab] 或“AI”[tiab])AND(“综合 蛋白质”[tiab] 或“蛋白质设计”[tiab] 或“从头蛋白质”[tiab] 或“从头设计”[tiab] 或“蛋白质工程”[tiab])并且 2025[dp]。 关于人工智能药物发现的出版物数量 AI Index 团队在 PubMed 上运行以下搜索查询,将结果限制为 2018 年以来发表的文章。 搜索查询:(“人工智能”[Mesh] OR“机器学习”[Mesh] OR“深度学习”[Mesh] OR“神经网络, 计算机”[Mesh] 或“人工智能”[tiab] 或“机器学习”[tiab] 或“深度学习”[tiab] 或“神经网络*”[tiab] 或“生成式 AI”[tiab] 或“大语言模型*”[tiab] 或“LLM*”[tiab] 或“AI”[tiab])AND(“药物发现”[Mesh] 或“药物 设计”[Mesh] 或“药物发现”[tiab] 或“药物设计”[tiab] 或“药物开发”[tiab] 或“计算机辅助药物设计”[tiab] 或“CADD”[tiab] 或“从头药物设计”[tiab] 或“靶点识别”[tiab] 或“先导化合物优化”[tiab] 或“基于结构的药物” 设计”[tiab]) 关于虚拟细胞模型的出版物数量 AI Index 团队在 PubMed 上运行了下面的搜索查询。 搜索查询:“虚拟细胞”[tiab] 或“虚拟细胞”[tiab] FDA 批准的人工智能医疗设备 FDA 批准的人工智能医疗设备的数据来自 FDA 网站,该网站跟踪人工智能和机器学习 支持学习 (AI/ML) 的医疗设备。 患者对医疗保健领域人工智能的看法 在 PubMed/MEDLINE、Embase 和 Scopus 中进行了全面的文献检索,以确定已发表的实证研究 2020 年 1 月 1 日至 2025 年 12 月 31 日期间,调查了患者、家属或公众对使用人工 医疗保健领域的智能(AI)。搜索策略围绕五个核心概念构建:(1) 临床人工智能 (包括人工智能、机器学习、深度学习、神经网络以及ChatGPT等大型语言模型/ GPT); (2) 明确的患者、家属或公众观点; (3) 医疗保健和临床环境; (4) 人工智能在护理领域的使用或实施;和 (5)实证数据收集方法。 搜索要求在标题或摘要中明确提及人工智能技术,并且仅包含报告主要数据的研究 通过定性、定量或混合方法设计(例如调查、访谈、焦点小组、横断面或 观察性研究)。为了保持对人工智能作为感知对象而不是背景分析工具的关注,研究集中在 关于远程医疗的问题被排除在外。系统回顾 ===== 第411页 ===== 第411章 (十四行诗 4.6)。 搜索策略: 概念 A — 临床人工智能 护理中可能遇到/使用的人工智能技术 • 人工智能 • 机器学习 • 深度学习 • 神经网络 • 生成式人工智能 • 大型语言模型(LLM);聊天GPT; GPT • 临床人工智能 • 预测模型 • 临床决策支持 概念 B — 患者、家庭和公众的观点 仅明确陈述观点 • 患者视角* • 患者感知* • 耐心的态度* • 公众看法* • 公众态度* • 家庭视角* • 护理人员的观点* 概念 C — 医疗保健环境 将检索锚定到临床/医疗环境 • 提供医疗保健/医疗保健 • 医疗保健 • 医学 • 临床护理 • 医疗决策 概念 D——人工智能在护理领域的使用/实施 确保人工智能是实践中使用的感知对象 • 使用/使用过 • 实施 • 部署* • 申请* • 整合 • 互动* 附录| 2026 年人工智能指数报告 ===== 第412页 ===== 第412章 概念 E — 实证研究设计/数据收集 报告主要数据的特权研究 • 调查* • 调查问卷* • 面试* • 焦点小组* • 定性 • 定量 • 混合方法 • 横截面 • 观察性的 排除情况 防止漂移并删除仅供评论的文献 • 远程医疗 • 远程医疗 • 移动医疗/移动医疗 • 系统审查 • 范围审查 • 叙述性回顾 • 文献综述 • 文献综述 核心限制(跨数据库应用) • 出版年份:2020–2025 • 文档类型:仅限实证文章(通过搜索字符串排除排除评论) • 语言:以英语开头(如果需要,可以对非英语进行描述性标注) 搜索字符串于 2026 年 2 月 9 日实施 PubMed(174 篇文章): (((“人工智能”[MeSH 术语] 或“机器学习”[MeSH 术语] 或“深度学习”[MeSH 术语] 或“神经网络” 网络、计算机”[MeSH 术语] 或“人工智能”[标题/摘要] 或“机器学习”[标题/摘要] 或“深度学习” 学习”[标题/摘要] OR “神经网络*”[标题/摘要] OR “生成人工智能”[标题/摘要] OR “大语言模型*”[标题/ 摘要] OR “chatgpt*”[标题/摘要] OR “gpt”[标题/摘要] OR “临床 ai”[标题/摘要] OR “预测模型*”[标题/摘要] 或“临床决策*”[标题/摘要]或“决策支持”[标题/摘要])AND(“使用”[标题/摘要]或“使用”[标题/摘要] 或“实施”[标题/摘要] 或“部署*”[标题/摘要] 或“应用程序*”[标题/摘要] 或“集成”[标题/摘要] 或“互动*”[标题/摘要])AND(“患者视角*”[标题/摘要]或“患者感知*”[标题/摘要]或“患者 态度*”[标题/摘要]或“公众看法*”[标题/摘要]或“公众态度*”[标题/摘要]或“家庭观点*”[标题/ 摘要] 或“护理者视角*”[标题/摘要])AND(“提供医疗保健”[MeSH 术语] 或“医疗保健”[标题/摘要] 或“医疗保健”[标题/摘要] 或“医学”[标题/摘要] 或“临床护理”[标题/摘要] 或“医疗决策”[标题/摘要] 摘要]) AND (“调查*”[标题/摘要] OR “问卷*”[标题/摘要] OR “访谈*”[标题/摘要] OR “焦点小组*”[标题/ 摘要]或“定性”[标题/摘要]或“定量”[标题/摘要]或“混合方法”[标题/摘要]或“交叉方法” 部分”[标题/摘要]或“观察”[标题/摘要])) NOT(“远程医疗”[标题/摘要]或“远程医疗”[标题/摘要]或 “移动健康”[标题/摘要]或“mhealth”[标题/摘要])) NOT(“系统审查”[标题/摘要]或“范围审查”[标题/ 摘要]或“叙述性评论”[标题/摘要]或“文献评论”[标题/摘要]或“文献评论”[标题/摘要]))和 2020/01/01:2025/12/31[日期-发布] 附录| 2026 年人工智能指数报告 ===== 第413页 ===== 第413章 Embase(检索到 239 篇文章): (‘人工智能’/ exp OR ‘机器学习’/ exp OR ‘深度学习’/ exp OR ‘神经网络’/ exp OR ‘人工智能’:ti,ab OR ‘机器学习’:ti,ab OR ‘深度学习’:ti,ab OR ‘神经网络*’:ti,ab OR ‘生成人工智能’:ti,ab OR ‘大语言模型*’:ti,ab OR chatgpt*:ti,ab OR gpt:ti,ab) AND (((((患者和观点*:ti,ab 或患者) AND 感知*:ti,ab 或患者) AND 态度*:ti,ab或公众)和感知*:ti,ab或公众)和态度*:ti,ab或家庭)和观点*:ti,ab或照顾者) AND 观点*:ti,ab AND (‘医疗保健’/ exp OR 医疗保健:ti,ab 或‘医疗保健’:ti,ab 或医学:ti,ab 或‘临床护理’:ti,ab 或‘医疗决策’/ exp) AND (调查*:ti,ab 或问卷*:ti,ab 或访谈*:ti,ab 或‘焦点小组*’:ti,ab 或 定性:ti,ab 或定量:ti,ab 或“混合方法”:ti,ab 或“横截面”:ti,ab 或观察:ti,ab) AND [2020-2025]/ py NOT (telehealth:ti,ab OR telemedicine:ti,ab OR ‘mobile health’:ti,ab OR mhealth:ti,ab) NOT (‘systematic review’:ti,ab OR ‘scoping 评论”:ti,ab 或“叙述性评论”:ti,ab 或“文献评论”:ti,ab 或“文献评论”:ti,ab) Scopus(检索到 368 篇文章): ( TITLE-ABS-KEY (“人工智能”或“机器学习”或“深度学习”或“神经网络*”或“生成人工智能”或 “大语言模型*” OR chatgpt OR gpt ) AND TITLE-ABS-KEY (“患者视角*” OR “患者感知*” OR “患者 态度*”或“公众看法*”或“公众态度*”或“家庭观点*”或“照顾者观点*”)和标题-ABS- 键(“医疗保健”或医疗保健或医学或“临床护理”或“医疗决策”)和标题-ABS-键(调查* 或问卷* 或访谈* 或“焦点小组*”或定性或定量或“混合方法”或“横截面”或 观察))而不是 TITLE-ABS-KEY(远程医疗或远程医疗或“移动医疗”或 mhealth)而不是 TITLE-ABS-KEY( “系统综述”或“范围界定综述”或“叙述性综述”或“文献综述”或“文献综述”)和 PUBYEAR > 2019 年及下半年 < 2026 年 道德考虑 文献计量分析评估了医学人工智能和伦理文献,重点是数据共享、算法共享、生物安全和 全球健康。 AI Index 使用 (1) 主要搜索 PubMed Central 查找 2021 年 1 月至 2025 年 12 月期间的出版物 查询以识别讨论道德的医疗 AI 文章,并在该集合中使用其他过滤器来识别还涉及 (2) 的文章 数据共享,(3) 算法共享,(4) 生物安全,(5) 全球健康。对于由此产生的文章,人工智能指数映射了道德规范 涵盖的主题(参见下面的分类)并将其分为算法、治理或社会问题。 AI 指数对道德出版物使用以下分类法: 算法:偏见、公平、可解释性、误用、双重用途 治理:问责制、透明度、独立审查、监督、隐私、值得信赖 社会:公平、不平等、种族主义、无障碍、自治、正义、社区参与 被引作品 艾布拉姆森,J.,阿德勒,J.,邓格,J.,埃文斯,R.,格林,T.,普里策尔,A.,罗尼伯格,O.,威尔莫尔,L.,巴拉德,A.J.,班布里克,J., 博登斯坦,S.W.,埃文斯,D.A.,洪,C.-C.,奥尼尔,M.,雷曼,D.,Tunyasuvunakool,K.,吴,Z.,泽姆古利特,A.,阿瓦尼蒂,E.,… 杰珀,J.M.(2024)。使用 AlphaFold 3 准确预测生物分子相互作用的结构。自然,630(8016), 493–500。 https://doi.org/10.1038/s41586-024-07487-w Adams, R.、Henry, K. E.、Sridharan, A.、Soleimani, H.、Zhan, A.、Rawat, N.、Johnson, L.、Hager, D.N.、Cosgrove, S.E.、Markowski, A., 克莱因,E.Y.,陈,E.S.,萨希德,M.O.,亨利,M.,米兰达,S.,休斯顿,K.,林顿,R.C.,阿鲁瓦利亚,A.R.,吴,A.W.,和萨里亚,S. (2022)。实施基于 TREWS 机器学习的早期预警后,对患者结果进行前瞻性、多地点研究 脓毒症系统。自然医学,28(7),1455–1460。 https://doi.org/10.1038/s41591-022-01894-0 Adduri, A.K.、Gautam, D.、Bevilacqua, B.、Imran, A.、Shah, R.、Naghipourfar, M.、Teyssier, N.、Ilango, R.、Nagaraj, S.、Dong, M., Ricci-Tam,C.,卡彭特,C.,Subramanyam,V.,温特斯,A.,Tirukkovular,S.,沙利文,J.,Plosky,B.S.,Eraslan,B.,Youngblut, N.D.,……鲁哈尼,Y。 H.(2025)。使用 State 预测细胞对不同背景下的扰动的反应。 https://doi. 或者 ===== 第414页 ===== 第414章 https://doi.org/10.48550/ARXIV.2502.17761 Avsec, Ž.、Latysheva, N.、Cheng, J.、Novati, G.、Taylor, K. R.、Ward, T.、Bycroft, C.、Nicolaisen, L.、Arvaniti, E.、Pan, J.、Thomas, R., Dutordoir, V.、Perino, M.、De, S.、Karollus, A.、Gayoso, A.、Sargeant, T.、Mottram, A.、Wong, L. H.、… Kohli, P。 (2026)。前进 使用 AlphaGenome 预测调控变异效应。自然,649(8099),1206-1218。 https://doi.org/10.1038/s41586-025-10014-0 Bannur, S.、Bouzid, K.、Castro, D.C.、Schwaighofer, A.、Thieme, A.、Bond-Taylor, S.、Ilse, M.、Pérez-García, F.、Salvatelli, V.、Sharma, H.、 Meissen, F.、Ranjit, M.、Srivastav, S.、Gong, J.、Codella, N. C. F.、Falck, F.、Oktay, O.、Lungren, M. P.、Wetscherek, M. T.... Hyland, S. L.(2024)。 MAIRA-2:生成基础放射学报告(版本 2)。 arXiv. https://doi.org/10.48550/ARXIV.2406.04449 Ben Hmido, S.、Abder Rahim, H.、Ploem, C.、Haitjema, S.、Damman, O.、Kazemier, G. 和 Daams, F. (2025)。患者的观点 基于人工智能的手术决策支持。 BMJ 手术、干预和健康技术,7(1),e000365。 https://doi.org/10.1136/ bmjsit-2024-000365 Berger, S. A.、Håland, E. 和 Solbjør, M. (2026)。患者对前列腺癌人工智能工具信任的看法 诊断。定性健康研究,36(2–3), 276–288。 https://doi.org/10.1177/10497323251387545 Blankemeier, L.、Kumar, A.、Cohen, J. P.、Liu, J.、Liu, L.、Van Veen, D.、Gardezi, S. J. S.、Yu, H.、Paschali, M.、Chen, Z.、Delbrouck, J.-B., Reis, E.、Holland, R.、Truyts, C.、Bluethgen, C.、Wu, Y.、Lian, L.、Jensen, M.E.K.、Ostmeier, S.、…Chaudhari, A.S. (2026)。梅林:A 计算机断层扫描视觉-语言基础模型和数据集。自然。 https://doi.org/10.1038/s41586-026-10181-8 Bouladian, S. G.、Ngo, S.、Mastrodicasa, D.、Eng, D.、Khandwala, N.、Sousa, D.、Chaudhari, A. S.、Maron, D. J.、Rodriguez, F., & 桑杜,A.T.(2025)。在非门控胸部 CT 上进行冠状动脉钙机会性筛查后,他汀类药物治疗的持续性。 JACC:心血管影像,18(7), 841–843。 https://doi.org/10.1016/j.jcmg.2025.03.007 Boussina, A.、Shashikumar, S.P.、Malhotra, A.、Owens, R. L.、El-Kareh, R.、Longhurst, C. A.、Quintero, K.、Donahue, A.、Chan, T. C., Nemati, S. 和 Wardi, G. (2024)。深度学习脓毒症预测模型对护理质量和生存的影响。 Npj 数字医学, 7(1), 14. https://doi.org/10.1038/s41746-023-00986-6 Brixi, G.、Durrant, M.G.、Ku, J.、Naghipourfar, M.、Poli, M.、Sun, G.、Brockman, G.、Chang, D.、Fanton, A.、Gonzalez, G. A.、King, S. H., Li, D. B., Merchant, A. T., Nguyen, E., Ricci-Tam, C., Romero, D. W., Schmok, J. C., Taghibakhshi, A., Vorontsov, A., … Hie, B. L. (2026)。使用 Evo 2. Nature 在生命的各个领域进行基因组建模和设计。 https://doi.org/10.1038/s41586-026-10176-5 布罗德,P. G.,巴克利,T.A.,坎吉,Z.,吴,E.,林,E.B.,贾恩,P.,卡布拉尔,S.,阿卜杜尔努尔,R.-E.,海莫维奇,A.D.,弗里德,J.A., Olson, A.、Morgan, D.J.、Hom, J.、Gallo, R.、McCoy, L. G.、Mombini, H.、Lucas, C.、Fotoohi, M.、Gwiazdon, M.、… Rodman, A. (2024)。 大型语言模型在医生推理任务上的超人表现(版本 3)。 arXiv. https://doi.org/10.48550/ ARXIV.2412.10849 Callahan, A.、McElfresh, D.、Banda, J. M.、Bunney, G.、Char, D.、Chen, J.、Corbin, C.K.、Dash, D.、Downing, N.L.、Jain, S.S.、Kotecha, N.、Masterson, J.、Mello, M. M.、Morse, K.、Nallan, S.、Pandya, A.、Revri, A.、Sharma, A.、Sharp, C.、… Shah, N. H. (2024)。站在 FURM ground:评估医疗保健系统中公平、有用和可靠的人工智能模型的框架。 《新英格兰医学杂志》催化剂,5(10)。 https://doi. org/10.1056/CAT.24.0131 Carl, N.、Haggenmüller, S.、Winterstein, J. T.、Nguyen, L.、Wies, C.、Hetz, M. J.、Mangold, M. H.、Grüne, B.、Michel, M. S.、Brinker, T. J.,&Wessels,F.(2025)。患者对医学大语言模型中的同理心、同情心和自我表露的洞察:结果 IPALLM III 研究。世界泌尿外科杂志,43(1), 492。 https://doi.org/10.1007/s00345-025-05872-2 Cherti, M.、Beaumont, R.、Wightman, R.、Wortsman, M.、Ilharco, G.、Gordon, C.、Schuhmann, C.、Schmidt, L. 和 Jitsev, J. (2023)。 用于对比语言图像学习的可重复缩放定律。 2023 IEEE/CVF 计算机视觉与模式会议 认可(CVPR),2818-2829。 https://doi.org/10.1109/CVPR52729.2023.00276 Davis, V. H.、Qiang, J. R.、Adekoya MacCarthy, I.、Howse, D., ===== 第415页 ===== 第415章 罗德里克斯,S.G.(2025)。 Robin:用于自动化科学发现的多代理系统(版本 1)。 arXiv. https://doi.org/10.48550/ ARXIV.2505.13400 Hayes, T.、Rao, R.、Akin, H.、Sofroniew, N. J.、Oktay, D.、Lin, Z.、Verkuil, R.、Tran, V. Q.、Deaton, J.、Wiggert, M.、Badkundri, R.、Shafkat, I.、Gong, J.、Derry, A.、Molina, R. S.、Thomas, N.、Khan, Y.、Mishra, C.、Kim, C.、… Rives, A. (2024)。模拟5亿年 语言模型的进化。 https://doi.org/10.1101/2024.07.01.600583 Hernström, V.、Josefsson, V.、Sartor, H.、Schmidt, D.、Larsson, A.-M.、Hofvind, S.、Andersson, I.、Rosso, A.、Hagberg, O. 和 Lång, K.(2025)。人工乳腺X线摄影筛查乳腺癌的筛查表现及特点 智力试验 (MASAI):一项随机、对照、平行组、非劣效性、单盲、筛选准确性研究。的 柳叶刀数字健康,7(3),e175–e183。 https://doi.org/10.1016/S2589-7500(24)00267-X Holste, G.、Oikonomou, E. K.、Tokodi, M.、Kovács, A.、Wang, Z. 和 Khera, R. (2025)。完整的人工智能超声心动图 多任务深度学习的解释。 《美国医学会杂志》,334(4), 306。 https://doi.org/10.1001/jama.2025.8731 黄 K.、张 S.、王 H.、曲 Y.、卢 Y.、鲁哈尼 Y.、李 R.、邱 L.、李 G.、张 J.、尹 D.、Marwaha, S.、卡特 J. N.、周, X.、Wheeler, M.、Bernstein, J. A.、Wang, M.、He, P.、Zhou, J.、… Leskovec, J. (2025)。 Biomni:通用生物医学人工智能代理。 https://doi.org/10.1101/2025.05.30.656746 Huo, Z.、Fries, J. A.、Lozano, A.、Valanarasu, J. M. J.、Steinberg, E.、Blankemeier, L.、Chaudhari, A. S.、Langlotz, C. 和 Shah, N. H. (2024)。 3D 医学成像的事件时间预训练(版本 2)。 arXiv. https://doi.org/10.48550/ARXIV.2411.09361 Jain, S.、Beazer, J.、Ruffolo, J. A.、Bhatnagar, A. 和 Madani, A. (2025)。 E1:检索增强的蛋白质编码器模型。 https://doi. 组织/10.1101/2025.11.12.688125 Jiang, Y.、Black, K. C.、Geng, G.、Park, D.、Zou, J.、Ng, A. Y. 和 Chen, J. H. (2025)。 MedAgentBench:真实的虚拟 EHR 环境 对医学 LLM 代理人进行基准测试(第 2 版)。 arXiv. https://doi.org/10.48550/ARXIV.2501.14654 金瑞、徐明、孟芳、万贵、蔡清、蒋勇、韩军、陈勇、卢伟、王明、兰志、蒋勇、刘建、王大、 丛 L. 和张 Z. (2025)。 STELLA:迈向具有自我进化多模式代理的生物医学世界模型。 https://doi. 组织/10.1101/2025.07.01.662467 Jumper, J.、Evans, R.、Pritzel, A.、Green, T.、Figurnov, M.、Ronneberger, O.、Tunyasuvunakool, K.、Bates, R.、Žídek, A.、Potapenko, A., 布里奇兰,A.,迈耶,C.,科尔,S.A.A.,巴拉德,A.J.,考伊,A.,罗梅拉-帕雷德斯,B.,尼科洛夫,S.,贾恩,R.,阿德勒,J.,…哈萨比斯,D. (2021)。使用 AlphaFold 进行高度准确的蛋白质结构预测。自然,596(7873),583–589。 https://doi.org/10.1038/s41586-021- 03819-2 Kim, S., Jin, P., Song, S., Chen, C., Li, Y., Ren, H., Li, X., Liu, T., & Li, Q. (2025)。 EchoFM:可推广的基础模型 超声心动图分析。 IEEE 医学成像汇刊,44(10), 4049–4062。 https://doi.org/10.1109/TMI.2025.3580713 Labinsky, H.、Klemm, P.、Graalmann, L.、Thiele, T.、Hornig, J.、Fink, D.、Morf, H.、Mucke, J.、Kiltz, U.、Pecher, A.-C.、Pfeil, A.、Elling- Audersch, C.、Bendzuck, G.、Krusche, M.、Hueber, A. J. 和 Knitza, J. (2025)。患者的经历、态度和概况 风湿病学中的人工智能:德国国家横断面调查研究。国际风湿病学,45(12), 269。 https://doi.org/10.1007/s00296-025-06023-x Levine, D. S.、Shuaibi, M.、Spotte-Smith, E. W. C.、Taylor, M. G.、Hasyim, M. R.、Michel, K.、Batatia, I.、Csányi, G.、Dzamba, M., Eastman, P .、Frey, N.C.、Fu, X.、Gharakhanyan, V.、Krishnapriyan, A. S.、Rackers, J. A.、Raja, S.、Rizvi, A.、Rosen, A. S.、Ulissi, Z.... 伍德,B.M.(2026)。 Open Molecules 2025 (OMol25) 数据集、评估和模型 (arXiv:2505.08762)。 arXiv. https://doi. org/10.48550/arXiv.2505.08762 李浩、张胜、陶立、李新、刘杰 (2025)。中国基于大语言模型的医疗服务接受度:A 全国横断面研究。 BMC 公共卫生,25(1), 4007。 https://doi.org/10.1186/s12889-025-25425-x 刘 H.、朱 Y.、王 Y.、龙 Y.、赖 Z.、于 L. 和赵 C. (2025)。 MedMMV:可控多模态多智能体框架 可靠且可验证的临床推理(版本 1)。 arXiv. ===== 第416页 ===== 第416章 https://doi.org/10.48550/arXiv.2602.02603 Njei,B.,Al-Ajlouni,Y。 A.、Sidney Kanmounye, U.、Boaeng, S.、Loic Nguefang, G.、Njei, N.、Hamouri, S. 和 Al-Ajlouni, A. F. (2026)。 医疗保健研究中的人工智能代理:范围界定审查。 PLOS One,21(2),e0342182。 https://doi.org/10.1371/journal。 电话.0342182 Nong, P., & Ji, M. (2025)。对医疗保健人工智能的期望和信任的作用:了解患者对人工智能将如何影响成本的看法, 访问以及患者与提供者的关系。美国医学信息学协会杂志,32(5), 795–799。 https://doi. org/10.1093/jamia/ocaf031 Notin, P.、Kollasch, A. W.、Ritter, D.、Van Niekerk, L.、Paul, S.、Spinner, H.、Rollins, N.、Shaw, A.、Weitzman, R.、Frazer, J.、Dias, M., Franceschi, D.、Orenbuch, R.、Gal, Y. 和 Marks, D. S. (2023)。 ProteinGym:蛋白质设计和健身的大规模基准 预测。 https://doi.org/10.1101/2023.12.07.570727 Ogu, J. C.、Ozcan, B. B.、Dogan, B. E.、Xi, Y. 和 Knippa, E. E. (2026)。患者对乳腺 X 光检查中人工智能的看法 解释:安全网和学术医院环境的比较调查研究。乳腺癌研究和治疗, 215(1), 25. https://doi.org/10.1007/s10549-025-07870-9 奥马尔,M.,索林,V.,维勒,L.H.,查尼,A.W.,科瓦奇,P.,霍洛维茨,C.R.,科菲亚蒂斯,P.,格利克斯伯格,B.S.,弗里曼,R.,纳德卡尼, G.N. 和巴生 E. (2026)。映射大语言模型对临床记录中的医疗错误信息的敏感性 和社交媒体:横断面基准分析。 《柳叶刀数字健康》,8(1), 100949。https://doi.org/10.1016/j。 土地.2025.100949 Pai, S.、Hadzic, I.、Bontempi, D.、Bressem, K.、Kann, B. H.、Fedorov, A.、Mak, R. H. 和 Aerts, H. J. W. L. (2025)。视觉基础模型 用于计算机断层扫描(版本 2)。 arXiv. https://doi.org/10.48550/ARXIV.2501.09001 Passaro, S.、Corso, G.、Wohlwend, J.、Reveiz, M.、Thaler, S.、Somnath, V. R.、Getz, N.、Portnoi, T.、Roy, J.、Stark, H.、Kwabi-Addo, D.、Beaini, D.、Jaakkola, T. 和 Barzilay, R. (2025)。 Boltz-2:实现准确有效的结合亲和力预测。 https://doi. 组织/10.1101/2025.06.14.659707 Rao, A.、Jensen, M.、Fisher, A. T.、Blankemeier, L.、Berens, P.、Fereydooni, A.、Lirette, S.、Alkan, E.、Kitamura, F.C.、Chaves, J. M. Z.、 雷斯,E.,德赛,A.,威利斯,M.H.,霍姆,J.,约翰斯顿,A.,伦奇克,L.,布廷,R.D.,法里纳,E.M.J.M.,塞尔帕,A.S.,…乔杜里,A. S.(2026)。 Comp2Comp:具有 FDA 批准的计算机断层扫描图像人工智能算法的开源软件 分析(版本 1)。 arXiv. https://doi.org/10.48550/ARXIV.2602.10364 Sandhu, A. T.、Rodriguez, F.、Ngo, S.、Patel, B. N.、Mastrodicasa, D.、Eng, D.、Khandwala, N.、Balla, S.、Sousa, D. 和 Maron, D. J. (2023)。 偶然的冠状动脉钙化:对以前的非门控胸部计算机断层扫描进行机会性筛查以改善 他汀类药物费率(NOTIFY-1 项目)。流通,147(9),703-714。 https://doi.org/10.1161/CIRCULATIONAHA.122.062746 Sau, A.、Pastika, L.、Sieliwonczyk, E.、Palattzoglou, K.、Ribeiro, A. H.、McGurk, K. A.、Zeidaabadi, B.、Zhang, H.、Macierzanka, K., Mandic, D.、Sabino, E.、Giatti, L.、Barreto, S. M.、Camelo, L. D. V.、Tzoulaki, I.、O’Regan, D. P.、Peters, N. S.、Ware, J. S.、Ribeiro, A. L.P., … Ng, F.S. (2024)。用于死亡率和心血管风险估计的人工智能心电图:模型 开发和验证研究。 《柳叶刀数字健康》,6(11),e791–e802。 https://doi.org/10.1016/S2589-7500(24)00172-9 沙班,M.,张,Y.,邱,H.,杨,Y。 Y.,宋A.H.,Jaume,G.,王Y.,Weishaupt,L.L.,丁,T.,Vaidya,A.,Lamane,A.,邵, D.、Zidane, M.、Bai, Y.、McCallum, P.、Luo, S.、Wu, W.、Wang, Y.、Cramer, P.、… Mahmood, F. (2025)。空间基础模型 蛋白质组学(版本 1)。 arXiv. https://doi.org/10.48550/ARXIV.2506.03373 Shah, S. J.、Devon-Sand, A.、Ma, S. P.、Jeong, Y.、Crowell, T.、Smith, M.、Liang, A.S.、Delahaie, C.、Hsia, C.、Shanafelt, T.、Pfeffer, M. A.、Sharp, C.、Lin, S. 和 Garcia, P。 (2025)。环境人工智能抄写员:医生倦怠和对可用性的看法 和文件负担。美国医学信息学协会杂志,32(2), 375–380。 https://doi.org/10.1093/jamia/ 奥卡伊295 Shah, S. J.、Nair, A.、Murtagh, K.、Ma, S.P.、Vogt, K.、Clutter, D.、Sheikh, L.、Schmidt, H.、Smith, ===== 第417页 ===== 第417章 Soh, Z. D., Bai, Y., Yu, K., Zhou, Y., Lei, X., Thakur, S., Lee, Z., Phang, L. C. L., Peng, Q., Xu, C. C., Chong, R. S., Hoang, Q. V., 拉加万,L.,谭,Y。 C.、Sabanayagam, C.、Wu, W.-C.、Ho, M.-C.、He, J.、Gupta, P.、… Cheng, C.-Y。 (2025)。一种综合语言—— 用于初级眼保健中对话诊断和分类的视觉基础模型。细胞报告医学,6(12),102476。https:// doi.org/10.1016/j.xcrm.2025.102476 Swanson, K.、Wu, W.、Bulaong, N. L.、Pak, J. E. 和 Zou, J. (2024)。虚拟实验室:人工智能代理设计新的 SARS-CoV-2 纳米抗体 实验验证。 https://doi.org/10.1101/2024.11.11.623004 OpenFold3 团队。 (2026)。 OpenFold3-preview-2 技术报告。 Tudor, B. H.、Shargo, R.、Gray, G. M.、Fierstein, J. L.、Kuo, F. H.、Burton, R.、Johnson, J. T.、Scully, B. B.、Asante-Korang, A.、Rehman, M.A. 和 Ahumada, L.M. (2025)。对医疗保健应用和使用模式中的人类数字孪生的范围审查。 Npj数字 医学,8(1), 587。 https://doi.org/10.1038/s41746-025-01910-w Vaidya,A.,张,A.,Jaume,G.,宋,A.H.,丁,T.,瓦格纳,S.J.,卢,M.Y.,Doucet,P.,罗伯逊,H.,阿尔马格罗-佩雷斯,C.,陈, R. J.、ElHarouni, D.、Ayoub, G.、Bossi, C.、Ligon, K. L.、Gerber, G.、Le, L. P. 和 Mahmood, F. (2025)。分子驱动基础模型 用于肿瘤病理学(第 1 版)。 arXiv. https://doi.org/10.48550/ARXIV.2501.16652 Van Bon, A. C.、Blauw, H.、Jansen, T. J. P.、Laverman, G. D.、Urgert, T.、Geessink-Mennink, J.、Mulder, A. H.、Out, M.、Groote Veldman, R.,Onvlee,A.J.,Schouwenberg,B.J.J.W.,Vermeulen,M.A.R.,Diekman,M.J.M.,Gerding,M.N.,Van Wijk,J.P。 H.,克拉森, M.、Witkop, M. 和 DeVries, J. H. (2024)。用于治疗 1 型糖尿病的双激素全闭环系统:现实世界 在荷兰进行的多中心、前瞻性、单臂试验。 《柳叶刀数字健康》,6(4),e272–e280。 https://doi.org/10.1016/ S2589-7500(24)00002-5 Vince, O.、Oldach, P.、Pereno, V.、Leung, M. H. Y.、Greco, C.、Minto-Cowcher, G.、Ur-Rehman, S.、Kam, K. Y.。 K.,周,W.,博尔顿,E., Mwambingu, B. R.、Greenhalgh, N. L.、Knot, I. E.、Christoffersen, L.、Clark, M.、Pecoraro, R.、Kollasch, A. W.、Bohnuud, T.、Bakalar, M., …高尔斯,G.(2025)。突破生物学的数据墙:利用全球生物发现将已知的生命树扩大 10 倍以上 管道。 https://doi.org/10.1101/2025.06.11.658620 沃龙佐夫,E.,谢科夫斯基,G.,卡森,A.,维雷特,J.,齐默尔曼,E.,特内霍尔茨,N.,王,Y。 K.、伯恩哈德、J.H.、戈德里奇、R. A.、Retamero, J. A.、Shia, J.、Gonen, M.、Weiser, M. R.、Klimstra, D. S.、Yousfi, R.、Fusi, N.、Fuchs, T. J.、Severson, K. 和 Liu, S. (2025)。 PRISM2:通过临床对话解锁多模式 Ggeneral 病理学 AI(版本 2)。 arXiv. https://doi.org/10.48550/ ARXIV.2506.13063 Vukadinovic, M.、Chiu, I.-M.、Tang, X.、Yuan, N.、Chen, T.-Y.、Cheng, P.、Li, D.、Cheng, S.、He, B. 和 Ouyang, D. (2026)。综合 使用 View Primed 视觉语言 AI 进行超声心动图评估。自然,650(8103),970–977。 https://doi.org/10.1038/s41586-025- 09850-x 瓦哈卜 (Wahab),N. 和拉杰普特 (Rajpoot),N. (2025)。 MPath:从整个幻灯片图像生成多模式病理报告(版本 1)。 arXiv. https:// doi.org/10.48550/ARXIV.2512.11906 Wald, T.、Hamamci, I. E.、Gao, Y.、Bond-Taylor, S.、Sharma, H.、Ilse, M.、Lo, C.、Melnichenko, O.、Schwaighofer, A.、Codella, N. C. F., Wetscherek, M. T.、Maier-Hein, K. H.、Korfiatis, P.、Salvatelli, V.、Alvarez-Valle, J. 和 Pérez-García, F. (2025)。综合语言- 用于 3D 医学图像理解的图像预训练(版本 2)。 arXiv. https://doi.org/10.48550/ARXIV.2510.15042 吴成、张X、张Y、惠慧、王Y、谢W(2025)。通过利用放射学的通才基础模型 网络规模的 2D 和 3D 医疗数据。自然通讯,16(1), 7866。 https://doi.org/10.1038/s41467-025-62385-7 Wu, D.、Haredasht, F. N.、Maharaj, S. K.、Jain, P.、Tran, J.、Gwiazdon, M.、Rustagi, A.、Jindal, J.、Koshy, J. M.、Kadiyala, V.、Agarwal, A.、Tappuni, B.、French, B.、Jesudasen, S.、Cosgriff, C. V.、Chakraborty, R.、Caldwell, J.、Ziolkowski, S.、Iberri, D. J.、… Goh, E. (2025)。 首先,做 NOHARM:迈向临床安全的大语言模型(版本 2)。 arXiv. https://doi.org/10.48550/ARXIV.2512.01241 wwPDB 联盟、Burley, S. K.、Berman, H. M.、Bhikadiya, C.、Bi, C.、Chen, L.、Costanzo, L. D.、Christie, C.、Duarte, J. M.、Dutta, S.、冯、Z.、Gh ===== 第418页 ===== 第418章 陈 R. C. K.、梁 L.、张 X. 和陈 H. (2025)。多模态知识增强的全幻灯片病理学基础模型。 自然通讯,16(1), 11406。 https://doi.org/10.1038/s41467-025-66220-x 叶,C.,贝内加斯,G.,阿尔伯斯,C.,李,J.C.,普里洛,S.,菲尔兹,P。 D.、克拉克,B. 和宋,Y。 S.(2025)。预测跨区域的功能约束 具有系统发育信息的基因组语言模型的进化时间尺度。 https://doi.org/10.1101/2025.09.21.677619 张 J.、坎宁安 J.、布朗 J. 和盖恩比 R. (2022)。基于进化的数学模型显着延长了对 阿比特龙治疗转移性去势抵抗性前列腺癌,并确定进一步改善结果的策略。埃莱夫,11,e76284。 https://doi.org/10.7554/eLife.76284 张,J.,Ubas,A.A.,De Borja,R.,Svensson,V.,Thomas,N.,Thakar,N.,Lai,I.,Winters,A.,Khan,U.,Jones,M.G.,Tran,V., Pangallo, J.、Papalexi, E.、Sapre, A.、Nguyen, H.、Sanderson, O.、Nigos, M.、Kaplan, O.、Schroeder, S....Yu, J. (2025)。太浩湖- 100M:用于上下文相关基因功能和细胞建模的千兆级单细胞扰动图谱。 https://doi. 组织/10.1101/2025.02.20.639398 郑浩,史志,易平。 (2025)。 MedCoAct:具有信心的多智能体协作,以实现完整的临床决策(版本 1)。 arXiv. https://doi.org/10.48550/ARXIV.2510.10461 Zimmermann, E.、Vorontsov, E.、Viret, J.、Casson, A.、Zelechowski, M.、Shaikovski, G.、Tenenholtz, N.、Hall, J.、Klimstra, D.、Yousfi, R., Fuchs, T.、Fusi, N.、Liu, S. 和 Severson, K. (2024)。 Virchow2:缩放病理学中的自监督混合放大模型(版本 3)。 arXiv. https://doi.org/10.48550/ARXIV.2408.00738 附录| 2026 年人工智能指数报告 ===== 第419页 ===== 第419章 第7章:教育 代码.org 接受计算机科学教育 有关计算机科学教育机会的数据来自 Code.org 的《2025 年 AI + CS 教育状况》报告和 附带的交互式仪表板。 AP计算机科学数据 通过与大学理事会签订的协议向 Code.org 提供的 AP 计算机科学数据可以在此处查看。 AP 计算机科学数据取自大学理事会的国家和州摘要报告。 计算研究协会(CRA Taulbee 调查) 计算研究协会 (CRA) 每年向其美国和地区的成员大学分发 Taulbee 调查 收集加拿大有关计算机科学、计算机工程和信息部门的信息。本次使用的数据 该报告来自 2024 年调查,调查结果于 2025 年发布。有关 CRA 方法的更多信息,请 参考他们的报告。 全球K-12人工智能教育 树莓派计算教育研究中心,设在计算机科学与技术系 剑桥大学在布鲁金斯学会 2021 年报告中进行的研究的基础上编制了此数据集 培养生活技能。对数据集进行了一项更改,以澄清美国的某些学校可以开设计算机科学 和地区,并不是所有地方都可以作为选修课。有关 Raspberry 使用的方法的更多信息 Pi计算教育研究中心,请参阅其报告。今年,AI Index 团队更新了由 AI Index 编制的数据集 中心提供截至 2025 年的最新信息。 IPEDS 综合高等教育数据系统 (IPEDS) 结合了美国教育部进行的年度调查 教育国家教育统计中心。 IPEDS 从每所学院、大学以及技术和技术部门收集信息 参加联邦学生经济援助计划的职业机构。 竣工数据 本章使用来自完成调查的数据,该调查收集了完成高等教育的学生人数的数据 教育计划。被认为与人工智能软件相关和人工智能硬件相关的专业的完整列表可以在 2025 年 1 月白宫人工智能人才报告附录 C。 经合组织 本章使用来自 OECD Data Explorer 的数据,特别是来自题为“在校学生、毕业生人数 以及按教育领域划分的新进入者。”该数据集的方法可以在 Education at a Glance 2024 Sources 中找到, 方法论和技术说明。 被引作品 走在时代前沿:美国最大的公立大学系统正在学习人工智能方面的知识。 (2026)。 https://www.calstate.edu/impact-of- the-csu/technology/ai-empowered-csu/Pages/ai-survey.aspx AI人才报告|东航 |白宫。 (2025 年 1 月 15 日)。 https://bidenwhitehouse.archives.gov/cea/writing-materials/2025/01/14/ 人工智能人才报告/ 伯恩斯,M.,温思罗普,R.,路德,N.,维内蒂斯,E.,&卡里姆,R.(2026)。人工智能世界中学生的新方向:繁荣、准备、 保护。布鲁金斯学会。 https://www.brookings.edu/wp-content/uploads/2026/01/A-New-Direction-for-Students-in-an-AI-World-FULL- 报告.pdf Chegg.org (2025)。 Chegg 2025 年全球学生调查。https://www.chegg.org/global-student-survey-2025 大学生对人工智能的看法(2025)。高等教育内部。 https://www.insidehighered.com/news/students/academics/2025/08/29/ 调查大学学生观点人工智能 弗里曼,J.(2025)。 2025 年学生生成式 AI 调查。HEPI。 https://www.hepi.ac.uk/wp-content/uploads/2025/02/HEPI-Kortext- Student-Generative-AI-Survey-2025.pdf 中小学生成式人工智能运用指南(2025年版)|安全与新兴中心 技术(2025)。中国教育部基础教育与教学指导委员会。 https://cset.georgetown。 教育/出版物/ china-school-gen-ai-use-guide-2025/ 附录| 2026 年人工智能指数报告 ===== 第420页 ===== 第420章 Handa, K.、Bent, D.、Tamkin, A.、McCain, M.、Durmus, E.、Stern, M.、Schiraldi, M.、Huang, S.、Ritchie, S.、Syverud, S.、Jagadish, K.、Vo, M.、贝尔 M. 和甘古利 D. (2025)。人择教育报告:大学生如何使用克劳德。 https://www.anthropic.com/news/ 人择教育报告大学学生如何使用克劳德 Joseph Doss, C.、Bozick, R.、Schwartz, H. L.、Chu, L.、Rainey, L. R.、Woo, A.、Reich, J. 和 Dukes, J. (2025)。人工智能在学校的应用很快 增加但指导滞后:兰德调查小组的调查结果|兰德。兰德调查小组。 https://www.rand.org/ pubs/research_reports/RRA4180-1.html Kumar, A. N.(2012 年,7 月 3 日)。计算机科学中刻板印象威胁的研究|第17届ACM年会论文集 计算机科学教育中的创新与技术。第 17 届 ACM 创新与年会论文集 计算机科学教育中的技术。 https://dl.acm.org/doi/10.1145/2325296.2325361 Laird, E.、Dwyer, M. 和 Quay-de la Vallee, H. (2025)。齐头并进:学校对人工智能的接受与学生面临的风险增加有关。 民主与技术中心。 https://cdt.org/wp-content/uploads/2025/10/CDT-2025-Hand-in-Hand-Polling-111225- 无障碍.pdf 麦克莱恩,C.、安德森,M.、西多蒂,O. 和毕肖普,W. (2026)。青少年如何使用和看待人工智能。 https://www.pewresearch.org/wp-content/ uploads/sites/20/2026/02/PI_2026.02.24_Teens-and-AI_REPORT.pdf 学生们在学习生活中谈论人工智能。 (2025)。明天的项目。 https://www.tomorrow.org/resource/2025-national- 报告/ Z 世代的声音:美国年轻人如何看待和使用人工智能。 (2025)。沃尔顿家庭基金会-盖洛普。 https://www. gallup.com/analytics/658901/walton-family-foundation-galup-voices-gen-american-youth.aspx Warner, J. R.、Fletcher, C. L.、Torbey, R. 和 Garbrecht, L. S. (2019)。提高农村地区计算机科学教育能力 通过大规模集体影响模型。第 50 届 ACM 计算机科学教育技术研讨会论文集, 1157–1163。 https://doi.org/10.1145/3287324.3287418 沃森,C.E. 和雷妮,L. (2025)。人工智能的挑战。大学教师如何评估当今时代高等教育的现状和未来 人工智能。伊隆大学想象数字未来中心。 https://dgmg81phhvh63.cloudfront.net/content/user-photos/Research/ PDF/AI_Challenge.pdf Yongpradit, P.、Weissman, H. 和 Ellis, V. (2025)。 2025 年人工智能 + 计算机科学教育现状。 Code.org。 https://drive.google.com/file/d/1p1x- UFVec0fwXOBv2B17j65wiD8KYSvQ/视图 附录| 2026 年人工智能指数报告 ===== 第421页 ===== 第421章 第 8 章:政策与治理 全球人工智能立法记录 今年,人工智能指数与数字政策警报合作,追踪通过成为法律的人工智能相关法案。数字政策警报 如下所述,管道被用来系统地识别和分类人工智能相关立法。最终的人工审核是 由 AI Index 团队进行验证所有包含内容。 概述 人工智能立法跟踪器采用自动化的四阶段管道来系统地识别、分类和提取结构化的 来自 G20 国家人工智能相关立法的信息。该管道结合了自主代理网络爬行 借助基于大语言模型 (LLM) 的文档分析,以最少的手动操作处理数千个候选法律文本 干预。 管道架构 第一阶段:自动源抓取 人工智能驱动的浏览器代理可以导航一组预定义的立法来源网站。对于每个源,代理都会执行 预定义的一组关键字查询——涵盖人工智能、机器学习、算法和其他领域等术语—— 源语言中的相关表达,并收集似乎包含立法内容的页面的 URL。代理 自主运行,处理特定于站点的导航模式,包括分页、cookie 同意对话框、验证码 挑战,以及无需人工干预的搜索过滤器。 第二阶段:初步分类 获取每个收集到的 URL 并提取其全文。然后将该文档提交给大型语言模型(Google Gemini)进行初步相关性评估。该模型确定 (a) 文本是否构成人工智能相关立法以及 (b) 文件类型(例如主要立法、次要法规、战略文件、行政命令)。文档低于a 定义的相关性阈值在此阶段被丢弃。 第三阶段:二级分类 通过相关立法初级分类阶段的文件将进行第二次更精细的法学硕士分析。这张通行证 从每条法律中提取一组结构化字段,包括但不限于: - 立法涵盖的人工智能系统类型 - 受影响的部门(例如医疗保健、金融、公共管理) - 政策目标(例如安全、透明度、问责制、创新促进) - 法律指定的责任机构或监管机构 - 法案或法案编号和正式名称,用于消除重复立法 - 立法状态(例如已颁布、提议、正在审查) 第四阶段:报价提取 最终法学硕士通过识别并提取每个立法文本中的逐字段落——具体条款、定义或条款 证实前面阶段做出的分类决定。这些引述作为链接每个的可审计证据 对其源材料进行结构化注释。 数据存储 管道在服务器上保留以下工件: - 所有访问过的 URL 及其分类结果 - 所有通过一级分类的URL的完整抓取文本(仅用于分类的子页面文本不保留 分别) - 结构化分类字段和提取的报价,以 JSON 格式存储 - 抓取作业元数据,包括源标识符和处理时间戳 美国州级人工智能立法 对于通过法律的人工智能相关法案,人工智能指数在法案全文中搜索“人工智能”关键词 美国所有 50 个州的网站。仅当关键字出现在法案的最终版本中时,法案才被视为已通过法律,而不是 只是介绍的版本。请注意,仅包括 2015 年至 2025 年通过的法律。 AI Index 团队调查了以下内容 数据库: 阿拉巴马州、阿拉斯加州、亚利桑那州、阿肯色州、加利福尼亚州、科罗拉多州、康涅狄格州、特拉华州、佛罗里达州、佐治亚州、夏威夷州、爱达荷州、伊利诺伊州、印第安纳州、 爱荷华州、堪萨斯州、肯塔基州、路易斯安那州、缅因州、马里兰州、马萨诸塞州、密歇根州、明尼苏达州、密西西比州、密苏里州、蒙大拿州、 内布拉斯加州、内华达州、新罕布什尔州、新泽西州、新墨西哥州、纽约州、北卡罗来纳州、北达科他州、俄亥俄州、俄克拉荷马州、俄勒冈州、 宾夕法尼亚州、罗德岛州、南卡罗来纳州、南达科他州、田纳西州、德克萨斯州、犹他州、佛蒙特州、弗吉尼亚州、华盛顿州、西弗吉尼亚州、 威斯康星州、怀俄明州 附录| 2026 年人工智能指数报告 ===== 第422页 ===== 第422章 为了进行更彻底的审查,人工智能指数还包括多州人工智能立法追踪器上列出的与人工智能相关的州法律,即使 他们没有特别提到“人工智能”作为关键词。 美国人工智能监管 本节考察了 2016 年至 2025 年美国监管机构颁布的人工智能相关法规,分析了 法规及其发起机构。为了编译这些数据,人工智能指数对“人工智能”进行了关键词搜索 联邦公报 (Federal Register) 是一个综合性的政府文件存储库,来自超过 436 个机构以及几乎所有机构 美国政府的一个部门。 美国国会听证会 这记录了第 115 届国会(1 月 3 日)美国国会人工智能听证会的证人参与情况 2017年)至第119届国会(截至2025年1月30日)。数据主要从Congress.gov 收集,并在需要时收集 补充有委员会网站和美国政府出版办公室的文字记录。听证会已确定 通过手动、基于关键字的标题和描述搜索(例如“人工智能”、“机器学习”、“算法”) “自动化”、“生成人工智能”),然后手动验证以确保人工智能是听证会的中心焦点。分析单位是 个别证人出庭,在 107 场听证会上提出 425 项意见。对于每次观察,AI Index 都会记录听力- 级别信息(国会会议、日期、姓名、事件编号、序列号、主题)和证人级别属性(例如姓名、 组织和分类隶属关系)。 人工智能的公共投资 人工智能指数分析了欧洲国家和美国的政府人工智能支出,重点关注数据集中的地区。 更容易接近。值得注意的是,该分析可能无法完全代表所有国家或地区,因为可用性和质量 数据可能会有很大差异。此外,虽然此分析包括来自不同国家的政府合同的数据,但它仅 涵盖美国的赠款级支出。这种差异是由于收集可比赠款数据方面的挑战造成的 来自欧盟、中国等其他国家和地区。尽管如此,美国的案例表明, 政府在人工智能方面的部分支出是通过赠款来实现的。随着更多数据的出现,人工智能指数的未来迭代范围将扩大 可用,但现有数据中的差异和差距可能会影响调查结果的全面性和准确性。 数据来源 对于欧洲国家,AI 指数从 Tenders Electronic Daily (TED)(欧洲议会出版办公室)收集了公开招标数据。 欧盟,2024)——专门针对欧洲公共采购的欧盟官方期刊的在线增刊。同时 合同有多种格式,最详细的数据来自批量 XML 下载,其中包括全面的 有关招标程序、发行实体、中标承包商、地块价值、描述、中标日期和共同点的信息 采购词汇 (CPV) 代码。 TED 出版物受欧盟法律门槛管辖:高于特定货币价值的投标, 被视为跨境利益的,必须在 TED 上发布。然而,一些国家也报告了低于阈值的采购, 导致各国的覆盖范围存在差异。 对于英国,数据源包括 TED、Find a Tender、Contracts Finder 和 Contracts Finder Archive。数据来自 苏格兰和威尔士是通过其采购网站的 API 访问的,而北爱尔兰不提供此服务, 需要将其排除在分析之外,并可能导致英国对人工智能的公共投资被低估。 由于 API 限制限制了历史数据访问,AI 指数通过以下方式利用了开放式合同合作伙伴关系的数据注册表: Kingfisher Collect 获取苏格兰和威尔士的综合数据。 美国的合同和 OTA 数据来自 Omari 等人。 (2025) 和来自 FPDS 官方 API。赠款数据为 源自可公开访问的 USAspending 平台,该平台是一个有助于批量下载信息的官方存储库 与合同授予通知和拨款数据相关。虽然该数据集比 TED 数据集包含更长的时间范围,但它是 值得注意的是,数据质量可能会有所不同。此外,美国政府的一项研究 ===== 第423页 ===== 第423章 早些时候,导致估计投资水平出现追溯性通胀。因此,AI Index 团队采用了另一种方法 仅聚合给定奖励程序的每次 AI 比赛后发生的交易,同时控制极端情况 先前解除义务的影响(即及时删除第一笔人工智能交易的第一年6内报告的所有解除义务 每个奖项)。这种方法保留了早期观察到的时间趋势,同时减少了总估计库存 投资,特别是在初始样本期。 分类 使用正则表达式的全文搜索实现了对人工智能相关合同和赠款的分类。人工智能词典是 通过生成与 AI 相关的表达式并合并 Yamashita 等人的“核心”表达式来编译。 (2021)词汇。 此外,Word2Vec 模型通过手动为每个基线表达式添加余弦相似术语来扩展字典。 复习并包含在最终词汇中。这个过程提供了对于识别人工智能至关重要的关键词和共现模式 内容。 分类遵循多步骤方法。最初,正则表达式(regex)匹配合同中识别的人工智能条款 并给予奖励。然后,这些文件被分类为“非人工智能相关”或“人工智能相关”。为了验证人工智能相关的匹配, 采用 BERTopic 模型和预训练的 DeBERTA Transformer 来评估特定 AI 相关主题的概率分数。 相关性得分低于20%的奖项将接受人工评审,而得分较高的奖项则被确认为与人工智能相关。至 为了确保额外的准确性,所有高价值投标也经过人工审核。 6 CFR 法规规定的清仓行动期。 附录| 2026 年人工智能指数报告