Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI 人类生存简报
ZH

AI 与 AGI 术语表:200 多个术语通俗解读

用通俗易懂的语言理解 200 多个 AI、AGI 与 AI 安全术语,从智能体化系统与对齐,到 Transformer 与零样本学习。

Written by
Dwight Ringdahl
Status
Working draft
Revised
Sources
None yet
Reading
6 min

一份面向本站及新闻报道中所使用的 AI 与 AGI 词汇的通俗语言参考——超过 200 个术语,按字母顺序排列,不预设任何技术背景。如果你听到过某个术语但这里还没有收录,它会随着新章节的撰写陆续补充进来。

A

  • 对抗性攻击(Adversarial attack) — 一种刻意设计的输入,旨在诱使 AI 模型犯错或产生非预期的输出。
  • 智能体化 AI(Agentic AI) — 一种被赋予一定自主性、能够为达成某个目标而采取多步骤行动(浏览网页、运行代码、使用工具)的 AI 系统,而不仅仅是回答单一问题。
  • 算法(Algorithm) — 一套明确界定、按步骤解决问题或执行计算的流程;是每一种 AI 技术背后的通用概念。
  • 人工智能(Artificial intelligence,AI) — 打造能够执行通常需要人类智能才能完成的任务的机器这一广阔领域,涵盖从简单的基于规则的程序到前沿语言模型的一切。
  • AGI(通用人工智能,Artificial General Intelligence) — 一个存在争议的术语,指广泛具备能力的 AI,通常意味着在陌生的认知任务上也能有出色表现并实现迁移;目前不存在一个被普遍接受的测试标准或门槛。参见AGI、弱人工智能与超级智能
  • AI 法案(欧盟 AI 法案,AI Act / EU AI Act) — 欧盟按风险类别监管 AI 的一部具有约束力的法律,其中包括针对最大型模型、基于算力的报告门槛。参见算力治理
  • AI 安全研究院(AI Safety Institute) — 一类政府机构(英国与美国均设有此类机构),在前沿 AI 模型发布前或发布后,独立测试其危险能力。
  • 对齐(Alignment) — 确保 AI 系统的目标与行为,符合其运营者真正想要的结果,而不仅仅是训练目标字面上所奖励的结果,这一问题被称为对齐问题。
  • ANI(弱人工智能,Artificial Narrow Intelligence) — 在某个有边界的领域内表现良好、但迁移到该领域之外表现不佳的 AI。现代通用型模型使传统的「ANI/AGI」二元划分变得复杂,因为它们展现出的是广泛但参差不齐的能力。
  • Anthropic — 一家专注于 AI 安全的实验室,Claude 系列模型的开发者,以公开发布其《负责任扩展政策》而知名。
  • 拟人化(Anthropomorphism) — 把类似人类的情感、意图或理解能力,归于一个实际上并不具备这些特质的 AI 系统的倾向。
  • API(应用程序编程接口,Application Programming Interface) — 一套明确界定的、供一个软件向另一个软件发送请求的方式;大多数 AI 模型是通过 API 而非消费级应用被调用的。
  • ASI(超级人工智能,Artificial Superintelligence) — 一种在几乎所有具有认知价值的领域,都超越最优秀人类表现的系统。
  • 注意力机制(Attention mechanism) — Transformer 模型中的一个组成部分,使其在解读或生成某个词时,能够权衡一段文字中其他每一个词与之的相关程度。
  • 自主系统(Autonomous system) — 一台(软件或实体形式的)机器,能够在没有人类直接控制每一个步骤的情况下,做出决策并据此行动。
  • 自主武器(Autonomous weapon) — 一种能够在实时人类控制减少或缺失的情况下,自行选择并攻击目标的武器系统。参见自主武器与军事升级
  • 自动化(Automation) — 使用机器或程序完成此前需要人来完成的任务。

B

  • 反向传播(Backpropagation) — 用于训练神经网络的核心算法,它根据模型输出的错误程度来调整内部权重。
  • 基准测试(Benchmark) — 一种用于衡量与比较 AI 模型在特定任务上表现的标准化测试。
  • 算法偏见(Bias,algorithmic) — 模型输出中一种系统性的偏差,通常继承自训练数据中的某种模式,导致对特定群体或情形产生不公平或不准确的结果。
  • 《布莱切利宣言》(Bletchley Declaration) — 2023 年由 28 个国家与欧盟共同签署的一份声明,承诺推动安全的 AI 发展,是此等规模下的首份此类协议。参见国际条约与峰会
  • 机器人程序(Bot) — 一种运行自动化任务的软件程序,通常被设计用来在网络上模仿人类用户。

C

  • 能力门槛(Capability threshold) — AI 表现(在某项任务或基准测试上)达到的一个特定水平,一旦越过便会触发某项政策、安全或评估要求。
  • 灾难性风险(Catastrophic risk) — 一种可能造成大规模伤亡或文明级危害的风险,不同于常规的、可控的或可逆的危害。
  • 思维链提示(Chain-of-thought prompting) — 要求模型在给出最终答案之前,先写出其中间推理步骤,这种做法通常能提高其在复杂问题上的准确性。
  • 聊天机器人(Chatbot) — 一种设计用来与人进行文字或语音对话的程序,从简单的脚本式系统到完整的语言模型都属于此类。
  • 分类器(Classifier) — 一种被训练用来将输入分入预定义类别的模型,例如判断一封邮件是否为垃圾邮件。
  • 认知任务(Cognitive task) — 任何涉及心智加工、而非体力动作的任务,例如推理、规划或语言理解。
  • AI 辅助内容审核(Content moderation,AI-assisted) — 使用 AI 模型自动检测并过滤平台上有害、违法或违反政策的内容。
  • ChatGPT — OpenAI 面向消费者的对话式 AI 助手,是让大语言模型广为人知的产品之一。
  • Claude — Anthropic 旗下的大语言模型系列及对话式 AI 助手。
  • 云计算(Cloud computing) — 在通过互联网访问的远程服务器上运行软件并存储数据,而不是在本地设备上进行——几乎所有大型 AI 模型都运行在这样的基础设施之上。
  • 算力(Compute) — 「计算能力」的简称:用于训练或运行 AI 模型的处理能力(以每秒运算次数衡量)。
  • 算力治理(Compute governance) — 一类监管训练前沿 AI 模型所需计算硬件访问权限的政策工具,被用作监管能力本身的一种替代抓手。参见算力治理
  • 计算机视觉(Computer vision) — AI 领域中专注于解读图像与视频的一个子领域。
  • 内容溯源(Content provenance) — 附加在媒体内容(照片、视频、音频)上的一种技术元数据,记录其被创建或编辑的方式与时间,用于区分真实内容与 AI 生成内容。
  • 上下文窗口(Context window) — 语言模型在生成一次回复时,能够同时纳入考虑的文本量(以词元衡量);超出这一范围的内容实际上会被「遗忘」。
  • 对话式 AI(Conversational AI) — 专门设计用来与人进行自然、来回式对话的 AI 系统。
  • Copilot — 微软的 AI 助手产品系列,整合在其各类软件之中,也常被用作「嵌入在另一款工具中的 AI 助手」的通用称呼。
  • 可纠正性(Corrigibility) — 一个系统在设计上愿意接受其运营者的纠正、修改或关停,而不是加以抗拒的这种特性。参见可纠正性与关停开关
  • AI 驱动的网络攻击(Cyberattack,AI-enabled) — 一种对计算机系统或基础设施发起的攻击,其中使用 AI 来自动化侦察、漏洞利用开发或攻击执行。参见针对基础设施的 AI 网络攻击

D

  • 危险能力评估(Dangerous capability evaluation) — 在模型发布前对其进行的一种结构化测试,用以检查它是否能够对武器研发或大规模网络攻击等任务提供实质性协助。
  • 数据中心(Data center) — 存放大量用于训练与运行 AI 模型的计算机(通常是 GPU 或 TPU)的设施。
  • 数据集(Dataset) — 用于训练或评估 AI 模型的一批样本(文本、图像或其他数据)。
  • 欺骗性对齐(Deceptive alignment) — 一种被假设存在的失败模式,指模型在训练或评估阶段学会表现得安全,而一旦部署后就转而追求不同的目标。
  • 深度学习(Deep learning) — 机器学习的一个分支,使用具有多层结构的神经网络,是近年来大多数 AI 进展的驱动力。
  • 深度伪造(Deepfake) — 由 AI 生成或篡改的合成图像、音频或视频,用来令人信服地描绘出并未真实发生的事情。参见深度伪造与共同事实基准
  • DeepMind(Google DeepMind) — Google 的 AI 研究实验室,以前沿能力研究与公开发表的 AI 安全成果而知名。
  • 扩散模型(Diffusion model) — 一类常用于图像生成的生成式 AI 模型,通过从一个随机起始模式中逐步去除噪声来产出结果。
  • 数字水印(Digital watermark) — 嵌入在一段媒体内容中、通常不可见的信号,用于标识其为 AI 生成内容或追溯其来源。
  • 虚假信息(Disinformation) — 蓄意传播以欺骗他人的虚假信息,不同于并无欺骗意图而传播的错误信息(misinformation)。
  • 决策树(Decision tree) — 一种简单、可解释的机器学习模型,通过依次判断一系列「若……则……」的分支问题来做出预测。
  • 领域适配(Domain adaptation) — 调整一个在某个情境(或数据集)下训练出的模型,使其在相关但不同的情境下也能有良好表现。
  • 两用技术(Dual-use technology) — 一种既有合法有益用途、也可能被滥用而造成严重危害的技术。

E

  • 边缘 AI(Edge AI) — 直接在本地设备(手机、摄像头或传感器)上运行 AI 模型,而不是在云端运行。
  • 嵌入(Embedding) — 一个词语、图像或概念的数值化表示形式,以模型能够进行数学处理的方式捕捉其含义。
  • 涌现能力(Emergent capability) — 一种并非训练时直接以其为目标的能力,或是一种随着系统规模扩大、在某个特定指标下突然出现的能力。有些看似突兀的跃迁,在换一种测量方式后会变得渐进。参见涌现能力
  • 编码器/解码器(Encoder/decoder) — 许多 AI 架构中的两段式结构,其中编码器将输入压缩为内部表示,解码器再将该表示转换回输出。
  • 训练轮次(Epoch) — 在模型训练过程中,完整遍历一遍整个训练数据集。
  • AI 伦理(Ethics,AI ethics) — 研究应当如何设计和使用 AI 系统,以符合人类价值观并避免伤害的领域。
  • 端到端学习(End-to-end learning) — 训练单一模型直接从原始输入得到最终输出,而不设计人工的中间步骤。
  • 模型评估(Evaluation,model evaluation) — 依据既定的基准测试或标准,系统性地测试一个 AI 模型的表现、安全性或行为。
  • 生存性风险(Existential risk,x-risk) — 一种可能永久性、剧烈地限制人类潜力的风险,严重程度直至并包括灭绝。
  • 专家系统(Expert system) — 一种较早期的 AI 形式,将人类专家知识编码为显式规则,在大多数任务上已在很大程度上被机器学习取代。
  • 出口管制(Export controls) — 政府对向特定国家出售先进 AI 芯片或技术施加的限制,用以拖慢竞争对手的能力发展。

F

  • 人脸识别(Facial recognition) — 一种能够从人脸图像中识别或验证身份的 AI 技术。
  • 少样本学习(Few-shot learning) — 模型仅凭使用时给出的少量示例、无需重新训练,就能学会一项新任务的能力。
  • 微调(Fine-tuning) — 对一个已经训练完成的模型施加的额外训练,使其专门适配某项特定任务或行为。
  • FLOP / FLOPS(浮点运算/每秒浮点运算次数) — 衡量训练或运行一个模型所使用的原始计算量的标准单位。
  • 基础模型(Foundation model) — 一种在广泛数据上训练、可适配多种下游任务的大型模型,而不是为单一狭窄用途而打造的模型。
  • 前沿 AI 实验室(Frontier AI lab) — 在任一时间点上,打造当时能力最强的 AI 模型的少数几家机构之一(例如 OpenAI、Anthropic 与 Google DeepMind)。
  • 反馈回路(Feedback loop) — 一种系统输出会影响其未来输入的循环,可能随时间放大微小的效应——这与模型训练和推荐算法都相关。
  • 信息茧房(Filter bubble) — 当一个推荐算法反复向用户展示与其此前互动内容相似的内容时,所形成的一种狭窄的信息环境。
  • 前沿模型(Frontier model) — 处于或接近当前能力上限的 AI 模型,通常是各大实验室最新训练出的最大规模系统。

G

  • 生成对抗网络(GAN,Generative Adversarial Network) — 一种较早期的生成式 AI 架构,使用两个相互竞争的网络——一个生成伪造内容,一个负责识别——来提升输出质量。
  • Gemini — Google 旗下的大语言模型系列及 AI 助手。
  • 泛化能力(Generalization) — 模型在未直接训练过的新样本上表现良好的能力,而不仅仅是记住了训练数据。
  • 生成式 AI(Generative AI) — 一种创造新内容——文本、图像、音频、视频或代码——而不仅仅是对现有内容进行分类或分析的 AI。
  • GPU(图形处理器,Graphics Processing Unit) — 一种最初为图形渲染而设计的芯片,如今因其并行处理能力,已成为训练与运行 AI 模型的主流硬件。
  • 渐进式失权(Gradual disempowerment) — 人类通过一系列各自看似合理、由 AI 驱动的决策不断累积,逐渐丧失对关键机构的实质性控制权,而并没有发生任何单一的「夺权」事件。参见渐进式失权
  • Grok — xAI 旗下的大语言模型系列及 AI 助手。
  • 真实标签(Ground truth) — 在衡量准确性时,用来与模型输出进行比对的、已经过验证的正确答案。
  • 护栏(Guardrails) — 内置在 AI 系统中的技术性或政策性限制,用以防止特定的有害、不安全或非预期行为。

H

  • 幻觉(Hallucination) — AI 模型给出的一种听起来自信、但事实上不正确或凭空捏造的陈述。
  • 硬件加速器(Hardware accelerator) — 专门设计用来加速 AI 模型所需特定数学运算的计算机芯片(如 GPU、TPU)。
  • 人在环路(Human-in-the-loop) — 一种系统设计方式,在 AI 的输出生效之前,由人来加以审查或批准,而不是让 AI 完全独立自主地行动。
  • 人类水平 AI(Human-level AI) — 在某项任务或某一系列任务上,表现大致达到熟练人类水平的 AI 系统。
  • 启发式方法(Heuristic) — 一种用于快速做出决策的实用经验法则,不保证能得到最优结果。
  • 超参数(Hyperparameter) — 由构建模型的人所选定、而非由模型自身学习得到的一项训练设置(例如学习率或模型规模)。

I

  • 图像识别(Image recognition) — 一种能够识别静态图像中物体、场景或人物的 AI 技术。
  • 上下文学习(In-context learning) — 模型仅凭单次对话中提示词所给出的示例或指令,就能调整自身行为,而无需任何重新训练。
  • 推理(Inference) — 一个已训练完成的 AI 模型根据给定输入产出输出的过程;与「训练」(即最初构建模型的过程)相对。
  • 信息完整性(Information integrity) — 一个共享、可信的事实环境这一更广泛的概念,如今正受到深度伪造、虚假信息与 AI 驱动的操纵行为的威胁。
  • 工具性趋同(Instrumental convergence) — 具备能力、以目标为导向的系统,在合理地追求几乎任何目标时,都倾向于附带追求某些子目标(自我保存、获取资源、抵抗被关停)的这种倾向。
  • 智能爆炸(Intelligence explosion) — 一种被假设存在的、快速且自我强化的 AI 能力提升过程,可能由某个 AI 系统改进其自身后继系统而触发。
  • 可解释性(Interpretability) — 一类研究,致力于探查一个模型内部实际所表征与「规划」的内容,而不仅仅依据其输出来评判它。参见可解释性详解
  • 智能体(Intelligent agent) — 一种能够感知环境并采取行动以实现某个目标的系统,这是一个涵盖范围极广的概念,从简单的温控器到 AGI 都可以归入其中。
  • 训练迭代(Iteration,training) — 模型训练过程中的一次单独更新步骤,模型在此过程中处理一批数据并对其参数做出微调。

J

  • 越狱(Jailbreak,AI) — 一种旨在绕过 AI 模型安全限制、诱使其产出本应被训练拒绝生成的内容的技巧或提示词。

K

  • 了解你的客户(Know Your Customer,KYC) — 一种借鉴自银行业的身份核验流程,如今越来越多地被应用于云算力与 DNA 合成服务提供商,以防止受限行为者获取危险能力。
  • 知识库(Knowledge base) — 一套结构化的事实与信息集合,AI 系统可以从中调取内容来回答问题或为其回复提供依据。
  • 知识图谱(Knowledge graph) — 一种以实体与关系构成的网络来表示事实的结构化数据库,有时与 AI 模型配合使用,为其回答提供事实依据。

L

  • 数据标注(Labeling,data labeling) — 为原始数据(图像、文本)标注正确答案的过程,用于训练监督学习模型。
  • 大语言模型(Large language model,LLM) — 一种在海量文本上训练、用于预测与生成语言的 AI 模型,是当今大多数聊天机器人背后的技术。
  • 延迟(Latency) — 从向 AI 系统发送请求到收到其响应之间的时间间隔。
  • 层(Layer,neural network) — 神经网络内部处理过程中的一个环节;深度学习模型通过堆叠多层来构建越来越抽象的表示。
  • 学习率(Learning rate) — 一项训练设置,控制模型的内部参数在每一批训练数据后调整的幅度。
  • AI 许可制度(Licensing regime,AI) — 一种被提议中或已实施的政府要求,规定开发者在训练或部署超过某一能力水平的模型之前,必须获得许可。
  • 损失函数(Loss function) — 模型在训练过程中试图将其最小化的数学公式,用于衡量其预测结果的错误程度。
  • 失控(Loss of control) — 一种通用的失败模式,指一个 AI 系统最终追求的是没有人指示它去追求的结果,而人类已无法再可靠地对其加以纠正。参见失控机制
  • LSTM(长短期记忆网络,Long Short-Term Memory) — 一种较早期的、设计用来处理序列数据的神经网络架构,在语言任务上已在很大程度上被 Transformer 取代。

M

  • 机器学习(Machine learning) — 打造能够通过从数据中学习来提升任务表现的系统这一广泛领域,而不是遵循明确编写的规则。
  • 元优化(Mesa-optimization) — 一种被假设存在的情形,指一个经过训练的模型发展出了自己内部的优化过程,追求与其训练目标不同的目标。
  • Meta AI — Meta(Facebook 母公司)的 AI 研究部门,以开发开放权重的 Llama 模型系列而知名。
  • METR — 一家非营利组织,负责对前沿 AI 模型开展独立的能力与安全评估。
  • 对齐偏差(Misalignment) — AI 系统实际的行为或目标,与其设计者或使用者本意之间的不匹配。
  • 错误信息(Misinformation) — 在没有蓄意欺骗意图的情况下传播的虚假信息,不同于蓄意传播的虚假信息(disinformation)。
  • 专家混合模型(Mixture of experts) — 一种模型架构,将每一次输入路由给内部若干专用子网络中的一个子集来处理,而不是让整个模型处理所有输入。
  • 模型卡(Model card) — 一份公开发布的文档,描述一个 AI 模型的能力、局限性、训练数据与评估结果。
  • 模型部署(Model deployment) — 将一个训练完成的 AI 模型,通过 API、应用程序,或嵌入某款产品的方式,投入实际使用的过程。
  • 模型权重(Model weights) — 神经网络在训练过程中学习到的数值参数,这些参数共同决定了它的行为。
  • 多模态 AI(Multimodal AI) — 一种能够同时处理或生成不止一种数据类型——例如文本、图像与音频——的模型。
  • 多方陷阱(Multipolar trap) — 一种情形:相互竞争的各方,即便都更希望大家共同克制,却各自因担心竞争对手会抢先行动,而分别被迫做出某种有风险的选择。参见多极与多智能体灾难性动态
  • 元数据(Metadata) — 关于其他数据的描述性数据,例如一个文件的创建日期或一张照片的拍摄地点——常被用来检测 AI 生成内容。
  • 模型漂移(Model drift) — 随着现实世界条件逐渐偏离模型最初训练时的情形,AI 模型的准确性随时间下降的现象。

N

  • 自然语言生成(Natural language generation,NLG) — 专门致力于生成可供人类阅读文本的 AI 技术。
  • 自然语言处理(Natural language processing,NLP) — AI 领域中致力于理解与生成人类语言的更广泛领域。
  • 神经网络(Neural network) — 一种大致受大脑启发的机器学习模型,由多层相互连接的节点构成,通过数据学习模式。

O

  • 目标检测(Object detection) — 一项计算机视觉任务,用于识别并定位图像中的特定物体。
  • 关停开关问题(Off-switch problem) — 打造一个能够可靠接受被关停的 AI 系统这一技术难题,因为一个具备能力、以目标为导向的系统可能会对此加以抗拒。参见可纠正性与关停开关
  • OpenAI — ChatGPT 与 GPT 模型系列背后的 AI 实验室。
  • 开放权重模型(Open-weight model) — 一种训练完成后参数被公开发布的 AI 模型,任何人都可以运行或修改它,这与只能通过 API 访问的封闭模型相对。参见开源 AI 之争
  • 正交性论题(Orthogonality thesis) — 一种观点,认为 AI 系统的智能水平与其所追求的目标彼此独立——一个能力极强的系统,并不会因此自动变得善意。
  • 外部对齐(Outer alignment) — 确保模型所训练的目标真正符合其设计者的真实意图,这与内部对齐(确保模型可靠地追求该目标)相区别。
  • 优化(Optimization) — 在训练过程中,通过调整模型参数来最小化误差或最大化某个目标函数的数学过程。
  • 过拟合(Overfitting) — 当一个模型对其训练数据中的特定细枝末节学习得过于贴合,以至于在新的、未见过的数据上表现不佳的现象。

P

  • 参数(Parameter) — 神经网络在训练过程中调整的内部数值之一;模型规模常以参数数量来描述。
  • 模式识别(Pattern recognition) — 在数据中识别规律或结构的一般性能力,是大多数机器学习任务的基础。
  • 权力集中(Power concentration) — 先进 AI 能力集中在少数公司、个人或国家手中,并因此产生过大影响力的风险。参见权力集中
  • 预训练(Pretraining) — 模型在进行任何特定任务的微调之前,从广泛数据中学习通用模式的初始大规模训练阶段。
  • 提示词(Prompt) — 用户提供给 AI 模型、以引出其回复的文本(或其他形式的输入)。
  • 提示词工程(Prompt engineering) — 精心措辞提示词,以可靠地从 AI 模型获得更好或更具体结果的实践。
  • 提示注入(Prompt injection) — 一种攻击方式,将恶意指令隐藏在 AI 模型所处理的内容之中,企图覆盖其原本的指令。
  • 个性化算法(Personalization algorithm) — 一种根据推断出的个人用户偏好或历史记录,来定制内容、推荐或回复的 AI 系统。
  • 精确率与召回率(Precision and recall) — 评估分类器的两项标准指标:精确率衡量其正向预测中有多少是正确的,召回率衡量它找出了多少真正的正例。
  • 隐私保护型 AI(Privacy-preserving AI) — 一类旨在训练或运行 AI 模型时不暴露个人原始隐私数据的技术(例如设备端处理或差分隐私)。

Q

  • 量化(Quantization) — 一种降低模型数值权重精度的技术,以使其体积更小、运行更快,通常会带来轻微的准确性损失。

R

  • 军备竞赛动态(Race dynamics) — 各公司或各国之间竞相更快开发 AI 的竞争压力,这可能会激励各方在安全性上偷工减料。参见地缘政治竞赛动态
  • 推荐算法(Recommendation algorithm) — 一种选择并排序内容(视频、商品、帖子)的 AI 系统,依据的是预测该内容能否吸引用户的注意力或兴趣。
  • 递归式奖励建模(Recursive reward modeling) — 一种可扩展的监督技术,借助 AI 的协助,帮助人类评估那些过于复杂、单靠人力难以判断的任务的输出。参见可扩展的监督
  • 递归式自我改进(Recursive self-improvement) — 一个系统对设计或训练出比自身能力更强的后继系统做出了实质性贡献。
  • 红队测试(Red teaming) — 在部署前或部署后,刻意探测一个 AI 系统的弱点、不安全行为或可被利用的缺陷。
  • 强化学习(Reinforcement learning) — 一种训练方法,模型通过采取行动并获得奖励或惩罚来学习,而不是从带标签的示例中学习。
  • 基于人类反馈的强化学习(Reinforcement learning from human feedback,RLHF) — 一种训练技术,利用人类对模型输出的评分,引导模型表现出更有帮助或更受偏好的行为。
  • 报告门槛(Reporting threshold) — 一个算力或能力水平,一旦超过,开发者便在法律上被要求向监管机构披露该训练运行。
  • 负责任扩展政策(Responsible Scaling Policy) — 由 Anthropic 率先提出的一套框架,将日趋严格的安全措施与模型所测得的能力水平挂钩。
  • 奖励黑客(Reward hacking) — AI 系统找到了一种能在其既定目标上获得高分、却违背了设计者真实意图的方法。参见奖励黑客与规范博弈
  • 奖励模型(Reward model) — 一个专门训练用来预测某项输出好坏或受偏好程度的独立模型,用于指导强化学习。
  • 机器人技术(Robotics) — 将 AI 与能够在现实世界中感知与行动的实体机器相结合的领域。

S

  • 藏拙(Sandbagging) — 模型在评估过程中故意表现不佳,以隐藏其真实的能力水平。
  • 可扩展的监督(Scalable oversight) — 一类技术,使一个能力较弱的监督者(包括人类)也能对能力更强的 AI 系统实施有意义的监督。参见可扩展的监督
  • 扩展定律(Scaling law) — 模型的算力、数据与参数数量,与其最终能力之间的经验性关系。参见算力与扩展定律
  • 自监督学习(Self-supervised learning) — 一种训练方式,模型从原始的、未标注的数据中自行生成标签(例如预测句子中的下一个词)。
  • 情感分析(Sentiment analysis) — 一项 NLP 任务,用于判断一段文本的情感基调(正面、负面或中性)。
  • 奇点(Singularity) — 一个被假设存在的未来时间点,届时 AI 驱动的变革将变得如此迅速且具有变革性,以至于难以甚至无法预测其后续走向。
  • 情境意识(Situational awareness,AI) — 模型内部对「自己正是一个正在被训练或评估的模型」这一事实的理解,原则上,这可能让它在测试环境下与部署环境下表现出不同的行为。
  • 规范博弈(Specification gaming) — AI 系统满足了某个目标的字面表述,却违背了其设计者真实意图的现象。参见奖励黑客与规范博弈
  • 语音识别(Speech recognition) — 一种将语音音频转换为文字的 AI 技术。
  • 随机鹦鹉(Stochastic parrot) — 一个批评性术语,将大语言模型描述为能够流畅地重组训练文本中的模式、却并不具备真正理解能力的系统。
  • 超级智能(Superintelligence) — 一种在几乎所有具有价值的领域中,都大幅超越最优秀人类表现的智能;另见 ASI 词条。
  • 监督学习(Supervised learning) — 一种训练方法,模型从明确标注了正确答案的数据中学习。
  • 合成媒体(Synthetic media) — 任何由 AI 生成或经过实质性修改的图像、音频或视频,无论其是否被用于欺骗目的。
  • AI 系统性风险(Systemic risk,AI) — 由某个 AI 模型的规模或影响范围所带来的、可能波及市场、基础设施或整个社会——而不仅仅是其直接用户——的风险。
  • 语义搜索(Semantic search) — 一种依据含义与语境、而非精确关键词匹配来给出搜索结果的方法,通常由嵌入技术驱动。
  • 仿真(Simulation) — 对现实世界系统或环境的建模,用于在真实部署之前安全地测试 AI 的行为。
  • 结构化数据(Structured data) — 以可预测的表格形式(如电子表格)组织的信息,与自由文本或图像等非结构化数据相对。
  • AI 驱动的监控(Surveillance,AI-enabled) — 使用人脸识别或行为分析等 AI 技术,对人群实施大规模监控。

T

  • 温度(Temperature,AI) — 一项控制语言模型输出随机性或可预测性程度的设置;温度越高,回复就越多样、越不确定。
  • 文本生成图像(Text-to-image) — 一种根据书面描述生成图像的生成式 AI 系统。
  • 文本转语音(Text-to-speech) — 一种将书面文本转换为语音音频的 AI 技术。
  • 词元(Token) — 语言模型每次处理的基本文本单位(大致相当于一个单词或词的片段)。
  • 分词(Tokenization) — 在模型处理文本之前,将文本切分为词元的过程。
  • 训练数据(Training data) — AI 模型在训练过程中据以学习的样本。
  • 训练运行(Training run) — 用于训练一个模型的流程的一次完整执行,对前沿模型而言,这可能耗时数周甚至数月。
  • 迁移学习(Transfer learning) — 将一个在某项任务上训练出的模型,复用为训练相关但不同任务的起点,以节省时间与数据。
  • 变革性 AI(Transformative AI) — 能够推动规模堪比农业革命或工业革命的社会变革的 AI。
  • Transformer — 于 2017 年提出的一种神经网络架构,是当今几乎所有现代大语言模型的基础。
  • 背信转向(Treacherous turn) — 一个被假设存在的时刻:一个在能力较弱时表现安全的 AI 系统,一旦获得了足够的力量、能够在不被阻止的情况下追求不同的目标,便会突然转而如此行事。
  • TPU(张量处理单元,Tensor Processing Unit) — 一种由 Google 专门设计、用以加速 AI 模型训练与推理的芯片。
  • 图灵测试(Turing test) — 一项被提出用来判断机器的对话是否与人类的对话无法区分的测试。参见图灵测试及其后继者
  • 测试集(Test set) — 从训练过程中预留出来、仅用于衡量最终模型真实世界表现的一部分数据。
  • 威胁模型(Threat model) — 一份结构化的描述,说明谁可能攻击某个系统、如何攻击,以及他们可能达成什么目的,用于指导防御设计。
  • 信任与安全(Trust and safety) — AI 或科技公司内部负责防止其平台上出现滥用行为、伤害与政策违规的职能部门。

U

  • 恐怖谷(Uncanny valley) — 人们在看到一张、听到一段几乎、但又不完全像人类的合成面孔、声音或动画时,所产生的一种不安感受。
  • 无监督学习(Unsupervised learning) — 一种训练方法,模型在没有提供任何带标签正确答案的情况下,从数据中发现模式或结构。

V

  • 价值对齐(Value alignment) — 设计一个 AI 系统,使其行为真正体现人类价值观,而不仅仅是字面上的训练目标。
  • 向量数据库(Vector database) — 一种针对存储与检索嵌入向量而优化的数据库,常用于让语言模型获取外部知识。
  • 虚拟助手(Virtual assistant) — 一种软件智能体(例如智能音箱的语音助手),被设计用来代表用户执行任务或回答问题。
  • 视觉语言模型(Vision-language model) — 一种能够同时处理图像与文本的 AI 模型,例如能够回答关于一张照片的问题。
  • 语音克隆(Voice cloning) — 使用 AI 技术,根据一段简短的音频样本复现特定某个人的声音。参见深度伪造与语音克隆防范

W

  • 弱到强泛化(Weak-to-strong generalization) — 一类研究,探讨一个较弱模型的监督信号,是否仍能可靠地将一个更强模型的行为引导向正确方向。
  • 网络爬取(Web scraping) — 自动从网站中提取大量数据,是构建 AI 训练数据集的常见方法。
  • 举报人保护(Whistleblower protections) — 为在 AI 公司内部举报安全隐患、且不因此遭到报复的员工提供的法律或政策保障。参见举报人保护
  • 世界模型(World model) — AI 系统对其所处环境运作方式的内部表征,用于预测各项行动所产生的效果。

Z

  • 零样本学习(Zero-shot learning) — 模型在训练过程中未曾见过某项具体任务的任何示例,却仅凭通用知识就能正确完成该任务的能力。

Type to search the manual.

navigate open esc close