正在载入…

华为 AI 方向机考错题本

试卷:2026-08-05 语言:Python 3 用途:刷题后复盘。每道题记录“考点—正确结论—易错点”。

复习方法:先遮住答案自己说出核心公式;再看“易错点”;最后用一句话总结。标记为“待巩固”的题,隔天重做。

一、错题总览

线性代数0 道题
强化学习0 道题
大模型0 道题

线性代数

概率论与数理统计

机器学习基础

深度学习与神经网络

强化学习

自然语言处理

大模型

二、逐题记录

2026-07-01 · Q1 概率分布差异度量 答案:C(余弦相似度)

题干:下列哪个量可用于衡量两个概率分布的差异?

本题按题目给定答案记录为余弦相似度。注意:在严格的信息论语境中,KL 散度是专门衡量概率分布差异的常用指标。

线性代数错题

Q20 矩阵转置线性变换 答案:C(是)

题干:在 (2×2) 矩阵空间中,(T(A)=A^T) 是否为线性变换?

转置满足加法和数乘:

(A+B)^T=A^T+B^T, (cA)^T=cA^T

并且 ((A^T)^T=A)。因此 (T(A)=A^T) 是线性变换。注意:这不表示所有矩阵都满足 (A=A^T),后者只对对称矩阵成立。

概率统计错题

本批题目元数据:2026-07-15 · Q2 垃圾邮件贝叶斯;2026-07-15 · Q3 泊松样本;2026-07-15 · Q5 矩阵转置线性变换;2026-07-15 · Q9 男女生编程偏好贝叶斯。

新题1 异常值与回归评价指标 答案:RMSE

题干:回归数据含少量极端异常值时,哪个指标通常最敏感?

RMSE=√[(1/n)Σ(yᵢ−ŷᵢ)²]

RMSE 会将误差平方,极端误差被放大,因此比 MAE、中位数绝对误差更容易受异常值影响。

新题2 贝叶斯垃圾邮件判断 答案:0.667

题干:某词在垃圾邮件和正常邮件中的出现概率分别为 0.8、0.1,垃圾邮件先验为 20%。邮件含该词时为垃圾邮件的概率是多少?

P(S|W)=0.8×0.2/[0.8×0.2+0.1×0.8]=0.667

这是贝叶斯公式:后验概率 = 似然×先验 ÷ 总概率。

新题3 泊松样本的期望 答案:两者期望都为 λ

题干:泊松样本的样本均值与无偏样本方差的期望关系?

若 (X_i∼Poisson(λ)),则:

E(X̄)=λ, E(S²)=Var(Xᵢ)=λ

不要与 (operatorname{Var}(X̄)=λ/n) 混淆;题目问的是样本均值的期望。

Q1 Softmax 数值稳定性 答案:D

题干:softmax(x)i=exᵢjexⱼ,当 xi 较大(如 >1000)会导致数值溢出。正确的稳定化实现是?

softmax(x)i=exp(xi−max(x))/Σexp(xj−max(x))

要点:整体减去最大值不改变结果,最大指数变为 1,避免溢出。L2 归一化和除以最大值不是等价稳定技巧。

Q2 VQA 答案:A

题干:视觉问答(Visual Question Answering,VQA)是典型的多模态任务,它的输入和输出分别是什么?

Visual Question Answering 的输入是图像+自然语言问题,输出是文本答案,属于视觉与语言的多模态任务。

Q3 HRL 顺序子任务奖励 答案:B(−11)

题干:HRL 将任务依次拆为 A、B、C、D。奖励分别为 5、8、12、16;失败惩罚分别为 −RA/2、−RB/4、−RC/3、−RD/4。某任务失败时后续任务跳过,并额外施加“后续被跳过任务基础奖励平均值”的负级联惩罚。现 A 成功、B 失败,求总奖励。

A 成功得 5;B 失败罚 −8/4=−2;C、D 被跳过,级联惩罚为 −(12+16)/2=−14;总和 5−2−14=−11。

易错:被跳过任务不再获得基础奖励/失败惩罚,但会触发级联惩罚。

Q4 向量距离 答案:D(√8)

题干:词向量 vx=[2,3]T、vy=[4,1]T,采用欧氏距离计算相似度,欧氏距离是多少?

d(x,y)=√Σ(xi−yi)²=√[(-2)²+2²]=√8

Q6 截断 SVD 存储比例 答案:A(88.74%)

题干:某推荐系统中用户与短视频评分数据的矩阵维度为 1000×800,若使用 SVD 分解并保留秩 50,存储空间可减少的比例约为?

A≈UkΣkVkT。原矩阵 1000×800=800000;k=50 时存储量 1000×50+50+50×800=90050;减少率 1−90050/800000≈88.74%。

Σ 是对角阵,只存 50 个奇异值。奇异值=√(ATA 的特征值)。

Q10 RAG 余弦相似度 答案:B(0.989,极高)

题干:RAG 语义检索中,归一化向量 q=[0.8,1.2,1.6,2.0]、c=[1.0,0.8,1.4,1.8]。计算余弦相似度(保留 3 位小数),并按 ≥0.95 极高、0.85~0.95 高、<0.85 中等判断匹配等级。

cos(q,c)=(q·c)/(||q||||c||)=7.6/√(8.64×6.84)≈0.989

快捷模板:逐项相乘求点积;各自平方求和;最后相除。

Q11 最大似然估计 MLE 答案:D

题干:已知随机过程符合某种分布但参数 θ 未知,观察样本数据 X 后,MLE 的核心操作是什么?

θ̂=argmaxθ p(X|θ),独立样本时最大化 Σlog p(xi|θ)

A 是特定分布下的结果;B 是贝叶斯后验;C 是一致性理论性质。

Q12 逻辑回归评价指标 答案:D(MSE)

题干:在逻辑回归中,评价模型性能的常用指标不包括哪一项?

分类常用 Accuracy、Log Loss、AUC、Precision、Recall、F1;MSE 主要用于回归。AUC 是 ROC 曲线下面积,表示随机正样本得分高于随机负样本的概率。

Q13 推理峰值内存 答案:A

题干:端侧推理过程中,以下哪项因素最可能导致实际峰值内存显著超过模型文件本身大小?

峰值内存不仅有模型参数,还包括中间激活、临时 buffer、多分支并发缓存、batch 输入等。模型文件小不代表运行峰值内存小。

Q14 集中趋势 答案:B(均值)

题干:数据分析中,需要描述一组数据的“典型水平”或“中心位置”,下列哪个统计量最适合描述集中趋势?

均值/中位数/众数描述集中趋势;方差/标准差描述离散程度;偏度描述分布偏斜。

Q15 GSPO 序列级重要性采样 答案:A

题干:GSPO 引入序列级(sequence-level)重要性采样比率的主要原因是什么?

token 比率连乘会随长序列造成高方差、爆炸或消失。GSPO 以序列为粒度,并常用长度归一化的几何平均:

s=exp[(1/T)Σtlog rt]

不是为了提高探索、消除奖励模型偏差,也不等于 off-policy。

Q16 Householder 变换 答案:A、C、D

题干:以下关于 Householder 变换(利用反射矩阵 H=I−2vvT 将向量反射到坐标轴方向的正交变换)的性质,正确的有?

H=I−2vvT(vTv=1)

易错:B“行列式为+1”错误,+1 通常对应旋转,Householder 是反射。

Q18 梯度矩阵的秩与零空间 答案:A、B、C

题干:CNN 训练时梯度矩阵 A∈R1000×2000,且 rank(A)=500。结合线性代数中秩-零度定理及深度学习优化原理,以下说法正确的有?

根据秩-零度定理:

dim N(A)=列数−rank(A)=2000−500=1500

易错:一定先找题干给出的 rank。零空间维度是“列数−秩”,不是一般情况下的“列数−行数”。

Q19 在线逻辑回归 答案:A、B、C

题干:考虑逻辑回归在在线学习(Online Learning)场景下的性质,以下哪些说法正确?

易错:在线学习强调流式到达和持续更新;batch size=1 只描述更新粒度。固定学习率不等于有收敛保证。

三、2026-07-24 AI 岗真题

Q1 独立随机变量线性组合的方差 答案:B(11)

题干:独立随机变量 X~N(1,2)Y~N(2,3)Z=2X−Y 的方差为?

正态分布 N(μ,σ²) 的第二个参数是方差,所以 Var(X)=2、Var(Y)=3。

Var(aX+bY)=a²Var(X)+b²Var(Y)+2abCov(X,Y)

理解性推导:X'=X−E[X]Y'=Y−E[Y]。由方差定义:

Var(aX+bY)=E[(aX'+bY')²]
=a²E[X'²]+b²E[Y'²]+2abE[X'Y']

其中 E[X'²]=Var(X)E[Y'²]=Var(Y)E[X'Y']=Cov(X,Y)。X、Y 独立时协方差为 0,交叉项消失,因此:

Var(2X−Y)=2²×2+(−1)²×3=8+3=11

理解记忆:先把变量减去各自均值得到中心化变量,再展开平方。公式是从方差定义推出来的,不需要孤立死背。

Q4 L2 正则化与模型稳定性 答案:A

题干:L2 正则化为何常有助于提升模型稳定性?

L2 正则化在原损失后增加权重平方惩罚:

Ltotal=Ldata+λ||w||2²

它促使权重整体变小。对线性模型 y=wᵀx+b,输入发生微扰 Δx 时:

|Δy|=|wᵀΔx|≤||w||2||Δx||2

限制权重范数会降低输出变化的上界,从而减少模型对输入噪声和微小扰动的敏感性,通常改善稳定性与泛化能力。

理解记忆:L1 促稀疏;L2 缩小整体权重,使函数更平滑、对扰动更不敏感。L2 的梯度项与权重成正比,因此常与 weight decay 联系起来。

Q5 one-hot 多分类交叉熵 答案:B(−log 0.8)

题干:one-hot 标签 [0,1,0],预测概率 [0.1,0.8,0.1] 的交叉熵为?

多分类交叉熵为:

L=−Σiyilog pi

代入 one-hot 标签后,非真实类别位置都乘以 0,只有真实类别的概率 0.8 被保留:

L=−[0log(0.1)+1log(0.8)+0log(0.1)]=−log(0.8)≈0.223

真实类别概率越接近 1,损失越接近 0;若模型对错误答案非常自信,即真实类别概率趋近 0,损失会急剧增大。

理解记忆:one-hot 多分类交叉熵只看真实类别对应的预测概率,即 −log(p_true)。选项 C 忘记了每项前还要乘 yi

Q6 PCA 前的特征标准化 答案:C

题干:PCA 前通常标准化特征的主要原因是?

PCA 寻找数据方差最大的方向。如果不同特征的单位或数值范围差异很大,数值尺度大的特征通常具有更大的方差,容易不成比例地主导主成分。

常用 Z-score 标准化:

z=(x−μ)/σ

标准化后,每个特征通常具有均值 0、方差 1,使不同量纲下的方差可以公平比较,PCA 更能反映变量之间的相关结构。

理解记忆:PCA 按“方差大小”寻找方向。单位不统一时,方差不能公平比较;先标准化相当于让各特征站在同一起跑线上。若所有特征本来就同量纲且尺度有实际意义,则不一定必须标准化。

Q7 多模态后融合(Late Fusion) 答案:B

题干:多模态任务中的后融合(Late Fusion)是指?

Late Fusion 让图像、文本、语音等模态分别完成特征提取,甚至各自产生预测分数,最后在决策层附近组合结果。

ŷ=αŷimage+βŷtext

理解记忆:Early 是“先合再学”,Middle 是“边学边合”,Late 是“各学各的,最后表决”。

Q10 评分尺度差异与相似性 答案:C(皮尔逊相关系数)

题干:用户评分尺度差异明显时,更适合用哪种相似性?

不同用户可能有不同的打分基准:一名用户习惯打 4~5 分,另一名用户习惯打 2~3 分,但两人对物品的偏好升降趋势可能一致。皮尔逊相关系数会先减去各自均值,因此能减弱评分整体偏高或偏低造成的影响:

rxy=Σ(xi−x̄)(yi−ȳ) / √[Σ(xi−x̄)² Σ(yi−ȳ)²]

理解记忆:评分尺度不同,重点比较“喜欢和不喜欢的趋势是否同步”,而不是绝对分数是否接近,所以用皮尔逊相关。注意:皮尔逊能消除平移并对正比例缩放不敏感,但它衡量的是线性相关。

Q11 PagedAttention 的 Block Size 答案:D

题干:PagedAttention 的 Block Size 设为 1 的主要问题是?

PagedAttention 把请求的 KV Cache 拆成固定大小的逻辑块,通过块表映射到可能不连续的物理显存。Block Size 表示每个块容纳的 token 数。

若 Block Size=1,每个 token 都单独占一个块。长度为 L 的序列需要 L 个块表项;若 Block Size=B,则大约只需要 ⌈L/B⌉ 个块表项。

因此 Block Size 是空间利用率与访问效率之间的折中:

块太大 → 内部碎片增加;块太小 → 元数据、寻址和不连续访存开销增加

理解记忆:PagedAttention 类似操作系统分页。页太大浪费页内空间,页太小则页表庞大、地址转换频繁;Block Size=1 是“粒度过细”的极端情况。

Q12 语言模型困惑度(Perplexity) 答案:C

题干:对于高质量且符合目标分布的文本,模型困惑度通常如何?

困惑度是语言模型平均负对数似然(交叉熵)的指数:

PPL=exp[−(1/N)Σilog p(xi|x<i)] = exp(平均交叉熵)

模型给真实 token 的概率越高,负对数似然越低,PPL 也越低。它可以直观理解为模型预测下一个 token 时,平均在多少个候选之间“犹豫”。

易错与限制:只能在相同数据集、相同 tokenizer 和相近评测条件下公平比较 PPL。不同分词粒度会改变 token 数和概率分解,数值不能直接横向比较。记忆链:交叉熵低 ⇔ PPL 低 ⇔ 对真实文本更有把握。

Q13 Transformer 滑动窗口与 KV Cache 答案:A(20,20)

题干:滑动窗口大小 20,Prefill 30 token 后又 Decode 15 token,此时保留 token 数和注意力上下文长度为?

先算总长度:Prefill 处理 30 个输入 token,Decode 又生成 15 个 token,所以模型已经处理:

T=P+D=30+15=45

滑动窗口只允许保留并直接关注最近 W=20 个 token。因此较早的 25 个 token 滑出窗口,保留数量和当前局部注意力上下文长度均为:

min(P+D,W)=min(45,20)=20

Transformer 推理基础:

选项陷阱:B 把 Decode 数量误当成保留量;C 忽略窗口限制;D 把 Decode 数量误当成上下文长度。窗口中的 20 个 token 可以同时包含 Prefill 尾部和 Decode token。

机考公式:Prefill=P,Decode=D,窗口=W,则当前总长度为 P+D;滑动窗口内保留量及局部上下文长度通常为 min(P+D,W)。

Q14 SVD 的基本性质 答案:A

题干:关于 SVD,哪项正确?

任意实矩阵都可以分解为 A=UΣVᵀ。完整 SVD 中 U、V 可取为正交矩阵;Σ 的对角元素是奇异值,满足 σᵢ≥0

σᵢ=√λᵢ(AᵀA)

速记:任意矩阵可 SVD;U、V 正交;奇异值非负;不要求方阵或可逆。

Q19 非零向量点积与余弦相似度 答案:A、B、C、D

题干:关于非零向量点积和余弦相似度,正确的有哪些?

余弦相似度定义为:

cos(x,y)=x·y/(||x||₂||y||₂)

理解记忆:点积=方向相似度×长度放大;余弦只看方向、范围 [−1,1]。使用余弦替代注意力 logit 时,常需可学习温度或缩放因子。

Q16 Activation Checkpointing 答案:A、D

题干:关于 activation checkpointing,正确的有哪些?

Activation checkpointing 只保存部分前向激活,反向传播时重算未保存的激活,用计算换显存。A、D 正确;B 错,重算通常增加训练时间;C 错,该技术主要用于训练阶段。

速记:少存激活、反向重算;用计算换训练显存。

Q17 训练与推理显存优化 答案:B、C、D

题干:关于训练和推理显存优化,合理的有哪些?

KV cache 受层数、序列长度、KV 头数、head 维度和数值精度影响。PagedAttention 用分页块管理 KV cache;训练重计算减少中间激活;FP8 等低精度通常减少 KV cache 每个元素占用的字节数。

KV Cache 显存 ∝ 层数 × 序列长度 × KV头数 × head维度 × 2(K,V) × 每元素字节数

Q18 ResNet Shortcut Connection 答案:A、B、D

题干:关于 ResNet shortcut connection,正确的有哪些?

y=F(x)+x, ∂y/∂x=∂F/∂x+I

shortcut 提供梯度直通路径;当 F(x)=0 时实现恒等映射;维度一致时 identity shortcut 不需要参数。残差连接是通用架构思想,也大量用于 Transformer。

Q20 双分支多模态模型训练 答案:A、B、C、D

题干:双分支多模态模型训练中,正确的有哪些?

不同模态分支的梯度范数差异过大时,模型可能过度依赖梯度更强的模态。可通过分支梯度归一化、重标定或梯度裁剪缓解。

Swish(x)=xσ(x), Swish'(x)=σ(x)+xσ(x)(1−σ(x))

当 x 为较大正数时,σ(x)→1,因此 Swish'(x)→1,有利于梯度传播。

四、待继续补充

2026-06-03 · Q4

朴素贝叶斯垃圾文本分类 答案:D(0.91)

题干:朴素贝叶斯垃圾文本过滤中,(P(Spam)=0.4);垃圾文本包含 (W_1,W_2) 的条件概率分别为 0.5、0.6,正常文本对应概率为 0.1、0.2。假设类条件独立,同时包含两个词的文本为垃圾文本的后验概率是多少?

正常文本先验为 (P(Normal)=0.6)。根据类条件独立假设:

P(W_1,W_2|Spam)=0.5×0.6=0.3
P(W_1,W_2|Normal)=0.1×0.2=0.02

两个类别的未归一化得分分别为 (0.4×0.3=0.12) 和 (0.6×0.02=0.012)。归一化后:

P(Spam|W_1,W_2)=\frac{0.12}{0.12+0.012}=0.909≈0.91

易错点:不仅要相乘各特征的条件概率,还要乘类别先验,最后对所有类别得分进行归一化。

2026-06-03 · Q3

牛顿迭代法求方程根 答案:A(1.75)

题干:使用牛顿迭代法求方程 (x²−3=0) 的正根,初始点 (x_0=2),单次迭代后的 (x_1) 是多少?

令 (f(x)=x²−3),则 (f'(x)=2x)。牛顿迭代公式为:

x_{k+1}=x_k−\frac{f(x_k)}{f'(x_k)}

代入 (x_0=2):

x_1=2−\frac{2²−3}{2×2}=2−\frac14=1.75

易错点:分母要代入导数 (f'(x_0)=2x_0=4),不是原函数值。

2026-06-12 · Q16

凸函数的基本性质 答案:A、B、C

题干:以下关于凸函数的性质,正确的有哪些?

A 正确,凸函数对加法封闭;B 正确,若 (a_i≥0),则 (Σa_if_i) 仍为凸函数;C 正确,凸优化中不存在严格意义上的“局部最优但非全局最优”;D 错误,凸函数与凹函数之和未必凸,例如 (x²+(−2x²)=−x²) 是凹函数。

易错点:非负线性组合中的系数必须非负;你原先选择了 B、C,漏选了 A。

2026-06-12 · Q2

伯努利分布合格率的最大似然估计 答案:B(0.6)

题干:抽检 5 个灯泡,寿命为 ([2,0,3,0,4])。合格品寿命服从指数分布,不合格品寿命为 0,求合格率 (p) 的最大似然估计。

将非零寿命记为合格 (Y=1),寿命为 0 记为不合格 (Y=0),状态样本为 ([1,0,1,0,1])。因此 (Y_i\sim Bernoulli(p)),似然函数为:

L(p)=∏p^{yᵢ}(1−p)^{1−yᵢ}=p³(1−p)²

其中 (p) 的指数 3 表示 3 个合格品,(1-p) 的指数 2 表示 2 个不合格品。最大化可得:

\hat p=\frac{3}{5}=0.6

易错点:先把寿命数据转换为合格/不合格的 0-1 状态,再建立伯努利似然;指数分布的寿命数值不影响本题对合格率 (p) 的估计。

2026-06-17 · Q20

最大似然估计 MLE 的基本性质 答案:A、C、D

题干:关于最大似然估计 MLE,正确的有哪些?

似然函数把样本视为已知、把参数视为变量:

L(θ)=f(x₁,…,xₙ|θ), \hat θMLE=argmaxθL(θ)

独立样本时 (L(θ)=∏f(xᵢ|θ)),通常取对数得到 (ell(θ)=Σ\log f(xᵢ|θ))。因对数单调递增,最大化似然与最大化对数似然等价。MLE 不一定无偏,例如 (U[0,θ]) 中样本最大值是 MLE,但 (E[X_{(n)}]=nθ/(n+1)≠θ)。

2026-06-17 · Q4

逻辑回归 logit 变换的值域 答案:A(\((−∞,+∞)\))

题干:对数几率 (ln(p/(1-p))) 的取值范围是什么?

当 (0<p<1) 时:

0<p/(1−p)<+∞

对数函数将正数域 ((0,+∞)) 映射为整个实数轴,因此:

\ln\frac{p}{1−p}\in(−∞,+∞)

这就是逻辑回归中的 logit 变换,将概率 (pin(0,1)) 转换为任意实数。

2026-06-24 · Q19

可逆方阵的判定 答案:A、B、D

题干:下列哪些方阵一定可逆?

可逆的充要条件是:

\det(A)≠0 \Longleftrightarrow \operatorname{rank}(A)=n \Longleftrightarrow A^{-1}\text{ 存在}

单位矩阵满足 (I^{-1}=I),因此 A 正确;满秩方阵的行列式非零,因此 B 正确;零矩阵行列式为 0,不可逆,因此 C 错;D 是可逆性的直接判定条件。易错点:不能漏选单位矩阵。

2026-06-24 · Q12

独立几何分布之和 答案:D(负二项分布)

题干:若 (X_1) 至 (X_n) 独立同分布且均服从参数为 (p) 的几何分布,它们的和服从什么分布?

若每个 (X_i) 表示获得一次成功所需的试验次数,则 (S_n=ΣX_i) 表示获得 (n) 次成功所需的总试验次数。其概率质量函数为:

P(S_n=k)=C(k−1,n−1)p^n(1−p)^{k−n}, k=n,n+1,…

这正是负二项分布。几何分布是“第 1 次成功”的等待次数;负二项分布是“第 (n) 次成功”的等待次数。若教材将几何分布定义为成功前失败次数,则结果是负二项分布的平移版本,结论不变。

日期待补 · Q19

实对称矩阵的性质 答案:A、B、C、D

题干:若 (A) 为实对称矩阵,哪些结论必然正确?

由谱定理 (A=QΛQ^T)。实对称矩阵可正交对角化;若 (A^k=0),则所有特征值均为 0,故 (A=0);秩等于对角化后非零特征值的个数;而 (e^A=Qe^ΛQ^T),其特征值 (e^{λ_i}>0),所以 (e^A) 正定。

2026-07-01 · Q12

正态分布方差的最大似然估计 答案:D

题干:正态分布均值已知时,方差的最大似然估计使用哪一项?

\hat{σ}²MLE=\frac{1}{n}Σi=1n(xᵢ−μ)²

最大似然估计的分母是 n。分母为 (n-1) 的样本方差是无偏估计,不是 MLE。重点:最大似然估计(MLE)通常按似然函数最大化得到。

2026-07-01 · Q13

均匀分布参数的最大似然估计 答案:C(1.2)

题干:误差服从 (U[-a,a]),样本为 ({-0.5,1.2,-0.8}),求 (a) 的 MLE。

\hat a=\max_i|xᵢ|=\max(0.5,1.2,0.8)=1.2

要让区间包含所有样本,必须有 (a\geq1.2);而似然 (L(a)=(1/(2a))^3) 随 (a) 增大而减小,所以在最小可行值 (a=1.2) 处取得最大值。