华为 AI 方向机考错题本
试卷:2026-08-05 语言:Python 3 用途:刷题后复盘。每道题记录“考点—正确结论—易错点”。
一、错题总览
线性代数
概率论与数理统计
机器学习基础
深度学习与神经网络
强化学习
自然语言处理
大模型
二、逐题记录
2026-07-01 · Q1 概率分布差异度量 答案:C(余弦相似度)
题干:下列哪个量可用于衡量两个概率分布的差异?
本题按题目给定答案记录为余弦相似度。注意:在严格的信息论语境中,KL 散度是专门衡量概率分布差异的常用指标。
线性代数错题
Q20 矩阵转置线性变换 答案:C(是)
题干:在 (2×2) 矩阵空间中,(T(A)=A^T) 是否为线性变换?
转置满足加法和数乘:
(A+B)^T=A^T+B^T, (cA)^T=cA^T
并且 ((A^T)^T=A)。因此 (T(A)=A^T) 是线性变换。注意:这不表示所有矩阵都满足 (A=A^T),后者只对对称矩阵成立。
概率统计错题
新题1 异常值与回归评价指标 答案:RMSE
题干:回归数据含少量极端异常值时,哪个指标通常最敏感?
RMSE=√[(1/n)Σ(yᵢ−ŷᵢ)²]
RMSE 会将误差平方,极端误差被放大,因此比 MAE、中位数绝对误差更容易受异常值影响。
新题2 贝叶斯垃圾邮件判断 答案:0.667
题干:某词在垃圾邮件和正常邮件中的出现概率分别为 0.8、0.1,垃圾邮件先验为 20%。邮件含该词时为垃圾邮件的概率是多少?
P(S|W)=0.8×0.2/[0.8×0.2+0.1×0.8]=0.667
这是贝叶斯公式:后验概率 = 似然×先验 ÷ 总概率。
新题3 泊松样本的期望 答案:两者期望都为 λ
题干:泊松样本的样本均值与无偏样本方差的期望关系?
若 (X_i∼Poisson(λ)),则:
E(X̄)=λ, E(S²)=Var(Xᵢ)=λ
不要与 (operatorname{Var}(X̄)=λ/n) 混淆;题目问的是样本均值的期望。
Q1 Softmax 数值稳定性 答案:D
题干:softmax(x)i=exᵢ/Σjexⱼ,当 xi 较大(如 >1000)会导致数值溢出。正确的稳定化实现是?
softmax(x)i=exp(xi−max(x))/Σexp(xj−max(x))
要点:整体减去最大值不改变结果,最大指数变为 1,避免溢出。L2 归一化和除以最大值不是等价稳定技巧。
Q2 VQA 答案:A
题干:视觉问答(Visual Question Answering,VQA)是典型的多模态任务,它的输入和输出分别是什么?
Visual Question Answering 的输入是图像+自然语言问题,输出是文本答案,属于视觉与语言的多模态任务。
Q3 HRL 顺序子任务奖励 答案:B(−11)
题干:HRL 将任务依次拆为 A、B、C、D。奖励分别为 5、8、12、16;失败惩罚分别为 −RA/2、−RB/4、−RC/3、−RD/4。某任务失败时后续任务跳过,并额外施加“后续被跳过任务基础奖励平均值”的负级联惩罚。现 A 成功、B 失败,求总奖励。
A 成功得 5;B 失败罚 −8/4=−2;C、D 被跳过,级联惩罚为 −(12+16)/2=−14;总和 5−2−14=−11。
易错:被跳过任务不再获得基础奖励/失败惩罚,但会触发级联惩罚。
Q4 向量距离 答案:D(√8)
题干:词向量 vx=[2,3]T、vy=[4,1]T,采用欧氏距离计算相似度,欧氏距离是多少?
d(x,y)=√Σ(xi−yi)²=√[(-2)²+2²]=√8
Q6 截断 SVD 存储比例 答案:A(88.74%)
题干:某推荐系统中用户与短视频评分数据的矩阵维度为 1000×800,若使用 SVD 分解并保留秩 50,存储空间可减少的比例约为?
A≈UkΣkVkT。原矩阵 1000×800=800000;k=50 时存储量 1000×50+50+50×800=90050;减少率 1−90050/800000≈88.74%。
Σ 是对角阵,只存 50 个奇异值。奇异值=√(ATA 的特征值)。
Q10 RAG 余弦相似度 答案:B(0.989,极高)
题干:RAG 语义检索中,归一化向量 q=[0.8,1.2,1.6,2.0]、c=[1.0,0.8,1.4,1.8]。计算余弦相似度(保留 3 位小数),并按 ≥0.95 极高、0.85~0.95 高、<0.85 中等判断匹配等级。
cos(q,c)=(q·c)/(||q||||c||)=7.6/√(8.64×6.84)≈0.989
快捷模板:逐项相乘求点积;各自平方求和;最后相除。
Q11 最大似然估计 MLE 答案:D
题干:已知随机过程符合某种分布但参数 θ 未知,观察样本数据 X 后,MLE 的核心操作是什么?
θ̂=argmaxθ p(X|θ),独立样本时最大化 Σlog p(xi|θ)
A 是特定分布下的结果;B 是贝叶斯后验;C 是一致性理论性质。
Q12 逻辑回归评价指标 答案:D(MSE)
题干:在逻辑回归中,评价模型性能的常用指标不包括哪一项?
分类常用 Accuracy、Log Loss、AUC、Precision、Recall、F1;MSE 主要用于回归。AUC 是 ROC 曲线下面积,表示随机正样本得分高于随机负样本的概率。
Q13 推理峰值内存 答案:A
题干:端侧推理过程中,以下哪项因素最可能导致实际峰值内存显著超过模型文件本身大小?
峰值内存不仅有模型参数,还包括中间激活、临时 buffer、多分支并发缓存、batch 输入等。模型文件小不代表运行峰值内存小。
Q14 集中趋势 答案:B(均值)
题干:数据分析中,需要描述一组数据的“典型水平”或“中心位置”,下列哪个统计量最适合描述集中趋势?
均值/中位数/众数描述集中趋势;方差/标准差描述离散程度;偏度描述分布偏斜。
Q15 GSPO 序列级重要性采样 答案:A
题干:GSPO 引入序列级(sequence-level)重要性采样比率的主要原因是什么?
token 比率连乘会随长序列造成高方差、爆炸或消失。GSPO 以序列为粒度,并常用长度归一化的几何平均:
s=exp[(1/T)Σtlog rt]
不是为了提高探索、消除奖励模型偏差,也不等于 off-policy。
Q16 Householder 变换 答案:A、C、D
题干:以下关于 Householder 变换(利用反射矩阵 H=I−2vvT 将向量反射到坐标轴方向的正交变换)的性质,正确的有?
H=I−2vvT(vTv=1)
- 对称:HT=H;
- 正交:HTH=I;
- 反射:Hv=−v,所以 det(H)=−1;
- 用于稳定 QR 分解,比经典 Gram-Schmidt 数值更稳定。
易错:B“行列式为+1”错误,+1 通常对应旋转,Householder 是反射。
Q18 梯度矩阵的秩与零空间 答案:A、B、C
题干:CNN 训练时梯度矩阵 A∈R1000×2000,且 rank(A)=500。结合线性代数中秩-零度定理及深度学习优化原理,以下说法正确的有?
根据秩-零度定理:
dim N(A)=列数−rank(A)=2000−500=1500
- A:若参数方向 v∈N(A),则 Av=0,每个样本梯度在该方向的投影为零,损失的一阶变化为零,可能对应平坦区域或鞍点。
- B:零空间越大,有效梯度信息维度越低,参数更新存在更多无效方向。
- C:题目给出 rank(A)=500,因此零空间维度恰为 1500。
- D:新增梯度若线性相关,矩阵秩和零空间维度不会改变,故不能保证“直接降低”。
易错:一定先找题干给出的 rank。零空间维度是“列数−秩”,不是一般情况下的“列数−行数”。
Q19 在线逻辑回归 答案:A、B、C
题干:考虑逻辑回归在在线学习(Online Learning)场景下的性质,以下哪些说法正确?
- A:每到一个样本立即更新,形式上相当于 batch size=1 的随机梯度下降。
- B:AdaGrad 为各参数分配自适应学习率,低频稀疏特征仍能得到较大的有效步长。
- C:在线模型持续吸收新数据,通常比一次性批量训练更能适应概念漂移。
- D:固定学习率可能振荡或发散,不能保证严格收敛到全局最优。
易错:在线学习强调流式到达和持续更新;batch size=1 只描述更新粒度。固定学习率不等于有收敛保证。
三、2026-07-24 AI 岗真题
Q1 独立随机变量线性组合的方差 答案:B(11)
题干:独立随机变量 X~N(1,2)、Y~N(2,3),Z=2X−Y 的方差为?
正态分布 N(μ,σ²) 的第二个参数是方差,所以 Var(X)=2、Var(Y)=3。
Var(aX+bY)=a²Var(X)+b²Var(Y)+2abCov(X,Y)
理解性推导:设 X'=X−E[X]、Y'=Y−E[Y]。由方差定义:
Var(aX+bY)=E[(aX'+bY')²]
=a²E[X'²]+b²E[Y'²]+2abE[X'Y']
其中 E[X'²]=Var(X)、E[Y'²]=Var(Y)、E[X'Y']=Cov(X,Y)。X、Y 独立时协方差为 0,交叉项消失,因此:
Var(2X−Y)=2²×2+(−1)²×3=8+3=11
- 为什么系数要平方:方差本身来自“偏差的平方”,所以缩放 a 倍后方差缩放 a² 倍。
- 为什么相减仍然相加:(−1)²=1;独立时没有协方差交叉项。
- 顺带结论:E[Z]=2×1−2=0,独立正态变量的线性组合仍为正态,因此 Z~N(0,11)。
理解记忆:先把变量减去各自均值得到中心化变量,再展开平方。公式是从方差定义推出来的,不需要孤立死背。
Q4 L2 正则化与模型稳定性 答案:A
题干:L2 正则化为何常有助于提升模型稳定性?
L2 正则化在原损失后增加权重平方惩罚:
Ltotal=Ldata+λ||w||2²
它促使权重整体变小。对线性模型 y=wᵀx+b,输入发生微扰 Δx 时:
|Δy|=|wᵀΔx|≤||w||2||Δx||2
限制权重范数会降低输出变化的上界,从而减少模型对输入噪声和微小扰动的敏感性,通常改善稳定性与泛化能力。
- B 错:深度网络通常是非凸优化,L2 不能保证全局最优。
- C 错:L2 使权重趋小,但通常不会将权重精确压成 0;L1 更容易产生稀疏权重。
- D 错:正则化不保证缩短训练时间。
理解记忆:L1 促稀疏;L2 缩小整体权重,使函数更平滑、对扰动更不敏感。L2 的梯度项与权重成正比,因此常与 weight decay 联系起来。
Q5 one-hot 多分类交叉熵 答案:B(−log 0.8)
题干:one-hot 标签 [0,1,0],预测概率 [0.1,0.8,0.1] 的交叉熵为?
多分类交叉熵为:
L=−Σiyilog pi
代入 one-hot 标签后,非真实类别位置都乘以 0,只有真实类别的概率 0.8 被保留:
L=−[0log(0.1)+1log(0.8)+0log(0.1)]=−log(0.8)≈0.223
真实类别概率越接近 1,损失越接近 0;若模型对错误答案非常自信,即真实类别概率趋近 0,损失会急剧增大。
理解记忆:one-hot 多分类交叉熵只看真实类别对应的预测概率,即 −log(p_true)。选项 C 忘记了每项前还要乘 yi。
Q6 PCA 前的特征标准化 答案:C
题干:PCA 前通常标准化特征的主要原因是?
PCA 寻找数据方差最大的方向。如果不同特征的单位或数值范围差异很大,数值尺度大的特征通常具有更大的方差,容易不成比例地主导主成分。
常用 Z-score 标准化:
z=(x−μ)/σ
标准化后,每个特征通常具有均值 0、方差 1,使不同量纲下的方差可以公平比较,PCA 更能反映变量之间的相关结构。
- A 错:标准化只是预处理;主成分仍需通过协方差/相关矩阵的特征分解或 SVD 得到。
- B 错:PCA 不要求数据必须服从正态分布。
- D 错:标准化不会改变特征之间的线性相关关系,不能保证原特征线性无关。
理解记忆:PCA 按“方差大小”寻找方向。单位不统一时,方差不能公平比较;先标准化相当于让各特征站在同一起跑线上。若所有特征本来就同量纲且尺度有实际意义,则不一定必须标准化。
Q7 多模态后融合(Late Fusion) 答案:B
题干:多模态任务中的后融合(Late Fusion)是指?
Late Fusion 让图像、文本、语音等模态分别完成特征提取,甚至各自产生预测分数,最后在决策层附近组合结果。
ŷ=αŷimage+βŷtext
- Early Fusion:在输入层或浅层直接拼接不同模态,对应选项 C。
- Intermediate Fusion:各模态先编码一部分,再在网络中间通过拼接、注意力或交叉注意力交互。
- Late Fusion:各模态独立编码,在接近最终决策的位置进行加权、投票或分数融合。
理解记忆:Early 是“先合再学”,Middle 是“边学边合”,Late 是“各学各的,最后表决”。
Q10 评分尺度差异与相似性 答案:C(皮尔逊相关系数)
题干:用户评分尺度差异明显时,更适合用哪种相似性?
不同用户可能有不同的打分基准:一名用户习惯打 4~5 分,另一名用户习惯打 2~3 分,但两人对物品的偏好升降趋势可能一致。皮尔逊相关系数会先减去各自均值,因此能减弱评分整体偏高或偏低造成的影响:
rxy=Σ(xi−x̄)(yi−ȳ) / √[Σ(xi−x̄)² Σ(yi−ȳ)²]
- 皮尔逊相关:衡量中心化后的线性变化趋势,适合评分基准存在偏移的用户。
- 欧氏/曼哈顿距离:直接比较绝对数值差,容易受评分尺度和整体偏移影响。
- 汉明距离:主要比较离散符号或编码在多少个位置不同,不适合连续评分偏好。
理解记忆:评分尺度不同,重点比较“喜欢和不喜欢的趋势是否同步”,而不是绝对分数是否接近,所以用皮尔逊相关。注意:皮尔逊能消除平移并对正比例缩放不敏感,但它衡量的是线性相关。
Q11 PagedAttention 的 Block Size 答案:D
题干:PagedAttention 的 Block Size 设为 1 的主要问题是?
PagedAttention 把请求的 KV Cache 拆成固定大小的逻辑块,通过块表映射到可能不连续的物理显存。Block Size 表示每个块容纳的 token 数。
若 Block Size=1,每个 token 都单独占一个块。长度为 L 的序列需要 L 个块表项;若 Block Size=B,则大约只需要 ⌈L/B⌉ 个块表项。
- 优点:块内几乎没有因最后一个块未填满造成的内部碎片。
- 主要代价:块表和索引元数据显著增多,地址转换更加频繁。
- 访存影响:大量微小且分散的物理块降低连续访存、缓存局部性和 GPU 合并访存效率。
因此 Block Size 是空间利用率与访问效率之间的折中:
块太大 → 内部碎片增加;块太小 → 元数据、寻址和不连续访存开销增加
- A 错:块大小影响 KV Cache 管理,不会使模型权重无法加载。
- B 错:块内浪费减少不等于整体显存利用率必为 100%。
- C 错:更细的块会增加管理与访存开销,不能保证吞吐量提高。
理解记忆:PagedAttention 类似操作系统分页。页太大浪费页内空间,页太小则页表庞大、地址转换频繁;Block Size=1 是“粒度过细”的极端情况。
Q12 语言模型困惑度(Perplexity) 答案:C
题干:对于高质量且符合目标分布的文本,模型困惑度通常如何?
困惑度是语言模型平均负对数似然(交叉熵)的指数:
PPL=exp[−(1/N)Σilog p(xi|x<i)] = exp(平均交叉熵)
模型给真实 token 的概率越高,负对数似然越低,PPL 也越低。它可以直观理解为模型预测下一个 token 时,平均在多少个候选之间“犹豫”。
- A 错:PPL 通常越低越好,理论下限为 1。
- B 错:PPL 主要反映预测不确定性和对数据分布的拟合程度,不是只衡量多样性。
- C 对:在相同评测条件下,PPL 越低通常表示真实 token 获得的预测概率越高。
- D 错:PPL 与模型对目标文本分布的预测质量密切相关。
易错与限制:只能在相同数据集、相同 tokenizer 和相近评测条件下公平比较 PPL。不同分词粒度会改变 token 数和概率分解,数值不能直接横向比较。记忆链:交叉熵低 ⇔ PPL 低 ⇔ 对真实文本更有把握。
Q13 Transformer 滑动窗口与 KV Cache 答案:A(20,20)
题干:滑动窗口大小 20,Prefill 30 token 后又 Decode 15 token,此时保留 token 数和注意力上下文长度为?
先算总长度:Prefill 处理 30 个输入 token,Decode 又生成 15 个 token,所以模型已经处理:
T=P+D=30+15=45
滑动窗口只允许保留并直接关注最近 W=20 个 token。因此较早的 25 个 token 滑出窗口,保留数量和当前局部注意力上下文长度均为:
min(P+D,W)=min(45,20)=20
Transformer 推理基础:
- 注意力:
Attention(Q,K,V)=softmax(QKᵀ/√dk)V。Q 表示当前 token 要查询什么,K 用于匹配历史位置,V 提供实际内容。 - 因果注意力:自回归生成时,第 t 个 token 只能关注它之前的 token,不能看到未来。
- Prefill:并行处理完整输入提示词,并为输入 token 计算 K、V。
- Decode:每次生成一个新 token;若没有缓存,必须重复计算全部历史 token。
- KV Cache:缓存历史 token 的 K、V,用显存换取更少的重复计算,从而加速 Decode。
- 滑动窗口:只保存或直接关注最近 W 个 token,限制 KV Cache 和局部注意力长度,但会牺牲直接的长距离依赖。
选项陷阱:B 把 Decode 数量误当成保留量;C 忽略窗口限制;D 把 Decode 数量误当成上下文长度。窗口中的 20 个 token 可以同时包含 Prefill 尾部和 Decode token。
机考公式:Prefill=P,Decode=D,窗口=W,则当前总长度为 P+D;滑动窗口内保留量及局部上下文长度通常为 min(P+D,W)。
Q14 SVD 的基本性质 答案:A
题干:关于 SVD,哪项正确?
任意实矩阵都可以分解为 A=UΣVᵀ。完整 SVD 中 U、V 可取为正交矩阵;Σ 的对角元素是奇异值,满足 σᵢ≥0。
σᵢ=√λᵢ(AᵀA)
- 不要求 A 可逆,也不要求 A 是方阵。
- AᵀA 半正定,特征值非负,因此奇异值不会为负。
- 紧致 SVD 中 U、V 可能是矩形的列正交矩阵。
速记:任意矩阵可 SVD;U、V 正交;奇异值非负;不要求方阵或可逆。
Q19 非零向量点积与余弦相似度 答案:A、B、C、D
题干:关于非零向量点积和余弦相似度,正确的有哪些?
余弦相似度定义为:
cos(x,y)=x·y/(||x||₂||y||₂)
- A 对:非零向量的范数乘积为正,所以点积与余弦相似度符号相同。
- B 对:注意力中的点积通常配合缩放/温度控制分布尖锐程度;直接换成有界余弦可能导致 logits 范围过窄、softmax 过平,降低区分度。
- C 对:
x·y=||x||||y||cosθ,同时受夹角方向和两个向量长度影响。 - D 对:令
norm(x)=x/||x||₂、norm(y)=y/||y||₂,则norm(x)·norm(y)=cos(x,y)。所以余弦相似度正是两个向量分别 L2 归一化后的点积。
理解记忆:点积=方向相似度×长度放大;余弦只看方向、范围 [−1,1]。使用余弦替代注意力 logit 时,常需可学习温度或缩放因子。
Q16 Activation Checkpointing 答案:A、D
题干:关于 activation checkpointing,正确的有哪些?
Activation checkpointing 只保存部分前向激活,反向传播时重算未保存的激活,用计算换显存。A、D 正确;B 错,重算通常增加训练时间;C 错,该技术主要用于训练阶段。
速记:少存激活、反向重算;用计算换训练显存。
Q17 训练与推理显存优化 答案:B、C、D
题干:关于训练和推理显存优化,合理的有哪些?
KV cache 受层数、序列长度、KV 头数、head 维度和数值精度影响。PagedAttention 用分页块管理 KV cache;训练重计算减少中间激活;FP8 等低精度通常减少 KV cache 每个元素占用的字节数。
KV Cache 显存 ∝ 层数 × 序列长度 × KV头数 × head维度 × 2(K,V) × 每元素字节数
Q18 ResNet Shortcut Connection 答案:A、B、D
题干:关于 ResNet shortcut connection,正确的有哪些?
y=F(x)+x, ∂y/∂x=∂F/∂x+I
shortcut 提供梯度直通路径;当 F(x)=0 时实现恒等映射;维度一致时 identity shortcut 不需要参数。残差连接是通用架构思想,也大量用于 Transformer。
Q20 双分支多模态模型训练 答案:A、B、C、D
题干:双分支多模态模型训练中,正确的有哪些?
不同模态分支的梯度范数差异过大时,模型可能过度依赖梯度更强的模态。可通过分支梯度归一化、重标定或梯度裁剪缓解。
Swish(x)=xσ(x), Swish'(x)=σ(x)+xσ(x)(1−σ(x))
当 x 为较大正数时,σ(x)→1,因此 Swish'(x)→1,有利于梯度传播。
四、待继续补充
朴素贝叶斯垃圾文本分类 答案:D(0.91)
题干:朴素贝叶斯垃圾文本过滤中,(P(Spam)=0.4);垃圾文本包含 (W_1,W_2) 的条件概率分别为 0.5、0.6,正常文本对应概率为 0.1、0.2。假设类条件独立,同时包含两个词的文本为垃圾文本的后验概率是多少?
正常文本先验为 (P(Normal)=0.6)。根据类条件独立假设:
P(W_1,W_2|Spam)=0.5×0.6=0.3
P(W_1,W_2|Normal)=0.1×0.2=0.02
两个类别的未归一化得分分别为 (0.4×0.3=0.12) 和 (0.6×0.02=0.012)。归一化后:
P(Spam|W_1,W_2)=\frac{0.12}{0.12+0.012}=0.909≈0.91
易错点:不仅要相乘各特征的条件概率,还要乘类别先验,最后对所有类别得分进行归一化。
牛顿迭代法求方程根 答案:A(1.75)
题干:使用牛顿迭代法求方程 (x²−3=0) 的正根,初始点 (x_0=2),单次迭代后的 (x_1) 是多少?
令 (f(x)=x²−3),则 (f'(x)=2x)。牛顿迭代公式为:
x_{k+1}=x_k−\frac{f(x_k)}{f'(x_k)}
代入 (x_0=2):
x_1=2−\frac{2²−3}{2×2}=2−\frac14=1.75
易错点:分母要代入导数 (f'(x_0)=2x_0=4),不是原函数值。
凸函数的基本性质 答案:A、B、C
题干:以下关于凸函数的性质,正确的有哪些?
A 正确,凸函数对加法封闭;B 正确,若 (a_i≥0),则 (Σa_if_i) 仍为凸函数;C 正确,凸优化中不存在严格意义上的“局部最优但非全局最优”;D 错误,凸函数与凹函数之和未必凸,例如 (x²+(−2x²)=−x²) 是凹函数。
易错点:非负线性组合中的系数必须非负;你原先选择了 B、C,漏选了 A。
伯努利分布合格率的最大似然估计 答案:B(0.6)
题干:抽检 5 个灯泡,寿命为 ([2,0,3,0,4])。合格品寿命服从指数分布,不合格品寿命为 0,求合格率 (p) 的最大似然估计。
将非零寿命记为合格 (Y=1),寿命为 0 记为不合格 (Y=0),状态样本为 ([1,0,1,0,1])。因此 (Y_i\sim Bernoulli(p)),似然函数为:
L(p)=∏p^{yᵢ}(1−p)^{1−yᵢ}=p³(1−p)²
其中 (p) 的指数 3 表示 3 个合格品,(1-p) 的指数 2 表示 2 个不合格品。最大化可得:
\hat p=\frac{3}{5}=0.6
易错点:先把寿命数据转换为合格/不合格的 0-1 状态,再建立伯努利似然;指数分布的寿命数值不影响本题对合格率 (p) 的估计。
最大似然估计 MLE 的基本性质 答案:A、C、D
题干:关于最大似然估计 MLE,正确的有哪些?
似然函数把样本视为已知、把参数视为变量:
L(θ)=f(x₁,…,xₙ|θ), \hat θMLE=argmaxθL(θ)
独立样本时 (L(θ)=∏f(xᵢ|θ)),通常取对数得到 (ell(θ)=Σ\log f(xᵢ|θ))。因对数单调递增,最大化似然与最大化对数似然等价。MLE 不一定无偏,例如 (U[0,θ]) 中样本最大值是 MLE,但 (E[X_{(n)}]=nθ/(n+1)≠θ)。
逻辑回归 logit 变换的值域 答案:A(\((−∞,+∞)\))
题干:对数几率 (ln(p/(1-p))) 的取值范围是什么?
当 (0<p<1) 时:
0<p/(1−p)<+∞
对数函数将正数域 ((0,+∞)) 映射为整个实数轴,因此:
\ln\frac{p}{1−p}\in(−∞,+∞)
这就是逻辑回归中的 logit 变换,将概率 (pin(0,1)) 转换为任意实数。
可逆方阵的判定 答案:A、B、D
题干:下列哪些方阵一定可逆?
可逆的充要条件是:
\det(A)≠0 \Longleftrightarrow \operatorname{rank}(A)=n \Longleftrightarrow A^{-1}\text{ 存在}
单位矩阵满足 (I^{-1}=I),因此 A 正确;满秩方阵的行列式非零,因此 B 正确;零矩阵行列式为 0,不可逆,因此 C 错;D 是可逆性的直接判定条件。易错点:不能漏选单位矩阵。
独立几何分布之和 答案:D(负二项分布)
题干:若 (X_1) 至 (X_n) 独立同分布且均服从参数为 (p) 的几何分布,它们的和服从什么分布?
若每个 (X_i) 表示获得一次成功所需的试验次数,则 (S_n=ΣX_i) 表示获得 (n) 次成功所需的总试验次数。其概率质量函数为:
P(S_n=k)=C(k−1,n−1)p^n(1−p)^{k−n}, k=n,n+1,…
这正是负二项分布。几何分布是“第 1 次成功”的等待次数;负二项分布是“第 (n) 次成功”的等待次数。若教材将几何分布定义为成功前失败次数,则结果是负二项分布的平移版本,结论不变。
实对称矩阵的性质 答案:A、B、C、D
题干:若 (A) 为实对称矩阵,哪些结论必然正确?
由谱定理 (A=QΛQ^T)。实对称矩阵可正交对角化;若 (A^k=0),则所有特征值均为 0,故 (A=0);秩等于对角化后非零特征值的个数;而 (e^A=Qe^ΛQ^T),其特征值 (e^{λ_i}>0),所以 (e^A) 正定。
正态分布方差的最大似然估计 答案:D
题干:正态分布均值已知时,方差的最大似然估计使用哪一项?
\hat{σ}²MLE=\frac{1}{n}Σi=1n(xᵢ−μ)²
最大似然估计的分母是 n。分母为 (n-1) 的样本方差是无偏估计,不是 MLE。重点:最大似然估计(MLE)通常按似然函数最大化得到。
均匀分布参数的最大似然估计 答案:C(1.2)
题干:误差服从 (U[-a,a]),样本为 ({-0.5,1.2,-0.8}),求 (a) 的 MLE。
\hat a=\max_i|xᵢ|=\max(0.5,1.2,0.8)=1.2
要让区间包含所有样本,必须有 (a\geq1.2);而似然 (L(a)=(1/(2a))^3) 随 (a) 增大而减小,所以在最小可行值 (a=1.2) 处取得最大值。
- 后续题目继续按“题号、考点、答案、公式、易错点”追加。
- 整套试卷完成后,再按高频知识点和薄弱模块生成最终复习清单。
- 建议重点复习:概率统计、线性代数、Transformer/RLHF、模型部署内存、向量检索。