一、问题的提出角度误差究竟从哪里来AR-1106 这类基于 TDOA到达时间差的声源定位模块对外呈现的接口很简单串口周期性吐出一个角度值上位机或舵机据此转向。但工程落地时经常遇到两类抱怨——角度跳和分不开两个方向相近的人。把这两个现象拆到底层会发现它们并不是算法调参的问题而是被两个物理边界夹住的结果下边界来自采样时钟对时延的量化上边界来自麦克风间距引入的空间混叠。这两个边界同时由麦距 d 决定而且方向相反这就构成了阵列设计中最基础也最容易被忽略的一次取舍。二、下限采样时钟把时延切成了台阶双麦阵列可测的最大时延由几何决定τmax d / cc 取 343 m/s20℃。若 d 60 mmτmax ≈ 175 μs。在 16 kHz 采样下一个采样周期是 62.5 μs也就是说整个 ±175 μs 的动态范围只被切成了约 ±2.8 个整数样本台阶。角度与时延的关系是 θ arccos(cτ/d)。把整数样本代进去τ 0 对应 90°正侧τ 1 样本62.5 μs对应 arccos(0.357) ≈ 69°τ 2 样本对应 arccos(0.715) ≈ 44°τ 3 样本已经超出几何可能。换句话说不做任何插值时16 kHz 60 mm 的组合在正侧附近的角度台阶就有 20° 上下端射方向更是几十度一跳。用户看到的角度跳很大一部分就是这个量化台阶而不是噪声。改善路径有两条提高采样率48 kHz 把台阶缩到 20.8 μs样本数提升 3 倍或者做亚样本插值。前者代价是 MIPS 与功耗后者代价是对信噪比更敏感——下文再展开。三、上限麦距越大空间混叠来得越早直觉上把 d 拉大能改善量化因为 τmax 随 d 线性增长。但相位域相关有一个硬约束当声波半波长小于麦距时互相关的相位差超过 ±π出现缠绕产生对称伪峰。混叠临界频率为 falias c / (2d)。d 30 mm → falias ≈ 5.7 kHzτmax ≈ 87 μs16 kHz 下仅 ±1.4 样本d 60 mm → falias ≈ 2.86 kHzτmax ≈ 175 μs±2.8 样本d 100 mm → falias ≈ 1.72 kHzτmax ≈ 292 μs±4.7 样本d 150 mm → falias ≈ 1.14 kHzτmax ≈ 437 μs±7.0 样本把电话带宽 300–3400 Hz 叠上去看d 60 mm 时2.86 kHz 以上的分量已经进入混叠区而语音辅音能量恰恰集中在 2–4 kHzd 150 mm 时1.14 kHz 以上全部不可靠可用的相干带宽只剩下基频与低次谐波这一小段。d 增大换来的时延分辨力是用可用带宽换的。而估计方差又与有效带宽成反比两者会部分抵消这解释了为什么单纯拉大麦距往往达不到线性提升的预期。四、亚样本插值把台阶磨平的代价工程上更常用的做法是在互相关峰附近做亚样本细分典型两种一是对 GCC 输出峰值及左右各一点做抛物线拟合二是在频域对互谱相位做线性回归求斜率。两者在中高信噪比下都能把时延分辨推进到 0.1 个样本量级等效于 16 kHz 下 6.25 μs正侧角度台阶随之降到 2° 以内。代价在于估计方差。TDOA 的克拉美罗下界大致满足 στ ∝ 1 / (Beff · √(T · SNR))其中 Beff 是有效带宽、T 是积分时长。这意味着三件事信噪比每降 6 dB时延标准差约翻倍角度抖动同步放大把积分帧从 32 ms 拉到 128 ms 可换来约 2 倍的方差改善但角度更新的时间分辨率同比变差快速移动的声源会被拖尾只用窄带如仅取 300–1000 Hz 避混叠会直接抬高下界与拉大麦距的思路互相冲突。PHAT 加权是混响场景的常规选择它把互谱幅度白化、只保留相位信息能显著压低反射声造成的次峰。但白化是无差别的低信噪比频点的噪声相位会被同等放大。因此在安静会议室里 PHAT 表现很好在风噪或空调低频噪声偏强的环境里反而需要加一层信噪比加权或频点门控否则伪峰概率上升。五、输出侧串口速率不是瓶颈AR-1106 以 9600 bps 的串口输出角度。一帧角度报文按十来个字节计理论上每秒可发数十帧远高于任何机械执行机构的响应能力。所以限制跟得快不快的从来不是波特率而是估计方差与平滑窗的耦合为了压住抖动必须加中值或一阶低通而滤波深度直接换成响应延迟。实际调试中比较务实的分工是——DSP 侧只做保守平滑保留原始判决的快速性上位机或舵机侧再叠加死区与速率限制把机械抖动挡在执行层。六、场景匹配与局限这套边界分析可以直接转成选型判据。会议桌面拾音、展台互动这类目标距离 0.5–2 m、以电话带宽语音为主的场景60–80 mm 麦距是折中区间混叠临界落在 2.1–2.9 kHz配合亚样本插值可获得个位数角度精度。若目标是远场3 m 以上且允许结构变大可以考虑 100 mm 以上并主动做低通限带用带宽换几何增益。局限同样明确双麦线阵存在前后镜像模糊无法区分 θ 与 −θ需要靠结构遮挡、方向性麦克风或增加第三只麦破除仰角信息完全丢失只有水平投影角多声源同时说话时单峰搜索只会给出能量占优的那一个需要唤醒词或语音活动检测做时间上的门控。把这些前提写进需求评审比事后调滤波参数有效得多。