CABINET / Machines in Motion / 具身智能研究
传感器与感知硬件
具身智能系统的感知能力完全由传感器硬件决定。本文档系统梳理机器人系统中各类传感器的物理原理、工程指标、产品选型与标定方法。
1. 视觉传感器 (Vision Sensors)
1.1 RGB 相机基础
快门机制 (Shutter Mechanism)
全局快门 (Global Shutter) 与卷帘快门 (Rolling Shutter) 是两种根本不同的曝光方式。
全局快门:所有像素在同一时刻开始曝光、同一时刻结束曝光。传感器在曝光结束后将所有像素的电荷同时转移到存储节点,再逐行读出。这要求每个像素单元内集成额外的存储电容,导致像素填充因子 (fill factor) 降低,通常在 30%~60% 之间。
卷帘快门:逐行曝光,第 N 行开始曝光时,第 N-1 行可能仍在读出。行间延迟 (row delay) 通常为 10~30 μs。对于 1080p (1920×1080) 传感器,首行与末行的时间差为:
total_skew = row_delay × (num_rows - 1)
= 20 μs × 1079
≈ 21.6 ms
在机器人快速运动场景中(末端执行器速度 > 1 m/s),21.6 ms 的时间偏差会产生显著的图像畸变,影响视觉里程计 (Visual Odometry) 精度。
| 参数 | 全局快门 | 卷帘快门 |
|---|---|---|
| 运动畸变 | 无 | 有,与速度正相关 |
| 填充因子 | 30%~60% | 70%~90% |
| 暗电流噪声 | 较高 | 较低 |
| 成本 | 高 (2~5x) | 低 |
| 典型应用 | 机器人视觉、工业检测 | 手机、消费相机 |
| 代表芯片 | Sony IMX264 (GS) | Sony IMX477 (RS) |
Bayer 滤色阵列 (Bayer Filter Array)
CMOS 传感器的每个像素本身只能感知光强度,无法区分颜色。Bayer 滤色阵列在像素上方覆盖 R/G/B 滤色片,排列为 RGGB 模式(绿色像素数量是红色和蓝色的两倍,因为人眼对绿色最敏感)。
┌───┬───┬───┬───┬───┬───┐
│ R │ G │ R │ G │ R │ G │
├───┼───┼───┼───┼───┼───┤
│ G │ B │ G │ B │ G │ B │
├───┼───┼───┼───┼───┼───┤
│ R │ G │ R │ G │ R │ G │
├───┼───┼───┼───┼───┼───┤
│ G │ B │ G │ B │ G │ B │
└───┴───┴───┴───┴───┴───┘
去马赛克 (Demosaicing) 算法通过插值计算每个像素缺失的两个颜色通道。常见算法包括双线性插值、自适应色彩平面插值 (ACPI)、VNG (Variable Number of Gradients)。插值过程不可避免地引入伪色 (false color) 和拉链效应 (zipper artifact),在高频纹理区域尤为明显。
ISP 流水线 (Image Signal Processor Pipeline)
从原始传感器数据到可用 RGB 图像,需经过完整的 ISP 流水线:
Raw Bayer Data
│
▼
Black Level Correction (减去暗电流基底)
│
▼
Defect Pixel Correction (坏点修正)
│
▼
Lens Shading Correction (镜头渐晕补偿)
│
▼
White Balance Gain (白平衡增益,R/G/B 通道独立)
│
▼
Demosaicing (去马赛克插值)
│
▼
Color Correction Matrix (3×3 色彩校正矩阵)
│
▼
Gamma Correction (gamma = 2.2 或 sRGB 曲线)
│
▼
Noise Reduction (空域 + 时域降噪)
│
▼
Sharpening (锐化,通常为 Unsharp Mask)
│
▼
Output RGB Image
在机器人视觉中,ISP 的自动曝光 (AE)、自动白平衡 (AWB) 功能常被禁用或手动设定,以保证帧间一致性。许多视觉 SLAM 系统直接使用灰度图,跳过色彩处理。
1.2 工业相机 vs 消费相机
| 参数 | 工业相机 | 消费相机 |
|---|---|---|
| 快门 | 全局快门为主 | 卷帘快门为主 |
| 接口 | GigE Vision, USB3 Vision, CoaXPress | MIPI CSI-2, USB |
| 触发模式 | 硬件触发(μs 级精度) | 软件触发 |
| 帧率控制 | 精确可编程 | 受限于 ISP |
| 工作温度 | -20°C ~ +60°C | 0°C ~ +40°C |
| MTBF | > 50,000 小时 | 未标注 |
| 价格 | $500 ~ $5,000 | $10 ~ $100 (模组) |
代表产品:
| 品牌 | 型号 | 分辨率 | 帧率 | 快门 | 接口 | 价格 |
|---|---|---|---|---|---|---|
| Basler | acA1920-155uc | 1920×1200 | 155 fps | GS | USB 3.0 | ~$700 |
| FLIR (Teledyne) | BFS-U3-16S2C | 1440×1080 | 226 fps | GS | USB 3.0 | ~$600 |
| Allied Vision | Alvium 1800 U-500c | 2592×1944 | 52 fps | RS | USB 3.0 | ~$400 |
| Basler | acA4112-30uc | 4096×3000 | 30 fps | RS | USB 3.0 | ~$1,200 |
Sony IMX 系列传感器芯片(被广泛用于各类相机模组):
| 芯片 | 分辨率 | 像素尺寸 | 快门 | 典型应用 |
|---|---|---|---|---|
| IMX477 | 12.3 MP | 1.55 μm | RS | Raspberry Pi HQ Camera |
| IMX264 | 5 MP | 3.45 μm | GS | 工业检测 |
| IMX547 | 5.1 MP | 2.74 μm | GS | 机器视觉 |
| IMX678 | 8 MP | 1.12 μm | RS | 安防、无人机 |
| IMX334 | 8.3 MP | 2.0 μm | RS | 车载环视 |
1.3 深度相机 (Depth Cameras)
结构光 (Structured Light)
工作原理:投射已知红外光斑图案 (pattern) 到场景中,用红外相机拍摄被物体表面调制后的图案,通过图案变形计算深度。Intel RealSense D435 使用伪随机红外散斑 (pseudo-random speckle) 配合双红外相机进行立体匹配。
IR Projector ──────── 已知图案投射 ──────── 场景
│
│ 图案被表面调制
▼
IR Camera(s) ──────── 捕获变形图案 ──────── 深度计算
Intel RealSense 系列规格:
| 参数 | D435i | D455 | D405 |
|---|---|---|---|
| 深度技术 | 主动红外立体 | 主动红外立体 | 主动红外立体 |
| 深度分辨率 | 1280×720 | 1280×720 | 1280×720 |
| RGB 分辨率 | 1920×1080 | 1920×1080 | 无 |
| 深度帧率 | 最高 90 fps | 最高 90 fps | 最高 90 fps |
| 工作距离 | 0.1~10 m | 0.4~6 m (高精度) | 0.07~0.5 m |
| 深度精度 | <2% @ 2m | <2% @ 4m | <2% @ 0.25m |
| 基线 | 50 mm | 95 mm | 18 mm |
| IMU | 有 (BMI055) | 有 (BMI055) | 无 |
| 接口 | USB-C 3.1 | USB-C 3.1 | USB-C 3.1 |
| 价格 | ~$300 | ~$350 | ~$250 |
D455 相比 D435i 基线增大至 95 mm,远距离深度精度显著提升。D405 为近距离(7~50 cm)高精度设计,适合机械臂抓取场景。
飞行时间 (Time-of-Flight, ToF)
工作原理分为两类:
连续波 ToF (Continuous-Wave ToF):发射调制红外光(频率通常为 20~100 MHz),测量反射光与发射光之间的相位差,换算距离:
d = (c × Δφ) / (4π × f_mod)
其中 c 为光速,Δφ 为相位差,f_mod 为调制频率。单频调制的最大无模糊距离 (unambiguous range):
d_max = c / (2 × f_mod)
例如,f_mod = 75 MHz 时,d_max = 2.0 m。多频调制可扩展范围。
直接 ToF (Direct ToF, dToF):发射短脉冲光,使用 SPAD (Single-Photon Avalanche Diode) 阵列检测单光子返回时刻,精度可达毫米级。Apple iPhone LiDAR Scanner 采用此方案。
| 产品 | 类型 | 分辨率 | 帧率 | 范围 | 精度 | 价格 |
|---|---|---|---|---|---|---|
| Azure Kinect (DK) | iToF | 1024×1024 / 512×512 | 15/30 fps | 0.25~5.46 m | ±11 mm | ~$400 |
| Sony IMX556 (Lucid Helios2) | iToF | 640×480 | 30 fps | 0.3~8.3 m | ±5 mm @ 1m | ~$2,000 (相机) |
| PMD flexx2 | iToF | 224×172 | 60 fps | 0.1~4 m | ±10 mm | ~$500 |
ToF 相机的核心问题:多径干扰 (multipath interference),凹角、透明物体处深度值系统性偏差;飞点 (flying pixels),在深度不连续边缘产生错误中间值。
主动立体视觉 (Active Stereo)
结合结构光投影与双目立体匹配。投影红外纹理增强场景特征,使双目匹配在弱纹理区域(白墙、桌面)也能有效工作。Intel RealSense D400 系列实际上属于此类,而非纯结构光。
1.4 立体相机 (Stereo Cameras)
被动双目视觉通过两个固定基线的相机拍摄同一场景,利用视差 (disparity) 计算深度:
Z = (f × B) / d
Z 为深度,f 为焦距(像素),B 为基线长度(米),d 为视差(像素)。
深度精度与距离的平方成反比,与基线成正比:
ΔZ = Z² / (f × B) × Δd
Δd 为视差估计误差(通常 0.1~0.5 像素),这意味着 2 m 处的深度误差远大于 0.5 m 处。
Stereolabs ZED 2i 规格:
| 参数 | 规格值 |
|---|---|
| 分辨率 | 2208×1242 (2K) / 1920×1080 / 1280×720 / 672×376 |
| 帧率 | 15/30/60/100 fps (随分辨率递减) |
| 基线 | 120 mm |
| 视场角 | 110° (H) × 70° (V) |
| 深度范围 | 0.3~20 m |
| 深度精度 | <1% @ 0.5~3 m |
| IMU | 有 (加速度计 + 陀螺仪) |
| 接口 | USB 3.0 |
| 内置功能 | 神经网络深度估计、位置追踪 |
| IP 防护 | IP66 |
| 价格 | ~$500 |
ZED 2i 内置 NVIDIA Jetson 可直接运行的深度学习模型,在弱纹理区域通过学习型补全提升深度图质量。
1.5 事件相机 (Event Cameras)
事件相机与传统帧相机的根本区别:传统相机以固定帧率同步采集所有像素亮度值;事件相机中每个像素独立异步工作,仅当该像素检测到对数亮度变化超过阈值 C 时输出一个事件:
当 |log(I(x,y,t)) - log(I(x,y,t_last))| > C 时,输出事件 (x, y, t, p)
其中 p ∈ {+1, -1} 表示亮度增加或减少,t 为微秒级时间戳。
核心特性:
| 特性 | 事件相机 | 传统帧相机 |
|---|---|---|
| 时间分辨率 | 1~10 μs | 10 |
| 动态范围 | 120~140+ dB | 60~70 dB |
| 输出带宽 | 场景相关(稀疏) | 固定(全帧) |
| 运动模糊 | 无 | 有 |
| 功耗 | 10~50 mW | 500 mW~2 W |
| 冗余数据 | 极少 | 大量(静态区域) |
代表产品:
| 产品 | 分辨率 | 时间分辨率 | 动态范围 | 接口 | 价格 |
|---|---|---|---|---|---|
| iniVation DAVIS346 | 346×260 | 1 μs | 120 dB | USB 3.0 | ~$5,000 |
| Prophesee EVK4 HD | 1280×720 | 1 μs | >120 dB | USB 3.0 | ~$4,000 |
| CelePixel CeleX-V | 1280×800 | 1 μs | 120 dB | USB 3.0 | ~$3,000 |
| Samsung DVS Gen4 | 640×480 | <1 μs | 140 dB | MIPI | 研发中 |
DAVIS346 (Dynamic and Active-pixel Vision Sensor) 同时集成事件像素和传统帧像素,允许同步输出事件流和灰度帧,方便算法开发与调试。
机器人应用场景:高速抓取(需要 μs 级反应)、无人机在明暗交替环境(隧道出入口、室内外过渡)中的 SLAM、高动态场景下的视觉伺服。
当前限制:分辨率偏低,算法生态不成熟(大部分视觉算法基于帧设计),成本高,量产规模小。
2. LiDAR(激光雷达)
2.1 机械旋转式 (Mechanical Spinning)
工作原理:激光发射/接收模组安装在旋转电机上,以 10~20 Hz 速度 360° 旋转扫描。每个激光通道 (channel) 以固定垂直角度发射,多通道叠加形成三维点云。
旋转轴
│
┌───────┼───────┐
│ ┌────┼────┐ │
│ │ TX │ RX │ │
│ │ TX │ RX │ │ ← 多个通道(16/32/64/128 线)
│ │ TX │ RX │ │
│ │ TX │ RX │ │
│ └────┼────┘ │
└───────┼───────┘
│
旋转电机 (10~20 Hz)
测距方法为 dToF:发射 905 nm 或 1550 nm 短脉冲,SPAD 或 APD (Avalanche Photodiode) 检测返回脉冲,测量飞行时间。
代表产品:
| 品牌 | 型号 | 线数 | 范围 | 精度 | 点频 | 帧率 | FOV | 价格 |
|---|---|---|---|---|---|---|---|---|
| Ouster | OS1-128 | 128 | 120 m | ±1~3 cm | 5.2M pts/s | 10/20 Hz | 360°×45° | ~$8,000 |
| Ouster | OS0-128 | 128 | 50 m | ±1~5 cm | 5.2M pts/s | 10/20 Hz | 360°×90° | ~$8,000 |
| Velodyne | VLP-16 (Puck) | 16 | 100 m | ±3 cm | 300K pts/s | 5~20 Hz | 360°×30° | ~$4,000 |
| Velodyne | Alpha Prime | 128 | 245 m | ±3 cm | 4.8M pts/s | 10/20 Hz | 360°×40° | ~$75,000 |
| Hesai | Pandar128 | 128 | 200 m | ±1 cm | 6.9M pts/s | 10/20 Hz | 360°×40° | ~$30,000 |
机械旋转式的优势:360° 全视角、成熟的测距精度。劣势:旋转机构寿命有限、体积大(直径 85~120 mm)、成本高、抗震性差。
2.2 固态式 (Solid-State)
无旋转机构,通过 MEMS 微镜、OPA (Optical Phased Array) 或闪光 (Flash) 方式实现扫描。
MEMS 微镜方案:微型反射镜在两轴方向快速摆动,将激光束引导至不同方向。Livox 采用独特的”非重复扫描” (non-repetitive scan) 模式,积分时间越长覆盖密度越高。
Livox 花瓣形扫描模式(0.1s 内):
╭─────╮
╱ • • • ╲
│ • • │
│• ╳ •│ ← 中心密度高
│ • • │
╲ • • • ╱
╰─────╯
积分 1s 后覆盖率 > 99%
Flash LiDAR:一次发射覆盖整个 FOV(类似相机闪光灯),使用 SPAD 阵列接收。优点为无运动部件、帧率高;缺点为范围受限(发射功率分散)。
| 品牌 | 型号 | 技术 | 范围 | 精度 | 点频 | FOV | 价格 |
|---|---|---|---|---|---|---|---|
| Livox | Mid-360 | MEMS+旋转棱镜 | 70 m | ±2 cm | 200K pts/s | 360°×59° | ~$1,000 |
| Livox | HAP | MEMS | 150 m | ±2 cm | 450K pts/s | 120°×25° | ~$1,500 |
| Hesai | FT120 | Flash | 30 m | ±3 cm | 192K pts/frame | 100°×75° | ~$500 |
| Intel RealSense L515 | iToF LiDAR | 70 m | ±5 mm@1m | 23M pts/s | 70°×55° | 已停产 |
2.3 FMCW LiDAR (频率调制连续波)
传统 ToF LiDAR 测量脉冲往返时间;FMCW LiDAR 发射线性调频连续波,将返回光与本振光进行相干混频,通过拍频 (beat frequency) 同时获取距离和径向速度(多普勒效应)。
发射频率
▲
│ ╱╲ ╱╲ ╱╲
│ ╱ ╲ ╱ ╲ ╱ ╲ ← 发射信号(线性调频)
│ ╱ ╲╱ ╲╱ ╲
│ ╱
│╱ 返回信号(延迟 Δt)
│ ╱╲ ╱╲ ╱╲
│ ╱ ╲ ╱ ╲ ╱ ╲
│╱ ╲╱ ╲╱ ╲
└──────────────────────► 时间
拍频 f_beat = (B/T) × Δt
距离 R = (c × f_beat × T) / (2B)
速度 v = (Δf_doppler × λ) / 2
B 为调频带宽,T 为调频周期,λ 为激光波长。
FMCW 优势:
- 同时获得距离 + 速度(传统 dToF 只有距离)
- 相干检测灵敏度极高,远距离性能好
- 不受环境光干扰
- 可用 1550 nm 波长(人眼安全,允许更大功率)
代表产品:
| 品牌 | 型号 | 范围 | 精度 | 速度测量 | 价格 |
|---|---|---|---|---|---|
| Aeva | Aeries II | 500 m | ±2 cm | 有 (0.01 m/s 精度) | 未公开 (量产目标 <$500) |
| SiLC | Eyeonic Vision | 200 m | ±1 cm | 有 | 开发中 |
2.4 机器人 vs 自动驾驶 LiDAR 需求对比
| 需求维度 | 机器人(室内/近距) | 自动驾驶(室外/远距) |
|---|---|---|
| 范围需求 | 0.1~15 m | 10~300 m |
| 精度需求 | ±1~5 mm | ±1~5 cm |
| FOV 需求 | 宽视场 (>90° vertical) | 远距窄 + 近距宽 |
| 尺寸约束 | 严格 (<50 mm) | 相对宽松 |
| 抗震性 | 高 (关节振动) | 中等 |
| 成本预算 | $200~$2,000 | $500~$5,000 (量产目标) |
| 代表选型 | Livox Mid-360, Hesai FT120 | Hesai AT128, Aeva Aeries II |
3. 惯性测量单元 (IMU)
3.1 物理原理
MEMS 加速度计:质量块通过弹性梁悬挂于固定结构上。当受到加速度时,惯性力使质量块相对框架位移,位移通过电容变化检测:
固定极板
────────
┃ ┃
┌────┨ d₀ ┠────┐
│ ┃ ┃ │
│ ──────── │
│ ┃ ┃ │ ← 弹性梁
│ ┃ 质量 ┃ │
│ ┃ 块 ┃ │
│ ┃ ┃ │
└────┨ d₀ ┠────┘
┃ ┃
────────
固定极板
加速度 a 作用时:
ΔC = ε₀ × A × (1/(d₀-Δx) - 1/(d₀+Δx))
Δx = m × a / k (弹性恢复力平衡)
MEMS 陀螺仪:利用科里奥利力 (Coriolis effect)。振动质量块以已知频率驱动振动,当存在角速度时,科里奥利力在垂直于驱动方向和旋转轴的方向产生位移:
F_coriolis = -2m(ω × v_drive)
通过检测感测方向的位移(电容变化)测量角速度 ω。
3.2 噪声模型 (Allan Variance)
IMU 噪声通过 Allan 方差 (Allan Variance) 分析。在双对数坐标下,不同噪声源表现为不同斜率的直线段:
log(σ²(τ))
│
│╲
│ ╲ 斜率 = -1: 角度/速度随机游走 (ARW/VRW)
│ ╲
│ ────── 斜率 = 0: 偏置不稳定性 (Bias Instability)
│ ╱
│ ╱ 斜率 = +1: 速率随机游走
│ ╱
└────────────────────── log(τ)
τ_min (Bias Instability)
关键噪声参数:
| 噪声类型 | 符号 | 单位 (陀螺仪) | 单位 (加速度计) | 物理含义 |
|---|---|---|---|---|
| 角度随机游走 / 速度随机游走 | ARW / VRW | °/√h | m/s/√h | 白噪声积分后的扩散速率 |
| 偏置不稳定性 | BI | °/h | μg | 缓慢漂移的长时间稳定性下限 |
| 偏置重复性 | BR | °/h | mg | 开机间偏置变化 |
| 标度因子误差 | SF | ppm | ppm | 测量值与真值的比例偏差 |
3.3 IMU 等级对比
| 参数 | 消费级 (MPU-6050) | 战术级 (ADIS16490) | 导航级 (FOG) |
|---|---|---|---|
| ARW | 0.3 °/√h | 0.06 °/√h | 0.001 °/√h |
| Bias Instability (Gyro) | 20 °/h | 1.8 °/h | 0.003 °/h |
| VRW | 0.06 m/s/√h | 0.017 m/s/√h | 0.003 m/s/√h |
| Bias Instability (Accel) | 500 μg | 32 μg | 1 μg |
| 采样率 | 1 kHz | 4 kHz | 1~10 kHz |
| 价格 | $5 | $2,500 | $10,000~$100,000 |
| 尺寸 | 4×4×0.9 mm | 47×44×14 mm | 拳头大小 |
| 适用场景 | 手机、玩具 | 无人机、机器人 | 潜艇、导弹 |
机器人系统常用选型:
| 芯片 | 等级 | ARW | Bias Instability | 价格 | 应用 |
|---|---|---|---|---|---|
| BMI088 (Bosch) | 工业 | 0.2 °/√h | 8 °/h | ~$10 | 无人机飞控 |
| ICM-42688 (TDK) | 消费+ | 0.18 °/√h | 6 °/h | ~$5 | 机器人 VIO |
| ADIS16475 (ADI) | 工业 | 0.084 °/√h | 2 °/h | ~$300 | 精密导航 |
| ADIS16490 (ADI) | 战术 | 0.06 °/√h | 1.8 °/h | ~$2,500 | 军用/高精度 |
3.4 IMU 在传感器融合中的角色
IMU 提供高频(2004000 Hz)的短时运动估计,弥补视觉/LiDAR 的低帧率(1560 Hz)间隔。在视觉惯性里程计 (VIO) 中:
- IMU 在两个图像帧之间进行运动预积分 (preintegration)
- 视觉提供低频但全局一致的位姿修正
- 紧耦合 (tightly-coupled) 方案在同一优化问题中联合估计 IMU 偏置和视觉特征
IMU 单独积分定位的漂移速度:位置误差以 O(t²) 增长(加速度计偏置被双重积分),角度误差以 O(t) 增长。消费级 MEMS IMU 单独积分 10 秒后位置误差可达数米,因此必须与其他传感器融合。
4. 力/力矩传感器 (Force/Torque Sensors)
4.1 六轴力/力矩传感器工作原理
六轴 F/T (Force/Torque) 传感器同时测量三维力 (Fx, Fy, Fz) 和三维力矩 (Mx, My, Mz)。核心感测元件为应变片 (strain gauge) 组成的惠斯通电桥 (Wheatstone bridge)。
传感器结构截面:
外部法兰(连接工具/末端执行器)
╔════════════════════════╗
║ ║
║ 弹性体 (flexure) ║ ← 应变片贴附于此
║ ┌──┐ ┌──┐ ┌──┐ ║
║ │ │ │ │ │ │ ║ ← 多个弹性梁
║ └──┘ └──┘ └──┘ ║
║ ║
╚════════════════════════╝
内部法兰(连接机器人末端)
当力/力矩作用于外部法兰时,弹性体产生微小形变(μm 级),应变片电阻随形变变化:
ΔR/R = GF × ε
GF 为应变系数 (Gauge Factor,金属约 2,半导体约 100~200),ε 为应变量。
六个分量通过多个应变片的组合和标定矩阵 (calibration matrix) 解耦:
[Fx] [C11 C12 ... C16] [V1]
[Fy] [C21 C22 ... C26] [V2]
[Fz] = [C31 C32 ... C36] [V3]
[Mx] [C41 C42 ... C46] [V4]
[My] [C51 C52 ... C56] [V5]
[Mz] [C61 C62 ... C66] [V6]
其中 V1~V6 为各电桥的电压输出,C 为 6×6 标定矩阵。
4.2 代表产品规格
ATI Industrial Automation(市场主导者):
| 型号 | 力量程 (Fx/Fy) | 力量程 (Fz) | 力矩量程 | 分辨率 (力) | 分辨率 (力矩) | 采样率 | 价格 |
|---|---|---|---|---|---|---|---|
| Mini45 | ±580 N | ±1160 N | ±20 Nm | 0.125 N | 0.004 Nm | 7 kHz | ~$5,000 |
| Nano17 | ±25 N | ±35 N | ±0.25 Nm | 0.003 N | 0.015 Nmm | 7 kHz | ~$5,000 |
| Axia80 | ±200 N | ±600 N | ±10 Nm | 0.05 N | 0.005 Nm | 8 kHz | ~$4,000 |
| Gamma | ±65 N | ±200 N | ±5 Nm | 0.0125 N | 0.001 Nm | 7 kHz | ~$6,000 |
OnRobot HEX 系列(协作机器人集成):
| 型号 | 力量程 | 力矩量程 | 特点 | 价格 |
|---|---|---|---|---|
| HEX-E | ±200 N (Fz: 500 N) | ±10 Nm | 6 自由度 | ~$3,500 |
| HEX-H | ±600 N (Fz: 1500 N) | ±40 Nm | 重载版 | ~$4,000 |
4.3 关节力矩传感器 (Joint Torque Sensors)
区别于末端 F/T 传感器,关节力矩传感器安装在每个关节内部(减速器输出端),测量单轴力矩。
Franka Emika Panda 的设计:每个关节内置应变式力矩传感器,7 个关节共 7 个力矩测量通道,采样率 1 kHz。这使得 Panda 无需末端 F/T 传感器即可实现:
- 全身碰撞检测(力矩突变 > 阈值时紧急停止)
- 关节级阻抗控制 (impedance control)
- 重力补偿(精确测量每个关节的实际力矩并与模型对比)
- 外力估计(通过全身动力学模型反推末端接触力)
力矩分辨率:约 0.05 Nm。力矩范围:根据关节不同,12~87 Nm。
4.4 力传感与阻抗控制
力传感是实现阻抗控制 (Impedance Control) 的硬件基础。阻抗控制将机器人末端建模为弹簧阻尼系统:
F_ext = M × ẍ + D × ẋ + K × (x - x_d)
M 为期望惯量矩阵,D 为期望阻尼矩阵,K 为期望刚度矩阵,x_d 为期望位置。
无力传感时,机器人只能做位置控制,接触刚性环境时力会瞬间上升导致碰撞。有力传感时,控制器可实时调整位置轨迹以维持期望的力/位移关系,实现安全的物理交互(擦桌子、插拔、装配)。
力传感器的带宽和噪声直接决定阻抗控制的性能上限。1 kHz 以上的采样率和 0.01 N 级别的力分辨率是实现精细接触操控的基本要求。
5. 触觉传感器 (Tactile Sensors)
5.1 电阻式/电容式阵列
电阻式 (Piezoresistive):压敏材料(导电橡胶、导电织物)在受压时电阻降低。简单、成本低,但非线性严重、迟滞 (hysteresis) 大(20%~40%)、温度漂移明显。
电容式 (Capacitive):两个导电层之间夹柔性介电层,受压时极板间距减小,电容增大:
C = ε₀ × εᵣ × A / d
压缩时 d 减小,C 增大。优点为线性好、迟滞小 (<5%);缺点为对电磁干扰敏感、布线复杂。
| 类型 | 空间分辨率 | 力分辨率 | 量程 | 迟滞 | 成本/单元 |
|---|---|---|---|---|---|
| 电阻式 (FSR 阵列) | 2~5 mm | 0.1 N | 0~100 N | 20~40% | $1~5 |
| 电容式 (MEMS) | 0.5~2 mm | 0.01 N | 0~10 N | <5% | $10~50 |
| 压电式 | 1~3 mm | 0.001 N | 动态 only | N/A | $20~100 |
5.2 光学触觉传感器 (Optical Tactile Sensors)
GelSight 工作原理
GelSight 由 MIT 的 Edward Adelson 团队于 2009 年提出,其核心结构:
┌─────────────────────────────────┐
│ 弹性体 (Elastomer) │ ← 透明硅胶,表面涂反射涂层
│ ╔═══════════════════════╗ │
│ ║ 反射涂层 (Reflective ║ │ ← 接触面(朝外)
│ ║ Coating) ║ │
│ ╚═══════════════════════╝ │
│ │
│ LED (R) LED (G) LED (B) │ ← 多方向多色 LED
│ ● ● ● │
│ │
│ ┌───────────┐ │
│ │ Camera │ │ ← 内部 RGB 相机
│ └───────────┘ │
└─────────────────────────────────┘
工作流程:
- 物体接触弹性体表面时,使弹性体内表面产生局部形变
- 多方向 RGB LED 照亮形变后的反射涂层
- 内部相机拍摄涂层图像
- 通过光度立体法 (Photometric Stereo) 从多色照明重建表面法向量场
- 法向量积分得到高精度三维形状
GelSight 的测量能力:
- 空间分辨率:25~50 μm(由相机分辨率和光学系统决定)
- 深度分辨率:1~2 μm
- 可测量:接触面三维形状、法向量场、剪切力场、滑移检测
DIGIT (Meta/Facebook AI Research)
DIGIT 是 GelSight 原理的工程化实现,由 Meta FAIR 于 2020 年开源:
| 参数 | DIGIT | GelSight Mini |
|---|---|---|
| 尺寸 | 20×27×33 mm | 25×25×28 mm |
| 分辨率 | 640×480 | 320×240~640×480 |
| 帧率 | 60 fps | 30~60 fps |
| 接口 | USB 2.0 | USB |
| 弹性体 | 定制硅胶 | 定制硅胶 |
| 开源 | 是(硬件 + 软件) | 部分 |
| 价格 | ~$15 (DIY) / ~$300 (商用) | ~$400 |
| 耐久性 | 弹性体寿命约 10,000~50,000 次接触 | 类似 |
BioTac (SynTouch)
BioTac 模拟人指尖结构:
┌─────────────────────────┐
│ 柔性皮肤层 │ ← 弹性外壳 + 指纹状脊纹
│ ┌─────────────────┐ │
│ │ 导电液体 │ │ ← 模拟皮下组织
│ │ ┌───────────┐ │ │
│ │ │ 电极阵列 │ │ │ ← 19 个阻抗电极
│ │ │ + 温度 │ │ │
│ │ │ + 压力 │ │ │
│ │ └───────────┘ │ │
│ └─────────────────┘ │
└─────────────────────────┘
测量维度:
- 19 通道阻抗(空间压力分布)
- 1 通道液压(总法向力,0~30 N)
- 1 通道温度(热导率区分材质)
- 可检测振动到 1 kHz(滑移检测)
| 参数 | 规格 |
|---|---|
| 空间分辨率 | ~2 mm (19 电极) |
| 力分辨率 | 0.01 N |
| 力量程 | 0~30 N |
| 温度分辨率 | 0.003 °C |
| 采样率 | 100 Hz (全通道) / 2.2 kHz (压力+温度) |
| 价格 | ~$16,000 |
FingerVision
FingerVision 通过透明弹性体 + 外部相机实现视触觉融合:相机同时观察接触面形变和透过弹性体看到的物体视觉信息。
5.3 触觉传感的当前困境
触觉传感是人形机器人感知系统中最薄弱的环节,原因如下:
| 挑战 | 现状 | 需求目标 |
|---|---|---|
| 空间分辨率 | 1 | 人指尖: ~1 mm, 40+ 感受器/cm² |
| 覆盖面积 | 指尖局部 | 全手掌、全身(人体 ~1.7 m² 皮肤) |
| 耐久性 | 弹性体 10K~50K 次接触后磨损 | 百万次级别 |
| 成本 | $300~$16,000/指尖 | $10/指尖 (规模化目标) |
| 多模态 | 力 OR 形状 OR 温度 | 同时测量力+形状+温度+振动 |
| 柔性布线 | 刚性 PCB 为主 | 柔性电子、织物传感器 |
| 标准化 | 无通用接口 | 类似相机的标准化协议 |
人手指尖拥有约 2,500 个触觉感受器(Merkel 细胞、Meissner 小体、Pacini 小体、Ruffini 末梢),两点辨别阈值约 1~2 mm,力分辨率约 0.01 N。当前最好的人工触觉传感器在综合指标上仍与人手有数量级差距。
6. 本体感知 (Proprioception)
6.1 关节编码器 (Joint Encoders)
编码器测量关节旋转角度,分为增量式 (Incremental) 和绝对式 (Absolute)。
增量式编码器:输出脉冲序列(A/B 相正交信号),通过计数脉冲数确定相对位移。需要上电归零 (homing)。
A 相: ┌──┐ ┌──┐ ┌──┐ ┌──┐
│ │ │ │ │ │ │ │
───┘ └──┘ └──┘ └──┘ └───
B 相: ┌──┐ ┌──┐ ┌──┐ ┌──┐
│ │ │ │ │ │ │ │
──────┘ └──┘ └──┘ └──┘ └─
正转:A 领先 B 90°
反转:B 领先 A 90°
4x 解码:每周期计数 4 (上升沿 + 下降沿 × 2 通道)
绝对式编码器:输出当前绝对角度值,无需归零。实现方式:光学码盘 (Gray code)、磁编码器 (磁铁 + 霍尔阵列/AMR)。
| 类型 | 分辨率 | 精度 | 优点 | 缺点 | 代表产品 |
|---|---|---|---|---|---|
| 增量式光学 | 10,000~100,000 CPR | ±1~5 arc-sec | 高分辨率、高速 | 需归零、怕灰尘 | Renishaw ATOM |
| 绝对式光学 | 17~23 bit (单圈) | ±5~20 arc-sec | 无需归零、高精度 | 成本高 | Renishaw RESOLUTE |
| 绝对式磁性 | 12~14 bit | ±0.05~0.1° | 紧凑、耐脏 | 精度较低 | AS5047P (ams) |
| 绝对式磁性 | 17~19 bit | ±0.02° | 紧凑、高精度 | 温漂需补偿 | AS5147U (ams) |
机器人中的典型配置:
协作机器人通常在减速器两端各安装一个编码器:
- 电机侧 (Motor-side):高分辨率增量编码器(10,000+ CPR),用于电机换相和速度环控制
- 关节输出侧 (Link-side):绝对式编码器(17+ bit),用于实际关节角度测量
两个编码器的差值可以推算减速器柔性形变和关节力矩(替代力矩传感器的低成本方案)。
6.2 电机电流感测力矩估计
通过测量电机驱动电流估算输出力矩:
τ_motor = K_t × I_motor
τ_joint = τ_motor × N_gear × η_gear
K_t 为电机力矩常数 (Nm/A),N_gear 为减速比,η_gear 为传动效率。
优点:不需额外力矩传感器,成本极低。 缺点:受摩擦力影响大(静摩擦、粘滞摩擦、库仑摩擦),估计精度通常为实际力矩的 10%~30%;无法检测外部碰撞的高频分量;减速器回程差 (backlash) 导致力矩传递非线性。
电流测量通常通过分流电阻 (shunt resistor) 或霍尔电流传感器实现,采样率与 PWM 频率同步(10~50 kHz)。
6.3 MCU 集成与控制频率
本体感知数据由嵌入式微控制器 (MCU) 实时采集与处理:
| 控制层 | 频率 | 处理内容 | 典型硬件 |
|---|---|---|---|
| 电流环 (Current Loop) | 10~50 kHz | 电机换相、电流 PI 控制 | STM32G4, TMS320F28x |
| 速度环 (Velocity Loop) | 1~10 kHz | 速度 PID、编码器解码 | 同上 |
| 位置/力矩环 | 1 kHz | 关节位置控制、力矩控制 | STM32H7, RT1050 |
| 运动规划层 | 100~500 Hz | 逆运动学、轨迹插值 | ARM Cortex-A (Linux) |
关节级 MCU 通过实时总线(EtherCAT、CAN-FD)与中央控制器通信,延迟 < 1 ms。EtherCAT 总线支持 1 kHz 以上的确定性通信周期,是当前高性能机器人的主流选择。
7. 传感器标定 (Sensor Calibration)
7.1 相机内参标定 (Intrinsic Calibration)
针孔模型 (Pinhole Model)
三维点 P = (X, Y, Z) 在图像平面的投影:
┌ u ┐ ┌ fx 0 cx ┐ ┌ X/Z ┐
│ v │ = │ 0 fy cy │ │ Y/Z │
└ 1 ┘ └ 0 0 1 ┘ └ 1 ┘
fx, fy 为焦距(像素单位),(cx, cy) 为主点 (principal point)。
畸变模型 (Distortion Model)
径向畸变 (Radial Distortion):
x_distorted = x(1 + k1*r² + k2*r⁴ + k3*r⁶)
y_distorted = y(1 + k1*r² + k2*r⁴ + k3*r⁶)
r² = x² + y²,(x,y) 为归一化坐标。
切向畸变 (Tangential Distortion):
x_distorted += 2*p1*x*y + p2*(r² + 2*x²)
y_distorted += p1*(r² + 2*y²) + 2*p2*x*y
完整畸变参数向量:[k1, k2, p1, p2, k3](OpenCV 5 参数模型)。高阶模型可扩展至 8 或 12 参数。
标定流程 (OpenCV)
import cv2
import numpy as np
# 准备棋盘格角点坐标 (世界坐标系, z=0)
objp = np.zeros((rows*cols, 3), np.float32)
objp[:, :2] = np.mgrid[0:cols, 0:rows].T.reshape(-1, 2) * square_size
obj_points = [] # 世界坐标
img_points = [] # 图像坐标
for image in calibration_images:
gray = cv2.cvtColor(image, cv2.COLOR_BGR2GRAY)
ret, corners = cv2.findChessboardCorners(gray, (cols, rows), None)
if ret:
# 亚像素级精细化
corners = cv2.cornerSubPix(gray, corners, (11,11), (-1,-1),
(cv2.TERM_CRITERIA_EPS + cv2.TERM_CRITERIA_MAX_ITER, 30, 0.001))
obj_points.append(objp)
img_points.append(corners)
# 标定
ret, K, dist, rvecs, tvecs = cv2.calibrateCamera(
obj_points, img_points, gray.shape[::-1], None, None)
# K = [[fx, 0, cx], [0, fy, cy], [0, 0, 1]]
# dist = [k1, k2, p1, p2, k3]
重投影误差 (Reprojection Error) < 0.5 像素表示标定质量良好。
7.2 手眼标定 (Hand-Eye Calibration)
确定相机坐标系与机器人末端执行器坐标系之间的固定变换关系。分为两种安装方式:
Eye-in-Hand(相机安装在末端):
A_i × X = X × B_i
A_i: 机器人末端从位姿 i 到位姿 j 的相对变换 (已知, 从关节编码器计算)
B_i: 相机从位姿 i 到位姿 j 的相对变换 (已知, 从标定板检测计算)
X: 相机到末端的固定变换 (待求)
Eye-to-Hand(相机固定在外部):
A_i × X = X × B_i (公式形式相同, 但 A 和 B 的含义不同)
经典求解方法:Tsai-Lenz (1989), Park-Martin (1994), Daniilidis (1999, 对偶四元数)。
实际操作:驱动机器人运动到 15~25 个不同位姿(覆盖旋转和平移的各个方向),在每个位姿记录关节角度和标定板检测结果,联立求解。
7.3 IMU 与相机联合标定 (Kalibr)
Kalibr (ETH Zurich) 是最广泛使用的视觉惯性标定工具,同时标定:
- 相机内参与畸变
- IMU 内参(轴偏差、标度因子)
- 相机与 IMU 之间的时空变换 T_cam_imu
- 时间偏移 t_offset (通常 1~30 ms)
标定过程:在标定板前以丰富运动模式(平移 + 旋转、各轴激励)移动传感器组合,记录图像序列和 IMU 数据,通过非线性优化联合估计所有参数。
关键约束:IMU 必须在标定过程中被充分激励(三轴加速度和三轴角速度都应覆盖),运动需包含足够的高频激励以观测 IMU 时间偏移。
7.4 LiDAR 与相机外参标定
确定 LiDAR 坐标系与相机坐标系之间的刚体变换 [R|t]。
目标法 (Target-based):使用已知几何形状的标定板(带孔洞的棋盘格),在 LiDAR 点云中检测平面/边缘,在图像中检测角点,建立对应关系。
无目标法 (Targetless):利用场景中的自然特征(边缘、平面),通过互信息 (Mutual Information) 或深度不连续一致性优化外参。
典型精度:旋转误差 < 0.5°,平移误差 < 2 cm。
7.5 时间同步 (Time Synchronization)
多传感器融合对时间同步精度要求极高。1 ms 的时间偏差在 1 m/s 运动速度下造成 1 mm 的位置误差。
| 同步方式 | 精度 | 复杂度 | 适用场景 |
|---|---|---|---|
| 硬件触发 (GPIO) | <10 μs | 高(需定制硬件) | 高精度系统 |
| PTP (IEEE 1588) | <1 μs | 中(需网络支持) | 工业系统 |
| NTP | 1~10 ms | 低 | 非实时场景 |
| 软件时间戳 + 离线校正 | 1~5 ms | 低 | 快速原型 |
硬件触发方案:
MCU Timer (1 kHz 中断)
│
├── GPIO → 相机外触发 (曝光开始时刻已知)
├── GPIO → LiDAR 同步脉冲
├── GPIO → IMU 数据就绪中断
│
└── 统一时间基准 (共同时钟源)
IMU 通常是最高频传感器 (200~4000 Hz),作为时间插值的参考轴。相机和 LiDAR 的时间戳对齐到 IMU 时钟,通过硬件触发确保确定性延迟。
8. 传感器融合基础 (Sensor Fusion Fundamentals)
8.1 多模态融合的必要性
单一传感器模态存在系统性失效模式 (failure mode),无法满足机器人全场景需求:
| 传感器 | 失效场景 |
|---|---|
| RGB 相机 | 黑暗环境、强逆光、弱纹理表面、运动模糊 |
| 深度相机(结构光) | 室外强光、黑色吸光表面、镜面反射、>10m 距离 |
| LiDAR | 雾/雨/雪散射、黑色低反射率、玻璃/水面、高成本 |
| IMU | 长时间漂移(积分误差)、无绝对位置参考 |
| 超声波 | 高频吸收、多径、窄视角 |
| 触觉 | 仅接触时有效、覆盖面积有限 |
互补性 (Complementarity) 是融合的核心价值:
传感器 A 失效 传感器 B 有效
× ✓ → 系统仍工作
传感器 B 失效 传感器 A 有效
✓ × → 系统仍工作
同时失效的概率: P(A失效) × P(B失效) << max(P(A失效), P(B失效))
(假设失效模式独立)
8.2 融合层次
| 融合层次 | 英文 | 输入 | 输出 | 优缺点 |
|---|---|---|---|---|
| 早期融合 (原始数据级) | Early/Raw Fusion | 原始传感器数据 | 统一特征表示 | 信息损失小,但数据维度高、对齐困难 |
| 特征级融合 | Feature-level Fusion | 各模态提取的特征 | 联合特征 | 平衡信息量与计算量 |
| 晚期融合 (决策级) | Late/Decision Fusion | 各模态独立估计结果 | 最终决策 | 简单、模块化,但信息损失大 |
具体示例:
- 早期融合:将深度图与 RGB 图拼接为 RGBD 4 通道输入神经网络
- 特征级融合:LiDAR 点云特征 + 图像 CNN 特征在 BEV (Bird’s Eye View) 空间拼接
- 晚期融合:LiDAR 3D 检测结果与相机 2D 检测结果在目标级关联匹配
8.3 传感器模态综合对比
| 维度 | RGB 相机 | 深度相机 | LiDAR | IMU | 触觉 |
|---|---|---|---|---|---|
| 信息密度 | 极高 (百万像素) | 高 (30~100万点) | 中 (10~500万点/s) | 低 (6 DoF) | 低~中 |
| 工作距离 | 0.1~∞ m | 0.1~10 m | 1~300 m | N/A | 0 (接触) |
| 环境光依赖 | 高 | 中(红外) | 无 | 无 | 无 |
| 精度类型 | 2D 高精度 | 3D 中等精度 | 3D 高精度 | 相对运动 | 局部高精度 |
| 帧率 | 30~1000 Hz | 30~90 Hz | 10~20 Hz | 200~4000 Hz | 30~1000 Hz |
| 功耗 | 0.5~3 W | 2~8 W | 8~25 W | 0.01~0.1 W | 0.01~1 W |
| 成本 | $10~$1,000 | $200~$2,000 | $500~$75,000 | $5~$2,500 | $15~$16,000 |
| 数据量 | 大 (30 MB/s@1080p30) | 大 (10~30 MB/s) | 中 (5~50 MB/s) | 极小 (<1 KB/s) | 小 |
8.4 经典融合框架
视觉惯性里程计 (VIO) 是机器人中最常见的融合范式:
| 算法 | 融合方式 | 前端 | 后端 | 开源 | 精度 (EuRoC) |
|---|---|---|---|---|---|
| VINS-Mono | 紧耦合 | 光流+特征点 | 滑窗优化 | 是 | ATE ~0.1 m |
| OKVIS2 | 紧耦合 | 特征点匹配 | 关键帧优化 | 是 | ATE ~0.08 m |
| MSCKF | 紧耦合 | 特征点 | EKF | 是 | ATE ~0.15 m |
| ORB-SLAM3 | 紧耦合 | ORB 特征 | BA + 图优化 | 是 | ATE ~0.05 m |
LiDAR 惯性里程计 (LIO):
| 算法 | 特点 | 点云处理 | 开源 |
|---|---|---|---|
| LIO-SAM | 因子图、紧耦合 | 特征提取 (边+面) | 是 |
| FAST-LIO2 | 直接法、iKD-tree | 全点云直接配准 | 是 |
| Point-LIO | 逐点处理、高频 | 逐点更新 | 是 |
9. 公司格局表 (Industry Landscape)
9.1 视觉与深度传感
| 公司 | 总部 | 核心产品 | 技术路线 | 市场定位 | 估值/营收 |
|---|---|---|---|---|---|
| Intel RealSense (已剥离) | 美国 | D400/L500 系列 | 主动立体+结构光 | 机器人/无人机 | 独立运营中 |
| Stereolabs | 法国 | ZED 系列 | 被动/主动立体 | 机器人/空间计算 | 私有 |
| Orbbec (奥比中光) | 中国深圳 | Femto/Gemini 系列 | 结构光+iToF | 机器人/3D 扫描 | 已上市 (688322.SH) |
| iniVation | 瑞士 | DAVIS/DVXplorer | 事件相机 | 研究/工业 | 私有,A 轮 |
| Prophesee | 法国 | EVK 系列 | 事件相机 | 汽车/工业/IoT | $200M+ 融资 |
| Sony Semiconductor | 日本 | IMX 系列传感器芯片 | CMOS Image Sensor | 芯片供应商 | 万亿日元级营收 |
| Basler | 德国 | ace/dart/boost 系列 | 工业相机 | 工业视觉 | 已上市 (BSL.DE) |
| Teledyne FLIR | 美国 | Blackfly/Firefly | 工业相机 | 工业/科研 | Teledyne 子公司 |
9.2 LiDAR
| 公司 | 总部 | 核心产品 | 技术路线 | 主要市场 | 状态 |
|---|---|---|---|---|---|
| Velodyne (Ouster 合并) | 美国 | VLP/Alpha | 机械旋转 | 自动驾驶/机器人 | 与 Ouster 合并 |
| Ouster | 美国 | OS 系列 | 数字 LiDAR (SPAD) | 自动驾驶/机器人/测绘 | 已上市 (OUST) |
| Livox (DJI) | 中国深圳 | Mid-360/HAP/Tele-15 | MEMS+棱镜 | 自动驾驶/机器人 | DJI 子公司 |
| Hesai (禾赛) | 中国上海 | AT128/FT120/Pandar | 机械+MEMS+Flash | 自动驾驶/机器人 | 已上市 (HSAI) |
| Aeva | 美国 | Aeries II | FMCW | 自动驾驶/工业 | 已上市 (AEVA) |
| RoboSense (速腾聚创) | 中国深圳 | M 系列/E 系列 | MEMS+机械 | 自动驾驶 | 已上市 (2498.HK) |
| Luminar | 美国 | Iris | 机械扫描 1550nm | 自动驾驶 (OEM) | 已上市 (LAZR) |
9.3 力觉与触觉
| 公司 | 总部 | 核心产品 | 技术 | 市场定位 | 状态 |
|---|---|---|---|---|---|
| ATI Industrial Automation | 美国 | Mini/Nano/Gamma/Omega | 应变片 F/T | 工业机器人 | Novanta 子公司 |
| Robotiq | 加拿大 | FT 300-S | 应变片 F/T | 协作机器人 | 私有 |
| OnRobot | 丹麦 | HEX-E/H | 应变片 F/T | 协作机器人 | 私有 |
| GelSight Inc. | 美国 | GelSight Mini/Svelte | 光学触觉 | 机器人/质检 | 私有,种子轮 |
| Meta FAIR | 美国 | DIGIT | 光学触觉 (开源) | 研究 | Meta 内部 |
| SynTouch | 美国 | BioTac | 多模态触觉 | 研究/假肢 | 私有,小规模 |
| Contactile | 澳大利亚 | 3-axis tactile | 光学式 | 工业抓取 | 私有 |
| XELA Robotics | 日本 | uSkin | 电容式全覆盖 | 协作机器人 | 私有 |
9.4 IMU 与惯性传感
| 公司 | 总部 | 核心产品 | 技术 | 等级 | 状态 |
|---|---|---|---|---|---|
| Analog Devices (ADI) | 美国 | ADIS16475/16490/16500 | MEMS | 工业~战术 | 已上市 (ADI) |
| Bosch Sensortec | 德国 | BMI088/BMI270/BMI323 | MEMS | 消费~工业 | Bosch 子公司 |
| TDK InvenSense | 日本 | ICM-42688/ICM-45686 | MEMS | 消费~工业 | TDK 子公司 |
| STMicroelectronics | 瑞士 | LSM6DSO/ISM330DHCX | MEMS | 消费~工业 | 已上市 (STM) |
| Honeywell | 美国 | HG1930/HG4930 | RLG/FOG | 导航级 | 已上市 (HON) |
| Northrop Grumman | 美国 | LN-200/LN-270 | FOG | 导航级 | 已上市 (NOC) |
10. 成本趋势与投资视角 (Cost Trends & Investment Perspective)
10.1 LiDAR 成本曲线 (2018~2026)
价格 (USD)
│
70K │ ● Velodyne HDL-64E (2018)
│
60K │
│
50K │
│
40K │
│
30K │ ● Hesai Pandar128 (2020)
│
20K │
│
10K │ ● Ouster OS1-128 (2021)
│ ● Hesai AT128 (2022, 车规)
5K │ ● Ouster OS1-128 (2023)
│
2K │ ● Livox Mid-360 (2023)
1K │ ● ● Livox Mid-360 / Hesai FT120 (2024~2025)
500 │ ● Flash LiDAR 目标 (2026)
│
└────┬────┬────┬────┬────┬────┬────► 年份
2018 2019 2020 2021 2022 2023 2024~26
关键趋势:
- 2018~2023:128 线机械 LiDAR 价格从 $70,000 降至 $8,000(约 8x 降幅)
- 2022
2025:固态 LiDAR 进入 $500$2,000 区间 - 2025
2027:Flash LiDAR 目标 $200$500(30m 范围,机器人近距场景) - FMCW LiDAR 仍在 $3,000+ 阶段,预计 2027~2028 年进入 $500 以下
驱动因素:自动驾驶量产拉动规模效应、芯片化集成 (SoC LiDAR)、Flash 方案去除机械/MEMS 部件。
10.2 触觉传感器:最大未满足需求
当前市场规模:触觉传感器在机器人中的渗透率 < 5%,绝大多数工业机器人仍无触觉能力。
| 时间节点 | 预期进展 | 投资含义 |
|---|---|---|
| 2024~2025 | GelSight/DIGIT 在研究实验室普及,单个 $300~$400 | 技术验证期 |
| 2025~2026 | 人形机器人原型(Tesla Optimus, Figure 01)开始集成触觉 | 需求信号出现 |
| 2026~2028 | 柔性电子触觉 skin 原型(大面积覆盖),成本降至 $50/指尖 | 早期产业化 |
| 2028~2030 | 全手/全身触觉量产方案,成本 $10~$20/指尖 | 规模化拐点 |
技术路径竞争:
- 光学触觉 (GelSight 类):高分辨率但体积受限,难全身覆盖
- 电容式柔性阵列 (XELA 类):可覆盖大面积,分辨率有限
- 柔性电子皮肤:学术前沿(Stanford, MIT),可量产性未验证
投资关注点:谁能解决”高分辨率 + 大面积覆盖 + 低成本 + 耐久性”的四角矛盾。
10.3 深度相机商品化
深度相机已从 2014 年的 $400+ (原版 Kinect) 降至 2025 年的 $100~$300 区间,技术路线收敛:
| 价格区间 | 产品 | 场景 |
|---|---|---|
| $30~$80 | 手机 ToF 模组 (Sony IMX316) | 消费电子 |
| $100~$200 | Orbbec Gemini 2, Oak-D Lite | 教育/入门机器人 |
| $200~$400 | Intel D435i, ZED Mini | 主流机器人 |
| $400~$800 | Azure Kinect, ZED 2i | 高性能机器人 |
| $1,000~$3,000 | Lucid Helios2, Photoneo | 工业 3D 视觉 |
投资判断:深度相机硬件已进入利润率压缩阶段,纯硬件创业机会有限。价值正向上游芯片 (Sony, 奥比中光自研 iToF 芯片) 和下游算法/解决方案转移。
10.4 传感器产业关键判断
-
LiDAR:固态化+芯片化是确定趋势,FMCW 是下一代技术高地。Hesai 和 Ouster 在机器人市场有先发优势。Aeva 的 FMCW 如能量产至 $500 以下,将改变游戏规则。
-
触觉:当前处于”类似 2015 年的 LiDAR 阶段”,技术路线未收敛,量产方案未定型。这是具身智能硬件中确定性最高的增量赛道。
-
视觉:传感器硬件本身不再是壁垒(Sony 芯片主导),壁垒在感知算法和系统集成。事件相机若成本降至 $200 以下,将在高速/高动态机器人场景中快速渗透。
-
IMU:MEMS 惯性传感器已高度商品化(Bosch, TDK 主导),利润率低。机会在高精度战术/导航级 (ADI, Honeywell) 和新型架构 (原子惯性传感器)。
-
力觉:ATI 长期主导六轴 F/T 市场,但关节内置力矩传感器(Franka 方案)正使独立 F/T 传感器在协作机器人中的必要性降低。
参考文献
- Szeliski, R. (2022). Computer Vision: Algorithms and Applications (2nd ed.). Springer.
- Hartley, R., & Zisserman, A. (2004). Multiple View Geometry in Computer Vision (2nd ed.). Cambridge University Press.
- Gallego, G., et al. (2020). “Event-based Vision: A Survey.” IEEE TPAMI, 44(1), 154-180.
- Li, Y., et al. (2020). “GelSight: High-Resolution Robot Tactile Sensors for Estimating Geometry and Force.” Sensors, 17(12), 2762.
- Lambeta, M., et al. (2020). “DIGIT: A Novel Design for a Low-Cost Compact High-Resolution Tactile Sensor with Application to In-Hand Manipulation.” IEEE RA-L, 5(3), 3838-3845.
- Furgale, P., Rehder, J., & Siegwart, R. (2013). “Unified Temporal and Spatial Calibration for Multi-Sensor Systems.” IROS 2013.
- Qin, T., Li, P., & Shen, S. (2018). “VINS-Mono: A Robust and Versatile Monocular Visual-Inertial State Estimator.” IEEE TRO, 34(4), 1004-1020.
- Xu, W., et al. (2022). “FAST-LIO2: Fast Direct LiDAR-Inertial Odometry.” IEEE TRO, 38(4), 2053-2073.
- Dahiya, R. S., et al. (2010). “Tactile Sensing: From Humans to Humanoids.” IEEE TRO, 26(1), 1-20.
- Woodman, O. J. (2007). “An introduction to inertial navigation.” Technical Report, University of Cambridge.
- Intel RealSense D400 Series Datasheet. Intel Corporation.
- Ouster OS Sensor Datasheet. Ouster, Inc.
- ATI F/T Sensor Product Catalog. ATI Industrial Automation.
本文档为 Index 具身智能研究项目的第二层:传感器与感知硬件。上一层:机械本体与执行器,下一层:状态估计与SLAM。