01 事件相机基础原理
我方相机基于锐视智芯(AlpsenTek)HVS 融合视觉芯片:同一像素阵列同时输出 APS 图像流与 EVS 事件流。融合架构详见 HVS 融合视觉;术语见 术语表;数据格式见 数据格式。
1.什么是事件数据?
基本原理
数据通过异步事件流的形式记录场景变化,与传统帧式图像传感器不同,其每个像素独立工作,仅在检测到亮度变化(如物体运动、光线突变)时触发事件。
这种机制类似于人眼视网膜中神经元的活动方式:仅传递动态信息,忽略静态背景。

事件相机仿视网膜机制原理示意
事件相机由成千上万个独立工作的像素单元组成。每个像素都以微秒级的响应速度, 独立监测其视野内的亮度变化 。一旦检测到亮度变化超过设定阈值,该像素就会立即生成一个“事件”。
每个事件包含以下信息:
x, y:像素位置t:时间戳(通常为微秒级)p:极性(表示亮度是变亮还是变暗)
事件 = (x, y, t, polarity)
不同于帧图像的同步读取,事件是 异步 、稀疏和连续地产生的。这种数据格式让我们从“拍照片”的模式,迈入了“感知变化”的新纪元。
,当高尔夫球手挥杆时,传感器仅捕捉球和球杆的移动轨迹,而不会记录静止的天空或草地。
像素级工作原理
要理解事件相机上述特性的来源,需深入到单个像素:
- 像素独立工作:每个像素有自己的电路,只监测自己那一点的亮度,不依赖其他像素、不等待全局曝光——这是"异步"的物理来源。
- 对数亮度响应:像素测量的是亮度的对数变化(而非线性亮度)。同样比例的亮度变化(如翻倍、减半)产生相同大小的响应,无论背景是强光还是弱光——这正是事件相机高动态范围的根源。
- 阈值跨越触发:当对数亮度的变化量累积超过设定阈值时,像素立即发出一个事件,不等其他像素、不等"曝光周期"——这是微秒级响应、无运动模糊的来源。
- 极性(ON/OFF):变亮超过阈值 → ON 事件(p=1);变暗超过阈值 → OFF 事件(p=0)。静止不变的像素不发事件——这是稀疏、低功耗、低带宽的来源。
- EPS(Events Per Second,事件率):单位时间产生的事件数,衡量场景的动态繁忙程度。剧烈运动或抖动场景 EPS 高,静止场景 EPS 接近零。

单像素视角:对数亮度变化累积超过阈值(±C)的瞬间立即发出事件——变亮越阈 → ON,变暗越阈 → OFF;每次事件后阈值带随参考电平重置,静止时无输出。
一句话本质区别:帧相机 = "定时全幅采样"(固定帧率、所有像素同步);事件相机 = "每像素异步变化驱动"。微秒时间分辨率、低延迟、稀疏、低功耗、高动态范围——全部源于这一根本差异。
技术特点
- 异步性与实时性事件数据以连续流形式输出,响应速度达亚毫秒级,避免了传统帧式传感器的运动模糊问题。每个像素独立触发,数据生成不受固定帧率限制,适用于高速场景(如快速移动物体追踪)。
- 数据稀疏性与低功耗由于仅记录动态信息,事件数据量仅为传统图像传感器的1/10至1/1000,显著降低算力需求和功耗。
- 强环境适应性 事件传感器可在极端光照条件下(如低光或高光)稳定工作,通过独立像素触发机制自动适应亮度变化,避免传统传感器的曝光不足或过曝问题。
- 高时间分辨率事件相机具有微秒级时间精度,能够捕捉到高速运动中最微小的亮度变化。无论目标多快,事件都不会“模糊”。传统帧相机以 30FPS 捕捉图像,事件相机则以百万级事件/秒响应变化。
- 超低延迟事件是即时生成的,无需等待整帧图像采集。这使得事件视觉在实时控制、避障、手势识别等任务中极具优势。
- 动态范围极高由于每个像素单独处理变化,事件视觉能在 100dB 或更高的动态范围下工作。即使在强光与暗影并存的环境下,也能保持清晰识别。
- 数据稀疏性只有变化部分才会触发事件,数据量大幅减少。更高的压缩比意味着更低的带宽和存储需求。
2.事件数据 vs. 传统帧图像
| 特性 | 传统帧相机 | 事件相机 |
|---|---|---|
| 数据采集方式 | 同步帧 | 异步事件 |
| 时间分辨率 | 毫秒级(30~120FPS) | 微秒级 |
| 数据密度 | 稠密(所有像素) | 稀疏(仅有变化部分) |
| 延迟 | 高 | 低 |
| 动态范围 | 通常 < 60dB | 高达 100dB+ |
| 功耗 | 高 | 更低(按需输出) |
| 运动模糊 | 明显 | 几乎无 |
下面用一组对比直观展示两者差异——帧相机记录整幅画面(含静止背景),事件相机只记录运动目标:

以高尔夫挥杆为例,事件相机只捕捉球杆与球的运动轨迹,不记录静止的天空与草地:

3. HVS:图像 + 事件的像素级融合
上面讲的是"纯事件相机"。我方相机做的是 HVS(Hybrid Vision Sensor,融合视觉)——基于锐视智芯 HVS 芯片,同一片像素阵列里的每个像素,同时具备图像采样与事件检测两条链路。于是相机既能输出传统 APS 图像帧,又能输出 EVS 事件流,且两路在像素级、微秒级同步。完整介绍见 HVS 融合视觉。
三种工作模式
| 模式 | 输出 | 适用 |
|---|---|---|
| 图像模式(APS) | 整幅图像帧(RAW) | 静态场景、需要纹理与细节 |
| 事件模式(EVS) | 异步事件流 (x, y, p, t) | 高速运动、低延迟、低功耗 |
| 融合模式(HVS) | 图像 + 事件双流同步 | 既要细节又要高速响应 |
像素级融合 vs 传感器级融合
把 APS 与 EVS 合在一起有两种做法,差别很大:
- 传感器级融合:用两个独立传感器(一颗 APS + 一颗 EVS)物理并排,事后对齐——存在视差、时间不同步、体积大。
- 像素级融合(HVS / 我方):同一像素内集成光电转换 + 图像读出 + 事件检测,芯片内以
iampCOMB/GESP/IN-PULSE DiADC等架构配合PixMUX时分复用、BSI 堆叠工艺实现——零视差、微秒级同步、单芯片。

同一像素内分出"图像采样链路"与"事件检测电路"两条路径,分别输出 APS 帧与 EVS 事件。
双流协同:看得清 + 看得快
APS 与 EVS 各有所长,融合后互补:
- APS:纹理、色彩、静态细节——"看得清"。
- EVS:高速变化、低延迟、低带宽、>120dB 高动态范围——"看得快"。

同一高速运动场景,APS 给出清晰图像帧、EVS 给出事件点轨迹,两路融合为同一画面。
HVS vs 纯 EVS 路线
纯 EVS 传感器(如索尼、Prophesee 的纯事件路线)追求事件的极致性能,但通常不输出图像;HVS 在一颗粒内同时给出图像与事件,更适合"既要画面、又要事件"的落地场景——识别、监控、交互等需要图像上下文的应用。
4. 参数如何影响画面:accumulation time(累积时间)
事件相机本身只输出稀疏的事件点。要"看成画面",需要把一段时间窗内的事件累加成一帧,这个时间窗就是 accumulation time(累积时间):
- 累积时间过短 → 事件太少,画面稀疏、断裂,看不清目标;
- 累积时间合适 → 运动目标轮廓清晰;
- 累积时间过长 → 多次运动叠加,画面拖尾、糊在一起。

同一挥手场景,累积时间过小则画面稀疏断裂、合适则轮廓清晰、过大则拖尾糊在一起。
如何调整
USB 相机在 MultiVision Studio 中调整累积参数;MIPI 模块在 RDK X5 的 evs_live_player 中处理叠帧。
累加时间还与显示帧率耦合:当累加时间等于帧周期(1 / 帧率)时每个事件恰好出现一次(满累加 full);大于帧周期则同一事件跨多帧(过累加 over,呈慢动作 / 拖影);小于帧周期则大部分事件被丢弃(欠累加 under)。三种方案的取舍与 XYT 三维可视化见 事件可视化。
录制 ≠ 可视化
累加时间只是显示参数,类似播放器的慢动作。用 MultiVision Studio 或 evs_live_player 录得的 RAW / EVT2 文件保存的是全部原始事件,与录制时设的累加时间无关——回放时可任意重设。详见 事件可视化。
易混淆:时间分辨率 ≠ 延迟
时间分辨率指事件时间戳的精度(微秒级),取决于像素电路,是"记录有多细"。延迟指事件从产生到被下游使用的实际滞后,受传输、处理、调度等影响。两者无关:可以有微秒级时间分辨率但毫秒级端到端延迟。
5.应用场景
- 工业质检 :高速产线缺陷检测
- 智能交通 :快速目标跟踪、车道保持
- 机器人导航 :低光环境、复杂动态场景下的稳定导航
- 增强现实/虚拟现实(AR/VR) :低延迟手势识别与交互
- 医疗成像 :如眼动追踪、神经监测
6.总结
事件数据通过仿生机制与异步处理技术,解决了传统视觉系统的算力瓶颈与动态场景局限性,其低功耗、高实时性及隐私保护特性,使其在消费电子、自动驾驶等领域展现出独特优势。随着神经拟态计算生态的成熟,事件数据将推动边缘智能设备的进一步发展。
在传统的图像传感系统中,相机以固定帧率周期性地捕获完整图像。无论场景是否发生变化,每一帧图像都包含整幅视野的亮度值。这种方法虽然直观,但存在两个根本性限制:
- 低时间分辨率 :固定帧率无法反映快速变化的动态场景。
- 冗余信息 :大多数像素在相邻帧之间没有发生显著变化,却仍被重复采集,造成资源浪费。
事件视觉(Event-based Vision)彻底打破了这种框架。它不再“拍摄”图像,而是 感知变化 。
