车损三维重构

目标很具体:根据车损现场的拍照,重构三维事故现场;若能复现三维场景的动态,就更进一步;也可以吃行车记录仪视频。服务对象是车险的定损与定责。

这不是某一个算法的名字,而是一条垂直链路。底下叠了多视图三维重建、车损细粒度视觉理解、车载视频的运动估计,以及(若要做动态复现)带物理约束的碰撞过程重建。

技术主位在多模态生成的「从照片重建」和多模态大模型。动态复现摸到世界模型边缘。不是具身智能。

场景拆成四层目标

层次交付物成熟度(2026 年公开材料)
A. 静态三维现场可绕看、可量测的现场或整车三维有成熟路径:摄影测量、激光 SLAM、NeRF / 3DGS
B. 车损语义撞到哪些件、什么损伤类型、大致严重度二维检测与分割已有公开数据集与产业方案;抬到三维仍少
C. 行车记录仪 → 场景与轨迹自车轨迹、他车相对运动、俯视回放有论文管道,成功率通常不到「全场景可用」
D. 三维动态复现与定责碰撞过程可回放,并支撑责任判断研究与示证有人做;通用、可采信的端到端方案仍开放

A + B 是今天可以认真立项的核心。C 是差异化。D 是「更牛」的那一层,也是缺口最大的一层。

技术定位(一句话)

多模态理解 + 三维重建驱动的保险垂直应用;动态事故回放是向 4D / 弱世界模型 延伸的研究前沿。定损要的是忠实与可计量,不是好看的文生三维。

现场多视图照片 ──SfM / 激光──► 三维场景或整车(NeRF / 3DGS / 点云)
        │
        └──2D 损伤分割──► 抬到三维表面(如 CrashSplat)
行车记录仪视频 ──SLAM + 检测跟踪 + 深度──► 轨迹 + 俯视动态示意
        │
        └──(可选)动力学约束──► 碰撞过程回放(开放)
以上结果 + 配件价格与交规 ──► 定损报告 / 定责辅助(人审)

前人工作

下面按「解决哪一层」分组。同一层里,学术和产业分开记。

1. 二维车损检测与分割(定损语义的底座)

保险业最早规模化落地的是拍照定损,不重建三维。

工作大约时间做了什么和本场景的关系
蚂蚁「定损宝」约 2017–2018 公开车主拍照/视频识别损伤、维修方案;2.0 引入 SLAM 辅助取景与 AR 展示产业上证明「视觉定损」能进理赔流程;主路径仍是二维语义,不是三维现场
Mask R-CNN / YOLO 等用于车损2017 年后大量工作在私有或小公开数据上做损伤检测、部件分割方法通用,缺统一评测长期拖慢领域
CarDD(Wang 等,中科大等;IEEE TITS 2023)2022–2023约 4000 张高分辨率图、9000+ 实例、六类损伤;公开检测与实例分割基准目前最常用的公开车损数据之一;做 B 层应先在这上面报数
TQVCD 等视角约束数据集约 2024强调三分之四视角,降低标注复杂度采集协议可参考:现场拍照角度本身就是产品设计
SLICK(2025)2025结合结构先验与领域知识的车损分割,面向保险巡检代表「二维定损」仍在加深;文中自己提到未来接三维重建

读这一层时记住:准确率数字高度依赖私有数据与业务规则。公开论文里能公平比的,优先看 CarDD 一类基准。

2. 整车或损伤的三维表示(从 2D 抬到 3D)

真正贴近「车损三维重构」这个标题的学术工作,近几年才变密。

工作大约时间做了什么和本场景的关系
SfM + 摄影测量 / COLMAP 管线长期多视图估计相机与稀疏点云,再稠密重建A 层工程底座;现场光照差、反光车漆、少视角是常态难点
NeRF(Mildenhall 等,2020)与 3D Gaussian Splatting(Kerbl 等,2023)2020 / 2023新视角合成与可交互三维表示层;本场景是「重建」不是「文生 3D」
CrashSplat(Chileban 等,2025;代码公开)2025用 3DGS 重建车辆;把单视角 2D 损伤 mask 抬到三维高斯上;强调划痕等只在单视图清晰可见的情况目前最贴近「车损 + 3DGS」的公开管线之一;解决的是受损车辆的三维损伤可视化,不是整条马路事故现场
保险向专利与原型(图像损伤标到 CAD/三维车模、NeRF 估损等)近年把 2D 损伤映射到标准车身模型,辅助维修方案与报价产业方向:用规范化车模补全真实重建的缺失面;采信时要区分「实测」与「映射」

CrashSplat 的论文也写明:多数自动车损工作停在 2D,三维几何准确的损伤表示仍然稀缺。这正好是本场景的研究缝。

3. 事故现场三维(现场尺度,而不只是一辆车)

定责经常需要的是整段现场:刹痕、落物、相对位置、路口几何。这一层有交管与测绘传统,不全是深度学习。

工作 / 实践大约时间做了什么和本场景的关系
交通事故现场实景三维 / 无人机倾斜摄影(国内交管与安全工程论文,如 2023 前后)2020s外业多视图 + 内业实景三维;报告厘米级量测、缩短占道勘查证明「现场三维固证」在交管侧已有落地路径;采集设备常常是无人机或专业相机,不是车主手机随手拍
如视、睿数等信息方案近年产品手持激光 SLAM、点云、3DGS;强调快勘、快撤、可量测、可示证产业上把 A 层做成交管/司法工具链;保险侧若复用,要处理权限、成本与车主自助采集的差别
传统事故再现软件(PC-Crash 等)更早专家输入参数做动力学再现D 层的「老前辈」:物理仿真有,自动化从视频长出参数仍难

手机多视图重建整段路口,和激光扫一百平米现场,是同一目标下的两种采集预算。前人工作两边都有,不能混成一个指标。

4. 行车记录仪 → 动态 / 俯视重建

「根据行车记录仪复现动态」这一句,对应的是车载视频理解,而不是文生视频。

工作大约时间做了什么和本场景的关系
Dynamic Bird’s Eye View Reconstruction of Driving Accidents(IEEE TITS,约 2024)2024融合 SLAM、深度、检测与跟踪,从车载数据重建碰撞时刻的俯视动画与「记录仪 → 动态示意」最贴的公开管线之一;论文报告在困难基准上,可靠重建撞击时刻大约一半场景量级,整体良好更少——说明 C 层尚未产品级打穿
语义加权图像配准重建自车轨迹与路面(JSAE 等)约 2025用语义分割加权配准,从 dashcam 重建轨迹与行驶环境地图偏轨迹与路面,不是完整 3DGS 现场,但对「只有前视视频」很实用
Dashcam 事故检测数据集与 VLM 综述(如 DAD;2025 前后综述)2010s–2025检测/预判事故是否发生、类别与时序理赔入口的「这是不是事故」;不自动给出三维定责

5. 大模型时代的接法(仍薄)

方向现状对本场景的意义
VLM 读车损图、写查勘描述可行,作为报告草稿加速文书,不能单独当几何证据
视频 + LLM/VLM 做 crash detection有综述与数据集管「发现」,不管「量出来」
用视频生成模型「画出」事故过程看起来像,不等于发生过定责场景高风险;最多当示意,须与重建轨迹解耦

和前人工作相比,本场景的缝在哪

把目标写成研究问题,便于以后对照:

  1. 少视角、非专业拍摄下的现场三维:车主手机、不均匀绕车、反光与夜间。交管激光方案的精度参考点在这,迁移成本也在这。
  2. 损伤从 2D 到 3D 的一致性:CrashSplat 开了一条缝;部件级、可报价的三维损伤(哪个钣金件、变形量)仍少公开基准。
  3. 记录仪单目前视 → 多车三维动态:已有俯视重建管线,但成功率与法庭/保险公司采信标准之间还有距离。
  4. 动态复现的物理约束:只靠新视角合成「看起来在撞」,不够;需要轨迹、接触时刻与可解释的误差条。
  5. 定损与定责的证据分层:重建几何、推断补全、生成示意、语言模型叙述,必须在产品里分色标注。前人产业方案在二维定损上已有人审流程,三维侧要把同样的纪律建起来。

建议的落地顺序(研究或立项)

  1. 固定采集协议(绕车圈数、关键面必拍、是否要记录仪片段)。
  2. 跑通 A:COLMAP / 3DGS 出可交互整车或现场;报告失败案例(玻璃、夜间、严重形变)。
  3. 在 CarDD 或自有标注上做 B,再把 mask 抬到三维(复现或扩展 CrashSplat)。
  4. 单独立项 C:记录仪 → 俯视轨迹;与 A 的坐标系如何对齐。
  5. D 只在有动力学或专家工具链时启动;先做「可回放示意 + 人工确认」,再谈自动定责。

关键入口(自己以后点开)

还想补

  • 用自己的一辆车、二十张手机照片跑一遍 3DGS,记下失败视角。
  • 精读 CrashSplat,把它的「单视图抬三维」步骤画成自己的框图。
  • 列一张国内保险公司公开的 AI 定损能力表:哪些停在二维,哪些声称三维或 AR。
  • 若做动态,先复现一篇 dashcam → BEV 的开源或可复现实验,再谈自研。