解决什么问题
无人机回传画面后,自动框选出画面中的人、车、建筑物、塔架等目标,无需飞手全程盯屏。典型用于野外搜救(找人)、电网 / 风机巡检(找缺陷部件)。
核心逻辑
使用在航拍数据集(VisDrone、自建巡检集)上微调过的 YOLO 系列检测模型,对每帧图像做一次前向推理,输出检测框 + 类别 + 置信度,再按时间做跨帧去重,避免同一个人被重复告警。
输入示例
一张 1920x1080 航拍 RGB 图像(俯拍 / 斜拍)
输出示例
{
"objects": [
{ "class": "person", "bbox": [412, 233, 468, 351], "confidence": 0.91 },
{ "class": "vehicle", "bbox": [88, 512, 172, 560], "confidence": 0.86 }
],
"counts": { "person": 1, "vehicle": 2 }
}
使用建议
- 模型尽量跑在机载端(Jetson Orin Nano / RK3588),只回传结构化结果,省图传带宽。
- 俯拍视角与普通 COCO 数据分布差异大,务必用航拍数据微调,否则召回率会明显下降。
- 告警阈值按任务调:搜救宁可误报(confidence ≥ 0.35),巡检统计宁可漏报(≥ 0.7)。