解决什么问题
目标检测只能回答"有没有预设类别",VLM(视觉语言模型)能回答开放式问题:描述现场环境、判断异常情况、回答飞手的自然语言提问。
核心逻辑
周期性将关键帧(每隔 N 秒或由触发条件选取)送入多模态大模型,配合固定 system prompt 约束输出为简短、面向任务的中文描述,并要求在不确定时明确说明。
输入示例
图像 + 提问:"这片农田里有没有人员或异常情况?用一句话回答。"
输出示例
"画面中央田埂附近有 1 人弯腰作业,东侧停放 1 辆白色皮卡,未见烟雾或明显异常。"
使用建议
- 不要逐帧调用 VLM(慢且贵),先用轻量检测器触发,再让 VLM 对关键帧做语义解释。
- prompt 中强制"只描述可见内容、不推测",降低幻觉。
- 边缘部署可量化后跑 Qwen2-VL-2B;地面站或云端可用更大模型。