CLIP:Learning Transferable Visual Models From Natural Language Supervision(ICML 2021)
通过图文对比学习建立共享语义空间,是理解开放词汇识别的基础;原始 CLIP 主要进行图像级匹配,并不直接输出检测框。
Flamingo: Flamingo: a Visual Language Model for Few-Shot Learning (NeurIPS 2022)
通过将预训练视觉编码器与大型语言模型连接起来,实现图像与文本交错输入下的少样本学习,是现代多模态大语言模型的重要奠基性工作之一。其核心思想是保留已有视觉与语言模型能力,再通过跨模态连接模块实现统一建模。
Griffon:Spelling Out All Object Locations at Any Granularity with Large Language Models(ECCV 2024)
将不同粒度的语言定位数据统一为生成式训练任务,不引入额外检测模块或特殊坐标 token,探索 MLLM 直接输出目标位置的能力。除指代表达理解与短语定位外,也在 COCO 上评估目标检测。
Griffon v2:Advancing Multimodal Perception with High-Resolution Scaling and Visual-Language Co-Referring(ICCV 2025)
通过高分辨率视觉编码与轻量下采样连接模块控制视觉 token 数量,并结合文本、局部图像等提示强化通用 MLLM 检测、指代定位与计数能力。
二、领域适配:遥感目标检测与视觉定位
OpenRSD:Towards Open-prompts for Object Detection in Remote Sensing Images(ICCV 2025)
面向遥感图像构建开放提示检测框架,支持文本与图像提示,以及水平框和旋转框检测;通过不同检测头兼顾精度与实时性。它展示了语言条件检测路线如何适配遥感任务的提示形式、目标方向和效率要求。
GeoChat:Grounded Large Vision-Language Model for Remote Sensing(CVPR 2024)
基于 LLaVA-1.5,利用遥感多模态指令数据进行领域适配,支持区域描述、视觉问答、带坐标的对话和指代检测。它将遥感场景理解与区域级定位结合起来,适合学习如何从已有领域数据构造指令,并训练 MLLM 输出空间信息。
三、扩展阅读:目标跟踪与大幅遥感图像理解
JTD-UAV:MLLM-Enhanced Joint Tracking and Description Framework for Anti-UAV Systems(CVPR 2025)
面向反无人机系统,将目标跟踪与运动意图描述结合,研究 MLLM 如何参与具体视觉应用中的定位与语义理解。
LinkS²Bench:Are VLMs Lost Between Sky and Space? LinkS²Bench for UAV-Satellite Dynamic Cross-View Spatial Intelligence(arXiv 2026)
面向无人机视频与卫星图像之间的动态跨视角空间理解,构建涵盖感知、定位、关系与推理四个维度的评测基准,并通过跨视角对齐适配器改善模型表现,显式对齐增强空间定位与推理能力,是多模态模型用于遥感空间智能的任务研究实例。
2.5 专题文献(轻量化与高效部署)
本阶段回答:如何保留多模态感知能力,同时减少存储、计算和响应时间?
知识蒸馏与轻量模型
Knowledge Distillation:Distilling the Knowledge in a Neural Network(NIPS 2014 Deep Learning Workshop)
通过教师模型的软目标训练学生模型,是理解知识迁移与模型压缩的经典起点。
AWQ:Activation-aware Weight Quantization for On-Device LLM Compression and Acceleration(MLSys 2024)
利用激活分布信息降低低比特权重量化误差,是压缩 MLLM 语言骨干最常用的方法之一;检测与坐标输出的精度需要单独检验。
FastV:An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models(ECCV 2024)
按注意力权重筛选视觉 token 并在浅层之后剪除,减少后续计算。可进一步思考:为图像问答设计的 token 筛选,能否保留检测所需的小目标与局部信息?
FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness (NeurIPS 2022)
通过优化 GPU 中 Attention 的内存访问方式,在不近似、不裁剪 token 的情况下减少数据搬运和显存占用。它说明高效部署不仅要减少 FLOPs,还需要考虑计算与硬件之间的实际执行效率。
PagedAttention: Efficient Memory Management for Large Language Model Serving with PagedAttention (SOSP 2023)
采用分页式 KV Cache 管理减少显存浪费,并支持更高效的批处理与并发推理,是 vLLM 推理系统的核心技术。可进一步理解:模型压缩解决“模型能否放得下”,而推理系统优化决定“模型能否真正跑得快”。