英伟达LocateAnything上手,3B模型实现单步框定位,速度提升12.7倍
英伟达推出的 LocateAnything 模型采用 Parallel Box Decoding(PBD)技术,仅需 12.7 BPS 即可完成目标检测、指代定位、文字检测等五类任务。相比传统逐字生成...
近日,英伟达发布了一款名为 LocateAnything 的轻量级定位模型,这款 3B 参数的模型凭借创新的 Parallel Box Decoding(PBD)技术,在目标检测、指代定位、文字检测等多个领域实现了突破性进展。与传统的逐字生成(NTP)方式不同,LocateAnything 能够一次性输出完整的检测框,显著提升了定位效率和准确性。
核心功能与优势
这种设计使得开发者能够用一套接口完成多种定位需求,避免了传统方法需要拼接多个专业检测器的复杂性。
技术革新:从 NTP 到 PBD
传统的目标检测方法通常采用逐字生成(NTP)的方式,即依次输出检测框的四个坐标值(x1, y1, x2, y2)。这种方式存在明显的缺陷:一旦其中一个坐标值出现偏差,整个检测框就会失真。特别是在密集场景中,这种误差会被放大,导致多个目标被错误地关联或遗漏。
为了解决这一问题,LocateAnything 引入了 Parallel Box Decoding(PBD)技术。与 NTP 不同,PBD 将检测框的四个坐标视为一个整体,一次性生成完整的框。这就好比从四个人分别写一个数字变成一个人一次写完整张纸条,不仅提高了效率,还保证了框的几何关系不被打散。
为了应对可能出现的格式异常或坐标含糊情况,LocateAnything 还设计了出错重解码机制。当检测到异常时,系统会回退到上一个可靠节点,用传统的逐字模式重新生成这个框,然后继续使用并行模式。这种混合模式既保证了速度,又确保了稳定性。
三种推理模式的选择
LocateAnything 提供了三种推理模式供用户选择:
- Fast(快速模式):采用并行解码,速度最快且精度较高,适合机器人、端侧实时场景。
- Slow(慢速模式):采用逐字生成,虽然速度较慢但精度最高,适合离线标注和评测场景。
- Hybrid(混合模式):默认模式,结合了 Fast 和 Slow 的优点,在大多数场景下都能提供最佳性能。
推荐用户在没有特殊需求的情况下,默认使用 Hybrid 模式,因为它能够在速度和精度之间取得平衡。
架构与训练数据
LocateAnything 的整体架构可以分为三个部分:视觉编码器(MoonViT-SO-400M)、投影层(MLP 投影)和语言解码器(Qwen2.5-3B)。这种三段式结构清晰明了,没有复杂的花活。模型的训练数据非常丰富,包括 1200 万张图片、1.38 亿条查询和 7.85 亿个标注框。
实战上手
安装完成后,开发者可以通过简单的 API 调用来实现各种定位功能。
行业影响与未来展望
LocateAnything 的推出标志着目标定位技术的一次重大进步。相比动辄几十 B 参数的通用大模型,3B 参数的 LocateAnything 更适合中小团队部署,无需提前准备多卡集群。这将极大地降低目标定位技术的门槛,推动其在更多领域的应用。
随着人工智能技术的不断发展,目标定位作为计算机视觉的核心任务之一,将在自动驾驶、机器人、智能安防等领域发挥越来越重要的作用。LocateAnything 的高效性和易用性,无疑将加速这一进程,为行业带来新的发展机遇。
