科技
麻省理工学院人工智能模型加速自动驾驶汽车的高分辨率计算机视觉

  

  

  高分辨率计算机视觉的机器学习模型可以在边缘设备上实现计算密集型视觉应用,例如自动驾驶或医疗图像分割。图为一位艺术家对自动驾驶技术的诠释。来源:麻省理工学院新闻

  一种新的人工智能系统可以提高视频流的图像质量或帮助汽车无人驾驶汽车可以实时识别道路危险。

  麻省理工学院和麻省理工学院- ibm沃森人工智能实验室的研究人员推出了effentvit,这是一种计算机视觉模型,可以加速高分辨率图像的实时语义分割,并针对硬件有限的设备(如汽车)进行了优化nomous车辆。

  自动驾驶汽车必须快速、准确地识别遇到的物体,无论是停在拐角处的空转运货卡车,还是正在接近十字路口的骑自行车的人。

  为了做到这一点,车辆可能会使用一个强大的计算机视觉模型来对场景的高分辨率图像中的每个像素进行分类,这样它就不会忽略在低质量图像中可能被遮挡的物体。但是,这种被称为语义分割的任务非常复杂,当图像具有高分辨率时需要大量的计算。

  来自麻省理工学院、麻省理工学院- ibm沃森人工智能实验室和其他地方的研究人员开发了一种更高效的计算机视觉模型,大大降低了这项任务的计算复杂性。他们的模型可以在硬件资源有限的设备上实时准确地执行语义分割,例如车载计算机,使自动驾驶汽车能够在瞬间做出决定。

  实时处理优化

  最近最先进的语义分割模型直接学习图像中每对像素之间的相互作用,因此它们的计算随着图像分辨率的增加而呈二次增长。正因为如此,虽然这些模型是准确的,但它们在传感器或手机等边缘设备上实时处理高分辨率图像的速度太慢。

  麻省理工学院的研究人员为语义分割模型设计了一个新的构建块,它实现了与这些最先进的模型相同的能力,但只有线性计算复杂性和硬件效率的操作。

  其结果是一个新的高分辨率计算机视觉模型系列,当部署在移动设备上时,其运行速度比以前的模型快9倍。重要的是,这个新模型系列表现出与这些替代方案相同或更好的准确性。

  EfficientViT可以使自动驾驶汽车有效地执行语义分割,这是一项高分辨率的计算机视觉任务,涉及对场景中的每个像素进行分类,以便车辆准确识别物体。图为一个演示视频的剧照,展示了用不同的颜色对物体进行分类。图片来源:仍然由研究人员提供

  仔细观察解决方案

  这项技术不仅可以用来帮助自动驾驶汽车实时做出决策,还可以提高其他高分辨率计算机视觉任务的效率,比如医学图像分割。

  “虽然研究人员已经使用传统的视觉变压器很长一段时间,并且他们给出了惊人的结果,但我们希望人们也注意这些模型的效率方面。我们的工作表明,有可能大幅减少计算,因此这种实时图像分割可以在设备上局部发生,”电子工程与计算机科学系(EECS)副教授宋晗说,他是麻省理工学院- ibm沃森人工智能实验室的成员,也是描述新模型的论文的高级作者。

  与他一起撰写论文的还有第一作者、EECS研究生蔡涵;浙江大学本科生李俊艳(音译);清华大学本科生胡慕彦;以及麻省理工学院- ibm沃森人工智能实验室的主要研究人员庄干。这项研究将在国际计算机视觉会议上发表。

  简化的解决方案

  对于机器学习模型来说,对可能有数百万像素的高分辨率图像中的每个像素进行分类是一项艰巨的任务。一种强大的新型模型,被称为视觉变压器,最近得到了有效的应用。

  变形金刚最初是为自然语言处理而开发的。在这种情况下,他们将句子中的每个单词编码为一个标记,然后生成一个注意图,该图捕获每个标记与所有其他标记的关系。这张注意力图有助于模型在做出预测时理解上下文。

  使用同样的概念,视觉转换器将图像分割成像素块,并在生成注意力地图之前将每个小块编码为标记。在生成注意图时,该模型使用了一个相似函数,该函数直接学习每对像素之间的相互作用。通过这种方式,该模型开发了所谓的全局接受域,这意味着它可以访问图像的所有相关部分。

  由于高分辨率的图像可能包含数百万像素,分成数千个小块,注意力地图很快就会变得巨大。因此,随着图像分辨率的增加,计算量呈二次增长。

  在他们的新模型系列中,麻省理工学院的研究人员使用了一种更简单的机制来构建注意力图——用线性相似函数代替非线性相似函数。因此,它们可以在不改变功能和失去全局接受域的情况下重新安排操作顺序以减少总计算量。在他们的模型中,预测所需的计算量随着图像分辨率的增加而线性增长。

  “但是天下没有免费的午餐。线性注意力只捕捉到图像的全局背景,而失去了局部信息,这使得准确性更差。”

  为了弥补这种准确性损失,研究人员在他们的模型中加入了两个额外的组件,每个组件只增加了少量的计算量。

  其中一个元素帮助模型捕获局部特征交互,减轻了线性函数在局部信息提取中的弱点。第二个模块是一个支持多尺度学习的模块,可以帮助模型识别大小物体。

  “这里最关键的部分是我们需要仔细平衡性能和效率,”蔡说。

  他们设计的effentvit具有硬件友好的架构,因此可以更容易地在不同类型的设备上运行,例如虚拟现实耳机或自动驾驶汽车上的边缘计算机。他们的模型也可以应用于其他计算机视觉任务,比如图像分类。

  精简语义分割

  当他们在用于语义分割的数据集上测试他们的模型时,他们发现它在Nvidia图形处理单元(GPU)上的执行速度比其他流行的视觉转换模型快9倍,具有相同或更好的准确性。

  “现在,我们可以两全其美,减少计算,使其足够快,我们可以在移动和云设备上运行,”韩说。

  在这些结果的基础上,研究人员希望将这项技术应用于加速生成机器学习模型,比如那些用于生成新图像的模型。他们还希望在其他视觉任务中继续扩大effentvit的规模。

  “高效的变压器模型,由宋汉教授的团队开创,现在形成了各种计算机视觉任务的尖端技术支柱,包括检测和分割,”AMD公司人工智能算法高级总监陆天说,他没有参与这篇论文。“他们的研究不仅展示了变压器的效率和能力,还揭示了它们在现实世界中的巨大应用潜力,比如提高视频游戏中的图像质量。”

  “模型压缩和轻量级模型设计是高效人工智能计算的关键研究课题,特别是在大型基础模型的背景下。宋涵教授的团队在压缩和加速现代深度学习模型,特别是视觉变形器方面取得了显著进展,”甲骨文人工智能和机器学习全球副总裁杰伊·杰克逊补充道,他没有参与这项研究。“甲骨文云基础设施一直在支持他的团队推进这一系列有影响力的研究,以实现高效和绿色的人工智能。”

  参考文献:“高效vit:基于设备上语义分割的轻量级多尺度关注”,作者:蔡涵,李俊彦,胡木岩,甘创业,韩松,2023年4月6日,《计算机科学》,计算机视觉与模式识别。arXiv: 2205.14756

点击分享到

热门推荐