前Meta科学家希望将视觉人工智能引入工厂车间

人工智能正在改变我们周围的一切,但到目前为止,它在很大程度上仍然局限于数字领域。然而,越来越多的初创公司希望将其带入现实世界。

Perceptron是一家由两名前Meta研究科学家创办的初创公司,就是这样的公司。该公司成立于2024年11月,开发前沿视觉模型,旨在帮助机器更有效地与其物理环境交互。

本周,该公司推出了最新型号Isaac 0.5,其创建者表示,该型号旨在为机器提供在工业环境中“感知、推理和行动”的能力。具体来说,该软件能够帮助视觉引导机器人在仓库或工厂车间等复杂环境中导航。它还可以帮助公司从这些机器人录制的视频中提取视觉智能。

Isaac 0.5也作为开放权重模型发布,因此任何人都可以检查其参数和培训材料。

该初创公司由Armen Aghajanyan和Akshat Shrivastava共同创立,他们之前曾在Meta的基础人工智能研究 (FAIR)(这家科技巨头的人工智能研究部门)工作。两人将他们的软件视为工业自动化部署的未来。

该公司表示:“今天的物理人工智能迫使人们做出错误的选择:通用基础模型需要为每个实例使用多个专用云GPU,或者狭义模型处理感知或控制,但决不会两者兼而有之。”

Aghajanyan和Shrivastava表示,他们的工具与该领域的现有模型不同,因为它是通用的,这意味着它不是为一项特定的重复性任务而构建的。相反,他们说,该模型的设计是据其所处的特定环境(或情况)进行灵活调整的。

在一次采访中,Shrivastava让我考虑一下整理箱子等简单物理过程的内容:“想象一下,现在有一个机器人正在部署来对包裹进行分类。它需要执行哪些任务?”

这样一个相对简单的任务确实包含很多步骤。机器人首先必须阅读包裹上的标签,进行一些空间分析以了解盒子的位置,然后决定拿起哪个盒子。如果它要拾取一系列盒子,则必须计划拾取哪些盒子以及拾取顺序。

Perceptron的软件旨在帮助机器人找到完成流程每一步的方法。需要明确的是,业界已经拥有可以帮助机器完成大部分任务的软件,但很少有程序能够灵活地完成这些任务。

这种算法炼金术的数据来自哪里?

像Isaac 0.5这样的模型通过摄取大量视频训练数据来学习操作技能。 Perceptron表示,其新模型以一百万小时的所谓通用视频为基础,教其算法识别特定的设置、视觉效果和场景。该公司还严重依赖所谓的asego视频(通常通过GoPro或可穿戴相机从完成体力任务的人的角度捕获的视频)以及UMI视频,这些视频同样用于通过记录重复的人类动作来教授人工智能系统动作。

虽然Perceptron没有透露其训练数据的来源,但Shrivastava表示,该公司“在内部构建了跨越多种模式的PB级数据集,无论是图像、文本、视频等,还是机器人轨迹。”

可以帮助机器人在仓库中高效操作的软件的效用显然是巨大的,Perceptron认为它处于引领自动化浪潮的有利位置。该初创公司已准备好向各种供应商推销其软件,因此有可能将其智能层集成到广泛的行业中。

这些行业包括制造、物流和仓储、安全、移动以及媒体和娱乐。

“那里真的不存在这样的东西,”阿加贾扬说。 “我们对此感到非常兴奋。”

这个故事的早期版本错误地报道了最近的融资轮次。它已被更新以更正此信息。

← 上一篇文章 Ring引入了新的加密标准,使其成为云功能的默认标准 下一篇文章 → 雷达使播客可供人工智能代理搜索和使用

← 返回列表