原文标题:《终结者最强大脑!谷歌发布史上最大「通才」模型 PaLM-E,5620 亿参数,看图说话还能操控机器人》
谷歌刚刚上线了一个炸弹级「通才」模型 PaLM-E,足足有 5620 亿参数。它是一种多模态具身视觉语言模型,从引导机器人执行任务,到回答关于可观察世界的问题,全都能搞定。
大语言模型的飞速「变异」,让人类社会的走向越来越科幻了。点亮这棵科技树后,「终结者」的现实仿佛离我们越来越近。
前几天,微软刚宣布了一个实验框架,能用 ChatGPT 来控制机器人和无人机。
谷歌当然也不甘其后,在周一,来自谷歌和柏林工业大学的团队重磅推出了史上最大视觉语言模型 ——PaLM-E。
作为一种多模态具身视觉语言模型 ,PaLM-E 不仅可以理解图像,还能理解、生成语言,而且竟然还能将两者结合起来,处理复杂的机器人指令。
此外,通过 PaLM-540B 语言模型与 ViT-22B 视觉 Transformer 模型相结合,PaLM-E 最终的参数量高达 5620 亿。
横跨机器人、视觉-语言领域的「通才」模型
PaLM-E,全称 Pathways Language Model with Embodied,是一种具身视觉语言模型。
它的强大之处在于,能够利用视觉数据来增强其语言处理能力。
据论文介绍,PaLM-E 是一个仅有解码器的 LLM,在给定前缀或提示(prompt)下,能够以自回归方式生成文本补全。
其训练数据为包含视觉、连续状态估计和文本输入编码的多模式语句。
经过单个图像提示训练,PaLM-E 不仅可以指导机器人完成各种复杂的任务,还可以生成描述图像的语言。
可以说,PaLM-E 展示了前所未有的灵活性和适应性,代表着一次重大飞跃,特别是人机交互领域。
更重要的是,研究人员证明,通过在多个机器人和一般视觉语言的不同混合任务组合进行训练,可以带来从视觉语言转移到具身决策的几种方法,让机器人规划任务时能够有效地利用数据。
除此之外,PaLM-E 尤为突出的一点在于,拥有强大的正迁移能力。
在不同领域训练的 PaLM-E,包括互联网规模的一般视觉-语言任务,与执行单一任务机器人模型相比,性能明显提高。
而在模型尺度上,研究人员则观察到了一个显著的优势。
语言模型越大,在视觉语言与机器人任务的训练中,保持的语言能力就越强。
从模型规模来看,5620 亿参数的 PaLM-E 几乎保持了它所有的语言能力。
尽管只在单个图像进行训练,但 PaLM-E 在多模态思维链推理和多图像推理等任务中表现出突出的能力。
在 OK-VQA 基准上,PaLM-E 取得了新的 SOTA。
测评结果
在测试中,研究人员展示了如何使用 PaLM-E 在两个不同实体上执行规划以及长跨度的任务。
值得注意的是,所有这些结果都是使用基于相同数据训练的相同模型获得的。
在以前,机器人通常需要人工的协助才能完成长跨度任务。但现在,PaLM-E 通过自主学习就可以搞定了。
比如,「从抽屉里拿出薯片」这类指令中,就包括了多个计划步骤,以及来自机器人摄像头的视觉反馈。
经过端到端训练的 PaLM-E,可以直接从像素开始对机器人进行规划。由于模型被集成到一个控制回路中,所以机器人在拿薯片的过程中,对途中的干扰都有鲁棒性。
人类:给我来点薯片。
机器人:1. 走到抽屉旁 2.打开最上面的抽屉 3. 从最上面的抽屉里拿起绿色的薯片 4.放在柜台上。
人类:给我拿一个苹果。
机器人:1.走向苹果 2.拿起苹果 3.把它拿给操作员 4.放下苹果 5.完成。
除了执行长跨度任务,PaLM-E 可以让机器人执行规划任务,比如排列积木。
研究人员根据视觉和语言输入成功地进行多阶段的计划,并结合了长时间范围的视觉反馈,进而让模型能够成功地规划一个长周期的任务「将积木按颜色分类到不同的角落」。
如下,在排列组合上,机器人化身为多面手,按颜色将积木排序。
模型的泛化方面,PaLM- E 控制的机器人可以把红色积木移到咖啡杯的旁边。
值得一提的是,数据集只包含有咖啡杯的三个演示,但其中没有一个包括红色的积木块。
类似的,虽然模型此前从未见过乌龟,但照样可以顺利地把绿色积木推到乌龟旁边
在零样本推理方面,PaLM-E 可以在给定图像的情况下讲述笑话,并展示了包括感知,基于视觉的对话和计划在内的能力。
多张图的关系,PaLM-E 也整得很明白,比如图一在图二(右)的哪个位置。
此外,PaLM-E 还可以在给定带有手写数字的图像执行数学运算。
比如,如下手写餐馆的菜单图,2 张披萨需要多少钱,PaLM-E 就直接给算出来了。
以及一般的 QA 和标注等多种任务。
最后,研究结果还表明,冻结语言模型是通向完全保留其语言能力的通用具身多模态模型的可行之路。
但同时,研究人员还发现了一条解冻模型的替代路线,即扩大语言模型的规模可以显著减少灾难性遗忘。
参考资料:
声明:以上内容为本网站转自其它媒体,相关信息仅为传递更多企业信息之目的,不代表本网观点,亦不代表本网站赞同其观点或证实其内容的真实性。投资有风险,需谨慎。
环旭电子毛利率创上市十年新低,股价跌跌不休,连续回购有
图片来源:图虫3月28日,环旭电子(601231.SH)披露2021年年度报告称,该公司去...
两个20CM涨停,津荣天宇拟10转8派3,上市没满周年
图片来源:图虫创意3月29日,津荣天宇(300988.SZ)再次“20CM涨停”,收于44...
在管面积翻倍,碧桂园服务称大规模收并购已过去
图片来源:碧桂园服务结束过去一年来的大举收并购后,在3月29日召开的2021年度业绩发布会...
首套房利率降至5.2%,武汉楼市政策也放松了
去年被投资客们看好的武汉楼市,近期也继续出台了楼市刺激政策。界面新闻获悉,武汉房贷利率出现...
英国通胀创30年来最快增速,政府宣布立即降调燃油税
2022年3月9日,英国丹伯里,埃克森美孚公司运营的埃索加油站。图片来源:视觉中国英国政府...
让孩子自信互动才是幼儿园质量“金标准”
让孩子自信互动才是幼儿园质量“金标准” “入园难、入园贵”的问题终于不那么令人焦灼了。近年...
佳通轮胎获行业“十大轮胎品牌”等奖项
近日,由中国轮胎商务网发起主办、善养汽车联合主办的ApexTire2021中国轮胎年度大选...
快手2021年营收811亿元,调整后净亏损188.5亿
,快手今日公布了2021年第四季度及全年财报。财报显示,该公司第四季度营收244亿元,同比...
奇安信2022年新增订单超9亿元同比增长超65%
3月29日,奇安信发布关于近期经营情况的公告。公告显示,目前公司在手订单超23亿元,202...
大摩:苹果、谷歌等大型科技企业股票反弹,亚马逊、英伟达
北京时间3月29日早间消息,据报道,摩根士丹利财富管理公司表示,美国主要的科技和互联网股票...
万科蝉联第一2022房企综合实力TOP500测评成果出
3月29日,2022房地产开发企业综合实力测评成果正式发布,“房地产开发企业综合实力TOP...
华为加码芯片研发:海思升格为一级部门
华为本周发布2021年年度报告,从华为2021年的最新业务架构来看,海思已经从2012实验...
LGDisplay加码抢占中国透明显示市场
LGDisplay于3月29日至31日在北京东外56号文创园,以“YourLifewith...
一汽-大众奥迪赛车队加冕中国超级跑车锦标赛2021赛季
2022年3月24日,代表一汽-大众奥迪赛车队出征中国超级跑车锦标赛(ChinaGT)20...
StrategyAnalytics:
根据StrategyAnalytic...
增程技术成2022百人会热门增程式S
3月27日,中国电动汽车百人会论坛(...
工信部:1-2月份我国软件业务收入1
近日,工信部发布《2022年1-2月...
元宇宙进行时,高通在行动
近期,高通宣布设立总金额达1亿美元的...
Ultrasuede®携手智己L7打
环保可持续发展的理念不断融于各行各业...