• 回答数

    0

  • 浏览数

    4

  • 收藏数

    0

作者:admin 发表于 9 小时前
跳转到指定楼层
IT之家 7 月 31 日消息,谷歌 DeepMind 昨日(7 月 30 日)发布博文,宣布推出 Gemini Robotics ER 2 模型, 是其面向机器人的最强具身推理(embodied reasoning)模型。

定位方面,该模型可视为机器人的“高级大脑”,协调处理与人类交流、理解物理世界并规划多步骤任务等。该模型后续会向更低层级的视觉-语言-动作 (VLA) 模型分派任务,管控其完成各项任务。



在功能方面,相比较此前 1.6 版本,Gemini Robotics ER 2 模型通过持续观看视频,机器人现在可以追踪自身的运行进度,在出现问题时进行调整,并准确把握进入下一步的时机。

模型还可原生调用 Google Search(谷歌搜索)或开发者自定义函数。



在物理智能体方面,在机器人当前处于执行任务状态下,Gemini Robotics ER 2 模型可以同步推理后续步骤,以减少传统机器人“停止 — 思考 — 再行动”带来的停顿。

该模型接入 Gemini Live API(Gemini 实时 API)的双向流式端点,面向对延迟敏感的机器人任务。

相较 Gemini Robotics ER 1.6,ER 2 可分析连续视频流。机器人可据此跟踪自身任务进度,在动作出错时调整或重试,并判断何时进入下一步骤。

在任务进度分类测试中,Gemini Robotics ER 2 的准确率为 57.4%。该能力可帮助机器人在不重启整个工作流的情况下修正失败步骤。

在 moment-finding  时刻寻找(关键时刻定位)测试中,模型需要找出关键事件发生的精确视频帧,例如判断何时停止向杯中倒咖啡。ER 2 的准确率为 91.3%,平均绝对时间误差为 0.96 秒。





谷歌称,该模型以更低计算成本达到接近更大模型类别的精度,执行速度为其 4 倍,并满足现实机器人安全运行所需的亚秒级延迟要求。



ER 2 还支持多机器人协作。不同类型的机器人可借助共享语义理解沟通、交接任务,并完成单台设备难以独立完成的复杂工作流。谷歌展示了 Apptronik 的 Apollo 2 与 Franka 的 FR3 Duo 协作案例。

Gemini Robotics ER 2 现已通过 Gemini API 和 Google AI Studio 面向开发者公开提供;

同时,它已在 Gemini Enterprise Agent Platform(Gemini 企业智能体平台)中开启私密预览。

谷歌还发布了模型配置和提示词示例代码。

[来源链接] https://www.ithome.com/0/983/915.htm
分享:
回复

使用道具

成为第一个回答人

高级模式 评论
您需要登录后才可以回帖 登录 | 立即注册
⚠️

AI客服助手

×
AI
您好!我是AI客服助手,有什么可以帮助您的吗?

请先登录后使用AI客服助手

立即登录
内容由非常AI大模型生成,仅供参考,相关风险需自行承担。

赚钱

会员VIP

留言板

商务合作

联系电话:17308937318

QQ邮箱

QQ:118275

邮箱:118275@qq.com

友情链接