
一 | 拿起漏斗,插入圆底烧瓶;拿起量筒,把液体倒入烧瓶;移走漏斗,将烧瓶放到搅拌器上,再塞入瓶塞并按下开关。 广告 0:49 广告 广告 广告 了解详情 > 会员跳广告 首月9.9元 秒后跳过广告 开通视频黄金会员,尊享更高品质体验! 1080P及以上画质仅为黄金会员专享> 开通/续费会员 抱歉,您观看的视频加载失败 请检查网络连接后重试,有话要说?请点击 我要反馈>> 正在切换清晰度... 播放 按esc可退出全屏模式 00:00 00:00 00:00 广告 只看TA 倍速 剧集 字幕 字幕 下拉浏览更多 5X进行中 炫彩HDRVIP尊享HDR视觉盛宴 哎呀,什么都没识别到 反馈 循环播放 跳过片头片尾 画面色彩调整 AI明星识别 视频截取 色彩调整 亮度 标准 饱和度 100 对比度 100 恢复默认设置 关闭 单语言 双语言 选择显示语言 中文 English 主字幕(上方) 中文 English 副字幕(下方) 中文 English 关闭 复制全部log 早上好 今天是2026年8月24日星期一 农历七月十二 清晨 阳光照进红河谷 连片的火龙果基地里 一场盛大而短暂的花开正悄然上演 素有“月下美人”之称的火龙果花 在白日里尽情舒展芳华 洁白温润的花瓣如流云洒落 金黄细密的花蕊吐露生机 蜂蝶穿梭其间 尽显山野独有的浪漫 愿你我都能如这花般 珍惜当下 在短暂中绽放极致 静待繁花落尽后的硕果盈枝 万余名海外客打卡!元阳梯田打造世界级文旅新地标→依托千年哈尼梯田世界文化遗产资源、独特立体气候与浓郁民族文化底蕴,元阳县文旅产业持续提质升级,成为撬动县域高质量发展的重要动能。 对人来说,这是一串可以按顺序完成的动作;但对机器人,每一步都藏着两个判断:规划出的动作能否执行,当前动作是否完成。

二 | 数据显示,2026年上半年,全县景区接待游客达45万人次,外籍游客1.1万人次,入境游、避暑游市场双双升温。

三 | (来源:“人民日报”客户端)>>>点击查看详情 眼下,河口县依旧暑气蒸腾、万物并秀。

四 | 漫步在河口的街头巷尾,沿街绿化带里不时飘出阵阵清甜果香,为暑热中的边城添上了一抹沁人心脾的清凉。(通讯员:马阳睿然 侬批英)>>>点击查看详情 初秋时节,弥勒市天高云淡、清风和煦、层林染彩,整座城市沉浸在温柔静谧的秋韵之中。前者决定规划会不会脱离机械臂的能力,后者决定模型会不会卡在重复动作里,或还没完成当前动作就进入下一步。在湖泉生态园,湖水澄澈透亮、波光粼粼,岸边草木葱茏繁茂,湖光绿意相映成趣,风光旖旎动人。临水而建的亲水长廊游人如织,或漫步赏景或驻足留影,欢声笑语间,尽显小城秋日的悠然惬意。 端到端 Vision-Language-Action(VLA)模型通常根据当前观测直接生成动作序列。对于短程任务而言,模型仅根据当前画面生成动作序列通常已经够用;但随着任务步骤增多,模型很难持续追踪哪些操作已经完成,也容易混淆画面相似的不同阶段,导致误判任务进度。(通讯员:赵树龙)>>>点击查看详情 8月22日,记者从工商银行、农业银行、中国银行、建设银行、交通银行、邮储银行等六大银行了解到,各家银行已经根据财政部、中国人民银行、金融监管总局《关于进一步做好财政金融协同促内需政策有关工作的通知》,陆续发布公告,明确了最新的信用卡分期贴息政策执行要点。(来源:“央视新闻”微信公众号)>>>返回,查看更多。 另一类分层架构的方法:高层 VLM 负责规划,低层 VLA 负责执行。但二者并不天然兼容 —— 高层给出的往往是较为宽泛的开放语言,低层真正需要的却是明确到操作对象、目标位置和动作约束的可执行指令。

五 | VLA根据单帧输入难以判断任务进度而陷入循环。 近日,来自清华大学、上海人工智能实验室等机构的研究团队提出了 Cortex,一个面向长程机器人操作的双系统具身智能体框架。 它的核心思路,是用统一的结构化子任务描述连接高层规划与低层执行:高层生成的每项任务都明确操作对象、目标位置和动作约束,并被限定在低层执行器已经掌握的技能范围内;低层执行器在训练时,也使用相同格式的子任务描述,即「双向对齐」。 论文标题:Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation 项目网站:https://steinate.github.io/cortex.github.io 论文链接:https://arxiv.org/abs/2607.05377 代码链接:https://github.com/InternRobotics/Cortex 为了让这种对齐真正作用于长程任务,Cortex 并未只设计一个通信接口,而是从架构、数据、训练和部署四个方面搭建了一套完整体系。

六 | 视频链接:https://mp.weixin.qq.com/s/_Dkk116WPqO-F8GdCaOvDQ 架构:双系统分工,精准解决 「能不能做」和「做没做完」两大核心问题 在架构上,Cortex 将长程操作分为 System-2 和 System-1 两个层次,通过结构化的子任务将两个系统协同对齐,并通过文本记忆持续跟踪任务进度。

七 | 其中上层的 System-2 负责理解任务目标、拆分任务、维护记忆并判断当前进度;System-1 则接收当前子任务,根据子任务描述里的物体与本体约束,并将其转化为连续的机器人动作。 System-2 不会一次性生成完整的动作流程,而是根据当前视觉观测和已有记忆,持续判断应该保持当前任务、重新尝试,还是进入下一步。System-1 执行动作后产生的新观测会再次交给 System-2,用于更新记忆并判断任务是否完成。

八 | 由此,文章开头提到的两个问题被分别落实到系统设计中:结构化子任务接口保证高层提出的任务处于低层执行器的能力范围内,视觉观测与记忆的循环更新则帮助系统判断当前任务是否已经完成。 双向对齐的具身Agent架构,System-2接受观测和历史记忆输出当前子任务并更新实时记忆 数据:统一技能范式, 让规划指令可落地、无歧义 为消除高低层语义断层,Cortex 将操作行为归纳为 Pick、Place、Pour、Unscrew、Stir 等 32 种标准化技能原语,并为每类技能规定语言模板。 开放式的「把水倒进烧杯」会被整理成技能、目标对象与必要属性都明确的命令。

九 | 数据构建时,对于子任务输出,系统还写入颜色、空间位置、数量以及可达性等信息,减少「拿那个杯子」或「直接抓取不可达物体」一类语义正确、执行起来无法落地的规划。

十 | 对于记忆的更新,系统进行了语言压缩、关键信息如物体属性及统计数量写入等增强操作,提高 Cortex 完成空间理解、物体计数和失败恢复等复杂任务的成功率。

十一 | 围绕这套接口,团队对 4000+ 小时开源长时序视频与轨迹进行结构化标注,并修改仿真数据引擎自动生成约 30 小时带子任务标注的仿真数据。

十二 | 已有数据通过视觉语言模型重写为统一的子任务模板;自采轨迹则采用一套结合视觉、机器人状态和动作特征,基于动态规划的子任务边界切分工具链,实现自动化精准标注。 训练:最关键的训练样本, 集中在动作交界处 长轨迹的大多数画面都落在动作进行中。若均匀抽帧,模型最常学到的是「继续做当前动作」,真正决定是否切换子任务的边界帧反而很少。

十三 | Cortex 采用事件均衡采样(Event-balanced Sampling) 策略:在子任务边界前后约 1 秒的窗口内加密采样,同时保留执行阶段样本。模型既要学会动作尚未完成时保持指令和记忆,也要在看到完成证据后更新记忆、切换下一步。 在 Galaxea 数据的消融实验中,采用事件均衡采样的模型仅需 272 万训练样本,少于对照组的 310 万样本,综合评分却从 7.58 提升至 8.18。这说明对高层规划器而言,增加关键转场附近的监督,比继续堆叠大量稳定执行画面更有效。 Event-balanced sampling 示意图。

十四 | 橙色区间覆盖子任务切换;训练需要同时学会「耐心保持」和「及时换挡」。 实验:仿真领先几个百分点, 实机差距出现在完整任务上 Cortex 通过优化 Agent 框架 harness,直接面向真实机器人长程操作验证。团队不仅在 LIBERO-Long、RoboTwin 2.0 等仿真环境中测试,还将系统部署到真实双臂机器人平台上,Zero-shot 规划完成由数十个子任务组成的复杂化学实验任务。 在 LIBERO-Long 上,Cortex 的完整任务成功率为 95.5%,比单独使用 π0.5 的基线 92.4% 高 3.1 个百分点;在 RoboTwin 2.0 benchmark 下,整体成功率为 86.8%,比 π0.5 的 82.74% 高约 4.1 个百分点。这反映了整套 Agent 框架 —— 高层规划与底层执行对齐为长程任务的完成带来的增益。 更能体现系统差异的是实机长化学实验任务。研究者在 ARX ACONE 双臂平台上设计了两组 14 步流程,每组进行 20 次试验。Cortex 在化学液体搅拌实验和烧杯清洗任务上的完整成功率分别为 65% 和 55%;两种端到端模型(PI0.5 及 MEM)在这组试验中都因为混淆子任务阶段而中途失败。 14 步器皿操作流程。高层规划器需要持续记录漏斗、量筒、烧瓶和瓶塞的状态,并在确认每一步完成后再下发下一条局部指令。

十五 | 相比传统端到端 VLA 方法,Cortex 的优势并不只是某一个模块的提升,而是对长程任务进行了系统化建模。

十六 | 它用结构化子任务接口约束高层规划,用视觉反馈和语言记忆追踪执行进度,再通过闭环更新持续校正后续决策,使机器人能够在多步骤任务中保持目标、状态与动作的一致性。 这种设计让 Cortex 在仿真基准和真实双臂机器人实验中都展现出更强的长程操作能力。更重要的是,它给出了一个清晰的方向:面向真实场景的机器人智能,不能只依赖端到端动作生成,还需要能够围绕长期目标组织步骤、吸收反馈、更新状态,并在复杂流程中稳定推进。 对于真正进入实验室、家庭和工业现场的机器人来说,这种能力或许正是从 “完成一个动作” 走向 “完成一件事” 的关键一步。 作者介绍 论文共同第一作者彭嘉淇,余茜倩与冯德霖均来自上海人工智能实验室。其中彭嘉淇是清华大学与上海人工智能实验室联合培养的三年级博士生,导师为沈渊教授和林达华教授。在王泰研究员的指导下开展包括视觉动作语言模型,视觉语言导航,loco-manipulation 等机器人相关领域研究,致力于构造实现空间语义理解与长程移动操作的可落地具身智能体,曾发表多篇论文在 ICLR,ICRA 等会议上,NavDP/LoGoPlanner 一作,InternVLA-N1 核心作者,曾获得 ICRA oral。
Current article:http://ra9qiq.michengyuraochixun.buzz/8nw95n/20260826/87294.html
Published on:10:50:24
新闻热点
新闻爆料
图片精选
点击排行