文章ID:3127

沉默的羔羊

为球迷而生的潮玩!福特宝联手范盒空间共创新IP“阿秋”_我的网站

同桌的你

A |     

2026年7月16日,中国福特宝足球产业发展公司与广州范盒空间创意科技有限公司在北京世东国际大厦正式签署合作协议。    拿起漏斗,插入圆底烧瓶;拿起量筒,把液体倒入烧瓶;移走漏斗,将烧瓶放到搅拌器上,再塞入瓶塞并按下开关。         对人来说,这是一串可以按顺序完成的动作;但对机器人,每一步都藏着两个判断:规划出的动作能否执行,当前动作是否完成。

B | 双方以“为热爱共赴绿茵主场”为主题,宣布将联手打造全新足球潮玩IP“阿秋(Arqiu)”,共同推出一系列面向广大球迷群体的潮流文创产品,以潮玩力量激活足球文化,让足球以更有趣、更日常的方式走进球迷生活。前者决定规划会不会脱离机械臂的能力,后者决定模型会不会卡在重复动作里,或还没完成当前动作就进入下一步。         端到端 Vision-Language-Action(VLA)模型通常根据当前观测直接生成动作序列。

C | 对于短程任务而言,模型仅根据当前画面生成动作序列通常已经够用;但随着任务步骤增多,模型很难持续追踪哪些操作已经完成,也容易混淆画面相似的不同阶段,导致误判任务进度。

D | 作为中国足协全资公司,中国福特宝足球产业发展公司长期深耕赛事运营、商业开发、球迷服务,整合赛事票务、正版周边、球迷社群及线下活动等全链条资源,拥有庞大的球迷基础与权威的行业公信力。此次入局潮玩赛道,是福特宝主动拥抱年轻球迷、丰富球迷服务形态的重要举措。福特宝相关负责人表示:“球迷群体日益年轻化,他们不仅看球、聊球,更愿意为自己热爱的球队和文化付出。         另一类分层架构的方法:高层 VLM 负责规划,低层 VLA 负责执行。我们希望用潮玩这种年轻人喜爱的方式,把足球精神送到球迷手心,让服务球迷的半径从赛场延伸至日常。”范盒空间是由世奥公司与曦望文化联合成立的创意科技企业。公司依托世奥公司丰富的赛事资源,由曦望文化负责产品设计、研发与市场推广,专注体育潮玩领域,深耕IP开发与全域运营,具备从IP孵化、产品研发到市场落地的全链路能力。范盒空间始终坚持“潮玩化、情感化”的设计思路重塑足球衍生品,打造兼具文化厚度与市场热度的体育潮玩产品。但二者并不天然兼容 —— 高层给出的往往是较为宽泛的开放语言,低层真正需要的却是明确到操作对象、目标位置和动作约束的可执行指令。         VLA根据单帧输入难以判断任务进度而陷入循环。         近日,来自清华大学、上海人工智能实验室等机构的研究团队提出了 Cortex,一个面向长程机器人操作的双系统具身智能体框架。

E | 此次与福特宝强强联手,范盒空间将全面输出潮玩创意与产品落地能力,让阿秋(Arqiu) IP真正成为一款“为球迷而生”的潮玩代言。签约仪式现场,阿秋(Arqiu)定制IP人偶成为全场焦点。据介绍,阿秋(Arqiu)以真实球迷形象为创作原点,融合足球、潮玩与生活等年轻文化元素,被设定为每一个热爱足球的人身边的“足球伙伴”。         它的核心思路,是用统一的结构化子任务描述连接高层规划与低层执行:高层生成的每项任务都明确操作对象、目标位置和动作约束,并被限定在低层执行器已经掌握的技能范围内;低层执行器在训练时,也使用相同格式的子任务描述,即「双向对齐」。

F | 其名称“阿秋(Arqiu)”源自赛场上一声由衷的喝彩——“哇!真是一颗漂亮的进球”,在粤语中更有“厉害、强劲”之意,象征着足球的能量与激情;“秋”亦是收获的季节,寓意每一次拼搏终将迎来丰硕成果。

G | 阿秋(Arqiu)的精神内核是“用热爱,为平淡生活开球”,旨在唤醒每个人心中那份对足球与生活的热忱,让潮玩成为连接日常与绿茵的情感纽带。         论文标题:Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation          项目网站:https://steinate.github.io/cortex.github.io               论文链接:https://arxiv.org/abs/2607.05377               代码链接:https://github.com/InternRobotics/Cortex               为了让这种对齐真正作用于长程任务,Cortex 并未只设计一个通信接口,而是从架构、数据、训练和部署四个方面搭建了一套完整体系。

H |          视频链接:https://mp.weixin.qq.com/s/_Dkk116WPqO-F8GdCaOvDQ          架构:双系统分工,精准解决          「能不能做」和「做没做完」两大核心问题          在架构上,Cortex 将长程操作分为 System-2 和 System-1 两个层次,通过结构化的子任务将两个系统协同对齐,并通过文本记忆持续跟踪任务进度。         其中上层的 System-2 负责理解任务目标、拆分任务、维护记忆并判断当前进度;System-1 则接收当前子任务,根据子任务描述里的物体与本体约束,并将其转化为连续的机器人动作。与传统赛事纪念品不同,阿秋(Arqiu)并非简单的标志复刻或一次性周边,而是一个拥有独立性格、故事体系和情感内核的潮玩形象。围绕这一核心IP,双方将展开盲盒、手办、文创周边等一系列产品的联合开发,让足球文化以潮玩为载体,走入球迷的展柜、工位与生活场景。         System-2 不会一次性生成完整的动作流程,而是根据当前视觉观测和已有记忆,持续判断应该保持当前任务、重新尝试,还是进入下一步。System-1 执行动作后产生的新观测会再次交给 System-2,用于更新记忆并判断任务是否完成。阿秋(Arqiu)不仅能够为资深球迷提供全新的收藏体验,更将凭借萌趣潮流的设计打破圈层壁垒,吸引更多泛球迷、年轻群体通过“入手一款潮玩”开始认识足球、爱上足球,真正践行“共同服务广大足球球迷群体”的合作初心。         由此,文章开头提到的两个问题被分别落实到系统设计中:结构化子任务接口保证高层提出的任务处于低层执行器的能力范围内,视觉观测与记忆的循环更新则帮助系统判断当前任务是否已经完成。未来,福特宝与范盒空间将以阿秋(Arqiu)为起点,持续深耕足球潮玩赛道,围绕产品开发、内容孵化、线下体验与品牌推广,构建“潮玩IP+球迷服务+文化传播”的一体化生态。双方将不断推出更丰富、更具陪伴感的足球潮玩产品,让足球文化在赛场之外持续生长,让每一位球迷都能在潮流玩具中找到属于自己的绿茵热爱。据悉,阿秋(Arqiu)系列首批潮玩产品计划于今年9月全渠道同步发售,敬请广大球迷持续关注。         双向对齐的具身Agent架构,System-2接受观测和历史记忆输出当前子任务并更新实时记忆          数据:统一技能范式,          让规划指令可落地、无歧义          为消除高低层语义断层,Cortex 将操作行为归纳为 Pick、Place、Pour、Unscrew、Stir 等 32 种标准化技能原语,并为每类技能规定语言模板。

I |          开放式的「把水倒进烧杯」会被整理成技能、目标对象与必要属性都明确的命令。数据构建时,对于子任务输出,系统还写入颜色、空间位置、数量以及可达性等信息,减少「拿那个杯子」或「直接抓取不可达物体」一类语义正确、执行起来无法落地的规划。         对于记忆的更新,系统进行了语言压缩、关键信息如物体属性及统计数量写入等增强操作,提高 Cortex 完成空间理解、物体计数和失败恢复等复杂任务的成功率。         围绕这套接口,团队对 4000+ 小时开源长时序视频与轨迹进行结构化标注,并修改仿真数据引擎自动生成约 30 小时带子任务标注的仿真数据。已有数据通过视觉语言模型重写为统一的子任务模板;自采轨迹则采用一套结合视觉、机器人状态和动作特征,基于动态规划的子任务边界切分工具链,实现自动化精准标注。         训练:最关键的训练样本,          集中在动作交界处          长轨迹的大多数画面都落在动作进行中。

J | 若均匀抽帧,模型最常学到的是「继续做当前动作」,真正决定是否切换子任务的边界帧反而很少。

K |          Cortex 采用事件均衡采样(Event-balanced Sampling) 策略:在子任务边界前后约 1 秒的窗口内加密采样,同时保留执行阶段样本。

L | 模型既要学会动作尚未完成时保持指令和记忆,也要在看到完成证据后更新记忆、切换下一步。         在 Galaxea 数据的消融实验中,采用事件均衡采样的模型仅需 272 万训练样本,少于对照组的 310 万样本,综合评分却从 7.58 提升至 8.18。这说明对高层规划器而言,增加关键转场附近的监督,比继续堆叠大量稳定执行画面更有效。

M |          Event-balanced sampling 示意图。橙色区间覆盖子任务切换;训练需要同时学会「耐心保持」和「及时换挡」。         实验:仿真领先几个百分点,          实机差距出现在完整任务上          Cortex 通过优化 Agent 框架 harness,直接面向真实机器人长程操作验证。团队不仅在 LIBERO-Long、RoboTwin 2.0 等仿真环境中测试,还将系统部署到真实双臂机器人平台上,Zero-shot 规划完成由数十个子任务组成的复杂化学实验任务。

N |          在 LIBERO-Long 上,Cortex 的完整任务成功率为 95.5%,比单独使用 π0.5 的基线 92.4% 高 3.1 个百分点;在 RoboTwin 2.0 benchmark 下,整体成功率为 86.8%,比 π0.5 的 82.74% 高约 4.1 个百分点。这反映了整套 Agent 框架 —— 高层规划与底层执行对齐为长程任务的完成带来的增益。         更能体现系统差异的是实机长化学实验任务。研究者在 ARX ACONE 双臂平台上设计了两组 14 步流程,每组进行 20 次试验。Cortex 在化学液体搅拌实验和烧杯清洗任务上的完整成功率分别为 65% 和 55%;两种端到端模型(PI0.5 及 MEM)在这组试验中都因为混淆子任务阶段而中途失败。         14 步器皿操作流程。高层规划器需要持续记录漏斗、量筒、烧瓶和瓶塞的状态,并在确认每一步完成后再下发下一条局部指令。         相比传统端到端 VLA 方法,Cortex 的优势并不只是某一个模块的提升,而是对长程任务进行了系统化建模。         它用结构化子任务接口约束高层规划,用视觉反馈和语言记忆追踪执行进度,再通过闭环更新持续校正后续决策,使机器人能够在多步骤任务中保持目标、状态与动作的一致性。         这种设计让 Cortex 在仿真基准和真实双臂机器人实验中都展现出更强的长程操作能力。

o | 更重要的是,它给出了一个清晰的方向:面向真实场景的机器人智能,不能只依赖端到端动作生成,还需要能够围绕长期目标组织步骤、吸收反馈、更新状态,并在复杂流程中稳定推进。         对于真正进入实验室、家庭和工业现场的机器人来说,这种能力或许正是从 “完成一个动作” 走向 “完成一件事” 的关键一步。         作者介绍          论文共同第一作者彭嘉淇,余茜倩与冯德霖均来自上海人工智能实验室。

p | 其中彭嘉淇是清华大学与上海人工智能实验室联合培养的三年级博士生,导师为沈渊教授和林达华教授。在王泰研究员的指导下开展包括视觉动作语言模型,视觉语言导航,loco-manipulation 等机器人相关领域研究,致力于构造实现空间语义理解与长程移动操作的可落地具身智能体,曾发表多篇论文在 ICLR,ICRA 等会议上,NavDP/LoGoPlanner 一作,InternVLA-N1 核心作者,曾获得 ICRA oral。

Current article:http://fllw.yuejinhuapennuochoudengying.cyou/news/20260826_8816078.html

Published on:18:25:09


用户评论
用户名:
E-mail:
评价等级:               
评价内容: