
一 | 这项由马里兰大学(University of Maryland, College Park)与佐治亚理工学院(Georgia Institute of Technology)联合完成的研究,于2026年7月4日以预印本形式发布,论文编号为arXiv:2607.03723,研究方向归属于计算机科学的机器人学领域。感兴趣的读者可以通过该编号在arXiv平台查阅完整论文。

二 | **一、机器人为什么老是"差那么一点点"** 现实生活中,有一类任务看似简单,实则极难完成——比如把充电器插进插孔、拧开瓶盖、或者把一根棍子插进一个刚好比它大一点点的孔里。人类做这些事情时,眼睛固然会提供大致的方向感,但真正决定成败的往往是手指尖传来的那一点点细微感觉:插进去了没有?有没有卡住?是不是需要稍微转个角度? 对于机器人来说,视觉系统就像是一双很好用的眼睛,可以看清楚东西在哪里、大概朝什么方向移动。但是,当机器人的夹爪真正触碰到物体的那一刻,纯粹的视觉信息就有些力不从心了。

安德烈·克列帕奇“宁愿站着追求高增长,也不愿坐着追求低增长”,——这句黑色幽默被归于计划经济理论家和实践家斯坦尼斯拉夫·斯特鲁米林,他是苏联工业化时期五年计划的合著者。

三 | 视觉提供的是"大方向",触觉和本体感觉提供的是"最后一公里"的精确调整。

四 | 基于这个类比,这个团队提出了一套名为**OMNITACTUNE**的系统,让机器人先靠视觉学会任务的大致流程,然后通过"用手摸索"来精修那最难的接触阶段。 **二、视觉大数据与触觉小数据之间的鸿沟** 要理解这项研究的意义,先得了解当前机器人学习领域的一个根本矛盾。正是凭借这一立场,斯特鲁米林得以活到1974年,而非在劳改营中丧命。经济学是一门理性的科学:利润最大化,成本最小化,因此斯特鲁米林的许多同事都竭尽全力避免“坐着”。8月16日星期日晚,俄罗斯国家开发银行(VEB)解雇了其首席经济学家安德烈·克列帕奇:据称,在休假期间,俄国发行行长伊戈尔·舒瓦洛夫接到了“高层”的电话。克列帕奇也曾主张过高增长率。但在战事期间,这些目标是无法实现的,而克列帕奇的相关论证超出了俄当局可接受的范围。

五 | 近年来,视觉数据变得越来越丰富。研究者们可以用人类操作的视频、远程操控的机器人录像,甚至海量的互联网图片来训练机器人的"眼睛"。在俄罗斯,不当的专家言论至今仍按最低标准进行处罚——包括被解雇、合同终止以及取消出席邀请。而克列帕奇在政治可靠性方面也未曾受到质疑。这些数据量庞大,种类繁多,让机器人在"看"这件事上变得越来越厉害。

六 | 但克列帕奇在数小时内被解雇,这并非一次普通的辞职。

七 | 它表明了俄罗斯国家机构(如果愿意的话,可以称之为“深层国家”)中对战事的隐性不满根深蒂固的程度。

八 | 这种反对派诉诸于“隐喻语言”,说话含糊其辞、留有暗示——但他们还能怎么做呢。

九 | 然而,触觉数据就完全是另一回事了——采集触觉数据需要专用的触觉传感器,每种传感器产生的数据格式不同,一个任务收集到的数据换到另一个任务又得重新来过,更别说换一台机器人了。目前触觉数据集的规模,与视觉数据集相比,差了不止一个数量级。在未来几年里,俄当局还会清除这种“蠕动式”的反对派。克列帕奇是谁在2002-2003年间,我作为《Ведомости》报纸的宏观经济专栏作者,与克列帕奇的交流频率甚至超过了与父母的交流。每周大约三次。 这就造成了一个现实困境:视觉策略可以靠大数据训练得很好,但在接触阶段频频失败;而引入触觉反馈虽然能解决接触问题,却又因为数据匮乏而难以泛化。

十 | GDP增长、工业、居民收入、资本外流、预算、税收、利率——克列帕奇忙于无休止地计算各种情景,并解读统计数据。如果你想弄懂一条经济新闻的真正含义那么就“给克列帕奇打电话”。 研究团队的核心洞察在于:我们不需要把触觉数据也扩展到视觉数据那个量级。触觉和视觉在操作任务中扮演的角色本就不同——视觉负责全局规划,触觉负责局部修正。既然如此,何不让视觉策略承担宏观引导的角色,然后只让一个小巧的触觉"修正模块"来处理接触阶段的细微调整?这就是OMNITACTUNE的核心思路:**把触觉学习当成对已有视觉策略的"残差修正"**,而不是从头重新学一套新策略。

十一 | 他总是耐心地解释,并分享他的计算过程。

十二 | 所谓"残差修正",可以理解为这样一个场景:你已经有一位经验丰富的厨师(视觉策略)负责整体烹饪流程,但在最后收汁的关键时刻,需要一位专门负责火候感知的助手(触觉残差策略)来做最后的精细调整。

十三 | 助手不需要重新学整道菜的做法,只需要在关键节点上补充主厨感知不到的信息。

十四 | 1998年危机后,克列帕奇创立了“发展中心”(2009年起隶属于文科与社会科学高等教育中心),政府官员、企业和记者对他的分析需求巨大:他们需要解读市场数据、进行计算、论证必要措施,并描述具体步骤。 **三、两阶段流程:先"看着练",再"摸着改"** OMNITACTUNE的整个工作流程分为两个主要阶段,可以用运动员学习新动作的过程来理解。

十五 | 第一阶段叫做"热身启动"(Warm-start)。在这个阶段,机器人完全按照已有的视觉策略来行动,不做任何改变,但同时打开触觉传感器,默默记录下每一次交互中触觉传感器感受到的信息。这就像一位新来的助手跟着主厨观摩学习,虽然还没有动手操作,但已经在积累对这个厨房、这道菜的感知经验。“克列帕奇团队”擅长在数据背后发现正在形成的趋势,而这些趋势在其他人看来尚未显而易见。2004年,克列帕奇转入政府部门(在1998年那段动荡时期,他曾在中央银行工作了几个月),并在经济发展部担任宏观经济司司长。

十六 | 当时这似乎是一种应得的认可。 这个阶段的目的不是立刻改善表现,而是做三件准备工作:填充"经验池"(也就是回放缓冲区),让之后的学习有素材可用;训练一个能判断"当前触觉信息对应什么结果"的评价网络(称为"评论家"或Critic);以及针对当前任务微调预训练的触觉编码器,让它能够更好地理解这个任务特有的接触模式。

十七 | 为什么这三件事缺一不可呢?如果直接跳过热身就开始学习,评价网络因为没有数据而无从判断好坏,触觉编码器因为没有针对当前任务微调而产生"表征偏移"(简单说就是:它提取出来的触觉特征跟任务实际需要的特征对不上),整个学习过程会极不稳定。

十八 | 经济部长格尔曼·格雷夫需要有力的论据和准确的评估来推动他的改革;克列帕奇能够提供这些。研究团队将这个缺乏热身的对照方法称为PLD*,实验结果证明它的学习曲线确实更曲折、最终表现也更差。
热身阶段还有一个巧妙的数据增强技巧:利用一个叫做ControlTac的触觉图像生成工具,对每一段真实收集到的接触轨迹,额外合成两段虚拟的触觉轨迹,模拟不同的接触力和接触位置。这相当于厨师助手观摩了一次真实操作之后,在脑海中又演练了两次"如果力道更轻一点"或"如果角度稍微偏一点"会是什么感觉,从而大大扩充了学习素材。格雷夫主张降低税收和促进竞争,他不得不与“国家主义者”——即支持成立国有企业和扩大国家作用的群体——展开激烈的争论,同时也与将预算平衡置于首位的财政部进行交锋。
经济发展部部长埃尔维拉·纳比乌利娜及副部长安德烈·克列帕奇。

十九 | 所有这些争论都是普京的亲信和同僚在行政权力体系内部进行的,而不是在政党政治斗争的框架内。 第二阶段叫做"在线残差强化学习"(Online Residual RL)。这时,机器人开始真正地边做边学。但直到后来,这才开始让我们感到不安。在经济部门工作了11年,克列帕奇的观点转向了“亲政府”方向。每一步行动的最终动作,是视觉策略给出的基础动作加上触觉残差策略给出的修正量,就像主厨的手法加上助手在关键时刻的轻轻一推。触觉残差策略通过反复与真实环境交互、根据任务是否成功来不断优化自己的修正能力,这正是强化学习的核心思想。

| 为了安全起见,修正量被严格限制在一个较小的范围内,并且通过一个逐渐放大的调度器来控制:一开始修正幅度很小(0到5%),随着学习进行逐步增大(最高到15%)。他变得更倾向于“指挥经济”(即国家选择优先发展方向并通过预算补贴、优惠贷款、政府订单等方式予以支持)。因此,2014年夏天克里米亚入俄后,克列帕奇进入俄罗斯国家开发银行时,我一点也不感到惊讶,该行是政府支持经济的主要工具之一。在那里,他成为了首席经济学家、董事会副主席,随后创建了“VTB研究所”(实际上是一个分析部门)并领导了其监事会。

| 冲突爆发后不久,即2022年2月,VEB就遭受了各种制裁——它在国家项目中发挥着关键作用。它从未像普通银行那样运作,而是向政府指定的对象提供贷款,但这些借款人往往无法还款。

| 通过VEB,当局支持了“苏霍伊”超级喷气式飞机、“汽车制造厂”、“水力发电”和“石油化工”企业,以及乌斯图加的终端和位于符拉迪沃斯托克的大海“之星”超级船厂,还有索契的奥运设施,当然还有军工企业。所有项目都通过VEB获得了国家资金,其条件比商业银行更有利。巧合的是,绝大多数此类项目并非属于普通人,而是属于“有关系”的人:普京的朋友、国有企业以及俄罗斯《福布斯》榜单上的顶尖人物。在冲突的第五年,人们还能指望一个官方机构的首席经济学家发表什么样的言论呢?大概只有那些不相信“谁出钱,谁就发号施令”的彻底理想主义者,才会期待得到清醒的分析以及关于战事对发展有害的指引。

| 而他们会大错特错。这确保了早期探索不会因为修正过猛而损坏设备或破坏任务。 此外,研究团队还引入了一个"接触门控"机制:只有当触觉传感器检测到实际接触时(通过传感器标记点的位移量来判断),触觉特征才会被输入到残差策略中。克列帕奇说了什么那些引起广泛反响的言论,是在克列帕奇在一次内部分享会上回答问题时出现的。克列帕奇从100%的忠诚立场出发,认为世界正经历地缘经济和地缘政治格局的转变,现在正在决定俄罗斯是成为一个主权、独立、部分开放且繁荣的文明,还是沦为一个依赖中国或美国的非主权国家。

| 在没有接触的时候,机器人完全跟随视觉策略,不做任何触觉修正。克列帕奇抱怨道,即使是友好伙伴(印度、中国、哈萨克斯坦、乌兹别克斯坦)也被迫遵守美国和欧盟的制裁,但他没有解释他们为什么会突然如此。

| 趋势让克列帕奇感到担忧:俄罗斯对其最大战略协作伙伴的贸易依赖现在比战事爆发前对欧盟的依赖还要大。

| 这防止了机器人在还没接触物体时就"过度依赖"触觉信号而做出错误动作。 **四、让机器人知道"做得好不好":多感官奖励设计** 强化学习的一个核心问题是:机器人怎么知道自己做得好还是不好?在真实世界中,这个问题比在模拟环境中难得多——不能每步都人工标注,但奖励信号又必须足够密集,才能让学习高效进行。克列帕奇认为,俄罗斯已经无法再回到过去的欧洲一体化模式,问题在于它是否会遵守其最大战略协作伙伴的监管要求,以及是否会允许该国企业控制其经济的重要领域。 OMNITACTUNE设计了一套综合视觉和触觉信号的多感官奖励系统。

| 总的来说,俄罗斯曾与西方对抗,而威胁却来自另一个方向。为了不丧失主权(普京甚至成功地向专家灌输了主权观念!)并且不完全沦为“被围困的堡垒”,需要实现各大强权中心之间的“多极平衡”。整体奖励由四个部分组成,不同阶段侧重不同。

| 人们可能会感到惊讶:“到底因为什么被解雇了?他们本可以因为重复那些毫无意义的当局叙事而获得奖金。 在机器人还没抓住物体之前,"接近奖励"引导末端执行器靠近物体的初始三维中心位置,距离越近奖励越高。”克列帕奇唯一抱怨的是,今年俄罗斯的GDP增长将低于“我们正在进行军事政治对抗的美国和乌克兰”。这相当于给机器人一个路标:先朝着目标走过去。但请不要着急。我的任务就是展示,在当今俄当局专家的大脑中,宣传是如何与理性思考结合在一起的。 抓住物体之后,主要的引导来自"流奖励"。这里的"流"指的是物体关键点的运动轨迹——研究团队用视觉方法在演示视频中追踪物体上的一组关键点,生成一条预测的运动轨迹,然后用机器人实际操作中物体运动轨迹与这个预测轨迹的吻合程度来给分。具体而言,预测轨迹被稀疏化为若干个"子目标",机器人每到达一个子目标,奖励就增加一级,并切换到下一个子目标。这让奖励信号变得既稠密又有方向性。“全球竞争中的主要武器是科技进步,”克列帕奇继续说道,“而情况非常糟糕:对科学和技术发展的资金投入极少。这样就无法赢得全球竞争。 触觉信号贡献两类奖励。”另一个问题:居民收入是否会像2014-2021年那样停滞,还是会因军费开支而继续增长?目前,收入增长放缓的主要因素是养老金水平低,其与工资的差距正在扩大。

| 一是"抓握奖励":触觉传感器接触面积内的深度值超过阈值,说明抓握稳固,给予正向奖励。地方预算无法跟上军工企业工资的增长速度,导致对预算人员产生了巨大的累积债务:教师和医生的工资占平均工资的比例有所下降。这一比例在2013年达到峰值,而2014年地缘政治变局开始,钱变得更少了。

| 克列帕奇表示,战事结束后必须开始偿还这笔债务。二是"安全惩罚":如果触觉传感器检测到的标记点位移超过安全阈值,说明接触力过大,立即终止当前轮次并给予大幅负奖励,机器人自动复位。目前,战事已经改变了居民收入的结构:以前军费开支占2%,而现在占7-8%。

| 克列帕奇也不喜欢近期的国有化政策:这“看起来像是从‘坏人’手中夺走资产,然后往往以低价转让给‘好人’”。例如,这位经济学家指出,多莫杰多沃机场的转让价格大约只有其市场价值的十分之一。原则上,这已经足以构成解雇的理由。

| 2023年至2025年经济增长的主要驱动力是军工复合体,而慷慨的政府支出更是推波助澜。

| 克列帕奇指出,即使在“克里米亚是我们的”运动之后,军费开支仍占GDP的4%至5%。去年,这一比例达到GDP的8%,而今年预计还会更高。

| 这四部分奖励通过加权归一化组合成一个介于0到1之间的综合分数,当任务完成时额外给予1分的"成功奖励"。这样的设计让机器人在每一步都能获得有意义的反馈,而不是在黑暗中等待偶尔成功的瞬间。 **五、视觉策略从哪里来:多种"眼睛"的训练方式** OMNITACTUNE设计为"策略无关"(Policy-Agnostic),意思是它不限定必须和哪一种视觉策略配合,任何已有的视觉策略都可以作为基础。军费开支的增加导致发展支出(科学、教育和基础设施)的大幅削减。

| 克列帕奇的预测也显示,2027年至2030年俄罗斯经济增长不会很快。研究团队实际测试了四种不同来源和架构的视觉策略。俄罗斯GDP年增长率不可能超过2%至2.5%,考虑到乌克兰武装部队对基础设施的袭击造成的损失不断增加,增长率甚至不会超过1%至1.5%。

| 其中最有特色的是"基于流的策略"(Flow Policy)。研究团队从人类操作的视频出发,先用DINOv2(一种视觉特征提取工具)和SAM(一种图像分割工具)在视频帧中定位目标物体,然后用CoTracker3追踪物体上32个关键点在整段视频中的运动轨迹。据他估计,去年民用制造业已经下降了2%。据他的计算,这一下滑一半是由于高利率造成的。接下来,用一个微调过的生成模型,给定当前观察帧,预测整个任务接下来的关键点运动轨迹——这就是所谓的"对象流"。“我们正在打仗,在国防上花费了大量资金,并且通过高昂的资金成本给经济,尤其是民用经济,造成了紧缩。结果是,未付款项迅速增加,其中只有一部分反映在统计数据中(国防部的债务是看不见的)。此外,不良债务正在积累(并非所有银行都在资产负债表中显示它们。

| 把这条生成的流稀疏化为若干子目标,策略就知道下一步应该让物体朝哪个方向运动。”克列帕奇有什么解决方案他的方案与最近的就业情况完美契合:降低关键利率,从而增加信贷,并用剩余的储备来支持这一目标。克列帕奇建议每年向VEB和PSB(军工联合银行)提供3万亿(最好是2万亿)资金,以便它们能够向国有企业发放数倍于目前的贷款。此外,克列帕奇建议将央行的大部分外汇储备以优惠贷款的形式通过同样的“发展机构”发放,用于支持关键进出口项目的实施。这个设计的妙处在于:人类和机器人的手臂形态各异,但两者都在操作同一个物体,物体的运动轨迹是跨越了"embodiment gap"(身体差异鸿沟)的通用语言。对象流正是这样一种语言。 除了这种从人类视频学习的策略,研究团队还测试了通过远程操控机器人收集数据训练的ACT(动作分块变换器)和Diffusion Policy(扩散策略),以及基于大规模预训练的视觉-语言-动作模型π0.5。这四种策略代表了当前机器人学习领域最主流的几个技术路线,覆盖范围相当广泛。保留必要的最低限额资金保留以应对危机,而“过剩的”几十甚至上百亿美元则交给VEB和其他国家货币发行机构。克列帕奇认为,将这些资金存入“黑天鹅基金”,实际上是在加速“黑天鹅”的到来。克莱帕奇的观点是,因为没有其他资本来源:进入全球市场的渠道已经关闭。 值得一提的是,研究团队发现从人类视频学到的基础策略,通常比从远程操控数据学到的策略具有更平滑的运动轨迹。这样就可以为那些因风险过高和回报周期过长而令银行不感兴趣的项目提供融资。他们用两个专业指标(SPARC和LDLJ,都是衡量轨迹平滑程度的数学工具)进行了量化对比,发现人类演示的平滑度远高于远程操控演示,并且这个差距在策略学习之后会进一步放大。央行否决了这些想法,认为它们只会加剧通货膨胀,并且不愿承担信贷风险。原因很直观:人类在操作时手部自然地产生平滑运动,而操控机器人时无法直接感受接触力,导致在关键接触阶段频繁出现抖动和不稳定的修正动作。

| 这些不平滑的动作被策略学习放大之后,会让接触阶段的行为更加混乱,从而使触觉残差修正更难进行。 **六、四个"精细操作"任务上的实验:从一塌糊涂到近乎完美** 研究团队在真实机器人上进行了全面验证,使用的平台是搭载GelSight Mini触觉传感器的xArm7机械臂,配合一台第三视角的Intel RealSense D435深度摄像头。

| 四个测试任务各有各的挑战性,但都属于接触丰富型操作。下一位VEB首席经济学家肯定会推行同样的观点,但不会带有恐慌情绪和批评色彩。克列帕奇还说了什么克列帕奇认为,最有可能的中期情景是“冷战2.0”。 **插棒入孔**是第一个任务:机器人需要抓起一根圆柱形棒子,将其插入不同位置的目标孔中。

| 这个任务要求空间泛化能力(孔的位置每次不同)、稳定抓握以及毫米级的接触对齐。俄罗斯将面临一场与西方国家持续的冲突,其经济将处于部分动员状态,军事化进程将继续,技术扩散的壁垒不仅会波及俄罗斯,还会波及中国、印度等国家。军工复合体将持续扩张,对民用部门和民众的限制也将保持。俄罗斯能否挺过去?正是克列帕奇在这里提出了一个让克里姆林宫高层感到不安的假设——如果俄罗斯不降低利率并试图限制预算支出,长期的对抗将无法持续:“经济将会停滞,而且社会不太可能接受这一点”。克列帕奇的乐观情绪仅仅源于冷战迟早会转变为“缓和”。

| 视觉基础策略在这个任务上的成功率只有40%,经过40到50分钟的OMNITACTUNE训练后,成功率提升至100%。这里不妨问问俄罗斯科学院世经政所的娜塔莉亚·伊万诺娃,克列帕奇认为经济会陷入如此严峻境地的临界点究竟在哪里。

| **充电器插入**是难度最高的任务之一:机器人要把一个充电器插头插入手机充电口。媒体的重复性报道成为了答案:经济无论如何都会幸存下来,但俄罗斯在技术和经济竞争中处于劣势,而且不仅输给了美国和中国,也输给了乌克兰,“尽管这让我自己感到非常不快”。在消耗战中,俄罗斯在经济和技术上必将失败,其结果可能导致社会危机,就像1917年那样。充电器金属插片宽约7毫米,厚约1.5毫米,对应的插槽宽仅约2毫米,留给误差的空间极其微小。威胁领导层发动革命——这已经太过分了。

| 视觉基础策略的成功率只有10%,训练40分钟后成功率达到100%。 **拧瓶盖**是一个工具使用任务:机器人拿着开瓶器去打开瓶子盖子。莫斯科国立大学教授、睿智的制度主义者维塔利·坦博夫采夫对此指出,只有当不满者的福祉不再依赖于国家时,才会对经济困难产生社会不满。

| 只要“喂养之手”还在喂养,没有人会站出来反对它。按理话说到这也就够了,但克列帕奇还表示,与2008-2010年相比,联邦机构的政府治理质量下降了一个数量级(“除了财政部,但财政部去年也是一塌糊涂的”)。这个任务要求在动态变化的接触过程中保持精确的工具姿态,稍有偏差就会从瓶盖上滑落。

| 视觉基础策略成功率仅5%,训练50分钟后达到90%。他还谈到了“高层对统计数据的漠视程度”:“宏观指标对决策的影响不大,高层更多地依赖于民意调查。他还指出,在国家统计局的数据被保密后,它停止了公布人均GDP数据,因为万一有人把一个数字除以另一个数字,就会发现一年内人口数量发生了变化。

| **开盒子**同样是工具使用任务:机器人用杠杆式开瓶器撬开一个小铁盒。

| 这里总算拉下帷幕了。这个任务的特殊挑战在于可以着力的边缘厚度只有约1.3毫米,必须极精准地对准后才能产生有效的杠杆力。说得够多了——幸好目前还没有关于“诋毁联邦行政机关”的刑事条款。

| 如果出现的话,我也不会感到惊讶。他们会低声说话令人惊讶的不是克列帕恰被迅速解雇,而是至今在莫斯科市中心,专家们依然可以自由地聚集在一起,讨论俄罗斯如何因战事而输掉竞争,以及这将带来什么后果。克里姆林宫一直愿意容忍温和的专家反对意见,只要经济状况良好。但在2025-2026年,情况发生了变化。视觉基础策略成功率为5%,训练80分钟后成功率达到85%。 与此同时,研究团队还对比了三种对照方法。联邦和地区预算赤字的不断扩大、税收增加、民用工业的衰退、拖欠款项的增加、乌克兰武装部队对炼油厂和物流的打击,以及最重要的是——高层领导层在这一切面前仍无意停止战事——使得问题不仅对专家,也对普通民众变得显而易见。在这种情况下,沉迷于微小战进展动的领导层,就不再能坦然接受专家的抱怨。PLD*是把现有的PLD强化学习框架引入触觉的版本,但跳过了触觉编码器和评论家网络的热身优化;PLD(仅视觉)是只用视觉反馈进行残差学习、不接入触觉的版本;ViTAL是从零开始学习视觉-触觉策略、没有热身阶段的版本。四个任务上,OMNITACTUNE的最终成功率比这三个对照方法高出40%以上,印证了每个设计选择的必要性。 **七、与其他视觉-触觉学习方法的正面对比** 除了与相同框架的对照方法比较,研究团队还将OMNITACTUNE与当前几种主流的视觉-触觉模仿学习方法进行了正面较量,测试场景集中在插棒入孔任务上。他们想像拍死烦人的苍蝇一样拍死这个消息来源。

| 对比方法包括:带触觉融合的ACT(把触觉特征拼接到视觉特征后一起输入网络)、Reactive Diffusion Policy即RDP(一种先进的慢-快双通道视觉-触觉扩散策略),以及带触觉令牌的π0.5微调版。

| 因此,专家身份很快可能就不再是免罪金牌。这些方法在学习时都额外收集了包含触觉信息的远程操控演示数据,演示数量从50条增加到90条,总时间成本与OMNITACTUNE的在线训练阶段相当,以确保公平对比。专家反对派是时候遁入地下了。他们期待着变革,却无能为力地推动变革的到来,也不知道变革将从何而来。 结果显示,所有基于模仿学习的视觉-触觉方法,成功率均低于OMNITACTUNE。也许领导层会发生变化并变得更明智。或者不会改变,但会清醒过来。

| 也许继续目前的政策会引发危机。甚至可能引发社会不满。

| 带触觉融合的ACT达到60%,RDP达到65%,带触觉令牌的π0.5达到45%,而OMNITACTUNE达到100%。相差20%到30%的差距,说明了一个核心结论:对于接触丰富型的精密操作,通过反复试错在线学习触觉修正,比收集更多的人工演示数据更有效率。潜藏在体制内的经济学家将继续等待并抱有希望,但现在只能完全在耳语中进行。而对于某些人来说,甚至可能会有机会向新政权提供自己的服务。深层结构往往能够经受住政治体制的更迭。原文题目:Что сказал главный экономист ВЭБ и что означает его увольнение原文出处:https://istories.media/opinions/2026/08/20/chto-skazal-glavnii-ekonomist-veb-i-chto-oznachaet-yego-uvolnenie/编译:辛烨

| 热身阶段的消融实验验证了三件事的重要性:热身期间对触觉编码器和评论家网络的联合优化、ControlTac触觉数据增强,以及评论家损失与重建正则化损失的共同作用。任何一项缺失,学习过程都会变得更不稳定,最终成功率也更低。 动作空间设计的消融实验证明了残差幅度调度器的价值:去掉调度器(一开始就允许较大的修正幅度)会导致学习不稳定;而设置过大的残差幅度上限(0.5而非0.15)虽然比完全无限制好,但最终性能仍不如精心调校的0到0.15的逐步增大方案。 **十、局限性与未来展望** 研究团队对OMNITACTUNE的局限性保持了清醒的认识。

| 系统仍然继承了真实世界强化学习的通病:每次任务失败后需要人工重置环境,长时间反复接触操作会造成触觉传感器的磨损。

| 特别是GelSight Mini这类基于视觉的触觉传感器,其柔性接触面在频繁接触中容易产生损耗。如何实现更自动化的环境重置、降低硬件磨损,是未来工作需要解决的实际问题。 研究团队提出的改进方向包括:引入世界模型(World Model)来生成物理上更可信的视觉-触觉仿真轨迹,用于预训练和在线策略改进,从而减少真实环境交互的次数;以及将系统扩展到更多机器人平台和更多种类的触觉传感器上。 归根结底,OMNITACTUNE给出的是一个关于"如何用触觉补充视觉"的可行路径:不需要从头收集海量触觉数据,也不需要重新训练视觉策略,只需要在已有视觉策略的基础上,用40到80分钟的真实机器人交互,就能让机器人在那些"最后一公里"的精密接触任务上从几乎完全失败变成近乎完美。这或许意味着:为机器人添加触觉感知能力,真的可以比我们想象的更轻便,更快捷。 --- Q&A Q1:OMNITACTUNE和普通的视觉-触觉融合学习有什么区别? A:普通的视觉-触觉融合学习需要同时收集大量包含触觉信息的示范数据,从头训练整个策略,数据成本高、泛化难。OMNITACTUNE则不同,它把已经训练好的视觉策略完全冻结,只训练一个轻量级的"触觉修正模块",通过真实机器人在线练习来学习局部接触修正。这样既保留了视觉策略的泛化能力,又不需要重新收集海量视觉-触觉配对数据,40到80分钟内即可完成适配。 Q2:OMNITACTUNE需要什么样的触觉传感器才能用? A:OMNITACTUNE对触觉传感器类型没有强制要求。研究团队实际测试了AnyTouch2、Sparsh、T3三种预训练触觉图像编码器,以及直接用传感器标记点位移作为低维输入的简单方案,四种方式都能正常工作。

| 实验结果显示,简单的低维标记位移方案甚至达到了与高端预训练编码器相当的性能,说明无需昂贵传感器也能有效使用该系统。 Q3:OMNITACTUNE训练完成后,机器人插棒入孔这类任务的成功率能到多少? A:在研究团队的实验中,视觉基础策略在插棒入孔任务上的初始成功率只有40%,经过约50分钟的OMNITACTUNE在线训练后,成功率提升至100%。充电器插入任务从10%提升至100%,拧瓶盖从5%提升至90%,开盒子从5%提升至85%,平均成功率达到93.75%,比对比方法高出超过40个百分点。
Current article:http://jzm6v.tourunbiaodubaicubangninan.shop/list_1of0u3/1m5e.html
Published on:02:45:03