上证报中国证券网讯(记者 李雁争)具身智能赛道持续升温,机器人正从实验室走向真实场景。墨奇智能联合创始人兼CTO黄青虬近日接受上海证券报记者专访时表示,具身智能正从概念验证走向真实场景落地,数据采集与处理能力是现阶段的发展重点。 家庭复杂环境锻造通用模型能力 墨奇智能选择家庭及类家庭场景作为切入口,目前覆盖家庭、酒店和商务公寓。在黄青虬看来,场景选择本质上是数据选择。“你选什么场景,就意味着你能拿到什么样的数据;你能拿到什么样的数据,就意味着你能训练出什么样的模型。” 他解释,具身智能的目标是做通用基础模型,模型的通用能力来自泛化性,而泛化性来自数据多样性。“只有选择一个足够复杂的场景,才能回流多种多样的数据,训练出来的基础模型能力才会足够强。有了足够强的基础模型,经过简单微调再去落地物流、工业这样的垂直领域,我认为是没有问题的。” 对于公司成立不到一年估值便超70亿元,黄青虬坦言行业存在一定泡沫,“落地产生的价值还远远跟不上各家具身公司的估值”。但他认为,大赛道长周期行业早期有泡沫是正常现象,也有正向作用。“投资本质上是投人,技术路径会持续迭代,投资人认可的是我们团队的技术思路以及商业演进路径。” 高质量数据有两个核心标准 数据是具身行业公认的瓶颈,但各家对高质量数据的标准并不统一。黄青虬认为这是正常现象,“数据和硬件、算法设计是强耦合关系,选择不同算法架构,对数据的标准和要求也不相同”。 具体到墨奇,高质量数据有两个核心标准。第一是采集端做到“三个真实”——真实的人,在真实的环境,干真实的活。他以擦桌子为例:“在专门的数采场地里,数采员的目标往往是完成一条规定动作轨迹;但保洁人员的目标是把桌子擦干净,会观察污渍,根据实际情况调整方向、力度和次数,没擦干净还会再来一次。” 第二是处理端的AutoLabel(自动标注)能力。采回来的数据要经过质量筛选、分类、数据挖掘打标签、自动标注,最后分阶段喂给模型,让模型从易到难逐步学习。“我们设计了多道防线对模型做规模化评测,评测完后那些不太好的场景,又重新回去采集、挖掘。” 对于数据环节的卡点,黄青虬表示并非单点问题,而是系统性工程。采集端的难点在于设备定位精度和便携性的权衡,“定位精度高就不便携,要便携精度就不够高”;处理端则面临生产什么标签对模型训练有促进作用的行业共识缺失。整体趋势是往可规模化(scale up)的方向发展,把处理难度留给算法。 具身智能的终局形态是人形 对于市场热议的具身智能“ChatGPT时刻”,黄青虬认为有两种定义。第一种是规模化进入一个行业,“如果能够有1000台机器进去真实作业,会是一个比较大的突破点,未来三年之内应该可以实现”。第二种从能力角度定义,即机器人能够进入80%左右的陌生场景、自主完成约80%的任务,“这个定义描述的是具身大脑的泛化性,至少需要5年时间”。 在产品形态上,黄青虬坚定相信具身的终局形态是人形。“物理世界是为人类打造的,人形能够最大程度适配物理环境。如果不做人形,就要对物理世界做改造,改基建的周期特别长。”但他同时表示,短期可以在人形基础上做裁剪,比如用底盘代替双足、用夹爪完成60%至70%的工作,但不要做异形产品。“在人形基础上裁剪,数据是可复用的;如果做一个三头六臂的机器人,可能都采集不到这样的数据。” 黄青虬特别提到,长程任务是机器人能力发展的新阶段。“长程任务的最大难点在于系统稳定性,如果每个模块失败率是1%,单个动作是0.99的3次方,但30个动作的长程任务就是0.99的30次方,对每个模块的可靠性要求极高。”他认为,今年以来干活类机器人比例提升、长程任务增多,说明行业在硬件、算法、软件的可靠性上已有新突破。 “以这种速度持续进步,再过两三年,应该就能在某些行业达到接近人的水平。”黄青虬表示,C端落地会有更长周期,因为家庭场景更复杂,还涉及安全和隐私问题,“前期我们更专注在跟物体接触这件事上,未来才有可能去跟人做接触”。
上证报中国证券网讯(记者 李雁争)具身智能赛道持续升温,机器人正从实验室走向真实场景。墨奇智能联合创始人兼CTO黄青虬近日接受上海证券报记者专访时表示,具身智能正从概念验证走向真实场景落地,数据采集与处理能力是现阶段的发展重点。
家庭复杂环境锻造通用模型能力
墨奇智能选择家庭及类家庭场景作为切入口,目前覆盖家庭、酒店和商务公寓。在黄青虬看来,场景选择本质上是数据选择。“你选什么场景,就意味着你能拿到什么样的数据;你能拿到什么样的数据,就意味着你能训练出什么样的模型。”
他解释,具身智能的目标是做通用基础模型,模型的通用能力来自泛化性,而泛化性来自数据多样性。“只有选择一个足够复杂的场景,才能回流多种多样的数据,训练出来的基础模型能力才会足够强。有了足够强的基础模型,经过简单微调再去落地物流、工业这样的垂直领域,我认为是没有问题的。”
对于公司成立不到一年估值便超70亿元,黄青虬坦言行业存在一定泡沫,“落地产生的价值还远远跟不上各家具身公司的估值”。但他认为,大赛道长周期行业早期有泡沫是正常现象,也有正向作用。“投资本质上是投人,技术路径会持续迭代,投资人认可的是我们团队的技术思路以及商业演进路径。”
高质量数据有两个核心标准
数据是具身行业公认的瓶颈,但各家对高质量数据的标准并不统一。黄青虬认为这是正常现象,“数据和硬件、算法设计是强耦合关系,选择不同算法架构,对数据的标准和要求也不相同”。
具体到墨奇,高质量数据有两个核心标准。第一是采集端做到“三个真实”——真实的人,在真实的环境,干真实的活。他以擦桌子为例:“在专门的数采场地里,数采员的目标往往是完成一条规定动作轨迹;但保洁人员的目标是把桌子擦干净,会观察污渍,根据实际情况调整方向、力度和次数,没擦干净还会再来一次。”
第二是处理端的AutoLabel(自动标注)能力。采回来的数据要经过质量筛选、分类、数据挖掘打标签、自动标注,最后分阶段喂给模型,让模型从易到难逐步学习。“我们设计了多道防线对模型做规模化评测,评测完后那些不太好的场景,又重新回去采集、挖掘。”
对于数据环节的卡点,黄青虬表示并非单点问题,而是系统性工程。采集端的难点在于设备定位精度和便携性的权衡,“定位精度高就不便携,要便携精度就不够高”;处理端则面临生产什么标签对模型训练有促进作用的行业共识缺失。整体趋势是往可规模化(scale up)的方向发展,把处理难度留给算法。
具身智能的终局形态是人形
对于市场热议的具身智能“ChatGPT时刻”,黄青虬认为有两种定义。第一种是规模化进入一个行业,“如果能够有1000台机器进去真实作业,会是一个比较大的突破点,未来三年之内应该可以实现”。第二种从能力角度定义,即机器人能够进入80%左右的陌生场景、自主完成约80%的任务,“这个定义描述的是具身大脑的泛化性,至少需要5年时间”。
在产品形态上,黄青虬坚定相信具身的终局形态是人形。“物理世界是为人类打造的,人形能够最大程度适配物理环境。如果不做人形,就要对物理世界做改造,改基建的周期特别长。”但他同时表示,短期可以在人形基础上做裁剪,比如用底盘代替双足、用夹爪完成60%至70%的工作,但不要做异形产品。“在人形基础上裁剪,数据是可复用的;如果做一个三头六臂的机器人,可能都采集不到这样的数据。”
黄青虬特别提到,长程任务是机器人能力发展的新阶段。“长程任务的最大难点在于系统稳定性,如果每个模块失败率是1%,单个动作是0.99的3次方,但30个动作的长程任务就是0.99的30次方,对每个模块的可靠性要求极高。”他认为,今年以来干活类机器人比例提升、长程任务增多,说明行业在硬件、算法、软件的可靠性上已有新突破。
“以这种速度持续进步,再过两三年,应该就能在某些行业达到接近人的水平。”黄青虬表示,C端落地会有更长周期,因为家庭场景更复杂,还涉及安全和隐私问题,“前期我们更专注在跟物体接触这件事上,未来才有可能去跟人做接触”。