【导语】随着人形机器人技术的飞速发展,3D视觉技术已成为其实现环境感知与智能化决策的关键支撑。这一技术不仅提升了机器人的安全性与鲁棒性,还预示着巨大的市场规模增长潜力。从多目立体视觉到激光雷达、结构光、飞行时间法(ToF)以及单目视觉与深度学习的结合,各种3D视觉技术路线各具特色。在人形机器人市场规模不断扩大的背景下,3D视觉传感器产业链正加速完善,国内代表性厂商如奥比中光、华捷艾米等正引领技术创新与成本优化的双重突破,共同推动3D视觉技术迈向更广阔的消费级应用场景。

电子发烧友网报道(文 / 吴子鹏)在人形(xíng)机(jī)器(qì)人的设计方案中,3D 视觉技术是实现环境感知与智能化决策的核心支撑之一。它能够助力人形机器人完成环境感知与建模、动态目标检测与跟踪、物体操作与精细控制等任务,显著提升人形机器人的安全性与鲁棒性。
相较于其他类型的传感器,3D 视觉传感器具有精度高、信息量大、集成度高等诸多优势。浙商证券的研究指出,机器人视觉承担了 80% 的信息获取任务。相关预测数据显示,人形机器人 3D 视觉传感器的市场规模将从 2025 年的 1.4 亿元大幅增长至 2030 年的 91.5 亿元,复合年增长率(CAGR)高达 132%。
3D 视觉技术发展路线
当前,人形机器人的 3D 视觉技术路线主要围绕 “如何获取 3D 信息” 和 “如何处理 3D 数据” 展开,主要包含以下几类:
首先是多目立体视觉。其原理是通过多个相机模拟人眼视差,进而计算像素级深度图。该技术具有成本低、结构简单、适合中距离场景的优势。然而,多目立体视觉的计算复杂度较高,需(xū)要(yào)对(duì)左(zuǒ)右(yòu)图(tú)像(xiàng)特(tè)征(zhēng)进(jìn)行(xíng)匹(pǐ)配(pèi),并(bìng)且(qiě)在(zài)弱(ruò)纹(wén)理(lǐ)或(huò)低(dī)光(guāng)照(zhào)环(huán)境下,精度会有所下降。目前,有相当一部分人形机器人采用多目 3D 视觉传感器,例如优必选的 Walker X、普渡科技的 PUDU D9 等。
其次是激光雷达,也被称为激光雷达的可视化技术,它利用激光雷达进行高精度三维重建。基于激光雷达和视觉的 SLAM 技术分别被称为激光 SLAM 和视觉 VSLAM。激光 SLAM 又因传感器应用不同,分为单线(2D)和多线(3D)激光雷达两种。3D SLAM 使用多线激光雷达获取环境三维数据,并通过三维数据的特征点匹配进行定位。三维动态成像能够精确知晓物体的形状和大小,对环境信息的还原度极高。不过,3D 激光雷达的成本普遍较高,多用于工业或高端场景。
第三种是结构光(Structured Light)。其原理是将已知图案(如条纹、格雷码)投射到物体表面,通过畸变图案恢复 3D 形状。结(jié)构(gòu)光(guāng)具(jù)有(yǒu)高(gāo)精(jīng)度(dù)(亚(yà)毫(háo)米(mǐ)级(jí))、高(gāo)分(fēn)辨(biàn)率(lǜ)的(de)优(yōu)势(shì),适(shì)合(hé)近(jìn)距(jù)离(lí)(0.1 - 2 米(mǐ))物(wù)体(tǐ)重(zhòng)建(jiàn),在(zài)近(jìn)距(jù)离(lí)精(jīng)度(dù)方(fāng)面(miàn)表(biǎo)现(xiàn)出(chū)色(sè),适(shì)用(yòng)于(yú)物(wù)体(tǐ)识别与交互场景。但它受环境光干扰较大,在户外场景中的效果欠佳,且硬件(jiàn)体(tǐ)积(jī)相(xiāng)对(duì)较(jiào)大(dà)。
第(dì)四(sì)种(zhǒng)是(shì)飞(fēi)行(xíng)时(shí)间(jiān)法(fǎ)(ToF),通(tōng)过(guò)测(cè)量(liàng)光(guāng)脉(mài)冲(chōng)往(wǎng)返(fǎn)时(shí)间(jiān)来(lái)计(jì)算(suàn)距(jù)离(lí),分(fēn)为(wèi)间(jiān)接(jiē)(iToF)和(hé)直(zhí)接(jiē)(dToF)两(liǎng)种(zhǒng),小(xiǎo)米(mǐ)、波(bō)士(shì)顿(dùn)动(dòng)力(lì)等(děng)采用(yòng)了(le)此(cǐ)技(jì)术(shù)。ToF 具(jù)有(yǒu)实(shí)时(shí)性(xìng)强(qiáng)(帧(zhèng)率(lǜ)可(kě)达(dá) 100Hz 以(yǐ)上(shàng))、抗(kàng)干(gàn)扰(rǎo)能(néng)力(lì)强(qiáng)(主动(dòng)发(fā)光(guāng))的(de)特(tè)点(diǎn),适(shì)合(hé)动(dòng)态(tài)场(chǎng)景(jǐng)。然(rán)而(ér),ToF 的(de)精(jīng)度会随着距离的增大而降低,并且容易受到多路径反射的影响。目前,许多人形机器人在实时避障、手势识别等方面采用 ToF 方案。
第五类是单目视觉与深度学习结合。通过单目相机采集 2D 图像,利用深度学习模型(如 DepthNet、MonoDepth)估计深度。这种方式的优点是成本极低(仅需单相机),并且可以通过大数据训练适应复杂场景。但它的缺点也十分明显,深度估计依赖先验知识,在遮挡区域或无纹理区域容易出错,需要进行后处理优化,比较适合教育类场景中对轻量化有需求的人形机器人。
当然,在目前的人形机器人中,3D 视觉基本不是依靠某一种技术来实现的,多传感器融合是最为常见的方式。结合多种技术,如双目 RGB + 结构光、ToF + 多目视觉、激光雷达 + 单目、激光雷达 + 多目等,以平衡精度与成本,同时提升在复杂场景中的鲁棒性。
国内 3D 视觉方案代表性厂商
当前,3D 视觉正步入高速发展阶段,在消费电子、生物识别、机器人和汽车等众多领域得到广泛应用。人形机器人则是另一个极具潜力的应用场景。根据《人形机器人产业研究报告》,预计 2025 年中国人形机器人市场规模约为 53 亿元,同比 2024 年实现翻倍增长;到 2029 年,中国人形机器人市场规模或将达到 750 亿元,占世界总量的 32.7%,比例位居世界第一;到 2035 年,有望达到 3000 亿元规模。
目前,国内已经形成了较为完备的 3D 视觉传感器产业链。上游主要提供各类 3D 视觉传感器的硬件,包括感光芯片等核心元器件,具有较强的定制化、专用化需求;中游是 3D 视觉感知方案商,基于深度引擎算法,结合具体应用进行 3D 视觉传感器的方案设计;下游是各类终端开发者,根据中游提供的方案,开发出相应的应用算法方案。同时,国内也涌现出一批具有代表性的 3D 视觉方案公司,如奥比中光、天准科技等。
奥比中光作为全球领先的 3D 视觉感知技术企业,构建了覆盖结构光、双目、iToF、dToF、激光雷达(LiDAR)、工业三维测量六大技术路线的全栈式解决方案。其产品广泛应用于服务机器人、工业检测、3D 扫描、刷脸支付等领域,服务全球超 1000 家客户,在中国服务机器人 3D 视觉传感器市场占有率超过 70%。该公司也被誉为国内 “3D 视觉第一股”,在全球率先完成具身智能机器人视觉的核心技术布局。
华捷艾米作为国内 3D 视觉感知领域的先行者,其技术路线和产品方案深度融合了结构光、自研芯片与 AI 算法,形成了覆(fù)盖(gài)消(xiāo)费(fèi)电(diàn)子(zi)、智(zhì)能(néng)家(jiā)居(jū)、教(jiào)育(yù)交(jiāo)互(hù)等(děng)场(chǎng)景(jǐng)的(de)完(wán)整(zhěng)生(shēng)态(tài)。华(huá)捷(jié)艾(ài)米(mǐ)的(de)核(hé)心(xīn)技(jì)术(shù)围(wéi)绕(rào)单(dān)目(mù)结(jié)构(gòu)光(guāng)展(zhǎn)开(kāi),通(tōng)过(guò)自(zì)主研(yán)发(fā)的(de)激光发射芯片、衍射光学元件(DOE)及深度算法,实现高精度 3D 感知。
天准科技是国内工业视觉装备领域的领军企业,其 3D 视觉传感方案以高精度、高可靠性为核心优势,深度融合光学设计、AI 算法与精密制造技术,形成了覆盖半导体检测、工业自动化、消费电子、新能源等领域的完整解决方案。
此外,国内较为知名的 3D 视觉方案公司还有华睿科技、光鉴科技、深视智能、安思疆科技、驭光科技、灵明光子、禾赛科技、知微传感和速腾聚创等。
结语
综上所述,人形机器人的 3D 视觉技术路线各有优劣。多目立体视觉、激光雷达、结构光、飞行时间法(ToF)以及单目视觉与深度学习结合等技术,在精度、成本、场景适应性等方面各有特点,而多传感器融合正逐渐成为平衡性能与需求的主流选择。随着人形机器人市场规模从 2025 年的 53 亿元向 2035 年 3000 亿元的宏伟目标迈进,3D 视觉作为核心感知技术,不仅要在技术创新上突破精度、实时性与环境鲁棒性的瓶颈,更需在成本优化方面加速推进,以满足消费级场景的规模化需求。