Apple研发了一套机器学习人工智能系统,用户可自行创建专属手势操控数字交互界面,不再局限于设备厂商提前预设好的固定手势库。
这项发明的核心是一套基于视觉的训练框架,仅需用户少量示范动作,系统就能识别全新手势,该技术最极致的效果是,用户只做一次示范,系统就能学会这个专属手势。
自定义手势可以是静止固定姿势,也可以是连贯动态动作;支持单手、双手操作,能融合手指姿态与大范围手部运动。
这套系统可搭载所有配备摄像头的Apple设备,涵盖iPhone、iPad、Mac、Apple Watch、AirPods与Vision Pro。适配设备覆盖面广,让该技术对空间计算、辅助功能操控、全生态免手持交互具备极高实用价值。
系统不会直接从原始视频画面识别手势,而是先提取用户手部的骨骼特征模型,单只手通过21个标记点完整还原,覆盖手腕、指根关节、手指中段关节与指尖;双手手势则组合两套骨骼图谱,总计42个特征点位。
这种特征抽象处理至关重要,识别系统只需关注关节之间的相对位置关系,不会过度依赖肤色、环境光线、衣物遮挡、拍摄背景等外部条件,即便拍摄环境光线变化、手部局部被遮挡,基于骨骼的识别方案依旧能维持稳定识别效果。
Apple提出,将骨骼时序数据输入图变换器神经网络,模型会分析单根手指各关节的关联、同手多组手指关节的联动,以及这些空间关系随时间产生的动态变化。
空间注意力机制会定位与当前手势最相关的手部特征点,时序处理模块则区分滑动、旋转、拖拽、张合手指等不同动作。
统一模型可同时处理静态手势、动态手势、单手、双手各类动作,静态手部姿势会通过帧填充扩充为连续时序数据,适配动态手势的输入标准;单手样本同样会补齐维度,匹配双手手势的数据格式。该设计无需为不同手部交互类型搭建独立识别引擎。
该技术核心难点并非识别已有标准手势,而是仅通过极少示范,就让系统掌握全新自定义手势。
Apple采用少样本学习方案解决该问题:神经网络先基于海量标准手势骨骼样本完成预训练,再通过用户提供的少量自定义手势样本,对预训练模型快速适配微调。
专利文件明确说明整套流程:先用标准化手势数据集完成初始模型训练;再生成包含至少一组用户自定义手势的第二套数据集;基于新数据集重新训练初始模型,使其能够识别新增手势。
从属权利要求细化采用模型无关元学习算法,搭配支撑集、查询集完成新手势分类任务的训练与验证。
元学习的本质,是训练模型提升学习新事物的能力,模型在研发阶段会反复处理各类小型手势分类任务,当面对全新手势、仅有少量示范样本时,可快速自适应调整内部运算参数。
Apple还提出元增强数据方案:将独立的单手动作样本组合生成全新双手手势样本,无需录制海量真实双手动作素材,就能丰富训练任务的多样性,这套数据增强手段也纳入专利保护范围,用于扩充自定义手势训练数据集。
整套交互流程不只是简单录制手部动作,录入自定义手势期间,系统会实时展示提取出的手部骨骼线框,用户可保留、删除、重新录制捕捉效果不佳的动作样本。
若两段录入手势相似度过高、极易造成模型识别混淆,设备会主动弹出提醒。
手势录制完成后,训练过程直接在本机设备运行。苹果表示,根据设备算力、数据集大小不同,整套图变换器模型的训练耗时可控制在一分钟以内。
用户能够实时预览手势识别效果,若出现识别错误,可返回录制、样本审核环节优化动作样本。
本地端完成全部运算具备极强隐私优势:手势录制数据会记录用户肢体运动特征、个人生物识别信息,专利规定训练、识别运算全程在设备本地执行,避免这类隐私数据外流至外部服务器,训练完成的专属手势模型,可同步、导出至用户其他Apple设备。
该发明最关键的突破,是将手势自定义、全类型手势兼容、极小样本训练三大特性结合,传统手势识别系统,仅能识别厂商提前开发、海量数据训练完成的固定指令;而Apple这套框架,允许用户自行建立独属于自己的操作手势体系。
另一核心创新是,单一自适应架构可统一处理静态姿势、动态滑动、精细手指操作、双手组合动作。
理论上,用户自定义剪刀手势、捏取拖拽、双手比出特定造型,都能直接绑定系统指令,无需Apple提前将该动作录入官方识别库。
针对空间计算设备,这项技术预示手部追踪将走向可个性化编程的新阶段,用户可创建专属手势,实现打开应用、操控虚拟物体、切换媒体播放、启动高频快捷功能等操作。
训练完成的模型可跨设备、跨拍摄视角部署,在一台Apple设备录入的手势,能够同步成为全生态统一的个性化操控方案。
需要说明的是,专利申请不代表Apple一定会推出对应功能,但这套技术标志着手势交互逻辑出现重大转变:行业过去是识别固定手部动作,而Apple这套方案实现学习用户独有的手部交互语言。
该技术同样适用于Apple辅助功能生态,行动不便的用户很难做出标准化预设手势,这套系统可以学习用户自身能稳定完成的动作,彻底扭转人机交互的适配关系:不再需要用户迁就设备界面,而是让界面主动适配用户的肢体动作。
