AI眼镜这两年很火,从Meta的Ray-Ban Stories到国内的各种AI眼镜产品,越来越多的公司在做。我参与过两个AI眼镜项目的开发,从0到1做过产品,也踩过很多坑。
这篇文章就来总结一下AI眼镜开发的最佳实践,从产品设计、技术选型、交互设计到性能优化,分享一些经验。如果你也在做AI眼镜相关的产品,希望能帮到你。
产品定位要清晰
做AI眼镜之前,首先要想清楚产品定位。AI眼镜不是一个通用的计算平台,它有自己的优势和局限,要找到适合它的场景。
AI眼镜的优势是什么?第一是解放双手,用户不用拿手机,戴在眼镜上就能用。第二是第一视角,摄像头和麦克风采集的是用户看到的和听到的,很自然。第三是即时性,信息直接显示在眼前,不用掏手机。第四是便携性,眼镜本身就是日常佩戴的物品,不用额外带设备。
AI眼镜的局限是什么?第一是算力有限,眼镜的体积小,散热和电池都有限,不能跑大模型。第二是交互受限,没有键盘鼠标,主要靠语音、手势、头部动作交互。第三是显示区域小,光波导或者MicroLED的显示区域有限,不能显示太多内容。第四是续航短,眼镜的电池容量有限,重度使用可能半天就没电了。
基于这些优势和局限,AI眼镜适合什么场景?我觉得主要有几类:第一是信息提示类,比如导航、翻译、提醒,信息直接显示在眼前,很方便。第二是拍摄记录类,第一视角拍照录像,解放双手,记录生活。第三是语音助手类,语音问答、语音控制,不用掏手机。第四是专业场景类,比如工业维修、医疗辅助、物流分拣,给一线工人提供实时信息。
不适合什么场景?不适合长时间阅读、不适合复杂操作、不适合大模型推理、不适合重度娱乐。这些场景还是手机、电脑、VR头显更合适。
产品定位清晰了,后面的设计和开发才有方向。很多AI眼镜产品做不好,就是因为定位不清,什么都想做,结果什么都做不好。
硬件选型
硬件选型是AI眼镜的基础,选对了硬件,后面的开发会顺利很多。
第一个是主控芯片。AI眼镜的主控芯片有几个选择:高通的AR1 Gen1、联发科的Genio系列、还有一些国产芯片。选型的时候要考虑算力、功耗、发热、生态、价格。如果需要端侧AI推理,要选有NPU的芯片,算力至少要够跑一些轻量级模型。如果主要是云端AI,主控的要求可以低一些。
第二个是显示方案。AI眼镜的显示方案主要有几种:光波导、BirdBath、MicroLED。光波导最轻薄,显示效果也不错,但价格贵,良率低。BirdBath显示效果好,价格相对便宜,但体积大一些,不够轻薄。MicroLED亮度高,功耗低,但技术还不够成熟,价格贵。选型的时候要根据产品定位和预算来选,消费级产品一般用光波导或者BirdBath。
第三个是摄像头。AI眼镜至少要有一个摄像头,用来拍照、录像、视觉识别。摄像头的选型要考虑分辨率、帧率、视角、功耗、体积。一般用1600万像素的摄像头就够了,支持自动对焦,视角在80度左右。如果需要做3D感知,可以加深度摄像头或者双目摄像头。
第四个是麦克风。AI眼镜需要语音交互,麦克风很重要。一般用双麦或者三麦阵列,做波束成形和降噪,保证在嘈杂环境下也能清晰拾音。麦克风的位置也很重要,要放在嘴边附近,同时避免被头发或者衣服遮挡。
第五个是电池。AI眼镜的电池一般放在镜腿里,容量在300mAh到500mAh之间。续航是AI眼镜的痛点,要在体积和续航之间做平衡。可以考虑用充电盒,随用随充,延长使用时间。
硬件选型要尽早做,最好在项目初期就确定硬件方案,因为后面的软件开发都依赖硬件。如果硬件方案中途变更,软件也要跟着改,成本很高。
系统架构
AI眼镜的系统架构一般分为端侧和云端两部分。
端侧负责什么?第一是数据采集,摄像头、麦克风、传感器的数据采集。第二是本地处理,一些轻量级的AI推理,比如人脸检测、语音唤醒、手势识别,这些需要低延迟的,放在端侧。第三是交互响应,语音合成、显示渲染、触控反馈,这些要及时响应。第四是设备管理,系统状态监控、OTA升级、电源管理。
云端负责什么?第一是大模型推理,比如大语言模型、大视觉模型,这些算力需求大,端侧跑不动,放在云端。第二是数据存储,用户的照片、视频、设置、历史记录,存在云端。第三是账号和同步,多设备同步、社交分享、内容推荐。第四是服务端逻辑,比如搜索、翻译、导航,这些需要服务端数据的。
端侧和云端的分工要合理,不是什么都放云端,也不是什么都放端侧。低延迟、隐私敏感、简单的任务放端侧;高算力、需要大数据、复杂的任务放云端。
通信方面,端侧和云端一般用WebSocket或者gRPC做长连接,保证实时性。语音流用流式传输,边录边传,降低延迟。视频流可以用RTSP或者WebRTC,根据场景选择。
还要考虑离线模式,网络不好的时候,AI眼镜也要能做一些基本功能,比如本地拍照、本地语音助手、本地翻译。不能一断网就完全不能用。
交互设计
交互设计是AI眼镜的难点,因为没有键盘鼠标,交互方式有限。
主要的交互方式有几种:
第一是语音交互。这是AI眼镜最主要的交互方式,用户用语音下达指令,眼镜用语音回复。语音交互要做唤醒词检测、语音识别、语义理解、对话管理、语音合成。唤醒词要准确,误唤醒率要低;语音识别要支持离线和在线两种模式;语义理解要能处理多轮对话;语音合成要自然,不要太机械。
第二是触控交互。镜腿上一般有触控板,支持点击、滑动、长按。触控交互适合简单操作,比如拍照、暂停、切换菜单。触控板的位置和大小要合理,操作要符合直觉,不要太复杂。
第三是头部动作。利用IMU传感器,检测用户的头部动作,比如点头、摇头、抬头、低头。点头确认、摇头取消,是很自然的交互方式。但要注意误触,走路的时候头部也会动,要区分是有意的动作还是无意识的动作。
第四是手势识别。用摄像头识别用户的手势,比如捏合、滑动、指向。手势交互很直观,但识别准确率和延迟是问题,而且用户一直抬手也累。可以作为辅助交互方式,不要作为主要方式。
第五是眼动追踪。高端的AI眼镜可以做眼动追踪,用户看哪里就选中哪里,配合眨眼或者语音确认。眼动追踪很自然,但技术难度大,价格贵,目前还不太成熟。
交互设计的原则是简单、自然、低学习成本。用户拿到眼镜就能用,不需要看说明书。常用功能一键可达,复杂功能可以通过语音完成。不要做太多层级的菜单,用户在眼镜上操作菜单很痛苦。
还要考虑隐私和社交接受度。AI眼镜有摄像头,在公共场合使用会引起他人的不适。设计的时候要考虑隐私提示,比如拍照的时候有指示灯或者提示音,让周围的人知道正在拍摄。还要有物理开关,可以一键关闭摄像头和麦克风,给用户安全感。
AI能力设计
AI是AI眼镜的核心,AI能力的设计决定了产品的体验。
第一个是视觉AI。AI眼镜有第一视角的摄像头,可以做很多视觉相关的AI功能。比如物体识别,用户看到什么东西,问眼镜这是什么,眼镜识别出来告诉用户。比如文字识别(OCR),看到路牌、菜单、说明书,识别文字并翻译或者朗读。比如人脸检测,识别出认识的人,提醒用户名字。比如场景理解,理解用户当前在做什么,提供相关的信息。
视觉AI要注意延迟和准确率。用户问一个问题,希望马上得到答案,延迟不能太高。准确率也要高,识别错了会很尴尬,特别是人脸和物体识别。
第二个是语音AI。语音交互是AI眼镜的主要交互方式,语音AI的能力很关键。包括语音识别(ASR)、自然语言理解(NLU)、对话管理、语音合成(TTS)。语音识别要支持多种语言和方言,在嘈杂环境下也要准确。自然语言理解要能处理口语化的表达,不要太死板。对话管理要支持多轮对话,有上下文理解能力。语音合成要自然,有感情,不要像机器人。
第三个是大模型能力。现在大模型很火,AI眼镜也可以接入大模型,做智能问答、内容生成、任务规划。但大模型推理算力需求大,一般放在云端。要注意延迟,大模型生成回答需要时间,用户等待太久会不耐烦。可以做流式输出,边生成边显示,让用户看到进度。还要注意成本,大模型调用是要钱的,要控制调用频率和token数量。
第四个是推荐和个性化。AI眼镜可以学习用户的习惯和偏好,提供个性化的服务。比如用户经常去的地方,自动推荐附近的餐厅;用户经常查的信息,主动提醒;用户的日程安排,提前通知。个性化推荐要注意不要太打扰用户,要有度,不要变成广告推送。
AI能力的设计要从用户需求出发,不要为了AI而AI。每个AI功能都要解决用户的实际问题,有明确的使用场景。不要堆功能,功能多了用户反而不知道怎么用。
性能优化
AI眼镜的资源有限,性能优化很重要。
第一个是功耗优化。AI眼镜的电池小,功耗直接影响续航。要从几个方面优化:CPU和NPU的频率动态调节,根据负载调整频率,不需要的时候降频;屏幕亮度自动调节,根据环境光调整;后台进程管理,不需要的进程及时杀掉;网络优化,减少数据传输量,用更高效的编码。
第二个是延迟优化。AI眼镜的交互要求实时性,延迟高了体验很差。要优化端侧推理的延迟,用轻量级模型,用NPU加速,做模型量化和剪枝。优化云端推理的延迟,用更高效的模型,做推理缓存,边缘部署。优化网络延迟,用WebSocket长连接,减少握手开销,数据压缩。
第三个是内存优化。AI眼镜的内存有限,一般只有4GB或者8GB。要优化内存使用,及时释放不需要的内存,避免内存泄漏。模型加载用内存映射,减少内存占用。多任务的时候做内存回收,后台任务的内存可以压缩或者换出。
第四个是发热优化。AI眼镜戴在头上,发热太明显会不舒服。要控制芯片的温度,做温度检测和降频策略。重负载任务不要持续太久,比如连续录像不要超过一定时间。散热设计也要合理,热量要均匀分布,不要集中在一个地方。
性能优化要靠数据驱动,不要凭感觉优化。要用profiling工具,找到真正的瓶颈,针对性优化。优化之后要做测试,验证优化效果,不要越优化越差。
测试和质量保证
AI眼镜的测试比普通产品复杂,因为涉及硬件、软件、AI、交互等多个方面。
第一个是硬件测试。包括可靠性测试(跌落、防水、防尘、温度循环)、性能测试(续航、发热、充电速度)、射频测试(蓝牙、WiFi的信号强度和稳定性)、传感器测试(摄像头、麦克风、IMU的精度和一致性)。硬件测试要在量产前做充分,量产之后改硬件成本很高。
第二个是软件测试。包括功能测试,每个功能是否正常工作;兼容性测试,和不同手机、不同系统版本的兼容性;稳定性测试,长时间运行会不会崩溃、死机;性能测试,启动速度、响应速度、资源占用。软件测试要自动化,用CI/CD流水线,每次提交都自动跑测试。
第三个是AI测试。AI的测试比较特殊,因为AI的输出不是确定的。要做准确率测试,用标准测试集,测识别准确率、翻译准确率、语音识别准确率。要做鲁棒性测试,在不同环境下(光线、噪音、角度)测试AI的表现。要做边界测试,测试极端情况下AI会不会出错。AI测试要持续做,因为模型会更新,每次更新都要回归测试。
第四个是用户体验测试。AI眼镜的交互很新,用户体验很重要。要做可用性测试,找真实用户来用,观察他们的操作,收集反馈。要做场景测试,在真实使用场景下测试,比如户外、商场、地铁,看产品表现如何。要做长期测试,让用户用几周甚至几个月,看长期使用的体验和问题。
测试要尽早做,不要等到项目快结束了才测试。越早发现问题,修复成本越低。测试要覆盖全流程,从硬件到软件到AI到交互,都要测到。
踩坑经验
最后分享几个踩过的坑。
第一个坑是不要过早追求功能丰富。项目初期,先把核心功能做扎实,比如拍照、语音助手、导航,把这些体验做好了,再加其他功能。一开始就想做很多功能,结果每个功能都做不好,用户体验很差。
第二个坑是不要忽视续航。AI眼镜的续航是用户最关心的问题之一,续航太短,用户根本不想戴。项目初期就要把续航作为核心指标,硬件选型、软件优化都要围绕续航来做。不要等产品做出来了才发现续航不够,那时候改就晚了。
第三个坑是不要低估交互设计的难度。AI眼镜的交互和手机、电脑完全不一样,很多在手机上很自然的操作,在眼镜上就很别扭。交互设计要反复测试,找真实用户来用,不断迭代。不要坐在办公室里拍脑袋设计交互,那样做出来的东西用户不会用。
第四个坑是不要迷信大模型。大模型很强,但不是万能的。AI眼镜的很多场景,用轻量级的专用模型效果更好,延迟更低,成本更低。大模型适合做通用问答和复杂推理,不要什么都用大模型。
第五个坑是不要忽视隐私和安全。AI眼镜有摄像头和麦克风,用户很在意隐私。产品设计的时候就要把隐私放在第一位,比如物理开关、隐私提示、数据加密、本地处理。不要等出了隐私丑闻才来补救,那时候品牌形象已经毁了。
写在最后
AI眼镜是一个很有前景的方向,随着技术的成熟,未来可能会成为继手机之后的下一个计算平台。但目前AI眼镜还处于早期阶段,技术、生态、用户习惯都还在发展中。
做AI眼镜产品,要找准定位,做好交互,控制好功耗和发热,保证AI能力的体验。不要盲目跟风,要从用户需求出发,做真正有用的产品。
希望这篇文章的经验总结能帮到正在做AI眼镜的你。有什么问题欢迎交流,一起探讨。
评论(0)
暂无评论,快来抢沙发~
评论功能仅对会员开放,请先登录
登录