
1. 项目定位与系统思路1.1 为什么是“情感记忆增强”而不是普通的拍照记录这个项目的选题背景很特别。团队里最开始提了三个方向基于STM32的频谱分析、智能风扇控制系统、可编程音乐自动演奏电路都是电子系统设计课程里常见的题目。但讨论到后面大家一致觉得既然手头能拿到Rokid AR眼镜这样的设备还去做单片机小系统就太浪费了。我们想做一个真正能被家人用起来的东西于是“情感记忆增强”这个概念被提了出来。先说清楚什么是“情感记忆增强”。普通相册、备忘录是“被动记录”你翻到了才想起来而我们想做的系统核心差异在于“主动唤起”——在合适的时刻、合适的地点通过AR眼镜的显示和语音把那些容易被遗忘的、带有情感温度的记忆重新推到用户眼前。比如你走进父亲的书房眼镜自动弹出一段去年春节全家一起贴春联的AR影像母亲做饭时说了一句“你小时候最爱吃这个”系统立刻在视野角落浮现出对应的老照片和当时的语音片段。这里的关键词是“增强”不是“替代”。我们不做大而全的数字人生管理只做一件事把散落在手机相册、微信语音、家庭群聊天记录里的零散记忆按照时间和空间关系重新组织在Rokid AR眼镜的显示通道里变成可感知的情感节点。系统设计上它更像一个“记忆路由器”负责感知场景、匹配记忆、选择时机、完成呈现。1.2 为什么选Rokid AR眼镜作为核心载体选型阶段我们对比过几类设备手机App、智能音箱、带屏智能设备、头戴式AR眼镜。最终确定的判断依据不是“谁功能强”而是“谁最贴近记忆发生的现场”。手机App的劣势很明显你需要主动掏出手机、解锁、打开App才能看到内容这个交互链路太长天然打断情感场景。而且手机屏幕占据的是你的“注意力中心”当你想专心陪伴家人的时候手机弹通知反而成了干扰。智能音箱的问题在于“没有视觉锚点”。家庭记忆里大量信息是视觉的——老照片、旧物件、家人的面容变化音箱只能靠语音播放缺少沉浸感。更麻烦的是智能音箱是固定设备做不到“跟随用户走到记忆发生的具体位置”。Rokid AR眼镜恰好补上了这两个短板。它采用分体式设计佩戴轻便不遮挡视线光学显示模组可以在真实视野上叠加数字内容。这就意味着用户可以在正常与家人交流的同时通过眼镜看到与当前场景相关的记忆信息不需要低头看屏幕也不会因为“看手机”这个动作打断面对面的情感交流。从系统设计角度看Rokid还有几个技术上的加分项。它的操作系统基于Android深度定制有完整的SDK接口支持Unity开发环境方便我们做自定义的AR界面和交互逻辑设备自带IMU传感器、摄像头模组和麦克风阵列可以采集用户的姿态、环境光、语音等多模态数据为后面的场景识别提供了硬件基础续航方面分体式电池仓设计让重量集中在后部长时间佩戴的舒适度在同类产品里算第一梯队。说白了这个项目的本质就是用AR眼镜的“在场感”去弥补数字记忆的“抽离感”。设备选对了系统设计才有意义。2. 系统整体架构与关键技术选型2.1 系统的三层架构感知、理解、呈现整个系统的架构拆成三层来设计每一层职责单一层与层之间通过明确的数据接口通信。这个分层思路来自软件工程里的“关注点分离”在硬件资源有限的AR眼镜场景里尤为重要——你不能让所有逻辑都跑在眼镜端也不能把所有数据都传到云端不管延迟。感知层负责从环境中采集原始数据。核心传感器包括Rokid眼镜自带的RGB摄像头用于识别场景中的人脸、物体、文字、麦克风阵列采集语音并做声纹识别和关键词提取、IMU惯性传感器判断用户头部姿态和走动轨迹。此外我们还接入了家庭内的物联网设备数据比如智能门锁的开门记录、灯光的状态变化这些数据可以作为“记忆触发”的环境信号。理解层负责把感知到的原始数据变成“有意义的事件”。这一步是整个系统的技术核心也是工作量最大的部分。我们做了一个轻量级的边缘计算框架在Rokid眼镜端跑人脸特征提取模型基于MobileFaceNet压缩后约4.2MB在家庭网关设备上跑场景分类模型识别客厅、厨房、书房、卧室等区域再把两者结合成“谁在哪儿、正在做什么”的结构化语义。呈现层负责决定“用什么方式、在什么时机”把记忆内容显示给用户。这一层我们做了很多交互上的细节设计。比如记忆卡片的透明度、显示位置、驻留时长都要根据用户当前头部姿态和视线焦点动态调整不能让数字内容遮挡住真实的人际交流。语音播报的语速、音量也要能根据环境噪声自动调节。三层架构的好处在于每一层都可以独立替换升级。比如以后换了更好的人脸识别模型只需要动理解层以后想支持更多AR眼镜品牌只需要重写呈现层的渲染适配。2.2 核心技术模块拆解与选型理由具体到实现层面系统拆成了六个核心模块。我把每个模块的核心技术和选型理由列个表方便后面上手复现的时候对照参考。模块名称核心技术选型选型理由人脸识别MobileFaceNet ArcFace Loss模型小、推理快在Rokid眼镜端的CPU上能跑到25FPS左右精度满足家庭场景10人以内的需求声纹识别ECAPA-TDNN压缩版支持短语音注册3秒语音即可建立声纹模型抗噪能力比传统i-vector方案好得多家庭环境背景噪声复杂这一点很重要场景识别EfficientNet-Lite 迁移学习只需要识别6类家庭场景迁移学习后准确率可达91%参数量只有MobileNetV3的一半记忆索引SQLite 空间索引R-tree家庭记忆数据量通常只有几万条SQLite足够轻量R-tree支持按地理位置和时间的联合查询触发决策基于规则的专家系统 上下文窗口用可解释的规则控制记忆触发逻辑避免端上跑大模型的资源消耗也方便家庭成员自己调整触发偏好AR渲染Unity Rokid AR Glass SDK官方支持最好支持Unity的UI系统和动画系统迭代效率高学习资料也多选型的时候有一个原则算法复杂度和硬件算力之间必须找到平衡点。Rokid眼镜端的处理芯片是骁龙平台算力比手机要弱一些所以人脸模型、声纹模型都做了Int8量化体积压缩到原来的1/3左右推理速度基本没下降。实测下来人脸识别单帧推理耗时约38ms声纹验证耗时约120ms都在可接受范围内。2.3 为什么没选云端的通用大模型方案这是踩过坑之后才想明白的问题。最初方案里我们打算把语音理解、情感分析都丢给云端的通用大模型API做一个“智能体”式的服务。但实际测试后放弃了这个路线原因有三个。第一个原因是延迟不可控。AR眼镜场景对交互延迟的要求非常高从语音结束到记忆内容出现如果超过1.5秒用户就会觉得“卡顿”。云端API的往返延迟、排队时间、网络抖动叠加起来很难稳定压制在这个阈值以下。第二个原因是隐私边界模糊。家庭记忆内容本身就是高度私密的数据语音、影像、对话内容全部上传云端用户会有很大的心理顾虑。尤其是家里有老人小孩的场景数据安全要求更高。我们在用户调研里发现超过七成的受访者明确表示“不想让这些记忆数据离开家庭网络”。第三个原因是情感交互的现场性。大模型API擅长的是“生成新内容”而我们需要的更多是“匹配已有记忆”。情感记忆增强的核心不是“编一段漂亮的话”而是“准确地把过去的真实片段和当前的场景关联起来”。这个匹配过程用规则引擎加本地的语义标签就够了没必要让大模型介入。当然云端大模型也不是完全没用。我们留了一个扩展接口当用户明确授权、且愿意接受离线延迟的时候可以把匿名化的文本描述发给云端做更高级的情感语义分析。但这个功能默认是关闭的属于“可选项”而不是“核心路径”。3. 核心细节解析与实操要点3.1 记忆数据如何采集和结构化从散落碎片到知识图谱最琐碎也最关键的环节就是数据从哪里来。家庭记忆不像数据库是现成的结构化数据它散落在手机相册、聊天记录、朋友圈、家庭群的语音条里。我们的做法是做一个“家庭记忆汇聚网关”部署在一块小小的树莓派上常驻家庭网络负