端侧AI感知技术方案
(上篇)
多模态感知终端通用落地平台
面向录音卡、智能工牌、随身记录仪、
AI学习助手及可穿戴智能终端
方案概述
随着AI能力从云端逐步向终端侧延伸,智能硬件正在从“被动响应”走向“持续感知、主动理解和自然反馈”。对于录音卡、智能工牌、随身记录仪、AI学习助手等便携设备而言,真正决定体验的已经不只是单一主控芯片的算力,而是声音、图像、用户状态、显示交互、无线连接与低功耗管理能否形成一个高效协同的系统。
本方案面向多类音视觉与可穿戴AI终端,构建标准化、模块化、可裁剪的端侧AI感知平台。平台整合恒玄高端音视频SoC、AAC MEMS及骨传导声学器件、研极微ISP、具备片上处理能力的视觉Sensor、Syntiant超低功耗AI感知芯片、高刷触控电子墨水屏,并进一步引入EEG/IMU用户状态感知技术,形成“环境感知 + 用户状态感知 + 分层计算 + 本地反馈”的完整技术链路。
平台的核心目标不是简单堆叠器件,而是根据不同任务的实时性、功耗和算力需求进行分层处理:低功耗芯片负责长期值守,专业器件完成高质量信号采集和预处理,主SoC负责复杂业务与系统调度,必要时再连接云端大模型。由此在续航、感知质量、响应速度和产品成本之间取得更好的平衡。
01
核心技术架构
PART 01
从“单芯片计算”走向
“分层感知与协同计算”
传统智能终端往往依赖主SoC长期运行,语音、摄像、识别、显示等任务集中在单一处理器上,容易造成待机功耗高、热设计压力大以及算力利用效率偏低。本方案采用分层架构,将系统拆分为常驻感知层、声学感知层、视觉感知层、用户状态感知层、核心业务算力层和低功耗交互层。
01
超低功耗AI常驻感知:
Syntiant存算一体芯片
Syntiant芯片用于承担“设备一直在听、一直在感知,但主控不必一直醒着”的任务。其低功耗AI架构适合执行语音唤醒、关键词识别、环境声音事件检测、简单场景分类等常驻任务。只有当检测到真正有价值的事件时,才唤醒主SoC进入高算力工作状态。
这种设计可以显著降低便携终端的平均待机功耗,并减少无效数据上传和无效计算。对于需要全天佩戴或长时间工作的智能工牌、记录仪和可穿戴设备尤其重要。
02
全场景声学感知:
AAC MEMS + 骨传导 + 扬声器
声音是目前AI终端最自然、最高频的输入方式之一。平台采用高信噪比MEMS麦克风阵列完成环境声场采集,并可根据产品形态加入骨传导拾音。MEMS适合会议、课堂、日常交流等场景;骨传导则能够从佩戴者自身振动中提取有效语音,在风噪、街道、工地等复杂环境中提高本人语音的可用性。
在算法侧,可结合VAD、AGC、AEC、降噪、波束成形等技术,为语音识别、转写、会议纪要和智能交互提供更加稳定的输入。配套扬声器或其他声音输出器件后,可形成“采集—识别—理解—反馈”的闭环。
03
高清智能视觉感知:
算力Sensor + 研极微ISP
视觉部分采用“Sensor前端处理 + 专业ISP”的分层方式。具备片上处理能力的Sensor可承担运动检测、基础图像预处理、帧筛选和缓存等工作,避免主控持续处理全部原始画面;研极微ISP则进一步负责降噪、自动曝光、弱光增强、动态范围优化和视频质量稳定。
这种结构尤其适合随身记录仪、智能工牌和AI学习助手:设备可以在低功耗状态下判断“是否值得拍、是否需要录像”,只有在检测到有效事件后,才启动更高等级的视觉和AI处理。
04
用户状态感知:
EEG + IMU反馈技术
在传统音视频感知之外,平台进一步预留EEG与IMU用户状态感知能力,使AI终端不仅能够理解“外部发生了什么”,还能够辅助判断“用户当前是否处于适合接收信息的状态”。
现阶段可采用轻量化耳后EEG方案,例如4通道采集并与6轴IMU同步,用于研究注意、可能分心、疲劳趋势以及无效信号识别等状态。EEG模块采用低功耗连续采集设计,目标是以较低功耗作为辅助传感器(885946)长期工作,并通过信号质量判断避免在运动伪迹较强时做出过度推断。
EEG在本平台中的定位不是医疗诊断,而是“人机交互可靠性增强器”。例如,当设备判断用户可能没有注意到重要播报时,可以重复、减速、拆句或请求确认;在学习助手场景中,可根据注意趋势调整提醒节奏;在智能眼镜、耳机等可穿戴设备中,还可以探索“用户状态感知—AI判断—声音/视觉反馈”的闭环。
05
核心业务算力:
恒玄高端音视频SoC
恒玄高端音视频SoC作为整机主控,承担操作系统与任务调度、音视频编解码、无线连接、存储、显示控制、复杂AI应用及云端大模型接口等核心任务。通过将常驻感知、图像前处理等任务下放给低功耗或专用芯片,主SoC可以更多地用于真正需要高算力的业务。
这种分工有助于降低系统平均功耗、简化软件资源冲突,并提升整机运行稳定性。对于需要WiFi、蓝牙或Cat.1蜂窝通信的设备,也可以通过不同通信组合实现本地处理与联网服务之间的灵活切换。
06
低功耗人机交互:
高刷触控电子墨水屏
电子墨水屏具有强光可视、静态显示几乎不耗电的特点,非常适合需要长期佩戴和随身携带的AI终端。通过高刷新和触控能力,可用于展示工作状态、录音摘要、任务提示、学习内容、设备菜单及AI反馈信息。
对于需要持续显示但又不希望长期点亮LCD/OLED(885738)的产品,电子墨水屏可以显著降低显示系统的平均能耗。多色版本还可以通过不同颜色表达告警、重点和状态等级,提高信息识别效率。
02
平台如何工作
PART 02
感知、判断、调用、反馈
第一步:低功耗值守
Syntiant、Sensor前端或其他低功耗器件长期监测声音、运动和环境变化;EEG/IMU在支持的产品中用于辅助感知用户状态。
第二步:事件触发
系统发现关键词、异常声音、运动事件、关键画面或用户状态变化后,决定是否唤醒主SoC。
第三步:多模态融合
主SoC将音频、图像、时间、位置、用户状态等信息组合起来,判断当前场景与任务。
第四步:端侧或云侧AI处理
简单任务尽量在本地完成;需要大模型理解、长文本总结或复杂知识问答时,再通过网络调用云端能力。
第五步:自然反馈
通过扬声器、电子墨水屏、手机或其他终端输出提醒、摘要、确认和下一步行动,实现闭环交互。
