7,662
社区成员
发帖
与我相关
我的任务
分享我们正在使用 Rhino Pi-X1(QCS8550 / AidLux OS)开发一台固定书桌场景的离线伴读机器人。项目希望把书页视觉、中文语音识别、多模态问答和语音合成尽量放在端侧完成,减少网络延迟,并避免将阅读画面和用户语音上传云端。
GitHub 开源地址:
https://github.com/huangzhongshan/rhino-pix1-reading-companion-open
1080p 双页书籍
→ 外轮廓检测与左右页拆分
→ 透视校正与标题/正文 ROI
→ SenseVoiceSmall 识别问题
→ Qwen2.5-VL 结合当前书页回答
→ MeloTTS-Chinese 合成并播放语音
项目没有把每次问答都绑定到重新拍照。首次启动、手动采集或页面缓存丢失时才重新抓拍;真正的翻页变化由后台线程独立检测。连续追问、无效语音恢复和播报打断后的下一轮会复用当前页面,这样可以避免摄像头采集造成额外等待,也减少轻微画面抖动引发的误判。
ASR → VLM → TTS → 回放 闭环通过;中文书页测试还发现一个很实际的问题:直接把整页压缩到模型输入尺寸,标题和正文会互相干扰。对同一页进行原宽、中等和紧裁剪对照后,Qwen2.5-VL-3B 的原宽标题输入为 0/2,聚焦后的中等与紧裁剪均为 2/2。正文段落 ROI 也连续两次正确,而原宽输入会误选标题。这说明在固定机位的端侧视觉应用中,先做好区域选择和预处理,往往比直接更换更大模型更有效。
我们也测试了 Qwen3-VL-4B 的实验量化包。自定义直连服务完成 12 个同图请求且无运行错误,但当前包在这张低对比中文书页上的完整度仍未超过 3B,所以生产闭环继续使用稳定的 3B 版本,4B 保持隔离实验。
公开仓库包含:
仓库已排除真实书页、用户录音、TTS 音频、模型权重、运行日志和本机配置,使用 Apache License 2.0。
当前唤醒词仍是 ASR 后置门控,并非独立低功耗 KWS;板端 PulseAudio 组件存在版本不匹配,可靠的声学回声消除仍待完成,因此现阶段不宣称扬声器播报期间的纯语音打断已经通过。接下来将建立不少于 20 个不同版式页面的测试集,增加上、中、下重叠段落带与问题相关性选择,并完成 30–60 分钟连续运行、温度、内存和异常恢复测试。
作者/团队:欣新创艺(四川欣新创艺科技有限公司)