7,697
社区成员
发帖
与我相关
我的任务
分享2026 年 8 月 1 日,我参加了高通开发者城市创享工坊成都站。在机械臂实操环节,我们使用搭载高通跃龙 QCS8550 处理器的犀牛派 X1,并使用 OpenClaw 与现场抓取工具链,完成了从摄像头采集、目标识别到机械臂抓取的端到端闭环。
这次实践让我完整接触了端侧 AI 与机器人执行系统的联动。系统启动后,我们在终端输入指令,指定需要识别和抓取的物品。随后,摄像头采集、目标识别、位置转换、路径执行、夹爪控制和物品放置会自动衔接,整个抓取过程不需要人工干预。现场进行了接近 100 次抓取测试,成功率接近 100%。
本次任务是在工作台上放置面包、胡萝卜和小龙虾等仿真道具,由视觉系统识别终端指令指定的目标,再控制机械臂完成接近、夹持、返回起始区域和释放物品。
完整流程包括:
终端输入目标 → 摄像头采集 → 目标识别 → 坐标转换 → 抓取规划 → 抓取物品 → 返回并释放 → 状态反馈
| 组件 | 作用 |
|---|---|
| 犀牛派 X1 | 运行视觉识别、抓取流程和相关服务 |
| 支架式摄像头 | 安装在机械臂旁并接入犀牛派 X1,采集工作区域图像 |
| 机械臂与双指夹爪 | 完成目标接近、夹持和移动 |
| 控制与供电模块 | 为机械臂及相关设备提供控制和供电 |
| 调试电脑 | 连接开发板、启动程序并查看运行状态 |
摄像头通过单独支架固定在机械臂旁,并接入犀牛派 X1。开发板、摄像头、机械臂、夹爪、控制模块和调试电脑共同组成了一套完整的端侧机器人实验平台。
每个新终端首先进入项目目录并加载运行环境:
cd /home/aidlux/openclaw-grab
source ./setup.bash
setup.bash 用于统一加载项目运行所需的 Python 环境、ROS 2 Humble 环境和项目路径。完成环境加载后,可以启动抓取系统:
./tools/start_grasp.sh
运行期间可以另开终端查看节点、话题以及视觉和抓取状态:
source ./setup.bash
ros2 node list
ros2 topic list
ros2 topic echo /vision/status
ros2 topic echo /grasp/status
系统启动后,摄像头对工作台区域进行采集。视觉模块从画面中定位目标,并将识别结果交给抓取模块。抓取模块再结合标定结果,把视觉坐标转换为机械臂运动坐标。
摄像头画面中的像素位置不能直接用于控制机械臂,因此视觉抓取系统需要建立相机坐标系与机械臂坐标系之间的对应关系。我们在正式抓取前完成了标定,现场操作资料提供的标定入口如下:
./tools/start_calibration.sh <实测标定参数>
完成标定后,系统才能把“画面中的目标位置”转换为“机械臂应该到达的位置”。这一环节直接影响夹爪能否准确对准目标,也是视觉识别与机械执行之间最关键的连接点之一。
抓取系统启动后,我们在另一个已经加载环境的终端中输入目标物品,系统收到指令后开始识别和抓取。活动操作资料给出的示例如下:
source ./setup.bash
python3 tools/request_grasp.py --target bread
其中 --target 用来指定目标类别。任务下发后,系统自动完成识别、定位、抓取、返回起始区域和释放物品,不需要在机械臂运动过程中人工修正位置或干预夹爪动作。
目标请求进入系统后,视觉节点负责找到对应物体,抓取节点根据目标位置生成动作,机械臂执行移动,夹爪完成闭合。抓取完成后,机械臂返回起始区域并松开夹爪,最后由状态话题反馈执行结果。
现场使用面包、胡萝卜和红色小龙虾等仿真道具进行了接近 100 次抓取测试。系统在多轮运行中表现稳定,成功率接近 100%,并且从识别、抓取到返回起始区域释放物品的过程完全自动完成。

机械臂根据目标位置移动到胡萝卜上方,夹爪调整到适合抓取的姿态。

任务开始时,多个小龙虾道具分布在工作区域内。

识别与定位完成后,机械臂自动移动到目标上方并下降。

夹爪闭合后成功夹持目标,并保持夹持状态移动。
视觉模型能够识别物体,并不意味着机械臂一定能够抓到它。抓取还依赖目标位置、相机与机械臂之间的坐标关系、夹爪尺寸以及动作路径。
如果标定参数存在偏差,即使模型识别正确,夹爪也可能落在目标旁边。因此,标定和抓取偏移量的调整是整个流程中的关键环节。
视觉状态和抓取状态分开反馈后,可以快速判断问题发生在目标识别、位置转换还是机械臂执行阶段。相比只观察机械臂是否动作,这种方式更适合系统联调。
本次流程将识别、定位和执行连接在同一套系统中。任务下发后,机械臂能够自动完成后续动作,展示了端侧 AI 从“理解环境”走向“执行任务”的完整过程。
我们组采用“一条指令完成一次抓取”的方式,连续输入四次指令完成四轮抓取。现场另一个小组直接在终端接入 GPT 辅助修改代码,把四轮任务改成只输入一次指令便连续抓取四次,将原本约 4 分钟的过程缩短到约 1 分钟。
这个对比说明,端侧机器人项目除了关注单次识别和抓取是否成功,还可以通过任务编排减少重复输入和等待时间。把多个抓取任务组合成连续流程,能够显著降低板端重复处理与人工下发指令的时间。
这次经历也让我意识到,拥有工具并不等于真正会使用工具。我们组内也有经常使用 GPT 的成员,但当时的思路更多停留在按照既定流程完成任务,没有及时想到可以直接优化执行代码,把四次独立抓取改造成一次指令触发的连续任务。
当看到其他小组率先实现这一方案时,我们的第一反应甚至是质疑规则,而不是马上分析他们为什么能做到、我们能否复现并继续优化。事后复盘,如果当时能够更快跳出固有思路,在剩余约半小时的测试时间内开始尝试,我们组的最终用时或许还能再缩短 2~3 分钟。
这也是本次活动带给我最重要的收获:在 AI 工具快速迭代的今天,真正拉开差距的往往不是是否接触过某个工具,而是能否主动发现新的使用方式,把工具转化为解决问题和改造流程的能力。面对新的方案,与其停留在质疑或遗憾中,不如先理解、验证,再基于它继续创新。
这次成都站实践让我完整体验了视觉抓取系统从感知到执行的技术链路。犀牛派 X1 负责承载端侧智能与抓取流程,摄像头提供环境信息,机械臂和夹爪完成物理动作,ROS 2 则连接各个功能模块。
经过接近 100 次现场测试,系统抓取成功率接近 100%,并在任务下发后全程无需人工干预。相比单独运行一个识别模型,这次实践更有价值的地方,是把视觉识别、坐标标定、任务通信、机械执行和物品放置真正连接成了一套可运行的机器人闭环。现场其他小组对连续任务的优化,也让我看到大模型辅助编程在机器人流程改造和效率提升方面的实际价值。