基于树莓派与YOLO的单目视觉测距测尺寸系统实践
2026/9/4 7:21:53 网站建设 项目流程

简介:本资源是一套基于树莓派的单目视觉目标测量系统实现方案,面向嵌入式视觉开发初学者、计算机视觉课程实践者及智能测量应用开发者,解决无深度传感器条件下几何物体距离与尺寸的低成本精准测量问题,适用于工业检测、教育实验与智能监控等场景。压缩包共12个文件,含5个核心Python脚本(如main.py主控逻辑、find_short.py测距算法、ina219.py硬件扩展支持)、1个PyQt UI界面文件(Ui_File.ui)、1个YOLOv5s优化模型best.pt、1个启动脚本Start.sh及说明文档等,总大小13.57MB,结构清晰,模块职责明确。已有114人学习下载。用户可直接部署运行,获得A4纸标定测距、YOLO实时识别定位、相似三角形尺寸反算全流程代码,配套README.md与说明文件.txt详解校准流程、环境依赖及光照补偿策略,并提供附赠资源.docx补充原理图解与常见误差分析,具备完整工程复现能力。

1. 项目概述:从“看见”到“测量”的智能跨越

在嵌入式视觉和智能硬件领域,让机器不仅能“看见”物体,还能精确地“知道”物体有多大、离我多远,一直是一个极具吸引力的挑战。这个基于树莓派主控平台,结合单目摄像头和YOLO深度学习模型的项目,正是为了解决这一核心问题而生。它不是一个简单的拍照程序,而是一套集成了硬件选型、软件算法、标定流程和工程实践的完整测量系统。其核心功能是,仅用一个普通的USB摄像头或树莓派专用摄像头模块,就能实现对几何形状物体(如盒子、书本、圆形标靶)的距离和尺寸的非接触式测量,并且创新性地引入了A4纸作为参考物,极大地简化了现场标定和测量的复杂度。

这套装置的价值在于其高度的实用性和灵活性。无论是用于小型自动化产线上的零件尺寸抽检,还是智能仓储中对货品体积的快速估算,甚至是教育领域里让学生直观理解计算机视觉原理,它都能胜任。它避开了昂贵的激光雷达或双目立体视觉方案,以极低的成本(核心就是一块树莓派和一个摄像头)实现了令人满意的测量精度。对于开发者、创客和工程技术人员而言,这个项目提供了一个绝佳的切入点,去深入理解从图像像素到真实世界物理尺寸的完整转换链条,以及如何将前沿的深度学习目标检测算法(YOLO)与传统几何视觉方法相结合,解决实际问题。

2. 系统核心设计思路与方案选型

2.1 为什么选择单目视觉而非双目或激光方案?

在项目启动时,测量方案的选择是首要决策点。双目立体视觉通过两个摄像头模拟人眼,通过视差计算深度,精度较高,但需要严格的相机标定和同步,系统复杂度高,计算量大。激光雷达(LiDAR)或结构光方案精度最高,但成本昂贵,且不适合对反光或透明物体进行测量。

单目视觉方案的核心优势在于极简的硬件和较低的算力需求。它只需要一个摄像头,依靠透视投影原理和已知的物体尺寸信息(或参考物)来推算距离和尺寸。其挑战在于,从2D图像反推3D信息是一个“病态”问题,必须引入额外的约束条件。本项目的设计思路巧妙地解决了这个问题:用YOLO模型提供智能的“物体识别与定位”,用A4纸作为“已知尺寸的标尺”,将复杂的3D重建问题转化为可解的几何计算问题。这种组合使得系统既具备了深度学习的鲁棒性(能识别各种物体),又具备了传统几何方法的确定性和可解释性(测量原理清晰)。

2.2 硬件平台选型:树莓派4B/5与摄像头模块

主控选择树莓派几乎是必然的。它是一个功能完整的微型计算机,拥有强大的通用计算能力(特别是树莓派4B的4核Cortex-A72或树莓派5更强大的处理器)、丰富的IO接口(USB, CSI)和成熟的软件生态(完整的Linux系统, 丰富的Python库支持)。这让我们可以轻松地运行Python OpenCV、PyTorch或TensorFlow Lite等框架,处理图像和运行轻量级YOLO模型。

摄像头选型是关键中的关键。主要有两种选择:

  1. 树莓派专用CSI摄像头模块:如OV5647、IMX219。优点是直接通过CSI接口连接,带宽高、延迟低、驱动集成好,能通过raspistilllibcamera库直接进行精细化的参数控制(如曝光、白平衡)。这对于需要稳定图像质量的测量系统非常重要。
  2. 通用USB摄像头:即插即用,兼容性好,选择多。但需要注意选择支持UVC协议的摄像头,以确保在Linux下能稳定工作。USB2.0的带宽可能成为高分辨率、高帧率应用的瓶颈。

实操心得:对于精度要求高的测量项目,强烈推荐使用树莓派CSI摄像头。我们曾测试过某款廉价的USB摄像头,发现其镜头存在明显的桶形畸变,且自动曝光波动大,这会给标定和测量带来难以校正的系统误差。而像IMX219这样的官方摄像头模块,镜头质量更好,且能通过软件锁定曝光和增益,确保拍摄环境光照变化时,图像的亮度保持一致,这是稳定测量的基础。

2.3 软件与算法栈的构建

软件栈是项目的灵魂,我们采用分层设计:

  • 底层驱动与图像采集:使用libcamera(新系统推荐)或OpenCV的VideoCapture进行图像捕获。libcamera能提供更底层的控制,适合专业应用。
  • 核心视觉库OpenCV是毋庸置疑的选择。它提供了从图像预处理(滤波、二值化)、摄像头标定、轮廓提取、透视变换到几何计算的所有工具函数。
  • 深度学习框架:为了运行YOLO模型,我们需要一个推理引擎。ONNX RuntimeTensorFlow Lite是树莓派上的优秀选择,它们针对边缘设备做了大量优化。我们可以先在PC上使用PyTorch或TensorFlow训练好YOLO模型,然后转换为TFLite或ONNX格式,再部署到树莓派上。
  • 业务逻辑与集成:使用Python作为胶水语言,将上述所有模块串联起来,构建完整的测量流水线。

3. 核心原理深度解析:从像素到厘米

3.1 摄像头成像与畸变校正:测量的第一步

摄像头镜头并非理想的小孔成像模型,它存在径向畸变(图像边缘弯曲)和切向畸变。如果不校正,用图像边缘的像素点去做测量,误差会非常大。因此,摄像头标定是进行任何定量视觉测量的绝对前提

标定的目的是获取摄像头的内参矩阵畸变系数

  • 内参矩阵:包含了焦距(fx, fy)和主点(cx, cy)信息。焦距决定了物体成像的大小,主点是光轴与成像平面的交点。
  • 畸变系数:描述了镜头畸变的数学参数。

标定通常使用棋盘格标定板。通过从不同角度拍摄多张(建议15-20张)棋盘格图片,OpenCV的cv2.calibrateCamera函数可以计算出这些参数。之后,任何通过该摄像头捕获的图像,都需要先用cv2.undistort函数进行畸变校正,得到无畸变的图像,后续的测量都在校正后的图像上进行。

import cv2 import numpy as np # 假设已经通过标定得到了 camera_matrix 和 dist_coeffs camera_matrix = np.array([[fx, 0, cx], [0, fy, cy], [0, 0, 1]]) dist_coeffs = np.array([k1, k2, p1, p2, k3]) # 对捕获的原始图像进行畸变校正 img_raw = cv2.imread('captured.jpg') img_undistorted = cv2.undistort(img_raw, camera_matrix, dist_coeffs)

3.2 基于参考物的单目测距与测尺寸原理

这是本项目的核心算法。当我们在物体旁边放置一张已知尺寸的A4纸(210mm × 297mm)作为参考物时,魔法就发生了。

测距原理(已知物体实际尺寸,求距离)

  1. 识别与定位:使用YOLO模型或传统的图像处理(如颜色分割、轮廓查找)识别出A4纸,并获取其在图像中的像素宽度W_pixel或高度H_pixel
  2. 计算焦距(首次标定):在已知距离D_known(例如,将A4纸放在距离摄像头50cm处)拍摄一张图片,测量图中A4纸的像素宽度W_pixel_known。根据相似三角形原理,可以计算等效焦距(以像素为单位):F_pixel = (W_pixel_known * D_known) / W_real其中W_real是A4纸的实际宽度(210mm)。这个F_pixel是一个常数,只要摄像头焦距不变(即不调焦),它就固定。
  3. 测量未知距离:在新的场景中,再次识别A4纸并测量其像素宽度W_pixel_new。此时,摄像头到A4纸的距离D_new为:D_new = (W_real * F_pixel) / W_pixel_new

测尺寸原理(已知距离,求物体尺寸): 当我们需要测量A4纸旁边的一个盒子时:

  1. 测距:首先用上述方法,通过A4纸计算出摄像头到测量平面的距离D。这里假设盒子与A4纸基本在同一平面上。
  2. 识别物体:用YOLO模型识别出盒子,并获取其包围盒的像素宽度W_obj_pixel
  3. 计算实际尺寸:根据相同的相似三角形原理,物体的实际宽度W_obj_real为:W_obj_real = (W_obj_pixel * D) / F_pixel高度计算同理。

核心要点:整个测量的精度基石在于A4纸轮廓提取的像素精度焦距F_pixel标定的准确性。任何导致A4纸像素尺寸测量不准的因素(如光照不均、背景杂乱、透视变形严重)都会直接放大最终的距离和尺寸误差。

3.3 YOLO模型的角色:从“找轮廓”到“智能识别”

在传统方法中,我们需要用复杂的图像处理算法(阈值分割、边缘检测、轮廓查找、形状拟合)来定位A4纸和待测物体。这在受控环境下可行,但一旦环境光变化、背景复杂或物体纹理多样,传统算法就非常脆弱。

YOLO模型的引入,将系统鲁棒性提升了一个数量级。它的作用非常明确:

  1. 替代传统的A4纸检测:我们可以训练一个简单的YOLO模型,专门识别“A4纸”。无论A4纸是平铺、倾斜还是部分遮挡,YOLO都能以很高的置信度给出其精确的包围盒,这比寻找四边形轮廓要稳定得多。
  2. 识别并定位待测物体:我们可以扩展YOLO模型,让它同时能识别“纸箱”、“书本”、“圆形标靶”等我们关心的几何物体。这样,系统就能自动找到画面中所有可测量的物体,并直接输出其像素位置和范围,省去了复杂的定制化图像处理流程。

在树莓派上,我们需要使用轻量级的YOLO版本,如YOLOv5sYOLOv8n或专门为边缘设备设计的YOLO-NASPP-YOLO Tiny等。这些模型在保持一定精度的同时,参数量和计算量大幅减少,可以在树莓派上达到每秒数帧到数十帧的推理速度,满足实时性要求。

4. 完整系统搭建与实操步骤

4.1 硬件连接与系统准备

  1. 树莓派系统烧录与配置:使用Raspberry Pi Imager工具,选择适合的OS(如Raspberry Pi OS Lite 64-bit),并预先配置好Wi-Fi、SSH和主机名,方便无头启动。烧录完成后,插入树莓派启动。
  2. 连接摄像头:如果使用CSI摄像头,确保树莓派断电,轻轻抬起CSI接口的卡扣,将摄像头排线金属面朝向网口一侧插入,按下卡扣锁紧。如果使用USB摄像头,直接插入USB口即可。
  3. 基础环境安装:通过SSH登录树莓派,首先换源(使用国内镜像源,如清华源、中科大源)以加速软件下载,然后执行系统更新。
    sudo apt update && sudo apt upgrade -y
  4. 安装核心软件包
    # 安装Python3, pip, 虚拟环境工具 sudo apt install python3-pip python3-venv -y # 安装编译工具和OpenCV依赖 sudo apt install build-essential cmake pkg-config -y sudo apt install libjpeg-dev libtiff5-dev libjasper-dev libpng-dev -y sudo apt install libavcodec-dev libavformat-dev libswscale-dev libv4l-dev -y sudo apt install libxvidcore-dev libx264-dev -y sudo apt install libfontconfig1-dev libcairo2-dev -y sudo apt install libgdk-pixbuf2.0-dev libpango1.0-dev -y sudo apt install libgtk2.0-dev libgtk-3-dev -y sudo apt install libatlas-base-dev gfortran -y sudo apt install libhdf5-dev libhdf5-serial-dev libhdf5-103 -y sudo apt install libqtgui4 libqtwebkit4 libqt4-test python3-pyqt5 -y sudo apt install python3-dev -y

4.2 OpenCV与深度学习推理环境部署

在树莓派上从源码编译OpenCV虽然能获得最佳性能,但极其耗时(可能超过5小时)。对于大多数应用,使用预编译的轮子(wheel)是更快捷的选择。

  1. 创建虚拟环境并安装OpenCV

    python3 -m venv cv_env source cv_env/bin/activate pip install --upgrade pip # 安装OpenCV,推荐使用针对树莓派预编译的版本 pip install opencv-python-headless # 无GUI版本,适合服务器 # 或者安装完整版(如果需要在树莓派桌面显示图像) # pip install opencv-python
  2. 安装深度学习推理引擎:以ONNX Runtime为例,选择ARM64版本。

    pip install onnxruntime

    如果需要TensorFlow Lite,可以安装tflite-runtime

    pip install tflite-runtime
  3. 准备YOLO模型

    • 在性能更强的PC上,使用YOLOv5或YOLOv8官方代码训练你的自定义数据集(包含“a4_paper”, “box”, “book”等类别)。
    • 将训练好的PyTorch模型(.pt文件)导出为ONNX格式(.onnx)或TFLite格式(.tflite)。
    • 将导出的模型文件、对应的类别标签文件(labels.txt)以及推理脚本上传到树莓派。

4.3 摄像头标定实操流程

  1. 制作标定板:打印一张标准棋盘格图(例如,9x6内角点),将其平整地贴在一块硬质平板上。
  2. 采集图像:编写一个Python脚本,控制摄像头从不同角度、不同距离拍摄约20张棋盘格图片。确保棋盘格在画面中位置、倾斜角度多样。
    import cv2 cap = cv2.VideoCapture(0) # 对于CSI摄像头,可能是 `cap = cv2.VideoCapture(0, cv2.CAP_V4L2)` count = 0 while count < 20: ret, frame = cap.read() cv2.imshow('Capture', frame) key = cv2.waitKey(1) & 0xFF if key == ord('s'): cv2.imwrite(f'calib_{count}.jpg', frame) count += 1 elif key == ord('q'): break cap.release() cv2.destroyAllWindows()
  3. 执行标定:使用OpenCV的标定示例代码,处理所有采集的图像,计算并保存摄像头内参和畸变系数。这个步骤通常在PC上完成,然后将参数文件(如calibration_params.pkl)部署到树莓派。

4.4 测量程序集成与实现

这是将所有模块组合起来的核心脚本。其工作流程如下:

  1. 初始化:加载摄像头参数、加载YOLO模型、初始化视频流。
  2. 主循环: a.捕获并校正图像:读取一帧,进行畸变校正。 b.YOLO推理:将校正后的图像输入YOLO模型,得到检测结果(包含A4纸和待测物体的边界框、类别、置信度)。 c.寻找A4纸:从结果中筛选出置信度最高的“a4_paper”检测框。 d.计算距离:根据A4纸检测框的像素宽度和预先标定的焦距F_pixel,计算摄像头到A4纸所在平面的距离D。 e.测量其他物体:遍历其他检测结果(如“box”),对于每个物体,根据其像素宽度和计算出的距离D,换算其实际尺寸。 f.可视化与输出:在图像上绘制检测框,并标注出计算出的距离和尺寸信息,显示或保存结果。
import cv2 import numpy as np import onnxruntime as ort class MeasurementSystem: def __init__(self, cam_matrix, dist_coeffs, model_path, focal_length_pixel): self.cam_matrix = cam_matrix self.dist_coeffs = dist_coeffs self.focal_pixel = focal_length_pixel # 预先标定好的焦距(像素单位) self.a4_width_real = 210.0 # 单位:毫米 # 初始化ONNX Runtime会话 self.session = ort.InferenceSession(model_path) self.input_name = self.session.get_inputs()[0].name def process_frame(self, frame): # 1. 畸变校正 undistorted = cv2.undistort(frame, self.cam_matrix, self.dist_coeffs) # 2. 预处理图像为YOLO输入格式 (例如,resize到640x640,归一化等) input_blob = self.preprocess(undistorted) # 3. YOLO推理 outputs = self.session.run(None, {self.input_name: input_blob}) # 4. 后处理,解析出检测框 detections = self.postprocess(outputs) # 5. 查找A4纸并计算距离 distance_to_plane = None for det in detections: if det['class_name'] == 'a4_paper' and det['confidence'] > 0.7: pixel_width = det['bbox'][2] - det['bbox'][0] # 计算距离 distance_to_plane = (self.a4_width_real * self.focal_pixel) / pixel_width # 在图像上绘制A4纸框和距离 cv2.rectangle(undistorted, (det['bbox'][0], det['bbox'][1]), (det['bbox'][2], det['bbox'][3]), (0,255,0), 2) cv2.putText(undistorted, f"A4: {distance_to_plane:.1f}mm", (det['bbox'][0], det['bbox'][1]-10), cv2.FONT_HERSHEY_SIMPLEX, 0.6, (0,255,0), 2) break # 假设只有一个A4纸 # 6. 如果找到了A4纸(即知道了距离),则测量其他物体 if distance_to_plane: for det in detections: if det['class_name'] != 'a4_paper': pixel_width = det['bbox'][2] - det['bbox'][0] real_width = (pixel_width * distance_to_plane) / self.focal_pixel # 绘制物体框和尺寸 cv2.rectangle(undistorted, (det['bbox'][0], det['bbox'][1]), (det['bbox'][2], det['bbox'][3]), (255,0,0), 2) cv2.putText(undistorted, f"{det['class_name']}: {real_width:.1f}mm", (det['bbox'][0], det['bbox'][1]-10), cv2.FONT_HERSHEY_SIMPLEX, 0.6, (255,0,0), 2) return undistorted def preprocess(self, img): # 实现图像resize, BGR2RGB, 归一化,维度转换等 pass def postprocess(self, outputs): # 实现YOLO输出解析,非极大值抑制等 pass # 主程序 if __name__ == "__main__": # 加载参数,初始化系统 system = MeasurementSystem(cam_matrix, dist_coeffs, 'yolo_model.onnx', focal_pixel=800) # 示例焦距 cap = cv2.VideoCapture(0) while True: ret, frame = cap.read() if not ret: break result_frame = system.process_frame(frame) cv2.imshow('Measurement System', result_frame) if cv2.waitKey(1) & 0xFF == ord('q'): break cap.release() cv2.destroyAllWindows()

5. 精度优化、常见问题与排查实录

5.1 影响测量精度的关键因素及优化策略

  1. 摄像头标定精度:这是所有误差的源头。务必确保标定板平整,拍摄张数足够(>15),且覆盖整个画面区域。标定后,计算出的重投影误差(reprojection error)应尽可能小(通常要求小于0.5像素)。
  2. A4纸检测的像素级精度
    • 问题:YOLO给出的包围盒是轴对齐的矩形框,如果A4纸在图像中倾斜,这个框的宽度并不是A4纸实际边缘的精确像素距离。
    • 优化:一种更精确的方法是在YOLO定位到A4纸大致区域后,在该区域内部使用传统的图像处理(如Canny边缘检测、霍夫直线变换)来精确定位A4纸的四条边,然后计算其最小外接矩形的宽度。这结合了深度学习的鲁棒性和传统算法的亚像素精度。
  3. 参考物平面与待测物平面的一致性
    • 问题:公式推导假设A4纸和待测物体处于同一深度平面。如果盒子比A4纸高或低,测量结果就会不准。
    • 优化:对于要求高的场景,可以考虑使用多个已知尺寸的参考物,或者利用A4纸上的多个特征点进行单应性矩阵估计,来应对轻微的平面不一致。更复杂的方案是引入稀疏点云重建,但这超出了单目+参考物的范畴。
  4. 光照与曝光:强烈或变化的光照会导致图像过曝或欠曝,边缘模糊,影响检测和轮廓提取精度。
    • 优化:使用摄像头的手动曝光模式,固定一个合适的曝光值。确保测量环境光照均匀、稳定。可以考虑增加柔光罩。
  5. 镜头焦距:公式中的F_pixel在摄像头物理焦距不变时才恒定。严禁使用自动对焦摄像头,必须使用定焦镜头,或者在软件中锁定焦距。

5.2 典型问题排查速查表

问题现象可能原因排查与解决方法
测量距离/尺寸数值完全不对,偏差极大1. 焦距F_pixel标定错误。
2. A4纸实际尺寸输入错误(单位是米还是毫米?)。
3. 摄像头标定参数未用于图像校正。
1. 重新进行焦距标定,确保已知距离D_known测量准确。
2. 检查代码中a4_width_real的数值和单位。
3. 确认cv2.undistort函数被正确调用,且参数无误。
测量结果不稳定,数值跳动1. A4纸检测框像素宽度波动大。
2. 环境光照闪烁或自动曝光未锁定。
3. 摄像头对焦未锁定(如果是自动对焦)。
1. 提高YOLO检测置信度阈值,或加入检测框平滑滤波(如移动平均)。
2. 切换到手动曝光模式,并固定参数。
3. 使用定焦镜头,或通过v4l2-ctl工具锁定对焦。
YOLO模型检测不到A4纸或物体1. 模型未正确训练或泛化能力差。
2. 输入图像的预处理与训练时不匹配。
3. 环境与训练数据差异太大(如颜色、光照)。
1. 增加训练数据的多样性和数量,确保包含各种角度、光照下的A4纸。
2. 确保推理时的图像归一化、尺寸调整与训练时完全一致。
3. 在应用现场采集一些图片,对模型进行微调。
图像存在严重畸变,边缘物体弯曲摄像头畸变校正未启用或校正参数错误。重新进行严谨的摄像头标定,确保畸变系数正确,并确认校正函数被调用。
程序运行卡顿,帧率极低1. YOLO模型过大,树莓派算力不足。
2. 图像分辨率过高。
3. Python循环效率低,存在内存泄漏。
1. 换用更轻量的YOLO版本(如Nano, Tiny)。
2. 将摄像头采集分辨率降低到640x480或320x240。
3. 优化代码,避免在循环中重复加载模型或创建大对象。使用numpy向量化操作。

5.3 从“能用”到“好用”的进阶技巧

  1. 多帧融合与滤波:单次测量难免有噪声。可以对连续多帧(如10帧)的测量结果进行卡尔曼滤波或简单的中值滤波,输出一个平滑稳定的结果,这对于显示或后续控制非常有用。
  2. 动态焦距标定:如果应用场景中测量距离范围变化很大(从20cm到2米),在极端距离下,使用同一个F_pixel可能会有误差。可以预先在不同距离下标定一组F_pixel值,在实际测量时,根据一个粗略的距离估计(例如,用A4纸像素面积估算)来动态选择最合适的焦距参数进行插值计算。
  3. 利用A4纸角点进行透视校正:如果A4纸与摄像头成像平面不平行(存在透视),直接使用包围盒宽度会引入误差。可以检测A4纸的四个角点,然后通过透视变换将其校正为正面视图,在这个校正后的图像上测量像素尺寸,精度会更高。这需要更稳定的角点检测算法。
  4. 温度与长期稳定性:树莓派在长时间运行或高负载下会发热,可能轻微影响摄像头传感器性能。对于工业级应用,需要在系统热稳定后(开机运行30分钟后)重新检查标定参数,或考虑增加温度补偿机制。

这个项目最吸引人的地方在于,它清晰地展示了一个复杂问题如何被分解为一系列可解决的子问题:硬件选型、驱动配置、摄像头标定、算法集成、精度优化。每一个环节都有得琢磨,都有提升空间。在实际操作中,我最大的体会是“耐心”和“数据”的重要性。标定环节多花一小时获取高质量的数据,抵得上后期调试一整天;为YOLO模型多收集100张不同场景的A4纸图片,其鲁棒性的提升是任何算法调优都难以比拟的。它不仅仅是一个测量工具的制作过程,更是一次对嵌入式视觉系统全栈开发的深度实践。

本文还有配套的精品资源,点击获取

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询