[{"archived":false,"content":" 项目简介 # 本项目面向工业机器人零件抓取场景，构建了从视觉识别、目标定位、坐标转换到机械臂执行的完整流程。\n系统通过相机获取工作区域图像，利用 YOLO 模型识别目标零件，并根据检测框中心计算目标位置。随后将图像坐标转换为机械臂可执行的抓取位姿，通过通信模块向仿真机械臂发送运动和吸取指令。\n系统流程 # ```mermaid\nflowchart LR\nA[相机拍照] --\u0026gt; B[YOLO零件识别] B --\u0026gt; C[计算目标中心] C --\u0026gt; D[坐标转换] D --\u0026gt; E[生成抓取位姿] E --\u0026gt; F[机械臂移动] F --\u0026gt; G[吸嘴吸取] ","date":"2026 年 9 月 22 日","externalUrl":null,"permalink":"/projects/%E5%B7%A5%E4%B8%9A%E6%9C%BA%E5%99%A8%E4%BA%BA-2d-%E8%A7%86%E8%A7%89%E6%8A%93%E5%8F%96%E5%AE%9A%E4%BD%8D%E7%B3%BB%E7%BB%9F/","section":"项目","summary":"基于 YOLO 目标检测完成零件定位，通过图像坐标与机械臂坐标转换生成抓取位姿，并结合 MQTT、TCP Socket 与仿真机械臂完成零件识别、定位和吸取流程。","tags":["Computer Vision","Industrial Robotics","Object Detection","Robot Grasping"],"title":"工业机器人 2D 视觉抓取定位系统","type":"projects","year":"2026"},{"archived":false,"content":" 1. 目标检测解决什么问题 # 目标检测不仅要回答“图像里有什么”，还需要回答“目标在哪里”。\n因此，一个典型检测结果通常包含：\n类别；\n置信度；\n目标位置。\n对于普通目标检测，目标位置通常表示为水平矩形框 Bounding Box。\n2. Bounding Box # 常见表示方式包括：\n[\n(x_1,y_1,x_2,y_2)\n]\n或者：\n[\n(x_c,y_c,w,h)\n]\n其中：\n\\(x_c,y_c\\)：目标中心；\n\\(w,h\\)：目标框宽高。\n3. IoU # IoU 用于衡量两个目标框之间的重叠程度：\n[\nIoU=\\frac{|A\\cap B|}{|A\\cup B|}\n]\nIoU 越大，说明两个目标框越接近。\n4. NMS # 同一个目标可能产生多个候选框，因此通常使用 Non-Maximum Suppression：\n选择置信度最高的框；\n计算它与其他框的 IoU；\n删除重叠程度过高的框；\n重复上述过程。\n5. 为什么需要 OBB # 对于细长、倾斜或方向明显的目标，普通水平框可能包含大量背景。\nOBB（Oriented Bounding Box）在矩形框基础上进一步表示旋转角度，因此更适合：\n遥感目标；\n文本检测；\n工业零件；\n细长目标。\n6. 小结 # Bounding Box 是目标检测最基础的位置表示方式，而 OBB 则进一步引入方向信息。\n理解 Bounding Box、IoU 和 NMS，是理解 YOLO 检测流程的重要基础。\n","date":"2026 年 9 月 22 日","externalUrl":null,"permalink":"/notes/%E8%AE%A1%E7%AE%97%E6%9C%BA%E8%A7%86%E8%A7%89/%E7%9B%AE%E6%A0%87%E6%A3%80%E6%B5%8B/yolo-%E7%9B%AE%E6%A0%87%E6%A3%80%E6%B5%8B%E5%9F%BA%E7%A1%80%E4%BB%8E-bounding-box-%E5%88%B0-obb/","section":"笔记","summary":"梳理目标检测中 Bounding Box、IoU、NMS 与 OBB 的基本概念，并结合 YOLO 理解目标定位过程。","tags":["YOLO","Object Detection","Bounding Box","OBB","IoU"],"title":"YOLO 目标检测基础：从 Bounding Box 到 OBB","type":"notes","year":"2026"},{"archived":false,"content":" 研究背景 # 3D Gaussian Splatting（3DGS）能够以显式高斯表示实现高质量、实时的新视角合成，也为三维场景编辑提供了新的技术路径。\n语言驱动的三维场景编辑通常需要先根据文本指令修改多个二维视图，再将修改结果重新融合到三维场景中。然而，不同视角之间存在遮挡、尺度变化、编辑噪声以及语义歧义，使得同一目标在不同视图中的编辑结果可能不一致。\n研究问题 # 本研究重点关注多视角编辑过程中的语义对应与一致性问题，包括：\n不同视角下目标区域的语义对应； 遮挡和视角变化导致的匹配困难； 二维生成模型带来的跨视角编辑噪声； 多视图编辑结果向三维表示迁移时的一致性。 方法概述 # 整体流程可以概括为：\n文本编辑指令 → 多视图二维编辑 → 多视角语义对应 → 一致性约束 → 3DGS 场景更新。\n研究通过更加合理的语义传递机制，在不同视图之间建立编辑区域的对应关系，并将多视角信息重新融合至三维场景表示。\n我的参与 # 本人作为论文第二作者，参与相关工作调研、部分实验及结果分析，并对语言驱动三维场景编辑、多视图一致性和 3D Gaussian Splatting 等相关方法进行了学习与实践。\n当前状态 # 论文目前处于审稿阶段。\n","date":"2026 年 9 月 22 日","externalUrl":null,"permalink":"/research/transsplat-unbalanced-semantic-transport-for-language-driven-3dgs-editing/","section":"科研","summary":"面向语言驱动的 3D Gaussian Splatting 场景编辑，研究多视角编辑中的语义对应与一致性问题","tags":["3D Vision / 3DGS / Scene Editing / Multimodal"],"title":"TransSplat: Unbalanced Semantic Transport for Language-Driven 3DGS Editing","type":"research","year":"2026"}]