跳到主要内容

语义分割

语义分割服务

把每一个像素归到一个类别,再把每个类别变成能用的数字:面积、占比、数量与变化。覆盖街景、航空遥感、工业与医疗影像。

示例项目 · 一张街景影像被分割为各个类别

概述

掩膜要能用来算出点什么,才算有价值

语义分割就是把图像里的每个像素归到一个类别:道路、建筑、植被、天空、缺陷、组织、作物。真正让它值得做的是下一步。掩膜本身只是一张图,交付物是由它算出来的那张表——这张图里植被占多少、这处缺陷有多少毫米、这片地里某种作物有多少公顷、两个时期之间这些数字又变了多少。

选哪个模型是其中最不重要的决定,我们也放在最后做。它由影像类型和你需要的类别决定:街景用城市场景模型,航空与卫星瓦片用遥感模型,工业表面用异常检测模型,CT、MRI 与内镜用医学影像模型。我们基于成熟的开源架构来做,而不是从零造轮子——在绝大多数项目上,一个成熟模型配上认真准备的数据,永远好过一个新模型配上仓促准备的数据。

真正决定这些数字站不站得住的,是类别定义和验证。我们会在标注开始之前就把每个类别到底算什么定清楚,推理完成后再用一份留出样本人工逐张打分,并把逐类 IoU 连同结果一起交付。没有经过验证的掩膜,只是一个用颜色画出来的主观判断。

真实产出

四类影像上的分割效果

同一套流程骨架——定义类别、分割、测量、验证——用在四个彼此几乎毫无共同点的领域上。下面的输出来自成熟开源模型在公开演示数据上的结果。

街道与行车场景

一次推理即可分出道路、人行道、建筑、植被、天空、车辆与行人。这类影像的类别占比,正是街道空间指标的来源:一条街看上去有多绿、围合感有多强、临街面有多少是活跃的。

街道场景 1,叠加语义分割结果,各区域按类别着色
城市场景
街道场景 2,叠加语义分割结果,各区域按类别着色
城市场景

工业表面与缺陷

从左到右依次是:输入图像、人工标注真值、预测热力图、二值掩膜与最终轮廓。用分割而不是分类,缺陷才成为可测量的对象——它的面积、形状,以及是否超出公差。

工业缺陷分割五联图:输入图像、真值标注、预测热力图、预测掩膜与分割结果
缺陷

医学影像

在 CT 断层上勾出器官与感兴趣区域。临床上真正关心的从来不是掩膜本身,而是由它得出的体积、边界,以及两次扫描之间的变化。

CT 断层 1,器官区域已分割并按类别着色
医学影像
CT 断层 2,器官区域已分割并按类别着色
医学影像

航空与卫星影像

输入瓦片、参考标注与预测结果并排呈现,下方是类别图例:不透水面、低矮植被、树木、车辆、建筑。带上地理参考之后,每个类别都成为可测量、可跨期比较的面积。

航空影像瓦片的地表覆盖分割结果,附不透水面、低矮植被、树木、车辆、建筑与背景的类别图例
航空影像

演示影像来自开源项目,按各自许可证使用:MMSegmentation 与 Anomalib(Apache-2.0)、MedSAM(Apache-2.0)、GeoSeg(GPL-3.0)。此处仅用于说明各类输出长什么样,实际项目在你自己的影像上运行。

服务范围

你实际拿到的是什么

掩膜只是中间产物。由它算出来的统计结果,以及证明这些结果可信的证据,才是交付物。

  • 逐张掩膜

    索引 PNG 或单波段 GeoTIFF,一个类别一个取值,分辨率与源影像一致。

  • 类别配色表

    调色板与类别的对应关系以数据形式交付,掩膜在任何软件里打开配色都一致。

  • 逐类统计

    每张影像各类别的像素数、面积与占比;影像有地理参考或标定时,直接给到真实单位。

  • 矢量多边形

    掩膜转成多边形,简化容差由你指定,可直接进 GIS 与 CAD 流程。

  • 实例对象

    当问题是「有几个」而不是「占多少」时,把连通区域逐个计数并测量。

  • 置信度图层

    逐像素置信度与掩膜一并输出,低置信区域可以复核,而不是盲目采信。

  • 精度报告

    对照人工打分样本给出总体与逐类的 IoU、精确率与召回率,样本本身也一并交付。

  • 变化对比

    有两期数据时,给出各类别的增减,并写明两期是如何配准比较的。

  • 方法记录

    模型、权重、训练或微调数据、阈值与后处理步骤,全部写下来并有版本。

  • 推理包

    可选项:交付权重与可运行脚本,之后新影像你们可以自己跑。

交付格式

按你的技术栈习惯的方式交付

PNG / TIFF 掩膜
索引掩膜,另可附带上色叠加图,便于复核与写报告。
GeoTIFF
与源影像配准的带地理参考掩膜,可直接在 QGIS 与 ArcGIS 中使用。
GeoJSON / Shapefile
矢量化后的类别图层,每个多边形带面积与类别属性。
COCO JSON
当输出要喂给另一套训练流程时,采用标准标注格式。
CSV / Excel
逐张与汇总的类别统计,精度报告单独成表。
模型权重
需要移交模型时,提供 ONNX 或框架原生权重。

样例数据

你实际拿到的是什么

示例项目数据。行人、灯杆这类细小类别的得分,永远低于大面积连续类别;把它们单独列出来正是重点所在——一个平均值恰好会盖住最可能出错的那几类。

示例项目 · 留出验证集上的逐类精度
类别像素占比 %IoU精确率召回率样本数
路面31.40.940.960.97480
建筑24.80.910.930.95480
植被18.20.890.920.94480
天空12.60.970.980.99480
车辆7.10.830.880.90480
行人1.40.680.790.76480

交付实例

这项服务在真实项目里的样子

基于这项服务完成的示例项目,附它们跑出来的数字,以及各自最终解决了什么问题。

GIS 分析计算机视觉地图可视化

街景分析

用语义分割、目标检测与色彩分析处理街景影像,大规模量化街道的物理特征。

分析路网
310 km
处理影像
24,800
每路段指标数
7

得到了什么结论

  • 全路网的绿视率从 4.1% 到 38.9%,其分布与行政区边界的吻合程度远超团队预期。两个相邻片区在街道类型没有变化的情况下,相差超过二十个百分点。
  • 围合比与绿视率之间只有弱相关。有几条街道在绿量上得分不低,走在其中却开阔而缺少遮蔽;这一点值得注意,因为街道空间政策里常把这两种品质当成一回事。
查看完整案例

服务流程

五个步骤,每个项目都一样

  1. 步骤 01

    说明你需要什么数据

    你手上有或需要采集的影像、真正关心的类别,以及结果最终要支撑哪一项测量。

  2. 步骤 02

    我们确定数据范围

    把类别定义(含边界情形)以书面形式敲定,同时约定精度目标与验收方式。

  3. 步骤 03

    我们采集并处理数据

    按需完成标注,选型并微调模型,然后在全量影像上推理。

  4. 步骤 04

    我们校验数据集

    用一份留出样本人工打分,逐类比对通过后才进入交付。

  5. 步骤 05

    我们交付最终成果

    掩膜、统计、矢量、精度报告与方法记录;如在范围内,还包括模型权重。

项目按影像数量、是否需要定制标注、类别数量以及是否移交模型权重来定价。把一小批影像样本和需要的类别发给我们,你会拿到一份对应书面工作范围的固定报价。

常见问题

客户经常问到的问题

什么是语义分割?

语义分割是把图像中的每一个像素都归到某个类别。相比之下,分类是给整张图打一个标签,检测是给目标画一个框。当答案是一个面积或一个形状时——这个场景里植被占多少、这处缺陷范围有多大——分割才是对的工具,而不是一个「是」或「否」。

能处理哪些影像?

街景与 360 全景、无人机与航空摄影、卫星瓦片、工业检测图像、视频帧,以及 CT、MRI、超声与内镜等医学影像。实际的限制只有两条:分辨率相对于你最关心的那个最小类别够不够,以及这些类别在你手上的影像里到底看不看得见。

必须先有标注好的训练数据吗?

多数情况下不需要。城市场景、地表覆盖、常见缺陷类型这些通用类别体系,预训练模型迁移效果就很好,我们做的是验证而不是重训。自定义类别通常需要几百张标注图像——这部分我们可以代做,也可以对你已有的标注做质检。看过样本之后我们会明确告诉你属于哪种情况,你再决定要不要投入。

精度有多高?

取决于类别,所以我们按类别报告,而不是给一个总的漂亮数字。道路、建筑、天空这类大面积连续类别,IoU 通常能到 0.90 以上;行人、灯杆、电线这类细小类别会明显更低。每个项目都会对照人工打分样本做验证,样本本身也随结果交付,让你可以自己复核这个说法。

之后我们能自己跑模型吗?

可以,只要这一项在范围内。我们会移交权重、推理脚本以及前后处理步骤,新影像你们可以自己处理。但要注意底层架构的许可证:多数是宽松协议,也有部分开源模型带 copyleft 条款、会影响再分发,我们会在开工前把适用哪一种讲清楚。

可以处理视频而不是静态图吗?

可以。视频会按适合该问题的间隔抽帧,逐帧分割,并可在时间维度上做平滑,避免某个类别在相邻帧之间闪烁。结果可以按帧、按秒,也可以整段汇总来报告。

下一步

有具体的数据需求?

告诉我们语义分割需要覆盖哪片地域、包含哪些字段、多久刷新一次。正式开工前,你会先拿到明确方案、样例数据与固定报价。