跳到主要内容

示例项目

多城市 POI 数据分析

在五个都市区之间建立一份可比的品类普查,以及让这种比较得以成立的标准化工作。

市场
5 个都市区
采集记录
94,200 条原始
去重后
71,480 条唯一
刷新频率
每季度
周期
首期 6 周
原始记录
94,200

在五个都市区的完整边界内采集

唯一 POI
71,480

经过有据可查的去重

品类标签
14 → 1

标准化并公开映射关系

季度刷新
4 天

首期搭建耗时六周,现已压缩至此

问题

需要回答什么

一支研究团队需要比较某一零售品类在五个都市区之间的结构差异。其中两个市场有公开的行业数据,但彼此矛盾,而且各自的统计口径都没有完整说明。

他们要的不只是一个数字。他们需要同一套品类定义在每个市场被一模一样地执行,需要理清连锁归属以便测算集中度,还需要一个每季度都能重跑、而方法不会跑偏的基线。

麻烦出在品类混乱。跨来源、跨城市看下来,同一类生意出现在十四个不同的标签下,其中两个标签在某个市场里还被用来指另一类生意。

数据来源

输入了什么

  • 地图平台商户列表

    门店名称、类别、坐标、营业时间与经营状态的主要来源。

  • 公开工商名录

    用于覆盖率复核,同时提供注册经营名称。

  • 企业登记信息

    公开备案资料,用于判定哪些经营名称属于同一集团。

  • 人口普查数据

    各市场人口数,用于计算每万常住人口的渗透率。

  • 都市区边界定义

    统一的统计地理口径,确保「这个市场」在各地含义一致。

方法

具体怎么做的

采集按各都市区的完整边界分块推进,而不是靠城市名搜索——后者是多城市项目中最大的漏数来源。一旦覆盖跟着搜索框走,郊区门店就会被系统性漏掉。

去重使用一套写明的业务主键:名称归一化加地址,近似匹配用 50 米距离阈值。原始记录与唯一记录之比在各市场之间差异明显,这本身就暴露出某个来源过度收录了某个连锁品牌。

品类标准化把十四个来源标签收敛为一个定义明确的品类,每一条映射判定都记录在随数据一并交付的对照表里。两个有歧义的标签没有按规则处理,而是人工抽样查看门店后逐个判定。

连锁归属通过把经营名称与公开的企业备案资料做匹配来确定,前四十大集团再逐一人工复核。纯自动匹配的准确率约 88%——当产出是集中度指标时,这个水平不够用。

整条数据管道按市场与季度做了参数化,因此第二次运行只需要改配置,不需要重搭。

处理过程

数据管道

每个阶段都产出一件明确的中间成果,供下一阶段使用。因此任何结论都能回溯到产生它的那份输入。

  1. 01

    原始采集

    原始 JSON

    在五个都市区的完整边界内系统分块采集 94,200 条记录,郊区覆盖与中心城区保持一致。

  2. 02

    去重

    唯一 POI 表

    名称归一化加地址匹配,近似匹配阈值 50 米,收敛到 71,480 个唯一点位,并保留各来源主键。

  3. 03

    品类标准化

    映射表

    十四个来源标签映射到一个定义明确的品类,有歧义的情形由人工查看判定,完整映射一并公开。

  4. 04

    连锁归属判定

    品牌层级

    经营名称与公开的企业备案资料匹配,最大的几个集团再人工复核,使集中度指标站得住脚。

  5. 05

    可比普查

    普查数据集

    各市场的门店数、每万常住人口渗透率与连锁占比,交付为可按季度刷新的基线。

可视化

输出成果

五个研究都市区之一的 POI 采集密度稀疏密集

数据

结果表

示例项目 · 五个市场的可比普查
市场原始记录唯一 POI去重率 %每万常住人口连锁占比 %
Metro A28,40021,18025.44.138.2
Metro B19,90015,64021.45.622.7
Metro C17,60013,02026.03.251.4
Metro D16,10012,86020.16.817.9
Metro E12,2008,78028.02.444.6

关键发现

核心对比

  • Metro D渗透率最高6.8
  • Metro B5.6
  • Metro A绝对数量最多4.1
  • Metro C3.2
  • Metro E集中度最高2.4
每万常住人口对应的门店数。若按绝对数量排序,五个市场的次序会完全不同。

结论

分析说明了什么

  • 按绝对数量排,Metro A 大幅领先;按人均排,它只排第三,而团队原本认为无关紧要的两个市场,反倒是供给最密集的。

  • 连锁占比在这些被行业评论视为大体相似的市场之间,从 17.9% 一直分布到 51.4%。这个跨度后来成了整份研究的核心发现,而不是一条脚注。

  • 去重率介于 20.1% 到 28.0% 之间。有两个市场的公开数据几乎正好等于未去重的原始数量,这也解释了那些数字为什么互相矛盾。

  • 季度重跑只花了四天,而不是六周——因为这条数据管道是参数化的,不需要重建。

交付物

最终交付了什么

  • 覆盖五个市场的 71,480 条唯一 POI 数据集,带稳定标识符
  • 涵盖全部十四个来源标签的类别映射表
  • 与公开企业备案资料核对后的品牌与连锁层级
  • 可比普查表,含各市场门店数、渗透率与集中度
  • 覆盖率与校验报告,说明各市场实际达到的覆盖水平
  • 已配置为按季度刷新的参数化数据管道,附变更日志

下一步

想在你的市场做一个类似的项目?

告诉我们地域范围、品类和要做的决策。我们会把对应项目的范围定下来,并在开工前给出固定报价。