2025年8月重庆本地生活全品类数据采集与商圈分析

📅 发布时间:2026/10/1 4:56:01
2025年8月重庆本地生活全品类数据采集与商圈分析
今年8月这轮大众点评重庆全品类的数据整理是我近几个月做本地生活服务数据项目时体感最特殊的一次。以前做同类项目多半盯着一两个垂直类目比如只看餐饮或者只看酒店虽然也能看出一些商业规律但始终觉得少了一个维度——一条街上奶茶店和医美机构的数量关系一个商圈里火锅店与足疗馆的密度配比这些跨品类的结构信息才是最接近“真实城市商业生态”的东西。所以从2025年7月底开始我花了大概三周时间把大众点评在重庆主城及主要区县的全品类商户数据做了一轮系统性的抓取、清洗和交叉分析并最终落成了这份2025年8月的“重庆本地生活数据存档”。这篇文章把我整个项目的思路和过程完整拆开来讲包括数据获取的合规做法和边界、字段清洗与坐标纠偏这些脏活累活、按商圈的品类密度分析、按品类维度的结构拆解、以及2025年8月这个特定时间切片反映出来的暑期消费特征。无论你是想复现类似的城市商业数据项目还是单纯想做商铺选址、竞品调研、品类机会判断这套流程和思路都值得参考。我会把能公开的代码逻辑、参数设定以及踩过的坑都写在下面尽量说人话不做假大空的理论包装。1. 为什么从“全品类”切入重庆本地生活数据先说一个反直觉的结论垂直类目的数据好拿但很难用来判断一个商圈的真实价值。我以前做过好几次“只抓美食类目”的项目数据倒是很快跑完了但分析出一个商圈餐饮很旺盛却说不清楚它到底是纯粹的餐饮一条街还是有住宿、娱乐、丽人板块联动支撑的综合型商圈。而全品类数据的价值恰恰在于还原“商业基本面”——不同品类之间存在很强的关联和互斥关系只看单品类永远看不到这些。重庆是个很特殊的观察样本。这座城市近年来在社交媒体上的热度一直很高但它的本地生活业态结构和一线城市很不一样一方面老城区山势起伏人口密度和商圈分布高度集中形成了解放碑、观音桥、南坪、杨家坪、沙坪坝等几个传统商圈另一方面新区如照母山、礼嘉、中央公园一带的社区商业增长很快。不同板块的品类构成差异极大这一点在全品类数据里会体现得非常直观。我这次定的采集范围是大众点评重庆站的全部分区包括中心城区的九个行政区以及合川、永川、涪陵、万州等人口较多的区县。全品类覆盖的是一级分类下的美食、酒店、休闲娱乐、丽人、运动健身、亲子、教培、生活服务、购物等。之所以要覆盖区县是因为重庆的区县经济和主城关联很强只看主城会漏掉相当大一部分商业样本。另外一个出发点是想做一份“可以持续对比”的数据存档。单个时间点上的绝对数量意义有限但2025年8月的数据会被当作基准月后面每个季度更新一次就能看出哪些品类在一个季度内出现明显增长或萎缩。类似的做法在企业做市场洞察时很常见但个人和中小团队很少系统性地去沉淀——因为这个过程确实有点费功夫。后面我会讲到只要第一轮的清洗逻辑和存档结构搭得够好后续更新成本是可以压得很低的。提示做数据项目之前建议先明确“分析视角”。同样是全品类数据站在消费者角度和站在商户运营者角度需要保留的字段差别很大。我这次围绕的是“商圈商业结构”和“品类密度”这两个分析视角所以字段取舍、清洗规则都以此为核心。2. 数据获取的技术路径与合规底线这个项目里最容易被问到的就是“数据是怎么拿的”。我先把它拆成两个层面直接抓取的技术路径以及在2025年这个时间点做这类事情必须守住的合规底线。2.1 大众点评的品类体系与URL结构大众点评的商户页面和城市列表页结构比较稳定。以“重庆”为基础城市按一级分类进入会落到一个分类列表页URLURL里通常带cityId、categoryId和sort参数。一级分类下面还有二级分类比如“美食”下面有“火锅”“川菜”“日本料理”“快餐简餐”等几十个子类。全品类数据要做得干净一个关键动作就是把“分类—子分类”的映射关系先完整扒下来——这决定了后面数据入库时品类字段是否能正确分层。我这次先跑了一个分类映射脚本把重庆站所有一级分类和二级分类的ID关系、页面展示名称全部拉出来构建了一张分类维度表。需要注意大众点评的有些子分类是同义不同词的比如“重庆火锅”和“火锅”在不同页面会出现混用。这种问题留在后面清洗阶段统一处理抓取阶段不要急着归一化尽量保留原始字段值。2.2 采集策略网格切分与关键词扫描重庆主城商圈密集如果只按分类页翻页采集会漏掉大量分布在外围、但真实存在的商户。原因很简单分类页面的翻页深度有上限而且排序规则会掩盖长尾商户。我在实际操作中采用了一种更稳的“网格切分”策略把目标区域按经纬度切成边长约1公里的小网格重庆主城加主要区县大概需要几千个网格。每个网格内对目标一级分类做一次“周边检索”也就是把网格中心点的坐标作为检索原点。取出每个网格内的POI列表保留商户ID、名称、经纬度。对商户ID去重后再逐条进入详情页补齐经营信息。用网格切分的逻辑是什么因为大众点评的周边检索功能本身就是为了“以点找店”设计的切片遍扫相当于把整个城市变成了一张密集的渔网每个网格里的商户都会被覆盖到不会因为翻页深度限制而漏掉。我实测下来这种策略对重庆这种多中心、多组团的城市结构非常适用主城核心区域的覆盖率很高远郊区县也能找到比较偏的农家乐和景区配套商户。2.3 请求节奏、频率与合规容错这是整个项目里我最谨慎的部分。无论做什么数据采集都要记住一个底线不能影响目标平台的正常服务不能涉及非公开的用户隐私数据。我这次只处理公开的商户基础信息比如店名、地址、电话、经纬度、营业时间、人均消费、评分、点评数量不涉及任何用户账号和个人数据。为了把合规风险降到最低我给自己定了几个执行纪律请求频率严格控制每个网格之间休眠数秒避免对服务器造成压力。不对同一类目做连续深度翻页突破了正常翻页边界就切换关键词组合。不碰需要登录态的敏感数据接口全程只用公开页面能力。夜晚和平台高峰时段降低采集密度这既是为平台减负也是降低自己IP被限制的概率。这套纪律下来整体采集速度会比“猛跑”慢不少但胜在稳。整个过程跑了大概十几天没有出现大面积的IP封禁问题中途只遇到几次局部限流调整策略后很快恢复。提示如果你只是个人做城市研究建议优先查看目标平台是否有官方开放能力比如商户POI授权接口、第三方数据服务商等。自己写采集程序处理公开信息是可行的技术方案但务必自律。商业用途必须走正规授权渠道。3. 从脏数据到可用分析库字段清洗与地理校准抓下来的原始数据有点“原生态”这句话我每次做数据项目都要说一遍。大众点评的公开字段整体是规范的但细节上处处是坑同一个商圈在不同商户地址里的叫法不同坐标系统需要纠偏评分字段有的商户没有评分人均消费有的返回0或空值。如果不做清洗直接分析出来的图表会自带一种“差不多但不对劲”的感觉。3.1 原始入库与去重逻辑全品类数据去重不能只看商户名。重庆有很多连锁品牌同名店比如一家火锅品牌开在观音桥和南坪的两家分店名字完全相同但它们是两个不同的门店。真正可靠的主键是商户ID抓取时每一个POI和详情页都必须保留平台自身的ID字段入库后以ID去重。如果出现ID不同但名称和坐标都高度重合的记录大概率是同一家店的历史合并或搬迁这种情况我单独抽出来人工看了几十条样本后做了合并规则。3.2 坐标系纠偏GCJ-02与WGS-84的转换处理这里必须多说一句因为很多人会在这上面翻车。大众点评的POI坐标走的是国测局坐标也就是GCJ-02火星坐标系它和GPS原始的WGS-84坐标之间有一个非线性的偏移。如果你的分析工具默认按WGS-84计算距离或者叠底图会发现所有点位偏移了几十米到几百米不等。重庆这种山地城市几十米的偏差可能就把一个店从马路东边挪到西边商圈归属判断就被拉偏了。我写了一个标准坐标转换函数把抓取到的GCJ-02坐标批量转成WGS-84然后用经过校准的点位重新做商圈匹配和距离计算。网上有很多公开的转换算法关键是要先验证转换结果的偏差量级。我用已知地标的经纬度做了抽样对照转换后误差基本在可接受范围内。这一步和采集一样重要坐标错了后面所有空间分析都会失真。3.3 品类字段归一化原始数据的分类字段层级比较乱比如同样是火锅店有的挂在“美食/火锅”有的挂在“美食/重庆火锅”还有的挂在“美食/鱼火锅”下面。品类归一化我分了两步走第一步把二级分类映射到统一的一二级分类体系里建立了“鱼火锅—火锅”“小面—面馆”“江湖菜—川菜”这类规则映射表。第二步对无分类商户做名称关键词补全。比如商户名叫“XX推拿馆”但分类空白就通过关键词匹配归入“休闲娱乐/足疗按摩”。归一化规则的建立不能闭门造车我拿重庆当地的高频品类词火锅、小面、串串、麻辣烫、烤全羊、温泉、足疗、民宿过了一遍Top分类词表确保本地特色的重品类没有被漏掉。重庆的小面和火锅在全品类样本里占比很大如果不对这两个品类做专门的细分规则数据分析的结论会很粗糙。3.4 数据质量抽检与修正整个清洗流程做完后我做了三轮抽检。第一轮是抽地址字段明显残缺的样本第二轮是抽坐标离商圈中心过远的异常点第三轮是抽人均消费和评分明显矛盾的记录。抽检比例大约千分之一发现的重点问题集中在两类一类是景区周边商户的地址信息不完整需要按POI名称和描述补全另一类是部分团购型商户的“人均消费”展示的是套餐价而非堂食均价这个字段在分析时会单独按品类加权重处理。三轮下来整体数据质量标准基本稳定在了我自己能接受的水平。实践心得数据清洗阶段最忌一步到位。先做规则再看异常再补规则循环三遍以上数据质量才算真正稳定。着急跑分析图后面返工成本更高。4. 商圈维度重庆主城各核心商圈的品类结构与密度数据整理干净之后第一个想看的是商圈。重庆传统的商圈格局从数据里看得很清楚——本土商圈和外来商业体、老城区和新区的差异非常明显。我以商圈中心点做半径两公里的缓冲区对各商圈范围内的品类构成做了统计。4.1 传统核心商圈观音桥与解放碑的差异化画像观音桥商圈在总量上依然领先。它的结构特点是“餐饮丽人休闲娱乐”三头并进餐饮占比大约四成丽人和休闲娱乐加起来也占了非常可观的份额。从点评数量和人均消费的分位数看观音桥的中高端消费供给非常丰富火锅品类和异国料理这两块尤其突出。说明它既是本地人的聚餐中心也承担了大量游客和商务客群的消费功能。解放碑商圈则是另一番结构。它的酒店和民宿占比在重庆各商圈里是最高的尤其是星级酒店和中高端特色民宿这个特点很好理解——解放碑本身就是重庆游客住宿的核心承载区。餐饮占比略低于观音桥但小面、江湖菜这些“游客必吃”类目的点评密度很高。有一个有意思的现象是解放碑周边密室剧本杀类休闲娱乐门店这几年增长很快全品类数据里这类业态在解放碑的密度已经超过了其他传统商圈。4.2 区域型商圈南坪、杨家坪与沙坪坝的社区商业特征和解放碑、观音桥相比南坪、杨家坪、沙坪坝的品类结构更偏向“社区商业区域中心”的混合模式。南坪的餐饮占比和亲子类目占比都更高说明家庭型消费是主流杨家坪的购物占比明显偏高传统百货和大型超市的存量多但新式休闲业态相对偏弱沙坪坝由于学生客群庞大快餐、奶茶、小吃类目密度很高人均消费分位数明显低于解放碑和观音桥但点评活跃度并不差。这组对比让我意识到一个经常被忽视的道理商圈价值不取决于单一品类的强弱而取决于品类组合是否匹配周边客群结构。南坪的亲子业态强是因为辐射社区的家庭用户密度高沙坪坝的快餐供给强是因为学生流动客群在支撑。如果只拿餐饮或者人均消费去判断商圈会把它们统统归入“次级商圈”但实际上它们的商业生命力可能比某些空有客流但转化弱的商圈更健康。4.3 新区与社区商业照母山、礼嘉、中央公园的增量信号这次数据的另一个看点来自新区板块。照母山、礼嘉、中央公园一带是全品类数量增量比较明显的区域。照母山的餐饮门店数量增长快而且新店占比高咖啡馆、面包甜点这类“休闲餐饮”的密度甚至比部分传统商圈更高。礼嘉板块则是购物中心和社区底商并行发展亲子培训和运动健身类门店的覆盖率相当扎实。新区的问题也暴露得很清楚夜间经济和娱乐供给明显不足影院、KTV、足疗按摩这类“夜生活”业态的密度和传统商圈不在一个量级。这说明重庆的商业空间还在经历一个“白天消费先聚、夜间消费后补”的演进过程。对选址的人来说新区现在进场开夜间业态竞争压力小但要承担客流培养的时间成本。5. 品类维度餐饮、酒店、休闲娱乐的结构拆解与异常信号商圈视角看到的是空间分布品类视角看到的则是城市商业的骨架。把全品类数据按一级分类做汇总餐饮毫无悬念地占据绝对主力但真正有价值的信号藏在二级品类和均值中位数差异里。5.1 餐饮品类火锅和小面的“红海”与“内卷”检测先给一组直观数据感受下重庆餐饮的底色全品类有效样本里餐饮类占比超过四成其中火锅相关品类的占比在餐饮内部大约三成左右小面类商户在全城的分布密度也很惊人——几乎每个成熟社区500米范围内都能检索到至少一家小面店。这两个品类是重庆餐饮的基本盘但也是内卷最严重的领域。从人均消费结构来看火锅品类的平均值和中位数被高客单的精品火锅店拉得差距很大大量社区火锅店的人均消费集中在60-90元区间而头部网红店的客单价能到150元以上。小面品类的均值和中位数则非常接近说明这个品类价格高度刚性。另一个有趣的数据是火锅店的点评数和评分存在明显正相关但小面店的评分和点评数相关性很弱——很多高分小面店点评量只有几十条属于典型的“本地人私藏店”这种店不会成为游客打卡目标但运营状态非常稳定。5.2 酒店与休闲娱乐游客流量的真实映射酒店类数据的分布形态和重庆文旅热度的关系几乎是一一对应的。解放碑、洪崖洞、南滨路沿线是酒店类目绝对的高密度区且价差极大——从百元青旅到千元景观房都有供给。从2025年8月的数据看特色民宿和设计师酒店的新增占比明显高于传统经济型连锁说明重庆住宿供给正在从“量”往“质”的方向调整。休闲娱乐类目里电影院、KTV、足疗按摩、密室剧本杀是四个主要组成部分。密室剧本杀在观音桥和大学城附近有两条明显的聚集带这和年轻客群分布高度重合。足疗按摩的分布则和商圈关系不大更多是沿着成熟住宅区和酒店密集区铺开——游客住哪、按摩店就开在哪。这类业态的数据对判断“过夜客流”有很强的辅助作用这是只看餐饮数据得不到的视角。5.3 全品类中的品类生命周期信号把2025年8月的数据和重庆本地生活过去几年的公开趋势做对比有几个品类信号值得注意运动健身类目中普拉提、攀岩、射箭这类细分门类的数量在上行而传统健身房的比例在缩量。亲子品类里自然科学探索类的培训机构门店数量增长明显生活服务大类里宠物洗护和宠物寄养的门店密度持续走高。这些品类变化的共同指向是重庆市区的消费需求正在从“基本功能满足”转向“兴趣化和体验化”这和民宿、密室、精品咖啡馆的高增长放在一起看逻辑是自洽的。判断品类信号要小心单个品类的数量增加不等于市场空间变大。比如某类门店数量涨了30%如果点评数和人均消费没有同步上行更可能是供给过剩的开始。建议看数据时把“门店数量增速”和“平均点评活跃度”放一起看两个指标同向向上才是比较健康的扩张信号。6. 2025年8月的时间切片暑期消费与极端天气的双重作用这次项目的标题精准对应了2025年8月这个时间切片这也是这轮数据最有趣的地方——它是一个典型的“暑期高温”双重叠加样本。6.1 夜经济数据高温天气下的活跃时段迁移8月的重庆天气极热日间出行的意愿大幅下降但夜间的活跃度明显提升。从商户的评论时间分布来看火锅、烧烤、大排档、酒吧、KTV、夜宵类商户的点评高峰集中出现在21点到次日凌晨1点夜间时段的点评占比明显高于春秋两季的常规水平。数据里有一个细节特别直观营业时间字段里标明“营业至凌晨2点”和“营业至凌晨4点”的餐饮门店数量占比比非暑期时段高出一截。这说明很多商户在8月主动调整了经营时长来承接夜间客流。夜经济的活跃也体现在休闲娱乐类目上。解放碑、九街、南滨路沿线的酒吧和Livehouse门店点评量在8月达到一个小高潮九街这一带的数据表现尤其突出。当地的朋友告诉我这种夜间的活跃不只是天气原因——暑期本来就是学生和年轻游客最密集的时候多种因素叠加之下夜间消费自然成了主力时段。6.2 暑期“亲子避暑”品类脉冲如果只看品类数量的绝对占比亲子类目在全品类里算不上大头但2025年8月的亲子数据有明显脉冲特征。水上乐园、游泳馆、儿童科学馆这类季节性非常强的细分品类点评活跃度在8月大幅上升。与此同时重庆周边的避暑属性农家乐和景区民宿也贡献了大量的商户活跃度远郊区县在这一个月里获得的点评增量占比明显超过其商户数量占比。这类脉冲式数据如果不放在时间维度里看很容易被当作“有前景”的商业信号。但拆开看就能发现很多商户的旺季只有暑期这段到了秋天点评量会快速回落。对经营者和投资者来说识别“季节型品类”和“全年型品类”比单纯看数量增长重要得多。6.3 酒店价格带与游客评论的联动分析8月酒店类数据里还有一组值得记录的联动关系价格带在300-600元之间的中端酒店是点评增量和评分表现最稳定的区间而单价超过800元的酒店点评量波动很大好评和差评的分化也明显。这组数据说明重庆8月的游客结构中中端消费群体是绝对主力高端住宿的体验预期管理难度更大口碑波动自然更剧烈。7. 踩过的坑与沉淀下来的执行清单最后这部分写给想复刻这个项目的人。数据采集和分析本身不复杂真正复杂的是各种“意外”消耗的时间。我踩过的大坑主要有这几个按影响程度排序网格漏点初期网格设定过大导致两个商圈交界地带的商户被遗漏。后来把网格缩小至边长为0.5公里左右重新扫了一遍数据完整性才有明显改善。坐标偏移引发的商圈错判这个前面说过GCJ-02坐标如果不转直接把点位叠到商圈边界层上会出现大量点位“掉”在商圈之外。我先做了转换再重新匹配数据分布才恢复正常。翻页深度限制列表页翻到一定页数之后内容不再新增靠翻页拿全量数据是会瘸腿的。网格切分配合关键词扫描要比单纯翻页可靠得多。字段覆盖不均部分新开业商户的评价数、人均消费字段为空直接用平均值会拉低整体判断。我采用了“按商圈按品类按星级”多维插补的思路来填充空缺值分析时才没被拖偏。给我自己沉淀下来、也推荐给你的一套执行清单是这样的先做品类映射表再动手抓数据分类ID对应错误后面全乱。坐标系转换要作为标准化步骤写进清洗脚本不要事后再补。商圈归属判断尽量用中心点半径的缓冲方式不要用行政区边界因为重庆的商圈边界和行政区边界错位明显。每一次抓取都保留原始JSON存档改清洗规则时不用重新抓一遍数据——这能省下大量时间。做时间切片分析时一定要留出上一期或者去年同期数据做对照孤立的月度数据很难说明任何“变化”。这轮重庆全品类数据项目做完我自己在本地生活服务数据这件事上的方法论基本成型了。大众点评这个平台的价值在于它的品类分类和用户评价体系足够丰富配合全品类视角完全能看出一个城市商业结构的长周期变化。下一步我计划按季度更新数据重点追踪新区商业的成熟速度和传统商圈品类的迭代方向。做数据项目最大的乐趣就在这里——数据本身是沉默的但你把它洗干净、摆对位置之后它能把一座城市正在发生的变化讲给你听。