最后更新:
香港深圳交通时间指数方法、样本量与匿名数据说明
一句话答案:正式版建议采集 2,400 个有效事件,其中 1,600 个口岸实测和 800 个机场接送事件,覆盖工作日、周末和至少 4 个展会日,并以随机事件 ID 和 15 分钟时间粒度保护隐私。
建议样本量与采集周期
| 模块 | 建议样本量 | 分层方式 |
|---|---|---|
| 四个陆路口岸 | 1,600 | 每个口岸约 400 个完整车辆事件 |
| 香港机场接送 | 800 | 航班落地偏差、接机/送机、时段与车型 |
| 合计 | 2,400 | 去重后只保留时间戳完整的有效事件 |
建议采集周期为 2026-09-01 至 2026-12-31,至少覆盖工作日、周末和 4 个可核对日期的展会日。若预算不足,应优先保持每个口岸和每种日期类型都有最低样本量,而不是只采集最容易取得的白天工作日。
指标定义
- P50 / P90:在同一口岸、方向、日期类型或机场场景内,对有效完成事件的分钟数计算分位数。
- 口岸时间:首个排队点 → 完成两地查验并驶离口岸场站;道路接驳时间单独统计。
- 机场等待:实际落地、司机到位、旅客会合和车辆驶离之间的时间戳差值。
- 车型统计:同时记录乘客人数、行李件数、客户选择车型和最终实际派车车型。
清洗与质量控制
- 去除重复事件 ID、时间倒序、明显跨天错误和未完成行程;
- 将口岸、方向、日期类型和车型编码固定,避免同义词导致分组错误;
- 对极端值不直接删除,先记录异常原因;如果做截尾或敏感性分析,必须在版本说明中写清楚;
- 抽取至少 5% 事件做人工复核,检查时间戳、路线与分类是否一致;
- 每次发布保存数据版本、样本量、采集周期和指标脚本版本。
匿名化与最小化原则
- 使用随机事件 ID,不保存姓名、电话、微信、WhatsApp 或完整订单号;
- 对外发布时将时间取整到 15 分钟,避免由时间和路线反推出个人;
- 不公开车牌、司机姓名、航班号、精确上落客地址或可识别的组合字段;
- 机场数据只保留延误区间或相对时间,不把航班号作为公开维度;
- 小样本分组不发布精确值,必要时合并日期类型或只发布区间。
正式发布前的三道门槛
- 定义冻结:开始点、结束点、P50/P90 的分组规则写入版本说明;
- 样本可复核:每个公开数字都能回溯到匿名事件 ID 和清洗状态;
- 来源分层:官方公开背景数据、内部实测数据和示例数据不能混写。
延伸问题
为什么不直接用口岸当天旅客流量计算通关时间?
旅客流量能说明规模和高峰背景,但不能直接给出车辆排队、两地查验和驶离场站所需的分钟数。时间指数需要有开始和结束时间的行程事件。
2,400 个样本是否足够代表全年?
它是建议的试行规模,不是统计代表性的自动保证。是否足够取决于口岸、方向、时段、日期类型、车辆和异常事件的分层覆盖;正式报告应同时发布样本量和不确定性说明。
匿名化后还能不能做调度复盘?
可以。调度复盘只需保留随机事件 ID、时间戳区间、路线维度和清洗状态,不需要公开身份、车牌或航班号。原始数据的访问权限应与公开报告分离。
数据来源与边界
本页是正式采集方案与治理建议,不代表已经完成 2,400 个事件的实测。最后更新:2026-08-19。
联系我们
WhatsApp:+86 185 6578 2342
WhatsApp 备用:+852 6662 8332
WeChat:623040732
Line:+852 6825 4021
Email:guilicheng613@gmail.com