旧数据并非没有价值

历史数据可以显示长期变化、制度背景和测量方式,却不能自动代表当前状态。引用时写出年份,让读者知道数字处于哪段时期。若用于现况判断,应寻找更新资料或明确说明无法确认。

同名指标可能不同口径

失业率、覆盖率和完成率都依赖分母定义。机构可能因为政策、调查或系统升级改变统计范围。比较之前应阅读方法说明,确认定义是否连续;若不能连续,只能把两个时期分开描述。

抽样数据需要不确定范围

调查结果不是对总体的完整计数。样本设计、权重和未回应都会影响估计。只引用一个百分比会制造过度确定,应同时关注样本量、误差范围和调查对象。

二手图表要回到原始来源

社交媒体和报告摘要常把图表从原始上下文中截出。转引前应找到原报告,核对标题、脚注和时间。若无法找到,就不应把截图当作确定证据。

保存可复查的引用记录

记录来源名称、页面或文件标题、发布日期、访问日期和使用的具体表格。数据更新后仍保留当时版本,才能解释为什么旧报告与新页面数字不同。

区分行政记录与抽样调查

行政记录来自登记、申请或交易流程,通常覆盖已进入系统的人,却可能遗漏没有接触服务的群体。抽样调查试图推估总体,但结果依赖抽样框、回应率和权重。两者即使使用相同指标名称,也不能直接拼接。

行政数量上升可能代表真实增加,也可能是登记更完整;调查比例变化则可能来自问卷或抽样调整。来源类型决定结论能够走多远。

修订值与初值要保留发布日期

经济、人口和公共服务数据常先发布初值,之后随着资料补齐而修订。只写统计年份,无法解释为什么两份报告引用同一年却数字不同。记录发布版本和取得日期,才能还原当时可见的信息。

更新文章时,不应悄悄用新值覆盖旧论述。可以说明修订幅度和结论是否改变;即使变化不影响主要判断,也应让读者知道数字已经更新。

跨地区比较要检查可比单位

城市边界、年龄分组、价格水平和服务定义都会影响地区排名。总量大的地区往往人口也多,按人口计算又可能放大小地区的偶然波动。比较前应根据问题选择总量、人均值或标准化指标,并展示必要分母。

当定义无法统一时,最稳妥的方法是分别描述,不强行制作排行榜。缺乏可比性本身就是重要结论。

引用链越长,语义越容易丢失

新闻引用报告,报告引用数据库,社交平台再截取新闻图表,每一层都可能删掉条件。编辑时应尽量回到最接近原始生产者的页面,并核对表名、脚注和下载文件。

找不到原始来源时,可以把材料当作线索,但不能用确定语气写入核心结论。保留检索路径也有价值,它让后续编辑知道哪些环节仍待确认。

公开不等于没有使用限制

公开页面仍可能规定授权、署名、再发布和商业使用条件。下载前应阅读许可,引用时保留机构名称与数据集标题。涉及个人或小区域资料,还要评估重新识别风险。

只因为技术上能够抓取,不代表适合批量复制。优先使用官方接口和下载文件,控制请求频率,并保存必要字段而非整个站点。

建立一份最小引用卡片

每个核心数字可以附一张引用卡片,记录指标名称、生产机构、统计时期、发布时间、分子、分母、单位、地理范围和许可。卡片不必全部展示在正文,却应让编辑能够快速复核。

当来源更新时,先比较卡片字段,再决定是否改文。若只是页面布局改变而数据未变,不需要制造新鲜日期;若口径变化,则应单独解释,不能把新旧序列无缝连接。

机器可读文件也需要人工阅读说明

CSV和API方便处理,却常把关键定义放在另一份方法文件中。只下载数值而忽略代码表、缺失标记和修订说明,容易把特殊值当成真实观察。自动管线应把元数据文件视为输入的一部分。

在第一次使用新数据集时,人工阅读方法说明仍不可省略。自动化可以持续检查格式和更新时间,但不能替代对统计对象与采集方式的理解。