分配研究 · 01 贫富差距与基尼系数 全库约 26 分钟

Orientation · 先定义问题

一个数,压缩一条分配曲线

第 1 章 / 共 3 章

讨论差距之前,先把收入、人口和时间放进同一个统计边界。没有边界,数字精确也可能答非所问。

3
资源种类、观察单位、时间范围:同一句“差距”背后的三组统计边界

工资、家庭收入与资产存量描述的是不同分配;个人、家庭和家庭成员也是不同观察单位。

“贫富差距扩大了”听起来像一个完整判断,实际却可能指向工资、家庭全部收入、税后可用资源或资产净值。它们能够同时朝不同方向变化。把这些分布都收进一个词里,就像把体温、血压和心率合成“健康数字”:方便概括,却不足以说明究竟发生了什么。

严谨表达需要补齐一个句子:“在某段时间内,以某种单位观察,某类资源的分配发生了怎样的变化。”例如,“2023—2024 年间,按家庭规模调整后的人均可支配收入分布更集中于高收入组”,就比“贫富差距变大了”多给出了时间、单位、资源和方向。这里的可支配收入,是市场收入加现金转移,再扣除所得税和社会缴款后可用于消费或储蓄的收入;市场收入则是家庭成员通过劳动、经营和资本在税收与现金转移之前取得的收入。只有这些要素固定后,不同时点或地区的数字才可能放在一起。

为了让后面的推导能够手算,全文使用五户虚拟家庭:它们的年可支配收入依次为 2、4、6、8、20 个单位。同一组数字一旦改变收入定义、家庭规模或统计权重,就会回答不同的问题。

这组虚拟数据将在三页中反复出现。五户合计收入为 40,平均每户为 8;最高收入家庭取得一半总收入。它不是任何真实地区的缩影,也不用于暗示合理阈值。选择小样本,是为了让每一步都能手算,让读者看见统计量如何从家庭记录逐步变成结论。

还要警惕“单位相同就可以比较”的错觉。两个数字都写成元,不代表它们衡量的是同一资源:工资可能不含经营和资本收入,税前总收入没有扣除税费,家庭总收入也没有考虑成员人数。单位只是数字外壳,统计定义才决定数字的含义。

第一道分岔:收入流量,还是资产存量

市场收入更接近市场过程产生的初次分配结果。前面已经定义的可支配收入,则在市场收入基础上加入现金转移、扣除所得税和社会缴款,更接近家庭当期可以消费或储蓄的资源。比较两者,能够观察税收与转移制度怎样改变分布;混用两者,制度作用就会被错误地归给市场。

收入是“一段时间里流进来的资源”。财富则是“某个时点拥有的净存量”,通常等于住房、金融资产、企业权益等资产减去负债。一个刚进入高薪职业的年轻人可能收入高而净财富低;一位退休者可能当期收入普通,却拥有已还清贷款的住房和储蓄。收入不平等与财富不平等相关,但绝非同一个对象。

这一区分也解释了为什么标题里的“贫富”不能直接等同于收入。若研究机会、抵御风险或代际传递,财富往往不可缺少;若研究当前消费能力和税收转移,家庭可支配收入通常更合适;若研究劳动市场回报,工资或个人劳动收入更贴近问题。指标不是越全面越好,而是必须与问题匹配。

税前与税后不是两个版本的同一数字

假设五户的市场收入原本是 1、3、6、9、25,经过税收和现金转移后成为 2、4、6、8、20。后一个分布更均衡,但这并不表示工资结构发生了变化,而是公共政策改变了家庭最终可用资源。如果只看到税后结果,就无法判断差距来自市场还是被制度缓冲;如果只看税前结果,也无法描述家庭真实可支配能力。

实物公共服务又带来另一层边界。免费教育、医疗或住房服务能改善生活水平,但并不总被计入现金可支配收入。不同数据库对实物转移的处理并不完全一致。因此,“税后收入”不一定包含所有公共服务价值,指标名称也无法替代数据说明。

资本利得也需要单独确认。住房或股票价格上涨会提高账面财富,却不一定作为当期收入进入住户调查;出售资产实现的利得,在不同统计体系中处理也可能不同。研究者若把资产价格周期与经常性收入混为一谈,就会把存量重估误读为家庭每年持续获得的资源。

第二道分岔:比较个人,还是比较家庭生活水平

收入记录可能来自个人,但生活常在家庭内部共享。一个没有个人劳动收入的孩子,并不因此拥有零生活资源;一位收入较低、与高收入伴侣共同生活的成年人,其消费能力也不同于独居者。研究工资结构时,个人是自然单位;研究生活水平时,家庭资源及其成员人数通常更重要。

然而,简单用家庭总收入除以人数也不完美。两个人共同居住,并不需要两套厨房和两份供暖设备;成年人和儿童的消费需要也不完全一样。专业数据库常用“等值规模”调整家庭收入,再把调整后的水平赋给家庭成员。这个步骤回答的是共享和规模经济问题,不是统计上的小修饰。

同一组 2、4、6、8、20,如果代表五位独居者,可以直接排序;如果代表规模分别为 1、4、2、2、5 人的五户家庭,未经调整的家庭总收入会把大户和小户置于不公平的比较位置。更进一步,如果每户在总体中代表的人数不同,曲线上的横轴也不能机械地每户占 20%。下一页计算时先假定五户规模相同、权重相同,以隔离最基本的机制。

时间范围同样会改变答案

月收入容易受奖金、失业间隔和季节经营影响;年度收入能平滑一部分短期波动,却仍可能把暂时低收入者与长期贫困者放在一起。生命周期视角下,学生、初入职场者和退休者处于不同阶段。若研究长期机会,一年横截面只能提供有限证据;若研究当期政策冲击,过度平滑反而会掩盖变化。

价格变化也不能忽略。比较不同年份的实际生活水平,需要处理通货膨胀;比较不同地区,则可能需要考虑生活成本。但基尼系数作为相对分布指标,在所有收入按同一比例变化时通常不变。这使它适合观察相对差距,也意味着它不会主动告诉你每个人是变富还是变穷。

观察单位还包含伦理假设。把家庭收入平均分给成员,默认家庭内部充分共享;现实中,照护负担、议价能力与支出控制可能不对称。常用指标不得不做简化,但好的分析会说清楚简化在哪里,并在研究性别或儿童福祉时补充个人层面的资源指标。

第三道分岔:两端差额,还是整条分布

最高收入减最低收入只使用两个观察值,容易被极端值支配;最高与最低之比在最低值接近零时会剧烈变化。中位数与均值之比能提示分布偏斜,却仍无法展示中间各组怎样排列。要描述整个分布,需要一种同时使用所有排序位置的方法。

洛伦兹曲线先把人口按收入从低到高排列,再把“累计人口占比”放在横轴、“累计收入占比”放在纵轴。完全平等时,底部 20% 人口恰好取得 20% 收入,底部 60% 取得 60%,曲线就是一条 45 度直线。现实曲线通常位于这条线下方;弯得越深,表示更多收入集中在靠后的高收入群体。

基尼系数把完全平等线与实际曲线之间的面积,除以完全平等线下方整个三角形的面积。它因此使用了整条排序分布,而不只是最富和最穷。世界银行常把数值表达为 0 到 100,OECD 页面常用 0 到 1;40 和 0.40 在量纲一致时代表同一水平,而不是相差一百倍。

这里先抓住直觉:曲线越贴近平等线,面积越小,系数越接近 0;收入越集中,曲线越向右下方弯曲,系数越大。下一页会把五户收入转换成累计份额,逐段计算梯形面积,使 0.40 的来源完全透明。

“使用所有人”也不意味着“保留所有信息”。面积压缩会丢掉曲线的具体位置。好比两条不同形状的河道可能围出相同面积,两种收入分布也可能得到相同系数。因而,系数适合快速概括与追踪,却不能替代分位份额和原始分布图。

这个数字能说什么,不能说什么

基尼系数能回答的是:在既定口径下,收入在排序人口中的相对分布有多不均。它不能单独回答低收入者能否满足基本需要,不能说明高收入来自创新回报、垄断租金还是资产升值,也不能告诉我们差距集中在顶部、中部还是底部。两个社会可能拥有相同系数,却有完全不同的分布形状与生活水平。

相对不平等与绝对改善也可能同时发生。若每户收入都翻倍,五户从 2、4、6、8、20 变为 4、8、12、16、40,分布比例不变,系数也不变,但所有家庭的实际资源都增加了。反过来,若低收入家庭略有改善而总体收入下降,系数可能下降,却不必然意味着生活更好。因此,“更平等”不是“更富裕”的同义词。

同样,系数升降不是政策道德评分。一次经济转型可能同时提高底部收入、扩大顶部回报;一次严重衰退也可能因为高收入下降更快而让系数降低。负责任的分析必须把分配、收入水平、贫困与机会分开测量,再解释它们之间的关系。

还有一个常被忽略的比较对象:机会与结果。收入分布描述已经实现的结果;教育可及性、健康、地域与家庭背景则影响获得这些结果的机会。结果更平等不保证机会公平,结果有差异也不能证明机会公平。若讨论社会流动,必须加入跨代或长期跟踪数据。

这些区分不是为了把问题复杂化,而是为了避免不同分布在同一个词里彼此覆盖。收入概念确定资源,观察单位确定人口,时间范围确定变化尺度;三者共同组成后续测量的坐标系。

因此,贫富差距并不是一个天然唯一的数。收入概念、观察单位和时间范围共同确定了被测量的分布;基尼系数只有在这个分布已经明确之后才获得具体含义。下一章将固定这些条件,把五户家庭的收入一步步变成洛伦兹曲线和面积。