洛伦兹曲线把一组杂乱的收入记录改写成累计人口与累计收入之间的关系,基尼系数再把这条曲线压缩为一个面积比例。为了看清这一过程,先固定上一章讨论的统计边界:五户家庭规模相同、样本权重相同,资源是同一年度的家庭可支配收入,而且所有收入均为正。
把五户虚拟家庭按收入 2、4、6、8、20 从低到高排列,累计收入份额依次为 5%、15%、30%、50%、100%。这些节点构成一条经验洛伦兹曲线,梯形面积最终给出 0.40。
先验证基本量:收入合计为 40,均值为 8。最底部家庭收入 2,占总收入 5%;加上第二户的 4,底部两户累计为 6,占 15%。继续累加即可得到曲线上的五个非零节点。每个节点都同时回答“有多少人口”和“他们合计拿到多少收入”。
这一步看似只是算百分比,却完成了重要转换:原始收入的绝对单位被换成总体份额。无论原表用元、万元还是其他货币,只要每个观察值使用同一单位,份额都不变。也正因为如此,后面的结果描述的是相对分配,而不是收入购买力。
另一种常见公式从任意两人的收入差出发,汇总所有成对差额后再按平均收入与人口数标准化。它与洛伦兹面积法在通常条件下得到同一结果。面积法更适合建立直觉,成对差额法则提醒我们:系数本质上把人群之间的相对差异汇总起来。
第一步:从家庭记录变成累计份额
| 家庭 | 收入 | 人口累计 | 收入累计 |
|---|---|---|---|
| A | 2 | 20% | 5% |
| B | 4 | 40% | 15% |
| C | 6 | 60% | 30% |
| D | 8 | 80% | 50% |
| E | 20 | 100% | 100% |
排序是关键。洛伦兹曲线不关心 A 或 E 的姓名、职业与地区,只要求把收入从低到高排好。累计收入份额必须单调上升,起点是 (0, 0),终点是 (1, 1)。若底部 80% 家庭累计只取得 50% 收入,就意味着最后 20% 取得另外 50%。
家庭规模不同时,研究生活水平通常会先计算等值化收入:用等值规模调整家庭可支配收入,再按调整后的收入排序家庭成员。OECD 常用家庭人数平方根作为等值规模,即家庭收入除以家庭人数的平方根。它不是唯一方法,但能明确体现共同生活带来的规模经济。
真实样本中的每条记录也未必代表同样多的人。调查权重表示某个样本家庭在总体中代表多少人或多少户。权重较大的记录会让累计人口横轴前进更多。忽略权重,相当于把抽样设计改成“每条记录同等代表总体”,所得曲线可能与官方统计不同。
排序相同并不表示每一段横轴等宽。若 A 户代表总体的 8%,B 户代表 17%,那么前两个节点就在 8% 和 25%,而不是 20% 和 40%。收入累计也要乘以对应权重。大型调查通常由统计软件处理,而家庭权重、个人权重和经过非应答校正的权重仍具有不同统计含义。
若出现相同收入,彼此先后次序不会改变最终曲线;若出现负收入,处理则更棘手。经营亏损可能让累计收入份额短暂下降,使传统几何直觉失效。不同机构可能保留、截断或调整负值,所以包含大量自雇与经营收入时,元数据尤其重要。
第二步:把累计点连成曲线
完全平等线下方的大三角形面积为 1/2。案例曲线下方的面积,可以把相邻两个累计收入份额的平均值乘以横轴宽度,再逐段相加。因为五户权重相同,每段宽度都是 0.2。五个梯形面积依次是 0.005、0.020、0.045、0.080 和 0.150,总和为 0.300。
公式中的 X 是累计人口份额,Y 是累计收入份额。求和部分等于曲线下方面积的两倍,所以用 1 减去它就得到系数。也可以说,平等线与曲线之间的面积为 0.5 − 0.3 = 0.2,再除以总三角形的 0.5,结果仍是 0.4。
数据若采用 0 到 100 的尺度,0.40 就写成 40,二者没有信息差异。世界银行页面上的 40 与 OECD 页面上的 0.40 可能描述同一水平;尺度不同不能被解释为一百倍的差异。
经验曲线有三个数学边界:累计人口和累计收入都从 0 走到 1;正收入排序下,累计收入不会下降;曲线下方面积位于 0 与 0.5 之间。超出这些边界通常意味着排序、权重归一化或百分数尺度出现错误。
小样本曲线实际上是折线,不是光滑曲线。把节点连线等于假定每个相邻累计点之间线性变化,梯形法由此精确计算该经验折线的面积。展示图可以平滑以便阅读,但计算不应因视觉平滑而改变。
第三步:理解不变的东西
尺度不变性指所有收入按同一正比例变化时,系数保持不变。五户收入全部翻倍为 4、8、12、16、40,累计份额仍是 5%、15%、30%、50%、100%,所以结果仍为 0.40。这是相对不平等指标的长处,也是它不能描述绝对生活水平的原因。
匿名性指只要收入列表不变,收入由哪个具体身份的人持有并不改变系数。若 A 与 E 互换姓名,排序后的分布完全相同。这个性质让指标聚焦分配结构,却也主动舍弃了性别、地区、族群、年龄和阶层来源等信息。若研究群体不平等,必须另行分组分析。
人口复制通常也不改变结果:把这五户各复制一次,形成十户但保持比例,洛伦兹曲线仍相同。与此相对,任何一笔从较富家庭转给较穷家庭、又不颠倒两者排序的小额转移,通常会把曲线推近平等线并降低系数。这种对“从富到穷转移”的反应,是它作为不平等度量的重要基础。
如果每户都增加同样的绝对金额,结果却通常会下降。五户各加 2 后变成 4、6、8、10、22,低收入户的增幅比例更大,累计份额向平等线靠近。这与“每户都乘以 2”形成鲜明对比:相同绝对增量会改变相对结构,相同比例增量不会。
但系数不具备简单可加性。全国结果不能只用各地区系数取平均得到,因为总体不平等同时包含地区内部差异和地区之间的收入水平差异。世界银行的元数据也明确提醒:基尼系数不能自然地分解为组内和组间成分。需要可分解分析时,应选择适合该任务的熵类指标或专门分解方法。
这些性质解释了指标的设计取舍。匿名性帮助比较纯粹的分布,却看不见身份;尺度不变性帮助跨货币单位比较,却看不见共同变富;转移敏感性能够响应再分配,却不解释转移是否自愿、可持续或影响效率。任何统计指标都在保留某些信息的同时舍弃另一些信息。
公式之外:四类现实测量误差
一、同值不等形
一个系数对应的曲线并不唯一。某个社会可能主要是底部与中部拉开,另一个社会可能主要是顶部远离其余人群,两者面积恰好相同。数字相同并不意味着贫困程度、顶端集中或中产规模相同。只有查看分位份额或完整曲线,才能定位差距发生在哪里。
甚至两条曲线可能交叉:一个分布让最底部人群份额更高,却让中间人群份额更低。此时不能说其中一条曲线在所有位置都更平等,单个面积仍会给出排序,但排序掩盖了不同社会对底部和中部的不同取舍。把曲线与系数并列,是避免过度压缩的简单办法。
二、调查对顶部和底部的捕捉不同
高收入家庭可能更难抽中、拒访率更高,资本收入也更易漏报;低收入端可能出现零收入、负经营收入或不稳定记录。调查截尾、缺失值填补和行政税务资料校准都会影响尾部形状。两个机构即使都写“可支配收入基尼”,处理规则不同仍会产生差异。
样本误差意味着小幅变化未必具有统计意义。标准误或置信区间描述了这种不确定性;缺少这些信息时,末位小数的波动不能自动视为确定趋势。年度变化还可能来自一次性奖金、灾害或政策支付。
三、消费与收入讲述不同时间尺度
一些国家的家庭调查更可靠地记录消费,另一些则以收入为主。消费往往比当期收入平滑,因为家庭会储蓄或借贷;以消费计算的不平等常与收入不平等不同。世界银行跨国数据混合使用收入和消费型调查时,会标明基础概念,并提醒用户谨慎比较。
四、价格、家庭规模与人口覆盖范围
城市与农村价格差异、家庭等值尺度、集体居住人口是否纳入、调查覆盖的地理区域,都会改变分布。真正可比的序列通常来自同一调查体系和相近方法。长时间序列中的突然跳变,有时对应问卷、抽样框或定义变化,而非同等规模的经济变化。
没有一套调整能在所有研究问题中天然正确。全国统一价格适合描述名义资源,地区购买力调整更接近当地生活水平;家庭平方根尺度便于国际比较,针对儿童成本的尺度可能更适合家庭政策。方法选择应由研究问题驱动,并在结果旁明确呈现。
基尼系数精确概括了洛伦兹曲线与平等线之间的面积,却不会保留差距发生在底部、中部还是顶部的信息。抽样、家庭调整和收入定义又决定了曲线本身如何形成。于是,理解 0.40 的计算只是起点;现实中的同一个数,还需要放回完整分布和社会制度之中。
这也是从测量走向解释的分界:公式告诉我们差距的总体强度,分位份额、生活水平与制度背景则说明这种强度由谁承担、如何形成,以及它对不同家庭意味着什么。下一章将沿着这些被压缩的信息继续展开。