很多真实数据的首位数不是平均分布的:1 占 30.1%,9 只占 4.6%。 人编数字的时候会把首位摊得比较匀,或者堆在 5、6 上 —— 这就露出来了。
但这是一条有前提的定律,而前提经常被扔掉。 所以这一页先查前提,再谈符不符合 —— 「这批数据本来就不该拿本福特来查」是它能给出的最有用的答案, 也是那些直接上卡方的工具永远给不出的。
把文件拖到这儿也行 —— 文件不会上传,在浏览器里读完就没了
它不知道的事
符合不等于真实。 一个知道这条定律的人可以按它造数, 而且工具是公开的。首位数分布只是众多形状里的一个 —— 它能被伪造,也就不能当成清白的证据。
不符合也不等于造假。 先去找有没有下限、上限、凑整、 定价习惯(比如都以 .99 结尾)、或者一个审批额度在塑形。 本福特只告诉你「这堆数的形状不像自然产生的」,从来不告诉你为什么。
判据用的是 MAD,不是卡方的 p 值。卡方随样本量涨 —— 一万行诚实的数据几乎必然「不显著」不了,三百行造假的又轻松过关。 MAD 不随样本量动,这正是取证实务里换掉它的原因。卡方照样报出来, 但只作参考。
贴进来或拖进来的东西只在这个页面里,不上传、不存储。没有服务器。