文书查 · 案件大数据

基于 近 1.6 亿+ 全量裁判文书的案由/地域/年份/法院四维实时聚合统计 · 可按地域/案由钻取。← 平台首页→ 去类案检索

数据范围与口径说明

样本范围:本大数据分布基于全量公开裁判文书库(约 近 1.6 亿+ 篇),支持 案由/地域/年份/法院 四维实时聚合统计,不再限定于某几个年份;类案检索同样覆盖全量库(近 1.6 亿篇)。

统计口径:各维度取自文书结构化字段——年份为裁判(判决)年份、地域为审理法院所在省份、案由法院按文书登记口径归类; 同一案件以一篇生效文书计,占比分母为对应筛选下的样本总数。

使用提示:数据来源于公开裁判文书,受文书上网范围与公开比例影响, 统计结果反映已公开样本的分布,不等于全部实际案件;仅供研究与参考,不构成法律意见。

案由写法:请照抄入库案由原值(如 民间借贷纠纷 / 劳动争议);剥掉后缀的词干写法(民间借贷 / 劳动)在本页取不到任何数 —— 2026-08-09 实测 6 个词干 × 4 维 24 格全空,补成全称后同样 24 格全部有数。注意这与类案检索相反:/cases 的案由要送词干。可用值可照抄 GET /api/analytics?dim=cause 的 items[].key。

案由分布 · 暂无数据(统计表生成中或无匹配)

常见问题

案件大数据的样本范围和时间覆盖是多少?

本页分布统计基于全量公开裁判文书库(近 1.6 亿篇),支持案由、地域、年份、法院四维实时聚合统计,时间覆盖不再限定于某几个年份,库内各裁判年份均可统计;类案检索同样覆盖全量库(近 1.6 亿篇)。

支持从哪些维度看案件分布?

支持案由、地域、年份趋势、法院四个维度的分布统计,可叠加省份与案由复合筛选;任意分布项均可点击下钻到对应条件下的类案检索。

占比和统计口径是怎么算的?

各维度取自文书结构化字段——年份为裁判(判决)年份、地域为审理法院所在省份、案由与法院按文书登记口径归类;同一案件以一篇生效文书计,占比分母为对应筛选下的样本总数。

为什么有些维度各项占比之和不到 100%?

分布明细只列出该维度下数量最多的若干项(Top-N 排行),而占比分母固定取样本总数,因此「各项占比之和」等于所列项覆盖样本的比例,通常小于 100%,属正常口径而非计算错误。各维度覆盖度不同:年份、地域较高,案由、法院偏低——例如案由维度所列项合计约占样本四成,其余为未列入排行的长尾案由与该字段缺失或取值非规范的条目。页面顶部会按当前维度实时显示实际覆盖率与缺口构成,导出文件也会带上同一口径说明。

叠加案由筛选后,为什么各项占比之和会超过 100%?

因为上游按案由筛选时用的是词/子串匹配而非精确案由匹配,聚合结果里会混进同一族的其他案由(例如筛「物业服务合同纠纷」实际按「物业服务合同」匹配,电信、医疗、餐饮、旅店、娱乐等服务合同纠纷会被一并计入),各项计数被撑大,而占比分母仍取该案由的精确样本总数,于是各项占比之和超过 100%。这不是计算错误,也不是重复计数,而是筛选口径不够精确。页面会按当前维度实时算出实际偏差并在分布上方明示(同一案由不同维度偏差不同,故逐维分别标注);偏差大到不能作为该案由分布使用时,本站会主动隐去分布数字而不是给出错的统计。此时同屏的「样本 N 件」取自精确案由桶,不受该偏差影响,可直接引用。

大数据统计能等同于全部实际案件吗?

不能。数据来源于公开裁判文书,受文书上网范围与公开比例影响,统计结果反映已公开样本的分布,不等于全部实际案件;仅供研究与参考,不构成法律意见。

数据来源:公开裁判文书全量库实时聚合 · 仅供参考研究 · 文书查 · 深圳星谱网络科技有限公司