来源只认三类公开材料
录入队列只接受三类材料:公开赛事公报、联赛公开技术统计页、公开转播技术统计。三类之外的材料——包括二次转载的汇总表和无法回指原文的截图——一律不进入队列,即使数字看起来完全一致。
三类来源之间不是互相印证的关系,而是各管一段字段。公报负责最终比分与出场名单,技术统计页负责跑动与传球数据,转播技术统计补充时段切分。同一场比赛的同一字段只由一类来源供给,避免出现两个口径互相打架的情况。
悬停或聚焦节点可查看该阶段的记录口径,方向键可在节点之间移动。
流程文档 · 五个环节组
贝博体育自 2024 赛季起按阶段整理两队战报对比,站内每一个数字都要能回指到一次具体采集和一次具体复算。这份文档把公开来源采集、录入口径统一、场次编号生成、交叉复算与纠错更新的全部工序摊开写清楚,供引用之前逐项对照。
这一段解决的是“数字从哪来”。三类公开来源各有分工,采集按赛季阶段切批,字段口径在动手抄数之前就要落定。
录入队列只接受三类材料:公开赛事公报、联赛公开技术统计页、公开转播技术统计。三类之外的材料——包括二次转载的汇总表和无法回指原文的截图——一律不进入队列,即使数字看起来完全一致。
三类来源之间不是互相印证的关系,而是各管一段字段。公报负责最终比分与出场名单,技术统计页负责跑动与传球数据,转播技术统计补充时段切分。同一场比赛的同一字段只由一类来源供给,避免出现两个口径互相打架的情况。
采集不按自然月推进,而是按赛季阶段切批。一个批次对应一个完整阶段,批次之间的编号区间不重叠,也不允许引用尚未收口的阶段数据。当前进度已推到 2025 赛季中段。
阶段边界与轮次区间必须严丝合缝。如果某一阶段的轮次划分在来源材料里本身就有歧义,采集会暂停并转入口径复核,而不是先录后改。
每个字段在采集前先写好统计区间。进失球分布固定以 15 分钟为区间,每场剖成 6 段,采集阶段不允许为了凑拢某一场比赛而临时改动分段。
口径卡是这一节的产出物。卡上写明字段名、统计区间、来源类型与适用范围;同一字段在两个赛季阶段的口径卡保持一致,除非口径变更走完整复核。
这一段管的是“怎么落笔”。字段顺序、单位、缺项与异常值都有固定走法,录入人自己不先过一遍就不往下一道工序交。
录入界面里的字段顺序固定不变:场次编号、对阵、比分、区间分布、定位球路径、出场时间。没有正当理由不调整顺序,因为顺序一变,后续的比对脚本就会读错列。
单位同理。分钟保留整数,百分比保留一位小数,时间区间一律用左闭右开的分钟区间表示。这几条看上去琐碎,但跨赛季对比时,单位不一致比数字写错更难被发现。
来源材料没给出的字段会留空并打上标记,交给编号校验组处理。任何情况下都不允许用相邻场次的数值推算补位,也不允许用同阶段的均值代替。
异常值指超出合理范围的录入结果,例如单场出场时间超过比赛总时长。异常值不直接删除,而是冻结该场编号,等复核结论出来再决定是修正还是标注为口径差异。
交批之前,录入人要做三项自查:字段是否齐全、单位是否对齐、本批次编号是否连续。这三项由录入人自己完成,不占用复核工序的额度。
自查结果写在批次的备注栏里,随批次一起流转到编号校验组。备注栏为空视为未自查,批次会被整包退回,而不是补一句说明继续往下走。
这一段说明“凭什么能查到那一场”。编号本身就是一条检索路径,读得懂编号,就不需要再翻对照表。
场次编号由三段拼成:赛季代码、轮次、场次序号。三段之间用短横分隔,长度固定,段内不足位补零。这样编号本身就带出了它属于哪个阶段、哪一轮,不必再查外部对照表。
编号一旦生成就不复用。同一场比赛如果因为口径修正需要重新录入,编号保持不变,只递增修改记录序号,历史版本仍可调出。
编号校验组要确认三件事:编号是否唯一、三段是否与阶段批次号一致、本批次编号是否连续。三项中任何一项不通过,批次整包退回,不做局部修改。
去重按对阵与轮次的组合判断。同一轮次出现两个编号指向同一场比赛属于严重错误,会触发对该赛季阶段的追加抽查,而不只是删掉多余的那一条。
这一段回答“凭什么能用”。四道工序分属四个职能组,抽查不放过同批次的同类字段,差异判定只写字段与编号,不写个人意见。
四道工序按顺序走:录入口径、编号校对、图表复算、交叉抽查。前一道没有通过之前,后一道不启动。这个顺序不能并行,因为并行会让差异归属变得说不清楚。
四道工序分属四个职能组,不由同一个人跨两道。全站目前共 26 名成员分布在赛果录入、编号校验、图表制版、口径复核四个组里,复核意见只署职能组名。
交叉抽查的比例是每 10 场抽 2 场,也就是 20%。抽取方式为按场次编号排序后等距取点,由非录入人复算。抽查重点是区间分布与定位球路径两个字段,因为它们涉及的中间步骤最多。
抽查发现偏差时,不单独修正被抽中的那两场,而是回溯到同批次的同类字段全面重算。这条看起来代价偏高,但能把系统性的口径错误一次性排掉,比逐场打补丁更省事。
图表复算把录入数据重新跑一遍制版脚本,比对出图结果与上一版是否一致。差异分两类处理:数值差异走修正流程,视觉差异走制版说明,两者不混在一起处理。
差异判定要写明分歧点和判定依据,结论进入更新记录。记录只写字段名、场次编号与所采用的来源类型,不写个人判断措辞,方便后来人按同样的字段重新核对。
这一段讲“出了变化怎么办”。更新有固定窗口,纠错有固定入口,记录一律按赛季阶段组织,不写具体日期。
每轮比赛结束后 48 小时内完成录入与编号校验,图表复算与抽查在随后一个窗口内跟进。这个窗口是固定值,遇到来源发布延迟时顺延,顺延情况会记在批次备注里。
更新完成后,内容会同步到四种终端形态:桌面终端版、网页速览版、移动随行版、离线数据包。四种形态读取同一份编号数据,差别只在呈现密度与检索方式,具体能力边界见 客户端说明。
纠错入口是客服邮箱。提交时请附上场次编号与联赛阶段,便于直接定位到对应记录。口径上的分歧可以提交到 讨论专区,处理时限与更新窗口一致,都是每轮结束后的 48 小时。
更新记录按赛季阶段组织,每条记录包含工序编号、涉及的场次编号区间、变更字段与判定依据。时间线索统一使用赛季阶段与工序编号表达,不写具体日期,方便跨版本对照。
这份文档不承诺数字永远不变,只承诺每条记录都能回到一个来源和一道工序。
来源限定在公开赛事公报、联赛公开技术统计页与公开转播技术统计三类,三类之外的材料不进录入队列,同一字段只由一类来源供给。
场次编号由赛季代码、轮次与场次序号三段构成,编号生成后不复用,1,240 场记录均按这套规则编制,可逐场溯源。
四道复核工序顺序执行、分属四个职能组,交叉抽查按每 10 场抽 2 场执行,发现偏差时回溯同批次同类字段重算。
更新窗口为赛后 48 小时,更新记录按赛季阶段与工序编号组织,纠错以场次编号和联赛阶段作为检索入口。