AI 进入政务服务后,PB 级原始政务数据要变成可用的高质量语料。深智城在 MOI 上建成省级政务语料治理平台,覆盖清洗、标注、质检、分类与合规审查的全流程。
深智城集团是国有科技企业,业务覆盖 160 多个城市,拥有 70 余家子公司、15 家高新技术企业认证与 4100 人的技术团队(37% 为硕博学历),是国内领先的智慧城市解决方案提供商,曾获全球智慧城市大奖。
AI 进入政务服务后,公共安全、城市规划、民生服务等场景都开始需要大模型能力,而这些应用最终都要落回同一个前提:有没有足够质量的语料可用。
深智城业务覆盖 160 多个城市,拥有 70 余家子公司与 4100 人的技术团队,长期承担智慧城市与数字政府建设,手上沉淀了 PB 级的原始政务数据。
这个体量在国内政务领域并不多见,但体量本身不等于可用。
PB 级原始政务数据并不能直接喂给模型。数据分散在不同部门与业务系统,格式各异、质量参差,还带有大量不能对外的敏感信息。
政务数据的特殊之处在于合规不是可选项:哪些字段可以进入训练语料、哪些必须脱敏、哪些完全不能出库,都要有明确依据并可审计。这一层判断无法在模型训练阶段补做,必须前置到语料生产环节。
更棘手的是,每个政务 AI 应用都在各自重复做清洗、标注与合规审查。同一批数据被反复加工,既浪费算力也无法保证口径一致——两个应用对同一份数据的理解可能就不一样。
语料生产始终停留在项目制的一次性交付,项目结束,能力也就结束了,没有沉淀为可持续运行的基础设施。
深智城在 MOI 上建成政务语料治理平台,覆盖从原始数据接入到 AI-Ready 数据集交付的全生命周期:清洗去噪、语料标注、质量检验、分类入库、合规审查逐环节在同一平台内完成。
整条流水线在一个平台内闭环,这一点并非工程偏好——语料在多个工具之间搬运时,血缘与质检记录最容易丢失,而政务语料恰恰最需要这两样东西可查。
语料按 15 个行业门类、11 个主题分类与 12 类应用场景三个维度组织。三维交叉的意义在于,同一份语料可以被不同角度的需求找到:按行业找的人和按场景找的人,检索的是同一个库。
AI 开发者由此可以按需检索到结构化、可发现、已通过合规审查的语料,而不必自己从原始库里捞——合规审查在入库时已经完成,不必每个应用重做一遍。
该平台是广东省内首个政务领域语料治理平台,确立了公共部门数据转化为 AI 资产的标准路径。
政务数据按 15 行业 × 11 主题 × 12 场景完成组织,检索的入口与政务 AI 应用的实际需求形态对齐。
清洗、标注、质检与合规审查只做一次,所有下游应用共享同一份结果,重复加工带来的算力浪费与口径分歧同时消失。
语料生产从项目制的一次性加工,变成了可持续运行的基础设施——这是政务 AI 能够规模化的前提条件。