政务科技 / 数据治理深智城集团2026-08-22

深智城政务语料治理:15 行业 × 12 场景的省级语料平台

AI 进入政务服务后,PB 级原始政务数据要变成可用的高质量语料。深智城在 MOI 上建成省级政务语料治理平台,覆盖清洗、标注、质检、分类与合规审查的全流程。

深智城集团

深智城集团是国有科技企业,业务覆盖 160 多个城市,拥有 70 余家子公司、15 家高新技术企业认证与 4100 人的技术团队(37% 为硕博学历),是国内领先的智慧城市解决方案提供商,曾获全球智慧城市大奖。

省级首个
政务语料治理平台
15 × 12
行业 × 场景分类
PB 级
原始数据治理规模
全流程
清洗/标注/质检/合规

业务背景

AI 进入政务服务后,公共安全、城市规划、民生服务等场景都开始需要大模型能力,而这些应用最终都要落回同一个前提:有没有足够质量的语料可用。

深智城业务覆盖 160 多个城市,拥有 70 余家子公司与 4100 人的技术团队,长期承担智慧城市与数字政府建设,手上沉淀了 PB 级的原始政务数据。

这个体量在国内政务领域并不多见,但体量本身不等于可用。

业务挑战

PB 级原始政务数据并不能直接喂给模型。数据分散在不同部门与业务系统,格式各异、质量参差,还带有大量不能对外的敏感信息。

政务数据的特殊之处在于合规不是可选项:哪些字段可以进入训练语料、哪些必须脱敏、哪些完全不能出库,都要有明确依据并可审计。这一层判断无法在模型训练阶段补做,必须前置到语料生产环节。

更棘手的是,每个政务 AI 应用都在各自重复做清洗、标注与合规审查。同一批数据被反复加工,既浪费算力也无法保证口径一致——两个应用对同一份数据的理解可能就不一样。

语料生产始终停留在项目制的一次性交付,项目结束,能力也就结束了,没有沉淀为可持续运行的基础设施。

解决方案

深智城在 MOI 上建成政务语料治理平台,覆盖从原始数据接入到 AI-Ready 数据集交付的全生命周期:清洗去噪、语料标注、质量检验、分类入库、合规审查逐环节在同一平台内完成。

整条流水线在一个平台内闭环,这一点并非工程偏好——语料在多个工具之间搬运时,血缘与质检记录最容易丢失,而政务语料恰恰最需要这两样东西可查。

语料按 15 个行业门类、11 个主题分类与 12 类应用场景三个维度组织。三维交叉的意义在于,同一份语料可以被不同角度的需求找到:按行业找的人和按场景找的人,检索的是同一个库。

AI 开发者由此可以按需检索到结构化、可发现、已通过合规审查的语料,而不必自己从原始库里捞——合规审查在入库时已经完成,不必每个应用重做一遍。

客户收益

该平台是广东省内首个政务领域语料治理平台,确立了公共部门数据转化为 AI 资产的标准路径。

政务数据按 15 行业 × 11 主题 × 12 场景完成组织,检索的入口与政务 AI 应用的实际需求形态对齐。

清洗、标注、质检与合规审查只做一次,所有下游应用共享同一份结果,重复加工带来的算力浪费与口径分歧同时消失。

语料生产从项目制的一次性加工,变成了可持续运行的基础设施——这是政务 AI 能够规模化的前提条件。

方案架构

数据来源
  • 各部门原始政务数据(PB 级)
  • 历史归档与业务系统数据
  • 多源异构文档与表格
  • 标注与质检反馈
MatrixOne Intelligence
  • 原始数据清洗与去噪
  • 语料标注与质量检验
  • 15 行业 × 12 场景分类
  • 合规审查与脱敏
  • AI-Ready 数据集发布
业务应用
  • 省级政务语料库
  • 政务 AI 应用取数
  • 合规可追溯的语料
  • 跨部门语料复用

相关方案与产品