汇集技术深度解读、产品动态与最佳实践,持续分享 Data + AI 领域的工程洞察
Git4Data 系列(九):训练/验证/测试集的切分,是决定离线评估可不可信的一步。以一个风控模型为例,用 SQL 检测并防住时间、实体、重复、预处理、目标五类数据泄漏;再用库级快照把样本与切分清单一起冻结成可复现、可审计、可回退的版本,并对比业内其他做法。SQL 在 MatrixOne 4.1.0 上实测。


Git4Data 系列(八),AI 训练实践篇开篇:先建立机器学习全流程的坐标系。从数据接入、质量门禁、清洗标注、特征工程、训练/验证/测试集发布、模型评估,到上线监控与反馈重训,逐环节说明 snapshot、branch、diff、merge、cherry-pick、restore 与 PITR 能解决什么、不能解决什么,并以一个持续迭代的风控模型完整串联。配套脚本在 MatrixOne 4.1.0 上实测。

介绍 MatrixOrigin 如何将招标 Excel 解析、企业知识库检索、逐条技术应答、证据引用、人工审核与结果回填整合为一套可验证、可追溯、可持续迭代的投标 Agent 工作流,并通过金标数据集、回归测试和可观测体系持续提升投标应答的准确率与处理效率。
Agent 正在重演智能手机、智能汽车的数量曲线,很快会超过人。但真正被低估的资产,是每个 Agent 不停产生的 Agent Trace——PB 级、高强度、现有系统被迫丢掉 86% 的数据。为什么 Trace 是纠错、记忆、训练的数据飞轮,以及企业为什么需要一层为 Trace 而建的数据基础设施。

Git4Data 系列(七),数据运维实践篇收官:Write-Audit-Publish(WAP)。新数据先落 staging 分支、跑一组 SQL 审计门禁、再一次原子 MERGE 发布——脏批次在门口就被拦下,生产表全程零感知。含真实场景、三步落地、以及和直接灌/蓝绿改名/staging+INSERT/事务/DQ 工具等方案的详细对比。全部 SQL 在 MatrixOne 4.0.0-rc3 上实测。

Git4Data 系列(六),数据运维主题:数据协作开发。多个人要同时改同一张表时怎么办——多人并行清洗主数据、把数据改动做成可评审的 PR、在分支上开发大改造而主线照常服务——用每人一条分支、行级 DIFF 评审、三方 MERGE、冲突策略(FAIL/SKIP/ACCEPT)与 cherry-pick 实现。全部 SQL 在 MatrixOne 4.0.0-rc3 上实测。

Git4Data 系列(五),实践篇第一站「数据运维」:一份误操作急救手册。用一张订单表把四类最常见事故从头走一遍——手滑 UPDATE、ETL 跑错、应用 bug 慢性脏写、误删整表——讲清事前快照、行级 DIFF 看清损失、整表回滚 vs 定点修复、以及 PITR 兜底。全部 SQL 在 MatrixOne 4.0.0-rc3 上实测。

Git4Data 系列(四):画一张数据版本控制的全景地图。'git for data' 这个词被 DVC / Git LFS、lakeFS、Iceberg / Delta + Nessie、Snowflake / Neon、Dolt 一起用,但它们说的并不是同一件事。本文用五个问题立框架,按版本控制所在的层次分成四个种类(每类配一张架构图),再用一张 git 原语完整度矩阵把各家的 git 语义对齐,最后标定 MatrixOne 的准确坐标与诚实边界。

从 Human in the Loop 到 Team in the Loop,本文通过一次真实 Debug 场景,展示 Memoria 如何利用 Branch、Diff、Review、Apply 和 Rollback,将 Oncall、Dev、Ops 与 Agent 接入同一条共享记忆链路,实现团队上下文的审查、接力与可追溯管理。

Git4Data 系列(三):打开引擎盖。快照、克隆、diff、merge 凭什么在 TB 级数据上这么快——从 MatrixOne 的存储架构(不可变对象 + 元数据目录),到只读增量的 diff/merge、三方合并的真假冲突自动判定。讲清版本控制为何是存储引擎的自然产物,而非叠加上去的一层功能。

MatrixOne 深度集成 NVIDIA cuVS 与 RAFT,将向量索引构建、量化压缩和向量检索全面迁移至 GPU,在 8800 万级向量数据集上实现最高 19 倍索引构建加速和超过 200 倍检索性能提升,为企业级 AI 应用提供高性能混合查询能力。

Git4Data 系列(二):手把手、可直接复制运行的实操。装好 MatrixOne,灌进一百万行数据,把所有 Git 原语——快照、克隆、分支、行级 diff、带冲突策略的合并、cherry-pick、任意时间点恢复——在表 / 库 / 租户 / 集群四个粒度上跑一遍,并用实测数字证明:版本控制的成本与数据量无关。

一位老 Snowflake 人的 Summit 2026 现场观察:这家公司如何终于把 AI 标签贴牢,以及绕了一大圈之后,它“数据公司”的底蕴为何在 AI 时代头一回真正凸显。