博客

汇集技术深度解读、产品动态与最佳实践,持续分享 Data + AI 领域的工程洞察

最新文章

MatrixOne Git4Data 技术详解(九)·AI 训练实践篇:数据集发布与泄漏——别让离线指标骗了你

Git4Data 系列(九):训练/验证/测试集的切分,是决定离线评估可不可信的一步。以一个风控模型为例,用 SQL 检测并防住时间、实体、重复、预处理、目标五类数据泄漏;再用库级快照把样本与切分清单一起冻结成可复现、可审计、可回退的版本,并对比业内其他做法。SQL 在 MatrixOne 4.1.0 上实测。

MatrixOrigin2026年7月21日13 分钟阅读
阅读文章

MatrixOne Git4Data 技术详解(九)·AI 训练实践篇:数据集发布与泄漏——别让离线指标骗了你

技术干货

MatrixOne Git4Data 技术详解(八)·AI 训练实践篇:从数据进入到模型迭代——Git4Data 能力如何贯穿机器学习全流程

技术干货

MatrixOne Git4Data 技术详解(八)·AI 训练实践篇:从数据进入到模型迭代——Git4Data 能力如何贯穿机器学习全流程

Git4Data 系列(八),AI 训练实践篇开篇:先建立机器学习全流程的坐标系。从数据接入、质量门禁、清洗标注、特征工程、训练/验证/测试集发布、模型评估,到上线监控与反馈重训,逐环节说明 snapshot、branch、diff、merge、cherry-pick、restore 与 PITR 能解决什么、不能解决什么,并以一个持续迭代的风控模型完整串联。配套脚本在 MatrixOne 4.1.0 上实测。

2026年7月17日20 分钟阅读
阅读文章

投标团队最苦的活,我们用 AI Agent 重做了一遍

技术干货

投标团队最苦的活,我们用 AI Agent 重做了一遍

介绍 MatrixOrigin 如何将招标 Excel 解析、企业知识库检索、逐条技术应答、证据引用、人工审核与结果回填整合为一套可验证、可追溯、可持续迭代的投标 Agent 工作流,并通过金标数据集、回归测试和可观测体系持续提升投标应答的准确率与处理效率。

2026年7月10日9 分钟阅读
阅读文章

Agent 正在成为新的“智能手机”和“智能汽车”

行业洞察

Agent 正在成为新的“智能手机”和“智能汽车”

Agent 正在重演智能手机、智能汽车的数量曲线,很快会超过人。但真正被低估的资产,是每个 Agent 不停产生的 Agent Trace——PB 级、高强度、现有系统被迫丢掉 86% 的数据。为什么 Trace 是纠错、记忆、训练的数据飞轮,以及企业为什么需要一层为 Trace 而建的数据基础设施。

2026年6月24日9 分钟阅读
阅读文章

MatrixOne Git4Data 技术详解(七)·数据运维实践篇:Write-Audit-Publish——给 ETL 流水线装一道发布门禁

技术干货

MatrixOne Git4Data 技术详解(七)·数据运维实践篇:Write-Audit-Publish——给 ETL 流水线装一道发布门禁

Git4Data 系列(七),数据运维实践篇收官:Write-Audit-Publish(WAP)。新数据先落 staging 分支、跑一组 SQL 审计门禁、再一次原子 MERGE 发布——脏批次在门口就被拦下,生产表全程零感知。含真实场景、三步落地、以及和直接灌/蓝绿改名/staging+INSERT/事务/DQ 工具等方案的详细对比。全部 SQL 在 MatrixOne 4.0.0-rc3 上实测。

2026年6月18日9 分钟阅读
阅读文章

MatrixOne Git4Data 技术详解(六)·数据运维实践篇:数据协作开发——像合并代码一样合并数据

技术干货

MatrixOne Git4Data 技术详解(六)·数据运维实践篇:数据协作开发——像合并代码一样合并数据

Git4Data 系列(六),数据运维主题:数据协作开发。多个人要同时改同一张表时怎么办——多人并行清洗主数据、把数据改动做成可评审的 PR、在分支上开发大改造而主线照常服务——用每人一条分支、行级 DIFF 评审、三方 MERGE、冲突策略(FAIL/SKIP/ACCEPT)与 cherry-pick 实现。全部 SQL 在 MatrixOne 4.0.0-rc3 上实测。

2026年6月17日8 分钟阅读
阅读文章

MatrixOne Git4Data 技术详解(五)·数据运维实践篇:误操作急救——从手滑 UPDATE 到误删整表,都能秒级回退

技术干货

MatrixOne Git4Data 技术详解(五)·数据运维实践篇:误操作急救——从手滑 UPDATE 到误删整表,都能秒级回退

Git4Data 系列(五),实践篇第一站「数据运维」:一份误操作急救手册。用一张订单表把四类最常见事故从头走一遍——手滑 UPDATE、ETL 跑错、应用 bug 慢性脏写、误删整表——讲清事前快照、行级 DIFF 看清损失、整表回滚 vs 定点修复、以及 PITR 兜底。全部 SQL 在 MatrixOne 4.0.0-rc3 上实测。

2026年6月16日12 分钟阅读
阅读文章

MatrixOne Git4Data 技术详解(四):数据版本控制全景——MatrixOne、lakeFS、DVC、Neon、Dolt 到底有什么不同

技术干货

MatrixOne Git4Data 技术详解(四):数据版本控制全景——MatrixOne、lakeFS、DVC、Neon、Dolt 到底有什么不同

Git4Data 系列(四):画一张数据版本控制的全景地图。'git for data' 这个词被 DVC / Git LFS、lakeFS、Iceberg / Delta + Nessie、Snowflake / Neon、Dolt 一起用,但它们说的并不是同一件事。本文用五个问题立框架,按版本控制所在的层次分成四个种类(每类配一张架构图),再用一张 git 原语完整度矩阵把各家的 git 语义对齐,最后标定 MatrixOne 的准确坐标与诚实边界。

2026年6月15日9 分钟阅读
阅读文章

Human in the Loop,不该只停留在“一个人”

技术干货

Human in the Loop,不该只停留在“一个人”

从 Human in the Loop 到 Team in the Loop,本文通过一次真实 Debug 场景,展示 Memoria 如何利用 Branch、Diff、Review、Apply 和 Rollback,将 Oncall、Dev、Ops 与 Agent 接入同一条共享记忆链路,实现团队上下文的审查、接力与可追溯管理。

2026年6月12日7 分钟阅读
阅读文章

MatrixOne Git4Data 技术详解(三):MatrixOne 架构及 Git4Data 原理解析,快照、Diff、Merge 凭什么这么快

技术干货

MatrixOne Git4Data 技术详解(三):MatrixOne 架构及 Git4Data 原理解析,快照、Diff、Merge 凭什么这么快

Git4Data 系列(三):打开引擎盖。快照、克隆、diff、merge 凭什么在 TB 级数据上这么快——从 MatrixOne 的存储架构(不可变对象 + 元数据目录),到只读增量的 diff/merge、三方合并的真假冲突自动判定。讲清版本控制为何是存储引擎的自然产物,而非叠加上去的一层功能。

2026年6月9日11 分钟阅读
阅读文章

向量索引入核,驾驭亿级向量数据:MatrixOne × NVIDIA cuVS GPU 加速实践

技术干货

向量索引入核,驾驭亿级向量数据:MatrixOne × NVIDIA cuVS GPU 加速实践

MatrixOne 深度集成 NVIDIA cuVS 与 RAFT,将向量索引构建、量化压缩和向量检索全面迁移至 GPU,在 8800 万级向量数据集上实现最高 19 倍索引构建加速和超过 200 倍检索性能提升,为企业级 AI 应用提供高性能混合查询能力。

2026年6月4日10 分钟阅读
阅读文章

MatrixOne Git4Data 技术详解(二):从零跑通所有 Git 原语

技术干货

MatrixOne Git4Data 技术详解(二):从零跑通所有 Git 原语

Git4Data 系列(二):手把手、可直接复制运行的实操。装好 MatrixOne,灌进一百万行数据,把所有 Git 原语——快照、克隆、分支、行级 diff、带冲突策略的合并、cherry-pick、任意时间点恢复——在表 / 库 / 租户 / 集群四个粒度上跑一遍,并用实测数字证明:版本控制的成本与数据量无关。

2026年6月4日8 分钟阅读
阅读文章

Snowflake 的 AI 标签终于贴牢了,数据公司的底蕴也终于在 AI 浪潮下凸显了

技术干货

Snowflake 的 AI 标签终于贴牢了,数据公司的底蕴也终于在 AI 浪潮下凸显了

一位老 Snowflake 人的 Summit 2026 现场观察:这家公司如何终于把 AI 标签贴牢,以及绕了一大圈之后,它“数据公司”的底蕴为何在 AI 时代头一回真正凸显。

2026年6月4日12 分钟阅读
阅读文章