源码精读
杂乱数据如何变成一张可解释、可审计的知识图谱
一份企业数据从摄取到审计的完整旅程。十章逐行精读 Semantica,每一处论断都能回溯到源码的具体某一行,并以 microsoft/graphrag 作全程对照。
ox-alpha
0章
0处源码引用
0万字
commit 1ee2ae88 · tag course-anchor-20260824 · 2026-08-24
github.com/semantica-agi/semantica 开始阅读目录
- 01全景与编排数据从入口到知识库,编排层怎么保证步骤顺序、状态管理与失败处理。
- 02多源摄取30 种数据源怎么收进一个统一抽象而不互相污染
- 03解析、归一化与切块非结构化文本切成块时,怎么不把语义边界切烂。
- 04实体关系抽取让 LLM 抽实体和关系,结果凭什么可信、可复用,靠的是类型化输出、回退链、缓存与溯源包装四道闸门。
- 05冲突检测与去重同一事实有多个来源且互相打架时,谁说了算
- 06图谱构建与双时态事实抽出来的三元组怎么变成一张图,实体消解和双时态怎么落地。
- 07本体生成与校验企业没有本体时,怎么自动生成一份并通过 SHACL 校验
- 08推理与溯源图上的推理结论凭什么可信,W3C PROV-O 溯源怎么落地
- 09上下文与决策智能一个决策怎么被记录、链进因果网、被策略治理、最后导出审计件。
- 10存储与出口六种向量后端加多种图后端怎么统一抽象不漏后端特性,十几种导出格式怎么保互操作