图聚类系统
2026.05 — 2026.06 1 人
Python Graph Algorithm
问题
百万级数据需要聚类。标准算法(Louvain、Leiden、K-core、极大团)效果差且过程不透明——中间挂掉就得重来。
方案:单样本 K-hop → 循环 → 去重
复杂任务 → 简化为单样本 → 循环 → 去重
1. 从一个样本出发,K-hop 扩展找到所有相连节点
2. 在小规模子图上做后处理(规模可控、可调试)
3. 扩展到多样本:循环步骤 1 + 图去重合并重叠
4. 全量分类:每个样本跑一遍 → 去重 → 完成
为什么优于标准方案
| 维度 | 标准方案(全量一次性) | Loop + Dedup |
|---|---|---|
| 进度可见 | 黑盒 | 当前第 N/M 个样本 |
| 断点续跑 | 挂掉重来 | 从上次完成的样本继续 |
| 可调试 | 无法中途检查 | 单样本子图可逐一检查 |
| 结果 | 不符合业务预期 | 边规则直控,结果可定制 |
未完全攻克的难题
本质上是无监督学习——没有正确答案。验证只能靠人工看报告判断是否合理。没有标注数据、GPU 和训练时间,ML 验证指标(轮廓系数等)暂时用不上。这是我在硕士阶段想去深入的方向。
与 LLM 分析系统的共性
两个项目共享同一种设计哲学:不要一次性解决整个问题,拆到最小可处理单元,循环它,合并结果。LLM 分析:Leaf Agent × 100 条 → 递归合并。图聚类:单样本 K-hop → 循环去重。同一个模式,不同领域。