← 返回项目列表

图聚类系统

2026.05 — 2026.06 1 人
Python Graph Algorithm

问题

百万级数据需要聚类。标准算法(Louvain、Leiden、K-core、极大团)效果差且过程不透明——中间挂掉就得重来。

方案:单样本 K-hop → 循环 → 去重

复杂任务 → 简化为单样本 → 循环 → 去重

1. 从一个样本出发,K-hop 扩展找到所有相连节点
2. 在小规模子图上做后处理(规模可控、可调试)
3. 扩展到多样本:循环步骤 1 + 图去重合并重叠
4. 全量分类:每个样本跑一遍 → 去重 → 完成
      

为什么优于标准方案

维度标准方案(全量一次性)Loop + Dedup
进度可见 黑盒 当前第 N/M 个样本
断点续跑 挂掉重来 从上次完成的样本继续
可调试 无法中途检查 单样本子图可逐一检查
结果 不符合业务预期 边规则直控,结果可定制

未完全攻克的难题

本质上是无监督学习——没有正确答案。验证只能靠人工看报告判断是否合理。没有标注数据、GPU 和训练时间,ML 验证指标(轮廓系数等)暂时用不上。这是我在硕士阶段想去深入的方向。

与 LLM 分析系统的共性

两个项目共享同一种设计哲学:不要一次性解决整个问题,拆到最小可处理单元,循环它,合并结果。LLM 分析:Leaf Agent × 100 条 → 递归合并。图聚类:单样本 K-hop → 循环去重。同一个模式,不同领域。