>_ DevTrendsde

Sprache

Start

Sprachen

Bereiche

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embedded Sicherheit
Python

Wissensgraphen statt Gigabytes an Embeddings für Code-Analyse in Monorepos

Eine vertraute Situation: Sie füttern ein großes Monorepo mit einem KI-Assistenten, und er beginnt, Funktionsaufrufe aus benachbarten Diensten zu verwechseln, Verbindungen zwischen Modulen zu verlieren und nicht existierende Argumente zu erfinden. Die reguläre Vektorsuche ist ziemlich gut darin, ähnliche Textfragmente zu finden. Allerdings haben Vektordarstellungen Schwierigkeiten, die starre Struktur von Code zu verstehen, bei der eine einzige umbenannte Variable oder ein impliziter Import die Logik der gesamten Anwendung verändert.

Der Entwickler Vitaliy hat das Projekt code-graph-rag erstellt, um dieses Problem systematisch zu lösen. Anstatt sich solely auf Vektor-Embeddings zu verlassen, baut das Tool einen Wissensgraphen der Codebasis auf.

demo

So funktioniert es im Inneren

Das System basiert auf drei Kernkomponenten: dem Tree-sitter-Parser, der Memgraph-Graphdatenbank und der Qdrant-Vektordatenbank.

So funktioniert es:

  1. Tree-sitter parsed Quelldateien in abstrakte Syntaxbäume (AST).
  2. Der Analyzer extrahiert Knoten: Funktionen, Klassen, Methoden, Module und die Beziehungen zwischen ihnen.
  3. Daten werden unter einem einheitlichen, sprachunabhängigen Schema in Memgraph geschrieben.
  4. Darauf aufbauend übersetzt ein CLI-Tool cgr natürliche Sprachfragen in präzise Cypher-Abfragen an die Graphdatenbank.

Wenn Sie also fragen „wo wird Funktion X verwendet und wohin fließt ihre Daten als nächstes?

Ähnliche Projekte