본문 바로가기
카테고리 없음

지식 그래프 기반 하이브리드 RAG 구축 방법, 벡터 검색의 한계를 넘다 (GraphRAG·Neo4j·다중홉추론)

by dwenjji 2026. 7. 11.

지식 그래프 기반 하이브리드 RAG 구축 방법, 벡터 검색의 한계를 넘다 (GraphRAG·Neo4j·다중홉추론)

사내 AI 챗봇을 도입했는데, "정책 A와 규정 B가 충돌할 때 어떻게 해야 하나요?"라는 질문에 엉뚱한 답변을 내놓은 경험이 있으신가요? 벡터 기반 RAG(검색 증강 생성)가 바로 이 지점에서 무너집니다. 단일 쿼리와 가장 유사한 청크를 반환하는 건 잘하지만, "정책 A는 규정 B를 참조하고, 규정 B는 예외 조항 C에 의해 무효화된다"는 식의 다단계 관계 추론은 사실상 불가능합니다. MultiHopRAG 벤치마크에서 벡터 전용 RAG의 컨텍스트 정밀도는 0.093에 그쳤습니다. (FalkorDB, 2025) 이 한계를 돌파하는 기술이 바로 지식 그래프(Knowledge Graph) 융합형 하이브리드 RAG입니다.


벡터 RAG의 한계와 지식 그래프가 해결하는 것들

인포그래픽

벡터 검색 방식의 근본적 문제는 문서를 쪼갤 때 관계 정보가 파괴된다는 점입니다. 사내 인사 규정이 50개 항목에 걸쳐 정의된 경우, 벡터 인덱스는 각 항목을 독립된 벡터로 저장할 뿐 항목 간의 선후 관계나 예외 규정을 추적하지 못합니다. KPI 기준값, 유효 기간, 책임 주체처럼 엄격한 스키마를 요구하는 쿼리에서 벡터 RAG의 정확도는 사실상 0%에 수렴합니다. 반면 최적화된 Graph RAG는 같은 조건에서 90% 이상을 달성했습니다. (FalkorDB SDK, 2025)

지식 그래프는 현실 세계의 개체(Entity)와 관계(Relation)를 노드-엣지 구조로 표현합니다. 핵심 표현 단위는 `(인사규정_v3, 적용대상, 정규직_사원)`이나 `(예외조항_5조, 무효화, 규정_2조_3항)` 같은 트리플(Triple)입니다. 이 구조 덕분에 "5조 예외 조항이 적용되는 정규직 사원에게 v3 인사규정은 어떻게 적용되는가?"처럼 여러 단계를 거치는 질문도 정확하게 답할 수 있습니다.


하이브리드 RAG 구축 방법: LLM 자동 그래프 추출 파이프라인

지식 그래프를 처음 들으면 도메인 전문가가 수작업으로 관계를 입력해야 한다고 생각하기 쉽습니다. 하지만 2024년부터는 LLM을 활용한 자동 추출 파이프라인이 성숙 단계에 접어들었습니다.

파이프라인은 세 단계로 구성됩니다.

  1. 엔티티·관계 추출: LLM에 텍스트 청크와 온톨로지 스키마를 함께 입력해 트리플을 생성합니다. GPT-4o나 Claude Sonnet처럼 고추론 모델일수록 추출 품질이 높습니다.
  2. 검증 및 정제: Verifier 모듈이 생성된 트리플의 논리 일관성을 검사하고 중복을 제거합니다.
  3. 그래프 저장: 정제된 트리플을 Neo4j 등 그래프 DB에 적재합니다.

LangChain의 `LLMGraphTransformer`는 이 과정을 코드 수 줄로 추상화합니다. `llm_transformer.convert_to_graph_documents(documents)` 호출 한 번으로 문서에서 그래프를 생성할 수 있습니다.

하이브리드 RAG는 이 그래프를 벡터 검색과 결합하여 사용합니다. 의미적으로 유사한 문서는 벡터 검색으로, 다단계 관계나 엄격한 조건은 그래프 순회(Graph Traversal)로 처리합니다. 두 방식의 강점을 각각 살리는 구조입니다.


Graph RAG 실무 도입 시 주의할 점

그래프 RAG가 강력하다고 해서 모든 상황에 적합한 것은 아닙니다.

그래프 구축 비용이 초기에 상당히 높습니다. 온톨로지(어떤 개체 유형과 관계 유형이 존재하는지 사전 정의)를 설계하는 작업이 반드시 필요하고, 이는 도메인 전문가의 참여를 요구합니다. 문서가 자주 바뀌면 그래프도 지속적으로 업데이트해야 합니다.

그래서 실무에서는 단계적 접근이 권장됩니다. 먼저 기존 벡터 RAG를 운영하면서 어떤 유형의 질문에서 오답이 많이 나오는지 분석합니다. 다중 홉 추론이 필요한 질문이 전체의 20~30%를 넘는다면 하이브리드 RAG 전환을 검토할 시점입니다. 그 비율이 낮다면, 청킹 전략을 개선하거나 리랭킹 모델을 추가하는 것이 더 빠른 해결책일 수 있습니다.

결국 지식 그래프 기반 하이브리드 RAG는 도입 장벽이 높지만, 복잡한 사내 규정이나 법률 문서처럼 관계가 촘촘하게 연결된 도메인에서는 기존 방식으로는 넘을 수 없는 정확도 벽을 돌파할 수 있는 유일한 방법입니다.


참고: FalkorDB GraphRAG Benchmark 2025, LangChain 공식 블로그, arXiv SAC-KG 2024