AI 도입 팀들이 겪는 현실: 학습 데이터부터 망가져 있다
회의실을 예약하려고 노션 검색창에 '회의실'을 쳤을 때 2년 전 폐기된 10층 회의실 규칙이 상위에 올라온다. 팀 목표 문서를 찾으려다 작년 버전과 올해 버전 중 어느 것을 참고해야 할지 모른다. 검색 결과 3개 중 2개가 이미 틀린 정보다.
이렇게 되는 이유는 간단하다. 폴더 구조가 없거나 너무 복잡하면, 임베딩 모델(RAG의 핵심)도 결국 그 혼란을 그대로 학습한다. 최신본과 폐기본의 구분이 없으면, AI는 두 문서를 동등하게 취급하고 검색 순위를 매긴다. 메타데이터(문서 작성일, 상태, 담당자)가 없으면, AI가 참고할 추가 정보도 없다.
RAG 도입 전 확인해야 할 3가지 체크포인트
먼저 현재 노션 워크스페이스의 문서 상태를 진단해야 한다. 수백 개의 문서 중 정말 쓰이는 것이 몇 개인지, 얼마나 중복되어 있는지, 얼마나 오래된 것인지 파악하는 단계다. 이 과정은 지루하지만 RAG를 도입한 후 검색 결과가 신뢰할 수 있을지를 결정한다.
① 활성 문서와 폐기 문서를 물리적으로 분리한다. 같은 폴더 안에 섞여 있으면 AI도 구분할 수 없다. 폐기 처리된 문서는 별도의 '아카이브' 폴더로 옮기고, 최신본 앞에는 명확한 날짜나 버전 번호를 붙인다. 예를 들어 '2025 분기 목표(최신)' vs '2024 분기 목표(아카이브)' 식으로.
② 같은 주제의 문서가 여러 개인지 확인한다. 급하게 만들어진 프로젝트 문서, 슬랙 채널용 정리본, 임시 공유 버전이 동시에 존재하는 경우가 많다. 이 중 공식 버전을 하나 정하고, 나머지는 삭제하거나 참조 링크로 통일한다. RAG는 이런 중복을 처리하도록 설계되지 않았다.
③ 문서 메타데이터를 채운다. 노션이라면 각 페이지에 '최종 수정일', '담당자', '상태(진행중/완료/폐기)' 같은 속성을 추가한다. AI는 이 정보를 통해 '완료 상태의 최신 문서'를 우선순위로 랭킹할 수 있다.
팀별 폴더 구조는 이미 망쳐 있다는 가정 아래 시작하라
완벽한 구조를 기대하지 말자. 사람들은 편의상 자신의 폴더에 저장하고, 중요한 문서는 여러 곳에 복사되며, 누가 어디에 무엇을 저장했는지 아무도 모른다. RAG 도입팀은 이 현실을 받아들이고 '최소한의 규칙'부터 시작해야 한다.
실제로 작동하는 폴더 구조는 다음과 같다: 최상위는 '부서/팀별' 또는 '프로젝트별' 하나만 고른다. 그 아래 '운영 중(활성)', '보관(폐기)', '템플릿' 같은 상태별 폴더를 만든다. 각 폴더 안의 문서 제목에는 날짜를 붙인다('2025-01-15_월간보고서' 같은 형식). 이렇게 하면 임베딩 모델이 문서 제목의 날짜만 보고도 최신 버전을 우선순위로 둘 수 있다.
한 가지 중요한 점: 완벽함을 기다리지 말자. 팀이 90%만 정리된 상태에서 RAG를 도입하는 것이 0% 상태에서 완벽함을 기다리다가 1년을 버리는 것보다 낫다. 도입 후 검색 결과를 모니터링하면서 계속 개선할 수 있다.
RAG 시스템이 제대로 작동하려면 데이터 입력이 깨끗해야 한다
임베딩 모델은 사람처럼 '이 정보는 낡았으니까 무시하자'라고 판단하지 못한다. 벡터 거리(유사도)를 계산할 뿐이다. 따라서 폐기본과 최신본이 비슷한 내용이면, 둘 다 높은 유사도 점수를 받는다. 검색 결과는 무작위로 하나를 선택하거나, 둘을 동시에 제시하는데, 사용자는 어느 것을 신뢰해야 할지 몰라 결국 '이 AI도 쓸모없다'고 판단한다.
이 문제를 완전히 해결하려면 RAG 파이프라인에 필터(라우팅)를 추가해야 한다. 예를 들어 검색할 때 '상태=활성' 필터를 먼저 적용한 후, 그 결과 안에서만 임베딩 유사도를 계산한다. 노션의 경우, 쿼리할 때 데이터베이스 필터 조건('Status is Active')을 함께 사용하면 된다. 이렇게 하면 아무리 최신본과 비슷한 내용이어도 폐기본은 아예 검색 대상에서 제외된다.
정리 단계에서 가장 흔한 실수는 '모든 문서를 다 보존하려고 하는 것'이다. 정말 필요 없는 문서는 삭제하자. 아카이브는 필요하지만, 아카이브에 묻힌 것들이 현재 검색을 오염시키면 안 된다.
RAG 도입팀이 실제로 해야 할 작업 순서
주차 1: 현황 파악. 노션 워크스페이스의 모든 페이지를 내보내서(Export) 목록을 만든다. 어떤 문서가 있고, 누가 소유한지, 언제 마지막으로 수정되었는지 정리한다. 엑셀 한 장이면 충분하다.
주차 2: 정책 수립. 팀 리더와 함께 최소한의 폴더 규칙을 정한다. '상태 필드는 필수', '최신본은 제목에 날짜 포함' 같은 3-4가지 규칙만 정하자. 너무 많으면 준수율이 떨어진다.
주차 3: 정리 시작. 가장 자주 검색되는 폴더부터 시작한다. 모든 문서를 한 번에 정리하려고 하지 말 것. 팀이 매일 쓰는 프로젝트 문서, 팀 규칙, 진행 중인 업무 관련 문서 순으로 우선순위를 정한다.
주차 4-5: 메타데이터 입력. 각 문서에 상태, 담당자, 최종 수정일 같은 속성을 채운다. 템플릿을 만들어서 새 문서는 자동으로 이 필드를 갖도록 설정하는 것이 좋다.
주차 6: 파일럿 RAG 구축. 정리된 부분만 먼저 임베딩하고 검색해본다. 결과가 좋으면 다른 폴더로 확대하고, 이상하면 어느 문서 때문인지 찾아 수정한다.
AI 검색 신뢰도는 입력 데이터의 품질로 결정된다
RAG 도입을 고민하는 팀이라면, 임베딩 모델이나 LLM 모델의 성능보다 먼저 자신들의 데이터 상태를 진단해야 한다. 최신 GPT-4o를 쓰더라도, 입력이 지저분하면 출력도 지저분하다. 반대로 데이터가 깨끗하면, 3년 전 임베딩 모델도 대부분의 검색에서 충분히 정확하다.
가장 많은 팀이 하는 실수는 'RAG 기술을 먼저 고르고 나서 데이터를 정리하는 것'이다. 역순으로 해야 한다. 데이터가 100% 준비될 때까지 기다릴 필요는 없지만, 최소한 '폐기 문서와 활성 문서가 분리되고, 메타데이터가 채워진' 상태에서 RAG를 도입해야 팀이 AI를 신뢰할 수 있다. 그렇지 않으면 6개월 후 '사실 우리 검색 AI는 별로다'라는 결론에 도달하게 된다.
