오타와 사실 오류는 다른 위험이다

오타는 명백하다. '서을'은 누가 봐도 틀렸다. 하지만 자동 시스템이 생성한 "2023년 국내 영화 관객 수는 1억 5,000만 명"이라는 문장은 어떤가. 숫자는 정확해 보이고, 서술도 자연스럽다. 그런데 출처는 엉뚱한 곳에서 뽑았거나, 시점이 다르거나, 집계 기준이 맞지 않은 경우다. 검수자가 "이건 맞는 것 같은데"라고 넘어가면 그 오류는 독자에게 그대로 전달된다.

오타는 아찔하지만 일시적이다. 오타가 나면 수정 공지를 내도 "아, 오타였구나"로 끝난다. 그럴듯한 사실 오류는 다르다. 독자들이 그 정보를 신뢰하고 공유하고 다시 인용한다. 콘텐츠 팀의 신뢰도 한 번 깨지면 회복하기가 훨씬 어렵다.

그럴듯한 오류는 어디서 나오나

자동 시스템의 그럴듯한 오류 대부분은 세 가지 형태다. 첫째는 맥락 분리 오류다. 예를 들어 "서울시는 지난해 인구 1,000만 명을 기록했지만, 올해는 감소 추세"라는 문장에서 시스템이 "서울 인구 1,000만 명"만 추출했다면, 이제 그 숫자는 현재 정보처럼 보인다. 원문의 시점이나 조건이 떨어져 나간 것이다.

둘째는 데이터 소스의 모호성이다. 자동 크롤링이나 데이터베이스 연동에서 유사한 여러 통계가 나올 때, 시스템이 가장 관련성 높은 것으로 판단하지만 실제로는 다를 수 있다. "K-드라마 인기도"를 찾다가 특정 플랫폼의 재생 수만 반영했다면, 마치 전체 산업 수치인 것처럼 읽힌다.

셋째는 구식 정보의 재활용이다. 학습 데이터나 템플릿에서 뽑은 기존 기사를 새로 생성할 때, "지난해"나 "현재"라는 상대 표현이 자동으로 갱신되지 않는다. 2023년 기사의 "올해 예상"이 2024년에 그대로 복사되면, 그것도 그럴듯한 오류가 된다.

검수 리소스가 부족할 때 우선순위

모든 글을 완벽하게 검수할 수 없다는 것을 인정하는 게 첫 단계다. 그다음은 오류의 영향 범위로 우선순위를 정하는 것이다. 독자에게 직접 행동을 유도하는 콘텐츠부터다. 가격, 날짜, 법적 요건, 안내 정보 같은 항목이 오르면 문제가 크다. "부산 전시회는 1월 30일부터"라고 했는데 실제는 31일이면, 그 글 한 건이 수천 명의 일정을 뒤흔든다.

그다음은 신용도에 영향을 주는 상황 정보다. 인물의 직책, 회사의 설립연도, 제품 출시일 같은 것들은 기사의 신뢰성 전체를 손상시킨다. 마지막이 학술적이거나 배경적인 통계다. "역사상 가장 큰 경제 위기는"이라는 배경 설명에서 연도가 한두 해 틀렸다고 해서 즉각 독자의 행동이 바뀌지는 않는다. 물론 정확해야 하지만, 검수 시간이 부족하면 영향도가 높은 순서부터 집중해야 한다.

팀에 필요한 검수 체크리스트

자동 시스템을 운영하는 팀이라면 이 항목들을 먼저 검사하는 프로세스를 정립해야 한다. 첫째, 콘텐츠에 구체적인 숫자나 날짜가 있으면, 그것이 최신인지 출처가 명확한지 빠르게 확인한다. 크롤링 기반 시스템이라면 출처 URL 자체를 자동으로 함께 로깅하면 검수자가 클릭 한 번으로 원문을 볼 수 있다.

둘째, 상대 시간 표현("지난해", "올해", "최근")이 있으면, 그것이 발행일 기준으로 정확한지 점검한다. 자동 시스템이 일괄 변환했다면 모두 정확할 것 같지만, 템플릿에서 복사된 부분이 있으면 위험하다. 셋째, 인물 또는 기관의 현재 상태를 언급했으면 최신 정보인지 확인한다. "회사 CEO는 누구"라는 식의 표현이 시간이 지나면서 오래된 정보가 되기 쉽다.

넷째, 주장의 근거를 묵시적으로 담은 부분을 본다. 예를 들어 "이 제품은 시장에서 가장 인기 있다"고 했다면, 어떤 시장(온라인/오프라인)의 어떤 기간(최근 1개월)을 기준으로 했는지 원문에 명확히 있는지 확인한다. 이 네 가지만 집중해도 가장 위험한 오류 대부분을 막을 수 있다.

시스템 자동화 단계에서 사전 필터링하기

검수 단계에 의존하기만 하면 규모가 커질수록 한계가 생긴다. 자동화 시스템 자체에 몇 가지 필터를 심는 것이 효율적이다. 예를 들어, 콘텐츠가 과거 7일 내의 데이터를 인용했다면 자동으로 "최신성 검증 필요" 플래그를 붙인다. 직무자 이름이나 회사명을 포함했다면 별도 큐에 넣는다. 이런 오류가 나올 가능성이 높은 항목들을 미리 필터링하면, 검수자는 그 부분만 집중할 수 있다.

또 한 가지는 출처를 자동으로 캡처하고, 생성된 콘텐츠에 그 출처 링크를 메타데이터로 붙이는 것이다. "이 문장은 어디서 나왔는가"를 한 번에 추적할 수 있으면, 검수 시간은 크게 줄어든다. 일부 팀은 특정 도메인이나 브랜드명이 언급된 콘텐츠를 자동으로 별도 검수자에게 라우팅한다. 시스템이 작으면 이런 자동화가 오버헤드처럼 느껴질 수 있지만, 월 500건 이상 발행하는 팀이라면 투자할 가치가 충분하다.

신뢰도를 잃지 않는 결정

자동 시스템을 키워야 하는 압박과 품질을 지켜야 하는 책임이 충돌할 때, 일부 팀은 속도를 택한다. 그 결과가 독자 불신이다. 반대로 모든 글을 완벽하게 검수하려다 보면 자동화의 의미가 없어진다.

실무적인 답은 이것이다. 검증 불가능한 항목이 있으면, 그 글을 발행하지 말거나 그 부분을 수정하거나 명시적으로 출처를 표기한다. "시장 조사 기관 A의 2024년 통계에 따르면"이라고 쓰는 것이 "시장에서 가장 인기 있다"고 쓰는 것보다 훨씬 안전하다. 자동 시스템이 생성한 글이라고 해서 검수를 건너뛸 수 없다. 다만, 어느 부분을 먼저 볼 것인가를 명확히 하고, 시스템 단계에서 위험 신호를 미리 분류해 두면, 제한된 리소스로도 신뢰도는 지킬 수 있다.