블로그로 돌아가기
AI SEO

AI가 우리 회사를 확인할 수 없다 — 71개 기업 감사가 찾은 '84% 정체성 누출'

AI가 우리 회사를 확인할 수 없다 — 71개 기업 감사가 찾은 '84% 정체성 누출'

현실 세계에서 그 사업이 무엇인지와, AI 검색 시스템이 그것을 검증할 수 있는지 사이에는 간극이 있다. 저자는 이것을 "정체성 누출(identity leak)" 이라 부른다.

사업이 어려운 게 아니다. 어떤 사이트를 검색자에게 추천하고 노출할지 결정하는 AI 시스템에게 보이지 않는 것이다.

캐나다 프린스에드워드아일랜드(PEI) 의 여러 업종 검증된 사업체 71곳을 감사한 결과다.

결과수치
평균 사업체가 AI 시스템에 누출하는 정체성84%
AI가 검색 가능한 디지털 존재가 전혀 없는 비율17%
AI가 신뢰·검색 가능하다고 볼 요건 중 실제 충족 비율15.6%

84% 정체성 누출이란

AI 검색 검색(retrieval) 시스템은 사람처럼 웹사이트를 훑지 않는다. 구체적이고 검증 가능한 사실을 찾는다 — 누가 그 사업을 운영하는지, 어디 있는지, 무엇을 하는지, 그 뒤의 사람들이 실재하는지.

이것들을 찾지 못하면 웹에서 긁어모은 파편으로 추측한다. 또는 그 사업을 답변에서 아예 빼버린다.

사업에 관해 사실인 것과 AI가 확인할 수 있는 것 사이의 간극이 정체성 누출이다.

감사에서 발견된 5가지 유형

1. 신뢰 신호는 있는데 AI가 못 찾는다

가장 흔하고 가장 고치기 쉬운 형태다. 71곳 중 22곳은 자사 사이트 어딘가에 이름이 명시된 식별 가능한 리더십이 있었다.

여러 경우 그 정보가 "Our Team", "Our History", "Our Family" 같은 하위 페이지에 있어서, AI가 홈페이지를 훑는 일상적 패스에서 놓쳤다.

정보는 있다. 다만 검증이 필요한 자리에 없을 뿐이다.

2. 사이트는 있는데 AI가 읽을 게 없다

샘플의 여러 사업체가 전문적으로 만들어진 진짜 현대적 웹사이트를 갖고 있었지만, 직접 페치(fetch)하면 추출 가능한 텍스트가 0이었다. 정적 폴백 없이 전부 클라이언트 사이드 자바스크립트로 지어진 탓이다.

그중 하나는 "직관적 엔터프라이즈 및 AI 시스템"을 약속하는 태그라인을 내건 소프트웨어 회사였다. 그 홈페이지는 자기가 만들어졌다고 주장하는 바로 그 시스템에게 읽히지 않았다.

3. 사업은 실재하는데 도메인이 죽었다

유명 치즈 제조사의 도메인은 이제 도메인 리셀러가 판매 중이고, 소금 생산자의 도메인은 아무것도 반환하지 않았다. 그 브랜드는 다른 웹사이트에서 팔리는 제품 라인으로만 남아 있다. 둘 다 크롤러가 보는 자리에 나타나지 않았다.

4. 정체성이 웹에 흩어져 있다

한 초콜릿 제조사는 디렉터리 전반에 세 가지 다른 도메인 변형으로 유통됐고, 한 바이오텍 기업은 같은 엔티티로 두 개의 별도 라이브 도메인을 운영했다.

각 파편이 서로를 희석한다. AI 시스템은 "이게 누구인가"를 해결하려다 하나의 권위 있는 답이 아니라 경쟁하는 부분적 답들을 찾게 된다.

5. 애초에 디지털 존재를 만든 적이 없다

사진 스튜디오, HVAC 시공사, 목재소, 주 정부 차량검사 등록부에 오른 정비소실제로 영업 중인 사업체 여럿이 서드파티 디렉터리 리스팅으로만 존재했다. AI 시스템이 대조해 검증할 실제 사이트가 없다.

왜 누출이 생기나

정체성 누출은 사업이 나빠서 생기는 것이 아니다. 다른, 더 오래된 종류의 독자를 위해 지어진 웹사이트 때문에 생긴다.

과거 웹사이트의 임무는 검색엔진에 발견되고, 이미 어느 정도 맥락을 가진 사람에게 읽히는 것이었다. 광고에서 본 브랜드, 이웃의 추천, 로컬 디렉터리의 리스팅 같은 맥락이다. 그 조건에서는 보기 좋고 빨리 로딩되는 웹사이트면 제 역할을 다한 것이었고, AI 가독성은 고려 대상이 아니었다.

감사에서 발견된 누출 대부분은 세 가지 기술적 문제로 설명된다.

1. 정적 폴백 없는 클라이언트 사이드 렌더링페이지 콘텐츠가 브라우저에서 자바스크립트가 실행된 뒤에만 존재하면, 정적 HTML을 파싱하는 검색 에이전트는 영영 보지 못한다. 이 연구에서 최악의 결과(콘텐츠 전무) 를 낳았다.

2. 아무도 확인하지 않는 페이지에 갇힌 진짜 사실이름이 명시된 리더십, 실제 연혁, 정책 페이지가 홈페이지가 아니라 2차 페이지에 몰려 있었다. 전면 재검증 패스에서 대부분이 잡혔다 — 이 간극을 놓치기가 얼마나 쉬운지, 그리고 실제로 들여다보면 얼마나 실재하는지에 대한 증거다.

3. 정본(canonical) 진실 소스의 부재 — 정체성이 여러 도메인·디렉터리에 흩어져 있거나, 죽은 정본 도메인이 살아 있는 소셜 존재와 공존하면 AI 시스템은 어느 소스를 믿을지 판단할 방법이 없다. 대개 그 사이트를 검증 가능하게 만드는 데 가장 많이 투자한 서드파티 플랫폼으로 기본 선택한다.

호텔과 골프 리조트 숙박에서는 이것이 서드파티 예약 리셀러가 자체 예약 페이지와 나란히 또는 그 위에 랭크되는 형태로 나타났다 — 수수료가 직접 붙는 버전의 누출이다.

감사 방법

식음료, 리테일, 전문 서비스, 기술, 농업, 헬스케어, 숙박, 골프에 걸친 검증된 사업체 71곳을 대상으로 구조화된 감사를 진행했다.

검색엔진이 수년간 품질과 랭크 자격을 평가하는 데 써온 원칙을 기반으로 한 E-E-A-T 채점 프레임워크의 압축판을 사용했다. AI 검색 시스템이 지금 정보를 신뢰하고 추출하는 방식에 맞춰 수정한 포인트 기반 진단이다.

전체 감사는 5개 카테고리, 총 500점으로 채점한다.

  1. 주 기업 엔티티 감사 (미션, 리더십 가시성, 연혁, 연락처)
  2. 기술적 기반 (HTTPS, 법적 페이지)
  3. 초기 데이터 수집 (백링크 품질, 소셜 신호, 콘텐츠 최신성)
  4. 시니어 엔티티
  5. 정책 페이지

압축판은 485점 척도로 채점했다. 500점 기준에서 코어 웹 바이털스용 15점을 뺀 것으로, 이 감사에는 그 툴링 접근 권한이 없었다. 모든 사업체를 같은 기준으로 채점했다.

E-E-A-T 점수 외 추가 점검 항목은 다음과 같다.

  • 사업체의 이름·주소·전화번호가 자사 사이트와 이를 참조하는 소스들에서 일관된가
  • 자사 도메인에서 실명의 실제 인물이 식별되는가
  • 사이트를 직접 페치했을 때 읽을 수 있는 텍스트가 반환되는가

이 저수준 AI 검색 가능성 점검은 누구나 돌릴 수 있게 설계됐다. 크롤 예산, 구조화 데이터 구현, 서버 인프라에 대한 심층 기술 감사가 아니다. 기술 배경이 없는 사람도 브라우저만으로 사업체당 5분 이내에 전부 손으로 수행할 수 있다.

초기 결과 이후 전면 2차 패스로 독립 재검증했다.

기본 점검으로 이 정도 크기의 간극을 찾을 수 있다면, 그 사업은 기술적 문제 때문에 뒤처지는 게 아니라 아무도 이 문제를 들여다보지 않았기 때문에 뒤처지는 것이다.

누출을 닫는 6가지 조치

이 감사의 거의 모든 사례에서 같은 몇 가지 개입이 간극을 닫았다.

1. 페이지에 실명의 사람을 올린다이 연구에서 가장 흔한 수정이다. 실제 이름이 담긴 "About the Owner", "Our Story", "Our Team" 페이지를 추가한다. 이미 2차 페이지에 있다면 홈페이지에서 링크되게 한다.

2. 중요한 콘텐츠는 서버 렌더링한다 — 완전 클라이언트 렌더링 사이트라면 핵심 사실(이름, 주소, 서비스, 리더십)에 대한 정적 폴백이 필요하다. 사람 방문자용 인터랙티브 경험은 그대로 둬도 된다.

3. 도메인 하나를 골라 거기에 전념한다 — 파편화·중복 도메인은 하나의 정본 주소로 통합하고 나머지는 전부 리다이렉트한다.

4. 도메인이 실제로 살아 있는지 확인한다기본처럼 들리지만 이 샘플의 최소 두 곳은 아니었다. 도메인이 조용히 만료되거나 재판매 목록에 올랐는데 아무도 알아채지 못했다.

5. 진짜 링크된 정책 페이지를 둔다개인정보처리방침과 이용약관은 AI 시스템이 가중치를 두는 신뢰 신호인데, 잘 만들어진 사이트에서도 항상 있지는 않았다.

6. 서드파티 리셀러가 자체 예약 페이지 근처나 위에 랭크되는지 확인한다 — 호텔처럼 거래형 예약 경로가 있는 사업이라면, 직접 경로가 최소한 리셀러만큼은 검증 가능하도록 해야 한다.

가장 점수가 높았던 곳들

이 연구에서 최고점을 받은 사업체들은 가장 수완이 좋거나 가장 공격적인 마케터가 아니었다. 투명해야 할 제도적 의무가 있어서 사이트를 시스템이 쉽게 읽을 수 있게 만들 수밖에 없었던 곳들이다.

규제받는 요양 시설, 공적 책임을 지는 비영리, 전담 총지배인이 있는 정부 마케팅 자산 등이다.

정체성 누출을 닫는 것은 비싸지도 어렵지도 않다. 대부분 알려지지 않았을 뿐이고, 어떻게 찾아보는지 아는가의 문제다.

실무 정리

첫째, 5분짜리 자가 점검부터 한다. 직접 페치 시 텍스트가 나오는가, 실명이 자사 도메인에 있는가, NAP이 일관된가. 툴 없이 브라우저만으로 된다.

둘째, "About" 페이지 위치를 옮긴다. 71곳 중 22곳이 정보를 갖고도 하위 페이지에 둬서 놓쳤다. 가장 싸고 가장 효과 큰 수정이다.

셋째, 자바스크립트 렌더링을 사업 리스크로 등록한다. AI를 판다면서 AI에게 안 읽히는 사이트가 실제로 있었다. 마케팅 사이트 리뉴얼 요구사항에 정적 폴백을 못 박아야 한다.

넷째, 도메인 만료를 모니터링 항목에 넣는다. 브랜드가 살아 있는데 도메인이 재판매 중인 사례가 이 작은 샘플에도 둘 있었다.

다섯째, 같은 진단을 프롬프트로 돌려본다. AI에게 직접 우리 사업을 설명해보게 하는 방법은 AI 엔티티 풋프린트 감사 — AI에게 우리 사업을 설명해보게 하라에 있다. 이 감사의 정성적 버전이다.

여섯째, 엔티티 관점으로 전환한다. AI가 키워드가 아니라 개념의 출처를 찾는다는 구조는 엔티티 SEO — AI 검색은 키워드가 아니라 개념의 출처를 찾는다에서 다뤘다.

일곱째, 로컬 사업은 페이지 수를 늘리지 않는다. 이 감사가 보여주듯 문제는 콘텐츠 양이 아니라 검증 가능성이다 — 로컬 SEO, 페이지 늘리기보다 '토픽 권위' 쌓기가 이긴다.

자주 묻는 질문

정체성 누출(identity leak)이란 무엇인가요?

사업에 관해 사실인 것과 AI 시스템이 확인할 수 있는 것 사이의 간극입니다. AI는 운영자·위치·업종·실재 여부 같은 검증 가능한 사실을 찾고, 못 찾으면 파편으로 추측하거나 답변에서 아예 제외합니다.

감사 결과는 어땠나요?

캐나다 PEI의 검증된 사업체 71곳 중 평균적으로 정체성의 84%가 누출됐고, 17%는 AI가 검색할 수 있는 디지털 존재가 전혀 없었습니다. 평균 사업체는 신뢰·검색 가능 요건의 15.6%만 충족했습니다.

누출의 기술적 원인은?

정적 폴백 없는 클라이언트 사이드 렌더링(추출 텍스트 0), 리더십·연혁·정책이 홈페이지가 아닌 2차 페이지에만 존재, 그리고 여러 도메인·디렉터리로 흩어져 정본 소스가 없는 상태 세 가지입니다.

어떻게 고치나요?

실명이 담긴 소개 페이지를 홈페이지에서 링크, 핵심 사실의 서버 렌더링 폴백, 정본 도메인 하나로 통합·리다이렉트, 도메인 생존 확인, 링크된 정책 페이지 추가, 서드파티 리셀러가 자체 예약 페이지 위에 랭크되는지 점검입니다.

어떤 사업체가 점수가 높았나요?

가장 수완 좋은 마케터가 아니라 투명해야 할 제도적 의무가 있어 사이트를 읽기 쉽게 만들 수밖에 없었던 곳들입니다 — 규제받는 요양 시설, 공적 책임을 지는 비영리, 전담 총지배인이 있는 정부 마케팅 자산 등입니다.

원문 출처: Search Engine Land

우리 사이트는 지금 어떤 상태일까요?

기사에서 본 내용을 우리 사이트에 대입해 보고 싶다면, 무료 진단으로 현재 상태부터 확인해 보세요.

영업일 기준 24시간 안에 담당자가 직접 답변드립니다.

함께 읽어보세요