블로그로 돌아가기
AI SEO

AI 검색을 위한 기술 SEO 4가지 — robots.txt부터 엔티티 일관성까지

AI 검색을 위한 기술 SEO 4가지 — robots.txt부터 엔티티 일관성까지

링크드인 피드가 뭐라고 하든, AI 리트리벌은 새로운 분야가 아니다. 이미 모범 사례였던 기술 SEO 기본기에 대한 스트레스 테스트다.

AI 가시성에 어려움을 겪는 웹사이트는 대개 오랫동안 검색 순위를 떨어뜨려 온 것과 같은 기술적 문제의 영향을 받고 있다. 검토할 항목이 몇 개 추가되긴 했지만, 웹사이트를 AI 가시성 측면에서 기술적으로 건전하게 만드는 데 대단한 비밀은 없다.

AI 시스템이 우리 사이트를 크롤링하고, 이해하고, 인용할 수 있도록 검토할 네 가지 기술 요소를 정리한다.

1. 크롤 가능성과 봇 접근

AI 어시스턴트의 부상으로 크롤러 생태계는 구글봇과 빙봇 너머로 확장됐다. 오픈AI, 앤스로픽, 퍼플렉시티가 각각 여러 봇을 운영한다. 일부는 모델 학습용, 일부는 리트리벌용, 일부는 이용자가 시작한 질의용이며, 각각 다른 동작과 다른 함의를 갖는다.

그런데 많은 사이트가 여전히 수년 전에 마지막으로 업데이트된 robots.txt에 의존한다. 지금은 가시성을 얻고 싶은 바로 그 봇들을 무심코 차단하고 있는 것이다.

현대 AI 크롤러 지형

AI 시스템은 단일 봇에 의존하지 않는다. 목적이 구분된 크롤러 패밀리를 쓴다.

예를 들어 앤스로픽에는 ClaudeBot, Claude-SearchBot, Claude-User가 있다. ClaudeBot은 학습용이고, Claude-SearchBot과 Claude-User는 리트리벌과 브라우징을 담당한다.

일부 AI 리트리벌 봇은 전통적 검색 크롤러보다 온디맨드 브라우저처럼 동작한다. 리트리벌 봇은 이용자가 질문할 때 실시간으로 페이지를 가져오고, 학습 봇은 모델 지식을 구축하기 위해 광범위하게 크롤링한다. 따라서 각각을 다르게 다뤄야 한다.

어떤 봇을 허용할지는 사업 판단이다

  • 뉴스·퍼블리셔: 콘텐츠가 생명줄이므로 AI를 차단하는 선택을 자주 한다. AI 시스템이 원출처로 방문자를 돌려보내지 않고 콘텐츠를 사용할 수 있다는 우려 때문이다.
  • 규제 산업(법률 서비스 등): 컴플라이언스 우려로 AI 크롤러를 차단하기도 한다.
  • 세 번째 그룹: 의도치 않게 차단한다. 수년 전에 쓰인 robots.txt를 그대로 쓰는 사이트가 많아, 학습 크롤러를 차단하려다 리트리벌 봇까지 걸리거나 그 반대인 규칙이 드물지 않다.

결과는 눈에 보이지 않는다. AI 시스템이 이용자 질의 중에 페이지를 가져올 수 없고, 전통적인 검색 순위 하락 같은 신호도 없다. 그냥 AI 답변에서 부재할 뿐이다.

수정 방향: robots.txt 구성이 실제 의도를 반영하는지 확인한다. AI 리트리벌 에이전트에게 발견되고 싶다면 1급 크롤러로 취급한다. 학습 크롤러를 차단하고 싶다면 명시적으로 차단하되 같은 규칙에 리트리벌 에이전트가 걸리지 않는지 검증한다.

2. 자바스크립트 렌더링: 조용한 살인자

자바스크립트 렌더링은 AI 가시성에서 가장 간과되는 기술적 위험이다. 주요 AI 크롤러 중 어느 것도 자바스크립트를 렌더링하지 않는다.

브라우저에서 주입되는 모든 콘텐츠 — 스키마, 텍스트, 제품 상세, 핵심 메타데이터 — 는 구글과 다른 검색엔진이 페이지를 완벽하게 색인하더라도 AI 시스템에는 보이지 않을 수 있다.

왜인가. 현대 싱글 페이지 애플리케이션(SPA)은 핵심 콘텐츠를 클라이언트 측에서 렌더링하는 경우가 많다. 서버 응답이 껍데기만 담고 있고 자바스크립트가 나중에 콘텐츠를 채운다면, JS를 실행하지 않는 AI 크롤러는 껍데기만 본다.

일부 크롤러는 비용·지연·복잡도를 줄이기 위해 의도적으로 JS 실행을 피한다. 크롤러가 자바스크립트를 실행할 수 있는 경우에도 속도 제한, 타임아웃, 헤드리스 브라우저 차이가 불완전한 렌더링을 만들 수 있다. 클라이언트 사이드 렌더링은 핵심 콘텐츠의 신뢰할 만한 전달 방법이 아니다.

예를 들어 콘텐츠와 스키마를 클라이언트 측에서 주입하는 리액트 SPA는 구글에서는 잘 작동하면서 AI 리트리벌 시스템에는 보이지 않을 수 있다. AI 크롤러는 거의 빈 페이지를 본다.

수정 방향: 핵심 콘텐츠에는 서버 사이드 렌더링(SSR), 정적 사이트 생성(SSG), 또는 하이브리드 렌더링을 사용한다. HTML 응답에 정식 텍스트, 헤딩, 구조화 데이터가 포함되도록 한다.

이 문제는 실측으로도 확인됐다. 41일간 크롤러 로그를 기록한 실험에서 GPTBot·ClaudeBot 등 8개 크롤러가 자바스크립트로 주입된 링크를 단 한 건도 따라가지 못했다.

3. 구조화 데이터와 명료성

AI 리트리벌 시스템이 성장하면서, 이들은 HTML 안에 내장된 구조화 신호에 크게 의존한다. 많은 AI 크롤러가 자바스크립트를 실행하지 않기 때문에, 서버 측에서 전달되는 스키마 마크업이 AI 시스템에 페이지 내용을 이해시키는 신뢰할 만한 방법이다.

구조화 데이터는 명시적 의미를 준다

구조화 데이터는 AI 시스템에 엔티티가 정확히 무엇인지, 다른 엔티티와 어떻게 관련되는지, 무엇이 중요한지를 알려 준다.

GPTBot, ClaudeBot, PerplexityBot이 페이지를 가져올 때 원시 HTML만 볼 수 있다. 스키마가 리액트나 뷰 같은 SPA 프레임워크로 클라이언트 측에서 주입되면 크롤러는 그것을 보지 못한다. 엔티티 인식도, 사실 추출도, AI 생성 답변에 포함되는 일도 일어나지 않는다.

사실 정확성이 올라간다

AI 시스템은 오해를 피하기 위해 명확하고 기계가 읽을 수 있는 신호에 의존한다. Schema.org 마크업은 정식 이름, 가격, 날짜, 저자, 제품 속성, 관계를 제공한다. 모호성을 줄여 AI가 우리 콘텐츠를 정확히 인용하거나 요약하도록 돕는다.

규칙은 단순하다. AI 시스템이 이해하기를 바라는 정보를 자바스크립트에 의존해 전달하지 않는다.

수정 방향: 스키마 마크업 코드가 서버 측에서 렌더링돼 초기 HTML 응답에 보이는지 감사한다. 핵심 구조화 데이터가 자바스크립트 실행 없이 접근 가능한지 확인한다. AI 크롤러 사용자 에이전트로 페이지를 가져와 검증한다.

4. 엔티티 일관성

브랜드가 일관되게 단일 엔티티로 표현될 때 AI 시스템은 그것을 식별하고 정확히 서술할 명확한 기반을 갖는다. 이건 구글 지식 그래프만의 문제가 아니다. 앤스로픽, 오픈AI, 마이크로소프트 모두 안정적이고 모호하지 않은 브랜드 정체성에 의존하는 내부 엔티티 레이어를 유지한다.

이 과제의 한 부분은 로컬 SEO의 오래된 NAP 일관성 문제를 브랜드 규모로 옮긴 것과 같다. 불필요한 이름 변형을 최소화하고, 피할 수 없는 관계는 명시적으로 만든다.

웹사이트, 스키마, 디렉터리, 소셜 프로필, 외부 목록에 걸쳐 브랜드 이름이 일관되지 않으면 엔티티 파편화가 발생한다. 'Acme', 'Acme Co.', 'Acme Inc.' 같은 변형이 불가피하다면 일관된 구조화 데이터와 권위 있는 외부 프로필을 통해 연결한다.

수정 방향: 브랜드 참조를 감사해 철자, 구두점, 대문자 사용, 법인명 사용을 가능한 한 표준화한다. 그리고 위키데이터, 링크드인, 크런치베이스 같은 정식 외부 노드로 향하는 sameAs 링크로 그 정체성을 강화한다. 이들은 그라운딩 앵커 역할을 하며 AI 시스템이 변형들을 하나의 권위 있는 엔티티로 합치도록 돕는다.

검증하고, 테스트하고, 반복한다

기술적 수정은 크롤러가 최종 결과에 접근하고 해석할 수 있을 때만 가치가 있다.

  • 자바스크립트가 실행되기 전에 핵심 카피, 헤딩, 내부 링크, 구조화 데이터가 존재하는지 주요 페이지를 검사한다
  • robots.txt, 메타 로봇 지시자, 상태 코드, 리다이렉트, 방화벽 규칙 전반에서 접근을 테스트한다
  • 서버 로그로 AI 크롤러가 페이지에 도달해 성공 응답을 받고 있는지 확인한다
  • 스키마 마크업 검증기와 구글 리치 결과 테스트로 구조화 데이터를 검증한다
  • AI 가시성을 전통적 순위와 분리해 추적한다. 일관된 프롬프트 세트로 브랜드 언급, 인용, 출처 페이지, 사실 정확성을 모니터링한다. 개별 응답은 변동하므로 일회성 확인이 아니라 시간에 따른 패턴에 집중한다

마지막 항목은 특히 중요하다. 같은 질의를 반복해도 인용 출처가 40%가량만 겹친다는 로컬 AI 검색 조사가 보여 주듯, 단발 측정은 성과 지표가 될 수 없다. 추적 항목 전반은 2027 SEO 우선순위에서 정리한 감사 순서와 함께 묶어 두는 편이 관리하기 쉽다.

핵심 정리

  1. robots.txt, 방화벽, 접근 통제가 학습·리트리벌 크롤러에 대한 실제 정책을 반영하게 한다
  2. 핵심 콘텐츠나 구조화 데이터를 자바스크립트에 의존해 전달하지 않는다
  3. 관련 스키마 마크업을 사용하고 초기 서버 응답에 포함한다
  4. 웹사이트, 구조화 데이터, 프로필, 권위 있는 외부 출처 전반에서 일관된 브랜드 엔티티를 유지한다
  5. 원시 HTML 검사, 크롤러 테스트, 스키마 검증, 반복 가능한 AI 인용 추적으로 구현을 검증한다

정리

AI 가시성은 새로운 분야처럼 느껴지지만 기술 요구사항은 익숙하다. 검색엔진과 AI 리트리벌 시스템 모두 접근 가능한 페이지, 명확한 정보, 일관된 엔티티, 기계가 읽을 수 있는 신호를 필요로 한다. 차이는 많은 AI 크롤러가 렌더링 역량이 적고 모호함에 대한 관용이 낮다는 것뿐이다.

목표는 모든 크롤러를 개별 최적화하거나 새 AI 플랫폼을 쫓는 것이 아니다. 가장 중요한 정보를 명확하게 노출하는, 기술적으로 견고한 웹사이트를 만드는 것이다.

자주 묻는 질문

AI 크롤러는 왜 robots.txt 점검이 중요한가?

AI 시스템은 학습용, 리트리벌용, 이용자 질의용 봇을 각각 운영합니다. 수년 전에 쓰인 규칙은 학습 크롤러를 막으려다 리트리벌 봇까지 차단하기 쉬우며, 그 결과는 순위 하락이 아니라 AI 답변에서의 부재로 나타납니다.

AI 크롤러는 자바스크립트를 렌더링하나?

주요 AI 크롤러는 자바스크립트를 렌더링하지 않습니다. 클라이언트 측에서 주입된 텍스트, 스키마, 제품 상세는 구글이 잘 색인하더라도 AI 시스템에는 보이지 않을 수 있습니다.

구조화 데이터는 어디에 있어야 하나?

초기 HTML 서버 응답 안에 있어야 합니다. SPA 프레임워크로 클라이언트 측에서 주입하면 AI 크롤러가 보지 못해 엔티티 인식과 인용 대상에서 제외됩니다.

엔티티 일관성은 왜 중요한가?

앤스로픽, 오픈AI, 마이크로소프트 모두 내부 엔티티 레이어를 유지하며 안정적인 브랜드 정체성에 의존합니다. 이름 변형이 흩어지면 엔티티가 파편화되므로 표준화하고 위키데이터·링크드인 등으로 sameAs 링크를 연결해야 합니다.

원문 출처: Search Engine Land

우리 사이트는 지금 어떤 상태일까요?

기사에서 본 내용을 우리 사이트에 대입해 보고 싶다면, 무료 진단으로 현재 상태부터 확인해 보세요.

영업일 기준 24시간 안에 담당자가 직접 답변드립니다.

함께 읽어보세요