25년 차 검색 베테랑이 보는 AI 시대 SEO — 도구는 다 바뀌어도 임무는 그대로다
AI 시대 SEO는 다시 무법지대가 됐다. 마이크로소프트 빙에서 10년을 보낸 듀언 포레스터는 최전선 추격을 포기하고 '큰 덩어리'에 집중하라고 말한다. 실무자가 지금 버려야 할 습관들.

SEO의 인크리멘털리티 테스트는 단순하게 들린다. 변경하고, 임팩트를 측정하고, 대조군과 비교하고, 이긴 쪽을 배포하고, 반복한다.
그러나 테스트는 시작도 하기 전에 테스팅 프레임워크의 결함 때문에 무너지는 경우가 많다.
10년간 평균 성공률 70%로 SEO 테스팅 프로그램을 이끌어온 저자는 신뢰할 수 있고 실행 가능한 결과는 그 변경이 실제로 가치를 만들었는지 보여줄 수 있는 방법론에 달려 있다고 말한다.
| 방법 | 무엇을 하나 | 한계 |
|---|---|---|
| A/B 테스트(스플릿 테스트) | 사용자를 같은 페이지의 다른 버전으로 보낸다 | UX·CRO에는 훌륭하지만 순위 임팩트를 분리하지 못한다 |
| 사전/사후 테스트 | 같은 페이지에서 변경 전후 성과를 비교한다 | 단순하고 빠르지만 SEO에서 가장 신뢰도가 낮다. 계절성·알고리즘 업데이트·경쟁사 변화 같은 외부 변수를 자동으로 통제할 수 없다 |
| 인크리멘털리티 테스트 | 특정 변경을 가한 페이지 그룹을 같은 기간 동안 변경하지 않은 유사 페이지 대조군과 비교한다 | SEO의 골드 스탠더드 — 단일 변수의 임팩트를 분리한다 |
두 그룹 간 성과 차이가 그 변경이 실제로 순위·가시성·트래픽에 영향을 줬는지 보여준다. 전후 데이터로 발견을 뒷받침할 수도 있다.
A/B 테스트를 쓸 때
사전/사후 또는 인크리멘털 테스트를 쓸 때
좋은 가설과 적절한 테스트 계획을 세우는 것이 효과적인 SEO 테스팅의 핵심이다. 각 테스트에서 더 많이 배울수록 다음 가설을 더 잘 세우게 된다.
오류에 덜 취약한 엄밀한 가설의 조건은 네 가지다.
예를 들어, 트래픽이 적은 몇 개 페이지의 중간에서 한 단어를 바꾸는 것은 정식 테스트를 할 가치가 없을 만큼 작을 것이다. 그러나 월 100세션 이상인 30개 페이지의 H1에서 한 단어를 4주간 바꾸는 것은 트래픽과 순위에 측정 가능한 임팩트를 낼 수 있다.
가설을 세울 때 최선과 최악의 결과를 함께 고려하라. 최악의 시나리오에는 페이지 로딩 실패, 추적 미작동, 전환·매출 하락이 포함될 수 있다. 각 시나리오의 가능성을 따져보고, 문제가 되기 전에 완화 전략과 프로세스를 준비하라.
라이브 또는 되돌리기의 리스크와 노력이 낮다면, 더 넓게 테스트하거나 가능한 곳에 전부 롤아웃하고 이후에 결과를 측정하는 것을 고려하라.
인크리멘털 테스트는 같은 시점에 특정 변경을 가한 명확한 테스트 페이지 세트를, 그 변경을 받지 않은 대조 페이지와 비교한다. 그러면 다음을 비교할 수 있다.
적절한 대조군이 없어도 사전/사후 테스트는 돌릴 수 있다. 전후 결과를 비교하기 때문이다. 더 많은 페이지로 롤아웃할 수 있다면, 롤아웃 중에 결과가 일관되는지 확인할 수 있다.
사이트의 통상 성과와 성과 리포트 읽는 법에 대한 감각이 없으면 제대로 하기 어려운, 테스팅에서 가장 까다로운 부분 중 하나다.
일부 테스트에는 후속 테스트가 따라온다. 관련 콘텐츠에 같은 변경을 적용하거나, 배운 것을 바탕으로 가설을 확장하는 식이다. 특정 카피가 우리 오디언스에게 잘 통한다는 것을 발견하면, 테스트해볼 유사 표현에 대한 인사이트를 얻을 수 있다.
작은 배치에서 먼저 테스트한다면, 전면 롤아웃 전에 결과를 확신할 만큼 충분한 테스트 페이지를 포함하라. 가설이 제품 카테고리 페이지와 제품 리뷰 페이지 모두에 적용될 수 있다고 생각한다면, 초기 테스트에 두 유형의 페이지를 함께 넣어라.
롤아웃도 결과를 확인해준다. 롤아웃을 또 하나의 테스트처럼 다루고, 첫 라운드에서 측정한 것을 모두 똑같이 측정한 뒤 첫 라운드 결과와 비교하라.
테스트가 기대에 못 미쳤다면? 모든 테스트가 계획대로 되지는 않는다는 점을 예상하라. 변경을 되돌리고, 그 테스트에서 배운 것을 미래의 가설에 적용하면 된다.
마지막 단계다. 성과 결과를 확정한 뒤의 후속 커뮤니케이션은 발견을 알리고, 다른 이들이 새 아이디어를 시도하도록 독려하고, 테스트에 받은 도움을 인정하는 데 도움이 된다.
성공적인 SEO 테스팅 프로그램은 모든 테스트를 승리로 만드는 것이 아니다. 왜 성과가 바뀌었는지 알고, 다음에 무엇을 할지 결정할 만큼 결과에 확신을 갖는 것이다.
더 강한 방법론은 변경의 임팩트를 분리하고 더 신뢰할 수 있고 실행 가능한 결과를 만들도록 돕는다. 기대에 못 미친 테스트조차 유용한 인사이트를 주고, 다음 가설을 날카롭게 하며, 무엇을 테스트하거나 롤아웃할지 결정하는 데 도움이 된다.
첫째, A/B 테스트로 순위를 측정하지 않는다. 가장 흔한 방법론 오류다. A/B는 UX·CRO용이고, 순위 임팩트 분리에는 인크리멘털리티 테스트가 필요하다.
둘째, 가설을 4가지 기준으로 검사한다. 실행 가능·일관됨·측정 가능·충분함. "트래픽 적은 몇 페이지의 한 단어"는 이 중 어느 것도 충족하지 못한다.
셋째, 금요일 배포 금지를 규칙으로 못 박는다. 리스크 완화 목록 중 가장 실무적이면서 가장 자주 어겨지는 항목이다.
넷째, 매출 최상위 페이지부터 테스트하지 않는다. 가장 큰 효과를 보고 싶은 유혹이 정확히 가장 큰 리스크가 된다.
다섯째, 결과를 필터링해서 본다. 전체 숫자만 보면 8개가 나빠졌는데 2개 때문에 이긴 것처럼 보이는 상황을 놓친다.
여섯째, 인과와 상관을 구분하는 프레임을 유료 채널과 공유한다. 같은 논리가 어트리뷰션과 인크리멘털리티는 다른 질문에 답한다 — 둘 다 필요한 이유에 있다.
일곱째, 테스트 대상을 우선순위로 고른다. 무엇부터 손댈지는 SEO 기술부채, 고칠 것과 무시할 것 — 크롤러가 준 10,001개 문제 앞에서의 채점 프레임과 함께 쓰면 좋다.
여덟째, 하락 감지와 테스트를 구분한다. 순위가 조용히 빠지는 것은 테스트 결과가 아니다 — 순위가 조용히 빠지는 페이지를 살리는 법 — 56일 창과 4단계 태깅에서 다뤘다.
A/B 테스트는 UX·CRO에 적합하지만 순위 임팩트를 분리하지 못합니다. 사전/사후는 빠르지만 계절성·알고리즘 업데이트·경쟁사 변화를 통제하지 못합니다. 인크리멘털리티 테스트가 단일 변수의 임팩트를 분리하는 SEO의 골드 스탠더드입니다.
실행 가능(충분한 세션·클릭과 유의미한 크기의 변경), 일관됨(여러 페이지에 같은 변경), 측정 가능(추적과 성과 데이터 확보), 충분함(순위·가시성 임팩트를 볼 만큼 긴 기간) 네 가지입니다.
여러 브라우저·기기 QA, 한 페이지에서 시작해 3일 뒤 추적 확인 후 확대, 금요일 배포 금지, 매출 최상위 페이지 회피, 주 단위 이상 점검, 사전 수립한 롤백 플랜, 성수기 전 충분한 시간 확보입니다.
모든 데이터(세션은 늘었는데 전환율이 떨어졌는지), 데이터 검증, 표면보다 깊이(엉뚱한 키워드나 저품질 리드), 필터링(데스크톱과 모바일 차이), 그리고 소수의 고트래픽 페이지가 전체를 왜곡하는 이상치입니다.
기사에서 본 내용을 우리 사이트에 대입해 보고 싶다면, 무료 진단으로 현재 상태부터 확인해 보세요.
영업일 기준 24시간 안에 담당자가 직접 답변드립니다.
AI 시대 SEO는 다시 무법지대가 됐다. 마이크로소프트 빙에서 10년을 보낸 듀언 포레스터는 최전선 추격을 포기하고 '큰 덩어리'에 집중하라고 말한다. 실무자가 지금 버려야 할 습관들.

구글 검색 파비콘이 기본 지구본 아이콘으로 바뀌는 오류가 일주일째다. 구글은 자사 버그임을 인정하고 수정 중이라고 밝혔다. CTR이 흔들리는 이 구간에 마케터가 확인할 것과 하지 말아야 할 것.

2027 SEO 전략은 순위가 아니라 이해·신뢰·인용으로 이동한다. AI 응답 엔진 대응, E-E-A-T, 브랜드 언급, 제로클릭 대응까지 우선순위를 정리했다.