들어가며
AI 크롤러의 세 가지 유형 — 이걸 구분해야 전략이 나온다
① 학습용 크롤러 (Training Crawlers)
- GPTBot (OpenAI)
- ClaudeBot (Anthropic)
- Google-Extended (Google — 뒤에서 설명하겠지만 실제 크롤러가 아니라 robots.txt 토큰입니다)
- CCBot (Common Crawl)
- Meta-ExternalAgent (Meta)
② 검색 인덱싱 크롤러 (Search/Retrieval Crawlers)
AI 검색 서비스가 실시간 답변에 사용할 인덱스를 구축하는 봇입니다. 이 인덱스에 있어야 AI 답변에서 인용될 수 있습니다.
- OAI-SearchBot (OpenAI — ChatGPT Search용)
- Claude-SearchBot (Anthropic — 2026년 신규 출시)
- PerplexityBot (Perplexity)
③ 사용자 요청 페처 (User-Triggered Fetchers)
사용자가 AI에게 질문했을 때, 실시간으로 특정 페이지를 가져오는 봇입니다.
- ChatGPT-User (OpenAI)
- Claude-User (Anthropic)
- Perplexity-User (Perplexity)
왜 이 구분이 중요한가
핵심은 이겁니다. 학습용 크롤러를 차단해도 AI 인용에는 영향이 없습니다. 하지만 검색 인덱싱 크롤러나 사용자 요청 페처를 차단하면 인용이 사라집니다.
예를 들어 GPTBot(학습용)을 차단하면 우리 콘텐츠가 GPT 모델 학습에 사용되지 않지만, ChatGPT Search에서의 인용에는 영향이 없습니다. 반대로 OAI-SearchBot을 차단하면 — OpenAI가 문서에 명시한 대로 — ChatGPT 검색 답변에 우리 사이트가 나타나지 않습니다.
"학습 데이터로는 쓰이기 싫지만 AI 검색에는 노출되고 싶다"는 조합이 가능한 겁니다. 이 구분 없이 일괄 차단하면 원치 않는 결과를 얻게 됩니다.
주요 사업자별 못 정리 (2026년 7월 기준)
OpenAI — 3종 체제
| 봇 | 용도 | 차단 시 영향 |
|---|---|---|
| GPTBot | 모델 학습 | 학습 데이터에서 제외. 인용에는 영향 없음 |
| OAI-SearchBot | ChatGPT Search 인덱싱 | ChatGPT 검색 답변에서 제외 |
| ChatGPT-User | 사용자 요청 실시간 페치 | 사용자가 링크를 요청해도 접근 불가 |
Anthropic — 2026년부터 3종 체제
| 봇 | 용도 | 차단 시 영향 |
|---|---|---|
| ClaudeBot | 모델 학습 | 학습 데이터에서 제외 |
| Claude-SearchBot | 검색 인덱싱 (2026년 신규) | Claude 검색 답변에서 제외 |
| Claude-User | 사용자 요청 실시간 페치 | 사용자 요청 시 접근 불가 |
Perplexity
| 봇 | 용도 |
|---|---|
| PerplexityBot | 검색 인덱싱 |
| Perplexity-User | 사용자 요청 페치 |
Google — 조금 특수한 구조
Googlebot — 검색과 AI 기능(AI Overviews, AI Mode)이 하나의 크롤러로 통합되어 있습니다. 즉, AI Overviews에서만 빠지고 일반 검색에는 남는 선택지가 없습니다. Googlebot을 차단하면 검색 자체에서 사라집니다.
Google-Extended — 실제 크롤러가 아니라 robots.txt 토큰입니다. 이걸 Disallow하면 Gemini 모델 학습에서 콘텐츠가 제외되는데, 일반 검색 순위에는 영향이 없습니다. "학습 거부 + 검색 유지"가 가능한 유일하게 깔끔한 레버입니다.
그 외 — Bytespider 문제
실전 robots.txt 전략
세 가지 기본 자세
전면 개방(Open by default) — 모든 주요 AI 봇을 허용합니다. AI 검색에서의 노출을 최대화하는 전략으로, 브랜드 노출이 중요한 B2B SaaS, 미디어, 콘텐츠 사이트에서 일반적입니다.
선택적 허용(Selective) — 검색·인용에 필요한 봇(OAI-SearchBot, Claude-SearchBot, PerplexityBot 등)은 허용하고, 학습 전용 크롤러(CCBot, 선택적으로 GPTBot)는 차단합니다. 노출은 유지하면서 학습 데이터 제공은 제한하는 절충안입니다.
전면 차단 — 모든 AI 봇을 차단합니다. 콘텐츠 유료화 모델이거나 저작권 보호가 최우선인 경우인데, AI 검색 생태계에서 완전히 사라진다는 걸 감수해야 합니다.
국내 서비스들은 어떻게 하고 있나 (2026년 7월 기준)
robots.txt는 누구나 확인할 수 있는 공개 파일입니다. 국내 주요 서비스들의 설정을 살펴보면, 전략적 분화가 뚜렷하게 보입니다.
네이버 — 명시적 전면 차단. 네이버는 메인 도메인(www.naver.com)부터 User-agent: * / Disallow: /로 사실상 모든 봇을 막고, 콘텐츠가 실제로 쌓이는 검색·블로그 도메인(search.naver.com, blog.naver.com)에서는 한발 더 나아갑니다. 이들 robots.txt에는 주석으로 "BOT ACCESS FOR THE PURPOSES OF AI TRAINING AND RETRIEVAL-AUGMENTED GENERATION (RAG) IS STRICTLY PROHIBITED"라고 명시하고, GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot, Claude-SearchBot, Google-Extended, CCBot 등 주요 AI 봇을 전부 개별 지정해서 차단합니다. 학습뿐 아니라 RAG(검색 인용) 목적의 접근까지 명시적으로 금지한다는 점이 특징입니다.
쿠팡 — 화이트리스트 방식 전면 차단. Googlebot, Yeti(네이버), Bingbot 같은 전통 검색 크롤러에게만 특정 경로를 허용하고, 마지막에 User-agent: * + Disallow: /로 나머지 모든 봇을 차단하는 구조입니다. AI 봇을 개별 지정하지 않고, 허용 목록에 없는 봇은 전부 막는 방식입니다.
무신사 — 화이트리스트형 개방. 무신사는 OAI-SearchBot, ChatGPT-User, Claude-User, Claude-SearchBot, Perplexity-User 같은 검색·사용자 요청 봇은 전면 허용하고, GPTBot·ClaudeBot·CCBot·Google-Extended 같은 학습용 봇까지 마이페이지·로그인 등 일부 사적 경로만 제외하고 허용합니다. 그리고 마지막에 User-agent: * / Disallow: /로 명단에 없는 봇을 전부 막습니다. 학습이냐 인용이냐로 가르기보다, 허용할 봇을 명시적으로 추린 화이트리스트에 가깝습니다.
탑텐 — 사실상 전면 개방. AI 학습·수집 크롤러(GPTBot, ClaudeBot, cohere-ai, Meta-ExternalAgent 등)까지 포함해서 대부분의 봇을 허용하고, 로그인·보안 경로만 차단하고 있습니다.
이 분화에는 패턴이 있습니다. 자체 콘텐츠 생태계와 트래픽 기반을 가진 플랫폼(네이버, 쿠팡)은 차단을 선택하고, AI 검색에서의 노출이 곧 유입 기회인 브랜드 커머스(무신사, 탑텐)는 개방을 선택하고 있습니다. 네이버 입장에서 AI 검색은 자사 검색 서비스의 경쟁자이고, 쿠팡 입장에서 콘텐츠는 앱 안에서 소비되는 자산이니까요. 반면 무신사나 탑텐 입장에서는 "10만 원 이하 러닝화 추천해줘"라는 질문에 자사 상품이 인용되는 게 이득입니다.
참고로 올해 초까지만 해도 네이버와 쿠팡이 AI 크롤러 접근을 일부 허용하고 있었는데, 이후 전면 차단으로 바뀌었습니다. 이 영역은 각 기업의 전략에 따라 계속 움직이고 있어서, 우리 서비스의 방향을 정할 때도 "지금 어떤 선택을 하는가"만큼 "언제든 다시 검토할 수 있는가"가 중요합니다.
한 가지 짚어둘 점은, 어느 쪽이 정답이라는 건 아니라는 겁니다. 비즈니스 모델에 따라 합리적인 선택이 달라지는 영역입니다. 다만 어느 쪽이든, 자기 사이트의 robots.txt가 실제로 어떤 상태인지 알고 내린 결정이어야 합니다. SEO 플러그인 기본값 때문에 의도치 않게 차단되어 있는 것과, 전략적으로 차단을 선택한 것은 완전히 다른 이야기니까요.
AI 노출을 원한다면 — 권장 설정 예시
# OpenAI
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
# Anthropic
User-agent: ClaudeBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
# Perplexity
User-agent: PerplexityBot
Allow: /
# 민감한 경로는 공통으로 차단
User-agent: *
Disallow: /admin/
Disallow: /checkout/
Disallow: /api/
"학습은 거부, 인용은 유지"를 원한다면
# 학습용 크롤러 차단
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
# 검색·인용용 봇은 허용
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
주의할 점들
SEO 플러그인의 기본값을 확인하세요. WordPress나 Shopify의 일부 SEO 플러그인이 2024~2025년에 "AI 봇 차단" 토글을 추가하면서 기본값을 켜둔 경우가 있습니다. 의도치 않게 AI 검색에서 사라진 사이트들이 이 케이스인 경우가 많습니다. 우리 사이트의 robots.txt를 실제로 열어서 확인해보는 게 좋습니다.
robots.txt는 신사협정입니다. 강제력이 없습니다. Bytespider처럼 무시하는 봇에게는 서버 레벨 차단(WAF, CDN 봇 관리)이 필요합니다. 정말 보호해야 할 콘텐츠라면 robots.txt 선언만으로는 부족합니다.
봇 검증은 역방향 DNS로. User-Agent 문자열은 누구나 위조할 수 있습니다. 로그에서 특정 봇의 진위를 확인하려면 역방향 DNS 조회(reverse DNS lookup)로 실제 해당 사업자의 IP 대역인지 확인해야 합니다.
Agentic Experiences — 크롤러 다음에 오는 것
Universal Commerce Protocol (UCP)
2026년 1월, Google이 NRF(전미소매협회) 컨퍼런스에서 Universal Commerce Protocol(UCP)을 발표했습니다. AI 에이전트가 이커머스 사이트와 소통하고 사용자 대신 구매까지 완료할 수 있게 하는 오픈소스 표준입니다. Shopify, Etsy, Wayfair, Target, Walmart 같은 리테일 기업들과 공동 개발했고, Visa, Mastercard, Stripe, PayPal 같은 결제 사업자들이 참여하고 있습니다.
사용자가 Gemini에게 "10만 원 이하 러닝화 찾아줘"라고 하면, AI 에이전트가 여러 리테일러의 상품을 검색·비교해서 제시하고, 사용자가 승인하면 구매까지 완료하는 흐름입니다. 2026년 5월에는 Universal Cart(리테일러 간 장바구니 통합)가 발표됐고, 호텔 예약과 음식 배달 같은 새로운 버티컬로도 확장되고 있습니다.
프론트엔드 개발자에게 의미하는 것
이 흐름에서 흥미로운 지점이 있습니다. AI 에이전트는 사람보다 데이터 불일치에 민감합니다.
사람은 상품 페이지의 가격과 피드의 가격이 조금 달라도 눈치 못 챌 수 있지만, AI 에이전트는 바로 잡아냅니다. 반품 정책이 페이지마다 다르게 적혀 있으면, 에이전트는 그 사이트를 신뢰할 수 없는 소스로 판단할 수 있습니다.
그래서 에이전트 시대의 사이트 관리 포인트는 이렇게 정리됩니다.
- 상품 정보가 사이트, 피드(Merchant Center), 외부 채널에서 일관되는가
- 배송·반품·고객지원 정보가 모든 위치에서 일치하는가
- 구조화 데이터(4편)가 실제 페이지 내용과 정확히 일치하는가
- 결제·예약 흐름이 에이전트가 진입해도 무리 없는 구조인가
결국 이것도 새로운 기술이라기보다, 이 시리즈에서 계속 다뤄온 원칙의 연장입니다. 정확하고 일관된 정보를, 기계가 이해할 수 있는 구조로 제공하는 것. 크롤러에게든, AI에게든, 에이전트에게든 같은 원칙이 적용됩니다.
시리즈를 마치며 — SEO 없이 GEO는 없다
여섯 편에 걸쳐 다뤄온 내용을 한 줄로 정리하면 이렇습니다.
1편에서 SEO가 왜 여전히 중요한지, 그리고 AI 검색 시대에 GEO라는 관점이 왜 필요해졌는지를 다뤘습니다. 2편에서는 크롤러가 사이트를 발견하는 과정을, 3편에서는 AI가 인용하고 싶어하는 콘텐츠 구조를, 4편에서는 구조화 데이터를, 5편에서는 성능을, 그리고 이번 편에서는 AI 크롤러 접근 제어와 에이전트 시대를 다뤘습니다.
돌아보면 전부 연결되어 있습니다. robots.txt가 잘못되면 크롤링이 안 되고, 크롤링이 안 되면 인덱싱이 안 되고, 인덱싱이 안 되면 검색에도 AI 답변에도 나올 수 없습니다. Google이 공식 가이드에서 확인해준 것처럼, AI 검색은 기존 검색 인덱스를 기반으로 작동하니까요. 헤딩 구조가 엉망이면 검색엔진도 AI도 콘텐츠를 이해하기 어렵고, 성능이 나쁘면 사용자도 크롤러도 떠납니다.
SEO와 GEO를 별개로 보면 판단을 놓칩니다. FAQPage 스키마가 좋은 예였습니다 — SEO 관점만 보면 리치 결과가 종료됐으니 빼도 되지만, GEO 관점까지 보면 AI 인용 신호로 유지하는 게 맞습니다. 반대로 GEO만 좇으면 기반 없이 지붕을 올리는 셈이 됩니다. llms.txt 같은 비공식 트렌드에 시간을 쓰는 것보다, robots.txt와 sitemap을 정확히 설정하는 게 훨씬 실질적입니다.
두 가지를 함께, 하나의 흐름으로 보는 것. 그게 이 시리즈에서 전하고 싶었던 핵심입니다.
긴 시리즈 읽어주셔서 감사합니다. 이 글이 검색과 AI의 경계가 흐려지는 시대에, 우리가 만드는 웹페이지를 조금 더 잘 이해받게 만드는 데 도움이 됐으면 좋겠습니다.
참고 자료
- Google Search Central — Optimizing your website for generative AI features on Google Search
- OpenAI — Overview of OpenAI Crawlers
- Anthropic — Claude 크롤러 문서
- Perplexity — PerplexityBot 문서
- Cloudflare — Perplexity의 미신고 스텔스 크롤링 관련 조사
- Google Search Central — Google 크롤러 및 Google-Extended
- Google Developers Blog — Under the Hood: Universal Commerce Protocol (2026.01.11)
- Google Blog — Google Shopping: Universal Cart & agentic shopping (2026.05)
- Search Engine Land — Google expands Universal Commerce Protocol (2026.05)
- Cloudflare — From Googlebot to GPTBot: Who's crawling your site in 2025
- Cloudflare — The crawl-to-click gap: AI bots, training, and referrals (2026)
- 본문에서 분석한 국내 서비스 robots.txt (2026년 7월 확인): 네이버 검색 · 블로그, 쿠팡, 무신사, 탑텐/굿웨어몰