서치버스강연 문의

인공지능 로봇을 들일지 막을지 정하는 법

최종 업데이트 2026년 9월 · 글 박정배

요점

  • 학습용 로봇(GPTBot, ClaudeBot)을 막으면 모델 학습 자료에서 빠지고, 검색용 로봇(OAI-SearchBot, Claude-SearchBot)을 막으면 챗지피티·클로드가 검색으로 만드는 답에서 빠진다. 오픈AI는 두 설정이 서로 독립이라고 적었다.
  • Google-Extended를 막으면 제미나이 학습과 제미나이 앱의 그라운딩(구글 검색 색인으로 답을 뒷받침하는 일)에서 빠진다. 구글 검색 노출과 순위에는 영향이 없다.
  • 구글 서치 콘솔의 「Google 검색 생성형 AI 제어」에서 제외를 고르면 AI 개요, AI 모드, 디스커버의 AI 기능에서 사이트가 빠진다. 구글은 이 설정을 다른 검색 결과의 순위 신호로 쓰지 않는다고 적었다.
  • 클라우드플레어를 쓰는 사이트는 대시보드의 AI 로봇 설정을 확인한다. 클라우드플레어는 2025년 7월 1일부터 새 사이트에서 AI 로봇을 기본으로 막았고, 2026년 7월 1일 기본값을 다시 나눴다.

로봇마다 하는 일이 다르다

오픈AI와 앤트로픽은 하는 일에 따라 로봇을 나눠 두었다. 로봇 배제 파일(robots.txt)에 로봇 이름을 적어 하나씩 들이거나 막을 수 있다.

회사로봇 이름하는 일막으면
오픈AIGPTBot생성형 AI 모델 학습 자료 수집오픈AI 모델 학습에 쓰이지 않는다
오픈AIOAI-SearchBot챗지피티 검색용 수집챗지피티 검색 답에 나오지 않는다. 오픈AI는 이동용 링크로는 나올 수 있다고 적었다
오픈AIChatGPT-User이용자가 대화 중 요청한 페이지를 그 자리에서 가져옴오픈AI는 이용자가 시작한 동작이라 robots.txt 규칙이 적용되지 않을 수 있다고 적었다
앤트로픽ClaudeBot모델 학습 자료 수집앤트로픽 모델 학습에 쓰이지 않는다
앤트로픽Claude-SearchBot검색 결과 품질을 위한 색인앤트로픽은 이용자 검색 결과에서 사이트의 노출과 정확도가 줄 수 있다고 적었다
앤트로픽Claude-User이용자 질문에 답하려고 페이지를 가져옴이용자가 시킨 웹 검색에서 사이트의 노출이 줄 수 있다
구글Google-Extended별도 로봇이 아니라 robots.txt에 적는 표지. 구글이 수집한 콘텐츠를 제미나이 학습과 그라운딩에 쓸지 정함제미나이 학습과 제미나이 앱의 그라운딩에 쓰이지 않는다. 구글 검색 노출과 순위에는 영향 없음

오픈AI는 GPTBot과 OAI-SearchBot 설정이 서로 독립이라고 적었다. 예를 들어 OAI-SearchBot은 허용해 검색 결과에 나오면서 GPTBot은 막아 학습에서 빠질 수 있다. robots.txt를 고친 뒤 검색 결과에 반영되기까지 24시간쯤 걸릴 수 있다. 앤트로픽은 자기 로봇들이 robots.txt 지시를 따르고, 크롤 지연(Crawl-delay) 확장도 지원하며, 캡차 같은 우회 방지 장치를 뚫으려 하지 않는다고 적었다.

사이트들이 AI 로봇을 막는 이유

옥스퍼드대 로이터저널리즘연구소가 열 나라의 주요 뉴스 사이트를 조사했더니 2023년 말 기준 48퍼센트가 오픈AI의 로봇을 막고 있었다. 사이트 주인들은 대가와 서버 비용을 두고는 학습용 로봇을, 방문자를 두고는 답을 만들 때 페이지를 읽어 가는 로봇을 문제 삼는다. 학습이 싫어서 GPTBot과 ClaudeBot을 막으면서 OAI-SearchBot과 Claude-SearchBot까지 한꺼번에 막는 설정도 있다.

가게 홈페이지의 선택지

가게 홈페이지는 언론사와 셈이 다르다. 기사는 읽히는 것 자체가 수입이지만, 가게 페이지는 읽힌 뒤 손님이 오는 것이 목적이다. 오픈AI는 검색 결과에 나오려면 OAI-SearchBot을 막지 말라고 안내한다.

모두 허용. robots.txt에서 어떤 로봇도 막지 않는다. 파일이 없어도 규칙을 지키는 로봇은 모두 허용으로 본다.

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

학습은 막고 검색은 허용. 학습용 로봇만 이름으로 막는다.

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

Google-Extended를 이 목록에 넣으면 제미나이 학습과 함께 제미나이 앱의 그라운딩에서도 빠진다. 제미나이의 답에 가게가 나오기를 바란다면 Google-Extended는 막지 않는다.

모두 막기. 가게 정보가 인공지능의 답에 쓰이지 않기를 바랄 때다. 이 경우 챗지피티와 클로드가 검색으로 만드는 답에도 가게 홈페이지가 쓰이지 않는다.

구글 AI 개요와 AI 모드는 따로 정한다

구글의 AI 개요와 AI 모드는 구글 검색 색인을 쓰므로 Google-Extended로는 뺄 수 없다. 구글은 2026년 8월 31일 서치 콘솔에 「Google 검색 생성형 AI 제어」 설정을 전 세계로 열었다.

이 설정은 영국 경쟁시장청이 2026년 6월 3일 구글에 부과한 행위 요건에서 나왔다. 경쟁시장청은 사이트가 자기 콘텐츠의 생성형 AI 사용을 통제할 수 있게 하라고 요구했다. 구글은 같은 날 영국의 일부 사이트에서 시험을 시작해 8월 31일 전 세계로 넓혔다. 서치 콘솔의 생성형 AI 실적 보고서로 설정을 바꾼 뒤 방문이 어떻게 달라졌는지 볼 수 있다.

클라우드플레어를 쓰는 사이트

홈페이지가 클라우드플레어를 거친다면 robots.txt와 별도로 클라우드플레어 대시보드의 AI 로봇 설정을 확인한다. 클라우드플레어는 2025년 7월 1일부터 새로 가입하는 사이트에서 AI 로봇을 기본으로 막고, 로봇이 페이지를 가져갈 때마다 값을 받는 유료 크롤(pay per crawl)을 내놓았다. 2026년 7월 1일에는 기본값을 다시 나눠, 광고가 붙은 페이지에서는 학습용 로봇과 에이전트 로봇을 막고 검색용 로봇은 모든 페이지에서 열었다. 새 도메인에는 2026년 9월 15일부터 이 기본값을 적용한다. 가게 주인이 모르는 사이에 검색용 AI 로봇이 막혀 있을 수 있으므로, 제작 업체에 클라우드플레어 사용 여부와 설정을 물어본다.

플랫폼 안의 가게 정보

가게 주인이 로봇 규칙을 정할 수 있는 곳은 자기 홈페이지뿐이다. 2026년 9월 확인한 네이버 지도의 robots.txt는 GPTBot, OAI-SearchBot, ClaudeBot, Claude-SearchBot, Google-Extended, PerplexityBot을 이름으로 막고, 배달의민족은 구글과 네이버의 로봇만 들인다. 이런 플랫폼에만 있는 가게 정보는 챗지피티와 클로드의 검색 로봇이 가져가지 못한다. 자세한 내용은 robots.txt 글에 있다.

공식 문서와 자료

  1. OpenAI 「Overview of OpenAI Crawlers」
  2. Anthropic 고객센터 「Does Anthropic crawl data from the web, and how can site owners block the crawler?」
  3. Google 검색 센터 「Google의 일반 크롤러」(Google-Extended)
  4. Search Console 고객센터 「Google 검색 생성형 AI 제어」
  5. 영국 경쟁시장청 「Google search: publisher conduct requirement」(2026년 6월 3일)
  6. Cloudflare 블로그 「Your site, your rules: New AI traffic options for all customers」(2026년 7월 1일)
  7. Cloudflare 블로그 「AI search crawl-to-refer ratio」
  8. Fletcher, R. (2024). How many news websites block AI crawlers? 로이터저널리즘연구소