서치버스강연 문의

로봇 배제 파일(robots.txt) 읽고 고치는 법

최종 업데이트 2026년 9월 · 글 박정배

요점

  • 로봇 배제 파일은 사이트 맨 위 경로의 robots.txt다. 주소/robots.txt를 브라우저로 열면 누구나 내용을 볼 수 있다.
  • User-agent: * 아래 Disallow: /가 있으면 규칙을 지키는 모든 로봇이 사이트 전체를 가져가지 않는다.
  • 파일이 없으면(404) 구글과 네이버 모두 전부 허용으로 본다. 서버 오류(5xx)가 나면 네이버는 전부 금지로 해석하고, 구글은 처음 12시간 동안 크롤링을 멈춘다.
  • 구글은 robots.txt를 검색 결과에서 페이지를 숨기는 수단으로 쓰지 말라고 적었다. 숨기려면 noindex나 비밀번호를 쓴다.

로봇 배제 파일이란

웹사이트는 맨 위 경로에 robots.txt라는 글 파일을 두고 로봇에게 어디를 가져가도 되는지 적는다. 1994년 네덜란드 개발자 마틴 코스터가 제안한 관행으로 시작했고, 국제인터넷표준화기구(IETF)가 2022년 9월 RFC 9309라는 번호를 붙여 표준으로 발행했다. 강제력은 없다. 구글, 네이버, 오픈AI, 앤트로픽은 자기 로봇이 이 파일의 규칙을 따른다고 문서에 적었다.

네이버 서치어드바이저 안내에 따르면 광고주 정보 확인이나 링크 미리보기처럼 특수한 용도의 로봇은 규칙을 완전히 지키지 않을 수 있다. 공개하면 안 되는 내용은 로그인 같은 다른 방법으로 막아야 한다.

우리 가게 파일 열어 보기

  1. 브라우저 주소창에 가게 홈페이지 주소 뒤에 /robots.txt를 붙여 연다. 예: https://example.com/robots.txt
  2. 「페이지를 찾을 수 없음」이 나오면 파일이 없는 것이다. 구글은 429를 뺀 4xx 응답을, 네이버는 4xx 응답을 파일이 없는 것으로 보고 모두 허용으로 처리한다.
  3. 파일이 열리면 아래 표와 한 줄씩 맞춰 본다.
줄뜻
User-agent: *이름을 따로 적지 않은 모든 로봇에게 하는 말
User-agent: Googlebot구글 검색 로봇에게만 하는 말. 네이버 로봇은 Yeti, 빙은 Bingbot
Disallow: /사이트 전체를 가져가지 말라
Disallow: /admin//admin/으로 시작하는 주소만 막는다
Allow: /전체를 가져가도 된다
Allow: /$첫 화면 주소 하나만 허용한다($는 주소의 끝)
Sitemap: https://example.com/sitemap.xml사이트맵이 있는 곳을 알린다

User-agent 한 줄과 그 아래 Disallow·Allow 줄들이 한 묶음이다. 로봇은 자기 이름이 적힌 묶음을 찾고, 없으면 * 묶음을 따른다.

막히는 모양과 원인

전체 차단. 아래 두 줄이 있으면 규칙을 지키는 모든 로봇이 사이트 전체를 가져가지 않는다. 제작 중에 넣어 둔 설정이 공개 뒤에도 남아 있는 경우다.

User-agent: *
Disallow: /

자바스크립트와 스타일 파일 차단. 구글은 로봇 배제 파일로 막힌 자바스크립트는 렌더링하지 않는다고 적었다. /js/나 /assets/ 같은 경로를 막아 두면 구글이 페이지를 그려 보지 못하고 빈 화면으로 처리할 수 있다.

주소마다 따로인 파일. 네이버 안내에 따르면 파일의 규칙은 같은 호스트, 프로토콜, 포트의 페이지에만 적용된다. http://www.example.com/robots.txt의 내용은 https://example.com/에 적용되지 않는다. 가게가 www가 붙은 주소와 안 붙은 주소를 함께 쓰면 두 곳의 파일을 모두 확인한다.

HTML로 돌아오는 파일. 네이버는 robots.txt가 HTML 문서로 돌아오면 안에 규칙이 있어도 파일이 없는 것으로 해석할 수 있다고 적었다. 파일은 일반 텍스트(text/plain)로 내보내야 한다. 구글은 UTF-8로 인코딩한 일반 텍스트 파일을 요구한다.

서버 오류. 서버가 robots.txt 요청에 5xx 오류를 내면 네이버는 「모두 허용하지 않음」으로 해석한다. 다만 전에 정상적으로 받아 둔 규칙이 있으면 잠시 그것을 쓸 수 있다. 구글은 처음 12시간 동안 크롤링을 멈추고 파일을 다시 가져오려고 시도한다. 호스팅이 불안정하면 페이지가 멀쩡해도 로봇이 사이트 전체를 건너뛸 수 있다.

숨기려면 robots.txt 말고 noindex

구글은 robots.txt 파일을 구글 검색 결과에서 웹페이지를 숨기는 수단으로 쓰지 말라고 적었다. 다른 페이지가 링크를 걸면 구글은 그 페이지를 방문하지 않고도 주소를 색인할 수 있고, 이때 검색 결과에는 설명 없이 주소만 나온다. 검색 결과에서 빼려면 페이지에 noindex 표시를 넣거나 비밀번호로 막는다. noindex를 넣은 페이지는 robots.txt로 막지 않는다. 막으면 로봇이 noindex 표시를 읽지 못한다.

구글은 robots.txt 내용을 보통 24시간까지 캐시한다. 고친 규칙이 구글에 반영되기까지 하루쯤 걸릴 수 있다. 오픈AI도 robots.txt를 고친 뒤 챗지피티 검색에 반영되기까지 24시간쯤 걸릴 수 있다고 적었다.

배달 앱과 지도 서비스는 어떻게 막았나

가게 정보가 많이 쌓인 플랫폼들의 robots.txt를 필자가 2026년 9월에 열어 확인한 설정이다.

사이트robots.txt 설정가게에 미치는 영향
네이버 지도첫 줄에 AI 학습과 검색증강생성을 위한 로봇 접근을 금지한다고 적고 GPTBot, OAI-SearchBot, ClaudeBot, Claude-SearchBot, Google-Extended, PerplexityBot을 이름으로 막는다. 나머지 로봇에게도 첫 화면 말고는 들어오지 말라고 적었다네이버 지도에만 있는 정보는 챗지피티·클로드의 검색 로봇이 가져가지 못한다
배달의민족가게 페이지를 웹으로 열지만 구글과 네이버의 로봇만 들이고 나머지는 막는다오픈AI와 앤트로픽의 검색 로봇은 배민 가게 페이지를 읽지 못한다
쿠팡이츠웹사이트에는 안내 페이지만 두고 가게 페이지는 앱 안에만 있다어느 검색 로봇도 가게 페이지를 가져갈 주소가 없다
요기요가게 페이지를 모든 로봇에게 연다규칙상 모든 로봇이 가져갈 수 있다

가게 정보가 이런 플랫폼 안에만 있으면 가게 주인이 로봇 규칙을 바꿀 방법이 없다. 가게가 직접 관리하는 홈페이지는 주인이 규칙을 정한다. 학습용 로봇과 검색용 로봇을 나눠 정하는 방법은 인공지능 로봇을 들일지 막을지 정하는 법에 적었다.

확인과 수정

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

공식 문서와 자료

  1. Google 검색 센터 「robots.txt 소개 및 가이드」
  2. Google 검색 센터 「Google에서 robots.txt 사양을 해석하는 방법」
  3. 네이버 서치어드바이저 「robots.txt 설정하기」
  4. IETF RFC 9309 「Robots Exclusion Protocol」(2022)
  5. 각 사이트의 robots.txt: map.naver.com, www.baemin.com, www.coupangeats.com, www.yogiyo.co.kr(2026년 9월 확인)