검색 용어 사전
검색엔진의 기본
크롤링(crawling)
검색엔진의 로봇(크롤러)이 링크와 사이트맵을 따라 웹페이지를 가져가는 일이다. 구글은 검색을 크롤링, 색인 생성, 검색결과 게재의 세 단계로 설명한다. 로봇은 페이지 안의 링크로 다음 주소를 알게 되므로, 다른 페이지로 가는 링크가 없는 홈페이지는 첫 화면에서 수집이 멈추기도 한다.
색인(index)
검색엔진이 가져간 페이지를 분석해 올려 둔 목록이다. 검색 결과는 이 목록에서 고른다. 색인에 없는 페이지는 검색 결과에 나오지 않고, 구글 AI 개요처럼 검색 색인을 쓰는 인공지능 답에도 쓰이지 않는다. 확인하는 법은 색인 확인 글에 있다.
게재(serving)
누군가 검색하면 검색엔진이 색인에서 결과를 골라 순서대로 보여 주는 단계다. 순위를 매기는 방식은 회사마다 다르고 계산식은 공개되지 않는다.
렌더링(rendering)
HTML과 자바스크립트를 실행해 화면을 그리는 일이다. 구글은 페이지를 렌더링 대기열에 넣고 자원이 허락할 때 실행한다. 구글 문서는 모든 크롤러가 자바스크립트를 실행할 수 있는 것은 아니라고 적었다. 빈 종이 확인 글 참고.
표준 URL(canonical URL)
내용이 같은 여러 주소 가운데 검색엔진이 대표로 색인하는 주소다. http와 https, www가 붙은 주소와 안 붙은 주소가 모두 열리는 사이트는 같은 페이지가 여러 주소를 갖는다. 사이트 주인은 <link rel="canonical">로 대표 주소를 표시할 수 있지만, 구글은 다른 주소를 고를 수도 있다.
로봇 배제 파일(robots.txt)
사이트 맨 위 경로에 두는 글 파일로, 로봇에게 어디를 가져가도 되는지 적는다. 1994년 마틴 코스터가 제안한 관행이 2022년 9월 RFC 9309로 표준이 됐다. 강제력은 없고, 규칙을 지키는 로봇만 따른다. robots.txt 글 참고.
noindex
페이지를 검색 색인에 넣지 말라는 표시다. 페이지의 <head>에 <meta name="robots" content="noindex">처럼 적는다. 구글은 검색 결과에서 페이지를 빼려면 robots.txt가 아니라 noindex나 비밀번호를 쓰라고 안내한다.
사이트맵(sitemap)
사이트의 페이지 주소를 모은 XML 파일이다. 파일 하나에 주소 5만 개, 50MB까지 담는다. 구글은 <priority>와 <changefreq>를 무시하고 <lastmod>는 정확성을 확인할 수 있을 때만 쓴다.
페이지랭크(PageRank)
1998년 스탠퍼드대학교의 세르게이 브린과 로런스 페이지가 발표한 점수다. 웹을 무작위로 돌아다니는 가상의 이용자가 85퍼센트의 확률로 링크를 따라가고 15퍼센트의 확률로 아무 페이지로 건너뛴다고 놓고, 그 이용자가 각 페이지에 머물 확률을 셌다.
개인화
같은 검색어라도 검색한 사람의 기록과 위치에 따라 결과가 달라지는 것이다. 2013년 미국 노스이스턴대학교 연구진의 조사에서 구글 검색 결과의 11.7퍼센트가 개인화 때문에 달랐고, 주로 로그인한 계정과 IP 주소가 차이를 만들었다.
통합검색
검색어 하나에 웹문서, 블로그, 카페, 지식iN, 지도, 쇼핑 같은 여러 영역의 결과를 한 화면에 묶어 보여 주는 방식이다. 네이버는 1999년 6월 2일 검색 서비스를 열고 이듬해 통합검색을 내놓았다.
서명일(byline date)
구글이 웹페이지가 게시되거나 고쳐진 날로 추정해 검색 결과에 보여 주는 날짜다. 구글은 한 가지 요소에 의존하지 않고 여러 요소로 날짜를 추정하며, 페이지에 「게시」나 「최종 업데이트」 라벨을 붙인 날짜를 눈에 띄게 적으라고 권한다.
사이트 주인의 도구
구글 서치 콘솔(Google Search Console)
구글이 사이트 주인에게 무료로 여는 관리 도구다. 사이트를 등록하고 소유를 확인하면 색인 상태, 검색 실적, 사이트맵, 생성형 AI 실적을 볼 수 있다. 서치 콘솔 글 참고.
URL 검사
서치 콘솔에서 페이지 하나를 넣어 색인 상태를 보는 도구다. 구글이 받아 간 HTML을 보고, 지금 상태를 실시간으로 시험하고, 색인 생성을 요청할 수 있다.
네이버 서치어드바이저
네이버의 사이트 주인용 도구다. 웹마스터 도구에서 사이트를 등록하고 소유확인을 하면 수집·색인·노출 현황을 보고 사이트맵, RSS, 수집 요청을 낼 수 있다. 소유확인은 1년마다 다시 한다. 서치어드바이저 글 참고.
빙 웹마스터 도구(Bing Webmaster Tools)
마이크로소프트의 사이트 주인용 도구다. 구글 서치 콘솔에 등록한 사이트를 가져오기로 옮길 수 있고, 2026년 2월부터 코파일럿과 빙 AI 요약의 인용을 보여 주는 AI 실적 보고서를 공개 미리보기로 연다. 빙 글 참고.
인덱스나우(IndexNow)
페이지를 만들거나 고치거나 지운 순간 사이트가 검색엔진에 주소를 직접 보내는 규약이다. 2021년 10월 18일 빙과 얀덱스가 내놓았고, 네이버는 2023년 7월부터 지원한다. 구글은 일반 웹페이지에 쓰지 않는다.
구글 비즈니스 프로필(Google Business Profile)
구글 지도와 구글 검색에 나오는 가게 정보를 사업자가 관리하는 도구다. 구글 가이드라인은 간판과 명함에 실제로 쓰는 이름을 쓰고, 체인점은 한 나라 안의 모든 지점이 같은 이름을 쓰라고 정했다.
네이버 스마트플레이스
네이버 지도와 플레이스 영역에 나오는 가게 정보(영업시간, 메뉴, 사진, 예약)를 사업자가 관리하는 곳이다. 홈페이지의 네이버 웹문서 노출은 서치어드바이저가 맡으므로 두 곳은 따로 관리한다.
구조화된 데이터
구조화된 데이터(structured data)
페이지의 정보가 무엇인지 기계에게 따로 알려 주는 표기다. 가게 이름, 주소, 영업시간, 메뉴, 가격대를 공동 어휘로 적는다. 구조화된 데이터 글 참고.
스키마오알지(schema.org)
구글, 마이크로소프트, 야후, 얀덱스가 함께 만든 구조화된 데이터의 공동 어휘다. 식당(Restaurant), 음식점(FoodEstablishment), 메뉴(Menu) 같은 종류와 그 속성이 정의돼 있다.
제이슨엘디(JSON-LD)
구조화된 데이터를 적는 형식의 하나로, 화면의 글자와 따로 페이지 안의 별도 칸에 정보를 한 묶음으로 적는다. 구글이 권하는 형식이다. 나머지 두 형식은 마이크로데이터와 알디에프에이다.
리치 결과(rich results)
구조화된 데이터를 바탕으로 검색 결과에 별점, 영업시간, 가격대 같은 정보를 더해 보여 주는 모양이다. 구글과 네이버 모두 표기를 했다고 이런 모양을 보장하지는 않는다고 적었다. 구글은 2023년 8월부터 자주 묻는 질문(FAQ) 리치 결과를 권위 있는 정부·보건 사이트에만 보여 준다.
대체 텍스트(alt text)
이미지에 붙이는 설명 글이다. 화면 읽기 도구를 쓰는 사람에게 사진을 대신하고, 검색엔진에게 사진의 주제를 알려 준다. 구글은 대체 텍스트를 키워드로 채우면 스팸으로 볼 수 있다고 적었다.
엔티티(entity)와 지식 그래프
엔티티는 기계가 하나로 알아보는 대상, 곧 사람, 장소, 가게, 음식 같은 개체다. 구글은 2012년 5월 지식 그래프를 발표하며 「things, not strings」라는 말을 썼고, 5억 개가 넘는 객체와 35억 건이 넘는 사실과 관계를 담았다고 밝혔다. 이름과 주소가 곳마다 다르게 적힌 가게는 기계가 하나의 엔티티로 묶기 어렵다.
인공지능 검색
검색증강생성(RAG, retrieval-augmented generation)
언어 모델이 질문을 받으면 검색으로 문서를 찾아와 읽고 답을 만드는 방식이다. 2020년 패트릭 루이스와 동료 연구진이 제안했다. 모델이 학습한 뒤에 생긴 정보도 쓸 수 있고, 답에 출처를 붙일 수 있다.
그라운딩(grounding)
모델의 답을 검색 결과 같은 외부 자료에 묶어 사실성을 높이는 일이다. 구글은 제미나이의 답을 구글 검색 결과에 묶는 기능을 그라운딩이라 부른다. 사이트 주인은 Google-Extended 표지로 자기 콘텐츠를 제미나이의 그라운딩에서 뺄 수 있다.
검색 확장(query fan-out)
질문 하나를 받으면 모델이 관련 질의를 여러 개 만들어 동시에 검색하는 방식이다. 구글은 2026년 5월 안내서에서 AI 개요와 AI 모드가 이 방식으로 문서를 찾는다고 밝혔다.
AI 개요(AI Overviews)
구글 검색 결과 맨 위에 인공지능이 쓴 요약을 보여 주는 기능이다. 구글은 2024년 5월 미국의 모든 이용자에게 열었다.
AI 모드(AI Mode)
구글 검색 안의 대화형 검색 화면이다. 2025년 9월 한국어로 열렸다. 구글은 초기 테스터들이 기존 검색어보다 2~3배 긴 질문을 입력한다고 밝혔다.
AI 브리핑
네이버가 2025년 3월 27일 내놓은 인공지능 요약이다. 통합검색, 짧은 형식 콘텐츠, 지역 정보, 쇼핑 영역에 적용됐고 네이버 안의 블로그, 카페, 지식iN, 뉴스를 근거로 쓴다.
제로클릭(zero-click)
검색한 사람이 아무 링크도 누르지 않고 검색을 끝내는 것이다. 스파크토로 조사에서 2026년 1~4월 미국 구글 검색의 68.01퍼센트가 클릭 없이 끝났다.
환각(hallucination)
인공지능이 사실이 아닌 내용을 사실처럼 말하는 것이다. 가게를 두고는 없는 가게를 지어내거나 폐업한 가게를 추천하는 식으로 나타난다. 2026년 발리 짱구·우붓의 음식점 4,776곳을 검색 연동 서비스 네 곳의 답과 맞댄 조사에서 지어낸 가게는 언급의 0.08퍼센트였고, 문을 닫은 가게를 추천한 경우가 93번 있었다.
GEO와 AEO
GEO(생성형 엔진 최적화)는 인공지능이 만드는 답에 자기 문서가 더 많이 쓰이게 고치는 일로, 2024년 프린스턴대학교 등의 논문에서 이름이 붙었다. AEO(답변 엔진 최적화)도 비슷한 일을 가리키는 말로 쓰인다. 구글은 생성형 AI 검색에 맞추는 일도 「여전히 검색엔진 최적화」라고 적었다. GEO·AEO 글 참고.
llms.txt
2024년 9월 3일 미국 개발자 제러미 하워드가 제안한 파일로, 사이트 맨 위 경로에 사이트 요약과 중요한 페이지 목록을 마크다운으로 적는다. 구글은 2026년 5월 안내서에서 구글 검색이 이런 AI 전용 파일을 쓰지 않는다고 적었다.
로봇 이름
| 이름 | 회사 | 하는 일 |
|---|---|---|
| Googlebot | 구글 | 구글 검색 수집 |
| Google-Extended | 구글 | 별도 로봇이 아닌 robots.txt 표지. 제미나이 학습과 그라운딩 사용 여부를 정함 |
| Yeti | 네이버 | 네이버 검색 수집 |
| Bingbot | 마이크로소프트 | 빙 검색 수집 |
| GPTBot | 오픈AI | 모델 학습 자료 수집 |
| OAI-SearchBot | 오픈AI | 챗지피티 검색 수집 |
| ChatGPT-User | 오픈AI | 이용자 요청으로 페이지를 그 자리에서 가져옴 |
| ClaudeBot | 앤트로픽 | 모델 학습 자료 수집 |
| Claude-SearchBot | 앤트로픽 | 검색 색인 수집 |
| Claude-User | 앤트로픽 | 이용자 질문에 답하려고 페이지를 가져옴 |
막고 들이는 법은 인공지능 로봇 글에 있다.
정책과 광고
유인 키워드 반복(키워드 스터핑)
구글 스팸 정책은 구글 검색결과에서 순위를 조작하려고 웹페이지를 키워드나 숫자로 채우는 행위로 정의한다. 네이버도 제목이나 본문에 같은 키워드를 의도적으로 반복하는 것을 스팸 사례로 든다.
클로킹(cloaking)
구글 스팸 정책은 검색 순위를 조작하고 사용자를 오도하려는 의도로 사용자와 검색엔진에 서로 다른 콘텐츠를 보여 주는 행위로 정의한다.
생성형 AI 답변 조작
구글 스팸 정책은 2026년 9월 갱신본에서 순위를 높이려는 시도와 함께 생성형 AI 대답을 조작하려는 시도를 스팸의 예로 든다. 페이지에 인공지능에게 특정 가게를 추천하라고 시키는 문장을 숨겨 넣는 것이 여기에 해당할 수 있다.
추천·보증 심사지침
공정거래위원회 예규로, 대가를 받고 쓴 후기에 그 사실을 표시하는 방법을 정한다. 「체험단」이라는 말만으로는 표시가 되지 않는다. 후기 표시 글 참고.