서치버스강연 문의

기계가 떼어 가도 뜻이 통하게 가게 페이지를 쓰는 법

최종 업데이트 2026년 9월 · 글 박정배

요점

  • 구글은 검색 결과의 제목을 페이지의 <title>, 화면에서 가장 눈에 띄는 제목, 소제목, 다른 페이지가 링크에 쓴 글자, 구조화된 데이터를 함께 보고 만든다.
  • 핵심 사실(가게 이름, 주소, 영업시간, 전화, 대표 메뉴와 가격)은 제목 바로 아래에 둔다. 언어 모델은 긴 입력의 앞과 끝을 잘 쓰고 가운데를 흘린다는 실험 결과가 있다.
  • 문단마다 주어(가게 이름)와 날짜와 단위를 넣는다. 앤트로픽은 2024년 9월 조각마다 앞뒤 설명을 붙여 저장하자 찾아야 할 조각을 놓치는 비율이 49퍼센트 줄었다고 발표했다.
  • 구글은 2026년 5월 안내서에 생성형 AI 검색을 위해 특별한 방식으로 작성할 필요는 없다고 적었다. 아래 방법은 사람이 읽는 페이지 한 장 안에서 쓰는 법이다.

기계는 페이지를 조각으로 잘라 쓴다

검색엔진과 인공지능의 검색기는 긴 문서를 통째로 쓰지 않고 조각으로 잘라 저장한 뒤, 질문에 맞는 조각을 골라 쓴다. 조각 하나만 떼어 냈을 때 누구의 무엇에 관한 이야기인지 남아 있어야 답에 제대로 쓰인다.

앤트로픽은 2024년 9월 「그 회사의 매출은 지난 분기보다 3퍼센트 늘었다」라는 문장을 예로 들었다. 문서에서 이 조각만 떼어 오면 어느 회사인지, 어느 분기인지 알 수 없다. 앤트로픽이 택한 해법은 조각마다 「이 조각은 ACME사의 2023년 2분기 실적 보고서에서 왔다」 같은 설명을 앞에 붙여 저장하는 것이었다. 그렇게 하자 찾아야 할 조각을 놓치는 비율이 49퍼센트, 다시 순위를 매기는 단계까지 더하면 67퍼센트 줄었다. 검색기가 조각에 붙이던 설명을 글쓴이가 문장 안에 미리 적어 두면 조각이 떨어져 나가도 뜻이 남는다.

2026년 자르는 방법 36가지를 견준 연구에서는 문단 단위로 묶어 자른 방법이 가장 좋았고 글자 수만 세어 자른 방법이 가장 나빴다. 한 문단에 한 가지 사실을 담고, 문단 안에서 그 사실이 완결되게 쓴다.

문단마다 주어와 날짜와 단위

한국어는 주어를 자주 생략한다. 가게 소개글에서 자연스러운 문장이 조각으로 잘리면 뜻이 사라진다.

떼어 내면 뜻이 사라지는 문장떼어 내도 뜻이 남는 문장
작년에 값을 올렸다.○○면옥은 2025년 3월 물냉면 값을 11,000원에서 12,000원으로 올렸다.
주차는 안 된다.○○면옥에는 주차장이 없다. 가까운 공영주차장까지 걸어서 5분이다(2026년 9월 기준).
이 집 육수는 하루 전에 끓인다.○○면옥은 육수를 하루 전에 끓여 밤새 식힌다.

핵심 사실은 제목 바로 아래

2023년 넬슨 류와 동료 연구진은 질문 하나에 문서 여러 개를 붙여 넣고, 답이 든 문서의 위치를 앞·가운데·끝으로 옮기며 언어 모델의 정답률을 쟀다. 답이 맨 앞이나 맨 끝에 있을 때 정답률이 가장 높았고, 가운데로 갈수록 떨어졌다. 논문은 이듬해 학술지 TACL에 실렸다.

가게 페이지라면 제목 바로 아래에 가게 이름, 주소, 영업시간, 전화, 대표 메뉴와 가격을 짧은 목록으로 둔다. 창업 이야기나 음식에 관한 긴 소개는 그 뒤에 둔다. 긴 소개글 속에 영업시간과 주소를 섞어 쓰면 사실이 글 가운데에 묻힌다.

제목과 첫 문단

구글은 검색 결과에 보이는 제목을 페이지의 <title> 요소, 화면에서 가장 눈에 띄는 제목, 소제목, 다른 페이지가 링크에 쓴 글자, 구조화된 데이터를 함께 보고 만든다고 밝혔다. 구글이 권하는 제목은 구체적이고 간결하며, 페이지마다 다르고, 같은 낱말을 되풀이하지 않는 제목이다. 제목이 본문과 맞지 않거나, 여러 페이지에 똑같이 붙은 상용구이거나, 무엇이 기본 제목인지 분명하지 않으면 구글은 본문에서 다른 글자를 골라 검색 결과에 내보낸다.

찾는 사람이 쓸 말은 제목, 소제목, 첫 문단에 둔다. 본문에 골고루 뿌리는 방식은 스팸 정책에 걸린다. 구글은 「부자연스럽게 느껴질 정도로 자주 반복되는 동일한 단어나 구문」을 유인 키워드 반복으로 다루고, 네이버는 제목이나 본문에 동일 키워드를 의도적으로 반복하는 것을 스팸 사례로 든다.

날짜

2024년 구글과 매사추세츠대학교 연구진이 최신 사정을 알아야 답할 수 있는 질문 600개를 만들어 여러 언어 모델에 물었을 때, 모델들은 크기와 상관없이 빠르게 바뀌는 지식에서 틀렸고, 검색 결과를 함께 넣어 주자 정답률이 올랐다. 검색 결과의 문서에 날짜가 있어야 기계가 어느 정보가 새것인지 가린다.

쓰지 말아야 할 것

공식 문서와 자료

  1. Google 검색 센터 「Google 검색결과의 제목 링크에 영향 주기」
  2. Google 검색 센터 「유용하고 신뢰할 수 있는 사람 중심의 콘텐츠 만들기」
  3. Google 검색 센터 「Google에 게시 날짜 제공하기」
  4. Google 검색 센터 「Google 웹 검색 스팸 정책」
  5. 네이버 서치어드바이저 「웹 콘텐츠 스팸사례」
  6. Anthropic 「Introducing Contextual Retrieval」(2024년 9월 19일)
  7. Liu, N. F. 외 (2024). Lost in the middle: How language models use long contexts. TACL 12
  8. Shaukat, M. A. 외 (2026). A systematic investigation of document chunking strategies (arXiv:2603.06976, 동료 심사 전 공개본)
  9. Vu, T. 외 (2024). FreshLLMs. Findings of ACL 2024
  10. 공정거래위원회 「부당한 표시·광고행위의 유형 및 기준 지정고시」(고시 제2019-11호) Ⅲ.14.나