기계가 떼어 가도 뜻이 통하게 가게 페이지를 쓰는 법
요점
- 구글은 검색 결과의 제목을 페이지의
<title>, 화면에서 가장 눈에 띄는 제목, 소제목, 다른 페이지가 링크에 쓴 글자, 구조화된 데이터를 함께 보고 만든다. - 핵심 사실(가게 이름, 주소, 영업시간, 전화, 대표 메뉴와 가격)은 제목 바로 아래에 둔다. 언어 모델은 긴 입력의 앞과 끝을 잘 쓰고 가운데를 흘린다는 실험 결과가 있다.
- 문단마다 주어(가게 이름)와 날짜와 단위를 넣는다. 앤트로픽은 2024년 9월 조각마다 앞뒤 설명을 붙여 저장하자 찾아야 할 조각을 놓치는 비율이 49퍼센트 줄었다고 발표했다.
- 구글은 2026년 5월 안내서에 생성형 AI 검색을 위해 특별한 방식으로 작성할 필요는 없다고 적었다. 아래 방법은 사람이 읽는 페이지 한 장 안에서 쓰는 법이다.
기계는 페이지를 조각으로 잘라 쓴다
검색엔진과 인공지능의 검색기는 긴 문서를 통째로 쓰지 않고 조각으로 잘라 저장한 뒤, 질문에 맞는 조각을 골라 쓴다. 조각 하나만 떼어 냈을 때 누구의 무엇에 관한 이야기인지 남아 있어야 답에 제대로 쓰인다.
앤트로픽은 2024년 9월 「그 회사의 매출은 지난 분기보다 3퍼센트 늘었다」라는 문장을 예로 들었다. 문서에서 이 조각만 떼어 오면 어느 회사인지, 어느 분기인지 알 수 없다. 앤트로픽이 택한 해법은 조각마다 「이 조각은 ACME사의 2023년 2분기 실적 보고서에서 왔다」 같은 설명을 앞에 붙여 저장하는 것이었다. 그렇게 하자 찾아야 할 조각을 놓치는 비율이 49퍼센트, 다시 순위를 매기는 단계까지 더하면 67퍼센트 줄었다. 검색기가 조각에 붙이던 설명을 글쓴이가 문장 안에 미리 적어 두면 조각이 떨어져 나가도 뜻이 남는다.
2026년 자르는 방법 36가지를 견준 연구에서는 문단 단위로 묶어 자른 방법이 가장 좋았고 글자 수만 세어 자른 방법이 가장 나빴다. 한 문단에 한 가지 사실을 담고, 문단 안에서 그 사실이 완결되게 쓴다.
문단마다 주어와 날짜와 단위
한국어는 주어를 자주 생략한다. 가게 소개글에서 자연스러운 문장이 조각으로 잘리면 뜻이 사라진다.
| 떼어 내면 뜻이 사라지는 문장 | 떼어 내도 뜻이 남는 문장 |
|---|---|
| 작년에 값을 올렸다. | ○○면옥은 2025년 3월 물냉면 값을 11,000원에서 12,000원으로 올렸다. |
| 주차는 안 된다. | ○○면옥에는 주차장이 없다. 가까운 공영주차장까지 걸어서 5분이다(2026년 9월 기준). |
| 이 집 육수는 하루 전에 끓인다. | ○○면옥은 육수를 하루 전에 끓여 밤새 식힌다. |
- 사실을 적는 문단은 가게 이름으로 시작한다. 「이 집」, 「저희 가게」로 받지 않는다.
- 한 문단에 가게 이름은 한 번이면 충분하다. 문장마다 되풀이하면 검색엔진은 키워드 반복으로 볼 수 있다.
- 숫자에는 단위와 시점을 붙인다. 「최근」, 「작년」, 「요즘」 대신 연도와 달을 쓴다.
- 「이것」, 「그것」, 「위의」처럼 앞 문단을 가리키는 말로 문단을 시작하지 않는다.
핵심 사실은 제목 바로 아래
2023년 넬슨 류와 동료 연구진은 질문 하나에 문서 여러 개를 붙여 넣고, 답이 든 문서의 위치를 앞·가운데·끝으로 옮기며 언어 모델의 정답률을 쟀다. 답이 맨 앞이나 맨 끝에 있을 때 정답률이 가장 높았고, 가운데로 갈수록 떨어졌다. 논문은 이듬해 학술지 TACL에 실렸다.
가게 페이지라면 제목 바로 아래에 가게 이름, 주소, 영업시간, 전화, 대표 메뉴와 가격을 짧은 목록으로 둔다. 창업 이야기나 음식에 관한 긴 소개는 그 뒤에 둔다. 긴 소개글 속에 영업시간과 주소를 섞어 쓰면 사실이 글 가운데에 묻힌다.
제목과 첫 문단
구글은 검색 결과에 보이는 제목을 페이지의 <title> 요소, 화면에서 가장 눈에 띄는 제목, 소제목, 다른 페이지가 링크에 쓴 글자, 구조화된 데이터를 함께 보고 만든다고 밝혔다. 구글이 권하는 제목은 구체적이고 간결하며, 페이지마다 다르고, 같은 낱말을 되풀이하지 않는 제목이다. 제목이 본문과 맞지 않거나, 여러 페이지에 똑같이 붙은 상용구이거나, 무엇이 기본 제목인지 분명하지 않으면 구글은 본문에서 다른 글자를 골라 검색 결과에 내보낸다.
<title>: 「○○면옥 | 을지로 평양냉면 · 영업시간과 메뉴」처럼 가게 이름, 동네, 음식을 넣는다.- 첫 제목(h1): 페이지가 무엇에 관한 것인지 한 줄로 쓴다. 은유나 문학적 제목은 본문 안의 소제목으로 옮긴다.
- 첫 문단: 무엇에 관한 페이지인지 적는다. 「○○면옥은 서울 중구 을지로의 평양냉면집이다.」
찾는 사람이 쓸 말은 제목, 소제목, 첫 문단에 둔다. 본문에 골고루 뿌리는 방식은 스팸 정책에 걸린다. 구글은 「부자연스럽게 느껴질 정도로 자주 반복되는 동일한 단어나 구문」을 유인 키워드 반복으로 다루고, 네이버는 제목이나 본문에 동일 키워드를 의도적으로 반복하는 것을 스팸 사례로 든다.
날짜
2024년 구글과 매사추세츠대학교 연구진이 최신 사정을 알아야 답할 수 있는 질문 600개를 만들어 여러 언어 모델에 물었을 때, 모델들은 크기와 상관없이 빠르게 바뀌는 지식에서 틀렸고, 검색 결과를 함께 넣어 주자 정답률이 올랐다. 검색 결과의 문서에 날짜가 있어야 기계가 어느 정보가 새것인지 가린다.
- 가격, 영업시간, 메뉴처럼 바뀌는 정보에는 「2026년 9월 기준」을 붙인다.
- 페이지에는 「게시」나 「최종 업데이트」라는 라벨을 붙인 날짜를 눈에 띄게 하나만 둔다. 구글은 날짜를 한 가지 요소에 의존하지 않고 여러 요소로 추정한다고 적었다.
- 구조화된 데이터에 날짜를 적으면 화면의 날짜와 같게 적는다.
- 내용을 고치지 않았는데 날짜만 바꾸지 않는다.
쓰지 말아야 할 것
- 확인하지 않은 숫자. 구글은 글쓴이에게 「쉽게 검증할 수 있는 사실 정보 오류」가 있는지 스스로 보라고 하고, 네이버는 「출처를 알 수 없는 소문을 사실처럼 작성하는 것은 사이트 신뢰도를 크게 떨어뜨립니다」라고 적었다.
- 남의 글 옮겨 오기. 구글과 네이버 모두 다른 사이트의 글을 자동으로 가져오거나 거의 그대로 옮겨 싣는 것을 스팸으로 규정한다.
- 입증할 수 없는 최고·최초. 공정거래위원회 고시는 「최대」, 「최고」, 「최초」, 「제일」, 「유일」처럼 배타성을 띤 절대적 표현으로 소비자를 오인시킬 우려가 있으면 부당한 표시·광고로 본다. 맛처럼 주관적인 판단은 이 규정에 걸리지 않는다. 「을지로 최초의 평양냉면집」은 입증할 자료가 있어야 쓴다.
- 경쟁 가게 끌어들이기. 공정거래위원회의 비교표시·광고 심사지침은 비교 대상과 기준이 명확하고, 객관적인 시험·조사로 실증된 사실에 근거할 것을 요구한다. 상호를 적지 않아도 손님이 어느 가게인지 알아볼 수 있으면 같은 규정이 적용된다.
- 인공지능만 읽으라고 만든 문장이나 페이지. 구글은 2026년 5월 안내서에서 생성형 AI 검색을 위해 특별한 방식으로 작성할 필요가 없고, 콘텐츠를 작은 조각으로 나눌 필요도 없다고 적었다. 문단마다 사실이 완결되게 쓰는 일은 한 페이지 안에서 한다. 페이지를 조각마다 따로 만들지 않는다.