회사 블로그에 글이 쌓이면 어느 시점부터 접속 기록에 낯선 이름이 늘어납니다. GPTBot, ClaudeBot, Google-Extended 같은 이름이 사람 방문자보다 페이지를 더 많이 가져가는 날도 생깁니다. 그때 사장님과 마케팅 담당자가 같은 질문을 합니다. 이걸 막아야 하느냐는 질문입니다.

막는 방법은 이미 여러 개가 나와 있습니다. robots.txt에 한 줄 넣는 방법, llms.txt를 두는 방법, Cloudflare에서 스위치를 켜는 방법이 각각 다른 층에서 작동합니다. 문제는 세 가지가 막아 주는 범위가 전혀 다르고, 잘못 고르면 막으려던 것은 안 막히고 검색 유입만 잃는다는 점입니다.

robots.txt는 법이 아니라 크롤러에게 보내는 요청입니다

robots.txt는 사이트 최상단에 두는 텍스트 파일로, 크롤러에게 어디를 가져가지 말아 달라고 적어 두는 문서입니다. 강제하는 장치는 없습니다. 크롤러가 스스로 읽고 지키기로 한 약속이어서, 무시하고 들어오는 요청을 서버가 알아서 거절해 주지는 않습니다.

다행히 주요 업체는 공식 문서에서 자사 크롤러가 robots.txt를 따른다고 밝히고 있습니다. Anthropic은 claude.com/crawling/bots.json에 크롤러 IP 목록을 공개해 진짜와 사칭을 구분할 수 있게 해 두었습니다.

지키지 않은 사례도 공개적으로 확인되었습니다. Cloudflare는 2025년 8월 4일, Perplexity가 선언한 크롤러를 차단당하자 일반 브라우저를 흉내 낸 사용자 에이전트와 공개 목록에 없는 IP로 우회했다고 발표하고 검증된 봇 목록에서 제외했습니다.

robots.txt는 지킬 의사가 있는 크롤러에게만 효력이 있습니다. 지킬 생각이 없는 쪽에는 아무 일도 일어나지 않습니다.

회사 이름 하나만 막으면 절반만 막힙니다

한 회사가 크롤러 하나만 쓰는 것이 아닙니다. 용도별로 이름이 나뉘어 있고, 어느 이름을 막느냐에 따라 잃는 것이 완전히 달라집니다. 공식 문서 기준으로 정리하면 이렇습니다.

  • OpenAI: GPTBot은 모델 학습용, OAI-SearchBot은 ChatGPT 검색 결과 노출용, ChatGPT-User는 이용자가 직접 시킨 페이지 방문용입니다.
  • Anthropic: ClaudeBot은 학습용, Claude-SearchBot은 검색 색인용, Claude-User는 이용자 질문에 답하려고 가져가는 요청입니다.
  • Google: Googlebot은 검색용, Google-Extended는 Gemini 학습과 그라운딩용, Google-CloudVertexBot은 별도 허용이 필요한 Vertex AI 에이전트용입니다.

학습만 막고 노출은 남기고 싶다면 GPTBot, ClaudeBot, Google-Extended 세 이름만 Disallow하면 됩니다. 여기에 OAI-SearchBot과 Claude-SearchBot까지 얹으면 AI 답변에 인용될 통로 자체가 사라집니다. 이 구분을 모르고 회사 이름으로 뭉뚱그려 막다가 유입을 잃는 경우가 많습니다.

사용자가 직접 시킨 요청은 robots.txt로 막히지 않습니다

OpenAI 문서는 ChatGPT-User에 대해 이용자가 직접 요청한 방문이므로 robots.txt 규칙이 적용되지 않는다고 밝히고 있습니다. 누군가 ChatGPT 창에 우리 회사 주소를 붙여 넣고 요약을 시키면, robots.txt에 무엇을 적어 두었든 그 페이지는 읽힙니다.

Anthropic의 Claude-User도 같은 성격입니다. Anthropic은 이 크롤러를 막으면 이용자가 물었을 때 우리 콘텐츠를 가져오지 못해 노출이 줄어든다고 안내합니다. 막는 것 자체는 되지만, 얻는 것보다 잃는 것이 큰 선택입니다.

그래서 AI가 우리 글을 절대 못 읽게 하겠다는 목표는 robots.txt만으로 달성되지 않습니다. 학습용 대량 수집을 줄이는 것까지가 robots.txt의 현실적인 사정거리입니다.

Google-Extended를 막아도 AI 개요는 그대로 나옵니다

가장 흔한 오해입니다. Google 공식 문서에 따르면 Google-Extended는 Gemini 모델 학습과 Gemini 앱·Vertex AI의 그라운딩에만 적용되고, 검색 포함 여부나 순위 신호로는 쓰이지 않습니다. AI 개요와 AI 모드는 Googlebot이 모은 검색 색인을 쓰기 때문에 그대로 노출됩니다.

검색 결과의 AI 답변에서만 빠지고 싶다면 별도의 스위치가 생겼습니다. Google은 2026년 6월 Search Console에 설정 > Search generative AI 항목을 추가했고, 2026년 8월 31일 전 세계 모든 사이트에 적용을 마쳤습니다. 반영에는 보통 1~2일이 걸립니다.

이 스위치를 끄면 AI 개요, AI 모드, Discover의 생성형 AI 기능에서 사이트가 빠집니다. Google은 이 설정이 나머지 검색의 순위나 색인 신호로 쓰이지 않는다고 명시했습니다. 대신 그 기능에서 오던 트래픽과 노출도 함께 사라집니다.

llms.txt는 막는 파일이 아니라 안내하는 파일입니다

llms.txt를 robots.txt의 AI 버전으로 아는 분이 많은데 용도가 정반대입니다. Jeremy Howard가 2024년 9월 3일 처음 공개한 이 규격은 사이트의 핵심 문서를 읽기 쉬운 형태로 모아 모델과 에이전트에게 안내하는 목록입니다. 2026년 8월 10일 v2가 나왔습니다.

차단 기능은 아예 없습니다. 게다가 Google은 생성형 AI 최적화 안내에서 llms.txt 같은 별도 파일을 검색이 사용하지 않으며, 만들어도 순위에 도움이 되지도 해가 되지도 않는다고 못박았습니다.

그렇다고 쓸모가 없지는 않습니다. OpenAI, Anthropic, Google 모두 자사 개발자 문서에 llms.txt를 두고 있습니다. API 문서나 기술 문서를 운영한다면 의미가 있지만, 회사 소개와 블로그가 전부인 사이트에서는 차단 대책으로도 유입 대책으로도 우선순위가 아닙니다.

실제로 요청을 끊으려면 네트워크 단에서 막아야 합니다

robots.txt가 의사 표시라면, Cloudflare 같은 앞단에서 거는 차단은 집행입니다. 크롤러가 파일을 읽든 말든 응답 자체가 나가지 않으므로, 상대가 규칙을 지킬 의사가 있는지와 무관하게 막힙니다.

Cloudflare는 AI 트래픽을 세 가지로 나눠 각각 허용하거나 막게 합니다. 색인해 두었다가 나중에 답할 때 쓰는 Search, 사용자를 대신해 지금 움직이는 Agent, 모델 학습에 쓰는 Training입니다. 무료 플랜을 포함한 모든 고객이 쓸 수 있습니다.

관리형 robots.txt도 함께 제공합니다. 대시보드에서 정한 정책을 robots.txt의 콘텐츠 신호로 자동 기록해 주고, 여기에 콘텐츠 사용 범위를 나타내는 use 항목이 추가되었습니다. 의사를 문서로 남기는 일과 실제로 막는 일을 한 번에 처리하는 방식입니다.

robots.txt는 표지판이고, 네트워크 단 차단은 잠금장치입니다. 둘을 같은 것으로 보면 막았다고 착각하게 됩니다.

2026년 9월 15일에 기본값이 바뀌니 지금 확인하세요

Cloudflare는 2026년 7월 1일 발표에서 9월 15일부터 기본값을 바꾼다고 밝혔습니다. 새로 등록되는 도메인은 광고가 붙은 페이지에서 Training과 Agent가 기본 차단되고 Search는 허용됩니다. 기존 무료 플랜 고객에게도 적용됩니다.

주의할 대목은 검색과 학습을 한 이름으로 함께 하는 혼합 크롤러입니다. 이런 크롤러는 가장 엄격한 규칙을 따르게 되어, Training을 막아 두면 Googlebot과 Bingbot, Applebot까지 함께 막힐 수 있습니다. 검색 유입이 끊기는 사고는 대부분 여기서 납니다.

9월 15일 전에 보안 설정에서 예외를 지정해 두면 지금 상태가 유지됩니다. 오늘 기준으로 남은 시간은 2주입니다. Cloudflare를 쓰고 있다면 다른 무엇보다 이 확인을 먼저 하세요.

돈을 받고 여는 길은 아직 일반에 열려 있지 않습니다

막는 것과 여는 것 사이에 요금을 받는 선택지가 있습니다. Cloudflare의 pay per crawl은 결제 의사가 없는 크롤러에게 HTTP 402 응답과 가격을 돌려주고, 결제 의사를 헤더에 담아 온 요청에만 콘텐츠를 내주는 구조입니다. 가격은 사이트 소유자가 도메인 단위로 정합니다.

다만 공식 문서 기준으로 아직 비공개 베타입니다. 신청하거나 담당자를 통해야 들어갈 수 있어서, 지금 이것을 전제로 수익 계획을 세우기는 이릅니다.

2026년 7월 1일에는 이를 확장한 Pay Per Use가 발표되었습니다. 크롤링 시점이 아니라 콘텐츠가 AI 답변에 실제로 쓰일 때 정산하는 방식이고, 첫 파트너는 Ceramic.ai와 You.com 두 곳입니다. 참여 사업자가 이 정도인 단계라 당장의 수익원으로 보기는 어렵습니다.

이럴 때는 막지 않는 편이 낫습니다

문의의 출발점이 검색과 AI 답변인 회사라면 학습만 막고 검색·인용 통로는 열어 두세요. 이미 학습에 쓰인 글은 지금 막아도 되돌아오지 않습니다. 차단은 앞으로 수집될 분량에만 영향을 줍니다.

Cloudflare 발표에 따르면 봇과 에이전트가 웹 요청의 절반을 넘었고, AI 크롤러 트래픽의 절반 이상은 내용이 바뀌지 않은 페이지를 다시 가져가는 요청입니다. 서버가 힘든 것이 문제라면 차단 대신 캐시와 요청 빈도 조절이 먼저입니다. 같은 발표는 지난 1년간 발행사와 AI 회사 사이에 50건이 넘는 콘텐츠 라이선싱 계약이 맺어졌다고 밝혔는데, 협상 카드가 될 만한 분량과 독점성이 없는 회사라면 전면 차단의 실익은 크지 않습니다.

  1. 서브도메인마다 robots.txt를 따로 두었는지 확인하세요. 한 곳에 적어도 다른 서브도메인에는 적용되지 않습니다.
  2. Cloudflare 보안 설정에서 9월 15일 기본값 변경 대상인지 확인하세요.
  3. Search Console의 Search generative AI 항목이 의도한 대로 켜져 있는지 확인하세요.

콘텐츠 운영 기준을 함께 정리하려면 콘텐츠 전략 글을 참고하세요. 설정별 원문은 Google Search Console 도움말Cloudflare 공지에 있습니다. 사이트 구조에 맞춰 적용하는 작업은 Codeforest가 돕습니다.

결론: 세 개의 층으로 나눠서 정하세요

학습 수집은 robots.txt에서 GPTBot, ClaudeBot, Google-Extended를 막아 의사를 남기고, 검색과 AI 답변 노출은 그대로 두세요. 사용자가 직접 시킨 요청은 robots.txt로 막히지 않으니 여기에 기대하지 마세요. Google 검색의 AI 답변에서만 빠지고 싶다면 Search Console 스위치가 정확한 도구입니다.

반드시 막아야 하는 콘텐츠가 있다면 Cloudflare 같은 앞단에서 Training과 Agent만 끊는 것이 실제로 강제되는 유일한 방법입니다. llms.txt는 차단 대책이 아니니 이 판단에서 빼도 됩니다. 그리고 9월 15일 기본값 변경으로 검색 크롤러까지 막히지 않는지, 오늘 한 번 확인해 두세요.