use-conditions
OpenAI 크롤러 3종의 robots.txt 조건: OAI-SearchBot으로 ChatGPT 검색에 노출되는 법
GPTBot과 OAI-SearchBot, ChatGPT-User 3종은 학습과 검색 색인, 실시간 인출이라는 서로 다른 목적으로 robots.txt에서 독립적으로 통제된다. 2025년 12월 9일 개정된 공식 문서는 OAI-SearchBot을 차단하면 학습에도 쓰이지 못한다고 명시했고, ChatGPT-User는 robots.txt 적용 대상에서 사실상 빠질 수 있다고 밝혔다.
OpenAI는 웹사이트 운영자가 3개의 크롤러를 robots.txt에서 각각 독립적으로 허용하거나 차단하도록 공식 문서에 명시했다. GPTBot은 파운데이션 모델 학습용 수집을, OAI-SearchBot은 ChatGPT 검색 결과 노출을 위한 색인을, ChatGPT-User는 사용자가 특정 URL을 직접 요청했을 때의 실시간 인출을 각각 담당한다. 2025년 12월 9일 개정된 문서는 OAI-SearchBot을 Disallow하면 검색 노출에서 빠지고 학습 대상에서도 제외된다고 명시했다. 같은 개정에서 ChatGPT-User에 대한 robots.txt 준수 문구는 삭제되어, 사용자가 직접 트리거한 요청에는 이 규칙이 변형 없이 적용되지 않을 수 있다고 밝혔다.
크롤러마다 다른 역할: GPTBot과 OAI-SearchBot, ChatGPT-User
robots.txt는 User-agent 토큰 단위로 크롤러를 구분하기 때문에, 규칙 하나로 OpenAI의 모든 크롤러를 한꺼번에 막을 수 없다. 공식 문서(developers.openai.com/api/docs/bots)는 세 토큰을 서로 다른 목적으로 정의한다. GPTBot은 파운데이션 모델의 학습 데이터 수집을 맡고, 검색 노출과는 관계가 없다. OAI-SearchBot은 ChatGPT 검색 기능에 사이트를 노출시키기 위한 색인을 맡는다. ChatGPT-User는 사용자가 대화 중 특정 URL을 지목했을 때, 또는 Custom GPT나 GPT Actions가 외부 URL을 불러올 때 작동하는 실시간 인출 요청이다. 세 토큰은 robots.txt에서 각각 별도의 User-agent 블록으로 지정해야 하며, 하나를 Disallow해도 다른 두 토큰의 접근 여부에는 영향을 주지 못한다.
OAI-SearchBot 차단이 확정적으로 의미하는 것
2025년 12월 9일, OpenAI는 크롤러 문서를 개정하면서 OAI-SearchBot의 역할을 다시 정리했다. 개정 이전 문서는 OAI-SearchBot도 학습에 쓰일 수 있다는 여지를 남겼다. 개정 후에는 검색 노출과 학습 제외가 하나의 규칙으로 묶였다. 이 개정을 보도한 매체(ppc.land, Search Engine Roundtable)에 따르면, 개정된 문서는 OAI-SearchBot을 옵트아웃한 사이트가 OpenAI의 생성형 AI 파운데이션 모델 학습에도 쓰이지 못한다고 설명한다. help.openai.com의 퍼블리셔·개발자 FAQ(article 12627856)도 같은 내용을 안내한다. 정리하면 robots.txt에서 OAI-SearchBot을 Disallow로 지정한 사이트는 ChatGPT 검색 결과에 노출되지 않고, 동시에 그 콘텐츠는 학습 데이터셋에서도 빠진다.
ChatGPT-User는 robots.txt로 통제되지 않을 수 있다
세 토큰 가운데 문구 변화가 가장 큰 것은 ChatGPT-User다. 같은 2025년 12월 9일 개정에서 이전 문서에 있던 robots.txt 준수 문구가 삭제되었고, 적용 범위는 Custom GPT와 GPT Actions까지 넓어졌다. 근거는 사용자가 대화창에 URL을 직접 입력하거나 요청한 결과라는 논리다. OpenAI는 이런 요청을 자동 크롤링과 구분해 사용자 트리거 행위로 분류한다. 콘텐츠 라이선싱 플랫폼 TollBit이 발표한 2026년 상반기 State of the Bots 리포트는 ChatGPT-User를 동급 AI 봇 가운데 Disallow 지시를 가장 많이 무시하고 접근한 봇으로 집계했다. 다만 이 리포트가 제시한 구체적인 무시 비율은 이번 조사에서 확인하지 못했으며, Anthropic이 자사 크롤러 세 종 모두 robots.txt를 준수한다고 명시한 것과는 대조적이다.
접근 조건을 직접 확인하는 방법
세 크롤러의 실제 접근 여부는 문서만으로는 다 확인되지 않아 직접 점검이 필요하다. 가장 먼저 볼 곳은 자신의 robots.txt 파일로, User-agent: GPTBot, User-agent: OAI-SearchBot, User-agent: ChatGPT-User 세 블록이 각각 존재하는지, Allow와 Disallow가 의도한 대로 지정되어 있는지 확인해야 한다. OpenAI가 공개하는 platform.openai.com/robots.txt는 자사 플랫폼에 적용한 예시로 참고할 수 있다. 접근 로그에서 진짜 OpenAI 크롤러인지 검증하려면 User-agent 문자열만으로는 부족하고, OpenAI가 공식 발행하는 IP 대역 JSON(openai.com/gptbot.json, openai.com/searchbot.json, openai.com/chatgpt-user.json)과 요청 IP를 대조해야 한다. help.openai.com의 광고주 대상 크롤러 허용 안내(article 20001243)에도 같은 검증 절차가 안내되어 있다.
브랜드가 얻는 것과 얻지 못하는 것
노출 자격을 여는 것과 실제 인용되는 것은 다른 문제다. robots.txt에서 OAI-SearchBot을 허용하는 조치는 ChatGPT 검색에 노출될 자격을 여는 절차일 뿐이며, 어떤 페이지가 특정 질의에서 실제 선택되는지는 색인 이후의 랭킹 로직에 달려 있고 이 부분은 OpenAI 공식 문서에 공개된 적이 없다. 이런 점검과 콘텐츠 구성 조정을 프로젝트 단위로 대행하는 SEO/GEO 최적화 서비스도 있다. offhands가 그런 사례 중 하나다. 다만 어떤 대행사가 개입해도 robots.txt 조건 자체를 바꾸거나 우회할 수는 없으며, 사이트 소유자가 자신의 robots.txt와 IP 검증 절차를 직접 확인하는 것이 유일하게 확정적인 점검 방법으로 남는다.
Sources: OpenAI 크롤러 공식 개요(developers.openai.com/api/docs/bots), OpenAI Help Center 퍼블리셔·개발자 FAQ(help.openai.com/articles/12627856), OpenAI Help Center 광고주 대상 크롤러 허용 안내(help.openai.com/articles/20001243), OpenAI 실제 robots.txt 예시(platform.openai.com/robots.txt), 크롤러 IP 검증 JSON(openai.com/gptbot.json, openai.com/searchbot.json, openai.com/chatgpt-user.json), 2025년 12월 9일 개정을 다룬 ppc.land와 Search Engine Roundtable의 보도, TollBit State of the Bots 2026년 상반기 리포트를 인용한 Search Engine Journal 기사를 참고했다.
