# AI 봇을 내 병원 홈페이지가 막고 있다? (ChatGPT 봇 편)

OpenAI 공식 문서 「OpenAI 크롤러 개요」(Overview of OpenAI Crawlers) 해설 · 메디스펙 데이터랩
원문: https://developers.openai.com/api/docs/bots · 영문판: https://developers.openai.com/api/docs/bots
해설 방식: 요약 · 이용 조건: OpenAI 저작권 · 요약과 짧은 인용만, 전문 게시 없음 · 원문 업데이트: 표시 없음 · 최종 확인: 2026-09-08 · 판: sha256:openai-bots-20260903
해설: 메디스펙 데이터랩 (https://medi-spec.com/datalab/rules/openai/chatgpt-search-crawler-access)

OpenAI는 ChatGPT 검색 노출 조건으로 검색용 크롤러(OAI-SearchBot) 허용과 공개 IP 대역 개방을 요구합니다. 메디스펙 데이터랩이 2026년 9월 4일 ChatGPT 웹검색 답변 500건을 분석한 결과 458건이 출처를 붙였고, 그 출처의 23%는 리뷰·예약 플랫폼, 24%는 지역·과목 의료 정보 사이트였습니다.

## 정의
ChatGPT 검색에 병원이 나오는 조건이란 OpenAI의 검색용 크롤러가 병원 페이지를 읽을 수 있고(robots.txt 허용과 IP 대역 개방), 읽은 내용이 질문의 답이 되어 답변의 출처 링크로 붙는 상태를 말하며, 학습용 크롤러(GPTBot) 차단과는 별개로 제어됩니다.

## 조건 × 한국 병원 실태 × 병원이 할 일
| 문서가 요구하는 조건 | 한국 병원 실태(메디스펙 데이터랩 실측) | 병원이 할 일 |
| --- | --- | --- |
| OAI-SearchBot 허용 ("Sites that are opted out of OAI-SearchBot will not be shown in ChatGPT search answers") | 전국 병원 홈페이지 8,808곳 중 36.8%가 열리지 않았고(도메인 해석 실패가 전체의 22.8%, 연결 오류 7.5%, 404 3.5%, 인증서 오류 1.6%, 차단 응답 1.1%, 서버 오류 0.3%), 열린 곳 중 3.3%는 검색 봇으로 접속했을 때 차단 응답을 돌려줬습니다(2026년 9월 7일 조사). | robots.txt에 User-agent: OAI-SearchBot / Allow: / 를 둡니다 |
| 공개 IP 대역의 요청 허용 ("IP 대역은 JSON 파일로 공개") | 메디스펙 병원 정보 페이지를 ChatGPT-User가 읽어 간 횟수는 최근 30일 2,046회였습니다(2026년 9월 2일 기준, OpenAI 서버에서 온 요청만). | 호스팅과 방화벽, CDN이 OpenAI 공개 IP 대역을 막지 않는지 확인합니다 |
| 이용자가 여는 요청(ChatGPT-User)은 robots.txt 미적용 가능 ("Because these actions are initiated by a user, robots.txt rules may not apply.") | 메디스펙 사이트 전체에서 이용자가 질문했을 때 AI가 페이지를 읽어 간 횟수는 최근 30일 2,336회였습니다(2026년 9월 3일 기준). | 봇 차단 솔루션이 ChatGPT-User를 막지 않는지 서버 로그로 확인합니다 |
| 학습 거부(GPTBot)는 검색 노출과 독립 ("Disallowing GPTBot indicates a site's content should not be used in training generative AI foundation models.") | 측정 항목 아님 | 학습만 막을 때는 GPTBot만 Disallow로 둡니다 |
| robots.txt 변경 반영 약 24시간 ("it can take ~24 hours from a site's robots.txt update for our systems to adjust.") | 측정 항목 아님 | 설정을 바꾼 하루 뒤 서버 로그에서 200 응답을 확인합니다 |

## 핵심 정리
- 검색 노출은 OAI-SearchBot 허용이 조건입니다
- 학습 거부(GPTBot)와 검색 노출은 양립합니다
- robots.txt 외에 방화벽과 IP 대역도 열려 있어야 합니다

## 크롤러는 셋이고 따로 제어하며, 검색 노출은 OAI-SearchBot이 결정합니다
(원문 절: 크롤러 구분(문서 개요) · OAI-SearchBot · GPTBot)
OpenAI는 용도가 다른 크롤러 셋을 robots.txt에서 각각 따로 켜고 끄게 해 두었습니다.
검색 노출은 OAI-SearchBot 기준이라서, 이 봇을 거부한 사이트는 ChatGPT 검색 답변에 표시되지 않는다고 문서가 명시합니다.
왜 중요한가: 학습용 GPTBot을 막아도 OAI-SearchBot을 열어 두면 검색에는 나오지만, 'AI 봇 전부 차단' 한 줄이 남은 홈페이지는 검색 노출까지 함께 잃습니다. 홈페이지 주소 뒤에 /robots.txt 를 붙여 열어 보면 1분 안에 확인할 수 있습니다.
| 크롤러 | 용도 | 막으면 |
| --- | --- | --- |
| OAI-SearchBot | ChatGPT 검색 노출 | 검색 답변에서 빠집니다 |
| ChatGPT-User | 이용자가 링크를 열 때 페이지 가져오기 | 이용자 앞에서 페이지가 안 열립니다 (robots.txt 미적용 가능) |
| GPTBot | 모델 학습용 수집 | 학습에서만 빠집니다. 검색 노출과 무관 |
인용: "Sites that are opted out of OAI-SearchBot will not be shown in ChatGPT search answers"
병원은: robots.txt에 User-agent: OAI-SearchBot / Allow: / 를 두고, GPTBot은 원하면 따로 막습니다.

## 이용자가 여는 요청에는 robots.txt가 적용되지 않을 수 있고, 반영은 약 24시간입니다
(원문 절: ChatGPT-User · 반영 시간과 공개 IP 대역)
이용자가 ChatGPT에서 링크를 열 때의 요청(ChatGPT-User)은 이용자가 시작한 동작이라 robots.txt가 적용되지 않을 수 있다고 문서는 밝힙니다.
허용은 유저 에이전트와 IP 양쪽에서 맞아야 하며, OpenAI는 크롤러별 IP 대역을 JSON으로 공개하고 robots.txt 변경은 약 24시간 뒤 반영된다고 적습니다.
왜 중요한가: robots.txt는 열어 뒀는데 호스팅 방화벽이 해외 IP를 통째로 막아 둔 홈페이지라면 결과는 차단과 같아서, 유저 에이전트와 IP 양쪽이 열려 있어야 합니다.
인용: "Because these actions are initiated by a user, robots.txt rules may not apply."
실측 수치: 2,046회 · 최근 30일 ChatGPT-User가 메디스펙 페이지를 읽어 간 횟수 (OpenAI 서버에서 온 요청만 · 2026년 9월 2일 기준)
실측(메디스펙 데이터랩): 메디스펙은 2026년 8월 31일부터 봇 방문의 발신 IP를 OpenAI 공개 대역과 대조해 확인된 것만 세는데, 유저 에이전트 문자열만으로는 흉내 낸 요청을 걸러낼 수 없기 때문입니다.
병원은: 호스팅과 방화벽이 OpenAI 공개 IP 대역을 막지 않는지 확인하고, 하루 뒤 서버 로그에서 200 응답을 봅니다.

## 그래서 병원은 · 지금 확인할 것
1. 홈페이지 robots.txt를 열어 OAI-SearchBot이 허용돼 있는지 봅니다
2. 'AI 봇 전부 차단' 한 줄이 있으면 GPTBot만 따로 막는 식으로 나눕니다
3. 호스팅과 방화벽, CDN이 OpenAI 공개 IP 대역을 막지 않는지 확인합니다
4. 설정 변경 하루 뒤 서버 로그에서 OAI-SearchBot과 ChatGPT-User 요청이 200인지 봅니다
5. 읽힐 내용이 있는지 봅니다. 진료시간과 주소, 전화가 이미지가 아닌 텍스트여야 합니다

## 이 문서가 요구·권장하는 것
1. ChatGPT 검색 노출을 원하면 robots.txt에서 OAI-SearchBot을 허용할 것
2. OpenAI가 공개한 IP 대역에서 오는 요청을 허용할 것(방화벽·봇 차단 솔루션 포함)
3. 학습 사용을 원하지 않으면 GPTBot만 별도로 차단할 것(검색 노출과 독립)
4. ChatGPT-User는 이용자 주도 요청이라 robots.txt로 막히지 않을 수 있음을 전제로 설계할 것
5. robots.txt 변경 후 약 24시간의 반영 지연을 감안할 것

## 정리
OpenAI 문서의 요구는 검색용 크롤러를 허용하고 IP 대역을 막지 말라는 것이지만, 읽을 수 있어도 읽을 내용이 없으면 인용되지 않습니다. 메디스펙 데이터랩의 분석에서 ChatGPT 인용 출처의 23%는 리뷰·예약 플랫폼, 24%는 지역·과목 의료 정보 사이트였고 병원 홈페이지 상당수는 열리지 않거나 텍스트가 없었으니, 홈페이지를 열어 두는 것과 함께 홈페이지를 대신해 읽히는 정보 페이지(메디스펙 등)에 같은 정보를 두는 것이 병원이 할 일입니다.

## 자주 묻는 질문
Q. 병원 홈페이지가 ChatGPT 검색에 안 나오는 이유는?
A. 순서대로 세 가지를 보시면 됩니다. robots.txt에서 OAI-SearchBot을 막았는지, 방화벽이나 CDN이 OpenAI 공개 IP 대역을 막는지, 페이지에 읽을 텍스트가 있는지입니다. 메디스펙 데이터랩이 2026년 9월 7일 전국 병원 홈페이지를 열어 본 조사에서 홈페이지 보유 병원의 36.8%는 접속이 되지 않았고 열린 곳 중 23.2%는 본문 텍스트가 200자 미만이었습니다.

Q. OAI-SearchBot, ChatGPT-User, GPTBot은 무엇이 다른가?
A. OAI-SearchBot은 ChatGPT 검색 노출용, ChatGPT-User는 이용자가 링크를 열거나 답을 요청할 때 페이지를 가져가는 요청, GPTBot은 모델 학습용 수집이며, 셋은 robots.txt에서 각각 따로 허용하거나 막을 수 있습니다.

Q. GPTBot을 막으면 ChatGPT 검색에서도 빠지나?
A. 그렇지 않습니다. GPTBot은 모델 학습용이고 검색 노출은 OAI-SearchBot 기준이라서, 둘을 robots.txt에서 따로 설정하면 학습만 거부하고 검색은 허용할 수 있습니다.

Q. robots.txt에 뭐라고 적어야 하나?
A. 검색 노출을 원하시면 User-agent: OAI-SearchBot 아래 Allow: / 를 두고, 학습에 쓰이지 않게 하려면 User-agent: GPTBot 아래 Disallow: / 를 따로 둡니다. 'AI 봇 전부 차단' 한 줄로 묶으면 검색 노출까지 함께 막히니 주의하세요.

Q. robots.txt를 고치면 ChatGPT에 언제 반영되나?
A. 문서는 검색 결과의 경우 약 24시간이 걸릴 수 있다고 안내하니, 하루 뒤 서버 로그에서 OAI-SearchBot 요청이 들어오고 200으로 응답되는지 확인해 보세요.

Q. 우리 서버에 온 봇이 진짜 OpenAI인지 어떻게 확인하나?
A. OpenAI가 공개한 IP 대역 목록과 요청의 발신 IP를 대조하면 됩니다. 유저 에이전트 문자열만으로는 흉내 낸 요청을 걸러내지 못합니다.

Q. 방화벽이나 CDN이 봇을 막고 있는지 어떻게 아나?
A. 서버 로그에서 OAI-SearchBot과 ChatGPT-User 요청의 응답 코드를 보시면 되는데, 403이거나 응답이 없다면 robots.txt와 무관하게 막힌 것입니다. 해외 IP를 통째로 차단한 호스팅 설정이 흔한 원인입니다.

Q. 홈페이지가 열리는데도 ChatGPT가 인용하지 않는 이유는?
A. OpenAI 문서는 접근 조건만 정하고 인용을 보장하지 않습니다. 메디스펙 데이터랩의 분석에서 ChatGPT 답변의 출처는 리뷰·예약 플랫폼 23%, 지역·과목 의료 정보 사이트 24%에 몰렸는데, 읽을 수 있는 것과 질문의 답으로 골라지는 것은 다른 문제입니다.

Q. 학습에는 쓰이지 않게 하면서 검색에는 나오게 할 수 있나?
A. 가능합니다. GPTBot만 Disallow 하고 OAI-SearchBot은 Allow 하면 되고, 문서는 GPTBot 차단이 학습 제외를 뜻하며 검색 노출과는 독립이라고 설명합니다.

Q. 홈페이지가 없는 병원은 ChatGPT 검색에 어떻게 나오나?
A. ChatGPT는 병원 홈페이지만 읽는 것이 아니라 크롤러가 읽을 수 있는 모든 페이지를 후보로 쓰고, 메디스펙 데이터랩의 분석에서도 출처의 다수가 리뷰·예약 플랫폼과 지역·과목 정보 사이트였습니다. 홈페이지가 없다면 그런 공신력 있는 정보 페이지에 정확한 정보가 있어야 합니다.

Q. ChatGPT 검색과 일반 ChatGPT 답변은 다른가?
A. 다릅니다. 검색을 켜지 않은 답변은 학습된 지식으로 답하고 출처를 붙이지 않지만, 검색을 켠 답변은 OAI-SearchBot이 읽은 페이지를 찾아 출처 링크를 붙입니다. 이 글의 조건은 검색을 켠 답변에 해당합니다.

병원 정보를 이 문서의 조건에 맞게 채우는 방법: https://medi-spec.com/provide