AI가 내 콘텐츠 긁어가는 거, 막아야 할까 열어야 할까?
글 이준석 Adam · 마켓피디아 대표
목차
요즘 이런 고민 해보셨어요? AI가 내 사이트 글을 마음대로 긁어다 챗봇 답변에 쓰는데, 정작 우리한테 클릭은 안 돌아와요. 그럼 막아버릴까 싶죠. 근데 막으면 AI 답변에서 우리 이름이 아예 사라지는 건 아닐까요?
먼저 답부터 드릴게요. 이번 주 소식을 모아 보면 방향이 하나로 모여요. 무작정 막기보다 인용되게 열어두되, 훈련용 크롤링만 골라서 막는 쪽입니다. 왜 그런지, 이번 주 SEO 뉴스 5건으로 풀어볼게요.
AI 크롤러 차단, 왜 갑자기 버튼 하나로 쉬워졌나
Cloudflare1가 이번 주에 재미있는 걸 내놨어요. Bot Preference Sync2라는 기능인데, 대시보드에서 정책만 고르면 사이트의 robots.txt3를 알아서 써줍니다. 크롤러를 세 종류로 나눠요. 검색용(Search), AI 에이전트용(Agent), AI 훈련용(Training). 각각 전부 허용할지, 광고 붙은 페이지만 막을지, 다 막을지 고를 수 있고요.
여기서 놓치면 안 되는 게 있어요. 2026년 9월 15일부터, 광고 수익을 켠 신규 Cloudflare 고객은 Training과 Agent 차단이 기본으로 켜집니다. 내가 아무것도 안 눌러도 AI 크롤러가 막히는 상태로 시작한다는 뜻이에요.
편해 보이죠. 근데 저희는 이 편리함이 오히려 함정이라고 봐요. 기본 차단이 켜진 줄 모르고 있다가, AI 노출을 통째로 닫아버리는 사고가 국내에서도 분명 나올 거예요. 특히 robots.txt를 몇 년째 방치해온 국내 사이트라면, 어느 날 Cloudflare 설정 하나로 정책이 바뀐 걸 눈치 못 챌 수 있거든요. 그리고 이건 어디까지나 규칙을 지키는 착한 크롤러만 막아요. 자격증명 노리는 악성 스크래퍼한테는 아무 소용 없습니다.
출처: Cloudflare Will Write Your Robots.txt, And It Has A Point (Search Engine Journal)
근데 구글봇은 왜 안 막나? 검색이랑 AI 훈련은 뭐가 다른데
같은 날 나온 Cloudflare의 Disallow AI Training 설정을 보면 헷갈리는 지점이 있어요. AI 훈련은 막는데 구글·빙·애플 크롤러는 그대로 통과시키거든요. 이유는 이 회사들이 “책임 있는(Accountable)” 조건을 지키기로 했기 때문이에요. 옵트아웃 제공, 훈련 데이터 사용 내역 공개, 그리고 훈련 거부해도 검색 순위에 불이익 없음을 약속한 곳만 예외로 둔 거죠.
실제로 이 설정은 Google-Extended4와 Applebot-Extended 두 줄만 막아요. 반대로 별도 훈련 크롤러를 굴리는 OpenAI, Meta 같은 곳은 아예 차단하고요.
여기서 꼭 알아야 할 구분이 있어요. 검색 색인과 AI 훈련은 완전히 다른 겁니다. 훈련 크롤러를 막아도 AI 답변이나 요약에 노출되는 건 안 막혀요. 그건 또 다른 통제거든요. 데이터가 이걸 보여줘요. 이 변화 뒤 Cloudflare 사이트에서 GPTBot5 거부율은 18.9%에서 22.0%로 올랐는데, 정작 AI ‘검색’ 크롤러 거부는 약 13%p 떨어졌어요. 훈련은 막고 검색·인용은 열어두는 쪽으로 사람들이 움직인다는 신호죠.
한 가지 주의. 빙(Bingbot)은 2027년 초까지 robots.txt의 훈련 규칙을 인식하지 못해요. 지금 빙 훈련을 막으려면 페이지에 NOARCHIVE 메타 태그를 다는 방법밖에 없습니다.
저희 생각엔 이 구분을 대부분의 국내 사이트 주인이 오해하고 있어요. “AI 막아” 하면 검색까지 같이 닫아버리는 식으로요. 지난달 Cloudflare가 구글봇까지 막은 사건을 다뤘는데, 이번 업데이트는 그때의 부작용을 정리하려는 후속 조치로 보여요. 그리고 네이버는 이 논의에서 아예 빠져 있어요. Yeti가 검색과 훈련을 어떻게 구분하는지 정책 자체가 흐릿하거든요.
출처: Cloudflare’s AI training block now spares Googlebot (Semrush)
이제 ‘돈 받고 열어주는’ 시대가 온다
막느냐 여느냐의 판이 아예 바뀌고 있어요. 이번 주 나온 세 회사의 움직임을 보면 흐름이 보입니다. 무단으로 긁어가던 AI가, 이제 콘텐츠 값을 치르기 시작했어요.
- 구글은 초대제 파일럿을 돌려요. 내 콘텐츠가 AI 응답(Gemini·AI Overviews6·AI Mode)에 “상당히 기여”하면 돈을 줍니다. 문제는 ‘상당히’의 기준을 구글이 비공개로 정하고, 월 총액만 보여준다는 거예요.
- Cloudflare는 Pay Per Crawl로 크롤 성공 1건당 과금해요(최소 $0.001, 가격은 사이트 주인이 설정). 파트너별로 쿼리당 지불(Ceramic.ai)이나 온디맨드 접근(You.com)도 있고요.
- Microsoft는 퍼블리셔가 직접 라이선스와 요금을 정하는 마켓플레이스를 열었어요. 다만 무엇에 얼마를 주는지는 여전히 불투명하죠.
솔직히 말할게요. 이건 아직 대형 영문 퍼블리셔 얘기예요. 국내 중소 사이트가 당장 이걸로 현금을 받긴 어렵습니다. 기준이 죄다 비공개라, 지금은 수익 모델이라기보다 실험에 가까워요. 그러니 “AI가 돈 준다더라”에 기대를 걸진 마세요. 다만 방향만은 분명해요. 무단 크롤에서 유료 접근으로 판이 굳는 중이고, 그 값을 받으려면 애초에 막지 말고 조건을 걸어 열어야 한다는 거죠.
출처: Google’s AI Payment Pilot Vs. Cloudflare & Microsoft Models (Search Engine Journal)
그럼 열면 이득이냐? AI는 클릭 안 주고 긁어만 간다
여기서 반대편 데이터를 봐야 공정하죠. 열어두면 정말 이득일까요? Ahrefs7가 프랑스 사례를 실측했는데, 숫자가 아파요.
2026년 7월 22일 프랑스에 AI Overviews가 깔린 뒤 딱 9일, 노출이 많은 도메인의 클릭률(CTR)8이 중앙값 기준 23.1% 빠졌어요. 963개 도메인을 분석한 결과예요. 사이트의 48%가 하루 클릭의 10% 이상을 잃었고, 19%는 30% 넘게 잃었죠. 의료 분야가 최악이었어요(AI 노출률 22.2%, CTR 20.4% 감소).
무서운 건 따로 있어요. 노출은 그대로거나 오히려 늘었는데 클릭만 떨어졌다는 점. 연구진은 이걸 ‘디커플링’9이라고 불러요. AI가 답을 대신 해주니 사람들이 굳이 링크를 안 누르는 거죠. AI 노출이 1%p 늘 때마다 CTR이 약 1%p씩 깎이는 선형 관계까지 나왔어요.
바로 이게 ‘막아버리자’는 정서의 뿌리예요. 근데 여기 함정이 있어요. 클릭이 준다고 크롤러를 닫아버리면, 남은 AI 답변 인용 기회마저 잃어서 이중으로 손해를 봐요. 한국은 아직 AI Overviews 충격이 영어권보다 작지만, 시간문제라고 저희는 봐요. 이미 챗GPT 유저의 검색 이탈에서 국내 유입 감소 조짐을 다뤘거든요.
출처: AI Overviews Cut CTR by 23.1% in France (Ahrefs)
그래서 결론, 막기보다 ‘인용되게’ 여는 쪽으로
방어만으로는 답이 안 나와요. 공격이 필요하죠. Semrush가 이번 주에 소개한 AI 인용 아웃리치가 그 공격의 형태예요. AI가 답할 때 인용하는 제3자 페이지를 찾아, 거기에 우리 브랜드를 올려두는 작업이에요.
왜 이게 먹히냐면요, AI 인용의 62%가 ‘고스트 인용’10이거든요. 출처는 다는데 정작 브랜드 이름은 안 붙는 인용이요. 그러니 자주 인용되는 페이지에 우리 정보가 올라 있느냐가, AI가 우리를 언급할지 말지를 좌우해요. 방식은 이래요. 인용 데이터를 뽑아 → AI(예: Claude)로 300건 넘는 페이지를 ‘미언급·과소·낡음·부정’으로 자동 분류 → 우선순위 높은 곳부터 아웃리치. 단, AI 분류는 틀릴 때가 있어서 사람이 하나씩 검수해야 해요.
이게 사실 마켓피디아가 GEO에서 매일 하는 일과 정확히 같은 논리예요. 막는 건 방어고, 인용되는 건 공격이죠. 그래서 저희 결론은 이렇습니다. 광고 수익이 큰 사이트라면 훈련 크롤러만 골라 막고, 검색·AI 검색 크롤러는 열어둔 채 인용 자산을 쌓아라. 특히 네이버는 아직 AI 인용을 추적하는 도구가 약해서, 지금이 오히려 선점 기회예요.
출처: AI citation outreach: a Semrush & Claude workflow (Semrush)
그래서 지금 할 수 있는 것
robots.txt에서 ‘검색’과 ‘AI 훈련’을 구분했는지 점검하세요.Google-Extended는 막더라도Googlebot은 열어둬야 검색이 안 끊깁니다.- Cloudflare를 쓴다면 기본 차단이 나도 모르게 켜졌는지 대시보드에서 확인하세요. 광고 수익 옵션을 켠 신규 계정이면 특히요.
- AI 답변에서 우리 브랜드가 인용되는지, 어떤 페이지가 인용되는지 먼저 파악하세요. 막을 곳과 열 곳은 그다음에 정합니다.
- 더 깊이: GEO 최적화란 무엇인가와 챗GPT가 우리 브랜드를 인용하게 하는 법을 먼저 읽어두면 판단이 쉬워져요.
직접 하기 어렵다면
막을지 열지, 어디를 열지 판단이 어렵다면 마켓피디아가 도와드릴게요. AI 검색 노출과 인용을 함께 설계하는 GEO 최적화부터, 사이트 전반의 SEO 컨설팅까지 상황에 맞춰 잡아드립니다. 편하게 문의 주세요.
용어 설명
Footnotes
-
Cloudflare는 전 세계 웹사이트 앞단에서 트래픽을 중계하며 보안·속도를 관리해주는 회사예요. 여기서 크롤러 정책을 걸면 사이트 앞단에서 바로 적용돼요. ↩
-
Bot Preference Sync는 Cloudflare 대시보드에서 고른 크롤러 정책대로
robots.txt를 자동으로 써주고 최신 상태로 맞춰주는 기능이에요. ↩ -
robots.txt는 사이트 최상단에 두는 작은 텍스트 파일로, “어떤 크롤러는 들어와도 되고 어떤 건 안 된다”를 알려주는 안내문이에요. ↩
-
Google-Extended는 구글의 AI 모델 학습용 크롤러 이름이에요. 이걸 막아도 검색용
Googlebot은 그대로 들어와서 검색 노출은 유지돼요. ↩ -
GPTBot은 OpenAI(챗GPT)가 웹을 읽어갈 때 쓰는 크롤러예요. 사이트가 이걸 막으면 챗GPT 쪽 학습·참조에서 빠질 수 있어요. ↩
-
AI Overviews는 구글 검색 결과 맨 위에 AI가 요약 답변을 띄워주는 기능이에요. 사용자가 링크를 안 눌러도 답을 얻어서 클릭이 줄어드는 원인이 돼요. ↩
-
Ahrefs는 백링크·키워드·검색 데이터를 분석해주는 대표적인 SEO 도구 회사예요. ↩
-
CTR은 클릭률(Click-Through Rate)을 말해요. 검색 결과에 100번 노출됐을 때 몇 번이나 클릭됐는지를 나타내는 비율이에요. ↩
-
디커플링은 노출이 그대로거나 느는데 클릭만 따로 떨어지는 현상이에요. AI가 답을 대신 해주면서 노출과 클릭이 서로 따로 놀게 된 거죠. ↩
-
고스트 인용은 AI가 어떤 페이지를 근거로 인용은 하면서도, 정작 그 안의 브랜드 이름은 언급하지 않는 인용을 말해요. ↩