웹사이트 트래픽의 실체: 인간 vs AI 봇
Website Traffic Reality: Humans vs AI Crawlers
목차 (7개 섹션)
웹사이트 트래픽의 실체: 인간 vs AI 봇
2024년 Cloudflare가 공개한 보고서에 따르면, 전 세계 인터넷 트래픽의 약 38%가 봇에서 발생한다. 당신이 지금 이 글을 읽고 있는 동안에도, 같은 사이트를 긁어가는 수십 개의 크롤러가 동시에 접속 중일 가능성이 높다. 그리고 그 중 상당수는 OpenAI, Google, Anthropic의 학습 크롤러다.
봇 트래픽의 계층 구조
봇은 크게 세 층위로 나뉜다.
첫째, 검색엔진 크롤러. Googlebot, Bingbot, Yandex Bot 등이 여기 속한다. 이들은 robots.txt를 준수하고, User-Agent를 정직하게 밝히며, 색인을 위해 페이지를 수집한다. 사이트 운영자 입장에서는 "착한 봇"으로 분류된다.
둘째, AI 학습 크롤러. 2022년 ChatGPT 출시 이후 이 범주가 폭발적으로 늘었다. GPTBot(OpenAI), ClaudeBot(Anthropic), Google-Extended, Meta의 FacebookBot 등이 대표적이다. 이들은 LLM 훈련 데이터를 확보하기 위해 웹 전체를 긁는다. 문제는 속도다. Cloudflare 데이터에 따르면 AI 크롤러는 일반 검색 크롤러보다 초당 요청 빈도가 훨씬 높고, 동시 접속 수도 많다. 소규모 서버를 가진 독립 출판사나 개인 블로그가 직접 피해를 입는 구조다.
셋째, 악성 봇. 계정 탈취(Credential Stuffing), 스크래핑, DDoS, 광고 사기 등을 목적으로 한다. 이들은 당연히 User-Agent를 위조하고 정상 사용자 행동을 흉내 낸다.
숫자로 보는 현황
Imperva의 2024년 Bad Bot Report는 전체 트래픽 중 악성 봇 비율을 32%로 집계했다. 즉, 착한 봇(6%)과 악성 봇(32%)을 합산하면 인터넷 트래픽의 거의 절반이 사람이 아니라는 계산이 나온다.
업종별로 차이가 크다. 금융 서비스는 악성 봇 비율이 45%를 넘고, 게임은 57%에 달한다. 반면 정부·공공기관 사이트는 상대적으로 낮은 편이다. 여행·항공 예약 사이트는 항공권 가격 스크래핑 봇이 전체 트래픽의 40% 이상을 차지하기도 한다.
지역별로는 미국발 봇이 전체의 50% 이상이지만, 이는 미국에 서버를 두고 운영되는 봇이 많기 때문이지 실제 운영 주체가 미국이라는 뜻은 아니다.
AI 붐이 바꾼 봇 생태계
2023년은 AI 크롤러 문제가 본격화된 해다. Spawning.ai가 운영하는 "HaveIBeenTrained?" 서비스가 수천만 개 이미지가 동의 없이 학습 데이터에 포함됐음을 보여주면서 논란이 시작됐다.
출판사들의 반발도 거세다. 뉴욕타임즈는 2023년 12월 OpenAI와 Microsoft를 저작권 침해로 제소했다. 더 인디펜던트, 허핑턴포스트 등 주요 미디어들은 GPTBot을 robots.txt로 차단하기 시작했다. 2024년 상반기 기준으로 상위 1,000개 웹사이트 중 약 26%가 적어도 하나 이상의 AI 크롤러를 차단하고 있다.
역설적으로 robots.txt 차단이 완벽한 해결책이 아니라는 점도 드러났다. 일부 크롤러는 이를 무시하거나, 더 정교하게는 일반 브라우저처럼 위장해 JavaScript를 실행하며 동적 콘텐츠까지 긁는다.
감지와 차단의 기술 전쟁
봇 차단 기술은 크게 세 접근법으로 발전해왔다.
규칙 기반 차단: IP 블랙리스트, User-Agent 필터링, 요청 빈도 제한(Rate Limiting). 가장 오래됐고, 우회하기도 가장 쉽다.
행동 분석(Behavioral Analysis): 마우스 이동 패턴, 스크롤 속도, 클릭 리듬 등을 분석해 봇을 식별한다. CAPTCHA가 여기서 파생됐다. 그러나 2024년 현재 고도화된 봇은 headless 브라우저와 AI를 결합해 사람의 행동 패턴을 모방한다.
ML 기반 이상 탐지: 트래픽 전체를 실시간으로 분석해 정상 분포에서 벗어나는 패턴을 찾아낸다. Cloudflare, Akamai, Fastly 같은 CDN 업체들이 이 방식을 주력으로 쓴다.
봇과 차단 시스템의 싸움은 바이러스와 백신의 관계와 유사하다. 2024년에는 AI 생성 봇이 AI 기반 탐지를 뚫는 Arms Race가 본격화되고 있다.
웹사이트 운영자가 알아야 할 것
GA4(Google Analytics 4) 기준으로, 구글은 알려진 봇을 기본적으로 필터링한다. 하지만 모든 봇이 걸러지는 건 아니다. 서버 로그(Apache, Nginx, Cloudflare)와 GA 데이터를 비교하면 차이가 드러난다. 세션 지속시간이 0초이거나, 바운스율이 비정상적으로 높거나, 특정 IP에서 트래픽이 급증하는 패턴이 보이면 봇 트래픽을 의심해볼 수 있다.
광고주는 특히 주의해야 한다. 디지털 광고 사기(Ad Fraud)의 상당 부분이 봇 트래픽에서 온다. 2023년 전 세계 광고 사기 피해액은 약 840억 달러(약 110조 원)로 추산된다. 이 돈의 상당수는 실제 사람이 아닌 봇의 클릭을 위해 낭비된 셈이다.
앞으로의 전망
생성형 AI의 확산으로 봇 트래픽 비율은 계속 높아질 전망이다. 한편에서는 콘텐츠 생산자가 AI 크롤러에게 사용료를 청구하는 "데이터 라이선스" 시장이 형성되고 있다. AP통신, Reddit, Stack Overflow 등은 이미 OpenAI·Google과 데이터 공급 계약을 체결했다.
인터넷은 점점 "사람을 위한 공간"과 "봇을 위한 공간"이 공존하는 이중 구조로 바뀌어가고 있다. 그 경계가 어디서 어떻게 그어지느냐가 향후 10년 디지털 생태계의 핵심 쟁점이 될 것이다.
관련 문서
문서 정보
- 최초 작성
- 최종 갱신
- 분류
- 기술
HANGUL.WIKI가 정리·작성한 문서입니다. 정확성을 위해 노력하나 오류가 있을 수 있으므로, 중요한 내용은 공식 출처를 통해 확인하시기 바랍니다. 내용의 오류나 정정 요청은 오류·정정 신고로 알려주시면 검토 후 반영합니다.