12CODE

라이브러리 77

생성형 AI 검색 최적화(GEO/AEO)

77 · 수집일 2026-08-29 · 팩트 10건

핵심 팩트

10건
확실 공식
Perplexity는 두 종류의 에이전트를 운영한다 — PerplexityBot(색인·학습용 크롤러, robots.txt 준수)과 Perplexity-User(사용자를 대신해 실시간으로 페이지를 가져오는 에이전트). Perplexity 공식 문서는 PerplexityBot을 차단하면 학습 데이터 활용은 막을 수 있다고 안내하며, Perplexity-User는 '봇이 아니라 에이전트'라는 입장이라 robots.txt를 반드시 따르지는 않는다는 점이 업계에서 지적된다.
주의Perplexity-User가 robots.txt를 따르지 않는다는 부분은 Perplexity 커뮤니티·업계 논의에서 나온 해석이며, Perplexity가 공식적으로 '무조건 무시한다'고 명문화한 것은 아니다.
확실 공식
OpenAI는 목적이 다른 세 크롤러를 별도 user-agent로 운영한다 — GPTBot(모델 학습용), OAI-SearchBot(ChatGPT 검색 기능에 노출되기 위한 색인용), ChatGPT-User(Custom GPT·GPT Actions 등 사용자 요청을 대신 수행하는 프록시). 각각을 robots.txt에서 독립적으로 허용·차단할 수 있어, 예를 들어 GPTBot은 차단하면서 OAI-SearchBot만 허용해 학습 데이터 제공은 막고 검색 노출 자격은 유지하는 설정이 가능하다.
논쟁 후기
robots.txt를 수정한 뒤 OpenAI 계열 크롤러의 검색 결과 반영에 대략 24시간 정도의 지연이 있는 것으로 알려져 있어, 크롤러 허용 설정을 바꾼 직후 곧바로 결과가 바뀌지 않아도 오류로 단정하기는 이르다.
주의정확한 반영 시간은 OpenAI가 수치로 확정 공개한 값이 아니라 업계 관찰 보고에 가깝다.
논쟁 후기
Perplexity의 답변 생성 파이프라인은 한 질의당 대략 10개 안팎의 후보 페이지를 검색·평가한 뒤, 관련성·최신성(freshness)·출처 신뢰도·페이지 구조 등을 기준으로 걸러 실제 답변에는 3~5개 정도만 인용하는 구조로 알려져 있다. 관련성은 정보성 질의에서 가장 강한 단일 신호로, 최신성은 질의 유형 전반에서 비중 있게 작용하는 것으로 관찰된다.
주의Perplexity는 인용 랭킹의 정확한 가중치 공식을 공식적으로 공개하지 않는다 — 위 단계·신호는 제3자의 역설계·관찰에 기반한 추정이다.
논쟁 후기
Perplexity의 인용 패턴을 관찰한 업계 분석에 따르면, 사이트 전체의 도메인 권위 점수보다 해당 페이지가 다루는 주제에 대한 전문성(토픽 권위)이 인용 여부에 더 크게 작용하는 경향이 있으며, 정부·언론·확립된 매체 출처가 의미적 품질이 비슷한 개인 블로그·SNS 게시물보다 높은 점수를 받는 경향이 관찰된다.
주의제3자 관찰 기반 패턴이며 Perplexity의 공식 확인은 없다.
논쟁 후기
Reddit과 OpenAI는 2024년 데이터 라이선싱 파트너십을 체결해, OpenAI가 Reddit의 Data API를 통해 콘텐츠에 접근하고 이를 ChatGPT 등 자사 제품에 반영할 수 있게 됐다. 이후 보도에 따르면 Reddit은 AI 데이터 라이선싱 방식을 연 단위 정액제에서 크롤링 빈도·생성 답변 내 활용도에 비례하는 사용량 기반·동적 과금 구조로 전환하는 추세로 알려져 있다.
주의구체적 금액(연 7천만 달러 등)은 언론 보도 추정치이며 양사가 공식 확정 발표한 숫자는 아니다.
논쟁 후기
Google 애널리틱스4(GA4)는 2026년 중 'AI Assistant'라는 기본 채널 그룹을 추가해 특정 AI 챗봇발 세션을 별도 medium 값으로 자동 분류하기 시작했다고 업계에 보고되며, 이 기본 목록에는 ChatGPT·Gemini·Deepseek·Copilot·Grok이 포함되지만 Perplexity와 Claude는 빠져 있어 두 소스는 세션 소스(Session source)에 대한 정규식 필터(예: perplexity\.ai, claude\.ai 도메인 매칭)로 별도의 커스텀 채널 그룹을 만들어야 잡힌다고 안내된다.
주의GA4 공식 도움말 원문을 직접 대조하지 못했다 — 정확한 출시일과 포함 소스 목록은 구글 애널리틱스 고객센터에서 최신 상태를 재확인해야 한다.
논쟁 후기
AI 챗봇에서 클릭해 유입되는 세션 중 상당수(업계 조사에서는 플랫폼에 따라 35~70% 수준으로 언급)는 리퍼러(referrer) 헤더 없이 도착해 GA4에서 'Direct(직접 유입)'로 분류되는 것으로 알려져 있어, 채널 그룹을 아무리 정교하게 짜도 실제 AI발 트래픽은 과소 집계될 수 있다는 한계가 지적된다.
주의정확한 손실 비율은 조사마다 편차가 커서(35~70%) 특정 수치를 확정값처럼 인용하면 안 된다.
확실 후기
구글은 AI 개요(AI Overview) 전용의 별도 스키마마크업을 요구하지 않는다고 설명한다 — 생성형 AI 검색에 구조화 데이터가 필수는 아니지만, 일반 검색과 마찬가지로 리치 결과 자격을 얻는 데 도움이 되므로 계속 사용하는 것이 권장된다는 입장이다. AI 개요는 일반 검색과 같은 색인을 사용하므로, 구글이 기존에 권장해온 표준 구조화 데이터와 사람 우선(helpful) 콘텐츠 원칙이 그대로 적용된다.
주의구글 서치 센트럴 원문 페이지를 직접 대조하지 못해 '간접 인용'으로 표기한다 — 정확한 문구는 developers.google.com/search 공식 문서에서 재확인 권장.
확실 후기
구글의 상품(Product) 구조화 데이터 가이드는 상품 스니펫과 판매자 정보(merchant listing) 두 용도를 구분하며, Product 마크업은 그 상품이 페이지의 실제 시각적 주제인 상품 상세페이지에만 적용하고 마크업의 각 속성값은 사용자에게 실제로 보이는 정보와 일치시켜야 한다고 안내한다.
주의구글 공식 문서(developers.google.com/search/docs/appearance/structured-data/product) 원문을 직접 대조하지 못했다 — 세부 필수·권장 속성 목록은 해당 공식 문서에서 최종 확인해야 한다.