확실
공식
A/B 테스트는 기존안(A, 대조군)과 변경안(B, 실험군)을 동시에 무작위로 나눈 두 그룹에 노출시켜, 특정 목표 지표(전환율 등)의 차이가 우연이 아니라 실제 변경으로 인한 것인지를 통계적으로 검증하는 실험 방법이다.
확실
공식
좋은 A/B 테스트 가설은 '무엇을 바꾸면 왜 어떤 지표가 얼마나 바뀔 것이다'라는 구체적 형태로 작성해야 한다(예: '상세페이지 상단에 리뷰 평점을 배치하면 구매 전환율이 15% 상승할 것이다'). '상세페이지를 개선하면 매출이 오를 것이다'처럼 막연한 가설은 실험 성공·실패를 판정할 기준 자체가 모호해진다.
확실
공식
표본 크기(샘플 사이즈)는 기준 전환율, 검출하고자 하는 최소 효과 크기(MDE), 유의수준(보통 95%), 검정력(보통 80%)을 입력해 사전에 계산하며, 이 값에 도달하기 전에 중간 결과만 보고 실험을 조기 종료하면 통계적으로 유의미하지 않은 결론을 채택할 위험이 커진다.
확실
공식
유효한 A/B 테스트는 A안과 B안 사이에 변경 요소를 하나로 한정해야 하며, 디자인·카피·프로모션 등 여러 요소를 동시에 바꾸면 어떤 요소가 결과 차이를 만들었는지 특정할 수 없게 된다(변수 격리 원칙).
확실
공식
실험 결과의 통계적 유의성을 판단할 때 관행적으로 p-value(유의확률) 0.05 미만을 '통계적으로 유의미하다'고 보는 기준으로 널리 사용하며, 이는 결과가 우연히 발생했을 확률이 5% 미만이라는 뜻이다. 다만 0.05라는 기준값 자체는 관행이지, 절대적 진리는 아니다.
확실
공식
실험 도중 예기치 못한 외부 변수(대형 이슈, 포털 메인 노출, 프로모션 등)로 트래픽 패턴이 급변하면 실험 결과가 오염될 수 있으며, 이런 경우 해당 기간 데이터를 제외하거나 실험을 재시작하는 것이 일반적인 대응 방법이다.
확실
공식
다변량 테스트(MVT)는 두 가지 이상의 변수(예: 헤드라인과 이미지)를 동시에 여러 조합으로 실험하는 방식으로, 조합의 수가 늘어날수록(예: 헤드라인 3종×이미지 3종=9개 조합) 각 조합에 배분되는 트래픽이 줄어들어 통계적으로 유의미한 결과를 얻기 위해 A/B 테스트보다 훨씬 많은 트래픽 볼륨이 필요하다.
확실
공식
구글 옵티마이즈(Google Optimize)는 2023년 9월 30일부로 서비스가 종료됐으며, 이후 웹사이트 A/B 테스트는 VWO·Optimizely 같은 유료 SaaS 툴이나 각 CMS·쇼핑몰 솔루션에 내장된 자체 실험 기능으로 대체해야 한다.
확실
공식
구글 광고 실험(Experiments) 기능은 기존 캠페인을 기반으로 테스트 캠페인을 자동으로 생성하는 A/B 테스트 도구다. 실험 이름, 테스트 캠페인 접미사, 목표, 실험 기간을 설정하면 원본과 테스트 캠페인을 동시에 운영하면서 성과를 비교할 수 있다.
주의맞춤 실험은 검색, 디스플레이, 동영상, 호텔 광고 캠페인에서 사용 가능하지만, 앱 캠페인이나 쇼핑 캠페인에서는 만들 수 없다. (Google Ads 고객센터)
확실
공식
구글 광고 실험에서는 최대 2개의 목표(측정항목)를 선택하여 테스트 성공 여부를 판단한다. 예: CTR 상승, 전환율 증가 등을 선택하고 원본 캠페인과 테스트 캠페인의 성과를 자동으로 비교한다.
확실
공식
구글 광고 실험의 트래픽 분할 방식에는 쿠키 기반(cookie-based)과 검색 기반(search-based) 두 가지가 있다. 쿠키 기반은 사용자를 실험군 또는 대조군 중 한쪽에 한 번 배정하면 그 사용자가 이후 몇 번을 검색하든 같은 쪽 캠페인만 계속 보게 유지한다. 검색 기반은 검색이 일어날 때마다 매번 무작위로 그룹을 다시 배정한다.
주의구글은 검색 캠페인 실험에서 쿠키 기반 분할을 기본값이자 권장 방식으로 제시한다. 실험 분할 비율은 50:50이 기본 권장값이다. (Google Ads 고객센터)
확실
공식
통계적 유의성은 광고 성과 차이가 우연이 아니라 실제 효과에 의한 것일 확률을 나타낸다. 구글 광고는 1-p값으로 계산되는 '신뢰도'(Confidence)로 표현한다.
확실
공식
P-값은 광고 성과 변화가 실제로 없을 경우 그 정도의 차이가 우연히 발생할 확률을 나타낸다. P-값이 낮을수록(예: 0.05 = 5%) 관찰된 차이가 우연이 아니라 실제 효과일 가능성이 높다는 의미다.
주의P-값이 낮다고 해서 효과의 크기가 크다는 뜻은 아니며, 이 둘은 별개의 개념이다. 표본이 아주 크면 실무적으로 미미한 차이도 통계적으로 유의미하게 나올 수 있다. (통계학 기본 원리)
확실
후기
통계적 유의성 판단에는 충분한 데이터량(샘플 크기)이 필수다. 실험 기간 동안 선택한 목표 측정항목(예: 전환수, 클릭수)이 충분히 쌓여야만 신뢰도 높은 결론을 낼 수 있다.
주의특히 저트래픽 캠페인이나 틈새 키워드는 충분한 데이터를 모으는 데 시간이 오래 걸린다. 실험 기간을 너무 짧게 설정하면 통계적 신뢰도가 낮아진다. (마케팅 커뮤니티)
확실
공식
구글 애즈 실험(Experiments) 고객센터의 실험 FAQ 문서는 실험을 최소 4~6주 이상 진행할 것을 권장하며, 구매 주기가 긴 업종은 전환 주기 1~2회를 기다리는 것이 좋다고 안내한다.
확실
공식
구글 애즈 실험은 실험 시작 후 처음 7일간의 데이터를 통계 계산에서 제외한다. 초기 최적화 과정에서 발생하는 편차를 걷어내 원본과 실험 캠페인을 공정하게 비교하기 위함이다.
확실
공식
구글 애즈 실험 결과 화면의 신뢰 구간(신뢰수준) 기본값은 80%이며, 사용자가 화면에서 다른 신뢰수준 값으로 바꿔 결과를 다시 확인할 수 있다.
확실
공식
구글 애즈는 실험 결과가 통계적으로 유의미하지 않게 나오는 이유로 ① 실험이 충분한 기간 진행되지 않음, ② 캠페인 트래픽 자체가 부족함, ③ 트래픽 분할 비율이 너무 작아 실험 쪽 트래픽이 부족함, ④ 적용한 변경사항이 실제로 유의미한 실적 차이를 만들지 않음, 이 네 가지를 공식적으로 안내한다.