← 블로그

A/B 테스트, 표본 크기부터 판정까지

실험군·대조군의 전환율 차이와 불확실성을 함께 읽는 예시입니다.

가입 없이, 파일 없이. 샘플 결과부터 확인하세요.

랜딩페이지 A안과 B안을 놓고 "음… B가 좀 더 나아 보이는데?"로 정하신 적 있으시죠? 며칠 돌려보고 전환율 높은 쪽 채택하고요. 그런데 그거, 우연일 수 있어요.

A/B 테스트는 바로 그 '느낌'을 '숫자'로 판정하는 방법이에요. 오늘은 그 테스트를 제대로 돌리는 법이랑, 주의해야 할 함정 하나를 짚어볼게요. 읽고 나면 "이게 저걸 이겼다"를 훨씬 조심스럽게 말하게 되실 거예요.

대충 돌리면 우연을 실력으로 착각해요

흔한 실수부터 볼게요. 소재 테스트를 하려고 하는데 캠페인 하나에 소재 나눠 넣고 집행을 했습니다. 사흘 정도 지났는데 B가 A보다 앞서는 게 보이는 겁니다. 그래서 돈을 아끼고자 빠르게 B로 확정하고 테스트를 종료했습니다.

이거 낯설지 않죠? 기간이 일주일이 되었다고 해도 큰 차이는 없습니다. 여기서 제일 문제인 건 전환율이라는 게, 표본이 적을 땐 우연히 요동친다는 거예요. 동전을 열 번 던지면 앞면이 7번 나오기도 하잖아요. 그렇다고 우리는 "이 동전은 앞면이 잘 나온다"고 하진 않죠.

A/B 테스트를 제대로 한다는 건, 이 우연을 걷어내고 "진짜 차이인지"를 가리는 거예요.

A/B 테스트는 이렇게 생겼어요

구조는 단순해요. 대상을 무작위로 반반 나눠서, 한쪽엔 A안, 다른 쪽엔 B안을 보여주고 전환율(혹은 절대값)을 비교해요.

방문자 트래픽을 무작위 50대 50으로 나눠 A안(전환율 4.2%)과 B안(전환율 4.8%)에 보여주고 비교하는 A/B 테스트 구조 그림.

여기서 '무작위'가 핵심이에요. 무작위 배정은 다른 조건이 평균적으로 균형을 이루게 합니다. 실제 표본의 불균형·배정 오류·교차 노출이 없다는 보장은 아니므로 설계와 추적을 확인해야 해요. 그 조건 아래에서 화면 변경의 효과를 추정합니다. (증분성 측정 글의 홀드아웃과 같은 논리예요. 광고 대신 화면을 바꿨을 뿐이죠.)

A/B 테스트 표본 크기는 어떻게 계산하나요?

작은 차이를 잡아내려면 표본이 더 많이 필요해요. 이걸 검정력(power, 실제로 차이가 있을 때 그걸 놓치지 않고 잡아낼 확률)이라고 해요. 테스트를 켜기 전에 "몇 명(혹은 몇 주)까지 모을지"를 먼저 정해두는 게 원칙이에요. 그래야 '적당히 이긴 것 같을 때 멈추고 싶은' 유혹을 피할 수 있어요.

표본 수는 기준 전환율·최소 검출 차이(MDE)·유의수준·검정력 네 값으로 정해집니다. 매번 손으로 풀기 번거로우면 A/B 테스트 표본 크기 계산기에 네 값을 넣어 필요한 인원과 예상 기간을 먼저 확인하세요.

통계적 유의성으로 판정한다는 게 무슨 뜻인가요?

p값은 차이가 없다는 가정과 검정 조건 아래에서, 관측값만큼 또는 더 극단적인 결과가 나올 확률입니다. 차이가 우연일 확률이나 B가 이길 확률은 아니에요. 미리 정한 유의수준뿐 아니라 효과 크기·신뢰구간·실무상 의미와 설계 타당성을 함께 봐야 합니다.

제일 흔한 함정 — 조기 종료(peeking)

이게 제일 많이들 당하는 함정이에요. 실험 중간에 자꾸 결과를 훔쳐보다가, B가 앞선 순간 "됐다!" 하고 멈추는 거예요.

조기 종료의 위험을 설명하는 가상 그래프. 14일과 0.4%p는 설명용 값이며 실제 실험의 종료일이나 효과를 보장하지 않는다.

그림은 설명용 가상 예시입니다. 14일을 기다리면 실제 차이에 도달한다는 뜻은 아니에요. 결과를 반복해서 보며 유의한 순간 종료하면 고정 표본 검정의 오류율이 달라집니다. 사전 종료 규칙을 지키거나, 중간 판독을 계획했다면 그에 맞는 순차 검정을 사용하세요. 배정 오류·안전 문제를 점검하는 모니터링과 승자 결정을 구분해야 합니다.

그 외 흔한 함정도 짧게 짚을게요. 지표를 여러 개 늘어놓고 '이긴 것만' 골라 보기(그중 하나쯤은 우연히 이기거든요), 그리고 트래픽이 너무 적어서 애초에 판정이 안 되는 경우예요.

오늘 해볼 것

이번 주에 테스트할 것 하나만 정하세요. 그리고 켜기 전에 딱 두 개를 먼저 적어두세요. (1) 성공을 판단할 지표 하나, (2) 언제까지 모을지(표본·기간). 안전·배정 상태는 점검하되, 결과를 보고 종료일이나 성공 지표를 바꾸지 마세요.

테스트 없이 두 지표가 같이 움직인 것만 보고 원인을 말하게 되는 함정은 상관관계와 인과관계 차이에 정리해 뒀어요.

마무리

정리할게요. A/B 테스트는 '느낌'을 '숫자'로 바꾸는 일이에요. 무작위로 나누고, 표본을 미리 정하고, 유의성으로 판정하고, 중간에 훔쳐보지 않기.

z-검정이나 검정력 계산을 매번 손으로 하는 게 번거로우시면, 저희가 만든 무료 툴 A/B 실험 분석에 결과 CSV를 올려보세요. 통계적으로 이겼는지, 그리고 표본이 충분했는지까지 판독해줘요. 데이터는 브라우저 안에서만 처리되고 서버로 나가지 않고요.

마지막으로 하나. 유의하게 안 나왔다고 "B가 A랑 똑같다"는 뜻은 아니에요. '아직 확신할 만큼 못 봤다'는 뜻일 수 있어요. 우선 판단을 보류하고 신뢰구간을 확인하세요. 추가 실험이 필요하다면 새 표본·기간·종료 규칙을 미리 계획하세요. 유의해질 때까지 기존 실험을 연장하는 방식은 피해야 합니다.

참고 자료

실험은 어느 단계인가요?

출처·검토근거 자료 1개

검토 Growth Opt Playbook

자주 묻는 질문

A/B 테스트는 며칠이나 돌려야 하나요?
필요 표본 수와 관찰 기간을 함께 미리 정합니다. 기준 전환율과 최소 검출 차이(MDE)로 그룹당 표본을 계산하고, 요일 주기·전환 지연을 반영한 종료 규칙을 정하세요. 중간에 유의해 보인다고 멈추면 위양성이 크게 늘어납니다.
전환이 너무 적은데 유의성이 나왔습니다. 믿어도 되나요?
전환이 적으면 정규근사(z)의 오류율이 불안정할 수 있습니다. 각 그룹 50명에 전환 0건 대 5건인 예에서 양측 pooled z의 p값은 약 0.0218, Fisher 정확검정은 약 0.0563으로 5% 기준 판정이 다릅니다. 사전에 정한 검정을 사용하고 희소 표본에서는 정확검정의 가정도 확인하세요.