12CODE

라이브러리 121

RFM 세그멘테이션 데이터 추출

121 · 수집일 2026-08-29 · 팩트 4건

핵심 팩트

4건
확실 논문
RFM 기반 이탈 예측(churn prediction)에는 로지스틱 회귀, 랜덤포레스트, XGBoost 같은 그래디언트 부스팅 모델이 흔히 쓰이며, RFM 점수(R/F/M 각 축의 점수 또는 원시값)를 예측 모델의 입력 피처로 사용한다. 여러 모델을 비교한 연구에서 XGBoost가 로지스틱 회귀·랜덤포레스트보다 높은 정확도·F1 스코어를 보이는 경우가 보고된다.
주의구체적 정확도 수치(예: XGBoost 96.2%)는 특정 데이터셋·특정 논문 실험 조건에 한정된 결과이며, 모든 비즈니스에 그대로 적용되는 일반 법칙이 아니다 — 자사 데이터로 재검증이 필요하다. (복수 학술 자료 종합(단일 소스 아님, tier는 방법론 자체가 확립돼 있다는 의미))
확실 논문
최근 연구는 RFM 피처 엔지니어링과 클러스터링(K-means, Deep Embedded Clustering 등), 딥러닝(LSTM·GRU 등)을 결합한 하이브리드 프레임워크로 고객 세그멘테이션과 이탈 예측을 동시에 수행하는 방향으로 발전하고 있다.
주의학술 논문 실험 환경(Olist, Instacart 등 공개 데이터셋) 기준 성능이며, 실무 자사몰 데이터에 그대로 이전되는 수치가 아니다. (논문 원문 실험 설계 한정)
확실 논문
이탈 고객은 전체 고객 대비 소수인 경우가 많아 클래스 불균형(imbalanced data) 문제가 생기며, 실무·연구에서는 SMOTE(합성 소수 샘플링) 등 오버샘플링 기법을 함께 적용해 예측 모델의 편향을 줄인다.
주의없음
확실 논문
이탈 예측 모델의 성능은 정확도(Accuracy)뿐 아니라 정밀도(Precision), 재현율(Recall), F1-score, ROC-AUC로 종합 평가하는 것이 표준이다 — 이탈 고객 비중이 적은 불균형 데이터에서는 정확도 하나만으로 모델을 판단하면 오해가 생기기 쉽다.
주의없음