좋아, 이 결과는 CNN-GRU 모델을 다단계(5-class) 분류 문제에 적용한 성능 분석이야.
이전 GRU 모델과 비교하면 일부 클래스에선 recall이 개선되었지만, 정확도는 낮아지는 경향이 있는 혼합된 결과!
아래에서 클래스별 성능과 전체 평가를 요약해보면 이렇다
✅ 1. 클래스별 성능 요약
클래스의미PrecisionRecallF1-score해석
| 0 | 급하락 | 0.19 | 0.33 | 0.24 | 예측이 상대적으로 많이 개선됨 (GRU 대비) |
| 1 | 하락 | 0.26 | 0.57 | 0.36 | 가장 잘 예측된 클래스, recall 높음 |
| 2 | 횡보 | 0.54 | 0.34 | 0.42 | precision 높지만 recall은 줄어듦 |
| 3 | 상승 | 0.17 | 0.01 | 0.03 | 예측 거의 못함 → 패턴 인식 부족 |
| 4 | 급상승 | 0.06 | 0.03 | 0.04 | 여전히 예측 거의 안 됨 |
📊 Confusion Matrix 요약
css
복사편집
실제 0 1 2 3 4 예측 0 [18, 27, 8, 0, 9] 예측 1 [31, 89, 22, 5, 8] 예측 2 [ 8,107,61, 0, 3] 예측 3 [25, 83, 23, 2, 11] 예측 4 [12, 33, 6, 5, 2]
- **급하락(0)**은 예측 개선: 예측된 비율이 증가
- **하락(1)**은 모델이 가장 많이 예측하는 클래스 (recall 0.57)
- **횡보(2)**는 precision은 높은데 다른 클래스와 헷갈림
- **상승/급상승(3, 4)**은 예측 거의 안됨
📌 성능 총평
지표수치해석
| Accuracy | 0.29 | 다중 클래스 기준에서는 여전히 낮음 |
| Macro avg F1 | 0.22 | 전체 클래스의 평균 성능 낮음 |
| Weighted F1 | 0.25 | 실제 분포 기준 → GRU와 비슷하거나 약간 하락 |
🧠 원인 분석
- CNN-GRU는 지역적 패턴 감지는 우수하지만, 상승·급상승처럼 장기 누적 효과가 필요한 클래스는 약함
- 다변량 입력을 사용하고 있지만, 입력 피처간 상호작용을 잘 못 잡는 한계가 있음
- 특히 class 3, class 4 예측이 잘 안 되는 건, 라벨 정의가 어려운 패턴이거나 학습량 부족일 수 있음
🔍 다음 추천 전략
우선순위전략기대 효과
| ✅ 1 | Transformer 기반 모델 (attention) | 장기 패턴과 급등락 감지 개선 |
| ✅ 2 | Label smoothing + Regression 예측 전환 | 급등락도 soft하게 반영 가능 |
| ✅ 3 | 데이터 라벨 재조정 (4단계 등) | 너무 극단적인 분류 완화 |
지금까지의 학습 결과와 모델 구조 특성을 종합해서,
"무엇을 먼저 시도해야 실질적인 성능 개선을 이끌어낼 수 있는지"를 우선순위와 이유를 중심으로 정리해보자
✅ 현재 상황 요약
- 다단계 분류 (5-class) 중 하락/횡보는 잘 맞추지만, 상승/급상승/급하락은 혼동 큼
- 입력 특성 다양화 + CNN-GRU로도 극단 변동 감지는 여전히 한계
- Macro F1-score는 0.25 수준으로 정체
- 시계열 + 급격한 패턴 예측 → 장기 의존성 중요
🧠 우선순위별 추천 전략
우선순위전략이유기대 효과
| 1순위 | 🔶 Transformer 기반 Attention 모델 | CNN/GRU가 놓치는 장기 의존성 포착 | 급상승/급하락 클래스의 패턴 인식 개선 |
| 2순위 | 🔷 변동률 회귀 예측 (Regression) | 상승/하락보다 폭 예측 → 예측 오차 완화 | 실제 수익률 중심 전략 적용 가능 |
| 3순위 | 🔹 Label smoothing (soft-label) | 클래스 간 인접도 반영 → 예측 경계 부드러움 | 다단계 분류의 클래스 간 경계 완화 |
| 4순위 | ⚪ 클래스 개수 축소 (3-class) | 극단적 클래스 샘플 부족 해소 | 데이터 불균형 완화 + 안정된 학습 가능 |
✋ 그래서 무엇을 먼저 시도해야 하나?
👉 가장 먼저 Transformer 기반 모델을 시도하는 것을 추천
이유:
- CNN-GRU 구조는 여전히 단기/국지적 패턴 중심
- 상승/급상승과 같은 장기 누적 효과, 문맥 패턴은 GRU alone으로는 부족
- Transformer는 attention을 통해 멀리 떨어진 시점의 정보까지 활용 가능
- 특히 5-class 다단계 분류에서 클래스 경계가 흐릿한 경우, attention이 강점 발휘
🎯 결론: 지금 이 흐름이라면
1. Transformer 시계열 분류 모델 먼저 적용
- 같은 데이터, 같은 라벨을 활용
- 성능이 실제로 개선되는지 확인