분류 전체보기 85

7주차 TIL - 변수와 가설을 넘어서~

해당 환경정보의 최적조건을 찾기 위해 머신러닝을 실시 결론적으로 최적조건을 적용하면 1등급 토마토 생산량이 늘어날 것이다.라는 가설을 토대로 프로젝트 데이터 분석📌 과실 생장(frtstGrupp)과 출하량(outtrn)의 관계 분석 결과시각적 분석: 과실 생장(frtstGrupp)이 증가할수록 출하량(outtrn)도 증가하는 경향이 뚜렷하게 나타남.상관계수: 0.6421 (강한 양의 상관관계)→ 과실 생장이 활발할수록 출하량이 증가할 가능성이 높음.# 다시 데이터 불러오기 import pandas as pd import matplotlib.pyplot as plt import seaborn as sns # 데이터 로드 prod_df = pd.read_csv(prod_path, encoding="cp94..

카테고리 없음 2025.02.06

7주차 TIL - 틈메이러 네 이놈

가설 1: 난방 에너지 사용량이 증가하면 출하량이 증가할 것이다.근거: 적절한 온도를 유지하면 작물의 생장이 원활하게 진행될 가능성이 높음.검증 방법: heating_energy_usage와 outtrn의 상관관계 및 회귀 분석.가설 2: CO₂ 사용량이 많을수록 출하량이 감소할 것이다.근거: 앞선 상관관계 분석에서 CO₂ 사용량(CO2_usage)이 출하량과 음의 상관관계를 보임.검증 방법: CO2_usage와 outtrn 간의 관계 분석 및 시각화.가설 3: 미스트 사용량이 많을수록 출하량이 감소할 것이다.근거: 높은 습도는 병해 발생 위험을 증가시켜 작물 품질에 악영향을 미칠 가능성이 있음.검증 방법: mist_usage_time과 outtrn의 관계를 시계열 분석 및 상관 분석.가설 4: 물 사용..

카테고리 없음 2025.02.05

7주차 TIL - ML 마스터 클래스의 마지막

🔹 1. DBSCAN (Density-Based Spatial Clustering of Applications with Noise)💡 왜 필요한가? (K-means의 한계)K-means는 군집을 원형(Spherical)으로 가정 → 복잡한 형태의 군집(강처럼 구불구불한 군집 등)은 잘 분류하지 못함.모든 클러스터 크기가 비슷하다고 가정 → 실제 데이터에서는 밀도가 다양한 군집이 존재.모든 데이터가 군집에 포함되어야 함 → 이상치(Outlier)를 처리하는 기능이 부족함.➡ 해결책: DBSCAN→ 밀도 기반 접근법으로 데이터가 밀집된 영역을 군집으로 인식하고, 밀도가 낮은 영역을 노이즈(이상치)로 간주하는 방식.🔹 2. DBSCAN 작동 원리DBSCAN의 주요 개념:epsilon (ε): "이웃"을 ..

카테고리 없음 2025.02.04

6주차 - 데이터 숙련 종료!

과제를 진행하면서 느낀 점과 성찰해야 할 부분이번 과제를 통해 Breast Cancer 데이터셋을 분석하며 기초 통계 분석, 가설 검정, ANOVA 분석, 그리고 머신러닝 모델 구축까지 전반적인 데이터 분석 과정을 경험할 수 있었습니다.1. 데이터 분석 과정의 중요성 재확인각 특성(radius, perimeter, area 등)이 종양의 악성 여부에 미치는 영향을 다양한 방법으로 분석하면서, 단순한 평균 비교만으로는 데이터의 패턴을 완전히 이해하기 어렵다는 점을 다시 한번 깨달았습니다.기초 통계를 통해 데이터의 전반적인 특성을 파악하는 것이 중요하지만,가설 검정과 ANOVA를 통해 실제로 변수 간 차이가 유의미한지 통계적으로 검증하는 과정이 필수적이라는 점을 배웠습니다.2. 머신러닝 모델 적용의 직관적 ..

카테고리 없음 2025.02.03

6주차 TIL - 데이터리터러시? 랜덤포레스트?

서론:데이터 리터러시의 중요성이 날로 커지며, 개인과 조직 모두 데이터를 이해하고 활용하는 능력을 필수적으로 요구받고 있습니다.본론:데이터 리터러시를 높이기 위해 기본 통계 지식을 학습하고, 데이터 분석 툴을 다루는 능력을 키우며, 데이터 기반 의사결정을 생활화해야 합니다. 이를 통해 데이터를 효과적으로 해석하고 활용할 수 있습니다.결론:데이터 리터러시를 강화하면 더 나은 의사결정을 내릴 수 있으며, 조직과 개인의 경쟁력을 크게 높일 수 있습니다.자세한 내용은 원문 링크를 참고하세요.  해당 URL에서 데이터 리터러시의 핵심 개념은 데이터를 읽고 분석하며 활용하는 능력으로, 데이터 중심 사고를 통해 더 나은 의사결정을 내리는 데 초점이 있습니다. 이를 위해 통계와 데이터 분석 툴을 이해하고, 데이터를 기..

카테고리 없음 2025.01.31

6주차 TIL - 머신러닝 데이터 분석기법

앙상블 데이터는 서로 다른 데이터 소스나 모델의 출력을 결합하여 더욱 정확하고 신뢰할 수 있는 결과를 도출하는 접근 방식입니다.예시:배깅(Bagging): 여러 데이터 샘플을 사용해 만든 모델들의 평균을 활용 (예: 랜덤 포레스트).부스팅(Boosting): 오류를 점진적으로 줄이는 모델 조합 (예: XGBoost).스태킹(Stacking): 다양한 모델의 결과를 메타 모델로 결합.시각화 방법:결과 비교 차트: 개별 모델과 앙상블 모델의 성능 비교 그래프 (예: 막대 그래프).의사결정 경로: 랜덤 포레스트의 트리 구조 시각화.상관도 행렬: 모델 결과 간의 상관성을 표시.적합한 시각화 도구로는 Matplotlib, Seaborn, Plotly 등이 사용    랜덤 포레스트(Random Forest)는 머신..

카테고리 없음 2025.01.27

6주차 TIL - 머신러닝 오프닝 학습 요약

1. 머신러닝의 기본 개념1.1 머신러닝의 정의데이터를 사용해 모델을 학습시켜 예측, 분류, 군집 등의 작업을 수행하는 알고리즘.1.2 머신러닝의 종류지도 학습(Supervised Learning): 레이블(정답)이 있는 데이터 학습.예: 회귀(Regression), 분류(Classification).비지도 학습(Unsupervised Learning): 레이블이 없는 데이터 학습.예: 군집화(Clustering), 차원 축소(Dimensionality Reduction).강화 학습(Reinforcement Learning): 에이전트가 환경과 상호작용하며 학습.예: 자율주행, 게임 AI.2. Python으로 머신러닝 준비2.1 필수 라이브러리데이터 처리 및 분석:numpy: 배열 및 수학 연산.pand..

카테고리 없음 2025.01.24

6주차 TIL - 범주형 데이터 복습

1. t-검정 (t-test)목적: 두 집단 간의 평균 차이가 통계적으로 유의미한지 검정.사용 상황:집단 수가 2개일 때 사용.종속 변수가 연속형 데이터일 때.독립 변수는 **범주형(2개의 그룹)**일 때.두 그룹의 샘플 크기나 분산이 유사하다고 가정.예시:독립표본 t-검정:질문: 남성과 여성의 평균 키에 차이가 있는가?데이터:성별키 (cm)남성175여성162대응표본 t-검정:질문: 다이어트 전후 체중 변화가 유의미한가?데이터:참가자다이어트 전 체중(kg)다이어트 후 체중(kg)A70652. ANOVA 검정 (분산분석)목적: 세 개 이상의 집단 간 평균 차이가 통계적으로 유의미한지 검정.사용 상황:집단 수가 3개 이상일 때 사용.종속 변수가 연속형 데이터일 때.독립 변수는 **범주형(3개 이상의 그룹)*..

카테고리 없음 2025.01.23

6주차 TIL - 머신러닝 입문했습니다

그전에 통계학에서 배운 카이제곱 검정과선형회귀가 이해가 되질 않아 나름대로 정리해보았다1. 카이제곱검정목적: 두 범주형 변수 간의 관계가 있는지 검정.데이터 유형: 범주형 데이터(예: 성별, 취미, 설문 응답 결과 등).데이터를 교차표(contingency table)로 정리하여 변수 간의 독립 여부를 확인.주로 사용하는 경우:독립성 검정: 두 범주형 변수(예: 성별과 흡연 여부)가 서로 독립적인지 확인할 때.적합도 검정: 관찰된 빈도(Observed frequency)가 기대 빈도(Expected frequency)와 얼마나 차이가 나는지 확인할 때.예시:질문: 성별(남성/여성)과 취미(독서/운동/영화감상) 간에 관계가 있을까?데이터: 교차표독서운동영화감상남성305040여성702060해석: 카이제곱검정..

카테고리 없음 2025.01.22

5주차 TIL - 통계의 마지막 에피소드

1. t-검정(t-test)목적:두 집단 간의 평균 차이를 비교하기 위해 사용됩니다.종류:독립 표본 t-검정 (Independent t-test)서로 독립적인 두 집단의 평균을 비교.예: 남성과 여성의 키 차이를 비교.대응 표본 t-검정 (Paired t-test)동일한 집단에서 두 번 측정한 값을 비교.예: 다이어트 전후의 체중 변화.가정:데이터가 정규분포를 따른다.두 집단의 분산이 동일해야 한다(등분산 가정).(등분산 가정이 충족되지 않으면 Welch의 t-검정을 사용함.)단점:비교할 수 있는 집단이 두 개로 제한됩니다.2. ANOVA (Analysis of Variance, 분산분석)목적:세 개 이상의 집단 간 평균 차이를 비교하기 위해 사용됩니다.종류:일원분산분석 (One-way ANOVA)하나의..

카테고리 없음 2025.01.21