분류 전체보기 85

5주차 TIL - 예측 알고리즘이 뭐여?

예측 알고리즘의 핵심 개념입력 데이터과거의 기록된 데이터(예: 생산량, 온도, 습도, 품질 검사 결과 등)가 필요합니다.패턴 학습입력 데이터를 분석해 데이터의 패턴, 추세, 상관관계를 찾습니다.출력 결과학습된 패턴을 기반으로 미래 데이터를 예측하거나 특정 조건 하에서의 결과를 추정합니다.주요 예측 알고리즘 종류통계적 알고리즘선형 회귀 (Linear Regression):독립 변수와 종속 변수 간의 선형 관계를 기반으로 결과를 예측.ARIMA (Autoregressive Integrated Moving Average):시계열 데이터(시간에 따라 변화하는 데이터) 예측에 사용.예: 제품 수요 예측, 판매량 추정.로지스틱 회귀 (Logistic Regression):이진 분류 문제(성공/실패 등)에 사용되며,..

카테고리 없음 2025.01.20

5주차 TIL - 통계

2. 필수 라이브러리통계 작업에서 주로 사용하는 Python 라이브러리는 다음과 같습니다:기본 데이터 처리 및 시각화:numpy: 수학 및 배열 연산pandas: 데이터 프레임 및 CSV, Excel 파일 처리matplotlib: 기본적인 데이터 시각화seaborn: 고급 시각화 (통계적 그래프)통계 분석:scipy: 통계 및 과학 계산 함수statsmodels: 통계 모델 및 추정pingouin: 쉬운 통계 테스트 제공researchpy: 데이터 분석 및 결과 해석 보조머신러닝 및 고급 분석 (선택):scikit-learn: 머신러닝 모델 및 데이터 전처리tensorflow 또는 pytorch: 딥러닝 (통계적 분석 외 추가적으로 학습 가능)3. 통계 기본 지식Python으로 통계를 다루기 전에 다음 ..

카테고리 없음 2025.01.17

5주차 TIL - 데이터 분석, 통계학 입문!

**6시그마(Six Sigma)**는 기업의 프로세스를 개선하고 품질을 높이기 위해 사용하는 체계적이고 데이터 중심의 경영 기법입니다. 제조, 서비스, IT, 금융 등 다양한 산업에서 결함률을 줄이고 효율성을 극대화하는 데 활용됩니다.핵심 개념"시그마(σ)"란?**시그마(σ)**는 통계학에서 표준편차를 의미하며, 데이터가 평균으로부터 얼마나 분산되어 있는지를 나타냅니다.6시그마에서 **"6"**은 평균값으로부터 ±6 표준편차 범위 내에 데이터가 99.99966% 포함된다는 뜻입니다.이는 **백만 개의 기회당 3.4개의 결함(Defects per Million Opportunities, DPMO)**을 목표로 한다는 뜻입니다.6시그마의 목표프로세스의 변동성을 줄이고 품질을 일관되게 유지.고객 만족도를 높이..

카테고리 없음 2025.01.16

4주차 TIL - 프로그래밍 주차 끝

프로젝트 진행 중 힘들었던 점데이터 정제 및 결측치 처리데이터셋에 결측치가 많아 분석 전 데이터를 정리하고 보완하는 데 예상보다 많은 시간이 소요되었습니다.결측치 처리 기준을 정하는 과정에서 팀원 간 의견이 엇갈리기도 했습니다.시간 관리의 어려움프로젝트 기간이 제한적이어서 데이터 분석과 발표 준비를 병행하는 데 큰 부담을 느꼈습니다.예상치 못한 오류나 추가 작업으로 인해 일부 일정이 밀려, 발표 준비 시간이 부족했습니다.기술적 한계지도 시각화와 같은 고급 기술을 처음 시도하다 보니, 관련 자료를 찾고 학습하는 데 많은 노력이 필요했습니다.사용한 분석 툴이나 라이브러리에 대한 익숙함이 부족해 작업 속도가 느려지기도 했습니다.힘든 점을 극복하기 위한 노력팀원들과 꾸준히 회의를 진행하며 의견을 조율하고, 작업..

카테고리 없음 2025.01.15

4주차 TIL - 프로젝트 발표 끝!

이번 프로젝트를 준비하면서 데이터를 분석하고 시각화하는 과정에서 많은 배움을 얻을 수 있었습니다. 특히, 식량 생산 데이터라는 중요한 주제를 다루며, 글로벌한 관점에서 문제를 이해하고 해결 방안을 제시하는 것이 얼마나 중요한지 깨달았습니다. 준비 과정에서 데이터 정제와 시각화를 진행하며 여러 난관도 있었지만, 팀원들과 협력하고 피드백을 주고받으며 문제를 해결해 나갈 수 있었습니다.발표를 통해 저희의 결과를 공유하며 청중과 소통하는 즐거움도 느낄 수 있었고, 데이터를 활용한 통찰이 정책적, 사회적으로 기여할 수 있는 가능성을 확인할 수 있었습니다.이 자리를 빌려 도움을 주신 멘토님들과 청중 여러분께 깊은 감사의 말씀을 드립니다. 앞으로도 데이터를 기반으로 더 나은 세상을 만드는 데 기여할 수 있도록 꾸준히..

카테고리 없음 2025.01.14

4주차 TIL - 프로젝트의 끝...

# 연도별 결측치 비율 확인 missing_by_year = data_cleaned.groupby('Year').apply(lambda x: x.isnull().mean() * 100) print("Missing by Year:\n", missing_by_year) # 결측치 비율이 낮은 연도만 필터링 valid_years = missing_by_year[missing_by_year['Value'] data_cleaned = data_cleaned[data_cleaned['Year'].isin(valid_years)]  # 'Value' 열의 결측치를 평균값으로 대체 data_cleaned['Value'] = data_cleaned['Value'].fillna(data_cleaned['Value'].me..

카테고리 없음 2025.01.13

4주차 TIL - 그래서 결론을 무엇으로 할 것인가

전세계 식품 생산 총량이 데이터이기 때문에결과를 안에 있는 데이터로 최대한 가져가고싶었다 그래서 코드를 수정했는데 # 국가별, 연도별 생산량 합계 계산 grouped_data = food_feed_data.groupby(['Area', 'Year', 'Element'])['Value'].sum().reset_index()# 연도별 첫 번째와 마지막 값 계산 growth_data = grouped_data.pivot_table(index=['Area', 'Element'], columns='Year', values='Value', aggfunc='sum').reset_index() # 첫 번째와 마지막 연도 선택 (연도는 데이터에 따라 변경 필요) first_year = grouped_data['Year'..

카테고리 없음 2025.01.10

4주차 TIL - 팀 프로젝트 시작!

*선택한 데이터 분석 [생산] 세계 식량 생산 데이터 탐색 *주제를 선택하게 된 이유현재까지 배운 라이브러리, 파이썬 함수를 사용하여 진행 할 수 있는 최적의 주제로 생각되어 선정했습니다.  *프로젝트명FOOD & FEED 프로젝트 핵심 내용* 주요 변수를 기반으로 생산량을 예측하여 지속 가능한 농업과 식량 공급의 효율화를 실현할 수 있습니다.  프로젝트 핵심 목표* 🐄 분석 목표EDA(탐색적 데이터 분석)인간 소비용 식량과 가축 사료 생산 데이터를 분석국가별 식량 생산량 분포와 주요 변수 탐색이상치 및 데이터 불균형 문제 확인시각화 및 비교 분석인간 식량과 가축 사료 간의 생산 비율 비교국가별 및 연도별 식량 생산량 트렌드 분석결론 도출식량 생산 패턴의 통찰력 제공 및 정책적 제언🐄 추후 고도화 방..

카테고리 없음 2025.01.08