Pandas 데이터 분석하기 — describe, value_counts, groupby로 데이터 요약하고 머신러닝 준비하기

·
AI Journey/Pandas
깨끗해진 데이터에서 의미를 찾아보자 지난 글에서는 우리가 사용하던 CSV 데이터를 직접 정리했습니다.처음에는 이런 문제가 있었습니다.결측치중복 데이터문자열 표기 불일치자료형 문제그리고 정제가 끝난 뒤 데이터는 다시 80명의 학습자 데이터가 되었습니다.하지만 여기서 한 가지 질문이 생깁니다.데이터를 깨끗하게 만들었으면 이제 무엇을 해야 할까? 데이터를 정리하는 것 자체가 목적은 아닙니다.우리가 정말 알고 싶은 것은 데이터 안에 들어 있는 정보입니다. 예를 들면 이런 질문입니다.어떤 과정을 듣는 학생이 가장 많을까?평균적으로 일주일에 몇 시간 공부할까?공부를 가장 많이 하는 학생은 누구일까?합격한 학생은 불합격한 학생보다 정말 공부를 많이 했을까?과정별 학습 시간에는 차이가 있을까? 이번 글에서는 Pan..