본문 바로가기

전체 글139

Data Merging: 공통 컬럼을 기준으로 데이터 합치기 지난번에는 concat()을 사용해서데이터프레임을 위아래로 이어붙이는 방법을 정리했다.이번에는 이어붙이기와는 조금 다르게,공통된 컬럼을 기준으로 옆으로 데이터를 붙이는 방법을 공부했다.이럴 때 사용하는 함수가 바로 pandas의 merge() 다.데이터분석을 하다 보면고객 정보는 한 파일에 있고,연봉 정보는 다른 파일에 있고,추가 정보는 또 다른 파일에 따로 있는 경우가 정말 많다.이럴 때 merge()를 사용하면공통된 키(key)를 기준으로 데이터를 자연스럽게 합칠 수 있다.연봉 데이터프레임 만들기먼저 은행 고객들의 연봉 정보가 담긴 데이터를 만들어본다.raw_data = { 'Bank Client ID': ['1', '2', '3', '4', '5', '6', '7', '8', '9', '10'.. 2026. 3. 22.
Multi-Indexing으로 그룹까지 나눠서 DataFrame 이어붙이기 지난번에는 pd.concat()을 사용해서여러 개의 데이터프레임을 하나로 이어붙이는 방법을 정리했다.이번에는 거기서 한 단계 더 나아가단순히 이어붙이는 것에서 끝나는 게 아니라,각 데이터프레임이 어떤 그룹에 속하는지까지 함께 표시하는 방법을 공부했다.이럴 때 사용하는 것이 바로Multi-Indexing을 활용한 concat() 이다.keys를 사용해서 그룹 이름 붙이기기본적인 concat()은 단순히 위아래로 데이터프레임을 붙인다.하지만 keys 옵션을 사용하면각 데이터프레임에 상위 그룹 이름을 붙일 수 있다.bank_all_df = pd.concat([bank1_df, bank2_df], keys=["Customers Group 1", "Customers Group 2"])bank_all_df이 코드를.. 2026. 3. 22.
DataFrame 이어붙이기: concat()으로 데이터 합치기 데이터분석을 하다 보면하나의 데이터프레임만 다루는 경우보다,여러 개의 데이터프레임을 합쳐야 하는 상황이 정말 자주 생긴다.예를 들면 이런 경우다.고객 데이터가 여러 파일로 나뉘어 있을 때월별 데이터가 따로 저장되어 있을 때부서별 데이터프레임을 하나로 합치고 싶을 때이럴 때 pandas에서 자주 사용하는 기능이 바로 concat() 이다.이번에는 간단한 고객 데이터 예시를 사용해서데이터프레임을 만들고, 위아래로 이어붙이고,새로운 고객 행까지 추가하는 방법을 정리해봤다.딕셔너리로 데이터프레임 만들기먼저 고객 데이터를 딕셔너리 형태로 만든 뒤데이터프레임으로 바꿔본다.raw_data = { 'Bank Client ID': ['1', '2', '3', '4', '5'], 'First Name': ['N.. 2026. 3. 22.
데이터 타입 바꾸기: astype()와 category로 메모리 절약하기 pandas로 데이터를 다루다 보면숫자 계산이나 필터링만큼 중요한 게 바로 데이터 타입(dtype) 관리다.처음에는 그냥 데이터를 불러와서 쓰기만 했는데,조금씩 공부하다 보니컬럼의 데이터 타입을 적절하게 바꾸는 것만으로도메모리를 아끼고, 데이터를 더 효율적으로 다룰 수 있다는 걸 알게 됐다.이번에는 pandas에서현재 데이터 타입 확인하기숫자형 타입 바꾸기category 타입으로 변환하기그리고 메모리 사용량 변화 확인하기를 정리해봤다.데이터 불러오기먼저 인사 데이터가 담긴 CSV 파일을 불러온다.employee_df = pd.read_csv('Human_Resources.csv')employee_df이제 employee_df 안에 데이터가 들어왔으니,각 컬럼이 어떤 데이터 타입으로 저장되어 있는지 확인해.. 2026. 3. 21.