codestates / codestates/ds-TIL
[TIL] 오예은_200909
- Dominant language
- No language data
- Stars
- 2
- Forks
- 1
- PR merge metrics
- No merged PRs in 30d
Description
## 키워드
`concat` `merge` `Tidy data`
## 배운 것
### 여러개의 데이터셋을 하나로 합치는 것
- concat : 물리적으로 병합
- merge : 겹치는 부분을 중심으로 병합 (sql에서 inner join 개념)
` 사용할 데이터를 선택한(추려낸) 후 병합하는 것이 병합 후 데이터를 선택하는(추려내는) 것보다 빠름 (데이터의 양, 메모리 등 영향)`
### Tidy data
- 데이터를 어떻게 잘 시각화 할 수 있을까?
- 데이터 쪼개기 (1 row - 1 observation)
- 열 단위로 데이터 핸들링이 가능해지는 장점이 있음
[ ] ` 데이터베이스 정규화와 같은 개념인지 조사해보기`
### 데이터 구조화 방법
- 전치(transpose)
- melt() 이용: 기준값에 대해 컬럼→variable, 컬럼에 해당하는 각 값 →value로 테이블을 바꿔줌
- pivot_table(): melt()의 반대 개념
- isin 메소드는 단순히 해당 데이터가 대상에 포함되어있는지 여부만 판단함
→영역 등을 체크하고 싶을 때는 condition을 이용하여 판별
[ ] ` str에 isin 사용하는 경우 연습해보기`
## 느낀점
- 데이터 분석을 위해서는 제공된 데이터셋에 대한 이해가 필수인것 같다. 여러개의 데이터프레임을 뜯어보는 데에 시간이 많이 걸렸지만, 문제해결을 위해서 생략하면 안되는 과정이라는 생각이 들었다.
- 하나의 데이터프레임을 여러가지 형태로 바꿀 수 있는 것이 신기했다. 피벗테이블은 엑셀에서 많이 사용해봐서 이해가 금방 되었던 것 같다.
- 여러 형태의 데이터 셋을 보다보니 (아직 몇 개 안되지만) 얼마나 다양한 데이터로 여러가지 실험(?)을 해봤느냐가 데이터를 다루는 실력을 좌우할 것 같다. 앞으로도 열심히 해야지! 일단 도전과제부터 풀릴때까지 도전!
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.