codestates / codestates/ds-blog
[ 이윤회] Data Science Bootcamp Day 2_ Python 101(Dataframe and Pandas)
- Dominant language
- No language data
- Stars
- 2
- Forks
- 4
- PR merge metrics
- No merged PRs in 30d
Description
파이썬이라는 프로그램 언어는 앱 개발, 데이터 분석 등 정말 다방면에서 활용이 되고 있는 프로그램 언어이다.
현재 필자는 데이터 분석을 위해 파이썬을 공부하고 있기에,
파이썬에서 데이터 분석을 하기에 기초적인 데이터프레임과 판다스에 대해서 설명하고자 한다.
## 데이터 프레임이란?
데이터 프레임이란 데이터를 시각적으로 보기 쉽고, 처리하기쉽게 하기 위하여 행렬의 방식으로 정리한 것이다.
흔히 엑셀 스프레드시트에 정리 된 데이터를 생각하면 해당 개념에 대한 이해가 쉬울 것이다.
파이썬에서 구현된 데이터 프레임의 예시는 아래와 같을 것이다
```
year dept revenue
2015 Sales 30
2016 Sales 35
2017 Sales 40
```
## 판다스란?
판다스는 파이썬에서 데이터 분석을 위한 라이브러리로 데이터 프레임 구조를 활용하는 라이브러리다.
해당 라이브러리를 파이썬에 불러오는 커맨드는 아래와 같다
```py
import pandas as pd
```
### 판다스를 활용해 데이터 프레임 생성하기
앞서 말한 것과 같이 판다스는 데이터 분석을 위한 라이브러리로
해당 라이브러리를 불러와 파이썬에서 데이터 프레임을 생성할 수 있다.
```
year dept revenue
2015 Sales 30
2016 Sales 35
2017 Sales 40
```
위와 같은 데이터 프레임을 생성하는 커맨드는 아래와 같다.
```py
import pandas as pd
year=[2015, 2016, 2017]
dept=['Sales', 'Sales', 'Sales']
revenue=[30, 35, 40]
Salesdata=list(zip(year, dept, revenue))
df=pd.DataFrame(data=Salesdata, columns=['year', 'dept','revenue'])
```
## 데이터 프레임 파해치기
파이썬에서 데이터 프레임에 특정한 조건에 맞는 값을 추출하기 또는 가공하기가 가능하다
### 데이터 프레임 열 선택하기
```
year dept revenue
2015 Sales 30
2016 Sales 35
2017 Sales 40
```
위 예시의 데이터 프레임 'df'에서 'revenue'열을 선택하는 커맨드는 아래와 같다
```py
df['revenue']
````
실행 결과
```
0 30
1 35
2 40
```
### 데이터 프레임 필터링
파이썬에서 특정 값보다 크거나 작은 데이터를 필터링 하는 것이 가능하다
예시의 데이터 중 'revenue' 값이 35보다 크거나 같은 데이터를 추출하는 커맨드는 아래와 같다
```py
df[df['revenue']>=35]
```
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.