codestates / codestates/ds-blog

[ 이윤회] Data Science Bootcamp Day 2_ Python 101(Dataframe and Pandas)

Open
#25 1 comment 1 reaction 0 assignees View on GitHub
news & info soft skill
Dominant language
No language data
Stars
2
Forks
4
PR merge metrics
No merged PRs in 30d

Description

파이썬이라는 프로그램 언어는 앱 개발, 데이터 분석 등 정말 다방면에서 활용이 되고 있는 프로그램 언어이다.
현재 필자는 데이터 분석을 위해 파이썬을 공부하고 있기에,
파이썬에서 데이터 분석을 하기에 기초적인 데이터프레임과 판다스에 대해서 설명하고자 한다.

## 데이터 프레임이란?

데이터 프레임이란 데이터를 시각적으로 보기 쉽고, 처리하기쉽게 하기 위하여 행렬의 방식으로 정리한 것이다.
흔히 엑셀 스프레드시트에 정리 된 데이터를 생각하면 해당 개념에 대한 이해가 쉬울 것이다.

파이썬에서 구현된 데이터 프레임의 예시는 아래와 같을 것이다

```
year dept revenue
2015 Sales 30
2016 Sales 35
2017 Sales 40
```

## 판다스란?

판다스는 파이썬에서 데이터 분석을 위한 라이브러리로 데이터 프레임 구조를 활용하는 라이브러리다.
해당 라이브러리를 파이썬에 불러오는 커맨드는 아래와 같다

```py
import pandas as pd
```

### 판다스를 활용해 데이터 프레임 생성하기

앞서 말한 것과 같이 판다스는 데이터 분석을 위한 라이브러리로
해당 라이브러리를 불러와 파이썬에서 데이터 프레임을 생성할 수 있다.

```
year dept revenue
2015 Sales 30
2016 Sales 35
2017 Sales 40
```
위와 같은 데이터 프레임을 생성하는 커맨드는 아래와 같다.

```py
import pandas as pd
year=[2015, 2016, 2017]
dept=['Sales', 'Sales', 'Sales']
revenue=[30, 35, 40]
Salesdata=list(zip(year, dept, revenue))
df=pd.DataFrame(data=Salesdata, columns=['year', 'dept','revenue'])
```

## 데이터 프레임 파해치기

파이썬에서 데이터 프레임에 특정한 조건에 맞는 값을 추출하기 또는 가공하기가 가능하다

### 데이터 프레임 열 선택하기
```
year dept revenue
2015 Sales 30
2016 Sales 35
2017 Sales 40
```
위 예시의 데이터 프레임 'df'에서 'revenue'열을 선택하는 커맨드는 아래와 같다
```py
df['revenue']
````
실행 결과
```
0 30
1 35
2 40
```

### 데이터 프레임 필터링

파이썬에서 특정 값보다 크거나 작은 데이터를 필터링 하는 것이 가능하다
예시의 데이터 중 'revenue' 값이 35보다 크거나 같은 데이터를 추출하는 커맨드는 아래와 같다
```py
df[df['revenue']>=35]
```

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.