codestates / codestates/ds-blog
DSFT01 이재우 03092020 데이터 시각화 첫번째 걸음
- Dominant language
- No language data
- Stars
- 2
- Forks
- 4
- PR merge metrics
- No merged PRs in 30d
Description
# 데이터 시각화
## 시작
> Admission challenge 과제에서 titanic data에서는 여자가 남자보다 생존확률이 높다는 것을 알 수 있었다.
> [https://colab.research.google.com/github/jingwoo4710/ds-admission-challenge/blob/master/ds_bootcamp_admission_challenge.ipynb#scrollTo=08CdiZjf-b6_](url)
```py
import pandas as pd
import matplotlib.pyplot as plt
titanic = pd.read_csv('https://web.stanford.edu/class/archive/cs/cs109/cs109.1166/stuff/titanic.csv')
titanic.head()
survived = titanic[titanic['Survived'] == 1]
survived['Sex'].value_counts(normalize=True).plot(kind='bar')
```

> 왜 일까?
## 접근 ( 성별 간의 나이 분포도를 통해 결론을 찾아내보자 )
> (ref : https://stackoverflow.com/questions/26476668/frequency-plot-in-python-pandas-dataframe/26477354)
```py
Male = titanic[titanic['Sex'] == 'male']
# print(Male)
Female = titanic[titanic['Sex'] == 'female']
# print(Female)
fig, ax = plt.subplots()
Male['Age'].value_counts().plot(ax=ax, kind='bar')
```

>나이의 range가 너무 커서 글자가 겹쳐서 보임. x축의 range를 조절 할 수 있는 방법이 다양하게 있었다. 아무것도 모르는 상태에서 그저 따라하기에 버겁다 느껴졌다. 도와주세요. 시간이 없어 내가 쉽게 이해하고 적용 할 수 있는 방법으로 가기 위해 높은 frequency를 나타내는 TOP 10 나이를 골라보자.
>(ref : https://stackoverflow.com/questions/60544330/highest-frequency-in-a-dataframe)
```py
Male.Age.unique()
#Male.Age.value_counts()[0:10] ERROR
f_val = Female.Age.value_counts()
Female_age = f_val.index[0:10]
```
> 그러다가 문득, 10개를 고르는것은 아무 근거 없는 biased 된 데이터를 기반으로 한다고 생각이듬. 그래서 가장 만만한 평균으로 접근해보기로 함.
>(ref : https://stackoverflow.com/questions/31037298/pandas-get-column-average-mean )
```py
titanic.groupby(by='Sex').mean().plot(kind='bar')
```

> 읽기 힘든 plot과 쓸데 없는 column을 줄이기로함.
```py
titanic[['Pclass', 'Age', 'Fare', 'Sex']].groupby(by='Sex').mean().plot(kind='bar')
```

## 알 수 있었던것
- 성별간의 Fare 외 나머지 분류의 차이는 미미하다.
- 그나마 생존률과 비슷하게 나타는 Fare와의 관계가 유사함을 알 수 있다. 그렇다고해서 상관관계가 있는지 알기는 부족하다. 내 실력이...
## 결론
> 이런거 필요없이, 재난 영화나 전쟁 영화에서 보면 아이와 여자를 먼저 살리는 장면을 많이 볼 수 있다. 나 또한 그게 당연하다고 생각하고 있다. 이런 통상적인 생각들도 데이터를 통해서 증명 할 수 있는 날을 기대한다. 👍 👍
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.