Udemy

Distribution Plots in Python

Jose Portilla의 무료 동영상 튜토리얼
Head of Data Science at Pierian Training
평점: 4.6/5점강사 평점
87개의 강의
4,632,781명의 수강생
Distribution Plots

강의 설명

Learn about Data Visualization with Seaborn and Python!

전체 강의에서 자세히 알아보세요.

Python for Data Science and Machine Learning Bootcamp

Learn how to use NumPy, Pandas, Seaborn , Matplotlib , Plotly , Scikit-Learn , Machine Learning, Tensorflow , and more!

주문형 동영상의 24:46:40 • 업데이트 날짜: 5월 2020

Use Python for Data Science and Machine Learning
Use Spark for Big Data Analysis
Implement Machine Learning Algorithms
Learn to use NumPy for Numerical Data
Learn to use Pandas for Data Analysis
Learn to use Matplotlib for Python Plotting
Learn to use Seaborn for statistical plots
Use Plotly for interactive dynamic visualizations
Use SciKit-Learn for Machine Learning Tasks
K-Means Clustering
Logistic Regression
Linear Regression
Random Forest and Decision Trees
Natural Language Processing and Spam Filters
Neural Networks
Support Vector Machines
한국어 [자동]
안녕하세요, 여러분 시본의 배급 플롯 강의에 오신 걸 환영합니다 이번 강의에서는 데이터 세트의 배급을 시각화하는 다양한 플롯 유형을 살펴볼 텐데요 목성 노트북으로 점프해서 시작하도록 하죠 네, 공책에 도착했어요 우선 바닷물 수입부터 시작하겠습니다 관례에 따라 아시누스라는 해생 생물을 수입하죠 공책에 있는 것이기 때문에 Matt Flot이 라이브라고 할 것입니다. 공책 안에 시각화된 것을 볼 수 있도록요. 좋아요, 이제 데이터를 좀 볼까요? 해상 운송에는 직접 로드할 수 있는 몇 가지 내장 데이터 세트가 있어요 팁이라고 하는 걸 하나 골라서 팁이라고 하는 데이터 프레임으로 저장할게요 Tipps는 Asinus의 load 데이터 집합과 같고 파센 팁은 문자열로 설정하면 돼요 그럼 팁 데이터 세트가 로드되고 프레임 상태를 확인할 수 있어요 이렇게 생겼네요 7개의 열이 있는데 식사를 하고 팁을 남긴 사람들을 나타내는 데이터예요 식권의 총 가격과 지폐 팁을 남긴 사람의 금액 팁을 남긴 사람의 성별과 성별 흡연자인지 아닌지를 알 수 있어요 식사한 날짜와 시간을 알 수 있죠 그리고 파티의 규모도요 좋아요, 첫 번째 플롯 유형에 대해 얘기해보죠 이 플롯 CISC 플롯인데요 이 플롯은 우리가 일정한 변수 세트의 배급을 보여줄 수 있게 해주죠 그냥 하나의 변수를 다르게 말하는 거예요 들어가서 살펴보죠 아시너스가 이 부분을 생각하고 이 부분을 할 때는 데이터 프레임의 단일 열 하나를 넘기는 거예요 이 경우엔 전체 지폐가 어떻게 분배되는지 보죠 토탈 빌이라고 입력하고 셀을 실행하면 이런 플롯이 나올 거예요 여기서 경고를 받아도 걱정하지 마세요 STATS 모델이라는 다른 패키지가 있을 경우죠 실제 선천적 코드에는 영향을 미치지 않아요 하지만 지금은 아무런 경고도 없으니 괜찮아요 기본적으로 조직도가 있고 Kd e라는 것이 있는데 커널 밀도 추정이라는 것이 이 줄에 있어요 이번 강의 후반부에서는 케이티의 실체와 그걸 형성하는 방법에 관해 논의할 거예요 하지만 지금은 제거할 수 있어요 추가 인수로 케이티 = false라고 하면 되죠 케이티 = False라고 입력만 하면 되죠 조직 문자란 게 있는데 조직 문자란 전체 지출이 어디 있는지 표시하는 거예요 여기 보시면 y축에는 카운트가 있고 X축에는 이 막대가 바인 형태로 있어요 그 말은 지폐의 총액이 10달러에서 20달러 사이란 거죠 이에 관해 좀 더 정보를 얻고 싶다면 bins 개수를 바꿀 수 있어요 세 번째 인수인계로 가면 되죠 적절한 입찰 개수는 데이터셋에 달려 있어요 하지만 일단 들어가서 30개를 골라보죠 이제 좀 더 정의가 나왔네요 여전히 대부분의 청구서가 10에서 20 사이인 걸 볼 수 있죠 예를 들어 너무 높은 값을 고르면∙∙∙ 가령, 100이라 치죠 그럼 기묘한 시나리오가 시작돼요 각 가격대에 따른 모든 청구서의 인스턴스를 구성하기 시작하는 거죠 보통은 크기에서 균형을 찾으려 하지만 그건 플롯 자체에 달렸죠 네 좋은 정보를 얻은 것 같군요 이 그래프를 읽을 수 있다면 대부분의 지폐가 10달러에서 20달러 사이란 걸 알 수 있죠 그리고 높을수록 희미해져요 빌 프라이스 그게 줄거리예요 그걸 통해 배급을 시각화할 수 있죠 조직그램이요 그 위에 케이크를 얹어서 먹을 수도 있고요 케이티 플롯은 나중에 나와요 조인트의 배치도와 해상 배치도를 살펴보죠 아시누스의 배치도라고 하면 다양한 데이터로 이 배치도와 대조할 수 있어요 두 개의 다른 분포도를 결합할 수 있는 거죠 변수가 2개일 뿐이죠 우리가 사용할 매개 변수가 있다면 두 개의 배포판을 어떻게 비교할지 선택할 수 있게 해주죠 에센스를 어떻게 시작점으로 사용할 수 있는지 보여드리죠 먼저 x 변수를 패스한 다음 Y 변수를 패스한 다음 데이터 집합을 패스해야 해요 백 엔드부터 시작하죠 승객 정보는 팁으로 설정해요 일종의 데이터 프레임이죠 x와 y에 대해서는 열 이름인 pasand string만 입력하면 돼요 비교하고 싶은 두 가지죠 예를 들어 전체 지폐의 분포와 팁의 크기를 비교하고 싶다고 해보죠 그렇게 하죠 제 전남편 이름으로 총계를 내고 접근하는 길에 팁 칼럼에 두죠 지금 최종 빌 열을 넘기고 있어요 팁 칼럼과 데이터는 팁과 같죠 이렇게 생긴 플롯이 나왔어요 2개의 배포 플롯이죠 y축의 끝부분이 보이고 x축의 합계 빌이 보이죠 그런 다음 줌아웃하면 전체 플롯이 보여요 그리고 그 사이에 Scatterplot이 있는데 이 Scatterplot은 사실 말이 돼요 왜냐하면 경향상 전체 지출이 높을수록 팁도 높아지거든요 팁은 보통 전체 지출에 비례하기 때문에 말이 되죠 조인트 플롯은 유형이라 불리는 추가적인 인자 매개 변수를 제공합니다 이 유형 매개 변수는 이 조인트 플롯 안에서 실제로 일어나는 일에 영향을 주죠 지금은 기본값으로 Scatter지만 인수 같은 걸 전달할 수도 있어요 헥스 같은 거요 헥스는 기본적으로 육각형 분포 표시를 만들 수 있죠 분산과 비슷한데 다만 육각형에 일정한 점수가 있다면 어두워지고 점수가 적으면 밝아져요 기본적으로 그런 분산점을 둘 필요가 없는 거죠 대신에 육각형으로 분포를 보여주는 거예요 또 다른 종류로는 회귀를 의미하는 eg가 있죠 Scatterplot처럼 보일 겁니다 다만 시본이 회귀선을 그을 뿐이죠 아직 머신 러닝에 관한 선형 회귀는 배우지 않았지만 나중에 해당 주제에 접근하게 되면 여기로 돌아와 이 라인이 어떻게 만들어졌는지 논의할 거예요 하지만 기본적으로 이건 흩어진 포인트 데이터에 선형으로 맞는 걸 보여주는 거죠 피어슨 계수에서 P 값을 볼 수 있습니다 이건 나중에 선형 회귀에 관해 얘기할 때 다룰 건데요 마지막으로 여기에 넣을 수 있는 또 다른 종류는 KDE입니다 그건 이것도 가능하게 하죠 제가 K-T를 언급했는데 이 지점이 밀도가 가장 많이 일치하는 곳을 보여주죠 그럼 다음으로 넘어가서 조인트 플롯은 기본 Scatter가 있는 플롯을 사용합니다 기본적으로 읽기가 가장 쉽고 많은 정보를 바로 제공하기 때문이죠 연동 플롯을 보여줌으로써 그 아이디어를 확장할 겁니다 연동 플롯은 기본적으로 연동 관계를 전체 데이터 프레임에 걸쳐 구성하죠 적어도 숫자 열에 대해서요 또한 색조 논쟁도 뒷받침합니다 나중에 보여드리죠 하지만 이 위쪽에 합집도가 있는데요 이 데이터 프레임에서 가능한 숫자 기둥의 모든 조합을 합집도로 나타내는 거예요 무슨 뜻인지 보여 드릴게요 모든 조합이 그렇게 될 테니까요 플롯 당 S와 S 생각을 호출해 데이터 프레임을 전달하면 되죠 코스 내내 이런 걸 많이 할 거예요 데이터 프레임이 클수록 플롯당 걸리는 시간이 길어요 플롯 당 많은 시간이 걸립니다 비교적 작은 프레임 대신 데이터 프레임이 크면요 우린 괜찮아요 여기 모든 수치 열 값에 대한 쌍 플롯이 있어요 사이즈가 정해져 있어요. 부리의 크기와 팁을 비교해 보세요 그런 다음 매개 변수 대 인스턴스 크기 대 크기 그냥 직선만 있는 게 이치에 맞는 Scatterplot 대신에요 히스토그램이 보이죠 팁 대 팁도 마찬가지예요 플롯 당 총액 대 총액은 데이터를 빠르게 시각화할 수 있는 좋은 방법이죠 더 좋은 점은 이 H에 색상 인수를 추가할 수 있다는 거예요 Hewe 인수는 열에서 넘기는 위치죠 카테고리의 카테고리는 숫자가 많거나 지속적인 카테고리가 아니라 실제 카테고리를 뜻해요 예를 들어 섹스 칼럼은 단정적이에요 남성과 여성 두 범주로 나뉘거든요 콜로니를 전달할 때 =섹스라는 이름을 입력하면 색조를 나타내는 열을 기반으로 데이터 포인트를 색칠해요 전설에 따르면 녹색 점수는 전부 여성이고 남성 점수는 전부 여성이에요 전체를 볼 수 있게 줌아웃할게요 파란색은 전부 수컷이에요 세 번째 인수로 팔레트를 지정할 수 있어요 팔레트로 특정 색 팔레트로 이걸 색칠할 수 있죠 색상, 색상, 스타일에 대해서는 해상 강연의 마지막 시간에 얘기해 보도록 하죠 예를 하나 보여드릴게요 기본적으로 그 플롯에서 나온 컬러 맵 스트링들이 있어요 팔레트에 전달할 수 있죠 변수가 어떻든 특정 색깔을 선택해요 보다시피 우편물은 파랗고 암컷은 옅은 분홍색을 띠죠 좋아요, 팔레트에 색상과 스타일을 훨씬 더 많이 넣을 거예요 이제 Roug 플롯으로 넘어갑시다 로그 플롯은 아주 간단한 개념입니다 로그 플롯의 개념을 이용해서 구축을 할 거예요 네 앞서 본 KT 줄거리를 설명해 주세요 S라고 입력할게요 A요 루그의 배치도처럼 이 단일 기둥에 배치할 거예요 팁이라고 입력하고 최종 법안 칼럼을 통과시킵니다 이 줄거리가 하는 일은 아주 간단해요 유니폼 또는 독특한 변종 분포의 모든 점에 대시 표시를 하는 거죠 근본적으로 단일 변수요 히스토그램 대신에 이 플롯을 한 번 더 비교해 볼게요 이 줄거리가 모든 걸 알려주죠 그걸 실행하고 케이티가 false라고 하죠 여기 아래에 있는 히스토그램과 러지의 그림은 달라요 히스토그램에는 칸이 나뉘어 있어요 칸에 대시가 몇 개인지 세고 이 위에는 숫자로 나타나요 그 말은 10개에서 11개 사이라는 거죠 이걸 보면 알 수 있어요 45단계가 있어요 전부 겹겹이 쌓여 있어요 그리고 이쪽의 총 가격은 루그가 적거나 대시가 적어요 즉, 벤이 덜 높다는 거죠 그게 SR-GR 램과 이 악당 계획의 기본 관계입니다 아주 간단한 개념이죠 분배선을 따라 있는 점 하나하나에 표시만 해 주시면 돼요 좋아요, 그게 총액이에요 악당에 대한 플롯을 바탕으로 케이티의 플롯을 설명하려고 해요 바로 이 줄이에요 이런 음모에 기초해서 어떻게 선을 긋죠? 악당 플롯 카운트 KDE와 연관이 있는 것을 볼 수 있습니다 커널 밀도 추정 플롯과 연관이 있습니다 이걸 구글에서 찾을 수 있고 커널 밀도 추정 플롯으로 위키피디아를 볼 수 있습니다 그러면 페이지는 이런 식으로 보이고 이것은 아래로 스크롤이 내려가죠 여기 아주 멋진 figure이 있네요. 우리는 기본적으로 구조를 만들거에요. 여기 검은 대시 하나하나가 불량 플롯이에요 실질적인 포인트요 그리고 각 점 위에는 이런 정상적인 가우시안 분포가 있어요 그 모든 걸 요약하는 거죠 그래서 커넌스 커널 밀도 추정값이 나오죠 정상 분포와 가우시안 분포는 무슨 뜻일까요? 확률론에서 위키피디아 네소스를 찾아보면 정상 분포와 지속적 분포 중앙에서 가장 흔한 경우일 거예요 일종의 정규 분포 방식이죠 다들 시험을 잘 봤는지 확인하고 학생들을 채점하고 점수 분포를 보는 거예요 보통 이런 건∙∙∙ 예를 들어 사람들의 나이나 키 같은 건 보통 일반적인 분포를 따르게 마련이죠 네 다시 주피터 노트로 돌아가서 이 주제들을 좀 더 상세히 살펴보죠 노트 북에서 코드를 복사해 붙여넣기를 하겠습니다 여러분은 이 코드를 이해하실 필요가 없어요 설명을 위한 다이어그램을 만들어 복사해 붙여넣기를 하는 거죠 이 코드를 복사하고 붙여넣기를 했어요 이 코드로 간단히 설명해보죠 수입할 게 좀 있어서요 임의 데이터로 데이터셋을 만들어요 그런 다음 그 무작위 데이터에 카펫을 깔아요 x축을 설정해 놨어요 올런드 화면으로 엑스맨의 엑스맥스와 여기 사이 간격으로 100점을 만드세요 이게 가장 이해하기 힘든 부분일 거예요 라이브러리를 사용하거든요 아직 얘기 안 했어요 정상이 아니에요 이건 각 카펫의 위치마다 정기적으로 배치된 줄거리죠 이렇게 생겼어요 이걸 확대해 볼게요 여기 데이터셋이 있네요 이건 임의의 데이터셋이고요 올해 실행하면 약간 달라 보일 수 있지만 팁으로 작업하는 건 더 이상 아닌 걸 기억하세요 무작위 데이터를 분석하고 있어요 여기 파란 선이 보이시죠? 이 회색 선은 정규 배포판을 나타내요 이 파란색 선들 위에요 대시보드를 중심으로 분포돼 있어요 여러 개가 겹겹이 쌓여 있어요 다음으로 넘어가서 커널 밀도 기반 함수를 하도록 할게요 이건 이런 정규 분포의 총합이에요 좋아요, 노트북에서 두 번째 블록을 복사하고 붙여 넣으면 이 모든 기본 함수들을 종합할 수 있습니다 정규 배포판인 셈이죠 티케이의 원래 플롯과 비슷하게 생겼어요 원반 플롯에서 나온 플롯이죠 첫 번째 플롯에서 가장 높은 T층을 봤어요 좋아요, 이렇게 데이터 배포판을 보여줄 수 있는 주요한 방법들이었죠. 이 컴퓨터와 플롯 유형의 다양한 플롯 유형을 간략히 검토해보죠 다시 스크롤을 올릴게요 이 플롯과 이 플롯을 두 가지 방법으로 사용할 수 있어요 케이티 = 가짜로 히스토그램을 보거나 빈칸으로 두는 거죠 커널 밀도 추정이라는 것을 볼 수 있습니다. 이것은 끝부분이 정규 배포판의 합이라는 것을 설명합니다. 이것은 x, y 인수로 두 개의 열을 전달하는 것과 매우 비슷하죠. 세 번째 인수가 데이터와 같다면 두 번째 플롯은 쌍 플롯이에요 플롯은 플롯을 기반으로 하는데 데이터셋에 있는 모든 열이나 숫자를 합친 플롯이에요 그 데이터셋을 그 프레임에 넘기면 색조와 팔레트를 넘길 수 있고 여분의 열로 색칠하고 싶다면 다음 플롯은 보통 루그 플롯을 사용하지 않지만 거기 있어요 로그 플롯을 사용한다는 주된 아이디어는 커널 밀도 추정 플롯의 논리를 구축하는 건데 이 코드를 통해 하는 거예요 이 코드를 천천히 읽어보셔도 됩니다 제가 말씀드리고 싶은 것은 악당 플롯을 사용할 때 핵심 밀도 추정 플롯을 구축하고자 한다면 케이티 플롯을 각 점에 정규 배포판을 가지고 있다고 하면 됩니다 그리고 모든 점의 합을 가져오는 거죠 그게 핵심 밀도 추정 플롯이에요 이 플롯을 이용해 그걸 어떻게 할 수 있는지 봤죠 이 플롯을 이용하시면 K-T 플롯을 없앨 수 있어요 케이티 = False라고 하면 되죠 실제 빈즈가 아닌 K-T 플롯을 원하시면 Asinus KDE 플롯 대신 파산 플롯을 쓰셔도 되고 asinus KDE나 파슨 팁을 쓰셔도 돼요 철봉 없이 K-T 구역을 만들 수 있어요 좋아요, 시본은 아주 강력하고 여러분이 작성해야 할 코드에 관해선 아주 간단하다는 걸 아셨으면 해요 모든 게 한 줄로 이뤄졌어요 플롯 맵 리브를 하려고 하면 여러 줄이 필요하지만 이게 좋은 점은 여러분이 아는 플롯 라이브에서 작동한다는 거죠 스타일링과 색에 관해 얘기할 때 자주 보게 될 거예요 지도 플롯의 많은 지식은 이 플롯에서 작은 부분들을 편집할 수 있게 전이할 수 있어요 시본을 다시 즐기기 시작하셨으면 좋겠네요 제가 가장 좋아하는 도서관 중 하나거든요 시본에 관해 배울 다음 줄거리도 빨리 보여드리고 싶네요 여러분, 감사합니다 다음 강의 때 뵙죠