머 리 말
통계학 수준에서 자료를 활용하여 한 집단, 두 집단, 여러 집단 간의 비교 검정은 기본적이면서 매우 중요한 역할을 한다.
이 책에는 일반 통계학의 기초와 관련된 책에서는 잘 다루지 않는
· 1장 자료와 통계학 : 텍스트 자료의 요약
· 7장 일반화 선형모형분석 : 로지스틱 회귀분석과 판별분석/반복측정 분산분석/공분산분석
· 9장 기계학습 : 서포트벡터머신/분류나무/랜덤 포레스트/인공신경망
을 다루고 있다. 강의계획에서 빅데이터 분석과 관련된 1.7절 텍스트 자료의 요약과 7.1절 로지스틱 회귀분석과 판별분석 그리고 9장을 제외한 강의계획을 세울 수도 있다. 특히, 7.1절의 로지스틱 판별분석은 9장 기계학습과 다루어도 좋다.
부록 II와 부록 III에서 각각 R, RStudio와 Python 설치와 사용법을 제공한다. 실제로 R과 Python의 활용은 매뉴얼적인 차원의 자세한 설명은 자제하고 다양한 보기의 자료와 관련된 통계적 기법의 응용, 활용, 결과 해석에 초점을 맞추었다. 본문의 다양한 [보기]와 [연습문제]에서 사용되는 자료와 R-코드 그리고 [Python-코드 실습]의 Py-코드를 저자(yschoi.pusan.ac.kr) 또는 경문사(www.kyungmoon.com)에서 받아 갈 수 있도록 하였다.
끝으로 이 책이 데이터사이언스 분야에서 통계학을 이해하고 R과 Python을 활용한 응용의 차원에서 실제 자료를 분석해 보려는 학생들과 타 전공의 학생들에게 도움이 되기를 희망한다.
부산대학교 통계학과 연구실 208호
최용석 드림