목록전체 글 (17)
Data Analysis & Merketing
파이썬은 for~ else~ 문을 지원한다. 이 중 for문을 돌면서 for문 내부에서 break를 만나지 않았을 때 진행 할 동작을 제시할 수 있다. n = 10 for i in range(20): if n == i: print('here') break else: print("hi") # hi # hi # hi # hi # hi # hi # hi # hi # hi # hi # here 위 코드는 흔히 사용하는 for문 + if~ else~ 문의 형태이다. n == i 경우에 break에 걸려 반복문이 중단될 것이다. n = 10 for i in range(5): if n == i: print('here') break else: print("hi") # hi 위 코드는 else문이 for문과 같은 라인에..
5주라는 기간 동안 이 책을 읽고 공부하면서 딥러닝에 대해 알아갈 수 있었다. 동시에 프로젝트를 진행하면서 딥러닝을 직접 응용할 수 있어서 아주 좋은 프로그램이라고 생각한다. 하지만 책 공부 + 프로젝트 + 학업 + 취준 + 알바 등 그 외 활동을 동시에 진행해야 했다.. 그리고 중간 중간 퀴즈들과 각 주마다 진행되는 간단한 과제들이 버거웠다.... (간단한 과제들이 모여 모여 압박처럼 느껴지는..) 5주라는 기간과 여러 활동들로 인해 시간적으로 여유롭지 못했기 때문에 너무너무 힘들었지만,, 좋은 사람들을 만날 수 있어서 즐거웠다. 직접적인 교육보다 이렇게 스스로 공부하면서 경험할 수 있도록 환경을 제공해주는 것이 좋았고 앞으로 또 기회가 된다면, 충분한 시간적 여유가 주어진다면 참여하고 싶다. 이 책 ..
생성 모델은 데이터로부터 확률분포를 추정해서 데이터를 생성하는 모델이다. 1. 베이즈 정리와 주변화 확률 모델을 이해하기 위한 확률의 기본 개념 3가지 : 확률의 곱 법칙, 합 법칙, 베이즈 정리 1) 확률의 곱 법칙 확률의 곱 법칙은 조건부 확률 식에서 유도할 수 있다. 이 식에서 우항의 분보를 좌항으로 넘기면 결합 확률분포는 다음과 같이 정리된다. 결합 확률분포가 두 확률분포의 곱으로 표현되었다. 확률의 곱 법칙은 결합 확률분포를 인수분해해서 두 확률분포의 곱 형태로 표현하는 것을 말한다. 2) 확률의 합 법칙 표본 공간 S에서 A의 발생 확률 p(A)를 구한다면, 먼저 A와 각 Bn의 결합 확률분포를 구하고 모든 Bn에 대해 합산하면 p(A)를 구할 수 있다. 결합 확률분포에서 일부 확률변수의 분포..
BDA Easy Study Project에서 진행하는 프로젝트에 대해 글을 작성하려고 한다. 프로젝트 주제 : 금융 뉴스 감성분석과 주가 시계열 예측을 통한 주가 등락 예측 01 데이터 불러오기 빅카인즈에서 제공하는 뉴스 분석 서비스를 활용하여 경제 토픽에 해당하며 2020년 1월 1일 부터 2023년 5월 8일에 속하는 뉴스를 크롤링 하였고, '일자', '언론사', '제목', '특성추출', '통합분류1' 변수를 추출하였다. (사진 상 보이는 나머지 변수들은 제거될 예정) 중복을 제거하고 나니 1728976개의 데이터가 존재하는 것을 확인하였다. 02 제목 - 불용어 처리 모델의 학습을 방해하는 불용어를 처리하기 위해 한글과 영어를 제외한 숫자, 한자, 특수문자 등을 제거하였다. 이처럼 숫자와 한자, 특..
인자분석 인자분석은 상호연관된 다변량 확률변수들 간의 내부적 상호의존관계를 저변에 내재하는 몇 개의 인자(요인)들을 통해 재현, 해석하고자 한다. 관찰 가능한 많은 특성/항목들로부터 몇 가지 일반적인 성격(인자)들을 발견하거나 만들어내는 통계적 과정이라고 할 수 있으며 인자들을 어떤 형태로 결합하면 거꾸로 각 항목들을 설명할 수 있다. 특히 사회과학 부문에서 변수축소와 가설적 구성개념의 구축(어떤 특성이 있음을 증명)을 위해 응용되어 왔으며, 이를 위해서는 변수들 사이의 관계에 관한 정보를 가지고 있는 공분산행렬, 상관행렬이 주요 분석대상이 된다. 서로 상관관계를 맺고 있어서 직접적으로 해석하기 어려운 여러 변수들 간의 구조적 연관관계를 상대적으로 독립이면서 저변구조를 이해하기 위한 개념상 의미를 부여할..
다변량 자료분석의 중요한 목적 여러 변수들의 정보를 일차원 or 소수 몇 개의 차원으로 축소하여 복잡한 다차원 구조를 단순화시켜 쉽게 이해하려는 것 다음 단계의 통계분석들(군집분석, 회귀분석, 인자분석 등)을 위한 입력자료로 이용(분석과정에서 하나의 중간단계) 선형변환과 주성분 주성분분석은 서로 상관되어 있는 변수들 간의 복잡한 구조를 분석하기 위해 p개의 변수들을 선형변환시켜 주성분이라는 새로운 인공변수들을 유도한다. (주성분은 서로 상관되어 있지 않은 독립적인 변수이다.) y = a1x1 + a2x2 + ... + apxp 변수들에 대해 가중결합을 취한 것을 선형변환이라고 한다. 이때 변환값 y는 가중계수들의 벡터 a = (a1, a2, ... , ap)의 적절한 선택에 따라 원래의 x보다 더 유용한..