RE-CONSIDER-ED

데이터, 비즈니스, 그리고 책에 대한 개인적인 기록

Latest

Random Forest로 시계열데이터 예측하기

지금 회사에서 가장 많이 한 업무 중 하나가 바로 주문수 예측이었다. 처음에 단순히 곱셈으로 작업하던 부분을 개선해서 이전보다 좀 더 세밀히 하기는 하지만 여전히

고객의 행동패턴을 세부적으로 나눠보기에 좋은 5가지 기준

매일, 매주 출근 길에 밀린 뉴스레터를 읽는다.뉴닉도 있지만 그 중에는 Ruben Ugarte’s Weekly Growth Needle이라는 레터도 있다. 대충 보고 지나갈 때도 있지만

[책]플랫폼 레볼루션 (2) 시작부터 거버넌스까지

플랫폼은 양면시장을 활용하되 특정 자원을 소유함으로써 가치를 창출하지 않는다. 그래서 내부보다는 외부에 관심을 기울임으로써 상호작용을 강화하고 확장함으로써 가치를 확장해나게 된다. 자연스럽게 일반적으로 전통적으로 사용하는

[책]플랫폼 레볼루션 (1) – 정의부터 설계 시 고려사항까지

플랫폼은 시장내 사용자들을 서로 연결해주고 상품, 서비스를 교환할 수 있도록 연결해줌으로써 모든 참여자들이 가치를 창출할 수 있게 도와 준다. 그리고 출판사의 편집자, 대학의 입학처장

편향과 분산 관점에서 배깅(Bagging)과 부스팅(Boosting)의 비교

편향은 크기가 n인 데이터 세트에서 샘플링 후 훈련시킨 모델 출력의 평균값과 실제 모델 출력 사이의 편차를 말한다. 일반적으로 모델에 대한 가설을 잘못 세우면 발생한다.

[HBR] 코로나 이후 우리의 모습은 어떻게 바뀔까? (What Is the Next Normal Going to Look Like?)

HBR에서 “What Is the Next Normal Going to Look Like?“이란 기사를 봤는데 코로나 이후 변하는 사회에 대해 시스코(Cisco), 월터스 클루베(Wolters Kluwer/

제주도 해녀의 부엌

공항 근처 호텔을 나와 비자림과 다랑쉬 오름을 다녀온 직후 땀에 젖은 몸을 이끌고 도착한 곳은 해녀의 부엌이었다. 오래된 건물 한켠에 붙어 있는 간판을 찾지

히든마르코프 모델을 이용한 오픈 이온 채널 수 예측(Kaggle - University of Liverpool - Ion Switching Competition)

※ 해당 글은 원 저자은 Gilles Vandewiele 씨의 허락을 받고 번역하였습니다.(링크) * 저자는 솔루션 코드를 공개하였습니다.(링크) 2 월 24 일, 캐글은 리버풀 대학과 공동으로

Permutation Importance & Partial Dependence Plot 정리

Permutation Importance과 Pertial Dependence Plot은 Machine Learning Model에서 Input과 Output간의 관계를 이해하기 위한 가장 쉬운 방법론 중 하나이다. Model을 평가하는 여러 방식이 있지만 그

[책] 좋은 선택 나쁜 선택

숫자는 거짓말을 하지 않는다. 하지만 거짓말쟁이들은 숫자를 이용할 궁리를 한다.(Figures don’t lie, but liars can figure.) 책에서 인용된 구절 중 가장 마음에

CNN, Convolution Neural Network 주요 개념

CNN은 Convolution Neural Network(이하)로서 합성곱을 적용한 신경망으로 신경망 중에서 가장 처음 배우는, 널리 알려진 신경망중 하나이다. 대략적인 구조는 아래와 같다. Convolution과 Pooling을

공공API - 기상(종관기상관측) R로 가지고 오기

기상정보를 활용하기 위해서 주로 기상자료개방포털에서 종관기상관측 데이터를 가지고 오긴 했는데 이를 매일 수작업으로 가지고 오다가 보니 오픈 API를 지원하는 것을 알게 되어서 간단하게 짜보았다.