RE-CONSIDER-ED

데이터, 비즈니스, 그리고 책에 대한 개인적인 기록

Latest

Model Specification

Model Criteria * Model은 다음 기준이 고려될 때 좋은 모델로 평가될 수 있다. * Model should be simple * Model World는 Real World를 단순하게 형상화 한 것으로,

베이지안 최적화(Bayesian Optimization)

Bayesian Optimization * Bayesian Optimization은 Training을 통해 파악하게 되는 Parameter와 별개로, 사전에 사람이 직접 입력해야 하는 HyperParameter를 최적화하기 위한 방법으로 아래와 같은 식과 같이 임의의

[책]리더를 위한 멘탈 수업

정보 * 저자 / 출판사: 윤대현,장은지 / 인플루엔셜 * 윤대현님: 현 서울대병원 정신건강의학과 교수 * 장은지님: 전 맥킨지리더십센터장 * 핵심키워드: 멘탈, 마음, 자기연민 * 점수: 3.5 / 5 * 구매링크: 링크

중복이미지 검출(Duplicate Image Detection)

모델 선정시 요구사항 * 현재 가지고 있는 이미지 데이터 규모 * 중복이미지 검출시 정확도 * Inference 시 실시간 여부 쓸 수 있는 기술 * FileName: File Naming Scheme에

믿음과 불안사이를 잇는 다리: 커뮤니케이션

팀장이 실무까지 하면서 팀을 매니징하는 것은 매우 어렵다. 따라서 팀장으로서 적절히 업무는 위임을 잘하는 것도 기술이다. 그리고 위임을 하기 위해서는 팀원에 대한 적절한 신뢰가

회사에서 데이터 너머를 바라볼 줄 아는 힘

회사에서 데이터 너머를 바라볼 줄 아는 힘

배경 * CEO Staff의 위치를 벗어나 프로덕트 실무로 팀을 이끈지 이제 한 달이 막 지나갔다. * 정말 많은 일들이 있었고, 이런 일로 팀들간에 조율이 필요할 수도

[TIL]RMSE(Root Mean Squared Error)

Why? * List Comprehension이 익숙치 않아 연습차원에 기존 Evaluation Metric을 줄여보려는 시도로 작성 * 작성하는 김에 numpy, sklearn, torch 모두 작성. * $RMSE = \sqrt {\sum\limits_{i=

BERTopic 주요 내용 요약 및 정리

어떤 모델인가? * Topic Modeling 기법 중 하나이다. * BERT 기반 Embedding + Class-based TF-IDF를 사용한 것이 아이디어의 핵심이다. 구조 * 크게 세 단계로 나눠서 볼

MLE(Maximum Likelihood Estimation)

시작하면서 * 이전에 Random Variable에 대한 글을 작성했던 적이 있다.  현재 우리가 관측하고 있는 숫자는 사실 여러 가능성 중 일부가 관측된 형태라고 볼 수 있다.

Numpy vs Torch

Numpy와 Torch의 차이 * Numpy는 일반적인 ML을 위해서 이용되나, Torch Tensor는 무거운 행렬연산에 최적화되어 GPU 사용을 지원 * Torch Tensor는 Tensor 생성시 추가 Parameter로 device_type과

Transformer를 위한 Custom Dataset 만들기

Background * Transformer에서 제공하는 Pipeline을 이용해서 Sentiment Classifier를 하는데 기존  Dataframe을 그대로 이용하려니 GPU를 활용하더라도 상당히 느려서 Efficiency를 높이기 위해서 Dataset으로 변환을 하기로 결정하였다. Usage

Gensim 기본 LDA 대신, Mallet LDA 사용시 몇가지 이슈 대처법

1.pyLDAvis 사용하려고 할 때 Inference 에러 발생시 다음과 작성했는데,  다음과 같은 에러가 발생할 경우가 있다. pyLDAvis.enable_notebook() vis = pyLDAvis.gensim.prepare(mallet_