대량 데이터에 대한 유사도 측정의 대안, MinHash & LSH
MinHash & LSH are * MinHash는 두 집합간의 유사도를 측정하는 기술로 각 집합을 기존 데이터보다 적은 형태의 Signature로 변환하여 연산비용을 줄여준다 * LSH는 Locality Sensitivity Hashing의
MinHash & LSH are * MinHash는 두 집합간의 유사도를 측정하는 기술로 각 집합을 기존 데이터보다 적은 형태의 Signature로 변환하여 연산비용을 줄여준다 * LSH는 Locality Sensitivity Hashing의
사실 이제는 출처가 기억이 나지 않는 이야기가 있다. 한 일본 검사에 관한 이야기였던 것으로 기억한다. 아이는 두려움이 너무나도 많아 툭하면 울곤 하였다. 이를 사람들은
FineTuning 장점 * Privacy * Reliability * Cost-Efficient Performance * More Control FineTuning * Full Fine Tuning: 모든 Layer & Parameter를 업데이트 * Parameter-Efficient Finetuning (PEFT): Parameter의 일부만
사실 왜 이 책을 읽게 된지는 기억이 정확하게 나지 않는다. 데이터 업에 근무한 이래, 우리가 보는 데이터는 어떠한 분포의 산물일 뿐이고, 나머지가 불확실성으로 가려져있다는
리더로서 일을 한지도 2년이 넘었다. 그 전에도 CEO Staff으로 일하면서 프로젝트를 위해서 버추얼 팀(Virtual Team)팀의 리더로 일한 적이 있었으나, 과제에만 집중할 뿐
사실 이 책을 읽은 이유는 순전히 제목 때문이었다. 월급을 두 번 받는다니, 게다가 나와 비슷한 공대생이라니 저 사람은 어떻게 할 것인가? 하지만 내용을 훑어보고는
왜 읽으려고 했을까? 사실 정확히 정리되지는 않았다. 그런데 회사의 상사 역시 이 책을 통해서 회고하고 있었고, 다른 누군가도 비슷한 행위를 하고 있었다. “노르웨이의 숲“
데이터가 없는 회사는 없다. 활용하지 않을 뿐이다. 모든 회사는 데이터를 가지고 있다. 그리고 그러한 데이터가 보다 전사에 체계적으로 흐를 필요가 있다고 느낄 시점이 될
Data Prep * New York City Taxi and Limousine Commission (TLC) Trip Record Data 데이터 활용 * https://www.nyc.gov/site/tlc/about/tlc-trip-
A/B테스트 시, 비회원은 어떻게 그룹할당할지 고민하지 않으면, 특정 그룹으로 쏠리거나, 아예 반영되지 않는 상황을 야기할 수 있다. 통상 비회원은 회원번호를 공통으로 처리하고 있기
배경 * 조직장은 개발 및 데이터 관련 업무를 한 경험은 있지만, 경력 자체는 데이터 관련 경험이 많지 않았음 * 사내 데이터 엔지니어링, 분석, 과학자 관련 역할을
Data Setup import polars as pl from xgboost import XGBRegressor from sklearn.linear_model import Ridge # Data taken from https://www.openml.org/search?