본문 바로가기

전체 글

(74)
Data Pipeline Engineering Data PipelineExtract — extract data from the sourceTransformation — transform data into desired formatLoad — load storage the dataData Engineer RoadmapUnderstand Data Warehouse Fundamentalslearn fundamentalslearn tools like Snowflake, BigQuery, RedshiftUnderstand processing frameworksBatch processing (Apache Spark: powered by databricks, Amazon EMR)Real-time processing (Apache Kafka)Understand c..
Tableau Prep Builder를 통한 데이터마트 구축 Tableau Prep Builder란?데이터를 결합, 변형, 정리할 수 있는 태블로에서 제공하는 인터페이스를 말합니다.더 많은 데이터에 연결온프레미스에 있든 클라우드에 있든 상관없이 데이터베이스와 스프레드시트 모두에 연결할 수 있습니다. 코드를 작성하지 않고도 다양한 데이터에 액세스하고, 결합 및 정리할 수 있습니다. Tableau Prep Builder는 가능할 때마다 지능적으로 작업을 데이터베이스에서 직접 진행하므로, 데이터베이스에 대한 기존 투자를 활용하여 흐름을 빠르게 실행합니다. 공동 작업의 기회 열기분석의 흐름을 유지할 수 있습니다. 생성된 흐름을 Tableau Desktop으로 열거나 Tableau Server 또는 Tableau Cloud를 통해 다른 사람들과 공유하기가 쉽습니다. 쉽게 ..
감정기반 플레이리스트 추천 플랫폼 - 프로젝트 상세 Githubhttps://github.com/dk3156/gallatin/tree/main GitHub - dk3156/gallatin: final projectfinal project. Contribute to dk3156/gallatin development by creating an account on GitHub.github.com 목적: 유저의 감정 (Mood) 를 고려한 추천 플랫폼을 제작유저의 감정을 노래의 danceability, energy, valence 속성으로 유추합니다.danceability: 트랙이 댄스에 맞는 노래인지 말해준다. 노래의 템포, 리듬, 비트 등 음악적 원소를 결합하여 점수를 부여한다. 점수가 0 이면 춤추기 어려움, 점수가 1 이면 춤추기 좋음이다.energy: ..
구글 굿즈 웹 서비스 지표 분석 : 프로젝트 상세 목적: AARRR 프레임워크를 통해 구글 굿즈 스토어의 비즈니스 현황을 파악하고 문제를 정의했습니다. Google Merchandise Store 고객의 구매 전환율과 재구매율 향상을 위한 5가지 가설을 수립하고 검증했습니다.배경: 실무에서 활용하는 로그데이터를 가지고 실질적인 인사이트와 수치로 고객의 현황을 파악하고 싶었습니다. 온라인에서 오픈소스로 제공하는 로그데이터 중 가장 데이터양과 질이 풍부하고 정확한 데이터를 찾아본 결과 구글 BigQuery에서 제공하는 Google Merchandise Store 로그데이터가 가장 적합하다고 판단했습니다.성과: AARRR 프레임워크를 사용하여 구글 굿즈 서비스의 전체적인 비즈니스 현황과 유저 행동 현황을 알 수 있었습니다. KPI로 선정한 지표를 통해 문제정..
건강한 프로덕트란 - Product Health 프로덕트를 상태(health)를 최적화하고 비즈니스의 장기적인 성공을 보장한다. 다음 단계를 따라 프로덕트 상태를 관리한다.1. 올바른 프로덕트 지표 선택2. 주요 프로덕트 지표 추적3. 프로덕트 성장 통찰력 확보 Product health 란 프로덕트의 어떤 부분이 제대로 작동하는지, 어떤 부분에 주의가 필요한지 이해를 돕습니다. 사람의 건강을 모니터링하는 것처럼 프로덕트의 건강을 측정하는것도 중요합니다. Product Health 를 측정하면1. 프로덕트의 성능을 이해하고 강점과 약점을 평가합니다.2. 고객 행동과 피드백을 분석하여 참여도를 높이고 고객 경험을 향상합니다.3. 프로덕트 개발에 대한 데이터 기반 결정을 내립니다.4. 프로덕트의 가치 제안을 높이는 전략을 취해 전환율과 성장을 촉진합니다...
아티클 : 당근마켓 - 공학적 관점으로 데이터 분석 프로세스 만들기 (내용정리)당근마켓은 매월 1800만명이 사용하는 서비스로, 매일 동네와 지역 사회에 대한 많은 데이터가 오간다. 이 데이터가 단순한 하나의 숫자에 그치지 않고, 상요자를 위한 의사결정의 근거가 될 수 있도록 많은 노력을 하고있다. 그중에서도 당근마켓 데이터 가치화 팀은 사용자들이 서비스를 어떻게 사용하는지, 또 무엇에서 가치를 느끼는지 분석하기 위해 노력하고, 이 분석을 더 쉽게 잘하기 위한 방법들을 고민하고 있다. 당근마켓에서 분석 업무는 1)문제의식을 가지고, 2)상황을 관찰하여 3)진짜 문제가 무엇인지 질문하고, 4)질문을 바탕으로 가설을 도출하고, 5)가설을 바탕으로 솔루션을 도출하는 과정으로 진행된다. 이 과정은 스타트업의 본질과 크게 다르지 않다. 스타트업 자체가 시장의 문제를 정확히 파악하..
Gallatin: 감정 기반 Spotify 재생목록 추천 웹어플리케이션 (기술 블로그) 사용 스택: Python 컨텐츠 기반 필터링스포티파이는 총 3가지 단계로 컨텐츠 기반 필터링을 통한 추천시스템을 구축한다.  1. 노래의 메타데이터 (metadata) 분석2. 노래의 오디오 구성요소 (audio signals) 분석3. 노래의 가사, 리뷰 등 텍스트 기반 자연어처리 (NLP models) 스포티파이는 2013년 Echo Nest Analysis 기업의 일부였을때, 이미 오디오 구성요소 분석을 진행하고 있었다. 10년이 지난 지금, 스포티파이의 추천 모델은 우리가 상상하는것 보다 훨씬 방대하고 다양한 데이터를 수집했을 것이며, 10년의 기간동안 학습해온 모델은 노래의 구조와 흐름까지 전부 파악하는 고도화된 시스템이 되었을 것이다.  협업 필터링스포티파이는 또한 600만명에 이르는 수많은 ..
통계 검정법 정리 (again) 통계 테스트: 연속 데이터 다음 질문을 고려하며 통계 테스트를 골라봅시다.1. 결과 변수가 연속적인가?2. 모수검정법 요구사항 (정규성, 등분산성 등등)을 충족하는가? 3. 얼마나 많은 샘플이 있는가?4. 결과가 짝을 이루는 가(종속적인가)? 모수적 검정법One sample t test (샘플이 한개일 때)If sigma is unknown, use one sample t test to determine if the sample is likely to have come from a given population with a defined mean. Paired t test or Dependent, repeated t test(샘플이 두개일 때)The paired-samples t test is used ..