ETL·파이프라인
- Prefect
- Python
- SQL
- ETL / ELT
원천 수집·정제·적재부터 정기 실행과
재처리까지 파이프라인 운영을 직접 맡았습니다.
원천 수집·정제·적재부터 정기 실행과
재처리까지 파이프라인 운영을 직접 맡았습니다.
서로 다른 운영 데이터와 DB를
공통 비즈니스 기준으로 결합·표준화했습니다.
퍼널·KPI 데이터마트를 만들고
부서 실무·임원 보고용 대시보드까지 담당했습니다.
주요 작업
약 600만 건 규모의 퀴즈 관측 데이터를 기반으로 도서 레벨 추천 기준과 난이도 상한, 학년 수준 개방 조건을 비교했습니다. 분석 결과를 임원 보고서와 개발 구현 기준으로 정리해 추천 정책 의사결정에 연결했습니다.
월간 리딩 데이터, 종합 성취도, 익월 목표 단어 수, 학생별 서재 갱신을 Python 배치로 묶었습니다. 맞춤 진단은 문제 부여부터 결과 수집·결과지 배포까지 연결하고, 운영팀이 직접 조회할 수 있도록 Streamlit 내부 도구를 구축했습니다.
이반 학생 학습이력, 도서 식별자, 온라인 학습 콘텐츠 정보를 대상으로 사전 비교·preview·dry-run·승인 후 반영하는 절차를 적용해 운영 데이터 수정과 마이그레이션의 검증 단계를 표준화했습니다.
Cursor Rules·Skills와 DB 문맥을 구조화해 SQL 조회, 정기 ETL, 데이터 수정, 분석 보고의 실행 절차를 재사용 가능하게 만들었습니다. 쓰기 작업에는 Gate·dry-run·confirm을 두고, 산출물과 매뉴얼 갱신부터 Git 커밋·PR까지 반복 가능한 워크플로로 운영했습니다.
분석 결과를 추천 정책 의사결정으로 연결하고, 정기업무와 데이터 수정 절차를 배치·내부 도구·AI 워크플로로 표준화해 반복 운영 가능한 구조로 전환했습니다.
주요 작업
SCRM, MetaCRM, DentWeb, TCM 등 서로 다른 운영 시스템과 PostgreSQL·MySQL·MSSQL 데이터를 통합했습니다. 병원·지점별로 다른 데이터 구조와 비즈니스 규칙을 표준화해 통합 예약·통합 수납 모델을 만들고, 수집부터 정제·적재·데이터마트·보고까지 연결했습니다.
일·주·월 데이터 작업을 Prefect Workflow로 구성하고, 병원·기준월·처리 단계별 parameter를 통해 부분 실행과 과거 데이터 재처리가 가능하도록 설계했습니다. 업무 성격에 따라 Work Pool을 분리하고 failure·crash 알림을 붙여 운영 상태를 확인할 수 있게 했습니다.
CRM·MSSQL 원천 데이터, PostgreSQL 통합 데이터, 월마감 보고 사이의 매출 정합성을 자동 검증했습니다. 병원별 과세·해외매출·수시술 등 서로 다른 비즈니스 규칙과 데이터 기간을 함께 검증해 원천부터 보고까지의 이상 여부를 빠르게 확인할 수 있게 했습니다.
통합 예약·수납을 기반으로 전환율, 상담, 매출, 객단가와 KPI 분석용 데이터마트를 구축했습니다. Funnel·월마감·BI용 데이터셋을 PostgreSQL과 Google Sheets에 제공해 분석·운영·경영 보고에 활용했습니다.
원천 수집 → 통합 모델 → 정합 검증 → 데이터마트·리포팅으로 이어지는 데이터 운영 체계를 구축하고, 정기 실행뿐 아니라 부분 실행·과거 재처리까지 가능한 파이프라인으로 운영했습니다.
주요 작업
외부 읽기 프로그램 월 15만 건, 읽기 평가 월 5만 건, 온라인 영어 학습 월 10만 건, 교과서 학습 월 8천 건 규모의 데이터를 수집·정제했습니다. 도서 정보와 함께 일 단위로 갱신해 분석과 서비스에서 반복 활용할 수 있는 데이터 기반을 만들었습니다.
학생 계정 생성·수정·삭제 작업 시간을 94% 줄였고, 입학 레벨테스트 결과 수집·결과지 제작·발송 작업 시간을 99% 줄였습니다. 입학 과정 알림 자동화를 통해 누락률도 98% 줄였습니다.
고객 유입·지역·연령, 학습 성장, 문항 난이도, 상담·문의 키워드를 분석해 운영 정책과 서비스 개선안을 도출하고 부서·경영진 의사결정 자료로 제공했습니다.
학습 가이드와 도서 데이터를 구조화해 영어 원서 추천 규칙을 설계했고, 2021년 「빅데이터 기반 도서추천 시스템 제공방법」을 특허 출원했습니다.
생성형 AI 등장에 맞춰 첨삭 자동화 서비스를 기획·도입했습니다. 첨삭 서비스는 2023.07 출시 후 2024.02 기준 주 1,000건 안팎, 음성 기반 발음 피드백은 주 500건 안팎의 사용량을 기록했습니다.
대규모 외부 데이터를 서비스·분석에 활용할 수 있는 기반으로 만들고, 반복 운영을 자동화하는 동시에 추천 규칙·특허와 생성형 AI 서비스를 실제 사용자 제품으로 출시했습니다.
실제 데이터 수집·통합·분석·운영 자동화에 사용한 도구와 방식입니다.
회사 성과가 아니라, 분석과 도구를 어떻게 쓰는지 보여주는 개인 기록입니다.
이메일이나 GitHub으로 남겨 주세요.