우대사항
1 데이터 인프라 및 아키텍처 경험
• CDC, Debezium, Kafka, AWS DMS, logical replication 등 변경 데이터 수집 구조 이해·경험
• Parquet, Iceberg, Delta Lake 등 데이터레이크 설계 또는 운영 경험
• Lineage, metadata catalog, schema registry, data quality framework 구축 경험
2 대용량 데이터 처리 경험
• Spark, PySpark, Trino, DuckDB 등을 활용한 대용량 데이터 처리 경험
• AWS 환경(S3, RDS, Aurora, Redshift, Glue, Athena, EMR) 활용 경험
3 데이터 변환 및 AI 활용 경험
• RDB 데이터를 JSON, document, key-value, feature store, vector DB 등으로 변환한 경험
• LLM/RAG/Agent 서비스용 데이터 전처리, chunking, metadata 설계 경험
• 개인정보·민감정보 비식별화, synthetic data, differential privacy 관련 경험
4 유관 실무 경험
• 고객사 데이터 구조 분석 및 PoC/구축 프로젝트 수행 경험
• Claude Code, Cursor 등 AI 코딩 도구로 데이터 처리 코드 생산성을 높인 경험
5 이런 분을 찾고 있어요
• 모델 학습보다 기업 데이터를 AI가 쓸 수 있는 구조로 바꾸는 일에 관심있는 분
• "데이터가 있다" 와 "AI가 사용할 수 있는 데이터다" 의 차이를 이해하는 분
• SQL table, schema, business context, metadata, lineage를 연결해 사고할 수 있는 분
• 데이터 정합성, 재현성, 감사 추적성을 중요하게 생각하는 분
• 고객마다 다른 데이터 구조를 공통 프레임워크로 흡수하는 문제에 흥미를 느끼는 분
• 연구형보다 제품형, 분석형보다 플랫폼형 문제 해결에 강점이 있는 분