정재민PORTFOLIO

AX · AI DEVELOPMENT · IMAGE PRODUCTION

2026

현업의 문제를
제작 시스템으로.

마케팅과 콘텐츠 제작에서 익힌 상품·고객 이해를 바탕으로 AX 워크플로우를 설계합니다. 프론트엔드·백엔드와 GPU 처리를 연결하고, 모델 학습부터 이미지 제작·검수까지 직접 구현했습니다.

파이온 코퍼레이션 · 프로젝트 단독 개발·제작

작업 이미지 200장 보기 ↓
브랜드 A 최종 화보 1브랜드 B 최종 화보 3학습한 LoRA를 거울 셀피 장면에 적용한 결과SELECTED WORK / 2026
150+화보 제작 컷
48동일성 학습 이미지
B200 × 8이미지 분산 학습 테스트

01 / ENTERPRISE AX

가구·페인트 기업의
이미지 제작 AX

2026.05–06 작업 기록요구 분석 · 기술 검증 · 웹 도구 구현

현업의 이미지 요청을 검수 가능한 작업 유형으로 바꾸고, 생성·편집·보정 도구를 연결했습니다.

이미지 생성·편집ComfyUIPhotoshopFrontend / Backend
8가구 작업 유형
35피드백 요구사항
1,200공식 페인트 색상

해결할 문제

상세페이지 제작의 반복 작업을 줄이려면 제품의 형태·색상·재질을 보존하면서 요청한 변화를 적용해야 했습니다. 단일 도구로 모든 작업을 처리하기보다, 작업별 적용 조건과 한계를 먼저 확인했습니다.

직접 구현한 일

  1. 01

    가구 이미지 작업 8개 유형에 입력·목표 레퍼런스·프롬프트·평가표를 묶고, 4라운드 실험으로 제품 보존과 요청 반영 여부를 검수했습니다.

  2. 02

    신상품 피드백의 요구사항 35건을 분석해 신규 생성 → 영역 편집 → ComfyUI 구조 마감 → Photoshop 최종 보정의 흐름을 제안했습니다.

  3. 03

    공식 1,200색 데이터를 활용한 페인트 웹 도구를 구현했습니다. 벽색 적용 결과를 다음 단계의 기준 이미지로 사용해 시간대 무드와 앵글을 바꾸도록 구성했습니다.

결과와 검수

배경 생성·화질 개선·가상 모델은 바로 활용할 수 있는 작업으로, 객체 삭제·세트 구성·도면 실사화·미촬영 색상은 입력과 검수 조건이 필요한 작업으로 구분했습니다.

비율 확장이 불안정한 요청은 입력 캔버스를 먼저 가공하고 목표 구도 이미지를 함께 사용했습니다. 도구의 성공 사례와 제한 조건을 다음 작업의 입력 기준으로 남겼습니다.

01요청 분석제품 보존·변경 조건
02도구 선택생성 / 영역 편집
03구조·디테일 보정ComfyUI / Photoshop
04검수와 기록적용 가능 / 조건부

02 / DATA → MODEL → APPLICATION

인물 동일성 학습과
웹 제작 도구 개발

2026.07–09데이터 제작 · LoRA 학습 · 프론트엔드·백엔드 개발

한 장의 얼굴에서 학습 데이터를 만들고, 학습한 모델을 실제 장면 편집과 평가로 연결했습니다.

LoRAComfyUIInpaintingFrontend / BackendGPU 처리
48선별 학습 이미지
7학습 버전 비교
2직접 개발한 웹 도구

해결할 문제

각도·표정·헤어·조명이 달라져도 같은 인물의 특징을 유지해야 했습니다. 얼굴 유사도만 높이는 학습은 피부와 배경을 과도하게 고정할 수 있어, 자연스러움까지 함께 비교해야 했습니다.

직접 구현한 일

  1. 01

    FaceMake에서 이미지·영상 생성, 프레임 추출, 조명·헤어 보정과 후보 선별을 연결했습니다. 사람이 채택한 보정 이미지 24장과 영상 프레임 24장으로 학습 세트를 구성했습니다.

  2. 02

    7개 학습 버전의 조건과 체크포인트를 비교했습니다. 얼굴 유사도, 피부 질감, 각도 대응과 과적합을 함께 확인하며 모델을 선택했습니다.

  3. 03

    FaceChange에서 LoRA·마스크·라운드별 강도를 제어하고 ComfyUI 처리와 연결했습니다. 실행 조건·평가 저장, 전후 비교와 이전 결과 복원을 구현했습니다.

결과와 검수

학습 데이터 제작용 FaceMake와 장면 적용용 FaceChange를 각각 만들고, 검수 결과가 다음 데이터·학습 선택으로 이어지는 흐름을 구성했습니다.

머리 전체와 얼굴 중심을 구분해 편집 범위를 조절했습니다. 학습을 늘릴 때 피부가 부자연스러워지는 사례도 기록해 모델 선택의 기준으로 사용했습니다.

01FaceMake생성·프레임 추출·선별
0248장 데이터이미지와 캡션 구성
03LoRA 학습조건·체크포인트 비교
04FaceChange적용·평가·이력 복원

03 / FRONTIER MODEL DEVELOPMENT

이미지·VLM·TTS
파인튜닝과 학습 테스트

2026 · 02월 LoRA·06월 Flow Matching·TTS 기록데이터 전처리 · 분산 학습 환경 · 비교 평가 도구 구현

Rectified Flow·Flow Matching 기반 이미지 학습 환경과 한국어 음성 파인튜닝을 구성하고, 로그와 생성 결과를 함께 비교했습니다.

Rectified Flow / Flow MatchingFLUX.2 VAEZ-Image LoRAVLMMOSS-TTSDDP / bf16
B200 × 8이미지 Flow Matching 학습 환경
학습·검증TTS 데이터 구성과 평가
조건 비교LoRA 학습·미세 조정

해결할 문제

학습이 실행되는지 확인하는 것과 제작에 쓸 수 있는 결과를 고르는 것은 별도의 문제였습니다. 데이터 품질, 학습 조건, 추론 조건을 기록하고 같은 입력으로 베이스 모델과 학습 모델을 비교할 수 있도록 구성했습니다.

직접 구현한 일

  1. 01

    NVIDIA B200 8장 환경에서 CC12M 이미지 데이터와 FLUX.2 VAE를 활용한 Latent Flow Matching 학습 테스트를 진행했습니다. 레이턴트 변환·학습·VAE 디코딩을 연결하고 TensorBoard의 loss·epoch·progress 기록을 확인했습니다.

  2. 02

    ai-toolkit 기반 Z-Image LoRA 파인튜닝에서는 Flow Matching 스케줄러·샘플러, bf16, gradient checkpointing과 latent 캐시를 적용했습니다. rank·alpha·학습률·스텝·캡션·Text Encoder·EMA 조건을 비교하고 체크포인트를 ComfyUI 추론에 연결했습니다. 이미지와 언어를 함께 다루는 VLM 파인튜닝도 진행했습니다.

  3. 03

    MOSS-TTS 한국어 Full SFT와 v1.5 LoRA/PEFT를 수행했습니다. 원본 발화의 ASR 전사·구간 분리·품질 필터와 오디오 코드 변환을 연결하고, 초기 rank 16 학습부터 rank 32·64 후속 실험까지 조건과 생성 결과를 기록했습니다. 32GB GPU 환경에서 튜닝 결과와 음성 생성을 테스트했습니다.

결과와 검수

한국어 발화를 전처리하고 LoRA 학습·미세 조정을 진행했습니다. 학습용·검증용 데이터를 나누고, 동일 문장과 참고 음성을 사용하는 비교로 발음·억양·말속도와 후처리 영향을 확인했습니다.

이미지는 얼굴 동일성·피부·포즈·과적합을, 음성은 화자 특성·자연스러움·말속도와 후처리 영향을 검수했습니다. 학습 로그와 실제 생성 결과를 함께 보며 조건을 선택했습니다.

01데이터 구성이미지·캡션 / 음성 JSONL
02학습 환경DDP·bf16·메모리 최적화
03조건 비교로그·체크포인트·생성 결과
04추론과 평가동일 입력의 배치 비교

이미지 학습 테스트 · B200 8장

CC12M → FLUX.2 VAE 레이턴트 → Flow Matching 학습 → VAE 디코딩

이미지 파인튜닝

Z-Image LoRA 조건 비교 → 체크포인트 선택 → ComfyUI 적용

한국어 음성 파인튜닝 · 32GB GPU 테스트

원본 발화 전처리 → 초기 LoRA → TTS 학습 조건 비교 → 동일 입력·후처리 검수

IMAGE MODEL / LATENT FLOW MATCHING · 2026.06

B200 8장 이미지 학습의
실제 Flow Matching 로그

CC12M 이미지와 FLUX.2 VAE 레이턴트를 연결한 이미지 학습 테스트입니다. 2026년 6월 22일 보관한 TensorBoard 이벤트에서 train/loss·train/epoch·train/progress를 확인하고 loss 추이를 다시 그렸습니다.

이 이벤트 파일에는 생성 이미지가 저장되어 있지 않아 학습 진행 기록으로 제시했습니다. 얼굴 LoRA 적용 사례와 Flow Matching 학습 로그는 별개의 실험입니다.

VOICE MODEL / SOURCE TO OUTPUT

한국어 음성 모델
파인튜닝과 품질 평가

한국어 발화를 전처리하고 MOSS-TTS LoRA를 학습했습니다. 32GB GPU 환경에서 튜닝 결과와 음성 생성을 테스트하고, 동일 문장과 참고 음성을 기준으로 화자 특성·발음·억양·말속도를 검수했습니다.

01데이터 전처리

전사·구간 분리·품질 필터를 거친 발화를 학습 데이터로 구성했습니다.

02학습·미세 조정

LoRA 조건을 비교하고 학습 결과에 추가 미세 조정을 적용했습니다.

03동일 입력 평가

문장과 참고 음성을 고정해 기준 모델과 튜닝 모델을 검수했습니다.

04음성 후처리

노이즈·음량 처리를 학습 결과와 구분해 평가했습니다.

01 / DATA → LORA

한국어 발화 전처리와 LoRA 학습

원본 발화를 전사·구간 분리·품질 필터링하고 오디오 코드로 변환했습니다. 학습과 검증 데이터를 구분해 튜닝 결과를 평가했습니다.

데이터와 학습 구성

작업적용 내용
전처리ASR 전사·발화 구간 분리·품질 필터
학습오디오 코드 변환·LoRA·bf16
평가동일 입력의 기준 모델·튜닝 모델 비교

생성 조건 비교 문장과 참고 음성을 고정하고 생성 결과를 함께 검수했습니다.

검수 기록

화자 특성·문장 끝 처리·발음·억양·말속도를 함께 확인했습니다.

02 / FINETUNING → EVALUATION

학습 조건 비교와 후속 미세 조정

rank·배치·학습량·학습률을 바꾸어 조건을 비교했습니다. 검증 loss와 실제 생성 결과를 함께 확인해 적용 후보를 선택했습니다.

실험과 검수 기준

실험확인한 부분
기준 모델안정적인 발음과 문장 연결
미세 조정화자 특성과 자연스러움
표현력 비교억양·말속도·표현의 변화

생성 조건 생성 조건을 기록하고 모델 학습·샘플링·후처리의 영향을 구분했습니다.

검수 기록

여러 설정이 함께 바뀐 실험의 차이를 특정 변수 하나의 효과로 단정하지 않았습니다.

검증 loss를 화자 유사도나 청취 품질 점수로 해석하지 않았습니다.

03 / AUDIO POSTPROCESS

음성 후처리와 품질 검수

생성 음성에 노이즈 제거·대역 필터·음량 정규화·리미터를 적용하고 처리 전후를 비교했습니다.

후처리 효과를 모델 학습 결과와 구분해 검수했습니다.

보관된 학습·평가 기록을 바탕으로 작업 과정과 검수 기준을 정리했습니다.

04 / FASHION IMAGE SYSTEM

상품 조건을 반영하는
패션 룩북 제작 도구

2026.01–10기준 자산·상품 데이터 설계 · 생성·검수 워크플로우 · 수정 웹 개발

얼굴·헤어·포즈 자산과 상품 데이터를 연결해 룩북 생성·수정 도구를 만들었습니다. 최근에는 완성컷에서 구축한 의상 참고 DB를 재사용하고, 새 착장·포즈·컬러 변경을 비교 검증했습니다.

LoRA / Inpainting상품 메타데이터Reference DB · JSON/CSVFrontend / Backend이미지 생성·편집 API
123건실제 생성 결과 · 2026.10.05 기준
40개의상 참고 크롭 · 품번·색상 29종
30건의상 DB 기반 생성 · A15 / B15
13건컬러 변경 비교 · 반복 2건 포함

해결할 문제

좋아 보이는 이미지라도 실제 상품의 길이·색상·핏이 다르면 룩북에 사용할 수 없었습니다. 상품 데이터와 참고 이미지의 역할을 분리하고, 고객 검수에서 나온 오류를 수정 방식별로 나눴습니다.

직접 구현한 일

  1. 01

    초기 포즈 베이스 20개를 제작·전처리하고 각도별 얼굴과 헤어를 학습했습니다. 5월에는 포즈 후보 67장을 비교하고 48컷의 구조화된 기준 자료를 정리했습니다.

  2. 02

    상품 메타데이터, 얼굴·포즈 기준, 마네킹 상품컷과 길이·핏 가이드를 입력별 역할에 연결했습니다. 수정 웹에서는 대상 영역·오류를 지정하고 전후 결과, 얼굴 복원과 부분 재생성 기록을 비교하도록 구현했습니다.

  3. 03

    완성컷 20장의 상·하의에서 참고 크롭 40개를 추출하고 품번·색상·출처별 JSON/CSV 인덱스를 만들었습니다. 상의 15종·하의 14종의 품번·색상 조합을 조회하고 손·팔이 보이는 참고 자산을 선별했습니다.

  4. 04

    의상 DB 기반 8장 입력으로 A/B 비율 각 15건을 생성했습니다. 같은 상품 참고를 다른 비율·포즈에 적용하는 비교와, 기존 핏 크롭·목표 컬러 마네킹을 분리한 6장 입력의 컬러 변경 13건을 진행했습니다.

  5. 05

    포즈 전환 20건과 착장·기장 가이드·컬러 변경 결과를 통합 보고서에 연결했습니다. 입력·출력 해시와 요청 ID를 보존해 재실행의 중복 요청을 막고, 전신과 원본 픽셀 밑단 크롭에서 신발·배색·기장 오류를 기록했습니다.

결과와 검수

2026년 10월 5일 기준 8개 카테고리의 실제 생성 결과 123건을 정리했습니다. 의상 참고 DB는 크롭 파일과 조회용 JSON/CSV로 구성했고, 저장한 품번·색상 조합 29종 모두를 DB 기반 생성 입력에 사용했습니다.

핏 기준과 색상 기준을 분리해 상의·하의 단독 컬러 변경과 배색 변경을 비교했습니다. 컬러 변경 13건에는 같은 조건의 반복 생성 2건이 포함돼 있습니다. 아래에는 최신 착장 12컷, 컬러 전후 3쌍과 포즈 전환 2건을 원본 입력과 함께 배치했습니다.

생성 완료와 상품 품질 합격을 구분했습니다. 밑단·신발·배색 오류와 주름·발 위치의 변화를 남겨, 다음 수정에서 어느 입력과 조건을 보완할지 확인할 수 있게 했습니다.

05 / AI CAMPAIGN PRODUCTION

같은 모델로 이어가는
브랜드 시즌 화보

2026 · 시즌 화보 제작인물 기준 선정 · 이미지 제작 · 고객 피드백·최종 마감

150컷 이상을 제작하며 브랜드 모델의 동일성, 의상과 장면의 완성도, 고객 검수까지 하나의 제작 과정으로 관리했습니다.

Face / Product SwapLoRA후보 비교디테일 보정Upscale
150+전체 제작 컷
100공개 두 브랜드 최종 납품 컷
최대 4차컷별 피드백 반영

해결할 문제

시즌마다 모델 섭외와 촬영을 반복하지 않고 같은 브랜드 인물로 화보를 이어가고 싶다는 요구가 있었습니다. 인물 기준을 먼저 고정하고, 의상·포즈·장면을 바꾸면서도 같은 사람으로 보이도록 제작했습니다.

직접 구현한 일

  1. 01

    브랜드별 정면·측면·표정 기준을 선정하고 인물 학습과 장면별 얼굴 교체를 연결했습니다. 얼굴·머리 영역을 단계적으로 다듬어 각도와 조명에 맞췄습니다.

  2. 02

    한 장면에서 기본 후보 10컷과 표정 변형 5컷을 비교한 기록을 남겼습니다. 선택한 결과의 피부·손·소품·의상 디테일을 보정하고 업스케일했습니다.

  3. 03

    메인·서브·와이드컷으로 구성을 나누고, 컷별 피드백을 최대 4차까지 반영해 최종본을 확정했습니다.

결과와 검수

전체 화보 제작 규모는 150컷 이상입니다. 아래 공개 사례는 그중 브랜드 A·B 각 50컷, 최종 납품 100컷에 해당합니다.

인물 기준 → 연출 → 얼굴 교체 → 후보 비교 → 디테일 마감 → 피드백의 반복 가능한 제작 흐름을 구축했습니다.

06 / AVATAR TOOL & RENDERER

생성 이미지에서
움직이는 아바타까지

2026.09 검수 기록파츠 제작 도구 · 리깅 편집기 · 렌더링 엔진 개발

AI로 만든 캐릭터를 파츠·표정·리깅과 연결하고, 직접 구현한 웹 편집기와 렌더러에서 움직이도록 만들었습니다.

WebGL2Mesh / Weight / KeyformAI 파츠 제작영상 매팅TTS

해결할 문제

생성 이미지 한 장만으로는 고개·눈·입을 자연스럽게 움직일 수 없었습니다. 파츠의 역할과 좌표, 변형 기준을 관리하고 전체 포즈를 함께 검사하는 제작 도구가 필요했습니다.

직접 구현한 일

  1. 01

    원화·레이어 관리, 눈·입 파츠 보강, 각도 기준 이미지·회전 프레임 선별을 연결하는 Avatar Live Studio를 개발했습니다.

  2. 02

    본·메시·웨이트·키폼을 편집하는 웹 도구와 WebGL2 렌더러를 구현했습니다. 부위 간 변형 기준을 통일해 고개 회전 시 입술이 눌리는 문제를 개선했습니다.

  3. 03

    매 프레임 반복되는 텍스처 업로드 병목을 찾아 캐시·업로드 구조를 개선했습니다. 강아지 캐릭터는 영상 매팅과 음성 합성·대사·안내 오버레이를 연결해 방송에 사용했습니다.

결과와 검수

캐릭터·표정 제작 도구, 리깅 편집기, 전체 동작 검수와 방송용 캐릭터를 구성했습니다.

동일 캐릭터·검수 경로의 A/B 측정에서 CPU draw p95가 1,174.6ms에서 63.2ms로 감소했습니다. 이 수치는 해당 렌더링 경로의 측정값입니다.

01캐릭터·파츠원화·레이어·눈·입
02각도 기준회전 프레임 제작·선별
03리깅 편집본·메시·웨이트·키폼
04렌더링·검수전체 포즈와 성능 비교

07 / MULTI-DEVICE AI SERVICE

글래스·모바일·서버를
잇는 AI 기록·학습 서비스

2026.08–09 작업 기록앱·웹 개발 · 음성 처리 서버 · 디바이스 연동

회의와 학습 정보를 필요한 순간에 확인하도록 화면·입력·연산을 글래스, 휴대폰, 서버에 나눴습니다.

Frontend / BackendWhisper / VAD / TitaNetBluetoothiPhone / Apple Watch글래스 UI

해결할 문제

휴대폰의 긴 화면과 복잡한 조작을 그대로 글래스에 옮길 수 없었습니다. 576×288 화면, 한 화면 5줄, 탭·스와이프 입력에 맞춰 정보와 기능의 위치를 다시 설계했습니다.

직접 구현한 일

  1. 01

    GPU 서버에서 Silero VAD·Whisper large-v3-turbo·TitaNet으로 발화 구간·전사·화자 정보를 처리하고, 앱 서버의 요약·용어 설명과 연결했습니다.

  2. 02

    회의·중국어 복습·길안내·지하철 글래스 앱 4종을 구성했습니다. 긴 원문·설정은 웹과 폰에, 짧은 확인과 조작은 안경에 배치하고 복습 상태의 서버 필드를 맞췄습니다.

  3. 03

    R1 스마트링의 블루투스 패킷을 공식 건강 내보내기와 대조해 심박·SpO₂·HRV·수면 신호를 읽고, iPhone 컨디션 앱과 Apple Watch 러닝 코칭 앱에 연결했습니다.

결과와 검수

글래스 앱 4종과 건강·러닝 앱 2종, 음성 처리·학습·정리 서버를 연결했습니다. 실기기에서 드러난 제약은 서버 진단 기록으로 확인하며 수정했습니다.

기록·학습 기능을 단순 화면 전환이 아니라 데이터 수집, 처리, 표시와 복습 상태 갱신까지 이어지는 서비스로 구현했습니다.