RLflow¶
인제대학교 SCLab 의 강화학습 MLOps 플랫폼. 학습 → 평가 → 승격 → 실기 배포를 한 흐름으로 묶고, 그 과정의 사실은 MLflow·Argo·Prometheus 가, 사람의 결정은 RLflow 가 기록한다.
| 주소 | 용도 |
|---|---|
| https://rlflow.kr | 콘솔. 프로젝트·런·정책·롤아웃·감시·설정 |
| https://mlflow.rlflow.kr | 실험 추적, 모델 레지스트리, 아티팩트 |
| https://argo.rlflow.kr | 워크플로 DAG, 파드 로그 |
| https://grafana.rlflow.kr | GPU·런·프로젝트 대시보드 |
| https://prometheus.rlflow.kr · https://alertmanager.rlflow.kr | 메트릭 원본, 알림 |
로그인은 GitHub 계정 하나로 전 주소에 공유된다.
파이프라인¶
| 단계 | 실행 주체 | 입력 → 출력 |
|---|---|---|
| ① CI | GitHub Actions | PR → ruff · config 스키마 · 보상 항 일치 · 환경 테스트 · 1분 smoke |
| ② 학습 | Argo train (+ Ray Tune) |
git ref + config → 체크포인트, MLflow run, candidate |
| ③ 평가·승격 | Argo evaluate-promote |
candidate → report.json, 게이트, ONNX, validated |
| ④ 시뮬 평가 | 프로젝트 evaluate.py |
시나리오 × 시드 5 → 지표 |
| ⑤ 실기 | ROS 2 + ONNX Runtime | 벤치 → 테더 → 제한 공간 → deployed |
| ⑥ 관측 | Prometheus · Grafana · Slack | 지표, 알림 |
| ⑦ real2sim | 텔레메트리 인덱서 | rosbag → Parquet → 보정 PR |
원칙¶
- 플랫폼은 얇게, 규약은 두껍게. 직접 작성한 코드는 접착 코드와 콘솔뿐이다.
- 정책은 아티팩트다.
git hash + config hash + 에셋 hash + 이미지 digest없이는 실행되지 않는다. - 승격은
candidate → validated → deployed순서만 있다. - 신규 연구자는 문서만으로 2시간 안에 프로젝트를 만들고 첫 런을 확인할 수 있어야 한다.