콘텐츠로 이동

RLflow

인제대학교 SCLab 의 강화학습 MLOps 플랫폼. 학습 → 평가 → 승격 → 실기 배포를 한 흐름으로 묶고, 그 과정의 사실은 MLflow·Argo·Prometheus 가, 사람의 결정은 RLflow 가 기록한다.

주소 용도
https://rlflow.kr 콘솔. 프로젝트·런·정책·롤아웃·감시·설정
https://mlflow.rlflow.kr 실험 추적, 모델 레지스트리, 아티팩트
https://argo.rlflow.kr 워크플로 DAG, 파드 로그
https://grafana.rlflow.kr GPU·런·프로젝트 대시보드
https://prometheus.rlflow.kr · https://alertmanager.rlflow.kr 메트릭 원본, 알림

로그인은 GitHub 계정 하나로 전 주소에 공유된다.

파이프라인

단계 실행 주체 입력 → 출력
① CI GitHub Actions PR → ruff · config 스키마 · 보상 항 일치 · 환경 테스트 · 1분 smoke
② 학습 Argo train (+ Ray Tune) git ref + config → 체크포인트, MLflow run, candidate
③ 평가·승격 Argo evaluate-promote candidate → report.json, 게이트, ONNX, validated
④ 시뮬 평가 프로젝트 evaluate.py 시나리오 × 시드 5 → 지표
⑤ 실기 ROS 2 + ONNX Runtime 벤치 → 테더 → 제한 공간 → deployed
⑥ 관측 Prometheus · Grafana · Slack 지표, 알림
⑦ real2sim 텔레메트리 인덱서 rosbag → Parquet → 보정 PR

원칙

  1. 플랫폼은 얇게, 규약은 두껍게. 직접 작성한 코드는 접착 코드와 콘솔뿐이다.
  2. 정책은 아티팩트다. git hash + config hash + 에셋 hash + 이미지 digest 없이는 실행되지 않는다.
  3. 승격은 candidate → validated → deployed 순서만 있다.
  4. 신규 연구자는 문서만으로 2시간 안에 프로젝트를 만들고 첫 런을 확인할 수 있어야 한다.

처음이라면 시작하기부터. 각 단계가 무엇을 하는지는 정책의 생애주기.