Project · 2026 · Development
AI 에이전트 E2E 테스트 자동화 대시보드



1/3
- Duration
- 2026.06 — 2026.08
- Role
- 요구사항 정의·우선순위 판단, LLM 기반 코드 생성 파이프라인 구축
- Skills / Tools
- Playwright (MCP)AI AgentReactTypeScriptGoogle Sheets
Key Accomplishment
- 테스트 레벨과 케이스 실행 레벨을 분리한 상태 모델을 정의하고 상태별 허용 조작을 규칙으로 고정 — 잘못된 시점의 조작으로 인한 비정상 종료 경로를 설계 단계에서 차단
- MCP 에이전트 동시 실행 값을 바꿔가며 반복 측정, 실행 시간 개선이 멈추는 동시 실행 값 2를 최적값으로 확정
- 토큰 예산 부족으로 장시간 테스트가 실패하는 현상을 사용량 기반 자동 일시중지·재개 구조로 전환 — 사람이 지켜보지 않아도 테스트 완주
- Google Sheets 테스트 케이스를 SSOT로 두는 동기화 구조 설계 — 코드 배포 없이 케이스만 동기화하여 갱신
Architecture
파일 기반 큐를 중심으로 에이전트 실행, 결과 저장, 시각화와 리포트를 분리한 비동기 테스트 파이프라인입니다.
Technical Challenges
- 제품 앱과 분리된 Express 워커가 파일 잡 큐를 감시하고 headless Claude 에이전트를 실행합니다. 에이전트는 Playwright MCP로 실제 브라우저를 조작하고, 케이스 결과를 JSON으로 기록해 대시보드와 리포트 웹훅이 같은 결과를 사용하도록 했습니다.
- 토큰 예산과 429 응답을 세션 단위로 감시해 자동 일시중지·재개하고, OAuth 만료·배터리 전원·종료 웹훅까지 운영 가드로 포함했습니다.
Details
운영 중인 ERP 서비스의 E2E 테스트를 AI 에이전트가 자동 수행하고, 결과 시각화와 리포트 웹훅 발행까지 담당하는 내부 도구와 워크플로우를 구축했습니다.
요구사항 정의와 개선 우선순위 판단을 직접 맡고 LLM 기반 코드 생성 파이프라인을 구축하여, 약 2개월 만에 프로덕션 서비스의 안정성을 검증하는 내부 도구로 운영 중입니다.
테스트 상태는 idle·in-progress·pause·resume·terminating, 케이스 실행 상태는 idle·in-progress·done으로 분리했고, 각 상태에서 전체 중단·전체/청크 재개·청크/단일 케이스 재실행 등 허용되는 조작을 규칙으로 고정했습니다.
토큰 예산과 429 응답을 세션 단위로 감시해 자동 일시중지·재개하고, OAuth 만료·배터리 전원·종료 웹훅까지 운영 가드로 포함했습니다. 커밋 분석 기준 테스트 케이스는 78건에서 342건으로 확장되었고, 최신 실행에서 342/342 통과를 기록했습니다.
검증은 단순 클릭 성공 여부가 아니라 케이스당 최대 1개의 상태변경 API 호출과 응답 코드·알림 문구를 evidence로 확인하도록 구성했습니다. 엑셀 양식 22종의 업로드 경로까지 포함해 실제 업무 회귀를 검증합니다.