Claude Code 활용

Claude Code PDCA 6번 돌린 후기: 일치율 100% 효과 0

AI 로컬 LLM 2026. 9. 29. 09:21

Claude Code에 PDCA 플러그인을 붙여 쓴다. 계획(Plan) 문서를 쓰고, 설계(Design) 문서를 쓰고, 구현(Do)한 뒤, 설계와 구현의 차이를 재는 갭 분석(Check)을 돌리고, 일치율이 90% 아래면 자동으로 고치기(Act)를 반복하는 구조다.

올해 5월 한 달 동안 이미지에서 색을 뽑는 도구 하나에 이 사이클을 여섯 번 돌렸다. 끝나고 Claude가 스스로 남긴 메모리의 제목이 "다음 사이클 진입 시 reject 휴리스틱"이었다. 여섯 번 중 절반은 헛돌았다는 뜻이다. 그 기록에서 배운 것을 적는다.

첫째, 일치율 하나로 성공을 판정하면 안 된다

어느 사이클은 설계 문서와 코드가 100% 일치했다. 갭 분석은 통과였다. 그런데 그 수정이 실제로 고친 사례는 0건이었다. 코드가 설계를 완벽히 따랐는데 설계 자체가 문제를 못 푸는 설계였다.

그 뒤로 두 축을 따로 적는다.

  • A축은 설계를 얼마나 충족했는가,
  • B축은 계획이 세운 가설이 실제로 효과를 냈는가.

A축 100%에 B축 실패는 얼마든지 있다. AI는 A축을 잘 올린다. B축은 현실만 답한다.

둘째, 뒤에서 거르는 것으로는 앞에서 만들지 않은 것을 못 고친다

색을 뽑는 파이프라인은 먼저 클러스터링으로 후보 색을 만들고, 그다음 필터가 이상한 것을 걸러낸다. 어떤 색이 결과에 안 나오는 문제를 필터를 고쳐서 풀려고 두 사이클을 썼다. 안 됐다. 클러스터링이 그 색을 아예 만들지 않으면 필터는 손댈 대상이 없다.

계획 단계에 규칙이 하나 생겼다. 필터만 고치는 계획은 "상류가 그 대상을 만드는가"를 먼저 확인한 뒤에만 승인한다.

셋째, 개선안이 최악 사례를 더 나쁘게 만들 수 있다

선명한 픽셀에 가중치를 주면 클러스터가 더 잘 나뉠 거라는 가설이 있었다. 결과는 반대였다. 가중치가 중심을 이상치 쪽으로 끌어당겨서, 가장 어려운 사례의 오차가 20에서 45로 커졌다. 가중치를 바꾸는 계획은 이상치 통계를 먼저 보고 나서 승인한다는 규칙이 추가됐다.

넷째, 합성 데이터는 실패를 재현하지 못한다

실제 이미지 열네 장 중 여덟 장에서 놓치는 색이 있었다. 같은 문제를 합성 이미지로 만들어 검증 도구를 세웠더니 여덟 시나리오 중 하나에서만 놓쳤다. 합성이 너무 깨끗했다. 그러데이션, 여러 색이 섞인 영역, 압축 노이즈 같은 실제 실패 원인이 없었다.

합성 검증을 도입할 때는 실제 데이터 통계와 차이가 10% 안인지 먼저 확인하는 것이 MVP 안에 들어가야 한다.

다섯째, 설계 문서를 건너뛰어도 되는 경우가 있다

단순한 UI 기능이고 계획에 요구사항이 명확하면 계획에서 바로 구현으로 가도 일치율 98%가 나왔다. 문서를 쓰는 게 목적이 아니다.

90%라는 문턱이 어디서 오나

이 구조에서 자동 개선이 도는 조건은 일치율 90%다. 갭 분석이 90% 아래로 나오면 고치기 단계가 저절로 돌고, 넘으면 완료로 넘어간다. 숫자 하나가 사이클의 방향을 정하는 셈이다.

여기에 함정이 둘 있다.

  • 분모가 설계 문서다. 설계에 안 적힌 것은 애초에 세지 않는다. 설계가 얇으면 일치율이 쉽게 100%가 되는데, 그건 잘했다는 뜻이 아니라 잴 게 없었다는 뜻이다
  • 반복에 상한이 있다. 우리 설정은 한 세션에 다섯 번이다. 다섯 번을 돌고도 90%를 못 넘으면 멈춘다. 그런데 못 넘는 이유가 설계가 틀려서일 때, 다섯 번은 전부 헛돈다. 여섯 사이클 중 절반이 헛돌았다는 게 이 얘기다

그래서 지금은 자동 반복에 들어가기 전에 한 번 끊는다. 일치율이 두 번 연속 제자리면 코드가 아니라 설계를 의심한다. 같은 곳을 세 번째 고치고 있으면 고치는 대상이 잘못된 것이다.

맥미니에서도 같은 교훈

집 맥미니 쪽에도 같은 교훈이 다른 옷을 입고 있다. 영상 대본을 다른 AI에게 검토시켰더니 다섯 라운드 전부에서 실제 결함이 나왔고, 반복되는 실패 유형은 하나였다. 상수 하나를 골라 조건 없이 일반화하는 것. 벤치마크 영상 하나를 통째로 폐기한 이유도 같다. 조건이 결론을 정한다.

일치율은 AI가, 효과는 현실이 말한다

정리하면 PDCA는 AI에게 문서를 쓰게 하는 의식이 아니다. 판정을 두 축으로 강제하는 장치다.

일치율은 AI가 자기 설계를 얼마나 따랐는지를 말해 주고, 효과는 현실이 말해 준다.

앞의 숫자만 보면 여섯 사이클이 전부 성공이었다. 뒤의 숫자를 보니 절반이었다.

※ 2026년 5월 PDCA 사이클 기록과 Claude가 남긴 메모리, 2026년 9월 맥미니 검토 기록을 근거로 썼다. 도구의 용도 외에 회사 정보는 넣지 않았다.

맥미니로 만드는 AI 홈서버 — 직접 돌려보고 씁니다