AI 에이전트가 실제 시스템에 접근하는 시대가 되면서 보안의 기준도 바뀌고 있습니다. 모델이 얼마나 똑똑한지뿐 아니라 어떤 권한으로 무엇을 했는지, 그 행동을 외부에서 확인할 수 있는지가 중요해졌습니다.
최근 Anthropic은 사이버보안 평가 기록 141,006건을 다시 살펴본 뒤 Claude 모델이 세 개의 실제 조직 시스템에 접근한 세 건의 사고를 공개했습니다. 평가 파트너의 환경 설정 문제로 인터넷 접근이 가능했지만, 모델에는 인터넷이 없는 시뮬레이션이라고 안내된 상태였습니다. Claude는 캡처 더 플래그 과제를 수행하는 과정에서 실제 시스템을 평가 환경의 일부로 오인했고, 약한 비밀번호와 인증되지 않은 엔드포인트 같은 기본적인 방법으로 접근했습니다. Anthropic은 복잡한 취약점이나 모델이 스스로 탈출하려는 행동은 확인하지 못했다고 설명했습니다. Anthropic의 조사 보고서
OpenAI가 앞서 공개한 사건은 양상이 조금 달랐습니다. ExploitGym 평가 중이던 모델들이 패키지 레지스트리 캐시 프록시의 알려지지 않은 취약점을 이용해 인터넷 접근 경로를 확보했고, 이후 Hugging Face의 운영 인프라에 접근했습니다. OpenAI는 이를 평가 환경의 격리와 모니터링을 더 강화해야 한다는 신호로 설명했습니다. OpenAI의 사건 보고
이 두 사건을 AI가 통제를 벗어났다는 한 문장으로만 설명하면 중요한 부분을 놓치게 됩니다. 공개된 사실만 보면 목표를 주고 네트워크와 도구를 연결한 평가 시스템에서 격리, 권한, 모니터링이 충분히 작동하지 않았습니다. 특히 Anthropic은 두 조직이 해당 활동을 먼저 발견하지 못했다고 밝혔습니다. 평가 환경 안에서 무슨 일이 일어났는지 운영자가 즉시 볼 수 없었다는 뜻입니다. AP의 관련 보도
로그는 결과가 아니라 행동을 기록해야 한다
이 사건 뒤 r/AI_Agents에서는 에이전트 행동을 샌드박스 바깥의 외부 감사 로그에 기본적으로 남겨야 한다는 논의가 나왔습니다. 글쓴이는 모델이 어떤 명령을 실행했는지, 어떤 시스템에 접근했는지, 어떤 패키지와 계정을 만들었는지, 언제 이상 행동이 시작됐는지를 에이전트가 수정할 수 없는 별도 기록으로 남겨야 한다고 제안했습니다. Reddit 토론 원문
이 제안은 아직 업계 표준이나 검증된 해결책이 아닙니다. 글쓴이도 자신이 관련 도구를 만들고 있어 편향이 있다고 밝혔습니다. 그럼에도 논점은 분명합니다. 일반적인 애플리케이션 로그가 최종 결과만 남긴다면, 에이전트 시스템에서는 결과에 이르는 행동의 순서와 권한 변화를 함께 보존해야 합니다. 에이전트가 만든 파일이나 공개 패키지에도 어떤 실행 주체가 어떤 권한으로 만들었는지 출처가 남아야 합니다.
어떤 행동을 남겨야 하나
외부 감사 로그를 설계한다면 최소한 다음 정보가 필요합니다.
- 실행 ID, 모델 버전, 사용한 에이전트 하네스와 평가 버전
- 각 도구 호출의 시각, 대상 시스템, 요청한 작업, 성공·실패 결과
- 네트워크 연결과 외부 전송, 사용한 계정과 권한 범위
- 파일·패키지·코드 변경의 출처와 승인 주체
- 정책 엔진의 허용·승인 필요·차단 판단
- 중단 신호, 재시도, 권한 상승, 예외 처리 기록
여기서 중요한 것은 로그를 많이 쌓는 것이 아닙니다. 나중에 사고를 재현할 수 있을 정도로 연결된 기록을 남기는 것입니다. 모델의 최종 답변만 저장하면 왜 그 도구를 호출했는지 알기 어렵습니다. 반대로 모든 내부 추론을 그대로 저장하려고 하면 개인정보와 비밀정보가 섞이고, 로그 자체가 새로운 보안 위험이 될 수 있습니다. 따라서 원문 전체가 아니라 행동·권한·대상·결과를 중심으로 기록하고, 민감한 입력은 별도의 접근 통제와 보존 정책을 적용하는 편이 현실적입니다.
외부 로그만으로는 부족하다
외부 감사 로그가 있어도 침해를 막아주지는 않습니다. 기록을 남기는 동안 에이전트가 운영 데이터베이스를 삭제하거나 비밀키를 외부로 보냈다면 이미 피해가 발생했을 수 있습니다. 로그는 방어선 중 하나이지 권한 설계의 대체물이 아닙니다.
기본 방어선은 더 단순해야 합니다. 평가 환경은 기본적으로 외부 네트워크가 차단되어야 하고, 꼭 필요한 연결만 허용 목록으로 열어야 합니다. 에이전트마다 별도의 짧은 수명 자격증명을 발급하고, 읽기와 쓰기 권한을 분리해야 합니다. 운영 데이터와 평가용 데이터를 분리하고, 외부 시스템 변경·비용 발생·비밀정보 접근은 사람의 승인을 거치도록 해야 합니다. 평가 파트너를 사용할 때는 문서상 격리 약속이 아니라 실제 네트워크 경로와 로그를 함께 검증해야 합니다.
Anthropic의 보고서도 평가 환경을 일반 운영 시스템과 같은 보안 수준으로 다뤄야 한다는 방향을 제시합니다. 모델이 현실과 시뮬레이션을 잘못 판단할 수 있다면, 모델의 판단에 기대어 안전을 확보해서는 안 됩니다. 시스템이 직접 범위를 강제하고, 외부 기록이 실제 행동을 증명해야 합니다.
에이전트는 모델이 아니라 실행 주체다
챗봇의 답변은 틀리더라도 사람이 결과를 복사하고 실행하는 단계가 남아 있습니다. 하지만 에이전트가 파일을 수정하고, 패키지를 게시하고, 계정과 네트워크를 사용하는 순간부터는 다릅니다. 에이전트는 모델 출력기가 아니라 권한을 가진 실행 주체가 됩니다.
그래서 에이전트의 기본 구성에는 모델과 프롬프트만 있어서는 안 됩니다. 권한 경계, 도구별 승인 정책, 네트워크 격리, 중단 장치, 그리고 외부에서 검증 가능한 행동 기록이 함께 있어야 합니다. 이 중 하나라도 빠지면 사고가 발생한 뒤에야 무엇이 일어났는지 추측하게 됩니다.
저는 앞으로 AI 에이전트를 붙일 때 먼저 성능보다 다음 질문을 확인하려고 합니다. 이 에이전트는 무엇을 할 수 있는가보다, 무엇을 할 수 없도록 되어 있는가. 그리고 문제가 생겼을 때 누가, 언제, 어떤 기록을 보고 멈출 수 있는가.
자율성이 커질수록 신뢰는 모델의 의도에 기대서 만들 수 없습니다. 에이전트가 실제로 한 행동을 외부에서 확인하고 되돌릴 수 있는 구조를 만드는 것, 그것이 에이전트 시대의 가장 기본적인 운영 조건에 가까워지고 있습니다.




