기억을 저장하는 일은 쉽습니다. 그 기록을 남기고, 보여주고, 사용하고, 나중에도 믿어도 되는지 감사하는 일은 더 어렵습니다.

에이전트는 대화를 요약해 저장하고 다음 달 비슷한 기록을 검색할 수 있습니다. 어려운 질문은 그 뒤에 옵니다. 왜 아직 남아 있는지, 지금도 참인지, 다른 기억과 충돌하지 않는지, 누가 볼 수 있었는지, 잘못된 기억이 어떤 답변이나 행동에 쓰였는지를 설명해야 합니다.

최근 장기기억 연구는 기억을 더 큰 저장소가 아니라 감사 가능한 선택의 문제로 다룹니다. 제품에서 이 차이가 중요한 이유는 최종 답변 점수만으로 기억을 잘 쓴 것인지, 검색과 추론이 나쁜 기록을 우연히 보완한 것인지 구분하기 어렵기 때문입니다.

기억 쓰기도 별도로 평가해야 합니다

2026년 5월 공개된 MEMAUDIT는 미래 질문을 모르는 상태에서 고정된 예산 안에 무엇을 남길지 평가하는 방법을 제안했습니다. 이 프로토콜은 표현 품질, 유효성 상태 보존, 예산에 맞는 선택을 나눠 봅니다. 나중에 답할 수 있는지만이 아니라, 미래 작업을 알기 전에 기억 시스템이 방어 가능한 결정을 했는지를 보는 것입니다.

6월의 Learning What to Remember는 최근성이나 단순한 의미 유사성만으로 잊을 대상을 정하면 안 된다고 주장합니다. 신뢰성·목표 관련성·사용자 관련성·작업 효용도 함께 봐야 한다는 접근입니다. 논문의 제한된 블라인드 조건 실험에서 다요인 방식은 정답 근거 보존율 0.770 ± 0.011을 기록해 균등 가중치 0.657, 최근성 기준 0.368보다 높았습니다. 모든 에이전트에 적용되는 법칙은 아니지만, 무엇을 잊을지도 별도의 평가 대상이라는 근거입니다.

SubtleMemory도 1,522개 평가 인스턴스와 1,090개 관계 통제 세트로 서로 보완·변경·충돌하는 기억을 시험했습니다. 현재 시스템이 기억 사이의 미세한 관계를 구분하는 데 약하다는 보고입니다.

따라서 연구가 지지하는 결론은 조심스럽게 잡아야 합니다. 장기기억의 품질은 무엇을 보존하는지, 무엇을 불확실하게 표시하는지, 기록 사이의 관계를 어떻게 처리하는지를 포함합니다. 검색 적중률만의 문제가 아닙니다.

기억은 상태를 가진 주장입니다

제품 설계의 언어로 바꾸면 기억은 텍스트 한 덩어리가 아니라 이력과 범위를 가진 주장입니다.

항목 감사가 답할 수 있어야 하는 질문
출처 이 기록은 어디에서 왔고 언제 만들어졌는가?
종류 사실·선호·지시·관찰·추정 중 무엇인가?
유효성 어떤 사용자·프로젝트·작업·시간 범위에서 유효한가?
관계 다른 기록을 보완·수정·반박하는가?
사용 이후 어떤 답변·결정·도구 행동에 쓰였는가?
접근 어떤 에이전트나 요청자가 어떤 권한으로 보았는가?

서로 다른 기억 버전의 신뢰도와 유용성을 비교하는 과정을 표현한 일러스트

장기기억은 저장된 사실의 목록이 아니라 서로 다른 상태를 비교하고 판단하는 과정입니다.

기억이 충돌하면 최신 기록 하나로 덮는 것보다 두 기록의 관계와 확인 필요성을 남기는 편이 유용할 때가 많습니다. 최근 기록이 틀릴 수도 있고, 오래된 기록이 현재 범위 밖일 수도 있습니다. 유효성과 출처가 없으면 검색 시스템은 둘을 구분할 방법이 없습니다.

Luthn은 저장과 에이전트 가시성을 나눕니다

이 관점에서 Luthn은 안전한 맥락을 구현한 현실적인 사례입니다. Luthn은 원문을 에이전트의 기본 맥락으로 넘기지 않습니다. 입력을 분류하고 가린 뒤 에이전트가 볼 수 있는 안전한 요약과 맥락을 따로 만듭니다. 저장됐다는 사실과 에이전트가 읽을 수 있다는 권한을 분리하고, 외부 공개도 별도의 명시적 승인으로 다룹니다.

기억 기록이 출처·유효성·범위·사용 이력을 확인받은 뒤 압축된 감사 메타데이터로 남는 과정을 표현한 일러스트

좋은 감사 기록은 결정의 메타데이터를 남기되 보호된 원문의 두 번째 복사본이 되지 않습니다.

공개 설계에서 감사 기록도 저장·공유·조회·결정·실패를 추적하는 수준에 둡니다. 대화 원문을 보관하는 아카이브나 원래 기록을 복구하는 통로로 만들지 않습니다. 운영 질문은 “에이전트가 무엇을 기억했나?”뿐 아니라 “왜 이 기억이 보였나?”이기 때문입니다.

Luthn이 모든 기억 문제를 해결한다는 뜻은 아닙니다. 분류·안전한 투영·접근 권한·감사 기록을 하나의 기능으로 뭉개지 않는 설계를 보여주는 사례입니다. 보호된 원문을 돌려주지 않고도 해당 투영이 만료됐거나 거부됐다는 사실을 설명할 수 있어야 합니다.

기억을 사용하지 않는 기준선·제한된 기억·넓은 검색 정책을 같은 테스트로 비교하는 과정을 표현한 일러스트

기억 정책의 품질은 저장량보다 선택·거부·출처·권한 판단을 같은 조건에서 비교할 때 드러납니다.

기억 정책을 비교하는 최소 실험

새 기억 정책을 도입할 때는 최종 답변이 좋아졌다는 인상만으로 판단하기 어렵습니다. 같은 작업 기록을 세 가지 조건으로 나누어 비교하는 편이 낫습니다. 기억을 쓰지 않는 기준선, 출처와 유효성만 남기는 제한된 기억, 검색 결과를 넓게 노출하는 기존 방식입니다. 세 조건에 같은 질문과 같은 도구 권한을 주면 기억 자체가 만든 차이를 관찰하기 쉬워집니다.

비교할 지표도 답변 정확도 하나로 끝내지 않습니다. 어떤 기록이 선택됐는지 출처가 완전히 연결되는지, 오래된 사실을 현재 사실처럼 말하지 않고 확인을 요청하는지, 서로 충돌하는 기록을 구분하는지, 요청자의 범위를 넘는 기억을 숨기는지, 기억이 실제 답변이나 도구 호출에 쓰였다는 흔적이 남는지를 각각 기록해야 합니다. 잘못된 기억을 사용하지 않은 것도 성공 결과에 포함해야 합니다.

예를 들어 같은 선호가 바뀌거나 프로젝트 범위가 달라지는 대화, 일부 기록만 접근 가능한 요청, 상위 모델로 넘겨야 하는 모호한 질문을 테스트 세트에 넣을 수 있습니다. 평가자는 최종 문장뿐 아니라 선택된 기억·거부된 기억·만료 상태·권한 판단을 확인합니다. 이 과정에서 개인정보나 보호된 원문을 평가 산출물에 복사하지 않도록 식별자와 요약만 남겨야 합니다.

이런 실험은 특정 정책이 모든 에이전트를 개선한다고 보장하지 않습니다. 다만 기억 시스템이 얼마나 많이 저장했는지보다, 무엇을 선택했고 무엇을 사용하지 않았으며 그 판단을 나중에 설명할 수 있는지를 비교하게 해줍니다.

감사는 네 가지 질문에 답해야 합니다

운영자가 모든 대화를 다시 읽을 필요는 없습니다. 제한된 감사 기록만으로도 적어도 다음 네 가지는 확인할 수 있어야 합니다.

  1. 어떤 원문과 분류 결과가 이 기억을 만들었는가?
  2. 어떤 소유자·프로젝트·작업·만료 조건에서 유효했는가?
  3. 어떤 에이전트나 요청자가 어떤 권한으로 받았는가?
  4. 이후 답변이나 도구 행동에 영향을 줬고, 그 다음 결과는 무엇이었는가?

원문을 감사 로그에 복사하면 또 하나의 민감한 저장소가 생깁니다. 아무 기록도 남기지 않으면 잘못된 기억을 조사할 수 없습니다. 필요한 중간 지점은 결정과 연결되지만 원문으로 무제한 돌아갈 수 없는 작고 조회 가능한 메타데이터입니다.

인용한 논문과 공개된 Luthn 문서는 설계 방향을 제시할 뿐, 로컬에서 통제한 A/B 실험의 결과는 아닙니다. 하나의 기억 정책이 모든 에이전트를 개선한다고 측정한 것도 아닙니다. 다만 장기기억이 커질수록 검색 품질과 함께 유효성·출처·접근·사용 이력도 평가해야 한다는 판단은 분명해집니다.