주제별 읽기

하네스·도구·실행 환경

모델만큼 실행 환경이 중요해지면 개발 방식은 어떻게 달라질까요?

모델 주변의 실행 환경과 도구 설계가 에이전트의 실제 성능을 어떻게 바꾸는지 살펴봅니다.

주제 가이드

모델만으로는 시스템의 성능을 설명할 수 없습니다.

모델 자체보다 에이전트가 실제로 어떤 일을 끝내는지 비교하려는 개발자를 위한 안내입니다.

모델 바깥을 살펴보세요

  • 도구와 실행 컨텍스트가 다음 행동을 어떻게 바꾸는지
  • 하네스를 제외한 평가에서 놓치는 것들
  • 빠른 데모가 불안정한 워크플로로 이어지는 조건

시스템을 비교하기 전에

  • 같은 작업과 제약 조건으로 후보를 비교하는가
  • 최종 결과뿐 아니라 도구 실패와 복구 과정도 기록하는가
  • 모델의 품질과 실행 환경의 품질을 구분하는가

최근 기록

  1. Codex 하나로 돌아온 뒤, 하네스를 또 만들었다새 도구를 따라 Codex와 Hermes를 나눠 쓰고 Drig 자동화 그래프까지 만들었다가, 다시 단일 도구로 돌아온 개발 회고입니다.Codex 하나로 돌아온 뒤, 하네스를 또 만들었다 대표 이미지
  2. Hermes, Grok Bot, Buzz: 같은 AI 에이전트로 비교하면 놓치는 것Hermes, Grok Bot, Buzz를 초기 사용 경험과 공식 자료를 바탕으로 비교했습니다. 범용 자동화, 클라우드 컴퓨터 사용, 영업 아웃리치라는 서로 다른 역할을 기준으로 정리합니다.Hermes, Grok Bot, Buzz: 같은 AI 에이전트로 비교하면 놓치는 것 대표 이미지
  3. 소프트웨어의 종말이 찾아오고 있나AI 에이전트와 최근 프로젝트를 진행하며, 코드 작성보다 책임과 검증이 더 중요한 일이 되어가는 과정을 돌아봅니다.소프트웨어의 종말이 찾아오고 있나 대표 이미지
  4. SpaceX 품에 안긴 Cursor, 개발자의 선택권은 남을까Cursor가 SpaceX의 컴퓨팅 자원을 얻게 됐습니다. 더 강한 작업 환경과 모델·비용·데이터·운영 선택권을 함께 지킬 수 있는지가 다음 관전 포인트입니다.SpaceX 품에 안긴 Cursor, 개발자의 선택권은 남을까 대표 이미지
  5. Higgsfield는 AI 영상 도구를 넘어 제작 스튜디오가 될까카메라 제어형 AI 영상 생성에서 Supercomputer와 Apps까지 확장한 Higgsfield의 문제의식, 최근 뉴스, 비용, 시장성과 한계를 살펴봅니다.Higgsfield는 AI 영상 도구를 넘어 제작 스튜디오가 될까 대표 이미지
  6. 에이전트의 기억은 많을수록 좋아지지 않는다연구와 Luthn의 제한된 recall 설계를 바탕으로 에이전트 기억이 신뢰성·탐색 다양성·컨텍스트 비용 사이에서 만드는 trade-off를 설명합니다.에이전트의 기억은 많을수록 좋아지지 않는다 대표 이미지
  7. Grok 4.6의 질주, Cursor는 어디까지 바뀔까SpaceX의 Cursor 인수와 Grok 4.6 공식 발표를 바탕으로 Cursor가 코드 편집기를 넘어 AI 에이전트 작업장으로 변화할 가능성과 한계를 살펴봅니다.Grok 4.6의 질주, Cursor는 어디까지 바뀔까 대표 이미지
  8. 개발 자동화를 그만두고, 다시 개발의 재미로 돌아온 이유Drig를 모든 개발 단계를 맡는 그래프에서 제한된 기획·증거·QA·배포 경계로 좁히고 Codex와 직접 협업하게 된 프로젝트 회고입니다.개발 자동화를 그만두고, 다시 개발의 재미로 돌아온 이유 대표 이미지
  9. 오픈 웨이트 모델은 어디까지 실무에 들어왔나오픈 웨이트 모델은 로컬 에이전트와 작업별 AI 스택을 직접 설계하는 실무 선택지가 되고 있습니다. Meta Muse Glimmer와 DeepSeek V4 Flash 사례로 가능성과 한계를 살펴봅니다.오픈 웨이트 모델은 어디까지 실무에 들어왔나 대표 이미지
  10. Lovable: 아이디어를 웹앱으로 바꾸는 AI 공동창업자코드를 모르는 창업자와 팀이 자연어로 웹앱을 만들고 배포하는 Lovable의 강점, 비용, 시장성, 한계를 살펴봅니다.Lovable: 아이디어를 웹앱으로 바꾸는 AI 공동창업자 대표 이미지
  11. 에이전트 도구 호출이 특허 지형에 들어오면Mistral의 코드 구현 도구 호출 미국 특허가 에이전트 개발자에게 더 구체적인 질문을 던졌습니다. 도구 호출의 일반적인 개념과 특허 청구항에 가까운 런타임 구현을 어떻게 구분할지 정리합니다.에이전트 도구 호출이 특허 지형에 들어오면 대표 이미지
  12. 브라우저는 이제 사람만 쓰는 도구가 아니다Playwright, Computer Use, Browser Use, Cloudflare Browser Run을 비교하며 AI 에이전트 시대에 브라우저가 실행 환경으로 바뀌는 이유를 살펴봅니다.브라우저는 이제 사람만 쓰는 도구가 아니다 대표 이미지
  13. 에이전트 평가에서 빠진 변수, 하네스Harness-Bench 연구를 바탕으로 컨텍스트·도구·권한·복구·검증을 제공하는 실행 구성이 에이전트 성능에 미치는 영향을 정리합니다.에이전트 평가에서 빠진 변수, 하네스 대표 이미지
  14. Codex 업데이트는 모델보다 작업 환경을 먼저 바꾸고 있습니다최근 OpenAI의 Codex 업데이트를 GPT-5.6 제공 범위, 브라우저 디버깅, 원격 작업, 재사용 가능한 워크플로 관점에서 정리합니다.Codex 업데이트는 모델보다 작업 환경을 먼저 바꾸고 있습니다 대표 이미지
  15. AI 에이전트 권한 승인에서 사람이 놓치는 것4만 회 이상 진행된 실험을 바탕으로 익숙한 명령어, 승인 피로, 휴먼 인 더 루프 통제가 코딩 에이전트에 충분하지 않은 이유를 정리합니다.AI 에이전트 권한 승인에서 사람이 놓치는 것 대표 이미지
  16. Codex 모델 하나에게 모든 일을 맡기지 않는 법에이전트를 많이 늘리는 대신 기획·구현·리뷰·QA를 책임·모델 경로·증거·권한으로 나눠본 프로젝트 기록입니다.Codex 모델 하나에게 모든 일을 맡기지 않는 법 대표 이미지
  17. AI 에이전트의 행동은 외부 감사 로그에 남아야 한다AI 에이전트가 실제 시스템에 접근하는 시대에 필요한 외부 감사 로그, 권한 경계, 실시간 탐지의 기본 원칙을 정리했습니다.AI 에이전트의 행동은 외부 감사 로그에 남아야 한다 대표 이미지
  18. AI 에이전트의 문제는 똑똑함이 아니라 권한 설계다최근 사이버보안 평가 사건은 에이전트의 안전성이 프롬프트나 모델 성능보다 권한 경계와 실행 환경에 달려 있음을 보여줍니다.AI 에이전트의 문제는 똑똑함이 아니라 권한 설계다 대표 이미지
  19. AI를 더 편하게 쓰기 위한 도구를 만들며실제 작업 흐름에 AI를 맞추기 위해 제한된 맥락, 명시적 권한, 검토 가능한 결과를 중심으로 도구를 만들어가는 기록입니다.AI를 더 편하게 쓰기 위한 도구를 만들며 대표 이미지