주제별 읽기
하네스·도구·실행 환경
모델만큼 실행 환경이 중요해지면 개발 방식은 어떻게 달라질까요?
모델 주변의 실행 환경과 도구 설계가 에이전트의 실제 성능을 어떻게 바꾸는지 살펴봅니다.
주제 가이드
모델만으로는 시스템의 성능을 설명할 수 없습니다.
모델 자체보다 에이전트가 실제로 어떤 일을 끝내는지 비교하려는 개발자를 위한 안내입니다.
모델 바깥을 살펴보세요
- 도구와 실행 컨텍스트가 다음 행동을 어떻게 바꾸는지
- 하네스를 제외한 평가에서 놓치는 것들
- 빠른 데모가 불안정한 워크플로로 이어지는 조건
시스템을 비교하기 전에
- 같은 작업과 제약 조건으로 후보를 비교하는가
- 최종 결과뿐 아니라 도구 실패와 복구 과정도 기록하는가
- 모델의 품질과 실행 환경의 품질을 구분하는가
최근 기록
- Codex 하나로 돌아온 뒤, 하네스를 또 만들었다새 도구를 따라 Codex와 Hermes를 나눠 쓰고 Drig 자동화 그래프까지 만들었다가, 다시 단일 도구로 돌아온 개발 회고입니다.

- Hermes, Grok Bot, Buzz: 같은 AI 에이전트로 비교하면 놓치는 것Hermes, Grok Bot, Buzz를 초기 사용 경험과 공식 자료를 바탕으로 비교했습니다. 범용 자동화, 클라우드 컴퓨터 사용, 영업 아웃리치라는 서로 다른 역할을 기준으로 정리합니다.

- 소프트웨어의 종말이 찾아오고 있나AI 에이전트와 최근 프로젝트를 진행하며, 코드 작성보다 책임과 검증이 더 중요한 일이 되어가는 과정을 돌아봅니다.

- SpaceX 품에 안긴 Cursor, 개발자의 선택권은 남을까Cursor가 SpaceX의 컴퓨팅 자원을 얻게 됐습니다. 더 강한 작업 환경과 모델·비용·데이터·운영 선택권을 함께 지킬 수 있는지가 다음 관전 포인트입니다.

- Higgsfield는 AI 영상 도구를 넘어 제작 스튜디오가 될까카메라 제어형 AI 영상 생성에서 Supercomputer와 Apps까지 확장한 Higgsfield의 문제의식, 최근 뉴스, 비용, 시장성과 한계를 살펴봅니다.

- 에이전트의 기억은 많을수록 좋아지지 않는다연구와 Luthn의 제한된 recall 설계를 바탕으로 에이전트 기억이 신뢰성·탐색 다양성·컨텍스트 비용 사이에서 만드는 trade-off를 설명합니다.

- Grok 4.6의 질주, Cursor는 어디까지 바뀔까SpaceX의 Cursor 인수와 Grok 4.6 공식 발표를 바탕으로 Cursor가 코드 편집기를 넘어 AI 에이전트 작업장으로 변화할 가능성과 한계를 살펴봅니다.

- 개발 자동화를 그만두고, 다시 개발의 재미로 돌아온 이유Drig를 모든 개발 단계를 맡는 그래프에서 제한된 기획·증거·QA·배포 경계로 좁히고 Codex와 직접 협업하게 된 프로젝트 회고입니다.

- 오픈 웨이트 모델은 어디까지 실무에 들어왔나오픈 웨이트 모델은 로컬 에이전트와 작업별 AI 스택을 직접 설계하는 실무 선택지가 되고 있습니다. Meta Muse Glimmer와 DeepSeek V4 Flash 사례로 가능성과 한계를 살펴봅니다.

- Lovable: 아이디어를 웹앱으로 바꾸는 AI 공동창업자코드를 모르는 창업자와 팀이 자연어로 웹앱을 만들고 배포하는 Lovable의 강점, 비용, 시장성, 한계를 살펴봅니다.

- 에이전트 도구 호출이 특허 지형에 들어오면Mistral의 코드 구현 도구 호출 미국 특허가 에이전트 개발자에게 더 구체적인 질문을 던졌습니다. 도구 호출의 일반적인 개념과 특허 청구항에 가까운 런타임 구현을 어떻게 구분할지 정리합니다.

- 브라우저는 이제 사람만 쓰는 도구가 아니다Playwright, Computer Use, Browser Use, Cloudflare Browser Run을 비교하며 AI 에이전트 시대에 브라우저가 실행 환경으로 바뀌는 이유를 살펴봅니다.

- 에이전트 평가에서 빠진 변수, 하네스Harness-Bench 연구를 바탕으로 컨텍스트·도구·권한·복구·검증을 제공하는 실행 구성이 에이전트 성능에 미치는 영향을 정리합니다.

- Codex 업데이트는 모델보다 작업 환경을 먼저 바꾸고 있습니다최근 OpenAI의 Codex 업데이트를 GPT-5.6 제공 범위, 브라우저 디버깅, 원격 작업, 재사용 가능한 워크플로 관점에서 정리합니다.

- AI 에이전트 권한 승인에서 사람이 놓치는 것4만 회 이상 진행된 실험을 바탕으로 익숙한 명령어, 승인 피로, 휴먼 인 더 루프 통제가 코딩 에이전트에 충분하지 않은 이유를 정리합니다.

- Codex 모델 하나에게 모든 일을 맡기지 않는 법에이전트를 많이 늘리는 대신 기획·구현·리뷰·QA를 책임·모델 경로·증거·권한으로 나눠본 프로젝트 기록입니다.

- AI 에이전트의 행동은 외부 감사 로그에 남아야 한다AI 에이전트가 실제 시스템에 접근하는 시대에 필요한 외부 감사 로그, 권한 경계, 실시간 탐지의 기본 원칙을 정리했습니다.

- AI 에이전트의 문제는 똑똑함이 아니라 권한 설계다최근 사이버보안 평가 사건은 에이전트의 안전성이 프롬프트나 모델 성능보다 권한 경계와 실행 환경에 달려 있음을 보여줍니다.

- AI를 더 편하게 쓰기 위한 도구를 만들며실제 작업 흐름에 AI를 맞추기 위해 제한된 맥락, 명시적 권한, 검토 가능한 결과를 중심으로 도구를 만들어가는 기록입니다.
