📚 study — 1분 지식 카드

안드로이드·코틀린·AI 코딩 도구를 1분에 읽는 카드뷰로 정리한 학습 블로그

정렬
Kotlin

코틀린이란 — 정적 타입 + 함수형

코틀린은 JVM에서 도는 언어로, 자바와의 상호운용성을 중시한다. 핵심은 '정적 타입 지정'이라 컴파일 시점에 타입이 확정돼 성능·신뢰성·유지보수·도구지원이 좋아진다. 동시에 타입 추론을 제공해 코드는 짧게 유지된다. 함수를 변수처럼 다루는 일급 함수, 불변성, 부수효과 없는 순수 함수 같은 함수형 개념도 지원한다. 자바엔 없는 nullable 타입과 함수 타입이 컴파일 단계에서 NPE 위험을 잡아준다.

  • 정적 타입 + 타입 추론 = 안전하면서 간결
  • nullable 타입(?)으로 NPE를 컴파일 시점에 차단
  • 일급 함수·불변성·순수 함수 = 함수형 지원
원본 →
Kotlin

문(statement)과 식(expression)

자바는 if/제어구조가 값을 만들지 않는 '문'이지만, 코틀린은 루프를 뺀 대부분의 제어구조가 값을 만드는 '식'이다. 그래서 `return if(cond) A else B`가 가능하다. 함수도 두 종류 — 중괄호로 감싼 '블록 본문 함수'와 등호로 잇는 '식 본문 함수'. 식 본문 함수는 타입 추론 덕에 반환형을 생략할 수 있다(블록 본문은 불가). 이 차이가 코틀린 특유의 간결함의 출발점이다.

  • 코틀린의 if/when은 값을 반환하는 '식'
  • 식 본문 함수 `fun f() = 1` 은 반환형 생략 가능
  • 변수도 타입 추론으로 생략 가능
원본 →
Kotlin

컬렉션 생성 함수 — setOf/hashSetOf/arrayListOf

코틀린은 컬렉션을 만드는 팩토리 함수를 제공한다. setOf·hashSetOf는 내부적으로 LinkedHashSet, arrayListOf는 ArrayList를 돌려준다. 코틀린은 자체 컬렉션을 새로 만들지 않고 자바 표준 컬렉션을 그대로 활용하면서, 정렬·필터 같은 유용한 확장 함수를 얹는 방식이다. `.plus()` 같은 연산은 원본을 바꾸지 않고 새 컬렉션을 반환한다(불변성 지향).

  • 코틀린 컬렉션 = 자바 컬렉션 + 확장 함수
  • .plus()는 원본 불변, 새 컬렉션 반환
  • 제네릭 원소 모임 + 알고리즘 메서드 제공
원본 →
Kotlin

클래스·인터페이스 — 자바와 무엇이 다른가

코틀린 인터페이스는 자바 8의 default 메서드처럼 구현이 있는 메서드를 가질 수 있지만, 상태(필드)는 가질 수 없다. 자바의 extends/implements는 모두 콜론(:)으로 대체되고, 확장 클래스 뒤엔 괄호()를 붙인다. 인터페이스 구현은 개수 제한이 없지만 클래스 확장은 1번만 가능하다. 자바의 @Override는 코틀린에서 `override` 변경자가 된다. 본문 없는 멤버는 추상, default는 키워드 없이 본문만 주면 된다.

  • 인터페이스에 구현은 OK, 상태(필드)는 불가
  • extends/implements → 콜론(:) 하나로 통일
  • @Override → override 변경자
원본 →
Kotlin

람다 — 코드 블록을 인자로 넘기기

람다는 다른 함수에 넘길 수 있는 작은 코드 조각이다. 자바 8처럼 코드 블록을 함수 인자로 직접 전달할 수 있어, 안드로이드의 setOnClickListener 같은 '메서드 하나뿐인 익명 객체'를 람다로 대체해 코드를 확 줄인다. 컬렉션에선 maxBy처럼 기준을 람다로 받는 라이브러리 함수가 있어 `list.maxBy { it.age }` 식으로 짧게 쓴다. 멤버 참조(Person::age)로 더 줄일 수도 있다.

  • 익명 객체 → 람다로 보일러플레이트 제거
  • list.maxBy { it.age } 처럼 기준을 람다로
  • 멤버 참조(::)로 한 번 더 축약
원본 →
Kotlin

널 가능성 — ?. 와 ?: 로 NPE 방어

코틀린 타입 시스템은 널 가능 여부를 타입에 담아 NPE를 컴파일 시점에 잡는다. 타입 뒤에 ?를 붙이면 null을 담을 수 있는 타입이 된다. 안전한 호출 `?.`는 null 검사와 호출을 한 번에 — `a?.length`는 a가 null이면 그대로 null을 반환한다(결과 타입도 nullable). 엘비스 연산자 `?:`는 null일 때 기본값을 지정한다. 이 조합이 코틀린이 자바보다 NPE에 강한 핵심 이유다.

  • 타입 뒤 ? = 널 가능 타입
  • ?. = null이면 호출 건너뛰고 null 반환
  • ?: = null일 때 기본값 제공(엘비스)
원본 →
Android

액티비티 생명주기

액티비티는 보통 한 화면을 대표하며 AppCompatActivity를 상속한다. 생명주기 콜백은 쌍으로 관리한다 — onCreate↔onDestroy, onStart↔onStop. onCreate(초기화·뷰 생성), onStart(아직 비표시, 센서·통신 시작), onResume(표시·화면 갱신), onPause(포커스 상실·리소스 해제·저장), onStop(통신 정지), onDestroy(참조 정리). 다른 클래스가 액티비티 인스턴스를 참조하면 폐기 후에도 메모리에 남아 누수가 생긴다.

  • 콜백은 쌍으로 — onCreate↔onDestroy, onStart↔onStop
  • onPause에서 저장·리소스 해제
  • 외부 참조가 남으면 메모리 누수
원본 →
Android

화면 회전과 상태 복원 — onSaveInstanceState

화면 가로/세로 전환 같은 디바이스 설정 변경이 일어나면 기존 액티비티는 폐기되고 새로 생성된다. 그래서 입력값 등이 사라진다. onSaveInstanceState/onRestoreInstanceState 콜백으로 데이터를 저장·복구할 수 있다. 저장 가능한 자료형은 기본형·문자열·리스트, 그리고 Parcelable을 구현한 인스턴스다. 시스템 임시 영역에 IPC로 주고받기 때문에 전달 규약이 필요하고, 그게 Parcelable 인터페이스다. 단, 뒤로가기로 명시적으로 폐기하면 호출되지 않는다.

  • 설정 변경 = 액티비티 재생성 → 상태 유실
  • onSaveInstanceState로 저장, Parcelable로 전달
  • 뒤로가기 폐기 시엔 호출 안 됨
원본 →
Android

레이아웃 선택 — Linear vs Constraint

LinearLayout은 depth가 얕고 순차적으로 뷰를 나열할 때, 단순한 화면에 적합하다. 복잡한 화면엔 RelativeLayout/ConstraintLayout을 쓴다. 사진 주변에 여러 뷰를 배치하는 상황은 예전엔 RelativeLayout이었지만 요즘은 ConstraintLayout이 표준 — 깊어지기 쉬운 계층을 1단계로 평탄화하는 게 장점이다. 속도도 다르다: LinearLayout은 사이즈를 2번 측정해 상대적으로 느리고, ConstraintLayout은 최적화로 1번만 측정해 더 빠르다.

  • 단순·순차 = Linear, 복잡 = Constraint
  • Constraint는 계층을 평탄화(depth↓)
  • 측정 횟수: Linear 2회 vs Constraint 1회
원본 →
Android

머티리얼 디자인 — 일관된 시각 언어

스큐어모픽(실물 모사)→플랫(평면)을 거쳐, 구글은 '프로젝트 케네디'로 디자인을 통일했고 그 위에 학습 부담을 줄인 머티리얼 디자인을 내놨다. 핵심은 시각 디자인의 공통 언어와 '이디엄'(단순 조작을 조합해 의미 있는 조작을 만드는 관용구)으로 사용자가 UI 동작을 예측하게 하는 것. 대표 컴포넌트는 리스트/그리드/카드, 그리고 FAB·Raised·Flat 버튼. 카드엔 정보를 의미 단위로 묶는 '청킹'을 적용한다.

  • 케네디 → 머티리얼: 일관성 + 학습부담↓
  • 이디엄으로 동작을 예측 가능하게
  • 카드·리스트·FAB가 대표 컴포넌트
원본 →
설계·아키텍처

왜 설계 기법을 쓰나 — 액티비티 비대화 방지

액티비티는 화면 로직, 사용자 액션 처리, 뷰 데이터 반영 등 너무 많은 역할을 떠안는다. 전부 액티비티에 넣으면 변경이 어렵고 관리가 힘들다. 그래서 역할을 분리해 변경에 강한 코드를 만드는 게 설계 기법의 목적이다. 대표적으로 MVP(Model-View-Presenter)와 MVVM(Model-View-ViewModel)이 있다. 둘 다 '뷰는 표시, 비즈니스/데이터는 분리'라는 원칙을 공유한다.

  • 문제: 액티비티가 모든 역할을 떠안음
  • 해결: 역할 분리로 변경에 강하게
  • 대표 패턴: MVP, MVVM
원본 →
설계·아키텍처

MVP 패턴 — 장점과 함정

MVP는 Model(DB·API 접근, UI 로직 없음), View(데이터 표시, 액션은 Presenter에 위임), Presenter(Model·View 중개, 이벤트 처리)로 나눈다. Presenter가 인터페이스로만 접근하게 하면 테스트가 쉬워진다. 장점은 역할 분리로 액티비티가 작아지고 View-Model 의존이 사라지는 것. 단점은 인터페이스 정의로 코드가 길어지고, 데이터를 뷰에 꽂는 로직을 직접 짜야 하며, 표준 프레임워크가 없어 분리 방식을 매번 고민해야 한다는 점이다.

  • Model/View/Presenter로 역할 3분할
  • 인터페이스 접근 → 테스트 용이
  • 단점: 코드량↑, 표준 프레임워크 부재
원본 →
설계·아키텍처

그레이들(Gradle)의 이해

Gradle은 안드로이드의 빌드 시스템으로, 어떤 라이브러리를 쓰고 어떻게 컴파일·패키징할지를 선언한다. 프로젝트 수준과 모듈(app) 수준 build.gradle로 나뉘며, dependencies 블록에 의존성을 적으면 자동으로 받아온다. minSdk/targetSdk로 지원 범위를 정하고, productFlavor로 같은 코드에서 여러 빌드 변형(무료/유료 등)을 만든다. 이 학습 레포의 ProductFlavorApp 예제가 그 실습이다.

  • 프로젝트/모듈 build.gradle 2단계
  • dependencies로 라이브러리 선언·자동 수신
  • productFlavor로 빌드 변형 생성
원본 →
AI 코딩 도구

diagnose — 디버깅을 규율로 만드는 스킬

mattpocock/skills의 diagnosing-bugs는 어려운 버그를 "재현 가능한 실패 신호"에서 시작하게 만드는 디버깅 루프다. 순서는 재현·최소화 → 3~5개 가설 → 한 변수씩 계측 → 수정 → 회귀 테스트 → 정리로 이어진다. 좋은 점은 버그를 설명하는 말솜씨보다, 같은 명령으로 빨간불과 초록불을 반복해서 볼 수 있는지를 먼저 묻는다는 것이다. 그래서 AI에게 바로 코드를 고치게 하기보다, 실패를 빠르게 보여주는 테스트·스크립트·로그 지점을 먼저 만들고 그 신호 하나로 가설을 줄여 간다.

  • 출발점: 재현 가능한 red/pass 신호를 먼저 만든다
  • 가설은 3~5개로 제한하고, 계측은 한 변수씩만 바꾼다
  • 수정 뒤에는 같은 실패 신호를 회귀 테스트로 남긴다
원본 →
AI 코딩 도구

Spec Kit — 명세 주도 개발(SDD)

GitHub Spec Kit은 AI에게 바로 구현을 맡기기 전에, 요구사항과 기술 결정을 파일로 고정하는 Spec-Driven Development 도구다. 흐름은 constitution으로 프로젝트 원칙을 세우고, specify로 "무엇과 왜"를 적은 뒤, plan에서 기술 선택을 붙이고, tasks로 실행 가능한 작업 목록을 만든 다음 implement로 들어간다. `specify init`은 Copilot, Codex, Claude Code, Gemini CLI 등 30개 이상 에이전트 통합을 지원하고, 스킬 모드에서는 `/speckit.*` 명령 대신 `speckit-*` 스킬을 설치할 수 있다. 교훈은 "명세 문서"가 산출물 보관용이 아니라, AI가 추측으로 코드를 시작하지 못하게 하는 실행 경계라는 점이다.

  • constitution→specify→plan→tasks→implement로 요구사항과 구현을 분리
  • `specify init`은 30+ 에이전트 통합과 skills 모드 설치를 지원
  • 핵심 가치: AI 코딩 전에 원칙·요구사항·작업 단위를 버전 관리
원본 →
AI 코딩 도구

Karpathy-inspired CLAUDE.md — 에이전트 행동을 네 규칙으로 좁히기

multica-ai/andrej-karpathy-skills는 Karpathy의 LLM 코딩 실패 관찰에서 출발한 짧은 CLAUDE.md 가이드다. 네 규칙은 ① Think Before Coding(가정·모호함·트레이드오프를 먼저 드러내기), ② Simplicity First(요청 밖 기능과 1회용 추상화 금지), ③ Surgical Changes(요청과 직접 연결된 줄만 바꾸기), ④ Goal-Driven Execution(성공 기준을 정하고 검증될 때까지 반복)이다. 교훈은 특정 도구보다 "에이전트가 어떤 행동을 하지 말아야 하는지"를 작고 검증 가능한 규칙으로 쓰는 것이 결과를 바꾼다는 점이다.

  • 4규칙: 먼저 이해·최소 코드·수술적 변경·목표 기반 검증
  • 모호하면 추측하지 않고 가정과 선택지를 드러내게 함
  • 규칙 파일은 작을수록 행동 경계가 선명해진다는 사례
원본 →
AI 코딩 도구

Ouroboros — 모호함을 수치로

Ouroboros는 코딩 에이전트가 막연한 요청에서 바로 구현으로 뛰지 않게 만드는 명세 우선 워크플로 엔진이다. 흐름은 interview로 숨은 가정을 드러내고, seed로 확정된 스펙을 만들고, run/evaluate로 실행과 검증을 반복하는 구조다. 핵심은 인터뷰를 감으로 끝내지 않는 점이다. 목표·제약·성공 기준·기존 코드베이스 이해 같은 차원을 0.0~1.0으로 채점하고, `Ambiguity = 1 - Σ(clarity_i × weight_i)`로 남은 불확실성을 계산한다. Ambiguity가 0.2 이하가 되어야 Seed를 만들 수 있고, 유사도 0.95 이상이면 온톨로지가 수렴했다고 본다. 즉 질문을 오래 하는 도구가 아니라, 구현해도 되는 상태를 수치로 가르는 장치다.

  • interview→seed→run→evaluate로 질문·명세·실행·검증을 분리
  • Seed 생성 임계값: Ambiguity <= 0.2, 수렴 기준: Similarity >= 0.95
  • Brownfield는 목표·제약·성공 기준에 코드베이스 컨텍스트까지 가중 평가
원본 →
AI 코딩 도구

서브에이전트 — 컨텍스트를 지키는 분업

Claude Code의 서브에이전트는 자체 컨텍스트 창, 전용 시스템 프롬프트, 별도 도구 권한을 가진 작업 단위다. 검색·코드 탐색·보안 검토처럼 로그와 파일 내용이 많이 쌓이는 일을 분리하면, 메인 세션에는 결과 요약만 돌아와 컨텍스트를 보존한다. 정의 파일은 프로젝트 `.claude/agents/`나 사용자 `~/.claude/agents/`에 두고, 중복 이름이 있으면 더 가까운 프로젝트 정의가 우선한다. 실무 포인트는 병렬화보다 권한과 비용 라우팅이다. `tools` allowlist, `disallowedTools` denylist, MCP 서버 범위, `model` 필드로 읽기 전용 탐색대·로컬 전용 조사원·저비용 요약 에이전트를 분리해 설계한다.

  • 정의 위치: 프로젝트 `.claude/agents/`가 사용자 `~/.claude/agents/`보다 우선
  • 권한 설계: `tools`/`disallowedTools`와 MCP 서버 범위로 읽기·쓰기·외부도구를 제한
  • 비용 설계: `model` 또는 `CLAUDE_CODE_SUBAGENT_MODEL`로 반복 탐색은 더 빠른 모델에 라우팅
원본 →
AI 코딩 도구

reloadSkills·sessionTitle·/reload-skills — SessionStart 훅·수동 명령으로 스킬·세션 제목 즉시 반영

Claude Code v2.1.152+는 스킬 탐색을 SessionStart 훅 종료 전 1회만 돌리므로, 훅이 ~/.claude/skills/에 새 SKILL.md를 써도 기본적으로 다음 세션에야 보인다. SessionStart 훅이 hookSpecificOutput.reloadSkills:true를 반환하면 훅 직후 스킬·커맨드 디렉터리를 재스캔해 같은 세션에서 즉시 사용 가능. 수동 경로는 /reload-skills — 대화 컨텍스트를 유지한 채 디렉터리만 재스캔(edit→reload→test 루프). 같은 릴리스에서 hookSpecificOutput.sessionTitle로 startup·resume 시 세션 제목을 프로그래밍 방식으로 설정 가능 — CI·팀 부트스트랩·스킬 authoring loop에 유용.

  • SessionStart reloadSkills:true — 훅이 스킬 설치 후 같은 세션에 등록
  • /reload-skills — 수동 재스캔, 컨텍스트 유지(edit SKILL.md→reload→test)
  • sessionTitle — startup/resume 시 세션 제목 programmatic set
원본 →
AI 코딩 도구

--safe-mode — 커스터마이징 다 끄고 설정 문제 격리

Claude Code(v2.1.169+)의 `--safe-mode`는 모든 커스터마이징을 로드하지 않고 시작하는 플래그다. CLAUDE.md·스킬·플러그인·훅·MCP 서버·커스텀 커맨드/에이전트·출력 스타일·워크플로·커스텀 테마/키바인딩· 상태줄·LSP 서버·자동 메모리가 전부 비활성화된다. 반면 인증·모델 선택·내장 도구·권한은 정상 동작해서, 모든 것을 끄는 `--bare`와는 다르다. 어떤 커스터마이징이 설정을 망가뜨렸는지 이분법으로 좁힐 때 쓴다. 관리(managed) 정책 훅·상태줄·커맨드는 안전 모드에서도 여전히 적용된다.

  • 끄는 것: CLAUDE.md·스킬·플러그인·훅·MCP·커스텀 커맨드/에이전트·출력스타일·테마·상태줄·자동메모리
  • 유지: 인증·모델 선택·내장 도구·권한 (그래서 전부 끄는 --bare와 다름)
  • 관리 정책 항목은 예외로 적용 / 실행 시 CLAUDE_CODE_SAFE_MODE 설정됨
원본 →
AI 코딩 도구

/cd — 프롬프트 캐시 깨지 않고 작업 디렉터리 옮기기

Claude Code(v2.1.169+)의 `/cd `는 세션을 통째로 새 작업 디렉터리로 옮긴다. 핵심은 대화의 프롬프트 캐시가 유지된다는 점이다. 시스템 프롬프트를 다시 만드는 대신, 새 디렉터리의 CLAUDE.md를 메시지로 덧붙이는 방식이라 세션 중간에 캐시가 깨지지 않는다. 세션은 새 디렉터리의 프로젝트 저장소로 이동해서 `--resume`/`--continue`도 거기서 찾는다. 처음 가는 디렉터리면 신뢰 여부를 물어본다. 세션 이동 없이 디렉터리 접근만 추가하려면 `/add-dir`를 쓴다.

  • 세션을 새 작업 디렉터리로 이동 — 프롬프트 캐시 보존(CLAUDE.md를 메시지로 append)
  • 세션이 새 디렉터리 저장소로 옮겨져 --resume/--continue도 거기서 인식
  • 접근만 추가는 /add-dir / Cd 권한 규칙으로 대상 제한 가능 / v2.1.169 미만은 Unknown command
원본 →
AI 코딩 도구

출력 스타일(Output Styles) — Claude의 역할·말투를 시스템 프롬프트째 바꾸기

출력 스타일은 Claude가 '무엇을 아는지'가 아니라 '어떻게 응답하는지'를 바꾼다. 시스템 프롬프트를 직접 수정해 역할·톤·출력 형식을 매 턴 고정한다. 내장 스타일은 Default 외에 Proactive(즉시 실행), Explanatory(코딩 중 'Insights' 설명), Learning(직접 코드 일부를 짜도록 TODO(human) 마커를 남김) 세 가지가 있다. `/config`의 Output style에서 고르며 선택은 .claude/settings.local.json의 outputStyle에 저장된다. 세션 시작 시 한 번 읽으므로 변경은 /clear 후 적용된다. 커스텀 스타일은 .claude/output-styles의 마크다운 파일로 만들고, keep-coding-instructions: true면 코딩 지침을 유지한다.

  • 내장: Default / Proactive(즉시 실행) / Explanatory(설명) / Learning(TODO(human) 마커로 직접 작성 유도)
  • CLAUDE.md(프로젝트 컨텍스트)와 달리 시스템 프롬프트 자체를 수정 — 매 응답에 적용, /clear 후 반영
  • 커스텀은 .claude/output-styles 마크다운 / 기본은 코딩 지침 제외, keep-coding-instructions: true로 유지
원본 →
AI 코딩 도구

fallbackModel — 기본 모델이 막힐 때 대체 모델로 자동 전환

fallbackModel은 기본 모델이 과부하(overloaded)거나 사용 불가일 때 쓸 백업 모델을 지정하는 설정이다. settings.json에 모델 이름 배열로 적으면 적힌 순서대로 시도하고, 전환되면 알림(notice)을 보여준다. 체인은 최대 3개까지만 적용되고 그 이상은 무시된다. `"default"`는 기본 모델로 확장된다. 이 키는 설정 파일 간 병합되지 않아서, 우선순위가 가장 높은 파일이 체인 전체를 결정한다. 한 세션만 바꾸려면 `--fallback-model` 플래그로 덮어쓸 수 있다.

  • 기본 모델 과부하·불가 시 배열 순서대로 백업 모델 시도 + 전환 알림 표시
  • 체인 최대 3개(초과 무시) / "default"는 기본 모델로 확장 / 병합 안 됨(최상위 파일이 전체 결정)
  • 단발성 변경은 --fallback-model 플래그로 한 세션만 덮어쓰기
원본 →
AI 코딩 도구

Stop 훅 additionalContext — 턴 끝에 컨텍스트 주입해 작업 이어가기

Stop·SubagentStop 훅은 hookSpecificOutput.additionalContext로 문자열을 돌려줄 수 있다. Claude Code는 이 문자열을 시스템 리마인더로 감싸 턴이 끝나는 지점에 끼워 넣고, 대화가 계속되어 Claude가 그 내용을 보고 작업을 이어간다. decision: "block"이 오류 피드백으로 강제 계속시키는 것과 달리, additionalContext는 오류가 아닌 정보성 피드백이다. 한 이벤트에 여러 훅이 값을 돌려주면 Claude는 전부 받고, 한 값이 10,000자를 넘으면 전체 텍스트는 세션 디렉터리 파일로 저장되고 미리보기와 파일 경로만 전달된다.

  • Stop·SubagentStop은 hookSpecificOutput.additionalContext로 턴 끝에 컨텍스트 주입 가능
  • block(오류 피드백) vs additionalContext(정보성 피드백) — 둘 다 대화를 계속시키지만 성격이 다름
  • 값 10,000자 초과 시 파일로 저장 후 경로+미리보기만 전달 / 여러 훅 값은 모두 수신
원본 →
AI 코딩 도구

상태줄 rate_limits — 5시간·7일 사용량을 항상 눈에 보이게

상태줄(statusline) 스크립트는 stdin으로 받는 JSON에 rate_limits 필드를 포함한다. rate_limits.five_hour와 rate_limits.seven_day 각각에 used_percentage(0~100)와 resets_at(Unix epoch 초)가 들어 있어, 5시간·7일 사용 한도를 몇 % 썼고 언제 리셋되는지 바닥에 상시 표시할 수 있다. 단 이 필드는 Claude.ai 구독자(Pro/Max)에게만, 그것도 세션 첫 API 응답 이후에 나타나며 각 윈도우가 독립적으로 없을 수 있어 jq에서 // empty로 부재를 처리해야 한다. 상태줄은 로컬에서 돌고 API 토큰을 쓰지 않으니 한도 추적에 부담이 없다.

  • rate_limits.five_hour / seven_day → used_percentage(0~100) + resets_at(Unix epoch 초)
  • Pro/Max 구독자 한정, 세션 첫 API 응답 후에만 등장 / 각 윈도우 독립적으로 부재 가능 → jq '// empty'
  • 상태줄은 로컬 실행이라 API 토큰 미소비 / context_window.used_percentage로 컨텍스트 사용량도 함께 표시 가능
원본 →
AI 코딩 도구

disableBundledSkills — 번들 스킬·내장 명령을 모델 눈앞에서 치우기

Claude Code에는 기본 제공되는 번들 스킬·워크플로와 /init 같은 내장 슬래시 명령이 딸려 온다. settings.json에서 disableBundledSkills를 true로 두면 번들 스킬·워크플로는 통째로 제거되고, 내장 슬래시 명령은 여전히 타이핑은 되지만 모델 목록에서는 숨겨진다. 이때 설치한 Skills 플러그인, .claude/skills/, .claude/commands/의 내 스킬·명령은 영향을 받지 않는다. 환경변수 CLAUDE_CODE_DISABLE_BUNDLED_SKILLS=1로도 같은 효과를 낼 수 있어, 내 워크플로만 깔끔히 노출하고 싶을 때 쓴다.

  • true 시 번들 스킬·워크플로는 완전 제거, 내장 슬래시 명령(/init 등)은 타이핑 가능하나 숨김
  • 내 것(플러그인·.claude/skills·.claude/commands)은 영향 없음
  • 환경변수 CLAUDE_CODE_DISABLE_BUNDLED_SKILLS=1로 동일 효과
원본 →
AI 코딩 도구

스킬 호출 권한 — disable-model-invocation / user-invocable

커스텀 명령이 스킬로 통합되면서, 스킬 프런트매터로 "누가 이 스킬을 부를 수 있는가"를 제어할 수 있다. 기본값은 사용자와 Claude 둘 다 호출 가능이지만, disable-model-invocation을 true로 두면 오직 사용자가 /이름으로만 부를 수 있고 Claude가 자동으로 실행하지 못한다. 배포·커밋·슬랙 전송처럼 부작용이 있거나 타이밍을 직접 잡아야 하는 작업에 쓰면, 코드가 준비돼 보인다고 Claude가 멋대로 배포하는 일을 막는다. 반대로 user-invocable을 false로 두면 / 메뉴에서 숨겨져 Claude만 쓸 수 있어, 명령이 아닌 배경 지식용 스킬(예: 레거시 시스템 설명)에 적합하다.

  • disable-model-invocation: true → 사용자만 /이름으로 호출, Claude 자동 실행 차단(서브에이전트 프리로드도 막음)
  • user-invocable: false → / 메뉴에서 숨김, Claude만 사용(배경 지식용)
  • 둘 다 기본 false/true → 기본은 양쪽 모두 호출 가능 / 부작용 있는 /deploy·/commit에 disable-model-invocation 권장
원본 →
AI 코딩 도구

스킬 effort 프런트매터 — 명령마다 추론 강도 따로 주기

스킬(=통합된 커스텀 슬래시 명령)의 프런트매터에 effort 필드를 두면, 그 스킬이 활성화된 동안만 세션의 추론 강도(effort level)를 덮어쓴다. 값은 low·medium·high·xhigh·max 중 모델이 지원하는 범위에서 고르며, 지정하지 않으면 세션 설정을 그대로 따른다. 가벼운 포맷 정리·로그 한 줄 추가 같은 스킬엔 low를, 아키텍처 설계·보안 점검처럼 깊은 사고가 필요한 스킬엔 high 이상을 박아두면 매번 /model로 바꿀 필요가 없다. 비슷하게 model 필드로 그 스킬이 도는 동안의 모델 자체를 바꿀 수도 있고, 본문에서는 ${CLAUDE_EFFORT}로 현재 강도를 읽어 지시를 분기할 수 있다.

  • effort: low/medium/high/xhigh/max — 스킬 활성 동안만 세션 effort 덮어씀(미지정 시 세션 상속)
  • model 필드와 짝 — 스킬 도는 동안의 모델까지 바꾸고 턴 끝나면 세션 모델 복귀
  • 본문에서 ${CLAUDE_EFFORT}로 현재 강도 읽어 지시 분기 가능(ultracode는 xhigh로 표시)
원본 →
AI 코딩 도구

PreCompact 훅 — 압축 직전, 컨텍스트를 지킬 마지막 기회

PreCompact 훅은 컨텍스트 압축(compaction)이 일어나기 직전에 실행된다. matcher로 무엇이 압축을 일으켰는지 구분할 수 있는데, 사용자가 직접 친 /compact는 manual, 컨텍스트가 차서 자동으로 도는 압축은 auto다. PreCompact는 블로킹 가능한 이벤트라서, 훅이 exit code 2로 끝나거나 JSON으로 decision:"block"을 돌려주면 압축 자체를 막을 수 있다. 그래서 "압축으로 대화 일부가 요약되어 사라지기 전, 중요한 컨텍스트를 파일로 저장하는 마지막 기회"로 쓰는 패턴이 대표적이다. SessionStart 훅과 짝지으면 다음 세션에서 그 컨텍스트를 다시 불러와 이어갈 수 있다.

  • 압축 직전 실행 / matcher로 manual(/compact 수동) vs auto(컨텍스트 참) 구분
  • 블로킹 가능 — exit 2 또는 decision:"block"으로 압축 자체를 막을 수 있음
  • 압축으로 요약돼 사라질 컨텍스트를 미리 저장하는 '마지막 기회' 패턴 (SessionStart와 짝)
원본 →
AI 코딩 도구

훅 핸들러 5종 — 셸·HTTP·MCP 도구·프롬프트·에이전트로 받기

훅 핸들러 type 5종 — command(셸), http(URL POST), mcp_tool(연결된 MCP 서버 도구 직접 호출), prompt(빠른 모델 평가), agent(서브에이전트 평가). v2.1.x에서 mcp_tool은 이미 실행 중인 MCP 연결을 재사용 — 별도 셸 프로세스 spawn 없이 PreToolUse 검증·PostToolUse 집계가 단순해짐. prompt/agent는 $ARGUMENTS에 훅 입력 JSON, model 필드로 평가 모델 지정. /hooks 메뉴는 5종 표시하나 추가·편집은 command·mcp_tool만 — http·prompt·agent는 settings.json 직접 작성.

  • 5종: command / http / mcp_tool / prompt / agent
  • mcp_tool — running MCP server 재사용, shell spawn 불필요
  • /hooks 메뉴는 command·mcp_tool만 편집 — 나머지는 settings.json
원본 →
AI 코딩 도구

스킬 disallowed-tools — 활성 동안 도구를 아예 풀에서 빼기

스킬 프런트매터의 `allowed-tools`와 `disallowed-tools`는 정반대 일을 한다. `allowed-tools`는 스킬이 활성인 동안 적힌 도구를 승인 없이 쓰게 해주지만 제한은 아니다 — 모든 도구는 여전히 호출 가능하고 권한 설정이 그대로 적용된다. 반면 `disallowed-tools`는 적힌 도구를 활성 동안 모델의 가용 풀에서 통째로 제거한다. 공식 문서가 든 예는 배경 루프에서 `AskUserQuestion`을 못 부르게 막는 것 — 사람이 안 보는 자율 스킬에 유용하다. 단, 이 제한은 다음 메시지를 보내면 풀린다. 모든 스킬·프롬프트에 영구 적용하려면 권한 설정의 deny 규칙을 써야 한다.

  • allowed-tools: 승인 없이 쓰게 허용(제한 아님) / disallowed-tools: 풀에서 제거(진짜 제한)
  • 예: 자율 배경 루프에서 AskUserQuestion 차단 — 사람 개입 호출 자체를 막음
  • 제한은 다음 메시지에 해제 / 영구 차단은 권한 설정 deny 규칙
원본 →
AI 코딩 도구

StopFailure 훅 — API 에러로 턴이 끝날 때만 잡아내기

Stop 훅은 Claude가 정상적으로 턴을 마칠 때 돌지만, API 에러로 턴이 죽으면 안 돈다. 그 빈틈을 메우는 게 StopFailure 훅이다 — 턴이 API 에러로 끝날 때 발화한다. matcher로 에러 종류를 구분할 수 있어서, rate_limit·overloaded·billing_error·authentication_failed·server_error 등으로 골라 받을 수 있다. 단 이 훅은 출력과 종료 코드가 무시되는 '사이드 이펙트 전용' 이벤트라 턴을 막거나 흐름을 바꾸진 못한다. 로깅·알림·정리 용도다.

  • Stop은 정상 종료에만 발화 / StopFailure는 API 에러로 끝날 때 발화
  • matcher로 에러 종류 구분: rate_limit·overloaded·billing_error·server_error 등
  • 출력·종료 코드 무시 — 막기 불가, 로깅·알림·정리 같은 사이드 이펙트 전용
원본 →
AI 코딩 도구

서브에이전트 중첩 — 서브에이전트가 또 서브에이전트를 띄우기

v2.1.172부터 서브에이전트가 자기만의 서브에이전트를 스폰할 수 있다. 위임한 작업이 다시 병렬 하위작업으로 갈라질 때(예: 발견 항목마다 검증 에이전트를 붙이는 리뷰어) 쓴다. 중간 산출물은 메인 대화에 닿지 않고, 최상위 서브에이전트의 요약만 돌아온다. 포그라운드는 부모를 블로킹하며 사슬처럼 이어져 자기제한적이라 깊이 제한이 없지만, 백그라운드는 깊이 5에서 Agent 도구를 못 받아 더 못 띄운다(고정·설정 불가).

  • v2.1.172부터 — 서브에이전트가 중첩 서브에이전트 스폰 가능
  • 포그라운드는 깊이 무제한(블로킹·자기제한), 백그라운드는 깊이 5에서 차단
  • 특정 서브에이전트 차단: tools에서 Agent 빼거나 disallowedTools에 추가
원본 →
AI 코딩 도구

subagentStatusLine — 서브에이전트 행마다 표시 내용 직접 그리기

subagentStatusLine은 프롬프트 아래 에이전트 패널에서 각 서브에이전트 행의 본문을 기본 'name · description · token count' 대신 내 포맷으로 바꾸는 설정이다. settings.json에 type "command"로 스크립트를 등록하면, 새로고침 틱마다 한 번 실행되며 보이는 모든 서브에이전트 행이 stdin에 단일 JSON으로 들어온다. 입력에는 공통 훅 필드 외에 columns(행 너비)와 tasks 배열(각 항목에 id·name·type·status·description·label·startTime·tokenCount·tokenSamples·cwd)이 담긴다. stdout에 행마다 {"id":..., "content":...} 한 줄씩 출력하면 그 행만 덮어쓴다.

  • 서브에이전트 패널 행 본문 커스터마이즈 — 기본은 name·description·token count
  • stdin: columns + tasks 배열(id·status·tokenCount 등), stdout: {"id","content"} 줄 단위
  • id 생략 시 기본 렌더 유지, content 빈 문자열이면 행 숨김 / statusLine과 동일한 trust·disableAllHooks 적용
원본 →
AI 코딩 도구

플러그인 마켓플레이스 — marketplace.json 하나로 팀에 플러그인 배포하기

마켓플레이스는 플러그인을 남에게 나눠주는 카탈로그다. 레포 루트의 `.claude-plugin/marketplace.json`에 name·owner·plugins 세 필드를 채우면 되고, 각 plugin 항목은 최소 name과 source(어디서 가져올지)만 있으면 된다. source는 같은 레포의 상대경로(`./plugins/x`)부터 github·url·git-subdir·npm까지 지원하며, github/url 소스는 ref(브랜치·태그)와 sha(정확한 커밋)로 버전을 고정할 수 있다. 쓰는 쪽은 `/plugin marketplace add owner/repo`로 등록하고 `/plugin install <플러그인>@<마켓플레이스>`로 깔며, `/plugin marketplace update`로 갱신한다.

  • marketplace.json 필수 필드: name(kebab-case) · owner · plugins[] / 각 plugin은 name+source
  • source 종류: 상대경로(./) · github · url · git-subdir · npm — github/url은 ref·sha로 핀 고정
  • 버전 미설정 시 git 커밋 SHA가 버전 — 핀 걸린 plugin.json version은 바꿔야 업데이트 전파
원본 →
AI 코딩 도구

MessageDisplay 훅 — 화면에 보이는 답변 텍스트만 바꿔치기

MessageDisplay는 어시스턴트 메시지 텍스트가 화면에 출력되는 동안 도는 표시 전용(display-only) 훅이다. hookSpecificOutput.displayContent로 문자열을 돌려주면 화면에 보이는 텍스트가 그것으로 교체된다. 단 트랜스크립트와 Claude가 보는 내용은 원본 그대로 유지돼, 모델의 판단에는 영향을 주지 않고 사람 눈에 보이는 것만 손댄다. matcher를 지원하지 않아 매번 발생하고, 기본 타임아웃이 10초로 낮게 잡혀 있으며, 블로킹은 불가(exit 2면 원본이 그대로 표시).

  • displayContent로 화면 출력 텍스트만 교체 — 트랜스크립트·모델 시야는 원본 유지
  • matcher 미지원, 항상 발생 / 기본 타임아웃 10초로 낮음
  • 블로킹 불가 — exit code 2여도 원본 텍스트가 그대로 표시됨
원본 →
AI 코딩 도구

--exclude-dynamic-system-prompt-sections — 프롬프트 캐시 재사용률 높이기

이 플래그는 머신마다 달라지는 시스템 프롬프트 조각(작업 디렉터리, 환경 정보, 메모리 경로, git 레포 여부)을 시스템 프롬프트에서 빼서 첫 번째 사용자 메시지로 옮긴다. 시스템 프롬프트가 사용자·머신에 상관없이 동일해지므로, 같은 작업을 여러 사람·여러 머신이 돌릴 때 프롬프트 캐시가 더 잘 재사용된다. 기본 시스템 프롬프트에서만 동작하고 `--system-prompt`/`--system-prompt-file`를 쓰면 무시되며, `-p`(print) 스크립트의 다중 사용자 워크로드에 쓰라고 안내된다.

  • 머신별 조각(cwd·환경·메모리경로·git여부)을 시스템 프롬프트 → 첫 사용자 메시지로 이동
  • 시스템 프롬프트가 동일해져 사용자·머신 간 프롬프트 캐시 히트율 상승
  • 기본 프롬프트에서만 작동(--system-prompt류 쓰면 무시) / -p 다중사용자 스크립트용
원본 →
AI 코딩 도구

Setup 훅 — 세션 시작 전 init·maintenance 준비 작업 자동 실행

Setup은 세션이 시작되기 '전'에 도는 훅 이벤트로, CLI 플래그로 트리거된다. `claude -p --init`은 matcher가 `init`인 Setup 훅을, `claude -p --maintenance`는 matcher가 `maintenance`인 Setup 훅을 세션 시작 전에 실행한다(둘 다 print 모드 전용). `claude --init-only`는 Setup과 SessionStart 훅만 돌리고 대화는 시작하지 않은 채 종료하므로, 의존성 설치·캐시 워밍 같은 준비 작업을 CI에서 한 번만 돌리기 좋다.

  • Setup은 세션 시작 전 실행되는 훅 이벤트 / 입력 JSON에 hook_event_name:"Setup", trigger 포함
  • --init → matcher 'init', --maintenance → matcher 'maintenance' (둘 다 -p print 모드 전용)
  • --init-only는 Setup+SessionStart만 돌리고 대화 없이 종료 — CI 준비 단계용
원본 →
AI 코딩 도구

skillOverrides — SKILL.md 안 건드리고 settings에서 스킬 노출 조정하기

skillOverrides는 settings.json에서 스킬 이름별로 노출 방식을 덮어쓰는 설정이다. 각 스킬에 "on", "name-only", "user-invocable-only", "off" 네 값 중 하나를 줄 수 있어서, SKILL.md의 프런트매터를 고치지 않고도 특정 스킬을 완전히 끄거나(off), 이름만 보이게 하거나(name-only), 사용자가 직접 호출할 때만 쓰게(user-invocable-only) 제한할 수 있다. 팀이 받은 플러그인 스킬이 너무 많아 모델이 엉뚱한 걸 자동으로 부를 때, 원본을 수정하지 않고 프로젝트 설정만으로 정리하기 좋다.

  • 스킬 이름별 노출 오버라이드 — 값은 on / name-only / user-invocable-only / off 네 가지
  • SKILL.md 프런트매터 수정 없이 settings.json만으로 스킬 가시성 조정
  • off=완전 숨김, name-only=이름만, user-invocable-only=수동 호출만 / 단 매니지드 스킬은 예외
원본 →
AI 코딩 도구

claudeMdExcludes — 특정 CLAUDE.md를 메모리 로딩에서 빼기

claudeMdExcludes는 settings.json에서 메모리 로딩 시 건너뛸 CLAUDE.md 파일을 글롭 패턴이나 절대경로로 지정하는 설정이다. 패턴은 파일의 절대경로에 매칭되며, 예컨대 ["**/vendor/**/CLAUDE.md"]처럼 적으면 의존성 디렉터리에 딸려 온 CLAUDE.md가 컨텍스트에 안 실린다. 유저·프로젝트·로컬 메모리에만 적용되고, 매니지드 정책 파일은 제외할 수 없다. 서브모듈이나 vendor 트리에 박힌 남의 CLAUDE.md가 컨텍스트 창을 잡아먹을 때, 원본을 지우지 않고 프로젝트 설정만으로 솎아내기 좋다.

  • 메모리 로딩에서 건너뛸 CLAUDE.md를 글롭/절대경로로 지정 — 패턴은 절대경로에 매칭
  • 유저·프로젝트·로컬 메모리에만 적용 / 매니지드 정책 파일은 제외 불가
  • 예: ["**/vendor/**/CLAUDE.md"] — vendor 트리의 CLAUDE.md를 컨텍스트에서 빼기
원본 →
AI 코딩 도구

Playwright CLI + MCP — Microsoft의 코딩·LLM 에이전트용 브라우저 제어 2종(접근성 트리·토큰 효율)

Playwright가 테스트 프레임워크를 넘어 에이전트 전용 브라우저 인터페이스 2종을 공식 출시했다. Playwright MCP는 LLM 에이전트용 — 접근성 트리 스냅샷으로 픽셀·비전 모델 없이 클릭·입력·탭·네트워크·콘솔 확인(Apache-2.0·34k★). Playwright CLI는 Claude Code·Copilot 같은 코딩 에이전트용 — MCP 대비 토큰 효율적(대형 도구 스키마·접근성 트리를 컨텍스트에 안 넣음). MCP와 CLI 두 레이어로 에이전트 유형별 브라우저 자동화를 분리한 설계가 핵심.

  • Playwright MCP = 접근성 트리 스냅샷, 비전 불필요, 클릭·입력·탭·네트워크·콘솔
  • Playwright CLI = 코딩 에이전트용, MCP 대비 토큰 효율적 브라우저 제어
  • 테스트 프레임워크 → 에이전트 인프라로 역할 확장
원본 →
AI 코딩 도구

allowManagedHooksOnly — 조직이 승인한 훅만 돌게 잠그기

allowManagedHooksOnly는 settings.json에서 켜면 매니지드 훅, SDK 훅, 그리고 매니지드 설정의 enabledPlugins로 강제 활성화된 플러그인 훅만 로드하는 설정이다. 유저·프로젝트·로컬에 정의된 일반 훅은 전부 차단된다. 훅은 사용자 권한으로 임의 셸 명령을 실행할 수 있어 보안 위험이 큰데, 이 설정으로 개인이 끼워 넣은 훅을 막고 조직이 검수한 훅만 허용하는 화이트리스트를 만든다. 훅을 통째로 끄는 disableAllHooks와 달리, 승인된 훅은 살려 두면서 비승인 훅만 거른다.

  • 매니지드 훅·SDK 훅·매니지드 enabledPlugins 훅만 로드 / 유저·프로젝트·로컬 훅은 차단
  • 훅은 사용자 권한 셸 실행 — 비승인 훅 차단으로 공급망/내부자 위험 축소
  • disableAllHooks(전부 끄기)와 달리 승인된 훅은 유지하는 화이트리스트 방식
원본 →
AI 코딩 도구

MCP 리소스·프롬프트 — 서버를 @멘션과 슬래시 커맨드로 쓰기

MCP 서버는 도구만이 아니라 '리소스'와 '프롬프트'도 노출하는데, 둘 다 일상 입력에서 바로 끌어 쓸 수 있다. 리소스는 파일처럼 @멘션으로 참조한다 — 프롬프트에 `@`를 치면 연결된 모든 서버의 리소스가 자동완성에 뜨고, `@server:protocol://resource/path` 형식(예: `@github:issue://123`)으로 적으면 해당 내용이 자동으로 가져와져 첨부된다. 한 프롬프트에서 여러 개를 동시에 참조할 수도 있다. 프롬프트는 슬래시 커맨드가 된다 — `/`를 치면 `/mcp__서버명__프롬프트명` 형태로 나타나고, 인자는 그 뒤에 공백으로 구분해 넘긴다. 둘 다 연결된 서버에서 동적으로 발견되므로 별도 설정이 필요 없다.

  • 리소스 = @멘션: `@server:protocol://resource/path` (예: @github:issue://123), 참조 시 자동 fetch·첨부
  • 프롬프트 = 슬래시 커맨드: `/mcp__servername__promptname`, 인자는 뒤에 공백 구분으로 전달
  • 둘 다 연결된 서버에서 동적 발견 — 설정 불필요, 한 프롬프트에 리소스 여러 개 참조 가능
원본 →
AI 코딩 도구

/btw — 대화 흐름 안 깨고 곁다리 질문 던지기

긴 작업 중간에 빠른 질문 하나가 필요한데 본 대화를 어지럽히고 싶지 않을 때 `/btw`를 쓴다. `/btw 그 설정 파일 이름이 뭐였지?`처럼 치면, 현재 대화 전체를 보면서 답하지만 그 질문·답변은 대화 기록에 남지 않고 닫을 수 있는 오버레이로만 뜬다. Claude가 한창 응답 중일 때도 실행 가능하며 메인 턴을 끊지 않고 따로 돈다. 단 곁다리 질문은 도구 접근이 없어 — 파일 읽기·명령 실행·검색을 못 하고 이미 컨텍스트에 있는 것만으로 답한다. 답이 뜨면 `f`로 새 세션으로 포크해 풀 도구 권한으로 이어갈 수 있다. 서브에이전트의 정반대다 — 서브에이전트는 빈 컨텍스트 + 풀 도구, `/btw`는 풀 컨텍스트 + 도구 없음.

  • 본 대화 기록에 안 남는 일회성 곁다리 질문 — 오버레이로만 표시
  • Claude 작업 중에도 실행 가능, 메인 턴 안 끊고 독립 실행 / 도구 접근은 없음(컨텍스트만으로 답)
  • `f`로 새 세션 포크해 풀 도구로 이어가기 — 프롬프트 캐시 재사용해 비용 낮음
원본 →
AI 코딩 도구

claude -p --bare — CI에서 매번 같은 결과 나오게 잠그기

`claude -p`(헤드리스)는 기본적으로 대화형 세션과 똑같은 컨텍스트를 읽는다 — 작업 디렉터리나 `~/.claude`의 훅·스킬·플러그인·MCP 서버·자동 메모리·CLAUDE.md를 전부 자동 발견한다. 문제는 CI에서다. 동료의 `~/.claude` 훅이나 프로젝트 `.mcp.json`이 끼면 머신마다 결과가 달라진다. `--bare`를 붙이면 이 자동 발견을 통째로 건너뛰어, 명시적으로 넘긴 플래그만 적용된다. bare 모드에서도 Bash·파일 읽기·편집 도구는 쓸 수 있고, 컨텍스트는 `--append-system-prompt`, `--mcp-config`, `--settings`, `--agents` 같은 플래그로 직접 주입한다. 출력은 `--output-format json`으로 받으면 `result`·`session_id`와 `total_cost_usd`(모델별 비용 분해 포함)가 들어와 스크립트가 결과·지출을 파싱할 수 있다.

  • --bare: 훅·스킬·플러그인·MCP·자동 메모리·CLAUDE.md 자동 발견을 모두 건너뜀 — 머신 무관 재현성
  • bare는 Bash·읽기·편집만 기본 제공, 나머지는 --mcp-config/--settings/--agents/--append-system-prompt로 명시 주입
  • --output-format json → result·session_id·total_cost_usd(모델별 분해)로 결과·비용 추적 / 파이프 stdin은 10MB 상한(v2.1.128)
원본 →
AI 코딩 도구

/usage — 플랜 한도가 스킬·서브에이전트·플러그인·MCP 중 어디로 새는지 % 분해

`/cost`가 이번 세션의 달러·소요 시간(API 시간·실제 경과 시간) 요약을 보여준다면, `/usage`는 다른 일을 한다. Pro·Max·Team·Enterprise 플랜에서 `/usage`는 최근 사용량이 내 플랜 한도에 얼마나 잡아먹었는지를 보여주는데, 핵심은 그 사용량을 스킬·서브에이전트·플러그인·개별 MCP 서버별로 전체 대비 퍼센트로 쪼개 준다는 점이다. 즉 "한도가 빨리 차는 범인"이 어떤 스킬이나 어떤 MCP 서버인지 눈으로 짚어낼 수 있다. 화면에서 `d`/`w` 키로 최근 24시간과 7일을 전환할 수 있고, 다른 기기나 claude.ai에서 쓴 사용량은 포함되지 않는다. 이 기능은 Claude Code v2.1.174 이상에서 동작한다.

  • /usage = 플랜 한도 기준 사용량을 스킬·서브에이전트·플러그인·MCP 서버별 % 로 분해 (≠ /cost의 달러·시간 요약)
  • d/w 키로 최근 24시간 ↔ 7일 전환 / 다른 기기·claude.ai 사용량은 미포함
  • Pro·Max·Team·Enterprise 플랜, Claude Code v2.1.174 이상 필요
원본 →
AI 코딩 도구

오토 메모리 — Claude가 스스로 적는 MEMORY.md로 세션 넘어 학습하기

Claude Code 메모리는 두 갈래다. CLAUDE.md는 내가 직접 쓰는 규칙이고, 오토 메모리(auto memory)는 Claude가 내 교정·선호를 보고 스스로 적어 두는 메모다. 빌드 명령, 디버깅에서 알아낸 점, 코드 스타일 선호 같은 걸 "다음 대화에서 쓸모 있겠다" 싶을 때만 저장한다(매 세션 저장하는 게 아님). 저장 위치는 `~/.claude/projects//memory/`이고, 인덱스 격인 `MEMORY.md`와 주제별 파일들로 나뉜다. 세션 시작 때는 `MEMORY.md`의 앞 200줄(또는 25KB)만 불러오고 나머지 주제 파일은 필요할 때 그때그때 읽는다. 전부 평범한 마크다운이라 `/memory`로 열어 직접 보고 고치거나 지울 수 있다.

  • CLAUDE.md(내가 씀) vs 오토 메모리(Claude가 씀) — 후자는 기본 on, 끄려면 autoMemoryEnabled:false 또는 CLAUDE_CODE_DISABLE_AUTO_MEMORY=1
  • 저장: ~/.claude/projects//memory/ (git 레포 기준이라 워크트리·하위폴더가 한 디렉터리 공유, 머신 로컬)
  • 세션엔 MEMORY.md 앞 200줄/25KB만 로드 — 주제 파일은 온디맨드 / Claude Code v2.1.59 이상 필요
원본 →
AI 코딩 도구

내장 ide MCP 서버 — 외부 터미널 CLI를 /ide로 VS Code에 붙이기

VS Code 확장이 켜져 있으면 로컬 MCP 서버 하나(이름 `ide`)가 돌고, CLI가 여기에 자동으로 붙는다. 이 연결 덕에 CLI가 만든 diff가 VS Code 네이티브 diff 뷰어로 열리고, 지금 에디터에서 선택한 텍스트와 열린 파일 경로가 매 프롬프트에 컨텍스트로 따라붙는다(트랜스크립트에 `⧉ Selected N lines from ` 표시). 통합 터미널에서 `claude`를 돌리면 IDE 연동이 자동이지만, 외부 터미널을 쓸 땐 Claude 안에서 `/ide`를 실행해 VS Code에 연결한다. `ide` 서버는 설정할 게 없어 `/mcp` 목록에선 숨겨지고, `127.0.0.1` 랜덤 포트에 바인딩되며 활성화 때마다 새 토큰을 발급한다. 모델에 노출되는 도구는 둘뿐 — 진단을 읽는 `mcp__ide__getDiagnostics`와 주피터 셀을 실행하는 `mcp__ide__executeCode`(실행 전 항상 확인 받음).

  • 확장 활성 시 로컬 MCP 서버 `ide` 가동 — CLI 자동 연결 / diff는 VS Code 네이티브 뷰어로 열림
  • 외부 터미널이면 Claude 안에서 `/ide` 실행해 연결 / 선택 텍스트·열린 파일이 프롬프트 컨텍스트로 첨부 (.env 등은 Read deny 규칙으로 제외)
  • 모델 노출 도구는 2개뿐: getDiagnostics(읽기), executeCode(주피터, 실행 전 Quick Pick 확인) / 127.0.0.1 랜덤 포트+세션별 토큰
원본 →
AI 코딩 도구

동적 컨텍스트 주입 — 슬래시 커맨드에 셸 출력·인자를 미리 끼워 넣기

커스텀 슬래시 커맨드(스킬)의 본문에 `!`명령`` 형태를 쓰면, Claude가 그 내용을 보기 전에 Claude Code가 먼저 그 셸 명령을 실행하고 출력으로 자리표시자를 갈아끼운다. 즉 모델은 명령어가 아니라 이미 실행된 '실제 데이터'를 받는다 — 예를 들어 `- PR diff: !`gh pr diff``라고 적으면 진짜 diff가 프롬프트에 인라인된 채로 도착한다. 인자도 같은 식으로 미리 박힌다: `$ARGUMENTS`는 넘긴 인자 전체로, `$1`·`$2`는 셸식 따옴표 규칙대로 쪼갠 위치 인자로 치환된다(`\$1`로 리터럴 `$` 이스케이프 가능). 치환은 원본 파일에 딱 한 번만 돌아서, 명령 출력 안의 자리표시자는 다시 펼쳐지지 않는다. 또 인라인 `!`는 줄 맨 앞이나 공백 바로 뒤에 있을 때만 인식되고, 여러 줄 명령은 ` ```! ` 펜스 블록으로 감싼다.

  • `!`명령``: Claude가 보기 전 셸 실행 → 출력으로 치환 / 모델은 명령이 아닌 실제 데이터를 받음 (예: !`gh pr diff`)
  • 인자 치환: $ARGUMENTS=인자 전체, $1·$2=따옴표 규칙대로 쪼갠 위치 인자 / \$1로 리터럴 $ 이스케이프
  • 치환은 원본에 1회만 — 출력 속 자리표시자는 재확장 안 됨 / 인라인 !는 줄 앞·공백 뒤만 인식, 여러 줄은 ```! 블록
원본 →
AI 코딩 도구

이미지로 대화하기 — 스크린샷·목업·다이어그램을 컨텍스트로 넣기

Claude Code는 터미널 CLI지만 이미지를 컨텍스트로 받는다. 넣는 방법은 셋 — 창에 드래그 앤 드롭, `ctrl+v`로 붙여넣기(맥에서도 `cmd+v`가 아니라 `ctrl+v`다), 또는 경로를 직접 주기("이 이미지 분석해줘: /path/to/image.png"). 에러 스크린샷을 던지며 "이거 왜 나는 거야?"라고 묻거나, 디자인 목업을 주고 "이걸 만드는 CSS 짜줘", DB 스키마 다이어그램을 주고 "새 기능에 맞게 어떻게 고칠까?"처럼 텍스트로 설명하기 번거로운 맥락을 그림 하나로 전달할 수 있다. 한 대화에서 이미지 여러 개를 다룰 수 있고, Claude가 답에서 `[Image #1]`처럼 가리키면 그 링크를 맥에서 `Cmd+Click`(윈도·리눅스는 `Ctrl+Click`)해 기본 뷰어로 연다.

  • 넣는 법 3가지: 드래그 앤 드롭 / ctrl+v 붙여넣기(맥도 cmd+v 아님) / 경로 직접 전달
  • 용도: 에러 스크린샷·UI 목업·다이어그램·스키마 — 텍스트로 설명하기 번거로운 맥락을 그림으로 / 목업→CSS·HTML 생성도 가능
  • 한 대화에 이미지 여러 개 / 답의 `[Image #1]` 링크는 Cmd+Click(맥)·Ctrl+Click(윈·리눅스)으로 뷰어에서 열기
원본 →
AI 코딩 도구

/branch — 대화를 통째로 복제해 다른 접근을 따로 시도하기

세션 중 다른 방법을 실험하고 싶지만 지금까지의 대화 흐름은 잃고 싶지 않을 때 `/branch`를 쓴다. `/branch try-streaming-approach`처럼 치면 그 시점까지의 대화를 복제한 새 가지로 옮겨 가고, 원본 세션은 그대로 남아 세션 피커에 보존된다. CLI에서는 `claude --continue --fork-session`처럼 `--fork-session`을 붙여 같은 효과를 낸다. `/branch` 확정 시 새 가지와 원본 두 개의 세션 ID가 찍히며, 원본으로 돌아가려면 그 ID나 이름을 `/resume`에 넘긴다. 단 "이 세션 동안 허용"으로 승인한 권한은 새 가지로 넘어가지 않는다. 한편 포크 없이 두 터미널에서 같은 세션을 동시에 이어가면 양쪽 메시지가 한 트랜스크립트에 뒤섞이니 주의. 코드까지 되감는 건 별개의 체크포인트/rewind 기능이다 — `/branch`는 대화 트리를 가르는 쪽이다.

  • `/branch [이름]`: 그 시점까지 대화를 복제한 새 가지로 이동, 원본은 피커에 그대로 / CLI는 --fork-session
  • 포크·rewind·--fork-session으로 만든 가지는 세션 피커에서 root 세션 아래 묶여 표시(→로 펼침)
  • '이 세션 허용' 권한은 새 가지로 미승계 / 포크 없이 두 터미널에서 같은 세션 이어가면 트랜스크립트 뒤섞임
원본 →
AI 코딩 도구

셸 모드 — 프롬프트 앞에 `!`로 명령 실행하고 출력까지 컨텍스트에 넣기

입력 프롬프트 맨 앞에 `!`를 치면 셸 모드로 들어간다. 여기서 친 명령은 Claude가 해석하거나 승인 절차를 거치지 않고 바로 실행되며, 실행한 명령과 그 출력이 둘 다 대화 컨텍스트에 추가된다. 즉 `!npm test` 한 줄이면 결과가 모델 눈앞에 그대로 쌓여, 이어서 "이 실패 고쳐줘"처럼 바로 물어볼 수 있다. 실행 중에는 실시간 진행 출력이 보이고, 오래 걸리는 명령은 `Ctrl+B`로 백그라운드로 돌릴 수 있다. 입력 중 `Tab`을 누르면 과거 명령 기반 자동완성이 뜨고, 셸 모드는 `Escape`·`Backspace`·`Ctrl+U`로 빠져나온다.

  • 프롬프트 맨 앞 `!` → 셸 모드 / 명령은 Claude 해석·승인 없이 즉시 실행, 명령과 출력이 모두 컨텍스트에 추가
  • 실시간 진행 출력 표시 / 긴 명령은 Ctrl+B로 백그라운드 전환, Tab은 과거 명령 기반 자동완성
  • Escape·Backspace·Ctrl+U로 셸 모드 종료 / 슬래시 커맨드 파일의 `!`명령``(미리 실행해 치환)과는 별개
원본 →
AI 코딩 도구

MCP 설치 스코프 — local·project·user 셋 중 어디에 서버를 둘지

MCP 서버는 세 스코프 중 하나로 설치하고, 스코프가 '어느 프로젝트에서 뜨는지'와 '팀과 공유되는지'를 결정한다. 기본값인 local은 추가한 그 프로젝트에서만 뜨고 내게만 보이며 `~/.claude.json`에 저장돼 버전 관리에 안 올라간다 — 개인용·실험용·자격증명 든 서버에 쓴다. project는 프로젝트 루트의 `.mcp.json`에 저장돼 버전 관리로 팀 전체가 같은 도구를 공유하고, user는 `~/.claude.json`에 저장돼 내 모든 프로젝트에서 뜬다. `claude mcp add --transport http <이름> --scope project ` 식으로 스코프를 지정한다. 보안상 `.mcp.json`의 project 스코프 서버는 쓰기 전에 승인을 받고, 승인 선택을 초기화하려면 `claude mcp reset-project-choices`를 쓴다.

  • local(기본·`~/.claude.json`·그 프로젝트만·비공유) / project(`.mcp.json`·버전관리로 팀 공유) / user(`~/.claude.json`·내 모든 프로젝트)
  • 지정: `claude mcp add --transport http <이름> --scope project ` / local 스코프는 일반 로컬 설정(.claude/settings.local.json)과 다른 ~/.claude.json에 저장
  • project 서버는 보안상 쓰기 전 승인 필요 / `claude mcp reset-project-choices`로 승인 선택 초기화
원본 →
AI 코딩 도구

Claude를 정기 실행하는 4가지 — 어디서 도느냐로 고른다

Claude Code로 PR 리뷰·의존성 점검·CI 실패 확인 같은 일을 주기적으로 돌리는 방법은 네 가지이고, 고르는 기준은 '어디서 도느냐'다. Routines는 Anthropic 관리 인프라에서 돌아 내 컴퓨터가 꺼져 있어도 실행되고, 일정뿐 아니라 API 호출·GitHub 이벤트로도 트리거된다(claude.ai/code/routines에서 설정). Desktop scheduled tasks는 데스크톱 앱이 내 머신에서 돌려서 로컬 파일·커밋 안 된 변경에 직접 접근해야 할 때 쓴다. GitHub Actions는 CI 파이프라인에서 돌아 열린 PR 같은 레포 이벤트나 워크플로 설정 옆에 둘 cron에 맞는다. `/loop`는 지금 열려 있는 CLI 세션 안에서 가볍게 폴링하는 용도로, 새 대화를 시작하면 멈추지만 만료 전이면 `--resume`/`--continue`로 되살아난다.

  • Routines = Anthropic 인프라(컴퓨터 꺼져도 실행) / 일정·API 호출·GitHub 이벤트 트리거 — claude.ai/code/routines
  • Desktop scheduled tasks = 데스크톱 앱·내 머신(로컬 파일·미커밋 변경 접근) / GitHub Actions = CI 파이프라인(레포 이벤트·cron)
  • `/loop` = 현재 CLI 세션 폴링 / 새 대화 시작 시 중단, 만료 전이면 --resume·--continue로 복원 / 자동 실행 프롬프트엔 성공 기준·결과 처리를 명시
원본 →
AI 코딩 도구

커스텀 커맨드 인자 — $ARGUMENTS 한 덩어리 vs 위치 인자로 쪼개 받기

커스텀 슬래시 커맨드(이제 스킬과 통합)는 호출할 때 넘긴 인자를 본문에 끼워 넣을 수 있다. `$ARGUMENTS`는 입력 전체를 타이핑한 그대로 한 덩어리로 받는다 — 본문에 `$ARGUMENTS`가 없으면 끝에 `ARGUMENTS: <값>`이 자동으로 붙는다. 여러 인자를 따로 받고 싶으면 `$ARGUMENTS[N]` 또는 짧게 `$N`을 쓰는데, 인덱스는 0부터다 — `$0`이 첫 번째, `$1`이 두 번째다(셸의 $1과 헷갈리기 쉬움). 인덱스 인자는 셸식 따옴표 규칙을 따라서 여러 단어를 한 인자로 넘기려면 `"hello world"`처럼 감싸야 하고, 산문 속 `\$1.00` 같은 리터럴 $는 백슬래시로 이스케이프한다.

  • `$ARGUMENTS` = 입력 전체 한 덩어리(타이핑 그대로) / 본문에 없으면 끝에 `ARGUMENTS: <값>` 자동 추가
  • `$ARGUMENTS[N]`·`$N` = 위치별 인자, 인덱스 0부터 — `$0`=첫째, `$1`=둘째(셸 $1과 다름) / 프런트매터 `arguments`로 이름 붙은 위치 인자도 선언 가능
  • 여러 단어 한 인자는 `"..."`로 감싸기 / 산문의 리터럴 `$`는 `\$1.00`처럼 백슬래시로 이스케이프
원본 →
AI 코딩 도구

커스텀 서브에이전트 만들기 — 자주 쓰는 일꾼을 파일로 굳히기

같은 지시를 가진 일꾼을 매번 새로 띄우게 된다면, 그걸 커스텀 서브에이전트로 파일에 굳힌다. 서브에이전트는 YAML 프런트매터 + 본문(시스템 프롬프트)으로 된 마크다운 파일이고, `name`과 `description` 둘만 필수다. `tools`(허용 도구 allowlist)·`disallowedTools`(차단 denylist)·`model`로 권한과 모델을 좁히는데, model에 `inherit`을 주면 메인 대화와 같은 모델을 쓴다. Claude는 작업이 들어오면 각 서브에이전트의 `description`을 보고 위임할지 판단하므로, description은 페르소나가 아니라 '언제 이걸 쓰는지'를 또렷이 적어야 한다. 저장 위치는 프로젝트용 `.claude/agents/`(버전 관리로 팀 공유)와 개인용 `~/.claude/agents/`(내 모든 프로젝트)가 있고, `/agents` 명령으로 가이드 따라 만들고 관리한다.

  • 마크다운 + YAML 프런트매터, 필수는 `name`·`description`뿐 / 본문이 시스템 프롬프트 / `/agents`로 생성·편집·삭제
  • 도구 좁히기: `tools`(allowlist) 또는 `disallowedTools`(denylist) / `model: inherit`로 메인 대화 모델 따라가기
  • 위치·우선순위: managed(1·조직) > --agents 플래그(2·세션) > `.claude/agents/`(3·프로젝트, 팀 공유) > `~/.claude/agents/`(4·내 전체) > 플러그인(5)
원본 →
AI 코딩 도구

@로 파일·디렉터리 참조 — Claude가 읽기를 기다리지 않고 내용을 미리 넣기

프롬프트에 `@`를 쓰면 Claude가 Read 도구로 파일을 찾아 읽기를 기다리지 않고, 그 자리에 내용을 바로 끼워 넣을 수 있다. `@src/utils/auth.js`처럼 파일을 가리키면 그 파일 전체 내용이 대화에 포함되고, `@src/components`처럼 디렉터리를 가리키면 내용이 아니라 그 안의 파일 목록(파일 정보 포함)이 들어온다. 중요한 부가 효과 하나 — `@`로 파일을 참조하면 그 파일이 있는 디렉터리와 상위 디렉터리들의 `CLAUDE.md`도 함께 컨텍스트에 딸려 붙는다(그 하위트리 규칙을 자동으로 끌어옴). 경로는 상대·절대 둘 다 되고, 한 메시지에서 여러 개를 동시에 참조할 수 있다(예: "@file1.js and @file2.js"). 같은 `@` 문법으로 연결된 MCP 서버의 리소스(`@server:resource`)도 끌어올 수 있다.

  • `@파일경로` = 파일 전체 내용을 그 자리에 인라인(Read 기다릴 필요 없음) / `@디렉터리` = 내용 아닌 파일 목록(파일 정보 포함)
  • 부가 효과: `@`로 파일 참조 시 그 파일 디렉터리+상위 디렉터리의 CLAUDE.md도 함께 컨텍스트에 추가
  • 상대·절대 경로 모두 가능 / 한 메시지에 여러 개(`@file1.js and @file2.js`) / `@server:resource`로 MCP 리소스도 동일 문법으로 참조
원본 →
AI 코딩 도구

원격 MCP 서버 인증 — /mcp로 OAuth 2.0 로그인하기

Sentry·Notion 같은 클라우드 MCP 서버는 대개 인증을 요구하는데, Claude Code는 OAuth 2.0을 지원한다. `claude mcp add --transport http <이름> `로 서버를 붙인 뒤 Claude 안에서 `/mcp`를 실행하면 브라우저가 열려 로그인 흐름이 진행된다. 서버가 `401 Unauthorized`나 `403 Forbidden`을 돌려주면 Claude Code가 그 서버를 '인증 필요'로 표시하고 `/mcp`에서 OAuth 흐름을 밟게 해준다. 발급된 토큰은 안전하게 저장되고 자동으로 갱신되며, 접근을 끊으려면 `/mcp` 메뉴의 "Clear authentication"을 쓴다. 브라우저 리다이렉트가 연결 오류로 실패하면 주소창의 콜백 URL 전체를 Claude의 URL 프롬프트에 붙여 넣으면 된다.

  • 흐름: `claude mcp add --transport http <이름> ` → Claude 안에서 `/mcp` 실행 → 브라우저 로그인 / 401·403 응답 시 자동으로 '인증 필요' 표시
  • 토큰은 안전 저장·자동 갱신 / 접근 해제는 `/mcp` 메뉴의 "Clear authentication" / OAuth는 HTTP 서버에서 동작
  • 사전 등록 리다이렉트 URI가 필요하면 `--callback-port`로 포트 고정(`http://localhost:PORT/callback`) / DCR 미지원 서버는 `--client-id`·`--client-secret`로 자격증명 직접 제공
원본 →
AI 코딩 도구

claude --from-pr — PR에 묶인 그 작업 세션으로 곧장 되돌아가기

`gh pr create`로 PR을 만들면 그때 돌던 세션이 그 PR에 자동으로 연결된다. 나중에 그 PR 작업을 이어가려면 `claude --from-pr <번호>`로 곧장 연결된 세션을 되살리거나, PR URL을 `/resume` 피커 검색창에 붙여 넣어 찾는다. 피커는 GitHub·GitHub Enterprise·GitLab·Bitbucket의 pull/merge request URL을 받아 그에 연결된 세션을 짚어 준다. 디렉터리 단위로 흩어진 여러 세션 중 "어느 게 이 PR 작업이었지?"를 헤매지 않고, PR 하나를 키로 삼아 대화·컨텍스트를 그대로 복원하는 워크플로다.

  • `gh pr create`로 PR 생성 시 그 세션이 PR에 자동 연결 — 별도 설정 불필요
  • 복원: `claude --from-pr <번호>` 또는 `/resume` 피커 검색창에 PR URL 붙여넣기
  • 피커는 GitHub·GitHub Enterprise·GitLab·Bitbucket의 PR/MR URL을 받아 연결 세션을 찾아줌
원본 →
AI 코딩 도구

--json-schema — claude -p 출력을 스키마에 맞춰 받아 스크립트로 바로 파싱

`claude -p`를 스크립트에서 쓸 때 자유 텍스트 답을 정규식으로 긁는 대신, 출력 형태를 JSON 스키마로 못박을 수 있다. `--output-format json`에 `--json-schema ''`를 같이 주면, Claude의 구조화된 결과가 응답의 `structured_output` 필드에 그 스키마 형태로 담겨 온다(`result`엔 텍스트, 그 외 session ID·usage 같은 메타데이터도 함께). 예컨대 `{"type":"object","properties":{"functions":{"type":"array","items":{"type":"string"}}},"required":["functions"]}` 스키마를 주고 "auth.py의 함수 이름 뽑아줘"라고 하면, 함수명 배열이 구조화돼 돌아온다. 받은 다음엔 `jq '.structured_output'`로 그 필드만 꺼내 후속 처리에 넘기면 된다. CI·배치 파이프라인에서 LLM 출력을 안정적으로 소비하기 좋은 방식이다.

  • `--output-format json` + `--json-schema '<스키마>'` → 결과가 응답의 `structured_output` 필드에 스키마 형태로 담김
  • 응답엔 텍스트(`result`)·session ID·usage 등 메타데이터도 함께 / `jq '.structured_output'`로 해당 필드만 추출
  • 자유 텍스트 파싱(정규식) 대신 형태를 못박아 CI·배치에서 LLM 출력을 안정적으로 소비
원본 →
AI 코딩 도구

멀티에이전트 오케스트레이션 — 리드 에이전트가 서브에이전트에게 일을 쪼개 맡기는 패턴

Anthropic 엔지니어링 블로그가 자사 리서치 기능을 만들며 정리한 '오케스트레이터-워커' 패턴이다. 리드 에이전트(LeadResearcher)가 계획을 세워 메모리에 저장하고, 전문 서브에이전트들을 병렬로 띄워 각자 조사하게 한 뒤 결과를 종합하고, 마지막에 CitationAgent가 출처를 붙여 답을 돌려준다. 내부 평가에서 이 멀티에이전트 구성(리드=Opus 4, 서브=Sonnet 4)이 단일 Opus 4 대비 90.2% 더 나은 성능을 냈고, BrowseComp 분석에선 '토큰 사용량 하나만으로 성능 분산의 80%가 설명'됐다 — 다만 채팅 대비 토큰을 약 15배 더 먹는다. 그래서 만능이 아니라, 병렬화가 잘 되고 단일 컨텍스트를 넘는 정보를 다루며 과제 가치가 높을 때만 값을 한다 — 공유 컨텍스트나 에이전트 간 의존이 많은 일(대부분의 코딩 포함)엔 오히려 안 맞는다고 명시한다.

  • 구조: 리드가 계획→서브에이전트 병렬 스폰→종합→CitationAgent 출처 부여 / 성능 +90.2%(단일 Opus 4 대비, 내부 평가)
  • 비용·변수: 채팅 대비 토큰 약 15배 / '토큰량만으로 성능 분산의 80% 설명', 토큰+도구호출+모델로 95% 설명
  • 위임의 핵심: 각 서브에이전트에 목표·출력형식·도구안내·작업경계를 줘야 중복 안 함 / 난이도별 에이전트 수 규칙(단순=1, 비교=2~4, 복잡=10+)
  • 안 맞는 경우: 공유 컨텍스트·에이전트 간 의존이 많은 일 — 코딩 대부분은 병렬화 가능한 부분이 적어 부적합
원본 →
AI 코딩 도구

작성과 리뷰를 분리하라 — 짠 세션 말고 새 세션이 검토해야 하는 이유

Anthropic의 Claude Code 베스트 프랙티스는 '코드를 짠 맥락'과 '그 코드를 리뷰하는 맥락'을 일부러 나누라고 권한다. 이유는 편향이다 — 방금 자기가 작성한 코드를 같은 세션이 다시 보면 "맞게 짰다"는 가정에 끌려 결함을 놓치기 쉽다. 그래서 리뷰는 깨끗한 컨텍스트의 별도 서브에이전트에게 맡긴다. 리뷰어는 추론 과정이 아니라 '결과 diff와 합격 기준'만 보고 판정하므로, 작성자가 못 본 문제를 독립적으로 잡아낸다. 실전에서는 구현 후 "이 변경을 서브에이전트로 리뷰해줘"처럼 별도 패스를 돌리거나, 번들된 `/code-review` 스킬로 현재 diff를 새 서브에이전트가 검토하게 한다 — 무인 실행이 길어질수록 이 독립 검증이 중요해진다.

  • 원리: 같은 세션은 자기가 쓴 코드에 편향 → 리뷰는 깨끗한 컨텍스트의 별도 서브에이전트로 분리(작성≠검증)
  • 리뷰어는 추론 말고 '결과 diff + 합격 기준'만 본다 — 그래서 작성자가 놓친 결함을 독립적으로 잡음
  • 실전: `/code-review` 스킬(새 서브에이전트가 현재 diff 검토) 또는 'PLAN.md 대비 리뷰' 프롬프트 직접 작성 / 무인 실행일수록 필수
원본 →
AI 코딩 도구

Cursor Composer + Claude Code 듀얼 스택 — 도구를 고르지 말고 일로 나눠라

2026년 실무에서 굳어진 패턴은 'Cursor냐 Claude Code냐'가 아니라 둘을 작업 유형으로 라우팅하는 것이다. 두 도구가 스택의 다른 층에 있기 때문이다 — Cursor는 IDE 중심(에디터 안에서 자체 모델 Composer로 빠른 초안·스캐폴딩·리팩터), Claude Code는 터미널/CLI 중심(멀티레포 오케스트레이션, 서브에이전트, CI 자동화, git에 남는 워크플로 산출물). Cursor는 GPT·Claude·Composer를 작업마다 갈아끼우는 '모델 유연성'을, Claude Code는 단일 최상위 모델에 에이전트 루프를 최적화한 '깊이'를 준다. 이미 CLAUDE.md·스킬·훅으로 레포에 워크플로를 박아뒀다면 전면 이전 비용이 가장 크다 — 그래서 한쪽으로 갈아타기보다 둘을 함께 쓰는 쪽이 자주 이긴다.

  • 라우팅: 에디터 안 빠른 초안·스캐폴딩·리팩터 → Cursor / 멀티레포·서브에이전트·CI·git 산출물 → Claude Code
  • 성격 차이: Cursor는 모델 갈아끼우는 유연성(GPT·Claude·Composer), Claude Code는 단일 모델 깊이(긴 호흡 에이전트 작업)
  • Composer 2.5 = 2026-05-18 출시, Kimi K2.5 베이스 / CLAUDE.md·스킬·훅 투자분이 있으면 전면 이전 비용이 커 듀얼 스택이 유리
원본 →
AI 코딩 도구

Agent SDK 별도 크레딧 — 2026-06-15부터 claude -p·자동화는 구독 한도와 분리

2026년 6월 15일부터 Anthropic은 '대화형'과 '프로그래밍 방식' 사용을 분리한다. Claude Agent SDK, `claude -p`(Claude Code 비대화 모드), Claude Code GitHub Actions, 그리고 구독으로 인증하는 서드파티 앱은 이제 구독 사용 한도가 아니라 '월별 Agent SDK 크레딧'에서 차감된다 — Pro $20, Max 5x $100, Max 20x $200(전액 API 요금 기준). 반대로 터미널·IDE에서 직접 타이핑하는 '대화형 Claude Code'는 종전대로 구독 한도를 그대로 쓰며 영향이 없고, API 키로 인증하면 크레딧 없이 기존 종량제가 유지된다. 크레딧이 소진되면 '사용 크레딧(usage credits)'을 켜둔 경우에만 API 요금으로 계속 돌고, 안 켰으면 다음 주기까지 요청이 멈춘다.

  • 차감 대상: Agent SDK·`claude -p`·Claude Code GitHub Actions·구독 인증 서드파티 앱 / 월 크레딧 Pro $20·Max 5x $100·Max 20x $200(롤오버 없음, 매월 초기화)
  • 영향 없음: 대화형 Claude Code(터미널·IDE)는 구독 한도 그대로 / API 키 인증은 종량제 유지(크레딧 미지급)
  • 소진 후: '사용 크레딧'을 켰으면 API 요금으로 계속, 안 켰으면 주기 갱신까지 중단 / 크레딧은 1회 신청(opt-in) 후 자동 갱신
  • 주의: 좌석제 Enterprise의 Standard 좌석은 이 크레딧 신청 불가
원본 →
AI 코딩 도구

Firecrawl MCP — 에이전트에 '웹 읽기'를 붙이는 가장 인기 있는 MCP 서버

Firecrawl은 자바스크립트 렌더링·페이지네이션·레이트리밋을 대신 처리하고 웹페이지를 깨끗한 마크다운으로 변환해 주는 웹 스크래핑·검색 API다. 공식 MCP 서버(firecrawl-mcp-server, GitHub 6.6k★)를 붙이면 Claude·Cursor·Windsurf 등 MCP 호환 도구에서 에이전트가 직접 웹을 검색하고 긁어올 수 있다. 설치는 별도 빌드 없이 `npx -y firecrawl-mcp` 한 줄에 `FIRECRAWL_API_KEY`만 환경변수로 넣으면 끝 — Claude Desktop은 `claude_desktop_config.json`에 npx 명령으로 등록한다. 단, MCP 서버를 여럿 붙일수록 도구 정의가 컨텍스트를 잡아먹어(데이터DB·파일시스템과 같이 쓰면 7.5만 토큰대) 에이전트 성능이 떨어진다는 점은 감안해야 한다.

  • 노출 도구: firecrawl_scrape·search·map·crawl·extract와 자율 수집용 firecrawl_agent, 변경 감시용 firecrawl_monitor_* 등
  • 설치: `env FIRECRAWL_API_KEY=fc-... npx -y firecrawl-mcp` 또는 `npm i -g firecrawl-mcp` — Cursor·Claude Desktop은 npx 명령으로 config 등록
  • 주의(주장): MCP 도구 정의 자체가 컨텍스트 오버헤드 — 도구가 많을수록 에이전트가 헷갈린다, 필요한 서버만 켜라
원본 →
AI 코딩 도구

llms.txt — 사이트 문서를 에이전트가 토큰 낭비 없이 읽게 하는 표준

llms.txt는 fast.ai·Answer.AI의 Jeremy Howard가 2024년 9월 3일 제안한 표준으로, 사이트 루트(`/llms.txt`)에 두는 마크다운 파일이다. 사람용 HTML은 내비게이션·CSS·광고가 대부분이라 LLM 컨텍스트 창을 낭비하는데, llms.txt는 핵심 문서로 가는 '큐레이션된 안내문'만 깔끔히 담아 코딩 에이전트(Cursor·Copilot·Claude 등)가 실시간으로 올바른 페이지를 적은 토큰으로 찾게 한다. 형식이 엄격하다: H1 프로젝트명 1개, 인용블록(`>`)으로 한 줄 요약, 그다음 H2 섹션마다 `[제목](URL): 설명` 형태의 링크 목록. `## Optional` 섹션은 컨텍스트가 빠듯할 때 건너뛰어도 되는 링크를 모으는 자리다.

  • 위치·이름 고정: 도메인 루트의 `/llms.txt`, 소문자, 유효한 마크다운(파일명 없는 URL은 `index.html.md`로 마크다운 버전 제공)
  • 구조: H1(프로젝트명) → 인용블록 요약 → H2 섹션별 링크 목록 / `## Optional`은 건너뛰어도 되는 링크
  • 전문(全文)을 한 파일에 담는 `llms-full.txt` 동반 포맷도 있음 — Mintlify·Vercel·Supabase 등 문서 플랫폼이 기본 생성(Anthropic·Cursor 문서도 보유)
원본 →
AI 코딩 도구

Agent Teams — 서브에이전트와 뭐가 다른가: 서로 대화하고 일을 나눠 갖는 팀

Claude Code의 Agent Teams는 여러 Claude 세션을 '팀'으로 묶어 한 세션이 팀 리드가 되어 작업을 배분·종합하는 실험적 기능이다(환경변수 `CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1`로 활성화). 서브에이전트와의 핵심 차이는 '협업'이다. 서브에이전트는 각자 독립 컨텍스트에서 일하고 결과만 리드에게 보고하지만, 팀원들은 서로 직접 메시지를 주고받고 공유 작업 목록(shared task list)을 보며 스스로 조율한다. 그래서 단순히 결과만 필요한 작업엔 서브에이전트가, 토론·상호 반박·조율이 필요한 복잡한 일엔 팀이 적합하다 — 대신 팀원마다 별도 Claude 인스턴스라 토큰 비용이 더 든다. 팀원은 CLAUDE.md·MCP·스킬 같은 프로젝트 컨텍스트는 자동 로드하지만 리드의 대화 기록은 상속하지 않으므로, 스폰 프롬프트에 작업 세부사항을 직접 담아야 한다.

  • 활성화: `CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1` (실험적). 팀원 실행 방식은 `teammateMode`(in-process 등)로 설정, split-pane은 tmux/iTerm2 필요
  • 고급 운영: 리드가 팀원 계획을 승인/반려하는 plan-approval('테스트 커버리지 포함한 계획만 승인' 같은 기준 지정 가능), 파일 충돌은 팀원마다 다른 파일을 맡겨 회피
  • 활용 패턴: PR 리뷰를 보안·성능·테스트 렌즈로 나눠 동시 검토, 또는 여러 팀원이 서로 가설을 반박하는 '과학적 토론'식 근본원인 디버깅(앵커링 회피)
원본 →
AI 코딩 도구

Anthropic 내부 팀 활용법 — 코드 안 짜는 팀까지 Claude Code를 쓰는 실전 패턴

Anthropic이 자사 10개 팀(데이터 인프라·보안·제품 엔지니어링·디자인·추론·그로스 마케팅·법무 등)의 Claude Code 실사용 사례를 공개했다. 핵심은 '코드 생성기'가 아니라 '사고 파트너'로 쓴다는 것 — 그리고 비개발 직군도 워크플로를 자동화한다. 보안팀은 인시던트 때 스택트레이스+문서를 던져 제어 흐름을 추적해 10~15분 걸리던 이슈를 3배 빠르게 해결하고, 추론팀 비ML 인력은 모델 함수 설명을 받아 리서치 시간을 80% 줄였다. 그로스 마케팅팀은 서브에이전트 2개로 광고 CSV 수백 건을 분류·재생성하는 에이전틱 워크플로를 짰고, 법무팀은 개발 리소스 없이 담당 변호사 라우팅 '폰 트리'를 프로토타이핑했다.

  • 범용 패턴: CLAUDE.md로 온보딩 컨텍스트 모으기 / 인시던트에 스택트레이스+문서 투입 / GitHub Actions로 PR 코멘트 코드리뷰 자동화 / write→test→iterate 자율 루프
  • 검증된 수치(자사 주장): 보안 인시던트 3배 빠른 해결, 추론 리서치 시간 ~80% 단축(1시간→10~20분), 쿠버네티스 장애 진단 20분 절약
  • 비개발 직군도 사용 — 디자인팀은 Figma 파일을 자율 루프에 넣어 코드·테스트 반복, 마케팅은 광고 변형 최대 100개 자동 생성
원본 →
AI 코딩 도구

Continue(continuedev) — AI Checks 피벗·read-only 보관·CLI 유산(~33.7k★)

한때 VS Code·JetBrains·CLI로 성장한 오픈소스 코딩 에이전트 Continue(Apache-2.0·~33.7k★)는 2026년 두 갈래 변화를 겪었다. 첫째, 제품 핵심이 IDE 채팅·자동완성에서 '모든 PR에 AI 검사를 돌리는' AI Checks로 피벗 — `.continue/checks/` 마크다운 하나가 검사 규칙이 되고 GitHub 상태 체크·CI에서 실행된다. 둘째, 메인 레포(continuedev/continue)는 2.0.0 최종 릴리스 후 read-only 보관 — 더 이상 능동 유지보수 없음. CLI(cn)는 모듈형 터미널 에이전트(TUI·헤드리스 `-p`)로 100+ LLM·Ollama 지원했으나 같은 운명. JetBrains는 @continuedev/cli 사용 권장. Roo Code·Zoo Code와 함께 'OSS 에이전트 도입 시 archived 여부'를 PoC 단계에서 확인해야 하는 대표 사례.

  • AI Checks = `.continue/checks/` 마크다운 → PR마다 자연어 규칙 검사, GitHub 상태 체크·CI 연동
  • 메인 레포 read-only(2.0.0 최종) — 스타·라이선스만 보지 말고 유지보수 상태·포크 경로 확인
  • CLI(cn) = 모듈형 TUI·헤드리스, 100+ LLM·Ollama — 같은 보관 상태, @continuedev/cli 권장
원본 →
AI 코딩 도구

MCP 도구를 코드로 호출하기 — 토큰 150k→2k로 줄인 'Code execution with MCP'

Anthropic이 2025년 11월 공개한 패턴. 에이전트가 MCP 도구를 하나씩 직접 호출하는 대신, MCP 서버를 '파일시스템 위의 코드 API'로 노출하고 에이전트가 그 API를 호출하는 코드를 직접 작성하게 한다. 도구가 수백~수천 개로 늘면 ① 모든 도구 정의를 미리 로딩하느라 컨텍스트가 터지고 ② 중간 결과가 매번 모델을 거치며 토큰을 잡아먹는데, 이 패턴이 둘 다 해결한다. 도구마다 파일 하나(예: `servers/google-drive/getDocument.ts`)로 두고 에이전트가 필요한 파일만 탐색해 읽는 '점진적 공개(progressive disclosure)' 방식이다. 회의록 처리 예시에서 토큰을 150,000 → 2,000으로 줄여 98.7% 절감을 주장한다(Anthropic 측 주장). 단, 에이전트가 생성한 코드를 돌리려면 샌드박스 실행 환경이 필요하다.

  • MCP 서버를 코드 API로 노출 → 에이전트가 도구를 '호출'이 아니라 '코드로 조합'(루프·조건·에러처리 그대로)
  • 필요한 도구 파일만 읽는 점진적 공개로 컨텍스트 절약 / 중간 결과를 코드 안에서 필터·집계 후 요약만 반환(1만 행 → 5행)
  • 회의록 예시 150k→2k 토큰(98.7% 절감) 주장 / PII를 모델에 안 흘리고 토큰화 가능 / Cloudflare도 'Code Mode'로 동일 결론. 단 샌드박스 실행 환경 필요
원본 →
AI 코딩 도구

Claude Code GitHub Action — PR에 @claude 부르면 알아서 고치고 리뷰까지

anthropics/claude-code-action는 Claude Code를 깃허브 액션 안에서 자율 에이전트로 돌리는 공식 액션이다. 이슈나 PR 코멘트에서 `@claude`로 부르면(또는 이슈를 Claude에 배정하면) 코드를 읽고, 변경을 만들고, PR을 올리거나 코멘트로 답한다. 별도 prompt 입력을 주면 멘션 없이도 PR마다 자동 코드리뷰·CI 수정·이슈 분류 같은 워크플로를 돌릴 수 있다. 설치는 Claude Code에서 `/install-github-app`를 실행하면 깃허브 앱과 시크릿까지 안내해 깔아 준다. 에이전트는 사내(자체) 러너에서 실행되고, Anthropic API·Bedrock·Vertex 등 여러 인증 방식을 지원하며 라이선스는 MIT다.

  • 트리거: PR·이슈에서 @claude 멘션 / 이슈를 Claude에 배정 / prompt 입력으로 자동 실행 — 코드 수정·PR 생성·리뷰 코멘트
  • 설치: Claude Code에서 /install-github-app 한 줄 — 깃허브 앱과 시크릿 설정까지 안내(레퍼런스 anthropics/claude-code-action@v1)
  • 자체 GitHub 러너에서 실행, MIT 라이선스(약 8k★). '월 50 PR 기준 API 비용 $5 미만'은 공식 문서의 주장
원본 →
AI 코딩 도구

멀티에이전트 3-티어 — 인세션·로컬 워크트리·클라우드를 일에 맞게 갈아끼우기

Addy Osmani가 정리한 2026년 멀티에이전트 코딩 도구 지형은 셋업·격리·동시성을 기준으로 3티어로 나뉜다. 티어1은 추가 셋업 없이 한 세션 안에서 도는 Claude Code 서브에이전트·Agent Teams — 상호작용 작업의 출발점. 티어2는 내 머신에서 에이전트마다 별도 git 워크트리를 띄워 충돌 없이 3~10개를 병렬로 굴리는 로컬 오케스트레이션(Conductor·Claude Squad·Vibe Kanban 등). 티어3은 클라우드 VM에서 비동기로 돌려 PR로 받아 보는 도구(Claude Code Web·Copilot Coding Agent·Jules·Codex Web) — 백로그를 밤새 비울 때. 핵심은 '하나만 고르기'가 아니라 일의 성격에 따라 세 티어를 갈아끼우는 것이며, 동시성은 3~5개가 스위트스폿이고 10개를 넘기면 비용만 늘기 쉽다.

  • 티어1(제로 셋업)=서브에이전트·Agent Teams / 티어2(로컬 워크트리, 3~10개)=Conductor·Claude Squad·Vibe Kanban / 티어3(클라우드 비동기)=Claude Code Web·Copilot·Jules·Codex Web
  • 격리는 에이전트마다 별도 git 워크트리로 — 머지 충돌 없이 깔끔하게 통합(Conductor 류는 자동 처리)
  • 동시성 스위트스폿 3~5개, 10개 초과는 이득 적고 비용↑ / 품질 게이트(테스트 훅·플랜 승인)와 AGENTS.md로 세션마다 학습 누적
원본 →
AI 코딩 도구

12-Factor Agents — 믿을 만한 에이전트는 '대부분 그냥 소프트웨어'다

HumanLayer의 Dex(Dexter Horthy)가 정리한, 프로덕션급 LLM 에이전트를 만드는 12가지 원칙(GitHub 23.3k★). 핵심 주장은 "여기 프롬프트, 여기 도구 한 보따리, 목표 칠 때까지 루프"라는 순진한 에이전트 루프는 70~80% 품질에서 막히고, 고객 대면 제품엔 그 80%로는 부족하다는 것 — 잘 도는 에이전트는 사실 '대부분 결정론적 소프트웨어'에 LLM 단계를 전략적으로 끼워 넣은 형태라고 본다. 그래서 프레임워크에 맡기지 말고 프롬프트·컨텍스트 창·제어 흐름을 직접 소유하고, 실행 상태를 비즈니스 상태와 합쳐 launch/pause/resume 가능한 단순 API로 만들라고 말한다.

  • 원칙 일부: 프롬프트를 소유하라 / 컨텍스트 창을 소유하라 / 제어 흐름을 소유하라 / 도구는 그냥 '구조화된 출력'일 뿐
  • 작고 집중된 에이전트로 쪼개고, 에러는 컨텍스트 창에 압축해 넣고, 사람 호출도 도구 콜로 처리하라
  • 에이전트를 '무상태 리듀서(stateless reducer)'로 만들어 어디서든 트리거·재개 가능하게
원본 →
AI 코딩 도구

awesome-claude-code-subagents — 154개 전문 서브에이전트를 플러그인으로 한 번에 까는 컬렉션

VoltAgent가 큐레이션하는 Claude Code 서브에이전트 모음으로, 154개 이상의 특화 에이전트를 10개 카테고리(Core Development, Language Specialists, Infrastructure, Quality 등)로 분류해 둔다. api-designer·backend-developer·typescript-pro·swift-expert처럼 역할별로 시스템 프롬프트가 미리 짜여 있어, 직접 에이전트를 정의하지 않고도 도메인 전문가를 골라 쓸 수 있다. Claude Code 플러그인 마켓플레이스로 카테고리 단위 설치가 되고, 수동으로 .claude/agents/에 파일을 복사해도 된다. GitHub 21.8k★(주장, 2026-06 기준).

  • 설치: claude plugin marketplace add VoltAgent/awesome-claude-code-subagents 후 voltagent-lang 같은 카테고리 플러그인 install — 또는 에이전트 .md를 ~/.claude/agents/(전역)·.claude/agents/(프로젝트)에 복사
  • 10개 카테고리·154+ 에이전트: 언어별(typescript-pro/swift-expert), 인프라, 품질, 메타-오케스트레이션 등 — 09-meta의 agent-installer로 'PHP 에이전트 찾아 설치해줘'식 자연어 설치도 지원
  • 서브에이전트 = 별도 컨텍스트 창에서 도는 전문 일꾼. 직접 system prompt를 작성하는 대신 검증된 역할 정의를 가져다 쓰는 게 핵심 이점
원본 →
AI 코딩 도구

대형 코드베이스에서 Claude Code — CLAUDE.md를 루트가 아니라 하위 디렉터리에 두라

Anthropic이 모노레포·레거시·마이크로서비스 같은 대형 코드베이스 운영 패턴을 공식 정리했다. Claude Code는 인덱스(RAG/임베딩) 없이 파일을 직접 traverse하고 grep하는 '에이전틱 검색'으로 도므로, '어디를 봐야 할지' 알려 주는 시작 컨텍스트의 품질이 성능을 좌우한다. 가장 실용적인 조언은 CLAUDE.md를 레포 루트에 몰아넣지 말고 하위 디렉터리에 두라는 것 — Claude가 현재 위치에서 디렉터리 트리를 거슬러 올라가며 만나는 모든 CLAUDE.md를 누적해 읽기 때문에 루트 컨텍스트는 사라지지 않는다. 또 모델이 바뀌면 옛 지침이 새 모델을 오히려 방해할 수 있어 주기적으로 설정을 재검토하라고 권한다.

  • CLAUDE.md는 얇게·계층적으로: 루트엔 '포인터와 치명적 함정'만, 세부 규칙은 하위 디렉터리 CLAUDE.md에. 초기화도 루트가 아니라 하위 디렉터리에서 — 트리를 거슬러 올라가며 누적 로딩되므로 루트 컨텍스트는 유지됨
  • 탐색을 좁혀라: 테스트·린트 명령은 디렉터리별로 스코프(타임아웃·컨텍스트 낭비 방지), 빌드 산출물·서드파티 코드는 검색에서 제외, 구조가 자명하지 않으면 폴더별 한 줄 설명을 적은 '코드베이스 맵' 마크다운을 추가해 에이전틱 검색의 출발점을 만든다
  • 유지보수: 한 모델용으로 쓴 워크어라운드 지침이 다음 모델을 오히려 제약할 수 있으니 곧 obsolete로 보고 주기적으로 리뷰. 검색·읽기는 read-only 서브에이전트에, 편집은 메인 에이전트에 분리 (출처: Anthropic 블로그, 2026-05-14)
원본 →
AI 코딩 도구

SWE-EVO — '단일 이슈'를 넘어 코드베이스를 여러 번 진화시키는 장기 과제 벤치마크

SWE-bench Verified가 최상위 모델들로 포화(Opus 4.8 88%대)되자, 연구자들은 실무에 더 가까운 '장기(long-horizon) 소프트웨어 진화'를 재는 SWE-EVO를 내놨다. 성숙한 오픈소스 파이썬 프로젝트 7개의 릴리스 노트에서 뽑은 48개 과제로, 과제 하나가 평균 21개 파일에 걸친 다단계 변경을 요구하고 인스턴스당 평균 874개 테스트로 검증된다. 결과는 냉정하다 — OpenHands+GPT-5.4 조합이 25%밖에 못 풀었고, 같은 계열 GPT-5.2가 SWE-bench Verified에서 72.8%를 받던 것과 극명히 대비된다. "이슈 하나→패치 하나"가 아니라 "여러 파일을 조율해 코드베이스를 진화시키기"가 진짜 병목임을 보여 준다.

  • 구조 차이: SWE-bench는 깃 이슈 1개를 해결해 패치 1개를 내는 격리된 과제. SWE-EVO는 릴리스 노트 기반으로 다파일·다단계 진화를 요구 — 평균 21개 파일 수정, 인스턴스당 ~874개 테스트로 검증
  • 점수 급락: 같은 기반 모델이라도 SWE-bench Verified 72.8%(GPT-5.2) → SWE-EVO 22.92%로 추락. 최고 성적도 GPT-5.4+OpenHands의 25% 수준 — 장기·복잡 과제에서 현 에이전트의 한계가 그대로 드러남
  • 시사점: Verified 고득점을 '실무 준비 완료'로 읽으면 안 된다. 벤치마크 포화는 곧 '다음 난도'를 만들고, 실제 병목은 단발 버그픽스가 아니라 여러 반복에 걸친 코드베이스 진화 (출처: arXiv 2512.18470, 48 tasks/7 projects)
원본 →
AI 코딩 도구

SuperClaude — /sc: 명령·에이전트·모드를 주입해 Claude Code를 '개발 플랫폼'으로 바꾸는 프레임워크

SuperClaude는 Claude Code의 코드를 고치지 않고 행동 지침(behavioral instruction)을 주입해 구조화된 개발 워크플로를 얹는 오픈소스 프레임워크다(현재 기준 GitHub 약 2.3만 ★, MIT, Anthropic 비공식). 핵심은 `/sc:` 접두사로 붙는 슬래시 명령 모음 — 구현·분석·문서화 같은 작업을 명령 하나로 트리거하고, 그에 맞는 전문 에이전트와 '행동 모드'가 함께 활성화된다. 구성은 30여 개 명령, 20여 개 전문 에이전트, 7개 행동 모드(브레인스토밍·태스크 관리 등), 그리고 Context7·Sequential 등 6~8종 MCP 서버 연동. 설치는 파이썬 쪽 pipx/PyPI(`SuperClaude install`) 또는 npm으로 한다. 같은 '스킬 묶음' 계열인 Superpowers와 달리, 명령·에이전트·모드를 하나의 네임스페이스(/sc:)로 패키징한 점이 차별점이다.

  • 동작 방식: Claude Code 본체 수정 없이 행동 지침을 주입 — `/sc:` 접두 명령으로 작업을 트리거하면 해당 전문 에이전트+행동 모드가 함께 켜짐
  • 구성(저장소 명시): 명령 ~30개, 전문 에이전트 ~20개, 행동 모드 7개, MCP 서버 6~8종(Context7·Sequential 등) / MIT·Anthropic 비공식
  • 설치: pipx 또는 PyPI(`SuperClaude install`), npm 경로도 제공 / Superpowers와 차이는 명령·에이전트·모드를 /sc: 네임스페이스로 일괄 패키징한 점 (별 수는 현재 기준·변동)
원본 →
AI 코딩 도구

SWE-Perf — '버그 수정' 말고 '성능 최적화'를 재는 첫 저장소급 벤치마크

SWE-bench류 벤치마크는 대부분 'GitHub 이슈를 고쳐 테스트를 통과시키는가'(정확성)를 잰다. SWE-Perf는 결이 다르다 — 실제 코드를 더 빠르게 만드는 능력, 즉 성능 최적화를 잰다. 인기 Python 저장소 9개에서 실제로 실행 속도를 개선한 PR들을 모아 만들었고, 10만 건이 넘는 PR(102,241건)을 필터링해 140개의 검증된 과제로 추렸다. 과제는 '버그를 안 만들면서 테스트 실행 시간을 줄이는 패치'를 저장소 전체 맥락에서 생성하는 것이다. 결과적으로 현재 최고 AI 모델과 사람 전문가 사이에 성능 개선 격차가 남아 있어, 정확성 벤치마크가 포화돼도 '빠르게 만들기'는 아직 사람이 앞선다는 신호다.

  • 정확성(버그 고치기)이 아니라 성능(코드를 더 빠르게)을 재는 첫 저장소급 벤치마크 — 스니펫이 아닌 코드베이스 전체 맥락에서 동작
  • 구성(프로젝트 페이지 주장): Python 저장소 9개, PR 102,241건을 필터링해 140개 인스턴스, 각 인스턴스는 실제 성능 개선 PR 기반
  • 최고 AI 모델 vs 사람 전문가 사이 성능 개선 격차(약 8.59%p 주장)가 남음 — 정확성은 포화돼도 최적화는 여전히 난제
원본 →
AI 코딩 도구

Dynamic Workflows(ultracode) — GA·스크립트 오케스트레이션으로 서브에이전트 수백 개

Dynamic workflow(v2.1.154+·2026-05-28 GA)는 Claude가 작업 설명을 받아 JavaScript 오케스트레이션 스크립트를 짜고 런타임이 백그라운드 실행 — 본 세션은 응답 가능. 서브에이전트/스킬과 달리 루프·분기·중간 결과가 스크립트 변수에, Claude 컨텍스트엔 최종 답만. 핵심 primitive — agent(spawn), parallel(barrier), pipeline(stage stream). 동시 16·런당 1,000 에이전트 상한. 켜는 법 — 프롬프트 ultracode·/effort ultracode(xhigh+자동 workflow)·/workflows 관리. managed settings disableWorkflows로 조직 비활성. Bun Zig→Rust 75만 줄 11일(테스트 99.8%) 공식 사례.

  • GA v2.1.154+ — agent/parallel/pipeline primitive, 동시 16·런당 1,000
  • /effort ultracode — xhigh+자동 workflow, /workflows pause·resume·slash 재사용
  • disableWorkflows managed gate — 토큰 소비 주의, pilot slice 먼저
원본 →
AI 코딩 도구

/context — 200k 컨텍스트가 어디로 새는지 한눈에 보고 막는 진단 명령

에이전트 성능이 떨어지는 흔한 원인은 모델이 아니라 컨텍스트 창이 잡동사니로 꽉 찬 것이다. Claude Code의 `/context`는 시스템 프롬프트·기본 도구·MCP 도구·메모리(CLAUDE.md)·스킬·대화 기록·남은 공간이 각각 토큰을 얼마나 먹는지 분해해서 보여준다. 공식 비용 문서도 "무엇이 공간을 잡아먹는지 보려면 `/context`를 실행하라"고 안내한다. 과거엔 MCP 서버가 컨텍스트의 절반을 먹는다는 사례가 많았는데, 지금은 MCP 도구 정의가 기본적으로 '지연 로딩'이라 실제로 쓰기 전까진 도구 이름만 들어간다. 그래도 안 쓰는 서버는 `/mcp`로 끄는 게 좋고, 공식 문서는 MCP보다 `gh`·`aws`·`gcloud` 같은 CLI를 쓰면 도구 목록이 컨텍스트에 안 쌓인다고 권한다. 실무 처방은 단순하다. `/context`로 범인을 찾고 → 안 쓰는 MCP를 끄고 → CLAUDE.md는 핵심만 200줄 이내로 → 남은 공간이 줄면 `/compact`나 새 세션으로 정리. 토큰을 아끼는 게 아니라 모델이 집중할 '깨끗한 작업 공간'을 지키는 일이다.

  • `/context`: 시스템·도구·MCP·메모리·대화별 토큰 점유율을 분해 — 공식 비용 문서가 진단 도구로 안내
  • MCP 도구 정의는 기본 지연 로딩(쓰기 전엔 이름만) — 그래도 안 쓰는 서버는 `/mcp`로 끄고, CLI(gh·aws)는 목록을 안 쌓아 더 가벼움
  • 처방: 범인 찾기→불필요 MCP off→CLAUDE.md 200줄 이내→공간 줄면 /compact·새 세션
원본 →
AI 코딩 도구

UI UX Pro Max — '디자인 안목'을 스킬로 주입해 매번 비슷한 AI 화면을 벗어나기

AI에 UI를 맡기면 어디서 본 듯한 보라색 그라데이션·똑같은 카드 레이아웃이 반복되는 게 흔한 불만이다. UI UX Pro Max는 이 '디자인 안목 부재'를 메우는 오픈소스(MIT) Claude Code 스킬로, 프로젝트 요구사항을 분석해 제품 유형에 맞는 디자인 시스템(스타일·색·타이포·간격·접근성)을 자동으로 골라준다. README 기준 67가지 UI 스타일(글래스모피즘·브루탈리즘·벤토 그리드 등), 161개 산업별 컬러 팔레트, 57개 폰트 페어링, 25종 차트, 15개 기술 스택(React·Next·Vue·SwiftUI·Flutter 등), 99개 UX 가이드라인, 161개 추론 규칙을 내장한다. 요청이 오면 제품 유형·스타일·팔레트·패턴·타이포를 병렬 검색하고, 업종에 안 맞는 '안티패턴'을 걸러낸 뒤 코드로 뽑는 식이다. 설치는 Claude Code에서 `/plugin marketplace add nextlevelbuilder/ui-ux-pro-max-skill` 후 `/plugin install`. 단, 떠도는 스타/설치 수치는 출처마다 8만~19만으로 들쭉날쭉하니 '인기 지표'는 걸러 보고, 핵심은 검증된 기능 범위로 판단하라.

  • 제품 유형→스타일·팔레트·폰트·패턴을 병렬 매칭하고 업종 부적합 안티패턴을 걸러 코드 생성 (MIT 오픈소스)
  • README 명시: 67 스타일·161 팔레트·57 폰트쌍·25 차트·15 스택·99 UX 규칙·161 추론 규칙
  • 설치: `/plugin marketplace add nextlevelbuilder/ui-ux-pro-max-skill` → `/plugin install` · 떠도는 별·설치수는 편차 커서 신뢰 말 것
원본 →
AI 코딩 도구

wshobson/agents — 에이전트·스킬·커맨드를 여러 도구에 한 번에 까는 멀티하네스 마켓플레이스

Claude Code뿐 아니라 Codex CLI·Cursor·OpenCode·GitHub Copilot·Gemini CLI까지 같은 에이전트 구성을 공유하려는 시도가 wshobson/agents다. 도메인 전문가 서브에이전트, 스킬, 슬래시 커맨드를 '플러그인' 단위로 묶어, 한 소스에서 여러 하네스로 배포한다. 특정 도구에 종속되지 않고 팀이 쓰는 에이전트 자산을 한곳에서 버전 관리하려는 사람에게 맞는다. README 기준 플러그인 84개, 에이전트 192개, 스킬 156개를 제공하며 라이선스는 MIT다. 작업 난이도에 따라 모델 티어를 갈아끼우는 라우팅도 포함한다.

  • 1개 소스 → Claude Code·Codex CLI·Cursor·OpenCode·GitHub Copilot·Gemini CLI 6개 하네스로 같은 구성 배포 (MIT)
  • README 명시: 플러그인 84개·에이전트 192개·스킬 156개 — 도메인 전문가 단위로 묶어 제공
  • 작업 난이도별 모델 티어 라우팅 내장 — 도구 락인 없이 팀 에이전트 자산을 한곳에서 버전 관리
원본 →
AI 코딩 도구

공식 MCP 레지스트리 — 흩어진 MCP 서버를 한 API로 찾는 '소스 오브 트루스'

MCP 서버가 폭증하면서 '어디서 신뢰할 만한 서버를 찾나'가 문제가 됐다. 그 답이 2025-09-08 프리뷰로 공개된 공식 MCP 레지스트리다. registry.modelcontextprotocol.io에서 공개 MCP 서버의 메타데이터(엔드포인트·기능·버전)를 한곳에 모아 REST API로 검색하게 한다. 기존 레지스트리(클라이언트별 마켓플레이스 등)를 대체하지 않고 그 위에 쌓이는 '업스트림 단일 출처' 역할이다. 클라이언트는 여기서 받아 자기만의 서브레지스트리로 가공하고, 사내용 비공개 서브레지스트리도 같은 스키마로 운영할 수 있다. MCP 오픈소스 커뮤니티 소유로 Anthropic·GitHub·PulseMCP·Microsoft·Block 등이 참여한다. 단, 아직 GA가 아닌 프리뷰라 데이터 리셋·호환성 깨짐 가능성이 명시돼 있어 프로덕션 의존은 주의해야 한다.

  • 검색: curl "https://registry.modelcontextprotocol.io/v0/servers?limit=10" — 서버 목록을 REST API로 조회
  • 기존 레지스트리 대체 아님 — 업스트림 단일 출처, 공개·사내 서브레지스트리가 같은 스키마로 위에 쌓임
  • MCP 커뮤니티 소유(Anthropic·GitHub·PulseMCP·Microsoft·Block 등 참여), 레포 약 6.9k★ — 단 아직 프리뷰(데이터 리셋·breaking change 가능)
원본 →
AI 코딩 도구

Zed 1.0 — Rust GPUI 에디터·ACP 에이전트 호스트·Parallel Agents(GPL-3.0·~85k★)

Zed(zed-industries/zed)는 Atom·Tree-sitter 제작진이 GPUI를 Rust로 바닥부터 짜 5년 만에 만든 GPU 가속 오픈소스 에디터다. 2026-04-29 1.0 GA, GitHub ~85k★·GPL-3.0. 핵심 정체성은 '자체 AI를 강제하지 않고 ACP(Agent Client Protocol)로 외부 코딩 에이전트를 호스트' — Claude Code·Codex·Gemini CLI·OpenCode·goose·Cline을 Agent Panel에 그대로 띄우고, 인증·과금·모델 선택은 각 에이전트가 소유(Zed는 과금 없음). 2026-04-22 Parallel Agents — Threads Sidebar(opt-cmd-j)로 프로젝트별 스레드 묶음, 스레드마다 접근 레포·워크트리 격리·에이전트 교체, 한 스레드가 여러 레포 가로질러 읽기·쓰기. JetBrains도 ACP 채택·양사 공동 에이전트 레지스트리. Cursor(IDE 1위)와 달리 '빠른 에디터=에이전트 공용 작업대'.

  • GPUI Rust 렌더링 ·2026-04-29 1.0 GA ·mac/Windows/Linux ·~85k★ GPL-3.0
  • ACP Agent Panel — Claude Code·Codex·Gemini CLI·OpenCode·goose·Cline, 인증·과금은 에이전트 소유
  • Parallel Agents — Threads Sidebar·스레드별 레포/워크트리 격리·멀티 에이전트 동시 실행
원본 →
AI 코딩 도구

openskills — Claude Code 스킬을 Cursor·Codex·Aider까지 그대로 쓰게 해주는 범용 로더

openskills는 Anthropic의 SKILL.md 스킬 시스템을 Claude Code 밖의 다른 에이전트에서도 쓰게 해주는 CLI 도구다(Apache 2.0, GitHub 10.4k★, TypeScript). 핵심은 "범용 SKILL.md 설치기" — 스킬을 받아 `AGENTS.md`에 Claude Code와 똑같은 `` XML 포맷으로 박아 넣어, AGENTS.md를 읽는 모든 호환 에이전트가 같은 스킬을 쓰게 만든다. 지원 대상은 Claude Code·Cursor·Windsurf·Aider·Codex 등이고, `npm i -g openskills` 후 `npx openskills install anthropics/skills`로 공식 스킬 모음을 한 번에 깔 수 있다. Claude Code의 점진적 공개(progressive disclosure) 방식을 그대로 따라 평소엔 이름·설명만 로드하고 필요할 때만 본문을 읽으므로, 여러 도구를 오가며 작업하는 팀이 스킬 자산을 한 벌로 공유하기 좋다. Anthropic 비공식 프로젝트다.

  • SKILL.md를 AGENTS.md의 XML로 변환 — Cursor·Windsurf·Aider·Codex 등 AGENTS.md 읽는 에이전트가 공유
  • 설치: npm i -g openskills → npx openskills install anthropics/skills / npx openskills sync (Apache 2.0, 10.4k★)
  • 점진적 공개 유지 — 평소 이름·설명만, 필요 시 본문만 로드 / Anthropic 비공식
원본 →
AI 코딩 도구

Memory Bank — 세션이 바뀌어도 프로젝트 맥락을 잃지 않게 하는 마크다운 메모리 패턴

Memory Bank는 에이전트가 세션·컨텍스트 리셋을 넘어 프로젝트 맥락을 유지하도록, 핵심 정보를 프로젝트 루트의 구조화된 마크다운 파일 묶음으로 외부화하는 패턴이다. 에이전트는 매 세션 시작 때 이 파일들을 먼저 읽어 '소스 오브 트루스'로 삼아, 불완전한 이해에서 나오는 잘못된 가정을 막는다. RooCode 구현(GreatScottyMac/roo-code-memory-bank)은 `memory-bank/` 디렉터리에 다섯 개 코어 파일을 둔다 — activeContext.md(현재 목표·세션 상태), decisionLog.md(아키텍처 결정과 근거), productContext.md(상위 프로젝트 맥락), progress.md(완료 작업), systemPatterns.md(코딩 패턴). 루트의 projectBrief.md는 초기화 시 즉시 맥락을 준다. Cline·RooCode·KiloCode·Cursor가 비슷한 방식을 쓰며, 핵심은 프롬프트(휘발성)가 아니라 대화 밖에 존재하는 영속 메모리라는 점이다. Claude Code의 MEMORY.md와 같은 계열의 발상이다.

  • 맥락을 프로젝트 루트 마크다운으로 외부화 → 세션·리셋을 넘어 유지, 매 세션 시작 시 먼저 읽어 가정 오류 방지
  • RooCode 코어 5종: activeContext / decisionLog / productContext / progress / systemPatterns + 루트 projectBrief
  • Cline·RooCode·KiloCode·Cursor 공통 패턴 — 프롬프트(휘발) 아닌 대화 밖 영속 메모리 / Claude Code MEMORY.md와 동류
원본 →
AI 코딩 도구

Cursor 규칙(.mdc) — 한 덩어리 지침을 '언제 켤지'로 쪼개 토큰 아끼기

Cursor의 프로젝트 규칙은 `.cursor/rules/*.mdc` 파일로 둔다(확장자가 `.mdc`여야 함 — 프런트매터가 없는 `.md`는 무시됨). 핵심은 AGENTS.md·CLAUDE.md처럼 모든 세션에 통째로 들어가는 게 아니라, 프런트매터 3필드(`description`·`globs`·`alwaysApply`) 조합으로 '언제 끌어올지'를 규칙마다 따로 정한다는 점이다. 활성 방식은 네 가지: ① Always(`alwaysApply:true`) 매 세션 포함 ② Auto Attached(`globs` 매칭 파일이 컨텍스트에 들어올 때만) ③ Agent Requested(`description` 보고 에이전트가 필요하다 판단하면) ④ Manual(`@규칙명`으로 직접 부를 때만). 덕분에 "테스트 파일 만질 때만 보는 규칙"을 평소 컨텍스트에서 빼둘 수 있어, 거대한 단일 규칙 파일이 매번 토큰을 먹는 문제를 피한다. 우선순위는 Team → Project → User 순으로 병합되며 앞쪽이 충돌 시 이긴다.

  • `.cursor/rules/*.mdc`(버전관리), 프런트매터 `description`·`globs`·`alwaysApply` 조합으로 적용 시점 결정 — `.md`는 무시
  • 4가지: Always / Auto Attached(globs 매칭) / Agent Requested(description 판단) / Manual(@멘션)
  • globs로 '특정 파일 만질 때만' 켜서 평소 컨텍스트 절약 / 우선순위 Team→Project→User
원본 →
AI 코딩 도구

Pydantic AI — 'FastAPI 느낌'으로 타입 안전하게 짜는 모델-비종속 에이전트 프레임워크

Pydantic AI는 Pydantic 검증 라이브러리를 만든 팀이 내놓은 파이썬 에이전트 프레임워크다. README는 스스로를 "프로덕션급 GenAI 애플리케이션을 빠르고 자신 있게 짜도록 돕는" 프레임워크라 소개하며, 목표는 웹 개발의 FastAPI가 주던 '이게 되네' 하는 개발 경험을 LLM 앱에 가져오는 것이다. 핵심은 타입 안전성이다. 에이전트의 입력·도구·출력을 Pydantic 모델로 정의하면 LLM 응답이 그 스키마에 맞게 검증되고, 안 맞으면 모델에 자동 재요청한다. 덕분에 "문자열 받아서 파싱하다 터지는" 흔한 실패가 컴파일 타임 가까이로 당겨진다. 모델에도 안 묶여서 OpenAI·Anthropic·Gemini·DeepSeek 등을 같은 코드로 갈아끼울 수 있고, 타입 안전한 의존성 주입, MCP/A2A 연동, Logfire(OpenTelemetry) 관측이 기본 제공된다. 코딩 에이전트를 '쓰는' 도구가 아니라 '만드는' 토대라서, 사내 자동화나 커스텀 에이전트를 직접 구축할 때 LangChain의 대안으로 자주 거론된다. MIT 라이선스, 약 17.8k★.

  • Pydantic 팀의 파이썬 에이전트 프레임워크 — 입력·도구·출력을 Pydantic 모델로 정의하고 LLM 응답을 스키마 검증(안 맞으면 자동 재요청)
  • 모델 비종속: OpenAI·Anthropic·Gemini·DeepSeek 등을 같은 코드로 교체 / 타입 안전 의존성 주입 + Logfire 관측 기본
  • 에이전트를 '쓰는' 게 아니라 '만드는' 토대 — MIT, 약 17.8k★ (수치는 레포 주장)
원본 →
AI 코딩 도구

Backlog.md — 깃 레포를 사람·AI 공용 칸반 보드로 바꾸는 마크다운 태스크 매니저

Backlog.md는 별도 서버나 SaaS 없이, 깃 저장소 안에서 작업(task)을 평범한 마크다운 `.md` 파일로 관리하는 오픈소스 도구다(MIT 라이선스). README에 따르면 모든 이슈가 깃에 커밋되는 .md 파일이라 PR·브랜치·히스토리와 자연스럽게 묶이고, 제로 설정 CLI로 터미널 칸반 보드와 웹 UI를 띄울 수 있다. 핵심은 'AI 에이전트와 사람이 같은 작업 목록을 공유'한다는 점이다. Claude Code·Gemini CLI·Codex·Kiro 등 MCP/CLI 호환 어시스턴트를 지원하며, MCP 커넥터를 쓰면 이 도구들에 워크플로 지침까지 자동 주입된다. 에이전트가 작업을 To Do→In Progress→Done으로 옮기고 진행 상황을 파일에 남기므로, 세션이 바뀌어도 '무엇을 하던 중이었나'가 레포에 그대로 남는다. 실무 포인트는 핸드오프다. 사람이 잘게 쪼갠 태스크를 에이전트에 넘기고, 에이전트가 작업하며 상태를 갱신하면, 별도 트래커 없이 깃 하나로 사람-AI 협업의 단일 진실 공급원(source of truth)을 만들 수 있다.

  • 작업 = 깃에 커밋되는 마크다운 .md 파일 — 서버·SaaS 없이 레포 안에서 칸반·진행 추적(MIT 라이선스)
  • Claude Code·Gemini CLI·Codex·Kiro 등 지원, MCP 커넥터가 에이전트에 워크플로 지침 자동 설정
  • 사람이 태스크 쪼개 핸드오프 → 에이전트가 To Do→In Progress→Done 갱신 → 세션 바뀌어도 맥락이 레포에 남음
원본 →
AI 코딩 도구

Ralph Wiggum 루프 — '멍청하지만 절대 안 멈추는' 에이전트 bash 패턴

Geoffrey Huntley가 심pson 캐릭터 이름을 따 정리한 Ralph는 본질적으로 `while :; do cat PROMPT.md | claude-code; done` 한 줄이다. 매 반복마다 새 컨텍스트로 에이전트를 띄워 한 번에 한 가지만 시키고, 상태는 fix_plan.md·AGENT.md·git 히스토리에 두어 컨텍스트 rot를 우회한다. 테스트·타입체커·정적분석을 backpressure로 걸어 잘못된 생성을 거른다. Anthropic은 2025-12 공식 ralph-wiggum 플러그인(/ralph-loop·Stop 훅)으로 채택했고, Continuous Claude는 PR·CI·머지까지 붙인 확장이다.

  • 순루프: 작업 1개→구현→검증(테스트/타입/린트)→통과 시 커밋→상태 갱신→컨텍스트 리셋→반복
  • stateless 핵심: 진행은 LLM 컨텍스트가 아니라 git·파일에 — 매 반복 새 인스턴스
  • 공식 ralph-wiggum 플러그인(/ralph-loop), Continuous Claude는 PR·CI·머지까지 확장
원본 →
AI 코딩 도구

GitHub Copilot 코딩 에이전트 — 이슈를 던지면 알아서 PR을 올리는 비동기 에이전트

터미널 CLI 에이전트와 달리, GitHub Copilot 코딩 에이전트는 깃허브 안에서 '비동기'로 도는 자율 에이전트다. 이슈를 `@copilot`에게 할당하거나 Agents 패널에서 작업을 주면, 에이전트가 백그라운드에서 레포를 조사하고 구현 계획을 세운 뒤 브랜치에 코드를 고쳐 초안 PR(draft pull request)을 연다. 실행은 GitHub Actions 위에서 돌아 격리된 환경에서 빌드·테스트를 거치고, 사람은 결과 PR을 리뷰만 하면 된다. 즉 '내가 옆에서 지켜보며 짜는' 동기식 페어 프로그래밍이 아니라, '일을 맡겨두고 다른 일을 하다 PR로 받는' 워크플로다. VS Code·GitHub.com·이슈 어디서든 `@copilot` 멘션으로 호출할 수 있어, 자잘한 버그·반복 작업을 사람 손에서 떼어내 백로그를 비우는 용도에 맞는다.

  • 이슈 할당 또는 @copilot 멘션 → 에이전트가 레포 조사·계획·브랜치 수정 후 초안 PR을 자동 생성
  • GitHub Actions 위에서 격리 실행(빌드·테스트), 사람은 PR 리뷰만 — '동기식 페어'가 아닌 '비동기 위임' 워크플로
  • Agents 패널·GitHub.com·VS Code·이슈 등 여러 진입점에서 @copilot으로 호출 가능
원본 →
AI 코딩 도구

skills.sh / npx skills — SKILL.md를 70+ 에이전트에 npm처럼 까는 스킬 패키지 매니저(Vercel·~22.6k★)

스킬(SKILL.md)이 쏟아지면서 생긴 문제는 '어떤 걸 어떻게 깔지'다. Vercel Labs의 skills CLI(skills.sh)는 오픈 에이전트 스킬 생태계를 위한 npm식 패키지 매니저(MIT·~22.6k★)다. `npx skills add ` 한 줄로 Claude Code·Codex·Cursor·OpenCode 등 70여 개 에이전트 폴더에 심볼릭 링크 설치. find·use(1회)·list·update·remove·init 서브커맨드, `-g`(전역)·`-a`(대상 에이전트)·`-y`(비대화형) 플래그. GitHub·GitLab·URL·로컬 경로 지원. SKILL.md 표준을 '설치·배포 레이어'로 묶어 도구 비종속 스킬 공유를 가능하게 한다.

  • `npx skills add/find/use/update/remove/init` — npm처럼 스킬 검색·설치·갱신(MIT·~22.6k★)
  • 70+ 에이전트 비종속 — Claude Code·Cursor·Codex·OpenCode 등에 심볼릭 링크로 동일 SKILL.md 공유
  • `-g` 전역 / 프로젝트 스코프, skills.sh 디렉터리에서 공개 스킬 탐색
원본 →
AI 코딩 도구

코딩 에이전트 프롬프트 인젝션 방어 — Claude Code가 실제로 거는 안전장치

프롬프트 인젝션은 공격자가 코드·웹페이지·파일에 악성 지시를 숨겨 에이전트의 원래 명령을 가로채는 기법이다. 코딩 에이전트를 실무에 들일 때 "이거 안전한가"가 첫 관문인데, Claude Code 공식 보안 문서는 마법이 아니라 '읽을 수 있는 구체적 안전장치'들로 답한다. 핵심은 권한 시스템(민감 작업은 명시적 승인)·컨텍스트 인식 분석(전체 요청을 보고 위험 지시 탐지)·입력 새니타이즈다. 특히 curl·wget 같은 네트워크 명령은 기본 자동승인이 안 되고, 웹 fetch는 별도 컨텍스트 창에서 처리해 악성 프롬프트가 본 세션에 섞이지 않게 격리한다. 그 위에 fail-closed 매칭(매칭 안 된 명령은 기본 수동승인)·명령 인젝션 탐지(이미 허용한 명령도 수상하면 다시 승인)·첫 코드베이스/새 MCP 서버 trust 검증이 더해진다. 단 trust 검증은 -p(헤드리스) 실행 시 비활성화되니 자동화 파이프라인은 그만큼 더 조심해야 한다. 어떤 방어도 100%는 아니므로 신뢰 불가 콘텐츠를 Claude에 직접 파이프하지 말 것을 공식 베스트 프랙티스로 권한다.

  • 권한 시스템·컨텍스트 인식 분석·입력 새니타이즈가 1차 방어, curl/wget 네트워크 명령은 기본 자동승인 제외
  • 웹 fetch는 '격리된 컨텍스트 창'에서 처리 — 악성 페이지 지시가 메인 세션에 주입되는 걸 차단
  • fail-closed(미매칭 명령 수동승인)·명령 인젝션 탐지·첫 코드베이스/MCP trust 검증. 단 trust 검증은 -p 헤드리스에선 꺼짐
원본 →
AI 코딩 도구

Devin Desktop(구 Windsurf) — Agent Command Center·Cloud·Cascade Workflows 통합 패밀리

2026-06 Cognition이 Windsurf(Codeium IDE)를 Devin Desktop으로 리브랜딩, Devin을 Cloud·Desktop·CLI·Review 하나의 패밀리로 통합했다. Devin Cloud — 샌드박스 VM에서 계획→코드→테스트→PR 비동기(67% PR merge). Devin Desktop — Agent Command Center(Kanban)·Spaces(Git worktree)·ACP로 Codex·Claude Agent·OpenCode 등 서드파티 에이전트도 관리. Cascade Workflows — 반복 멀티스텝을 .md 레시피로 정의해 /슬래시 호출(`.windsurf/workflows/*.md` 팀 공유). Pro $20/월에 Cloud+Desktop+SWE-1.6. Cursor(IDE 1위)와 달리 '에이전트 관리 센터+클라우드 VM' 통합이 차별.

  • Devin Desktop OTA — Windsurf→Devin Desktop, ACP·Spaces·Kanban·Devin Local(Rust)
  • Cascade Workflows — .md 레시피·/슬래시 호출·워크스페이스 커밋으로 팀 공유
  • Pro $20/월 — Cloud agent+Desktop IDE+SWE-1.6, 67% PR merge(2025 리뷰)
원본 →
AI 코딩 도구

CodeRabbit — 공개 레포는 무료, PR마다 줄 단위로 달라붙는 AI 리뷰어

CodeRabbit은 GitHub·GitLab에 붙어 PR이 열릴 때마다 자동으로 코드 변경을 분석하고, 변경 라인 옆에 인라인 코멘트와 PR 요약을 달아주는 AI 코드 리뷰 도구다. 가장 큰 미끼는 가격이다. 공식 가격표 기준 '공개 저장소는 영원히 무료(free reviews forever for public repositories)'라서 오픈소스·사이드 프로젝트에 비용 없이 붙일 수 있다. 유료는 Pro가 연간 결제 시 사용자당 월 24달러, Pro Plus가 48달러이며, 무료 티어도 공개·비공개 저장소 수 제한 없이 PR 요약과 IDE·CLI 리뷰를 제공한다. 즉 '에이전트가 코드를 짠다'가 아니라 '에이전트가 사람·AI가 짠 코드를 사람 대신 1차로 리뷰한다'는 쪽이라, 작성과 검토를 다른 주체로 분리하고 싶을 때 들어맞는다.

  • PR 열릴 때마다 변경 라인 옆에 인라인 코멘트 + PR 요약 자동 생성 (GitHub·GitLab)
  • 공개 저장소는 영원히 무료 — OSS·개인 프로젝트에 비용 0으로 리뷰 봇 추가(공식 가격표 명시)
  • 유료 Pro 연 결제 시 월 $24/인, Pro Plus $48/인; 무료 티어도 공개·비공개 무제한 + IDE·CLI 리뷰 포함
원본 →
AI 코딩 도구

Codex CLI — Rust 네이티브 로컬 코딩 에이전트(92k+★)

Codex CLI는 OpenAI가 만든 "내 컴퓨터에서 도는" 터미널 코딩 에이전트다. GitHub 저장소 기준 Apache-2.0 오픈소스이고, 2026-06-23 조회 시 92.8k★·13.7k forks·Rust 96.3%·최신 릴리스 0.142.0(2026-06-22)로 활발히 유지되고 있다. 실무 포인트는 설치 경로보다 운영 경계다. CLI는 셸 설치 스크립트, npm, Homebrew, GitHub Release 바이너리를 제공하고, 인증은 ChatGPT Plus·Pro·Business·Edu·Enterprise 로그인 또는 API 키로 나뉜다. 같은 README가 VS Code·Cursor·Windsurf IDE 통합과 클라우드 Codex Web을 별도 표면으로 안내하므로, 팀은 "로컬 CLI에서 할 일", "IDE에서 리뷰할 일", "클라우드 에이전트에 맡길 일"을 권한과 비용 기준으로 나눠야 한다.

  • 같은 런 검증: 92.8k★, 13.7k forks, Rust 96.3%, 최신 0.142.0(2026-06-22)
  • 설치 표면: 셸 스크립트·npm·Homebrew·GitHub Release 바이너리
  • 운영 경계: ChatGPT 로그인/API 키, IDE 통합, Codex Web을 작업 성격별로 분리
원본 →
AI 코딩 도구

promptfoo — 프롬프트·모델을 바꿔도 품질이 안 깨졌는지 자동으로 재는 eval 툴

코딩 에이전트/LLM 기능을 실무에 넣으면 곧 "프롬프트나 모델을 바꿨는데 결과가 더 나빠지진 않았나"라는 회귀 문제에 부딪힌다. promptfoo는 그 지점을 테스트 주도 개발처럼 다루는 오픈소스 CLI·라이브러리다. 2026-06-23 재검증 기준 GitHub 22,490★·MIT이고, 2026-03-09 OpenAI 인수 발표 뒤에도 오픈소스와 멀티모델 지원을 유지한다고 공지했다. 핵심은 선언적 테스트 케이스로 여러 프롬프트·입력·모델을 한 번에 돌리고, matrix/side-by-side 뷰로 비교하는 것이다. 단순 문자열 일치만이 아니라 metrics와 model-graded 평가로 정답이 하나로 떨어지지 않는 생성 결과도 점수화한다. 자동 레드티밍·펜테스팅은 보안 취약점을 찾고, CLI·라이브러리·CI/CD 통합은 프롬프트 변경을 배포 전 회귀 게이트로 만든다. eval은 로컬에서 실행되고 LLM과 직접 통신하므로, 평가 데이터를 불필요하게 외부 평가 SaaS에 밀어 넣지 않아도 된다.

  • 같은 런 검증: 22,490★, MIT, OpenAI 인수 뒤에도 오픈소스 유지 공지
  • 선언적 테스트로 프롬프트·입력·모델을 matrix/side-by-side 비교
  • metrics·model-graded 평가·레드티밍을 CI 회귀 게이트로 연결
원본 →
AI 코딩 도구

awesome-agent-skills — 코딩 에이전트 가리지 않고 쓰는 스킬 1400+개 모음(VoltAgent·25k★)

스킬(SKILL.md)이 Claude Code·Codex·Cursor·Gemini CLI 등에서 공통 표준이 되면서, "어떤 스킬을 깔지"가 새 고민거리가 됐다. VoltAgent의 awesome-agent-skills는 이 문제를 풀려는 큐레이션 레포다. 2026-06-23 재검증 기준 README 배지는 1497개+ 스킬을 표시하고, GitHub API로 26,182★·2,801 forks·MIT·같은 날 push를 확인했다. 핵심은 특정 에이전트 전용 프롬프트 모음이 아니라는 점이다. README는 Claude Code, Codex, Antigravity, Gemini CLI, Cursor, GitHub Copilot, OpenCode, Windsurf 등과 호환된다고 설명한다. Anthropic, Google Labs, Vercel, Stripe, Cloudflare, Netlify, Trail of Bits, Sentry, Expo, Hugging Face, Figma 같은 조직 발행 스킬과 커뮤니티 스킬을 함께 싣되, 대량 AI 생성물이 아니라 실제 팀이 쓰는 스킬을 손으로 고른다는 기준을 내세운다. 실무 교훈은 에이전트별 설정을 복붙하기보다, 검증된 SKILL.md를 공용 지식 단위로 관리하고 출처·라이선스·호환 도구를 같이 확인하라는 것이다.

  • 같은 런 검증: README 1497+ skills, GitHub 26,182★·2,801 forks·MIT·2026-06-23 push
  • Claude Code·Codex·Antigravity·Gemini CLI·Cursor·Copilot·OpenCode·Windsurf 호환 표방
  • 공식 조직 발행 스킬과 커뮤니티 스킬을 함께 싣되, 출처와 라이선스를 보고 골라 쓰는 카탈로그
원본 →
AI 코딩 도구

Roo Code 종료 → Zoo Code — 24k★ OSS 에디터 에이전트의 archive·커뮤니티 포크 생존

Cline에서 갈라진 VS Code 코딩 에이전트 Roo Code(24k★·Apache-2.0)는 Code·Architect·Ask·Debug·Custom 5모드·MCP·자연어 생성·리팩터링을 제공했다. 2026-05-15 v3.54.0을 마지막으로 저장소 archive(read-only) — 메인테이너는 Roomote 등 다른 프로젝트로 이동. 공식 README는 Zoo Code(커뮤니티 포크, 2026-04-23 기존 기여자 인계·v3.54.0 이어받음)와 Cline을 대안으로 안내. export→import로 설정 이주 가능. 계보 Cline→Roo→Zoo는 BYOK+오픈 라이선스+설정 이식성이 포크 생존을 보장하는 실제 사례.

  • 2026-05-15 archive — 24k★·Apache-2.0, 공식 대안 Zoo Code·Cline
  • Zoo Code = 기존 Roo 기여자 포크, 5모드·설정 그대로, export→import 이주
  • 교훈: OSS 에이전트는 archived 여부·포크 경로를 PoC 단계에서 확인
원본 →
AI 코딩 도구

Ruler — CLAUDE.md·AGENTS.md·.cursorrules를 한 곳에서 써서 모든 에이전트에 뿌리기

Ruler는 코딩 에이전트 지침을 도구별 파일에 손으로 복붙하지 않게 해 주는 "single source of truth" CLI다. `.ruler/AGENTS.md`와 하위 마크다운을 기준 순서대로 합치고, `ruler.toml` 설정에 따라 Claude Code, Codex CLI, Copilot, Cursor, Gemini CLI, Aider, Zed 등 30개 안팎의 에이전트 파일로 배포한다. 최신 README 기준 루트 `AGENTS.md`가 있으면 가장 높은 우선순위로 prepend되고, `.ruler/` 안의 파일에는 출처 주석이 붙어 traceability가 남는다. MCP 설정도 에이전트별 native 위치로 전파할 수 있고, nested rule loading은 모노레포·컴포넌트별 규칙을 다룰 수 있지만 아직 experimental로 표시된다. 2026-06-23 같은 런에서 2,773★·150 forks·MIT·archived=false·당일 push를 확인했다.

  • 입력 우선순위: 루트 AGENTS.md → `.ruler/AGENTS.md` → legacy instructions.md → 나머지 `.ruler/**/*.md`
  • 출력 범위: Claude Code·Codex CLI·Copilot·Cursor·Gemini CLI·Aider·Zed 등 30개 안팎 에이전트 지침/MCP/skills 위치
  • 실무 포인트: nested rule loading은 유용하지만 experimental, `--dry-run`으로 배포 diff를 먼저 확인
원본 →
AI 코딩 도구

Pi 2종 — earendil-works vs badlogic/pi-mono, 같은 이름 다른 철학의 터미널 에이전트

2026년 "Pi" 코딩 에이전트는 이름은 같지만 완전히 다른 두 프로젝트다. earendil-works/pi(MIT·~65k★)는 pi-ai·pi-agent-core·pi-tui·pi-coding-agent 모노레포로 멀티프로바이더 LLM API와 self-extensible 구조를 강조 — 내장 권한 시스템 없어 Gondolin micro-VM·Docker 샌드박스를 README가 권한다. badlogic/pi-mono(MIT·TypeScript·~63k★, Mario Zechner)는 Read·Write·Edit·Bash 4도구만 두고 MCP는 의도적 미지원, "에이전트가 .ts 익스텐션을 직접 작성"하는 최소주의 — Armin Ronacher가 "역대 최단 시스템 프롬프트"로 소개. 공통 교훈: self-extensible·minimal 모두 실행 경계(샌드박스)와 supply-chain review를 같은 설계 항목으로 봐야 한다.

  • earendil/pi — 4패키지 모노레포, 멀티프로바이더, self-extensible, 외부 VM/Docker 필수
  • badlogic/pi-mono — 도구 4개·MCP 없음·TS 익스텐션 자가작성, 세션 트리·핫 리로드
  • 이름 충돌 주의 — 레포·npm 패키지명 확인 후 도입, 둘 다 BYO-LLM·샌드박스 권장
원본 →
AI 코딩 도구

MCP 2026 — Linux Foundation·Stateless·MRTR·Extensions·OAuth RFC9207·Python SDK v2 alpha

MCP(Model Context Protocol)는 AI↔도구 연결 오픈 표준(Linux Foundation Agentic AI Foundation). 2026-07-28 RC(5/21 lock·7/28 final)는 출시 이후 최대 개정 — stateless 코어(Mcp-Session-Id·initialize 제거), Mcp-Method/Mcp-Name 헤더 mandatory, 12개월 deprecation policy·Roots/Sampling/Logging deprecated. Multi Round-Trip Requests(SEP-2322) — InputRequiredResult·requestState·client inputResponses retry loop. Extensions framework(SEP-2133) — reverse-DNS ID·MCP Apps+Tasks official extension·Skills SEP-2640 skill://index.json. OAuth authorization hardening 6 SEP — RFC9207 iss parameter mix-up attack mitigation(SEP-2468), OIDC application_type DCR(SEP-837), client credential issuer binding+re-register on migration(SEP-2352), refresh token scope semantics(SEP-2207), step-up scope accumulation(SEP-2350), stable .well-known suffix(SEP-2351). Python SDK v2.0.0a2 per-version wire validation.

  • SEP-2468 RFC9207 iss — reject auth response if iss missing/mismatch vs recorded issuer
  • SEP-837 application_type DCR — CLI/desktop localhost redirect rejected when defaulted web
  • SEP-2352 issuer-bound credentials — server migration forces client re-registration
원본 →
AI 코딩 도구

Cursor 코드베이스 인덱싱 — 임베딩으로 '의미 검색'하되 원문은 서버에 안 남긴다

대형 레포에서 에이전트가 "인증 실패는 어디서 처리하지?" 같은 행동·개념 질문을 받으면 문자열 grep만으로는 부족하다. Cursor의 현재 Search 문서는 Agent가 프롬프트 성격에 따라 Instant Grep, semantic search, 파일 읽기, Explore subagent를 조합한다고 설명한다. 시맨틱 검색은 코드를 함수·클래스·논리 블록 같은 의미 있는 청크로 나누고, 각 청크를 벡터 임베딩으로 만들어 벡터DB에 저장한 뒤, 질문도 같은 모델로 벡터화해 가까운 청크를 찾는 방식이다. 인덱싱은 워크스페이스를 열면 자동 시작되고 80% 완료 시점부터 검색 가능하며, 5분마다 바뀐 파일만 다시 처리한다. 프라이버시 경계도 중요하다. 파일 경로는 서버 전송 전 암호화되고, 원문 코드는 평문 저장되지 않으며, 인덱싱 중 메모리에만 있다가 폐기된다. 실무 교훈은 "시맨틱 검색이면 grep이 필요 없다"가 아니라, 정확한 심볼은 grep으로, 흐름·책임·개념 탐색은 시맨틱 검색과 Explore subagent로 분리해 컨텍스트를 아끼는 것이다.

  • 코드 청크를 벡터 임베딩으로 저장하고, 질문도 벡터화해 의미가 가까운 위치를 찾는다
  • 자동 인덱싱, 80%부터 검색 가능, 5분 증분 동기화, .gitignore·.cursorignore로 제외
  • Agent는 심볼/string은 grep, 개념/행동은 semantic search, 넓은 탐색은 Explore subagent로 조합
원본 →
AI 코딩 도구

Continuous Claude — Ralph 루프에 PR·CI·머지까지 붙인 '무인 개발 파이프라인'

Ralph 루프가 "끝날 때까지 새 컨텍스트로 다시 돌리는" 패턴이라면, Continuous Claude(AnandChowdhary)는 그 루프에 GitHub PR 생명주기를 붙인 CLI다. 매 반복마다 Claude Code 또는 Codex CLI가 작업하고, 새 브랜치에 커밋한 뒤 `gh pr create`로 PR을 열고, `gh pr checks`와 리뷰 통과를 기다린다. 초록불이면 머지하고, 실패하면 PR을 닫고 작업을 버린 뒤 다음 반복에서 실패 지식을 반영한다. 반복 사이 맥락은 기본 `SHARED_TASK_NOTES.md`에 남겨 컨텍스트 드리프트를 줄이고, `--worktree`로 병렬 실행도 지원한다. 현재 README 기준 GitHub PR 자동화가 핵심 경로이며 self-hosted forge는 미지원이다. 로컬 검증이나 안전한 시험 운전은 `--dry-run`, `--disable-commits`, `--disable-branches`, `--max-runs`, `--max-duration`, `--max-cost` 같은 제한 플래그로 먼저 좁히는 편이 낫다.

  • 같은 런 검증: MIT, 1.4k★, Claude Code/Codex provider 지원, GitHub CLI PR 자동화
  • 맥락 보존은 기본 SHARED_TASK_NOTES.md, 병렬 실행은 `--worktree`, 완료 판단은 연속 completion signal
  • 안전장치: `--dry-run`, `--max-runs`, `--max-duration`, `--max-cost`, `--stall-threshold`로 무한 루프를 제한
원본 →
AI 코딩 도구

Google Antigravity 2.0 — 데스크톱·CLI·SDK·Managed Agents API, Gemini 3.5 Flash agent stack(I/O 2026)

구글이 2026 I/O에서 Antigravity 2.0을 agent-first development platform으로 공개 — 데스크톱(병렬 multi-agent)·Go CLI·Antigravity SDK 3표면. Gemini 3.5 Flash — Terminal-Bench 2.1 76.2%·MCP Atlas 83.6%·3.1 Pro 대비 4× faster·Antigravity co-optimized 12×. Managed Agents in Gemini API(Interactions API) — single API call로 Antigravity harness+Gemini 3.5 Flash agent spin-up, Google-hosted isolated Linux sandbox에서 reason·tool·code execute. AI Studio agent templates·Android vibe coding·Firebase 연동. Gemini CLI(~105k★) 소비자 접근 2026-06-18 종료→Antigravity 이주. Claude Managed Agents(Anthropic REST) ·OpenAI Codex platform ·Microsoft Foundry Hosted agents와 4대 managed agent API 축.

  • 3표면 IDE+CLI+SDK + Managed Agents API — one call isolated Linux agent
  • Gemini 3.5 Flash agentic default — Search·Gemini app·Antigravity co-designed
  • Gemini CLI consumer sunset 2026-06-18 — Antigravity가 터미널 agent surface
원본 →
AI 코딩 도구

Mastra — 'Gatsby 팀'이 만든 TypeScript용 AI 에이전트 프레임워크

Mastra(mastra-ai)는 터미널 코딩 에이전트가 아니라, 제품 안에 AI 에이전트와 워크플로를 직접 넣을 때 쓰는 TypeScript 프레임워크다. React·Next.js·Node 앱에 붙이거나 독립 서버로 배포할 수 있고, YC W25 배지를 단 Gatsby 출신 팀의 프로젝트다. 핵심은 "모델 호출 래퍼"보다 넓다 — 40개 이상 모델 공급자를 한 인터페이스로 라우팅하고, 도구를 쓰는 Agent를 만들며, `.then()`·`.branch()`·`.parallel()`로 그래프형 Workflow를 짠다. 오래 걸리는 실행은 storage에 상태를 남기고 suspend/resume으로 사람 승인 뒤 이어갈 수 있다. 여기에 대화 기록·RAG·메모리, MCP 서버 작성, evals와 observability까지 묶어 "에이전트 앱의 백엔드 프레임워크"처럼 쓴다. 2026-06-24 GitHub API 기준 25,394★이고, 코어는 Apache-2.0이지만 `ee/` 디렉터리는 엔터프라이즈 라이선스라 프로덕션 사용 조건을 분리해서 봐야 한다.

  • 코딩 CLI가 아니라 제품 안 AI 에이전트·워크플로를 짜는 TS 백엔드 프레임워크
  • 구성: 40+ 모델 라우팅·Agent·그래프 Workflow·suspend/resume HITL·RAG/메모리·MCP·evals/observability
  • 라이선스 확인: 코어 Apache-2.0, `ee/`는 엔터프라이즈 라이선스 / 25,394★(2026-06-24 API 확인)
원본 →
AI 코딩 도구

Cursor CLI 헤드리스 모드 — `agent -p`로 CI·스크립트에서 코드 작업 자동화

Cursor의 Headless CLI는 에디터 안 대화형 에이전트를 CI·스크립트용 비대화형 작업자로 꺼내 쓰는 방식이다. 설치 후 `agent`를 그냥 실행하면 대화형 세션이고, `-p`/`--print`를 붙이면 프롬프트를 받아 최종 결과를 출력하는 자동화 모드가 된다. 중요한 분기점은 권한이다. 기본은 사람이 검토할 여지를 남기지만, `--force`(별칭 `--yolo`)를 주면 확인 없이 파일 편집까지 허용하므로 신뢰된 브랜치·격리된 워크스페이스에서만 써야 한다. 결과 소비 방식도 운영 포인트다. `--output-format`은 text·json·stream-json을 제공하고, stream-json에 `--stream-partial-output`을 더하면 긴 작업의 진행을 메시지/델타 단위로 추적할 수 있다. 인증은 `CURSOR_API_KEY` 환경변수로 처리한다. 즉 핵심은 "Cursor를 CI에 붙인다"가 아니라, 출력 형식과 편집 권한을 명시해 에이전트를 파이프라인 구성요소로 다루는 것이다.

  • `-p/--print` = CI·스크립트용 비대화형 실행, 인자 없이 실행하면 대화형 세션
  • `--force`/`--yolo`는 직접 편집 권한이므로 격리된 워크스페이스와 명시적 승인 정책이 필요
  • `--output-format` text·json·stream-json + `--stream-partial-output`로 자동화가 진행 상태를 읽게 한다
원본 →
AI 코딩 도구

Gartner가 'AI 코드 어시스턴트'를 'AI 코딩 에이전트'로 다시 부르다 — 4강 굳히기

GitHub가 공개한 2026 Gartner Magic Quadrant 요약에서 눈에 띄는 점은 카테고리명이 'AI Code Assistants'가 아니라 'Enterprise AI Coding Agents'라는 것이다. GitHub 글은 Gartner가 2026-05-20 보고서에서 12개 벤더를 실행력과 비전 완성도 기준으로 평가했고, GitHub·Anthropic·Cursor·OpenAI를 Leader 사분면에 뒀다고 설명한다. 다만 이 글은 GitHub의 해설이므로 "GitHub가 1위라서 좋다"가 교훈은 아니다. 더 실용적인 신호는 시장의 평가 단위가 자동완성·채팅에서 이슈 처리, 코드 리뷰, PR, 보안, 거버넌스까지 포함한 에이전트 워크플로로 넓어졌다는 점이다. 도구를 고를 때도 모델 품질 하나보다 멀티모델 선택, 감사·통제, SDLC 표면 통합을 같이 봐야 한다.

  • 공개 출처 기준: 2026-05-20 Gartner 보고서명은 Enterprise AI Coding Agents
  • GitHub 글은 12개 벤더 평가와 Leader 4곳(GitHub·Anthropic·Cursor·OpenAI)을 설명
  • 실무 함의: 자동완성보다 이슈→리뷰→PR→보안→거버넌스까지 이어지는 에이전트 표면을 평가
원본 →
AI 코딩 도구

ETH Zurich 연구 — AGENTS.md를 LLM에게 자동 생성시키면 오히려 성공률이 떨어진다

ETH Zurich·LogicStar.ai 팀이 실제 코딩 태스크에서 AGENTS.md(레포 컨텍스트 파일)가 코딩 에이전트에 도움이 되는지 처음으로 엄밀하게 측정했다(arXiv 2602.11988). 결론은 직관과 반대다: `/init` 류로 LLM이 자동 생성한 컨텍스트 파일은 성공률을 높이기는커녕 오히려 낮추는 경향을 보였고, 에이전트가 더 많은 단계를 밟게 만들어 추론 비용을 20% 넘게 끌어올렸다. 사람이 손으로 쓴 파일은 소폭의 이득은 있었지만 그 역시 탐색 단계와 비용을 함께 늘렸다. 60,000개 넘는 공개 레포가 이미 이런 파일을 두고 있는데, "있으면 좋다"는 가정이 데이터로 흔들린 셈이다.

  • 핵심 발견: LLM이 자동 생성한 AGENTS.md는 컨텍스트 파일 없는 경우보다 성공률을 떨어뜨리는 경향 + 추론 비용 20%↑(논문 abstract 확인)
  • 원인 추정: '전체 테스트 돌려라'·'관련 모듈 다 봐라' 같은 지시가 에이전트를 불필요한 탐색으로 몰아 단계·비용을 늘림
  • 권고: LLM 자동 생성 파일은 빼고, 사람이 추론 불가능한 정보(특수 빌드·툴 커맨드)만 짧게 적어라 — '자동 생성 디테일'은 독
원본 →
AI 코딩 도구

Dreams(Anthropic) — cross-session memory merge·Harvey 6× task completion

Dreams(Anthropic Managed Agents·research preview·Code with Claude 2026-05-06)는 세션 사이 비동기 memory curation — input memory store+1~100 session transcript→output store(입력 불변). duplicate merge·stale/contradicted replace·pattern→insight synthesis. instructions로 합성 방향 steer. Harvey legal-drafting case study — Dreams enable 후 agent task completion ~6×. Outcomes(rubric gate) ·Multiagent Orchestration(coordinator roster)와 3축 Managed Agents loop — memory drift·undefined done·context overload. beta headers managed-agents-2026-04-01 + dreaming-2026-04-21.

  • Input store immutable — output new store, review/apply/delete via Memory Stores API
  • Harvey ~6× completion — cross-session mistake pattern→memory update loop
  • vs Outcomes(session rubric) ·Multiagent(shared sandbox delegation) — complementary CMA primitives
원본 →
AI 코딩 도구

OpenClaw — 메신저로 부리는 self-hosted·모델 비종속 에이전트(MIT)

OpenClaw는 "내 기기에서 돌리는 개인 AI 어시스턴트"를 지향하는 오픈소스 프로젝트다. WhatsApp·Telegram·Slack·Discord·Google Chat·Signal·iMessage·Teams·Matrix·LINE·WeChat 같은 이미 쓰는 채널을 한 assistant 표면으로 묶고, Gateway 데몬(launchd/systemd user service)이 채널·워크스페이스·스킬 설정의 컨트롤 플레인 역할을 한다. 설치 흐름은 `openclaw onboard --install-daemon`으로 gateway, workspace, channel, skill을 단계별로 잡는 방식이다. README는 ChatGPT/Codex OAuth 구독과 여러 provider/model 지원을 언급한다. 2026-06-24 GitHub API 기준 380,229★·79,633 forks로 관심 신호는 강하지만, 실무 교훈은 별 수보다 "개인 비서 에이전트는 모델보다 채널 라우팅·데몬 운영·권한 경계가 제품"이라는 점이다.

  • WhatsApp·Telegram·Slack·Discord·Signal·iMessage·Teams·Matrix·LINE·WeChat 등 다채널 assistant
  • Gateway daemon + `openclaw onboard`가 workspace·channel·skill 설정을 묶는 운영 표면
  • GitHub API 확인: 380,229★·79,633 forks(2026-06-24) / README는 MIT badge와 ChatGPT·Codex OAuth 언급
원본 →
AI 코딩 도구

ccusage — 코딩 에이전트 토큰·비용을 로컬 로그만으로 집계하는 CLI(16.2k★)

ccusage는 코딩 에이전트 CLI의 로컬 사용 기록을 읽어 토큰·비용을 일/주/월/세션 단위로 집계하는 CLI다. `npx ccusage@latest`나 `bunx ccusage`로 바로 실행하고, 기본 리포트는 감지된 모든 source를 날짜별로 합친다. Claude Code 전용 `blocks`는 5시간 과금 창과 active block을 추적하고, `statusline`은 상태줄 표시용이다. 더 중요한 변화는 통합 범위다. README 기준 Claude Code, Codex, OpenCode, Amp, Droid, Codebuff, Hermes, pi-agent, Goose, OpenClaw, Kilo, Kimi, Qwen, GitHub Copilot CLI, Gemini CLI를 한 CLI에서 보고, `--json`, `--breakdown`, `--since/--until`, `--offline`, custom pricing override까지 제공한다. 2026-06-24 GitHub API 기준 16,517★다.

  • `daily`·`weekly`·`monthly`·`session`으로 감지된 source 전체를 한 리포트에 합산
  • `blocks`=Claude Code 5시간 창, `statusline`=상태줄, `--breakdown`=모델별 비용 분해
  • Claude Code·Codex·OpenCode·Amp·Droid·Goose·OpenClaw·Copilot CLI·Gemini CLI 등 지원 / 16,517★ 확인
원본 →
AI 코딩 도구

AI-research-SKILLs(Orchestra Research) — 에이전트를 'AI 리서치 전문가'로 만드는 98개 스킬 묶음(10k★)

Orchestra Research의 AI-research-SKILLs는 코딩 에이전트에 모델 아키텍처·파인튜닝·분산학습·평가·RAG·MLOps 같은 AI 연구/엔지니어링 절차를 SKILL.md 단위로 주입하는 MIT 라이선스 오픈소스 라이브러리다. README 기준 98개 스킬을 23개 카테고리로 나누고, autoresearch 스킬이 문헌 조사→아이디어→실험→논문 작성까지의 생애주기를 다른 도메인 스킬로 라우팅한다. 설치는 `npx @orchestra-research/ai-research-skills`로 에이전트를 자동 감지해 `~/.orchestra/skills/`에 깔거나, Claude Code 플러그인 마켓플레이스에서 카테고리별로 설치한다. 2026-06-24 GitHub API 기준 10,041★·748 forks다.

  • 범위: 98개 스킬·23개 카테고리 — fine-tuning, serving, eval, safety, RAG, MLOps 등
  • 설치: npx 인터랙티브 installer 또는 Claude Code marketplace 카테고리별 plugin install
  • 교훈: 프롬프트 하나보다 연구 생애주기를 라우팅하는 skill graph가 재사용성과 검증성을 높임
원본 →
AI 코딩 도구

goose(AAIF) — Rust BYO-LLM 에이전트·Subrecipes YAML 파이프라인(50k★)

goose는 Block이 만들어 공개한 Apache-2.0 오픈소스 AI 에이전트로, 깃허브 별이 약 49.5k다. 레포 태그라인은 "코드 제안을 넘어 — 어떤 LLM으로든 설치·실행·편집·테스트하는 확장 가능한 오픈소스 에이전트"로, 코드 한 줄 추천이 아니라 명령 실행·파일 편집·테스트까지 직접 하는 범용 에이전트를 표방한다. Rust(약 64%)로 작성됐고 데스크톱 앱(맥·리눅스·윈도)·CLI·임베더블 API 세 형태로 제공되며, MCP로 70여 개 확장을 물리고 Anthropic·OpenAI·구글·Ollama·Bedrock 등 15개 이상 모델 공급자를 갈아끼울 수 있다. 최근 레포는 block/goose에서 리눅스재단 산하 Agentic AI Foundation(AAIF·aaif-goose/goose)으로 이관됐다. Subrecipes(sub_recipes)로 복잡한 워크플로를 YAML로 쪼개: 메인 레시피의 {name, path, values}로 등록→별도 세션 격리 실행→결과만 반환. values는 런타임보다 우선, 서브레시피 중첩 금지, 같은 레시피 반복=최대 10워커 병렬(실험적).

  • 정체성: 'BYO-LLM' 범용 로컬 에이전트 — 특정 모델·클라우드에 묶이지 않고 API 키든 기존 Claude·ChatGPT·Gemini 구독이든(ACP 경유) 꽂아 쓴다. Cursor류 IDE 확장이 아니라 데스크톱 앱+CLI+API 묶음이다
  • 확장: MCP 표준으로 70여 개 익스텐션을 붙여 깃허브·브라우저·셸 등 외부 도구를 도구로 노출. Rust 코어라 단일 바이너리로 가볍게 돈다
  • 거버넌스: 원래 Block 사내 도구였다가 오픈소스화, 이제 MCP·AGENTS.md와 함께 리눅스재단 중립 거버넌스(AAIF)로 옮겨졌다. 별 수·공급자 수는 레포 표기 기준 주장이며 변동한다
  • Subrecipes — sub_recipes YAML·격리 세션·순차/병렬(최대 10워커), 실험적 기능
원본 →
AI 코딩 도구

GNAP — git 저장소 하나로 AI·사람 에이전트를 조율하는 프로토콜

GNAP(Git-Native Agent Protocol)은 별도 서버·DB 없이 git 저장소 자체를 에이전트 조율 계층으로 쓰는 MIT 라이선스 RFC다. `.gnap/`에는 version, agents.json, tasks/, runs/, messages/만 두고, 나머지 예산·대시보드·거버넌스는 애플리케이션 계층으로 남긴다. 에이전트는 heartbeat 루프에서 git pull→자기 활성 상태 확인→할 일과 메시지 읽기→작업→commit/push를 반복한다. 그래서 git history가 감사 로그가 되고, 사람과 AI가 같은 JSON 프로토콜 위에서 동등한 참여자가 된다. README는 Farol Labs가 AI 2명+사람 2명의 4-agent 팀으로 50개 이상 작업을 같은 repo에서 조율한다고 설명한다. 2026-06-25 GitHub API 기준 67★라 대중성은 작지만, 학습 가치는 "에이전트 협업을 SaaS가 아니라 버전관리 가능한 파일 프로토콜로 볼 수 있다"는 점이다.

  • 프로토콜 핵심: version + agents/tasks/runs/messages — 정확히 네 엔티티만 표준화
  • 운영 루프: pull→read→work→commit/push, git log가 별도 DB 없는 감사 로그
  • 주의점: 스타 수는 작음(67★) — 대중 도구보다 git-native coordination 패턴으로 학습
원본 →
AI 코딩 도구

Open SWE(LangChain) — 깃허브 이슈에 라벨만 붙이면 도는 비동기 클라우드 코딩 에이전트

Open SWE는 LangChain이 공개한 MIT 라이선스 오픈소스 비동기 코딩 에이전트다. 깃허브 이슈에 `open-swe-auto` 같은 라벨을 붙이거나 전용 UI에서 작업을 만들면, 클라우드에서 코드베이스 조사→계획→구현→테스트→자체 리뷰→PR 생성을 진행한다. 핵심 학습 포인트는 "코딩 에이전트 UX"다. 계획이 나오면 accept/edit/reject로 끊고, 실행 중에도 double texting으로 추가 지시를 넣으며, 추적 이슈에는 상태·계획·PR 링크가 계속 남는다. 내부 구조는 LangGraph 기반 Manager→Planner→Programmer→Reviewer 흐름이고, LangGraph Platform의 persistence·autoscaling과 Daytona 격리 샌드박스를 써서 긴 작업을 로컬 머신과 분리한다. 2026-06-25 GitHub API 기준 10,039★·MIT다.

  • GitHub-native UX: 이슈 라벨/추적 이슈/PR 링크로 에이전트 작업을 기존 흐름에 붙임
  • Human-in-loop + double texting: 계획 승인·수정, 실행 중 피드백 주입
  • 런타임: LangGraph Platform persistence/autoscaling + Daytona sandbox + Planner/Reviewer 게이트
원본 →
AI 코딩 도구

DX 도구별 PR 처리량 벤치마크 — '얼마나 자주 쓰느냐'가 도구 이름보다 크다

DX가 219개 기업·6만4,680명 개발자의 '실제 머지된 PR' 데이터를 AI 도구별로 다시 집계했다(2026 Q1, 2026-01-21 갱신). headline은 도구 순위보다 사용 빈도다. 매일 쓰는 개발자의 주당 머지 PR 중앙값은 Cursor 2.8→4.1(46% 증가), Claude 주간·월간 사용자는 4.0 초과, GitHub Copilot 일간 사용자는 2.5→3.61로 올랐다. 반대로 adoption 지표는 생산성 자체가 아니라 '일상 도구가 됐는지'를 보는 보조 신호다. Copilot은 일간 adoption 9.76%로 가장 끈끈했고, Cursor는 주간 adoption 31.56%, Windsurf는 월간 adoption 35.87%로 패턴이 달랐다. 교훈은 벤더 이름으로 ROI를 단정하지 말고, 일간·주간 cohort별 사용 빈도와 실제 PR 처리량을 같이 봐야 한다는 점이다.

  • 표본: 219개 기업·64,680명 개발자의 실제 머지 PR, 2026 Q1
  • 빈번 사용자 주당 PR 중앙값: Cursor 4.1(+46%)·Claude 4.0+·Copilot 3.61
  • 운영 포인트: seat 수가 아니라 daily/weekly cohort 사용률 + PR 처리량을 함께 추적
원본 →
AI 코딩 도구

Everything Claude Code(ECC) — 200k★ 넘긴 '에이전트 설정 모음', AgentShield 보안 감사기까지

Affaan Mustafa의 ECC는 "Claude Code 설정 모음"에서 크로스하네스 에이전트 운영 시스템으로 확장된 MIT 프로젝트다. 2026-06-25 같은 런에서 GitHub API 기준 221,207★·33,877 forks·archived=false를 확인했고, README는 Codex·Claude Code·Cursor·OpenCode·Gemini·Zed·Copilot을 지원한다고 설명한다. v2.0.0은 261개 skills, control-pane substrate, worktree lifecycle service, `orch-*` orchestrator 계열을 내세우고, RC 문서에는 66 agents·268 skills·84 legacy command shims 같은 설치 표면 수가 별도로 나온다. 실무 포인트는 숫자를 그대로 베끼는 게 아니라, 플러그인·수동 설치·rules 복사 경로를 섞으면 중복 동작이 생긴다는 README 경고처럼 "에이전트 자산 배포"도 설치 상태와 권한 경계를 관리해야 한다는 점이다. AgentShield는 별도 CLI/GitHub Action/App로 `.claude/` 설정의 secret, permission, hook, MCP, agent prompt injection 위험을 A~F 리포트와 JSON/HTML/evidence pack으로 감사한다.

  • 같은 런 검증: 221,207★·33,877 forks·MIT·archived=false
  • v2.0.0: 261 skills, control pane, worktree lifecycle, `orch-*` orchestration
  • AgentShield: CLI/Action/App로 secrets·permissions·hooks·MCP·agent prompts 감사
원본 →
AI 코딩 도구

Sim — '채팅·비주얼·코드'로 AI 에이전트를 짜는 오픈소스 워크스페이스(28.9k★)

Sim(simstudioai/sim)은 팀이 AI 에이전트를 만들고 배포·운영하는 Apache-2.0 오픈소스 워크스페이스다. 2026-06-25 GitHub API 기준 28,859★·3,674 forks·archived=false이고, README는 "Build conversationally, visually, or with code"를 핵심 흐름으로 설명한다. 대화형 Chat은 워크스페이스를 이해한 뒤 에이전트를 만들고 실행하며, Workflow builder는 블록 캔버스에서 자연어로 블록 생성·변수 연결·오류 수정을 돕는다. 문서/보고서 생성, RAG 지식베이스, 내장 Tables, 1,000개 이상 통합도 같은 워크스페이스에 묶인다. 실무 포인트는 low-code 도구를 "간단한 챗봇 빌더"로만 보지 말고, Chat·캔버스·코드·DB·RAG·실행 환경을 한 팀 작업대로 묶을 때 어떤 권한과 운영 경계가 필요한지 보는 것이다. 로컬 실행은 Docker 기반 `npx simstudio`, 더 깊은 self-host는 PostgreSQL+pgvector와 Bun/Next.js 스택을 요구한다.

  • 같은 런 검증: 28,859★·3,674 forks·Apache-2.0·archived=false
  • 구성 3방식: Chat·블록 Workflow builder·코드 / RAG 지식베이스·Tables·문서 생성
  • self-host: `npx simstudio` 빠른 실행, 고급 구성은 PostgreSQL+pgvector·Bun·Next.js
원본 →
AI 코딩 도구

Sentry Seer — 프로덕션 텔레메트리로 근본원인을 찾아 코딩 에이전트에 넘기는 디버깅 에이전트

Seer는 Sentry의 AI 디버깅 에이전트다. 스택트레이스를 챗봇에 붙여넣는 대신, Sentry가 이미 수집한 에러·트레이스·로그·메트릭·소스코드를 합쳐 "어디서 터졌나"보다 "왜 터졌나"를 추론한다. 2026-01-27 발표로 범위가 프로덕션 RCA에서 로컬 개발과 코드리뷰까지 넓어졌다. 로컬에서는 Sentry MCP 서버가 재현 중 생긴 텔레메트리를 보내고, Seer가 원인 분석 결과를 Claude·Cursor·Copilot 같은 코딩 에이전트의 수정 컨텍스트로 넘긴다. PR에서는 스타일 지적보다 배포 뒤 장애가 될 가능성이 큰 결함을 찾는다. 교훈은 AI 디버깅을 코드 정적 분석만으로 보지 말고, 런타임 텔레메트리와 PR 컨텍스트를 같은 루프에 묶어야 한다는 점이다. 요금은 Seer 연결 저장소에서 월 2개 이상 PR을 만든 active contributor 기준 $40/월이다.

  • 런타임 텔레메트리(에러·트레이스·로그·메트릭) + 소스코드로 정적 분석이 놓치는 분산·부하·프로덕션 버그 RCA
  • 로컬 재현은 Sentry MCP 서버로 코딩 에이전트에 연결, PR에서는 장애 가능성이 큰 결함 중심 리뷰
  • 요금은 Seer-connected repo에서 월 2개 이상 PR을 만든 active contributor당 $40/월, Seer 사용량은 PAYG와 별도
원본 →
AI 코딩 도구

Jules(Google) — plan-first VM agent·CI auto-fix loop·Jules API alpha

Jules(Google Labs·GA 2025-08)는 GitHub-native async coding agent — task마다 fresh Google Cloud VM clone·setup script·plan approval 후 코드 변경·PR. 2026-03 Gemini 3.1 Pro default(Pro tier)로 reasoning uplift. CI auto-fix loop — PR 생성 후 GitHub Actions 실패 감지→fix commit→resubmit, 사람 개입 없이 CI red→green close. Jules API(v1alpha·developers.google.com/jules/api) — Source·Session·Activity REST, Slack·Linear·GitHub custom workflow embed, requirePlanApproval로 plan gate 선택. AGENTS.md 자동 ingest·등급별 quota(무료 15/day·Pro 100·Ultra 300). vs Claude Code Web ·Codex Cloud ·Jules competitor Devin — Jules=GitHub issue→PR async with built-in CI babysitting.

  • CI fixer — Actions failure output→patch→push without keyboard
  • Jules API alpha — programmatic session, auto plan approval option
  • Fresh VM per task — secret·setup script review, no private code training
원본 →
AI 코딩 도구

/fork — 서브에이전트와 달리 '대화 전체'를 물려받는 분신 띄우기

서브에이전트는 정의 파일의 새 컨텍스트에서 시작하지만, fork는 생성 순간의 대화 전체를 그대로 복제해 백그라운드에서 도는 분기 세션이다. 현재 히스토리·시스템 프롬프트·도구·모델을 모두 물려받기 때문에, 같은 맥락을 다시 설명하지 않고 대안 조사나 검증을 맡기기 좋다. 결과는 완료 후 메인 대화에 메시지로 돌아오고, 실행 중에는 별도 패널에서 열어 후속 지시를 줄 수 있다. 핵심 차이는 캐시와 격리다. fork의 첫 요청은 부모와 같은 프롬프트·도구 정의라 부모 프롬프트 캐시를 재사용하지만, 명명된 서브에이전트는 별도 캐시와 전용 시스템 프롬프트를 쓴다. 파일 편집이 섞이면 위험하므로, 독립 작업에는 worktree 격리나 명확한 쓰기 범위를 함께 잡아야 한다.

  • fork=전체 대화·동일 도구·동일 모델·공유 프롬프트 캐시 / 명명된 서브에이전트=새 컨텍스트·전용 정의·별도 캐시
  • 실행 중 패널에서 fork transcript를 열어 후속 지시 가능, 완료 결과만 메인 대화에 도착
  • fork는 또 다른 fork를 만들 수 없음 / Agent tool 경유 시 worktree 격리로 파일 편집 충돌을 줄일 수 있음
원본 →
AI 코딩 도구

Task Master — PRD를 던지면 '의존성 달린 태스크 목록'으로 쪼개주는 에이전트(MIT+CC)

Task Master(eyaltoledano/claude-task-master)는 PRD·spec·GitHub issue를 `parse-prd`로 dependency-aware task graph로 바꿔, 에이전트가 "다음에 뭘 해야 하나"를 추측하지 않게 만드는 태스크 매니저다. MCP로 Cursor·Claude Code·Windsurf·VS Code·Amazon Q CLI에 붙거나 `npm i -g task-master-ai` CLI로 쓸 수 있고, `next`·`list`·`expand`·`analyze-complexity`·`set-status`로 작업 흐름을 관리한다. 핵심은 PRD를 작은 TODO로 쪼개는 데서 끝나지 않고, main/research/fallback 모델 역할과 optional research model, 태스크 의존성·복잡도·workstream tag를 함께 운영 표면으로 만든다는 점이다. 별도 API 키를 쓰거나 Claude Code/Codex CLI OAuth 경로를 쓸 수 있지만, 어떤 경로든 "상세 PRD가 좋아야 좋은 태스크가 나온다"는 제약은 그대로다.

  • PRD/spec/issue→task graph — dependency edge·priority·complexity·status를 명시
  • MCP+CLI 동시 지원 — editor chat 안에서는 tool, 자동화에서는 `task-master` command
  • GitHub API 기준 27.7k★·archived=false, README 표기는 MIT with Commons Clause
원본 →
AI 코딩 도구

Claude Agent SDK — 'Claude Code를 라이브러리로' 받아 자체 에이전트를 짜는 공식 SDK

Claude Agent SDK는 Claude Code를 구동하는 도구·에이전트 루프·컨텍스트 관리를 Python·TypeScript 라이브러리로 노출하는 Anthropic 공식 SDK다. 핵심은 Messages API처럼 모델 응답만 받는 것이 아니라, Read·Edit·Bash·Grep·WebFetch 같은 내장 도구 실행과 세션 관리를 포함한 에이전트 루프를 `query()`로 프로그램에서 돌린다는 점이다. TypeScript SDK는 네이티브 Claude Code 바이너리를 optional dependency로 묶어 별도 CLI 설치 부담을 줄이고, Python은 3.10 이상을 요구한다. 실무 구분도 명확하다. 대화형 개발·일회성 작업은 CLI가 맞고, CI/CD·커스텀 앱·프로덕션 자동화는 SDK가 맞다. Managed Agents가 Anthropic 호스팅 REST API라면, Agent SDK는 루프를 내 프로세스 안에서 돌려 권한·MCP·훅·세션 저장 방식을 직접 설계해야 한다.

  • Python/TypeScript에서 Claude Code의 도구 실행·컨텍스트 관리·세션을 `query()`로 호출
  • 내장 도구, Hooks, Subagents, MCP, Permissions, Sessions를 SDK 기능으로 제공
  • CLI=대화형 개발, SDK=CI/CD·커스텀 앱·프로덕션 자동화, Managed Agents=호스팅 REST API
원본 →
AI 코딩 도구

AI 랩이 개발 툴체인을 사들이는 중 — Anthropic→Bun($1B), OpenAI→Astral(FTC 승인)

AI 랩이 코딩 에이전트의 바깥 도구까지 사들이기 시작했다. Anthropic은 2025-12 Bun(JavaScript runtime·bundler·test runner)을 인수 — Claude Code가 Bun executable로 배포되며 "Bun이 깨지면 Claude Code가 깨진다". Claude Code $1B run-rate(6개월) milestone과 동시 발표. OpenAI는 2026-03 Astral(uv·Ruff·ty) 인수 발표, 2026-04 FTC early termination 승인으로 close 진행 — Astral 팀 Codex 합류. uv 126M·Ruff 179M monthly downloads. Bun·Astral 모두 MIT/오픈소스 지속 약속. 실무: Node/pip 대신 Bun/uv가 에이전트 기본 toolchain으로 밀리는 추세 — 소유권·로드맵·포크 가능성을 도구 리스크로 관리.

  • Anthropic→Bun(2025-12, $1B milestone) — Claude Code native installer·single binary distribution
  • OpenAI→Astral(2026-03 announce, 2026-04 FTC approve) — uv·Ruff·ty→Codex Python lifecycle
  • Strategic asset — install·lint·format·typecheck loop가 에이전트 vendor roadmap에 편입
원본 →
AI 코딩 도구

ccpi + tonsofskills.com — 플러그인·스킬·에이전트를 키워드로 검색·설치하는 오픈소스 마켓플레이스 CLI

Tons of Skills는 Claude Code용 플러그인·스킬·에이전트를 GitHub marketplace repo와 웹 카탈로그, ccpi CLI로 묶은 오픈소스 배포 표면이다. 현재 README는 432개 플러그인, 2,769개 스킬, 297개 에이전트와 30명 커뮤니티 기여자를 내세우며, `marketplace.extended.json`과 Claude Code CLI가 읽는 `marketplace.json`을 같은 원천으로 둔다고 설명한다. ccpi는 `pnpm add -g @intentsolutionsio/ccpi`로 설치해 검색·설치·목록·업데이트·검증을 맡고, Claude Code 안에서는 `/plugin marketplace add jeremylongshore/claude-code-plugins`로 바로 붙일 수 있다. 실무 포인트는 "좋은 프롬프트 모음"이 아니라, 팀 공용 에이전트 자산을 검증 가능한 패키지와 카탈로그로 배포하는 운영 문제로 보는 것이다.

  • 현재 README 기준 432 plugins·2,769 skills·297 agents·30 contributors
  • `marketplace.extended.json`과 Claude Code CLI용 `marketplace.json`을 같은 카탈로그 원천으로 관리
  • validator와 공개 100점 rubric으로 spec-correct 패키지만 병합하는 구조
원본 →
AI 코딩 도구

BMAD-METHOD — '애자일 팀 전체'를 에이전트로 흉내 내는 IDE 비종속 개발 방법론(49.7k★)

BMAD-METHOD(BMad Method)는 코딩 에이전트 하나를 잘 쓰는 팁이 아니라, 기획→분석→아키텍처→구현→테스트를 12+ 전문 에이전트와 34+ 워크플로로 나누는 AI 주도 개발 프레임워크다. V6 기준 `bmad-help`가 다음 단계를 안내하고, Party Mode는 여러 페르소나를 한 세션에 불러 토론하게 하며, 모듈 구조는 BMad Builder·Test Architect·Game Dev Studio 같은 도메인 확장을 붙인다. 실무 포인트는 "바로 코드"가 아니라 웹 번들(Gemini Gems·ChatGPT Custom GPTs)로 브레인스토밍·제품 브리프·PRD·UX·시장조사를 먼저 정리한 뒤, 그 산출물을 IDE 에이전트로 넘겨 구현 컨텍스트 누락을 줄이는 것이다. 2026-06-26 확인 기준 GitHub 49,673★·5,737 forks, 최신 릴리스 v6.9.0(2026-06-22), MIT 라이선스다.

  • 12+ 전문 에이전트와 34+ 워크플로로 기획·설계·구현·테스트를 단계화
  • 웹 번들로 PRD·UX·시장조사를 먼저 만들고 IDE 에이전트에는 정리된 산출물을 전달
  • `npx bmad-method install`; Node 20.12+·Python 3.10+·uv 필요, v6.9.0 최신 릴리스
원본 →
AI 코딩 도구

OpenSpec — Spec Kit보다 가볍게, 코드 짜기 전에 '무엇을 만들지'부터 합의하는 SDD(56.6k★)

OpenSpec은 AI 코딩 에이전트용 명세 주도 개발(SDD) 프레임워크다(MIT, 2026-06-26 확인 기준 56,605★). 이미 다룬 GitHub Spec Kit이 파이썬 설치·엄격한 단계 게이트의 '무거운' 쪽이라면, OpenSpec은 'fluid not rigid, brownfield not just greenfield'를 내세워 더 가볍게 반복하도록 설계됐다. 핵심은 변경(change) 단위 워크플로다. 불확실하면 `/opsx:explore`로 코드와 선택지를 먼저 훑고, `/opsx:propose`로 proposal/specs/design/tasks가 담긴 변경 폴더를 만들고, `/opsx:apply`로 구현한 뒤, `/opsx:archive`로 완료분을 정리하면서 실제 스펙을 갱신한다. Claude Code·Cursor 등 25개 이상 도구와 npm/pnpm/yarn/bun/nix로 붙고, Node 20.19+가 필요하다. 최신 릴리스는 v1.4.1(2026-06-03)이다.

  • 변경 단위 흐름: /opsx:explore → /opsx:propose → /opsx:apply → /opsx:archive
  • Spec Kit과의 차이: 엄격한 단계 게이트보다 자유로운 산출물 수정과 brownfield 도입을 강조
  • 25+ 도구 지원, MIT 라이선스, Node 20.19+ 필요, 최신 릴리스 v1.4.1
원본 →
AI 코딩 도구

Code Mode(Cloudflare) — MCP 도구를 'TypeScript API'로 바꿔 LLM에게 코드로 호출하게 하기

Cloudflare Code Mode는 MCP 도구를 LLM에게 직접 tool call로 노출하지 않고, doc 주석 달린 TypeScript API로 바꾼 뒤 LLM이 그 API를 호출하는 코드를 쓰게 하는 패턴이다. 핵심은 "도구 호출을 잘 고르기"보다 "짧은 코드를 써서 search→execute→filter→compose를 샌드박스 안에서 끝내기"다. cloudflare/mcp 서버는 Cloudflare API 2,500+ endpoint를 docs/search/execute 세 도구와 약 1.1k token footprint로 노출한다. codemode=false로 끄면 endpoint별 2,594개 도구가 등록되고 required param만 남겨도 약 244k token이 든다. 실행은 Dynamic Worker Loader의 V8 isolate에서 돌며, 일반 인터넷 접근은 막고 MCP binding만 열어 API key를 LLM 코드에 노출하지 않는다.

  • cloudflare/mcp — docs/search/execute 3 tools, 2,500+ endpoints, GraphQL Analytics까지 같은 execute 경로
  • Token budget — Code Mode 약 1.1k vs endpoint별 MCP 최소 스키마 약 244k
  • Sandbox — V8 isolate + MCP binding, 일반 인터넷 차단, supervisor가 token 보관
원본 →
AI 코딩 도구

에이전트 팀으로 C 컴파일러 짜기(Anthropic) — 병렬 자율 에이전트 '하네스'를 설계하는 실전 교훈

Anthropic 연구원 Nicholas Carlini가 Claude 에이전트 16개를 동시에 돌려, Linux 6.9를 x86·ARM·RISC-V에서 빌드하는 10만 줄짜리 Rust C 컴파일러를 만든 실험 기록이다(약 2,000세션·약 $20,000 소요). 핵심 교훈은 도구 이름이 아니라 '하네스(작업 환경)'를 어떻게 설계하느냐에 있다. 검증기(verifier)가 거의 완벽해야 하며 그렇지 않으면 "Claude가 엉뚱한 문제를 푼다". 또 Claude는 시간 감각이 없어("can't tell time") 방치하면 진척 대신 테스트만 몇 시간씩 돌리므로, 1%·10% 무작위 샘플을 도는 --fast 옵션으로 회귀를 빨리 잡게 했다.

  • 검증기가 곧 목표 — "task verifier가 거의 완벽하지 않으면 Claude는 엉뚱한 문제를 푼다". 기능 추가가 기존 동작을 자주 깨뜨려 결국 CI를 붙임
  • 병렬화: 테스트가 많이 깨질 땐 각 에이전트가 하나씩 집어 쉽지만, 단일 Linux 빌드는 서로 덮어써 충돌 → GCC를 'known-good 오라클'로 실패 파일 격리
  • 하네스 위생: 출력 범람 막으려 파일로 로깅·에러는 grep으로 찾게 표시, 작업 점유는 current_tasks/에 파일을 써서 잠금(git이 충돌 시 다른 작업 고르게 강제)
원본 →
AI 코딩 도구

서브에이전트 4가지 패턴(Philipp Schmid) — '메인 에이전트가 쥔 통제권' 순으로 줄 세우기

구글 딥마인드 Philipp Schmid가 2026-05-05에 정리한, 멀티에이전트를 짤 때 고를 수 있는 4가지 패턴이다. 메인 에이전트가 서브에이전트의 생애주기를 얼마나 쥐고 있느냐(통제 수준) 순으로 배열했고, 그에 따라 메인의 역할도 호출자→디스패처→코디네이터→감독자로 바뀐다. 핵심 조언은 "무조건 패턴 1부터 시작하라" — 멀티에이전트처럼 보이는 작업 대부분은 잘 짠 인라인 도구 호출 하나로 끝나며, 위로 올라갈수록 더 센 모델이 필요하다.

  • 패턴1 인라인 툴: 서브에이전트를 도구 호출 하나로 부르고 결과를 받음 — 리서치·코드리뷰·테스트 생성 같은 자기완결 작업
  • 패턴2 팬아웃: 여러 서브에이전트를 동시에 띄우고 나중에 결과를 모음 — 서로 의존 없는 독립 작업의 병렬화
  • 패턴3 에이전트 풀: 장수명 서브에이전트들과 메시지를 주고받으며 다단계 협업 / 패턴4 팀: 서브들끼리 직접 대화하고 메인은 역할만 세팅 후 빠짐 — 조정 로직이 한 에이전트 한계를 넘을 때만
원본 →
AI 코딩 도구

에이전트 코딩의 '80% 문제' — 보이는 80%는 끝내고 안 보이는 20%(인증·DTO·타 레포)를 빼먹는다

Sourcegraph의 Matt Tanner가 2026-05-21에 올린 'Agentic Coding in 2026' 글의 핵심은, 에이전트 생산성을 좌우하는 건 모델 성능이 아니라 '컨텍스트'라는 것이다. 에이전트는 작업의 눈에 보이는 80%는 안정적으로 끝내지만, 인증 미들웨어·API DTO·감사 로그·형제 레포의 통합 테스트 같은 안 보이는 20%를 빼먹는데 — 글은 이를 '80% 문제'라 부른다. 사이드 프로젝트에선 안 드러나지만 레포 수가 1을 넘는 순간부터 급격히 비용이 커진다. 해법으로 임베딩 기반 근사 검색이 아닌 '심볼 정확 검색(모든 callsite·구현체)'을 권한다.

  • '완료'를 의심하라: 에이전트가 끝났다 하면, 손댄 심볼들을 코드베이스 전체에서 검색해 에이전트가 안 연 파일이 나오면 작업은 미완 — 글이 꼽은 가장 실천적 습관
  • 권장 운영법: ①과제 블래스트 반경을 레포 전역 검색으로 미리 스코프 ②에이전트 커밋도 사람 커밋과 '같은 CI'로 게이트 ③에이전트를 외주 계약자처럼 다뤄 diff 리뷰·활동 감사 ④프롬프트가 아니라 '컨텍스트 레이어'에 투자
  • 대규모/멀티레포에선 임베딩 근사 검색보다 '결정적·전수(deterministic, exhaustive) 검색'을 권장 — 단 Sourcegraph 자사(코드검색 제품) 글이라 제품 포지셔닝은 감안할 것
원본 →
AI 코딩 도구

chrome-devtools-mcp(Google) — CDP MCP·Codex Developer mode, 브라우저 F12를 에이전트에(44.4k★)

chrome-devtools-mcp(ChromeDevTools/chrome-devtools-mcp·Apache-2.0·44,438★ live check)는 Chrome DevTools Protocol(CDP)을 MCP로 열어 DOM·console·network·performance trace·Lighthouse를 에이전트 도구로 만든다. 기본 설정은 `npx -y chrome-devtools-mcp@latest`, Codex는 `codex mcp add chrome-devtools -- npx chrome-devtools-mcp@latest`로 붙인다. 가벼운 브라우저 작업은 `--slim --headless`, 동시 에이전트는 `--experimentalPageIdRouting`, 세션별 임시 프로필은 `--isolated`가 안전하다. Codex app Developer mode는 Browser plugin의 @Browser/@Chrome에 full CDP를 주지만, Settings > Browser에서 켜야 하고 사이트별 명시 승인을 요구하며 조직은 `browser_use_full_cdp_access=false`로 끌 수 있다. 핵심은 "스크린샷 보고 추측"이 아니라 실제 콘솔·네트워크·DOM·성능 trace를 읽게 하되, 로그인 세션·쿠키·브라우저 내부 데이터까지 닿는 권한임을 분리·승인으로 통제하는 것이다.

  • CDP 도구화 — DOM·console·network·performance trace·Lighthouse를 MCP 클라이언트에서 호출
  • 격리 옵션 — `--slim --headless`, `--isolated`, `--experimentalPageIdRouting`으로 CI·동시 세션 위험 축소
  • Codex Developer mode — @Browser/@Chrome full CDP는 사이트별 승인과 enterprise kill switch가 전제
원본 →
AI 코딩 도구

Cipher → ByteRover CLI — 도구가 바뀌어도 따라다니는 '코딩 에이전트용 휴대 메모리 레이어'

Cipher는 이제 ByteRover CLI(brv)로 리브랜딩된 "코딩 에이전트용 영속 메모리" 프로젝트다. README 기준 핵심은 프로젝트 지식을 컨텍스트 트리에 넣고, `brv vc` 명령으로 branch·commit·merge·push/pull을 하며, 클라우드와 동기화해 팀·머신·도구 사이에서 같은 기억을 재사용하는 것이다. Cursor에서 쌓은 맥락을 Claude Code·Windsurf·Cline 같은 다른 에이전트로 옮겨도 처음부터 다시 설명하지 않게 만드는 레이어에 가깝다. 현재 문서는 `brv webui`를 기본 UI로 두고, MCP 서버·20개 LLM 제공사·24개 내장 도구·22개 이상 코딩 에이전트 호환을 내세운다. 단, 성능 수치는 프로젝트 자체 벤치마크이므로 제품 비교 지표가 아니라 "장기 대화 메모리를 어떻게 평가했는가"의 참고값으로 봐야 한다.

  • `brv vc`로 컨텍스트 트리를 버전 관리 — legacy `brv push/pull`보다 commit 단위 공유가 핵심
  • `brv webui`, MCP 서버, provider/model switch, hub/connectors까지 메모리 운영면을 한 CLI에 묶음
  • 자체 벤치마크는 LoCoMo 96.1%·LongMemEval-S 92.8%; 2026-06-26 확인 기준 GitHub 4,879★
원본 →
AI 코딩 도구

Kilo Code — VS Code·JetBrains·CLI를 오가는 오픈소스 코딩 에이전트(MIT·24.6k★)

Kilo Code는 VS Code, JetBrains, CLI에서 같은 에이전트 경험을 제공하려는 MIT 오픈소스 코딩 에이전트다. 현재 README는 500개 이상 모델을 고르고 작업 중 모델을 바꿀 수 있으며, provider pricing·zero markup·no API keys required to start를 내세운다. 핵심은 "에이전트 하나"보다 작업 모드 분리다. Code는 기본 구현, Plan은 코드 변경 전 설계, Ask는 파일을 건드리지 않는 코드베이스 질의, Debug는 추적, Review는 성능·보안·스타일·테스트 관점 점검으로 나뉜다. CLI는 `kilo run --auto`로 CI/CD 무인 실행도 가능하지만, 이 모드는 permission prompt를 모두 꺼서 trusted environment에서만 써야 한다.

  • 표면: VS Code 확장, JetBrains 플러그인, CLI, Cloud Agent, PR code review
  • 모드 분리: Code·Plan·Ask·Debug·Review + custom agents
  • 2026-06-26 확인 기준 GitHub 24,646★·2,799 forks·MIT, 최신 릴리스 v7.3.54
원본 →
AI 코딩 도구

Bumblebee(Perplexity) — MCP·확장·패키지 로컬 노출을 읽기 전용으로 찾는 스캐너(4.6k★)

코딩 에이전트를 쓰다 보면 MCP 서버, VS Code·Cursor·Windsurf 확장, npm·PyPI 패키지를 검증 없이 잔뜩 깔게 되는데, 정작 사고가 난 뒤 "어느 개발자 머신에 이 항목이 있나"를 빠르게 답하기 어렵다. Bumblebee는 Perplexity가 공개한 Apache-2.0 스캐너로, SBOM(배포 산출물)이나 EDR(실행·네트워크 흔적)이 놓치기 쉬운 개발자 로컬 상태를 NDJSON 인벤토리로 만든다. 핵심은 읽기 전용 설계다. `npm ls`·`pip show`·`go list` 같은 패키지 매니저를 실행하지 않고 락파일, 설치 메타데이터, 확장 매니페스트, 지원 MCP JSON 설정만 읽는다. 자체 CVE DB로 추측하지도 않는다. 사용자가 준 노출 카탈로그(JSON)와 정확히 일치하는 항목만 finding으로 내므로, "이미 알려진 악성 패키지·확장·MCP 서버가 내 fleet에 있나"를 확인하는 사고 대응 도구에 가깝다.

  • 스캔 표면: npm·PyPI·Go·RubyGems·Composer·Bun·pnpm·Yarn·Homebrew + MCP JSON 설정·에디터 확장·브라우저 확장·에이전트 스킬
  • 읽기 전용: 패키지 매니저 실행 없음·소스 파일 안 읽음, MCP env 자격증명 값은 record에 출력하지 않음
  • 2026-06-26 확인 기준 GitHub 4,635★·416 forks·Apache-2.0, 최신 릴리스 v0.1.2, baseline/project/deep 프로필과 selftest 제공
원본 →
AI 코딩 도구

Deep Agents(LangChain) — harness engineering로 Terminal Bench 2.0 Top 5

Deep Agents는 장기 작업용 LangChain 하네스다. ReAct 루프에 도구만 붙이는 대신 todo 계획, 서브에이전트, 가상 파일시스템, 튜닝된 시스템 프롬프트를 LangGraph 위에 묶는다. LangChain은 deepagents-cli에서 모델을 gpt-5.2-codex로 고정하고 하네스만 바꿔 Terminal Bench 2.0 점수를 52.8→66.5(Top 30→Top 5)로 올렸다고 공개했다. 조정 축은 프롬프트·도구·middleware 세 가지였고, LangSmith trace 분석으로 실패 패턴을 모은 뒤 targeted change를 반복했다. 핵심 개선은 exit 직전 PreCompletionChecklistMiddleware로 task spec 대비 검증을 강제하고, LocalContextMiddleware로 cwd·주변 디렉터리·사용 가능한 도구를 먼저 주입하며, 반복 편집을 감지해 계획 재검토를 유도한 점이다. 2026-06-26 확인 기준 GitHub 25,139★·MIT·최신 릴리스 deepagents==0.6.12.

  • Terminal Bench 2.0 52.8→66.5 — model fixed, harness only changed (Top 30→Top 5)
  • Middleware가 verification·local context·loop detection을 주입 — "더 센 모델"보다 하네스 수정
  • LangSmith trace→실패 원인 집계→프롬프트·도구·middleware 변경으로 반복 개선
원본 →
AI 코딩 도구

Agentic AI Foundation(AAIF) — MCP·goose·AGENTS.md가 리눅스재단 중립 거버넌스로 모이다

2025년 12월 9일, 리눅스재단이 Agentic AI Foundation(AAIF)을 출범하며 MCP·goose·AGENTS.md를 한 중립 거버넌스 아래 모았다. MCP는 AI 모델을 도구·데이터·앱에 연결하는 프로토콜, goose는 MCP 기반 로컬 우선 에이전트 프레임워크, AGENTS.md는 레포별 에이전트 지침을 일관되게 주는 마크다운 규약이다. 현재 AAIF 사이트의 프로젝트 목록에는 agentgateway도 추가되어, 단일 도구 묶음보다 "에이전트 인프라의 표준·런타임·지침을 재단 아래에서 키우는 흐름"으로 보는 편이 정확하다. 실무 교훈은 간단하다. 에이전트 스택을 고를 때 기능보다 먼저 거버넌스와 이식성을 봐야 하고, 레포 안의 AGENTS.md 같은 지침 파일은 팀 내부 팁이 아니라 에이전트가 공유하는 인터페이스가 되고 있다.

  • 초기 기증: MCP(Anthropic)·goose(Block)·AGENTS.md(OpenAI) — 표준·에이전트 런타임·레포 지침을 분리
  • AAIF 현재 프로젝트 목록은 AGENTS.md·agentgateway·goose·MCP — 에이전트 인프라의 계층이 늘어나는 신호
  • AGENTS.md는 6만+ 오픈소스 프로젝트 채택을 재단이 주장 — 지침 파일을 버전 관리하는 관행이 사실상 인터페이스화
원본 →
AI 코딩 도구

security-guidance 플러그인 — Claude가 짠 코드의 취약점을 같은 세션에서 잡아 고치게 하기

Anthropic 공식 마켓플레이스 플러그인으로, Claude Code가 코드를 짜는 동안 자기 변경을 스스로 보안 검토해 인젝션·안전하지 않은 역직렬화·DOM 주입 같은 취약점을 PR에 도달하기 전에 같은 세션에서 고치게 한다. 검토는 깊이가 다른 3단계로 돈다 — ①파일 편집마다 모델 호출 없는 정규식 패턴 매치(비용 0), ②턴이 끝날 때 그 턴의 git diff를 백그라운드에서 별도 Claude가 보안 관점으로 리뷰, ③Claude가 git commit·push를 할 때 주변 코드(호출부·새니타이저)까지 읽는 더 깊은 에이전틱 리뷰. 핵심은 코드를 짠 같은 인스턴스가 자기를 채점하지 않는다는 점 — 리뷰는 새 컨텍스트의 독립 Claude 호출이다. `/plugin install security-guidance@claude-plugins-official`로 깐다.

  • 독립 리뷰어: 짠 Claude가 자기 채점 안 함. 턴 끝·커밋 리뷰는 diff에서 출발하는 별도 Claude 호출(신선한 컨텍스트, '문제만 찾으라'는 보안 프롬프트). 모델 기본값은 Claude Opus 4.7(SECURITY_REVIEW_MODEL·SG_AGENTIC_MODEL로 교체)
  • 막지는 않음(공식 명시): 어느 단계도 쓰기·커밋을 차단하지 않는다. 발견은 '지시'로 Claude에 전달돼 대화 안에서 고쳐지고, 리뷰 모델은 놓칠 수 있음 → 방어선의 한 겹일 뿐, 완전한 보안책 아님. 한도: 턴당 변경 30파일·연속 3회, 커밋 리뷰 시간당 20회
  • 본인 셸 커밋은 제외: Bash 도구로 Claude가 한 commit·push만 리뷰됨(`!` 셸 이스케이프·직접 셸 커밋은 안 봄). 전부 훅(SessionStart·UserPromptSubmit·Stop·PostToolUse)으로 구현 — 소스가 '훅에서 별도 모델 호출' 예제. PR엔 Code Review, CI엔 기존 스캐너로 단계 분담
원본 →
AI 코딩 도구

AGENTS.md 실전 — 'README for agents'를 모노레포에 어떻게 까는가(중첩·우선순위 규칙)

AGENTS.md는 "코딩 에이전트를 안내하는 단순·개방 포맷"으로, 공식 사이트가 "a README for agents"라 부른다. README와 분리해 사람용 문서는 짧게 두고, 빌드·테스트·컨벤션 같은 에이전트용 상세 지침을 에이전트가 확실히 찾는 곳에 둔다는 발상이다. 필수 필드는 없고 "그냥 표준 Markdown"이라, 핵심은 양식이 아니라 '어디에 두느냐'다. 공식 사이트 기준 Codex·Jules·Cursor·Gemini CLI·Copilot 등 다수 도구가 지원하고 6만+ 오픈소스 프로젝트가 쓴다고 명시한다.

  • 중첩이 핵심: 패키지마다 AGENTS.md를 따로 두면 에이전트는 '편집 중인 파일에서 가장 가까운 파일'을 자동으로 읽는다 — 모노레포는 서브프로젝트별 맞춤 지침을 각자 싣는 게 정석(예시로 사이트는 'OpenAI 메인 레포에 88개 AGENTS.md'라 명시)
  • 우선순위 규칙(충돌 시): 편집 파일에 가장 가까운 AGENTS.md가 이긴다. 단 '사용자 채팅 프롬프트가 모든 것을 덮는다(override everything)' — 즉 직접 지시 > 가까운 파일 > 먼 파일
  • 테스트 자동 실행: 거기 적힌 테스트 명령을 에이전트가 알아서 돌리고 '작업 끝내기 전에 관련 프로그래매틱 체크를 실행해 실패를 고치려 시도'한다. AAIF(리눅스재단) 거버넌스로 이관돼 CLAUDE.md와도 사실상 호환되는 공용 표준 위치
원본 →
AI 코딩 도구

Factory droid — Terminal-Bench 1위·Mission·Custom Droid로 미는 모델 비종속 엔터프라이즈 코딩 플랫폼

Factory AI의 터미널 코딩 에이전트 droid는 Terminal-Bench core v0.1.1에서 Opus 4.1 조합 58.8%로 1위를 기록했다. Factory의 해석은 모델 이름보다 에이전트 하네스가 승부처라는 쪽이다. 계층형 프롬프트, 모델별 편집 처리, 경로 처리, 작은 도구 스키마, 환경 부트스트랩 같은 설계가 같은 모델의 성능을 끌어올린다는 것이다. 현재 CLI 문서는 이 방향을 제품 기능으로 이어 간다. 대화형 `droid`, 자동화용 `droid exec`, 큰 기능을 오케스트레이터+전문 droid로 나누는 `droid exec --mission`, MCP 연결, Custom Droids, 작업별 모델 라우팅을 한 흐름에 묶는다. 교훈은 벤치마크 점수보다 "프롬프트·도구·환경·모델 라우팅을 한 하네스로 설계했는가"를 봐야 한다는 점이다.

  • Terminal-Bench 58.8% — 모델 선택보다 하네스 설계 차이를 보여준 사례
  • `droid` 대화형 + `droid exec` 헤드리스 + `--mission` 다중 droid 워크플로
  • Custom Droids·MCP·모델 라우팅 — 팀별 에이전트 하네스 구성 단위
원본 →
AI 코딩 도구

Terminal-Bench 2.1 — 셸 전체가 문제, 에이전트+모델 쌍·Claude 5 Fable 83.1% (2026-06)

Terminal-Bench는 Stanford×Laude Institute가 만든 터미널 환경 코딩 에이전트 벤치마크 — SWE-bench(레포 수정)와 달리 커널 빌드·서버 배포·모델 학습 등 환경 전체가 문제다. 2.1 리더보드(tbench.ai)는 모델 단독이 아니라 '에이전트+모델 쌍'을 잰다. 2026-06-27 재확인 기준 Codex CLI+GPT-5.5 83.4%, Claude Code+Claude 5 Fable 83.1%, Claude Code+Opus 4.8 78.9%, Terminus 2+GPT-5.5 78.2%가 상위권이다. 같은 GPT-5.5도 Codex CLI와 Terminus 2 사이에 5.2%p 차이가 있어, 프롬프트·도구·복구 루프 같은 하네스 설계가 모델 선택만큼 중요해진다. Harbor의 `tb` CLI는 Terminal-Bench를 Codex·Claude Code·OpenHands 등 여러 에이전트로 같은 형식에서 돌리는 실행 표면이다.

  • 2.1 June 2026 — Codex CLI+GPT-5.5 83.4%, Claude Code+Claude 5 Fable 83.1%
  • Harness gap — 동일 GPT-5.5도 Codex CLI 83.4% vs Terminus 2 78.2%
  • 환경 전체 문제 — Docker+자동 판정, SWE-bench와 다른 '돌아가는 시스템' 과제
원본 →
AI 코딩 도구

SWE-bench Multimodal — 스크린샷 보고 'JS UI 버그'를 고치는 능력을 따로 재는 벤치마크

SWE-bench Multimodal(SWE-bench M)은 텍스트·파이썬 위주의 원조 SWE-bench를 "비주얼·사용자 대면 JavaScript 소프트웨어"로 확장한 벤치마크다. 공식 페이지는 공개 벤치마크를 517개 visual issue로 설명하고, 원 논문은 17개 JavaScript 라이브러리에서 모은 617개 task instance를 분석한다. 각 과제에는 버그 스크린샷·목업·다이어그램·시각적 에러 맥락 같은 이미지가 문제 설명이나 테스트에 들어간다. 핵심은 '코드를 짤 줄 안다'와 '화면 문제를 보고 이해한다'가 별개 능력이라는 점이다. 프런트엔드·다언어 코드베이스에 에이전트를 붙일 때 Verified 점수만 보면 시각 추론 약점이 가려진다.

  • 공식 페이지: 517 visual issue, Paper·GitHub·Dataset 링크를 함께 제공
  • 원 논문: 17개 JS 라이브러리·617 task instance, 문제/테스트에 이미지 최소 1장
  • SWE-agent 12% vs 차순위 6% — 시각 추론과 언어 일반화를 따로 봐야 함
원본 →
AI 코딩 도구

claude --worktree — 한 레포에서 여러 Claude 세션을 'git 워크트리'로 격리해 동시에 돌리기

한 터미널에서 기능을 만들면서 다른 터미널에선 Claude가 버그를 고치게 하되, 편집이 서로 충돌하지 않게 하는 워크플로. `claude --worktree <이름>`을 실행하면 각 워크트리가 자기 브랜치를 가진 별도 체크아웃으로 생성되어 한 작업 트리에서 파일이 엉키지 않는다. 다른 이름으로 같은 명령을 두 번째 터미널에서 돌리면 격리된 병렬 세션이 하나 더 뜬다. 서브에이전트·백그라운드 세션도 같은 방식으로 격리할 수 있어, 오래 걸리는 작업이 메인 브랜치를 막지 않는다.

  • 기본 동작: `claude --worktree feature-auth`는 `.claude/worktrees/`에 새 브랜치로 워크트리를 만든다. 이름을 비우면 `bright-running-fox` 같은 이름을 자동 생성. baseRef 설정으로 HEAD에서 분기할지 지정 가능
  • PR에서 바로: `claude --worktree "#1234"`는 origin에서 `pull/1234/head`를 받아 `.claude/worktrees/pr-1234`에 워크트리를 만든다. 세션 안에서 '워크트리에서 작업해'라고 말하면 EnterWorktree로도 생성됨
  • .worktreeinclude로 .env·secrets 같은 gitignore 파일을 워크트리에 복사(수동 `git worktree add` 경로일 때). git이 아니면 WorktreeCreate/WorktreeRemove 훅으로 SVN·Perforce·Mercurial 지원. 수동 정리는 `git worktree remove <경로>`
원본 →
AI 코딩 도구

Context Rot(Chroma 연구) — '컨텍스트만 길어져도' 18개 모델 전부 정확도가 무너진다

Chroma의 Context Rot 연구는 "긴 컨텍스트 창이면 긴 입력도 균일하게 처리한다"는 가정을 직접 겨냥한다. 연구진은 NIAH 변형, LongMemEval, repeated words처럼 일부러 단순한 과제에서 난이도는 고정하고 입력 길이·distractor·haystack 구조만 바꿨다. 그 결과 GPT-4.1, Claude 4, Gemini 2.5, Qwen3 등 18개 모델 모두가 길이가 늘수록 불안정해졌다. 핵심은 토큰을 많이 넣는 능력과 필요한 정보를 안정적으로 쓰는 능력이 다르다는 점이다. 실무 교훈은 RAG·에이전트 컨텍스트를 "다 넣기"보다, distractor 제거·핵심 300토큰 압축·근거 배치까지 설계해야 한다는 것이다.

  • NIAH 변형 — 질문·정답의 의미 유사도가 낮거나 distractor가 끼면 입력 길이가 늘수록 정답률이 떨어진다
  • LongMemEval — 11.3만 토큰 전체보다 핵심 300토큰만 넣을 때 모든 모델 점수가 더 높았다
  • 연구 수치 — 18개 모델·194,480회 호출·거부 0.035%; 재현 코드는 chroma-core/context-rot 공개
원본 →
AI 코딩 도구

서브에이전트 모델 라우팅 — 탐색은 Haiku, 리뷰는 Sonnet으로 강제해 비용 천장을 거는 법

Claude Code 서브에이전트의 모델 라우팅은 "좋은 모델 하나 고르기"가 아니라 역할별 비용·지연시간을 설정으로 고정하는 장치다. 정의 파일 프런트매터의 `model`에는 `sonnet`, `opus`, `haiku`, `fable`, 전체 모델 ID, `inherit`를 쓸 수 있고 생략하면 메인 대화 모델을 상속한다. 공식 문서는 Explore 내장 서브에이전트를 빠른 Haiku 읽기 전용 탐색대로 두고, 비용 통제 예시로 Haiku 같은 더 빠르고 저렴한 모델 라우팅을 든다. 실무 교훈은 반복 탐색·요약·가벼운 검토를 사람의 매번 선택에 맡기지 말고, 서브에이전트 파일과 조직 allowlist로 기본값을 잠그라는 것이다. 서브에이전트는 별도 컨텍스트 창에서 읽고 요약만 돌려주므로, 모델 비용과 메인 대화 컨텍스트 폭증을 같이 줄인다.

  • 해결 순서: CLAUDE_CODE_SUBAGENT_MODEL → 호출별 model 파라미터 → 정의 파일 model → 메인 대화 모델
  • Explore는 Haiku·읽기 전용 도구로 코드 탐색을 맡아 메인 컨텍스트를 보존한다
  • 조직 availableModels allowlist와 정의 파일 model을 함께 쓰면 비용·컴플라이언스 기본값을 코드처럼 리뷰할 수 있다
원본 →
AI 코딩 도구

에이전트 스킬의 '점진적 로딩' — 메타 100토큰만 항상 보이고, 본문은 필요할 때만 끌어오기

Agent Skills의 핵심은 SKILL.md를 한 번에 전부 먹이지 않는 점진적 공개(progressive disclosure)다. 세션 시작 때는 각 스킬의 name·description 같은 메타데이터만 보여 주고, 모델이 "지금 이 스킬이 필요하다"고 판단할 때 본문을 읽는다. 본문도 끝이 아니다. 스킬 폴더 안의 scripts, references, assets는 본문이 지시할 때 필요한 파일만 추가로 여는 구조라, 설치된 스킬 수와 실제 컨텍스트 비용이 1:1로 늘지 않는다. 그래서 description은 홍보 문구가 아니라 라우팅 조건이다. "무엇을 할 수 있다"보다 "언제 이 스킬을 써야 하는가"를 구체적으로 써야 제때 로드된다. 보안상으로는 스킬이 로컬 파일과 스크립트를 함께 가져올 수 있으므로, 출처·권한·실행 경계를 검토한 스킬만 설치해야 한다.

  • Discovery는 name·description만, Activation은 SKILL.md 본문, Execution은 필요한 scripts/references/assets만 추가 로드
  • description은 라우터다 — "언제 써야 하는지"를 좁게 써야 불필요한 스킬 로딩이 줄어든다
  • 설치 전 출처·권한·스크립트 실행 경계를 확인해야 한다
원본 →
AI 코딩 도구

Frequent Intentional Compaction — 컨텍스트를 40~60%로 유지하며 리뷰는 코드 아닌 '리서치·플랜'에 거는 워크플로

humanlayer의 ace-fca 문서는 코딩 에이전트 워크플로를 "컨텍스트 관리" 중심으로 다시 짠 사례다. 핵심은 컨텍스트가 가득 찰 때까지 밀어붙이지 않고, 사용률을 40~60% 근처로 유지하면서 리서치 → 플랜 → 구현을 분리하는 것. 구현 중에도 검증된 단계마다 목표, 접근, 완료한 단계, 현재 실패를 progress.md 같은 구조화 문서로 압축해 새 컨텍스트로 넘긴다. 문서의 BAML 사례는 이 방식이 마법이 아니라는 점도 같이 보여준다. 300k LOC Rust 코드베이스에서 빠른 성과가 났지만, 깊은 리서치·플랜 시간과 코드베이스 전문가 리뷰가 함께 있었다. 실무 교훈은 코드 리뷰보다 앞단 리뷰가 더 싸다는 것이다. 잘못된 리서치나 플랜은 잘못된 코드 수백 줄로 번지기 전에 잡아야 한다.

  • 원칙: 컨텍스트 사용률 40~60% 유지, 리서치→플랜→구현 분리, 단계별 검증 뒤 progress.md로 압축
  • BAML 사례: 300k LOC Rust 코드베이스에서 35k LOC 규모 취소+WASM 작업을 7시간에 초안화, 단 깊은 몰입과 전문가 리뷰가 전제
  • 서브에이전트는 역할극보다 컨텍스트 제어 수단 — 검색·읽기·요약 로그를 부모 창 밖에서 처리한다
원본 →
AI 코딩 도구

claude-code-security-review — PR마다 도는 Anthropic 공식 AI 보안 리뷰 액션(diff 인지·오탐 필터)

Anthropic이 공개한 claude-code-security-review(5,381★·MIT·Python 중심, 2026-06-27 GitHub API 확인)는 PR diff를 Claude로 의미 분석해 취약점을 찾고 해당 라인에 코멘트를 다는 GitHub Action이다. 단순 패턴 매칭이 아니라 코드 맥락을 읽어 SQL·command·XXE 등 인젝션, 인증·인가 결함, 비밀정보·PII 노출, 암호화 오용, RCE·역직렬화, XSS, TOCTOU 같은 로직 결함까지 본다. 핵심은 "AI 리뷰를 또 검증하는" 오탐 억제다. README는 DoS·레이트리밋·입증 안 된 입력검증·open redirect를 기본 제외한다고 설명하고, `/security-review` 명령 파일은 별도 서브태스크가 각 finding에 1~10 confidence를 매긴 뒤 8 미만을 버리게 한다. 같은 분석을 Claude Code 내장 `/security-review`로 개발 중에도 돌릴 수 있고, security-review.md를 `.claude/commands/`에 복사해 조직 기준으로 커스텀할 수 있다.

  • 도입은 워크플로 YAML 한 조각 — `anthropics/claude-code-security-review@main`에 `comment-pr: true`와 `CLAUDE_API_KEY`를 넘기면 PR head diff를 검토하고 라인 코멘트를 남긴다
  • 오탐 필터는 별도 검증 패스 — README의 제외 카테고리 + command 파일의 confidence 8 미만 폐기 규칙으로 "그럴듯한 경고"를 줄인다
  • 공식 경고: 프롬프트 인젝션에 하드닝되지 않았으니 신뢰 PR에만 쓰고, 외부 기여자 PR은 GitHub Actions 승인 뒤 실행하게 막아야 한다
원본 →
AI 코딩 도구

Serena(oraios) — 에이전트에게 IDE급 '심볼 단위' 코드 탐색·편집을 주는 MCP 툴킷(~24k★)

Serena는 Oraios의 MIT 오픈소스 MCP 툴킷으로, 2026-06-27 확인 기준 25,825★·1,718 fork·활성 저장소다. README가 붙인 한 줄은 "에이전트를 위한 IDE"다. 핵심은 에이전트가 파일 전체와 줄번호에 기대지 않고, LSP나 JetBrains 분석엔진을 통해 함수·클래스 같은 심볼 단위로 찾고·읽고·편집·리팩터링하게 하는 것. Claude Code·Codex·Gemini CLI·OpenCode, VS Code/Cursor/JetBrains 계열, Claude Desktop·Codex App 등 MCP를 받는 클라이언트에 붙을 수 있다. 기본 LSP 백엔드는 40개 이상 언어를 지원하고, JetBrains 유료 플러그인은 move·inline·debugging 같은 더 깊은 IDE 기능을 맡는다. 교훈은 "에이전트에게 더 긴 컨텍스트"보다 "정의·참조·리팩터링을 구조화된 도구로 주기"가 큰 레포에서 더 싸고 안정적인 경우가 많다는 점이다.

  • find_symbol / find_referencing_symbols / symbol overview로 필요한 정의·호출처만 컨텍스트에 올린다
  • 기본 LSP 백엔드는 40개 이상 언어, JetBrains 플러그인은 move·inline·debugging까지 확장
  • 공식 설치 주의 — MCP/플러그인 마켓플레이스 명령은 낡았으니 Quick Start의 uv 기반 설치를 따르라고 안내
원본 →
AI 코딩 도구

Agent Client Protocol(ACP) — '에디터'와 '코딩 에이전트'를 분리하는 개방형 표준(Zed·JetBrains)

ACP(Agent Client Protocol)는 코딩 에이전트와 에디터/IDE 사이의 통신을 표준화하는 개방형 프로토콜이다. LSP가 언어 서버를 에디터에서 분리했듯, ACP는 에이전트 구현과 에디터 UI를 분리한다. 프로토콜은 JSON-RPC 2.0 기반이며 initialize/authenticate/session/new/session/prompt 같은 흐름으로 세션을 만들고, 에이전트는 session/update로 메시지·툴 호출·계획·슬래시 명령 상태를 클라이언트에 알린다. 로컬 에이전트는 보통 에디터의 서브프로세스로 stdio를 쓰고, 원격 에이전트는 HTTP/WebSocket 지원을 확장 중이다. 2026년 현재 ACP Registry는 인증을 지원하는 호환 에이전트를 모아 배포하는 curated 목록으로 안정화되어, "에디터 하나에 모델 하나"가 아니라 에디터는 호스트, 에이전트는 교체 가능한 실행 엔진으로 보는 쪽에 힘을 싣는다.

  • 핵심 분리: 에디터/IDE는 Client, 코딩 에이전트는 Agent — 한쪽 구현이 다른 쪽 UI에 묶이지 않게 함
  • 통신 모델: JSON-RPC 2.0, 로컬 stdio, 원격 HTTP/WebSocket은 진행 중
  • 실무 효과: ACP Registry와 호환 클라이언트로 Claude·Codex·Cline류 에이전트를 같은 에디터 호스트에서 갈아끼우는 전략
원본 →
AI 코딩 도구

Conductor — 한 화면에서 Claude Code·Codex·Cursor를 '병렬로' 돌리는 맥용 오케스트레이터

Conductor(conductor.build)는 macOS에서 Claude Code·Codex·Cursor를 여러 격리 workspace로 동시에 돌리는 ADE(Agent Development Environment)다. 각 workspace는 별도 git worktree라 에이전트가 main을 직접 건드리지 않고, 한 화면에서 작업 상태를 보고 diff를 검토한 뒤 사람이 merge한다. 같은 축의 Orca(stablyai/orca·MIT·2026-06-27 기준 8,108★)는 macOS·Windows·Linux 데스크톱과 모바일 companion으로 넓히고, Claude Code·Codex·OpenCode·Pi 같은 CLI 에이전트를 worktree별로 실행한다. 교훈은 "에이전트를 많이 띄우기"보다 branch/worktree 격리, BYO 구독, diff-first 리뷰, human merge gate를 먼저 설계해야 병렬성이 실제 생산성이 된다는 점이다.

  • Conductor — macOS 앱, Claude Code·Codex·Cursor를 isolated workspace/worktree로 병렬 실행
  • Orca — cross-platform desktop+mobile companion, one prompt across five agents, CLI automation surface
  • 운영 포인트 — agent 실행보다 diff 검토·merge gate·worktree cleanup이 병목
원본 →
AI 코딩 도구

MCP Tool Search — MCP 서버 수십 개 붙여도 컨텍스트가 안 터지는 'on-demand 로딩'(Claude Code 기본값)

MCP 서버를 여러 개 붙이면 세션 시작 전에 도구 정의가 컨텍스트를 다 잡아먹는 'context pollution'이 오래 문제였다(한 개발자는 첫 프롬프트도 치기 전에 6.6만 토큰이 사라졌다고 기록). Claude Code의 MCP Tool Search는 세션 시작 시 도구 이름과 서버 instructions만 올리고, 실제 도구 정의는 Claude가 필요할 때 검색해서 불러온다. Anthropic은 2026-01-14에 이 기능을 공개했고, 공식 문서 기준 현재 기본값으로 켜져 있다. 실무 효과는 'MCP 서버를 더 붙여도 컨텍스트 영향이 거의 없다'는 것 — 그래서 서버 개수보다 서버 instructions를 잘 써두는 게 중요해진다.

  • 기본 동작(공식): 세션 시작 땐 도구 이름+서버 instructions만 로드, 정의는 ToolSearch로 필요할 때만 expand. Claude Code는 서버별 도구 수 상한을 두지 않고 '컨텍스트 예산'이 실질 한계
  • ENABLE_TOOL_SEARCH로 조절: unset/true=전부 지연, auto=정의가 컨텍스트 10% 안에 들면 미리 로드(auto:N으로 % 지정), false=전부 미리 로드. Vertex AI·비1차 ANTHROPIC_BASE_URL 프록시에선 기본 비활성
  • 제약(공식): tool_reference 블록을 지원하는 모델만 가능 — Haiku는 미지원, Vertex는 Sonnet 4.5·Opus 4.5 이상. 서버 작성자는 instructions를 스킬처럼 '언제 이 도구를 찾아야 하는지' 설명하게 쓰는 게 핵심
원본 →
AI 코딩 도구

DeepSWE(Datacurve) — 채점기 오류를 줄이고 '오래 걸리는 일'로 다시 줄 세운 코딩 에이전트 벤치마크

DeepSWE는 코딩 에이전트를 단발 버그픽스가 아니라 오래 걸리는 실제 엔지니어링 과제로 재는 벤치마크다. v1.1은 같은 113개 long-horizon task를 유지하되, 에이전트가 만든 커밋 패치만 뽑아 깨끗한 별도 컨테이너에서 검증하고 CTRF 테스트 리포트로 각 테스트의 통과·실패를 남긴다. 그래서 테스트 프레임워크를 monkey-patch하거나 실패 테스트를 숨기는 식의 지름길이 점수로 새기 어렵다. 2026-06-24 업데이트 기준 리더보드 상위권은 Claude Fable 5 70%±4, GPT-5.5 67%±6, Claude Opus 4.8 59%±2다. 교훈은 모델명 하나보다 task 난이도, harness 격리, 검증 컨테이너, 비용·스텝 수를 같이 봐야 한다는 점이다.

  • 113개 long-horizon task, 에이전트 작업 컨테이너와 검증 컨테이너를 분리
  • 커밋 diff만 적용해 채점하고 CTRF 리포트로 누락·실패 테스트를 드러냄
  • 점수만 보지 말고 비용, 출력 토큰, agent steps까지 함께 비교
원본 →
AI 코딩 도구

Context7(Upstash) — '낡은·환각 API'를 막으려 버전별 최신 문서를 매 요청에 끼워 넣는 MCP 서버(MIT)

Context7은 Upstash가 만든 MIT 라이선스 MCP 서버이자 CLI로, 에이전트가 오래된 학습 데이터에 기대다 존재하지 않는 API를 만드는 문제를 줄이려는 도구다. 라이브러리의 최신·버전별 문서와 코드 예제를 프롬프트 컨텍스트에 직접 넣어, "Next.js 14 미들웨어"처럼 버전이 중요한 질문을 문서 기반으로 답하게 한다. 현재 설치 경로는 두 갈래다. MCP 모드는 `resolve-library-id`로 라이브러리를 찾고 `query-docs`로 문서를 가져오며, CLI+Skills 모드는 `ctx7 library`와 `ctx7 docs`를 에이전트 스킬에서 호출한다. `npx ctx7 setup`은 모드와 대상 에이전트를 고르게 하고, 수동 설정은 `https://mcp.context7.com/mcp` 원격 서버와 API 키 헤더를 붙인다. 2026-06-28 확인 기준 GitHub 58,188★, 2,727 fork로 관심 신호가 크고 Thoughtworks Technology Radar에도 별도 항목이 있다. 단, 공개 저장소는 MCP 서버 소스이고 API 백엔드·파싱·크롤링 엔진은 비공개라 문서 품질을 맹신하지 말고 중요한 API는 원문 링크까지 확인해야 한다.

  • 두 사용 경로: MCP(`resolve-library-id`→`query-docs`) 또는 CLI+Skills(`ctx7 library`→`ctx7 docs`)
  • 설치/연결: `npx ctx7 setup`, 원격 MCP URL `https://mcp.context7.com/mcp`, API 키 권장
  • 검증 포인트: 58,188★·MIT·Thoughtworks Radar 신호는 강하지만, 백엔드/크롤러는 비공개라 원문 확인 필요
원본 →
AI 코딩 도구

공식 /code-review 플러그인 — '리뷰 4개 병렬 → 한 건씩 재검증'으로 오탐을 떨궈내는 구조

anthropics/claude-code 레포의 공식 code-review 플러그인은 AI 리뷰를 "한 번 세게 보기"가 아니라 발견과 검증을 분리한 파이프라인으로 만든다. 먼저 haiku가 PR이 닫힘·드래프트·자동/사소한 변경·이미 리뷰됨인지 보고 스킵 여부를 정하고, 변경 파일에 적용될 CLAUDE.md 경로만 모은다. sonnet은 PR 변경 요약을 만들고, 그 뒤 4개 리뷰 에이전트가 병렬로 돈다. sonnet 2개는 CLAUDE.md 준수만, Opus 2개는 변경 diff 안의 명백한 버그만 본다. 버그 에이전트는 diff 밖 컨텍스트를 읽지 않고, 컴파일/파싱 실패·항상 틀린 결과·명확한 규칙 위반 같은 HIGH SIGNAL만 남긴다. 스타일, 취향, 기존 코드 문제, 린터가 잡을 일은 제외한다. 더 중요한 부분은 마지막 검증이다. 발견된 각 이슈마다 별도 서브에이전트를 다시 병렬로 띄워 진짜인지 확인하고, 통과 못 한 항목은 버린다. 기본은 터미널 출력이며, `--comment`를 줬을 때만 GitHub 인라인 코멘트를 남긴다.

  • 스킵 판단 → 적용 CLAUDE.md 수집 → 변경 요약 → 4병렬 리뷰 → 이슈별 재검증 → 미검증분 폐기
  • 역할 분리: sonnet 2개는 CLAUDE.md 준수, Opus 2개는 diff 안의 명백한 버그만 확인
  • `--comment` 없으면 터미널 출력만. 코멘트는 검증된 고신호 이슈만, 중복 없이 1개씩
원본 →
AI 코딩 도구

Spotify Honk — Agent SDK·K8s pods·Slack @Honk·Fleet Management 위 백그라운드 agent

Spotify Honk는 "백그라운드 코딩 에이전트"가 단순히 IDE 안의 채팅 기능이 아니라, 기존 플랫폼 운영 능력 위에 올라가야 한다는 사례다. Spotify는 먼저 Fleet Management/Fleetshift로 저장소 대상 선정, PR 생성, 리뷰, 병합 흐름을 표준화해 두었고, Honk는 그 가운데서 복잡한 코드 수정을 맡는다. 2025년 글 기준 1,500개 이상 AI 생성 PR이 프로덕션에 병합됐고, 마이그레이션 작업은 손코딩 대비 60~90% 시간을 줄였다고 설명한다. 2026년 Code with Claude 글은 구조를 더 구체화한다. Honk는 Claude Agent SDK를 Spotify 자체 harness로 감싸 Kubernetes pod에서 여러 세션을 병렬 실행하고, trusted tools와 multi-OS CI build로 변경을 검증한다. Slack 대화 중 @Honk를 부르면 대화 맥락을 작업 입력으로 받아 PR을 돌려준다. 교훈은 "에이전트가 PR을 많이 만든다"가 아니다. Backstage 카탈로그, 표준화된 기술 스택, lint/static analysis, Fleetshift 같은 golden path가 있어야 에이전트 출력이 검토 가능한 변경으로 남는다.

  • Fleetshift가 대상·스케줄·상태를 맡고, Honk가 복잡한 코드 수정을 맡는 분리 구조
  • Claude Agent SDK + 자체 harness + Kubernetes pod + CI 검증으로 병렬 세션을 운영
  • Slack @Honk는 대화 맥락을 PR 입력으로 바꾸지만, 품질은 Backstage·표준화·lint guardrail에 기대고 있음
원본 →
AI 코딩 도구

mini-SWE-agent — '도구·설정 다 빼고' 100줄 bash만으로 SWE-bench 74%를 찍은 미니멀 에이전트(SWE-agent 후속)

mini-SWE-agent는 SWE-bench·SWE-agent 팀이 "에이전트 스캐폴드가 얼마나 작아질 수 있나"를 실험한 v2 미니멀 코딩 에이전트다. 핵심 agent class는 파이썬 약 100줄이고, 도구는 bash 하나만 두며 각 action을 `subprocess.run`으로 독립 실행한다. 대화 이력은 완전히 선형이라 trajectory와 LM 입력이 거의 같아 디버깅과 fine-tuning baseline에 유리하다. 그래서 빠른 로컬 CLI, 샌드박스 교체, FT/RL baseline, 벤치마크 실험에는 잘 맞고, 전용 도구를 많이 붙이는 실험은 전작 SWE-agent가 더 적합하다. README는 Meta·NVIDIA·IBM·Stanford·Princeton 활용 사례와 SWE-bench Verified 74%+를 함께 제시한다.

  • bash 하나 + subprocess.run — shell-first이고 sandbox 교체가 쉽다
  • 완전 선형 history — trajectory와 LM 입력이 거의 같아 디버깅·baseline에 유리
  • README가 제시하는 사용처 — local CLI·sandbox·FT/RL baseline·benchmark
원본 →
AI 코딩 도구

Gemini in Android Studio — Compose·Gradle·크래시 분석까지 읽는 Android 전용 AI 코딩 동료

Gemini in Android Studio는 Android 개발 전용 AI 코딩 도우미다. IDE 안에서 개발 질의응답, 코드 생성, 관련 자료 찾기, 베스트 프랙티스 안내를 처리하고, 공식 문서는 Compose UI 목업·디버깅, Gradle 빌드 오류 수정, Logcat/App Quality Insights 기반 크래시 분석을 대표 사례로 든다. 공개 기능은 Agent Mode, code completion, code transformation, unit test generation, file attachment, multimodal image attachment, commit message 작성, 문서화까지 넓다. 개인용은 무료 티어가 있고, `.aiexclude`로 Gemini가 볼 수 있는 코드를 제어할 수 있다. 핵심은 Android AI를 별도 브라우저 도구로 빼지 않고 IDE workflow 안에 넣어 컨텍스트 전환을 줄이는 것이다.

  • Android 전용 AI 도우미 — Compose UI·Gradle·crash analysis까지 IDE 안에서 처리
  • Agent Mode / code transform / unit test generation / file+image attachment / commit message
  • 무료 티어 + `.aiexclude` — 개인용 접근성과 코드 노출 경계를 함께 제공
원본 →
AI 코딩 도구

Kiro(AWS) — 코드보다 스펙을 먼저 굳히는 requirements.md·design.md·tasks.md 에이전트

Kiro는 AWS 계열의 에이전트형 개발 도구로, 기능과 버그 수정을 먼저 구조화한 뒤 구현으로 넘어가게 만든다. 공식 Specs 문서는 모든 spec이 `requirements.md`(또는 `bugfix.md`), `design.md`, `tasks.md`의 세 파일로 구성되며, Feature Specs는 Requirements-First 또는 Design-First 흐름으로 요구사항 수집·기술 설계·실행 계획을 순서대로 만든다고 설명한다. 잘 아는 기능에는 Quick Plan으로 세 산출물을 한 번에 만들 수 있고, 복잡한 기능이나 회귀 비용이 큰 버그에는 표준 Feature Spec과 Bugfix Spec이 더 적합하다. 실행 단계에서는 `tasks.md`의 상태를 추적하고, Run all Tasks가 의존성 그래프를 보고 독립 작업을 wave 단위로 병렬 실행한다. 교훈은 문서가 장식이 아니라, 에이전트가 무엇을 언제 실행해도 되는지 정하는 작업 경계라는 점이다.

  • `requirements.md`·`design.md`·`tasks.md` 3개 산출물 + Feature Specs의 Requirements-First / Design-First 흐름
  • Quick Plan은 requirements·design·tasks를 한 번에 생성하고, 표준 Spec은 승인 게이트를 남겨 둔다
  • Bugfix Specs는 root cause analysis·fix design·regression prevention을 분리하고, Run all Tasks는 wave 단위 병렬 실행
원본 →
AI 코딩 도구

Amp(Sourcegraph) — '토큰 아끼지 마라'를 철학으로 내건, 스레드·서브에이전트·Oracle로 미는 프런티어 코딩 에이전트

Amp는 Sourcegraph가 만든 터미널·에디터용 코딩 에이전트로, "프런티어 모델과 그다음에 올 것을 위해 만든 에이전트"를 표방한다. 설계 철학이 다른 도구와 갈리는데, 토큰을 아끼려 컨텍스트를 깎기보다 '제약 없이' 쓰는 쪽에 무게를 둔다 — 작업 품질을 위해 토큰 비용을 감수한다는 입장이다. 작업 단위는 '스레드(Thread)'로, 대화·작업 맥락이 영속 저장돼 살아있는 메모리이자 팀 협업·공유 수단이 된다(스레드 포킹으로 대안 시도도 가능). 서브에이전트는 전문 작업을 떼어 맡고 메인 스레드에 결과를 보고하며, 읽기·검색·진단 같은 독립 작업은 기본적으로 병렬로 돌린다(같은 파일·공유 계약을 건드리는 쓰기만 직렬화). 'Oracle'이라는 별도 도구로 더 강한 추론 모델에 어려운 분석을 위임할 수 있고, AGENT.md 파일로 규칙·제약을 코드베이스에 박아 둔다.

  • 철학적 차별점: 컨텍스트를 깎아 토큰을 아끼는 대신 '제약 없는 토큰 사용'으로 품질을 우선 — 비용보다 결과를 택하는 트레이드오프. CLI 실행 모드 `amp -x`는 유료 크레딧을 쓰고, Amp Free는 대화형에만 적용
  • 구조: '스레드'가 영속 메모리이자 협업 단위(포킹 지원) + 서브에이전트가 전문 작업을 병렬로 처리하고 메인에 보고. 독립 작업(읽기·검색·진단)은 기본 병렬, 같은 파일·타입·DB스키마·공개 API를 건드리는 쓰기만 직렬화
  • 도구·환경: 어려운 추론은 'Oracle' 도구로 더 강한 모델에 위임, AGENT.md로 규칙 주입, MCP 지원(`amp mcp add`). macOS·Linux·Windows(WSL)·JetBrains 2025.1+ 지원, `--stream-json`은 `--execute`와 함께 사용
원본 →
AI 코딩 도구

Repomix — 레포 전체를 'AI 친화 단일 파일' 하나로 싸서 LLM에 통째로 먹이는 패커(MIT·~26.3k★)

Repomix는 코드베이스 전체를 LLM이 소화하기 좋게 단일 파일 하나(repomix-output.xml 등)로 묶어주는 오픈소스 도구로, GitHub ~26.3k★·MIT 라이선스다(yamadashy/repomix). 에이전트가 도구로 코드를 탐색하지 않는 상황 — ChatGPT·Gemini·Claude 웹/데스크톱에 레포 맥락을 통째로 붙여 넣고 싶을 때 — 이 진가를 발휘한다. `npx repomix`만 치면 현재 디렉터리를 한 파일로 패킹한다. 수작업 파일 복사·붙여넣기를 없애주고, 버그 조사·보안 감사·구현 계획·서드파티 라이브러리 문서화 같은 '레포 스냅샷이 필요한' 작업에 그대로 쓰인다. LLM 친화 출력을 위해 XML/Markdown/플레인 등 포맷을 고르고, 토큰 수를 세어주며, 보안상 민감 정보(시크릿) 탐지·코드 압축으로 토큰을 줄이는 옵션도 제공한다.

  • 사용법: `npx repomix`로 설치 없이 현재 레포를 단일 파일로 패킹 → 그 파일을 LLM 채팅에 붙여 넣으면 전체 프로젝트 맥락 확보. repomix.com 웹 인터페이스와 GitHub 페이지에 'Pack' 버튼을 다는 크롬 확장도 있음
  • AI 친화 출력: XML·Markdown·플레인 등 포맷 선택, 토큰 카운팅으로 컨텍스트 예산 가늠, 코드 압축(주석 제거 등)으로 토큰 절감 — '에이전트가 못 도는' 모델에 레포를 통째로 넣을 때의 비용/한도 문제를 직접 다룸
  • 안전장치·용도: 시크릿 탐지로 민감 정보 유출 방지, 클론 없이 원격 레포 패킹 지원. 권장 용도는 버그 조사·보안 감사·구현 계획·서드파티 라이브러리 문서화 등 레포 스냅샷이 필요한 작업(JSNation Open Source Awards 2025 'Powered by AI' 후보)
원본 →
AI 코딩 도구

하네스 엔지니어링(Harness Engineering) — '모델 말고 모델 둘러싼 모든 것'을 설계해 에이전트 실패를 구조로 막기

Martin Fowler 사이트(Birgitta Böckeler, 2026-04-02)는 '하네스(harness)'를 "AI 에이전트에서 모델을 뺀 모든 것"으로 정의한다 — 즉 도구·피드백 루프·안전 경계·검증 시스템 전체. 핵심 발상은 "에이전트가 실수하면 그때그때 고치지 말고, 그 실수를 두 번 다시 못 하게 하는 해법(주로 더 나은 하네스)을 만든다"는 것으로, 같은 모델을 그대로 두고 하네스만 바꿔도 성능이 크게 움직인다. 실제로 LangChain은 모델이 아니라 하네스를 바꿔 Terminal-Bench 2.0 점수를 52.8%→66.5%로 끌어올렸다(주장). Fowler 글은 자기교정 확률을 높이는 'builder harness'와 사람의 개입을 꼭 필요한 곳에만 두는 'user harness'를 구분하고, 환경을 에이전트가 읽고 다루기 쉽게 만드는 'ambient affordances'와 토폴로지를 좁혀 가변성을 줄이는 접근을 제시한다.

  • 정의: 하네스 = 에이전트에서 '모델을 제외한 전부'(도구 오케스트레이션·검증 루프·컨텍스트/메모리·가드레일·관측성). 'AI 에이전트 성능은 모델이 아니라 하네스가 결정한다'가 2026년의 합의
  • 핵심 원칙: 에이전트가 실수하면 즉석 수정이 아니라 '다시는 그 실수를 못 하게 하는 해법'을 하네스로 만들어 영구화 — 같은 모델로도 점수가 출렁(LangChain Terminal-Bench 52.8%→66.5%는 하네스만 교체한 결과라는 주장)
  • Fowler/Böckeler 프레임: 'builder harness'(자기교정 유도)와 'user harness'(사람 개입을 필요한 지점에만)로 분리, 'ambient affordances'(환경을 에이전트가 읽기 쉽게)·토폴로지 고정으로 가변성 축소 — 좋은 하네스는 사람 입력을 없애는 게 아니라 '중요한 곳으로' 돌린다
원본 →
AI 코딩 도구

Agent Skills(SKILL.md) — Anthropic가 연 'Skill 한 번 만들면 어떤 에이전트서나' 오픈 표준, Cursor·Codex·Gemini CLI까지 채택

Agent Skills는 Anthropic이 만들어 오픈 표준으로 공개한, AI 에이전트에 전문 지식·워크플로를 주입하는 경량 포맷이다. 핵심은 SKILL.md 한 파일을 담은 폴더 — 메타데이터(name·description)와 지침을 적고, 스크립트·참고문서·템플릿을 함께 묶을 수 있다. Claude Code 전용이 아니라 Cursor·OpenAI Codex·Gemini CLI·GitHub Copilot·VS Code·OpenHands·Goose·Roo Code 등 수십 개 도구가 같은 포맷을 채택해, "한 번 만들면 어디서나 쓰는" 크로스 제품 재사용이 핵심 가치다.

  • 구조: 폴더 + 필수 SKILL.md(메타 name·description + 지침), 선택적으로 scripts/·references/·assets/ 번들. 별도 SDK·플러그인 형식이 아니라 마크다운 파일 하나가 진입점
  • 동작은 '점진적 공개(progressive disclosure)' 3단계 — ①Discovery: 시작 시 name·description만 로드 ②Activation: 작업이 description과 매칭되면 본문 전체를 컨텍스트로 ③Execution: 필요할 때만 번들 코드·참고파일 로드. 그래서 스킬 수십 개를 달아도 컨텍스트 footprint가 작다
  • 표준 채택 현황(agentskills.io 클라이언트 쇼케이스 기준): Claude Code/Claude·Cursor·OpenAI Codex·Gemini CLI·GitHub Copilot·VS Code·OpenHands·Goose·Roo Code·Amp·Factory·Kiro·Letta 등. openai/skills(Codex용 Skills Catalog)는 22.3k★. Anthropic이 발원해 오픈 표준으로 풀고 생태계가 확장 중
원본 →
AI 코딩 도구

OpenHands(All-Hands-AI) — 에이전트의 모든 행동을 'Docker 샌드박스'에서 돌리는 오픈소스 코딩 에이전트(MIT·~77k★)

OpenHands(옛 OpenDevin)는 코드를 짜고 수정할 뿐 아니라 명령 실행·웹 브라우징·API 호출까지 사람 개발자처럼 하는 오픈소스 자율 코딩 에이전트다. 핵심 차별점은 에이전트의 모든 행동을 격리된 Docker 런타임(샌드박스)에서 실행한다는 점 — 로컬 환경을 직접 건드리지 않고 컨테이너 안에서 셸·파일 편집·브라우저를 돌린다. CLI·웹 GUI·Cloud·Agent SDK 등 여러 형태로 쓰며 특정 모델에 묶이지 않고 다양한 LLM 공급자를 붙일 수 있다. 라이선스는 MIT(단, enterprise/ 디렉터리는 별도)이며 README 기준 약 77k★다.

  • 샌드박스 우선 설계 — 에이전트의 bash 실행·파일 편집·브라우징이 격리된 Docker 컨테이너 런타임 안에서 일어나, 자율 에이전트가 호스트를 망칠 위험을 구조로 줄인다(표준 설치도 Docker 기반)
  • 한 코어, 여러 표면 — 동일 엔진을 CLI(헤드리스 포함)·웹 GUI·OpenHands Cloud·파이썬 Software Agent SDK로 노출. 모델 비종속이라 Claude·GPT 등 원하는 LLM 공급자를 끼운다
  • SWE-bench Verified 상위권을 '주장' — 공식은 77.6% 해결(검증된 리더보드 수치라기보다 프로젝트 측 주장으로 받아들일 것). 라이선스 MIT·~77k★, '87% 버그 티켓 당일 해결' 류 마케팅 수치는 검증 안 됨
원본 →
AI 코딩 도구

android/skills(Google 공식) — Android 개발 베스트프랙티스를 'SKILL.md'로 에이전트에 주입하는 공식 스킬 묶음(Apache-2.0·~5.8k★)

Google Android 팀이 직접 내는 공식 에이전트 스킬 저장소다. developer.android.com의 모범 사례를 Agent Skills 오픈 표준(SKILL.md) 형식으로 묶어, LLM이 약한 Android 작업에서 헛짚지 않도록 '근거'를 깔아 준다. Expo의 expo/skills에 대응하는 네이티브 Android판 격으로, 2026-04-20 발표 뒤 빠르게 성장했고 현재 약 5.8k★·Apache-2.0 라이선스다. CLI가 감지된 모든 에이전트에 스킬을 깔아 주며(기본값 Gemini·Antigravity), LLM이 이미 잘하는 영역이 아니라 '평가상 못하는 워크플로'를 골라 채우는 게 설계 방향이다.

  • 공식·검증된 정보만 — Apache-2.0, 최신 릴리스 v1.0.2(2026-06-11), Agent Skills(SKILL.md) 오픈 표준 사용. 별 수(~5.8k★)는 시점에 따라 변하는 GitHub 수치이니 '주장'으로 볼 것
  • 실제 수록 스킬 예시 — jetpack-compose, navigation/navigation-3, performance/r8-analyzer, testing/testing-setup, system/edge-to-edge, build/agp/agp-9-upgrade, camera/camera1-to-camerax, wear/jetpack-compose-m3 등 마이그레이션·도구 워크플로 중심
  • 설계 철학 — 'LLM이 못하는 곳을 메운다'. 이미 잘하는 영역이 아니라 평가에서 underperform하는 use case를 겨냥하고, 외부 공개 기여는 현재 받지 않는다(공식 README 기준)
원본 →
AI 코딩 도구

Vibe Kanban(BloopAI) — Claude Code·Codex·Gemini CLI 여러 에이전트를 '칸반 보드'로 병렬 돌리는 오케스트레이션 레이어(Apache-2.0·~27k★)

여러 코딩 에이전트를 한 칸반 보드 위에서 동시에 굴리는 오픈소스 오케스트레이션 도구다. 각 작업을 'workspace'로 띄우는데, workspace마다 별도 git 브랜치·터미널·dev 서버가 붙고 내부적으로 git worktree로 격리돼 에이전트들이 서로의 작업을 침범하지 못한다. 그 위에서 diff 리뷰, 앱 프리뷰, PR 생성까지 한 화면에서 한다. `npx vibe-kanban` 한 줄로 실행되고 Claude Code·Codex·Gemini CLI·Copilot· Amp·Cursor·OpenCode·Droid 등 10여 개 에이전트를 지원한다(공식 README 기준). 다만 README는 현재 "Vibe Kanban is sunsetting"이라 밝혀, 오픈소스 도구의 운영 지속성을 함께 따져야 하는 사례이기도 하다.

  • 격리 모델 — workspace = 브랜치+터미널+dev서버 한 묶음, 그 토대가 git worktree. 에이전트가 main을 건드리지 않고 병렬로 돌게 만드는 게 핵심(Cursor 2.0·Conductor와 같은 worktree 계열 패턴)
  • 도구 비종속 — 한 보드에서 Claude Code·Codex·Gemini CLI·GitHub Copilot·Amp·Cursor·OpenCode·Droid·CCR·Qwen Code 등 '10+ 코딩 에이전트'를 섞어 쓴다. Rust(~50%)+TypeScript(~46%)로 작성
  • 지속성 주의 — README가 'Vibe Kanban is sunsetting'이라 명시하고 외부 PR도 사전 논의 없이는 받지 않는다. 별 수(~27k★)는 시점에 따라 변하는 GitHub 수치이니 '주장'으로 볼 것
원본 →
AI 코딩 도구

토스의 'Claude Code를 레이어드 아키텍처처럼' — 팀 지식을 Global/Domain/Local 3계층 플러그인으로 굳히기

토스 기술블로그(toss.tech)는 코딩 에이전트를 '개인 생산성 도구'에서 '팀의 일하는 방식'으로 끌어올리는 패턴을 제안한다. 핵심은 흩어진 규칙·노하우를 Claude Code 플러그인에 담되, 그 지식을 세 계층으로 나누는 것이다 — 전사 공통(보안·코딩 스타일)은 Global, 결제·정산·회원 같은 도메인 로직은 Domain, 특정 레포의 구현 디테일은 Local. 이렇게 계층화된 플러그인이 모이면 그 자체로 '살아있는 지식 베이스(Living Knowledge Base)'가 되고, 나아가 조직의 워크플로(예: /new-feature)를 배포하는 사내 마켓플레이스로 확장한다는 구상이다.

  • 지식 3계층 — Global(전사 보안·코딩 스타일) / Domain(팀·비즈니스 도메인 로직) / Local(레포별 구현 디테일·프로젝트 규칙). 한 CLAUDE.md에 다 밀어넣지 말고 책임에 따라 쪼개라는 게 요지
  • 비유의 출처 — '이전 글에서 Claude Code 구조를 레이어드 아키텍처에 비유했듯, 플러그인이 담는 지식도 계층화할 수 있다'. 코드 아키텍처 사고를 '지식 관리'에 그대로 적용
  • 팀 스케일 — 계층화된 플러그인 묶음 = Living Knowledge Base → 워크플로를 배포하는 '마켓플레이스 1.0'으로 확장. 개인 팁이 아니라 조직 차원 표준화가 목표 (toss.tech 자체 글, 수치 주장 없음)
원본 →
AI 코딩 도구

Ruflo(전 claude-flow) — Claude Code 위에 'queen 에이전트가 worker 떼를 지휘하는' 멀티에이전트 스웜 하네스(MIT·~59.8k★)

Reuven Cohen(ruvnet)이 만든 오픈소스 멀티에이전트 오케스트레이션 레이어로, 2026년 초 'claude-flow'에서 'Ruflo'로 개명했다(README 기준 ~59.8k★, MIT). 핵심 구조는 queen 에이전트가 계획·위임하고 다수 worker 에이전트가 병렬 실행하는 hierarchical 스웜이며, mesh·ring·star 등 토폴로지와 합의 프로토콜을 지원한다. Claude뿐 아니라 GPT·Gemini·Cohere·Ollama로 라우팅되는 모델 비종속 하네스이고, npm 패키지는 ruflo(구 claude-flow 이름도 호환 유지)로 깐다. 단, 성능·도구 수치는 프로젝트 자체 주장이며 한 외부 감사는 '주장된 MCP 도구 다수가 실제로는 동작 안 한다'고 지적했으니 수치는 그대로 믿지 말고 검증해서 쓰는 게 안전하다.

  • 구조 — queen-led hierarchical 스웜: 한 에이전트가 작업을 쪼개 위임하고 worker들이 병렬 처리, SQLite/임베딩 기반 메모리로 세션 간 컨텍스트를 유지한다고 README가 설명. 100+ 에이전트·다수 플러그인·MCP 도구를 묶어 제공한다고 주장
  • 모델 비종속 — 이름이 'Claude만'을 함의해 Ruflo로 개명. Claude·GPT·Gemini·Cohere·Ollama를 smart routing으로 갈아끼우며, npx ruflo / npx claude-flow 둘 다 같은 도구를 호출(하위호환)
  • 수치는 '주장'으로 — 속도·비용 절감·SWE 점수 등은 프로젝트 자체 벤치 주장이고, 2026년 한 독립 감사는 '광고된 MCP 도구·비용절감 수치가 실측과 어긋난다'고 반박. 도입 전 자기 환경에서 직접 측정 권장
원본 →
AI 코딩 도구

Crush(Charm/charmbracelet) — Go로 짠 '예쁜 터미널' 코딩 에이전트, 세션 중에 LLM을 갈아끼우는 모델 비종속 TUI(~25.4k★)

TUI 라이브러리로 유명한 Charm(charmbracelet)이 만든 터미널 기반 코딩 에이전트로, Go로 작성됐고 README 기준 ~25.4k★·라이선스는 FSL-1.1-MIT다. 다른 터미널 에이전트들과 묶이는 범주(OpenCode·goose·Aider 부류)지만 차별점은 'Charm다운' 글래머러스한 TUI와 모델 비종속성이다. Anthropic·OpenAI·Groq·OpenRouter 등 다수 공급자를 지원하고 OpenAI/Anthropic 호환 엔드포인트면 뭐든 붙으며, 한 세션 안에서 LLM을 바꿔 끼울 수 있다. 프로젝트별로 컨텍스트가 분리되는 세션 기반이고, MCP를 http·stdio·sse 세 전송으로 확장한다.

  • 정체성 — Charm 생태계(Bubble Tea 등 TUI 도구로 유명)가 내놓은 코딩 에이전트. Go 98%대, 라이선스 FSL-1.1-MIT, README상 ~25.4k★, macOS·Linux·Windows·BSD 계열까지 지원
  • 모델 비종속·세션 중 전환 — Anthropic/OpenAI/Groq/OpenRouter/Vercel AI Gateway 등 여러 공급자 지원, OpenAI·Anthropic 호환이면 연결, '세션 도중 LLM 교체' 가능. 프로젝트별 컨텍스트가 나뉘는 세션 기반
  • 설치·확장 — brew/npm(@charmland/crush)/winget/Arch/Nix/FreeBSD 등 패키지 다양, 'no configuration'으로도 동작하고 crush.json으로 설정. MCP를 http·stdio·sse로 붙여 도구 확장
원본 →
AI 코딩 도구

'Coding Beyond Your Training'(arXiv 2026) — Claude Code 도입이 개발자의 '쓰는 언어·레포 폭'을 넓힌다는 5,838명 패널 연구

이코노미스트 Alexander Quispe가 2026년 5월 arXiv에 올린 워킹페이퍼로, AI 코딩 어시스턴트 도입이 개발자 개인의 '기술적 프런티어'(다루는 언어·레포·커밋량)를 넓히는지를 GitHub 데이터로 추정한다. 2025-05~2026-01 사이 Claude Code가 GitHub에 퍼진 staggered rollout을 활용해, 개발자 5,838명을 28개월간 월 단위로 추적했다. '첫 Claude 공동저자(Co-authored) 커밋' 시점을 도입 기준으로 잡고, 아직 도입 안 한 개발자를 대조군으로 쓰는 staggered DiD 방식이다. 도입 후 월 커밋 +41개, 기여 레포 +1.5개, 사용 언어 수 +0.83, 신규 언어 +0.31 등 '양'과 '다양성'이 모두 늘었다고 보고한다.

  • 데이터 — 개발자 5,838명을 28개월 월 단위 패널로 추적, 처치는 '첫 Claude-co-authored 커밋' 시점으로 정의, not-yet-treated를 대조군으로 쓰는 staggered DiD
  • 효과(추정치) — 월 커밋 +41, 기여 레포 +1.5, 사용 언어 +0.83, 신규 언어 +0.31. '많이 짠다'를 넘어 '안 쓰던 언어·레포로 폭이 넓어진다'가 핵심
  • 한계 — 단독 저자 워킹페이퍼(미동료심사)이고 관측 데이터 기반 인과 추정이라 '도입이 원인'이라 단정 말 것. 실무 함의는 '에이전트가 개발자의 기술 반경을 넓힌다'는 가설 정도로
원본 →
AI 코딩 도구

superpowers(obra) — 'TDD·브레인스토밍·서브에이전트 리뷰'를 스킬로 강제하는 에이전트 방법론 프레임워크(MIT·~22.9만★)

Jesse Vincent(obra)이 만든 '에이전트 스킬 프레임워크이자 소프트웨어 개발 방법론'으로, 깔아두면 코딩 에이전트가 작업을 시작할 때 자동으로 트리거되는 스킬 묶음을 준다. 핵심은 도구가 아니라 '강제되는 워크플로'다. 에이전트는 먼저 목표를 캐묻고(brainstorming), 스펙·구현 계획을 만든 뒤, 작업마다 새 서브에이전트를 띄워 '스펙 준수 → 코드 품질' 2단계 리뷰를 거치며 자율적으로 진행한다. TDD 스킬은 RED-GREEN-REFACTOR를 강제하고 '테스트 전에 짠 코드는 삭제'한다고까지 명시한다. 특정 도구에 묶이지 않고 Claude Code·Codex·Gemini CLI· Factory Droid·OpenCode·Pi 등에 각각 설치해 쓴다. GitHub API 기준 ~229.8k★·MIT, 최신 v6.0.0(2026-06-16).

  • 강제되는 워크플로 — brainstorming(목표 캐묻고 대안 탐색→스펙), writing-plans, test-driven-development(RED-GREEN-REFACTOR 강제·테스트 전 코드는 삭제), systematic-debugging, requesting/receiving-code-review가 자동 트리거
  • 서브에이전트 주도 개발 — 작업마다 '새 서브에이전트'를 띄워 '스펙 준수 검토 → 코드 품질 검토' 2단계로 리뷰. 작성 패스와 리뷰 패스를 같은 컨텍스트에서 섞지 않는 게 설계 핵심
  • 도구 비종속 — Claude Code(/plugin install superpowers@claude-plugins-official)·Codex·Gemini(gemini extensions install)·Antigravity·Factory Droid·OpenCode·Pi 등 하네스별로 따로 설치. 사용자 지시가 항상 스킬보다 우선(CLAUDE.md가 'TDD 쓰지마'면 그게 이긴다)
원본 →
AI 코딩 도구

claude-code-router(musistudio) — Claude Code 요청을 가로채 '작업 종류별로' 다른·싼 모델로 흘려보내는 라우팅 프록시(MIT)

Claude Code를 Anthropic 모델에만 묶지 않고, 로컬 프록시를 끼워 요청을 다른 공급자/모델로 라우팅하는 오픈소스 도구다. Anthropic ↔ OpenAI 포맷을 변환해주기 때문에 OpenRouter·DeepSeek· Ollama·Gemini 등 OpenAI 호환 API면 Claude Code 인터페이스 그대로 붙는다. 핵심은 '한 모델로 다 처리'가 아니라 작업 성격에 따라 모델을 갈아끼우는 라우팅 규칙이다 — 기본 모델 외에 background(가벼운 백그라운드 작업), think(추론), longContext(긴 컨텍스트)처럼 라우터를 나눠, 백그라운드성 작업은 더 싸거나 로컬인 모델로 흘려보내 비용 천장을 거는 식이다. 세션 중 /model로 즉시 전환할 수도 있다. MIT 라이선스이며 Anthropic 공식 도구가 아닌 서드파티 프록시다.

  • 동작 방식 — Claude Code와 모델 사이에 로컬 프록시를 두고 Anthropic↔OpenAI 포맷을 번역. OpenRouter·DeepSeek·Ollama·Gemini 등 OpenAI 호환 API면 무엇이든 백엔드로 붙는다
  • 작업별 라우팅(비용 최적화 핵심) — default 외에 background·think·longContext 등 라우터를 나눠, 가벼운 백그라운드 작업은 싸거나 로컬인 모델로 보내고 무거운 추론만 비싼 모델에 맡기는 식으로 천장을 건다. /model로 세션 중 즉시 전환도 가능
  • 주의 — 비공식 서드파티 프록시(MIT). 라우팅 대상에 비(非)Anthropic·로컬 모델을 섞을 수 있다는 게 장점이자, 모델별 출력 품질·포맷 호환은 사용자가 검증해야 한다는 뜻
원본 →
AI 코딩 도구

ast-grep — 에이전트의 '찾아 바꾸기'를 텍스트가 아니라 '문법 트리(AST)'로 시키는 구조적 검색·치환 도구(Rust·MIT·~14.5k★)

ast-grep(명령어 sg)는 코드를 문자열이 아니라 tree-sitter로 파싱한 AST로 보고, '패턴 매칭'으로 검색·린트·치환을 하는 Rust CLI다. 패턴은 평범한 코드처럼 쓰되 $MATCH 같은 '$+대문자' 와일드카드로 임의의 AST 노드 하나를 잡는다. 텍스트 정규식과 달리 언어 문법을 알기 때문에, 함수 호출·인자 구조 같은 '의미 단위'를 정확히 잡아 대규모로 바꿀 수 있다. 그래서 LLM 에이전트가 'sed로 막 치환하다 줄 어긋나는' 실수 없이 코드를 안전하게 일괄 수정하게 하는 도구로 쓰인다(공식 agent-skill 저장소도 운영). 멀티코어를 쓰고 CLI로도 라이브러리로도 동작한다. (MIT, GitHub 기준)

  • 무엇 — tree-sitter 기반 AST 패턴 매칭 CLI. 패턴을 코드처럼 쓰고 $MATCH/$$$ 같은 와일드카드로 노드를 잡아 search·lint·rewrite. YAML로 린트 규칙도 정의. 멀티코어 활용·jQuery식 AST 순회 API 제공
  • 왜 에이전트에 좋나 — 정규식/sed는 '텍스트'만 보니 들여쓰기·괄호·동일 이름 변수에서 오작동하기 쉽지만, ast-grep은 언어 문법을 알아 '구조 단위'로 정확히 치환한다. LLM이 대규모 리팩터를 줄 어긋남 없이 시키는 데 적합(ast-grep 공식 agent-skill 저장소 존재)
  • 한계(공식 명시) — 타입·제어흐름·데이터흐름·테인트 분석 같은 깊은 의미 정보는 없다(그쪽은 Semgrep 영역). 즉 '구문은 정확하지만 의미 추론은 못 한다'. 보안 룰셋이 필요하면 ast-grep만으론 부족
원본 →
AI 코딩 도구

컨텍스트 엔지니어링(Anthropic 공식) — '프롬프트 한 줄' 말고 '에이전트가 매 턴 보는 전체 토큰'을 설계하는 법

Anthropic 응용AI팀이 2025-09-29에 낸 엔지니어링 글로, 프롬프트 엔지니어링의 다음 단계를 '컨텍스트 엔지니어링'으로 규정한다. 프롬프트가 '잘 쓴 한 번의 지시'라면, 컨텍스트 엔지니어링은 추론 매 순간 컨텍스트 창에 무엇을 넣을지 '큐레이션'하는 일이다. 핵심 원칙은 "원하는 결과가 나올 확률을 최대화하는, 가장 작은 고신호(high-signal) 토큰 집합"을 찾는 것 — LLM의 '주의 예산(attention budget)'은 유한하고, 토큰이 많아질수록 성능이 떨어지는 'context rot'이 생기기 때문이다. 길게 돌아가는 에이전트를 위해 compaction(대화 압축)·note-taking(외부 메모)·멀티에이전트(서브에이전트가 요약만 반환)·just-in-time 검색을 작업 유형별로 골라 쓰라고 권한다. (Anthropic 엔지니어링 블로그 기준)

  • 정의 — 프롬프트 엔지니어링은 '한 번의 지시를 잘 쓰기', 컨텍스트 엔지니어링은 '에이전트가 매 턴 보는 컨텍스트 창 전체(시스템 프롬프트·도구 결과·히스토리·검색물)를 매 순간 큐레이션'하기. 시스템 프롬프트는 하드코딩 로직과 모호한 지침 사이 'right altitude(적정 고도)'를 노려라
  • 핵심 원칙 — '주의 예산'은 유한하고 토큰이 늘면 'context rot'으로 성능이 떨어진다. 그래서 목표는 '원하는 결과 확률을 최대화하는 가장 작은 고신호 토큰 집합'. 데이터는 미리 다 채우지 말고 lightweight identifier(파일경로 등)만 들고 런타임에 끌어오는 just-in-time 방식
  • 긴 작업용 3패턴 — ① compaction: 왕복 대화는 요약해 다시 채운다 ② note-taking: 마일스톤형 작업은 외부 메모로 기억 ③ 멀티에이전트: 서브에이전트가 수만 토큰을 쓰되 메인엔 1,000~2,000토큰 요약만 반환하고 리드가 종합. 작업 성격에 맞춰 골라 써라
원본 →
AI 코딩 도구

Roo Code의 '코드베이스 인덱싱' — 'grep만 쓰는' 에이전트 시대에 굳이 벡터DB(Qdrant)로 의미 검색을 거는 선택(Apache-2.0·~24.2k★)

요즘 Claude Code·Cursor류 에이전트가 벡터DB를 안 띄우고 grep·파일트리·find으로 코드를 찾는 쪽으로 기울었지만, VS Code용 오픈소스 에이전트 Roo Code(Cline 포크)는 여전히 '코드베이스 인덱싱'으로 의미 기반(semantic) 검색을 건다. 동작은 ① tree-sitter로 코드를 함수·클래스 같은 의미 블록(100~1000자)으로 쪼개고 ② 임베딩을 떠서 ③ Qdrant 벡터DB에 저장한 뒤, 에이전트에게 codebase_search 도구를 쥐여 준다. 그러면 "사용자 인증은 어디서 처리하나" 같은 자연어 질의로 정확한 텍스트 일치가 아니라 '의미'로 코드를 찾는다. 대형·비공개·낯선 레포에서 grep으로 키워드를 모를 때 유리하다는 게 이 방식의 포지션이다. (GitHub·공식 문서 기준)

  • 동작 3단계 — tree-sitter로 의미 블록(100~1000자, 미지원 언어는 줄 단위 폴백) 분할 → 임베딩 → Qdrant 벡터DB 저장. 에이전트엔 codebase_search 도구로 노출돼, 텍스트 일치 아닌 '의미'로 관련 코드를 찾게 한다
  • 임베딩은 8종 선택 — OpenAI·Google Gemini·Ollama·OpenAI Compatible·Mistral·Vercel AI Gateway·Bedrock·OpenRouter. 공식 문서는 '현재 무료'인 Gemini를 권하고, Ollama로는 완전 로컬 임베딩도 가능. Qdrant는 클라우드나 Docker 로컬로 띄운다
  • 왜 지금 논쟁거리냐 — 다수 프런티어 에이전트(Claude Code·Cursor류)는 벡터RAG 대신 grep/파일트리로 회귀했다는 평가가 많다. Roo Code는 반대로 '키워드를 모르는 대형·비공개 레포'에선 의미 검색이 낫다는 쪽. tree-sitter 기반이라 코드를 '문법 단위'로 잘라 인덱싱한다
원본 →
AI 코딩 도구

Cline — VS Code 'Plan→Act' 코딩 에이전트 + 읽기 전용 서브에이전트(Apache-2.0·~63k★)

Cline은 VS Code·JetBrains·CLI/SDK로 동작하는 BYOK 멀티프로바이더 오픈소스 코딩 에이전트(Apache-2.0·~63k★). Plan/Act 2모드 — Plan에서 레포 탐색·질의·전략 수립, Act에서 diff·터미널·MCP 실행(기본 human-in-the-loop). Anthropic·OpenAI·Gemini·OpenRouter(200+)·Ollama/LM Studio까지. 2026 서브에이전트 — 메인이 명시적으로 띄우는 병렬 '읽기 전용 탐색대': 별도 컨텍스트로 코드베이스 조사 후 요약만 반환, 쓰기·MCP·파괴적 명령 불가. Claude Code 서브에이전트와 같은 컨텍스트 격리 발상이지만 탐색 전용으로 좁힘. Cursor(IDE)·Claude Code(터미널)와 달리 VS Code 확장+모델 비종속이 핵심.

  • Plan/Act — Plan에서 전략·Act에서 편집/명령, diff·터미널 승인이 기본값
  • BYOK 멀티프로바이더 — OpenRouter·Ollama·Bedrock·Azure/Vertex, MCP(cline mcp) 지원
  • 읽기 전용 서브에이전트 — 병렬 탐색·영향 범위 조사, 결과 요약만 메인에 반환
원본 →
AI 코딩 도구

Claude Squad — tmux+git worktree로 여러 코딩 에이전트를 한 터미널에서 병렬로 돌리는 TUI(AGPL·~7.8k★)

Claude Squad는 Claude Code·Codex·Gemini·OpenCode/Amp·Aider 같은 여러 AI 코딩 에이전트를 각자 격리된 작업공간에서 동시에 띄워 한 TUI로 관리하는 터미널 앱이다. 내부적으로 tmux로 각 에이전트 세션을 분리하고 git worktree로 작업물을 격리해, 한 레포 안에서 여러 태스크를 충돌 없이 병렬 진행한다. Conductor·Vibe Kanban 같은 GUI 오케스트레이터와 달리 터미널만으로 돌아가는 게 특징이며, 실행에는 tmux와 gh(GitHub CLI)가 필요하다.

  • 여러 에이전트를 한 화면에서 — Claude Code 한 칸, Codex 한 칸, OpenCode 한 칸 식으로 각 태스크를 독립 세션으로 띄워 동시에 돌리고 TUI에서 전환
  • tmux + git worktree 격리 — 세션 분리는 tmux가, 작업물 충돌 방지는 worktree가 담당. -p(profile) 플래그로 에이전트별 설정 지정
  • 주의점 — tmux 의존이라 네이티브 Windows 미지원, 프롬프트 자동수락(--autoyes)은 실험적, 라이선스가 AGPL이라 이를 네트워크 서비스로 확장할 땐 검토 필요
원본 →
AI 코딩 도구

claude-plugins-official — 회사들이 직접 올린 177+ 플러그인이 모이는 Anthropic 공식 마켓플레이스(~30k★)

anthropics/claude-plugins-official은 Anthropic이 직접 큐레이션하는 Claude Code 플러그인 공식 마켓플레이스다. AWS·Microsoft·MongoDB·Cloudflare·Figma·Atlassian·Notion·Playwright 등 회사들이 자사 도구를 스킬·서브에이전트·MCP 서버·LSP 묶음으로 올려두고, 한 줄 명령으로 골라 깐다. 거기에 Anthropic이 직접 번들한 code-review·frontend-design·ralph-loop·claude-md-management, 그리고 Python·Rust·Go·Java 등 언어별 LSP 플러그인까지 들어 있다. 이름이 비슷한 claude-plugins-community(3rd party 검수본)와는 별개다.

  • 설치 흐름 — 인터랙티브 첫 실행 시 자동 등록되며, 헤드리스/CI에선 `claude plugin marketplace add anthropics/claude-plugins-official`로 추가한 뒤 `/plugin install <이름>@claude-plugins-official`로 깐다(또는 `/plugin > Discover`로 탐색)
  • 무엇이 들었나 — 벤더 통합(aws-core·azure·mongodb·cloudflare·figma·github·playwright·context7·firecrawl…)부터 Anthropic 자체 워크플로(code-review·pr-review-toolkit·feature-dev·hookify·ralph-loop)와 사전제작 LSP(pyright·rust-analyzer·gopls·jdtls 등)까지 177개 이상
  • 주의 — 공식 마켓플레이스라도 Anthropic이 각 플러그인의 MCP 서버·코드를 통제하지 않는다고 명시. 설치·사용 전 신뢰할 수 있는 플러그인인지 직접 확인하라는 경고가 붙는다
원본 →
AI 코딩 도구

Rakuten 도입 사례 — Claude Code가 1,250만 줄 vLLM에서 '7시간 무인 코딩'으로 기능 하나를 끝낸 기업 레퍼런스

Anthropic이 공개한 Rakuten 고객 사례다. ML 엔지니어 Kenta Naruse가 1,250만 줄 규모의 오픈소스 라이브러리 vLLM에 활성화 벡터 추출 기능을 구현하라고 시키자, Claude Code가 사람이 코드를 직접 안 쓰고 가끔 가이드만 주는 상태로 7시간을 연속 자율 작업해 한 번에 완성했다고 한다. 결과물은 레퍼런스 대비 99.9% 수치 정확도였고, 회사 전체로는 신규 기능의 출시 소요가 24일→5일(79% 단축)로 줄었다는 게 사례가 내세우는 지표다. 단 이는 Opus 4 출시 시점(2025)에 함께 발표된 벤더 측 마케팅 사례이며, 수치는 Rakuten·Anthropic의 자체 주장임에 유의.

  • 핵심 수치(벤더 주장) — 7시간 연속 무인 코딩 / 출시 24일→5일(79%↓) / 복잡한 코드 수정 99.9% 정확도
  • 운영 패턴 — AI 담당 GM Yusuke Kaji의 표현: 'Claude Code에 4개를 위임하고 나는 1개에 집중해, 5개 작업을 병렬로 굴린다'
  • 맥락·한계 — Opus 4 발표(2025)와 묶여 나온 고객 레퍼런스다. 1,250만 줄 코드베이스에서의 단일 작업 일화이며 통제된 벤치마크가 아니므로, 일반 성능 보장이 아니라 '엔터프라이즈 자율 코딩이 가능했다'는 사례로 읽어야 한다
원본 →
AI 코딩 도구

awesome-claude-code(hesreallyhim) — 스킬·훅·슬래시커맨드·오케스트레이터를 '한 분류에 검증된 하나'로 골라주는 정전(正典) 큐레이션 목록(CC BY-NC-ND·~46.6k★)

awesome-claude-code는 hesreallyhim이 관리하는 Claude Code 생태계의 '정전' 큐레이션 목록으로, GitHub에서 약 46.6k 스타·4.1k 포크·1,157 커밋까지 활발히 갱신되고 있다(레포에서 직접 확인되는 사실). 단순 링크 덤프가 아니라 스킬·훅·슬래시커맨드·에이전트 오케스트레이터·애플리케이션·플러그인·상태줄·개발 도구를 분류별로 모으고, 동작하지 않는 도구는 잘라내고 동작하는 것만 '무슨 용도인지' 태깅하는 방식이라 '분류당 하나만 고르기'에 적합하다는 평가를 받는다. 이슈가 1,000건을 넘길 만큼 제출·검증이 활발하며, 레포 자체는 Python 98%로 구성된 자동 검증 파이프라인으로 목록을 관리한다. 라이선스는 CC BY-NC-ND 4.0(저작자표시·비영리·변경금지)이라 그대로 재배포·상업적 가공에는 제약이 있으니 '읽고 도구를 고르는' 용도로 쓰는 게 맞다.

  • 쓰는 법 — 새 도구를 막 깔기 전에 '이 분류에서 이미 검증된 것'을 먼저 확인하는 색인으로 사용. 동작 안 하는 건 컷, 동작하는 건 용도 태깅(주장이 아닌 큐레이션 정책)
  • 범위 — 스킬·훅·슬래시커맨드·오케스트레이터·플러그인·상태줄·앱·개발툴을 한곳에. 비슷한 aggregator(everything-claude-code 등)는 '전부 쏟아내기'라 성격이 다름
  • 사실 — github.com/hesreallyhim/awesome-claude-code, ~46.6k★·4.1k fork·480 open issues, 라이선스 CC BY-NC-ND 4.0(비영리·변경금지라 재배포 제약 있음)
원본 →
AI 코딩 도구

OpenAI가 SWE-bench Verified를 버렸다 — '실패한 테스트 중 59%가 결함, 모델이 정답을 외운다'며 공식 점수 보고 중단(2026-02)

2026년 2월, OpenAI의 Frontier Evals 팀은 코딩 에이전트 사실상 표준 지표였던 SWE-bench Verified의 점수 보고를 중단한다고 공식 발표했다(OpenAI 주장). 이유는 두 가지다. ① 결함 있는 테스트 — 자주 실패하던 어려운 문제 일부(전체의 약 27.6%)를 감사했더니, 기능적으로 맞는 답을 거부하는 결함 테스트가 그중 약 59.4%였다(문제 설명에 없는 정확한 함수명을 요구하거나, 무관한 동작을 검사). ② 학습 데이터 오염 — Django·Astropy 등 유명 오픈소스 파이썬 레포에서 문제를 뽑은 탓에, 주요 프런티어 모델들이 '태스크 ID'만 주면 정답 패치를 그대로 재현했다(OpenAI 주장). 결론은 "Verified 점수 개선은 더 이상 실제 개발 능력 향상이 아니라 '벤치를 얼마나 학습 때 봤는가'를 반영한다"이며, OpenAI는 비공개·카피레프트로 오염이 덜한 SWE-bench Pro로의 전환을 권한다.

  • 교훈 — 굿하트의 법칙: 지표가 목표가 되면 지표이길 멈춘다. AI 코딩 도구를 'Verified 80%' 같은 단일 숫자로 고르지 말 것
  • 수치 격차(보도된 OpenAI 감사값) — Verified ~80%대 모델이 오염에 강한 SWE-bench Pro 공개셋에선 ~23%로 급락. 감사 표본은 64회 독립 실행·138문항
  • 실무 — 사내 도구 평가는 공개 벤치 대신 '우리 비공개 레포로 만든 자체 태스크'를 쓰는 게 오염·과적합을 피하는 길. OpenAI도 전문가가 원본 태스크를 짜는 GDPVal 류로 투자 이동
원본 →
AI 코딩 도구

Codebuff(CodebuffAI) — '한 모델'이 아니라 파일선택·계획·편집·검토 4개 에이전트가 분업하는 오픈소스 코딩 에이전트(Apache-2.0·~6.5k★)

Codebuff는 자연어 지시로 코드베이스를 고치는 오픈소스 AI 코딩 에이전트로, 단일 모델에 다 맡기는 대신 역할이 다른 에이전트 여러 개가 협업하는 구조를 핵심으로 내세운다(README 주장). 예컨대 '인증 추가' 같은 작업이 들어오면 ① File Picker가 레포를 훑어 아키텍처를 파악하고 관련 파일을 찾고 ② Planner가 어떤 파일을 어떤 순서로 고칠지 계획하고 ③ Editor가 정밀 편집을 하고 ④ Reviewer가 변경을 검증한다. 이렇게 나누면 단일 모델 도구보다 컨텍스트 이해가 낫고 편집이 정확하며 오류가 적다는 게 프로젝트의 설명이다. CLI(`npm i -g codebuff`)뿐 아니라 SDK(`@codebuff/sdk`)로 에이전트를 프로덕션에 임베드할 수 있고, `/init`를 돌리면 knowledge.md와 `.agents/` 디렉터리(TypeScript 타입 정의)가 생겨 자기만의 커스텀 에이전트를 정의할 수 있다.

  • 핵심 구조 — File Picker(탐색)→Planner(계획)→Editor(편집)→Reviewer(검증) 분업. '서브에이전트로 컨텍스트를 나눠 오염을 막는' 멀티에이전트 패턴을 도구 자체가 기본값으로 박아둠
  • 확장 — CLI와 SDK 둘 다 제공(SDK로 앱에 코딩 에이전트 임베드). `/init`로 .agents/ TS 정의를 만들어 에이전트 행동을 직접 커스터마이즈, 광고 기반 무료판 Freebuff도 별도 존재
  • 사실 — github.com/CodebuffAI/codebuff, Apache-2.0, ~6.5k★. '단일 모델보다 낫다'는 정확도 우위는 벤치 수치가 아니라 프로젝트 주장이니 도입 전 자체 검증 권장
원본 →
AI 코딩 도구

CodeRabbit '인간 vs AI 코드' 리포트 — AI가 짠 PR이 결함 1.7배(PR당 10.83 vs 6.45건), '리뷰를 줄이지 말고 늘려라'

AI 코드리뷰 도구를 만드는 CodeRabbit가 2025년 12월 17일 발표한 'State of AI vs Human Code Generation' 리포트는, 오픈소스 PR을 자사 리뷰 엔진으로 분석해 AI가 관여한 코드가 사람만 짠 코드보다 결함이 더 많다고 보고했다. 핵심 수치는 AI-coauthored PR이 PR당 평균 10.83건의 문제를, 사람만 짠 PR은 6.45건을 내 약 1.7배 차이가 났다는 것. 유형별로는 가독성 문제가 약 3.15배로 가장 크게 벌어졌고, 로직·정확성 결함이 늘었으며 보안 취약점도 1.5~2배대로 증가했다. 함의는 분명하다 — AI로 '쓰는 시간'은 줄지만 '찾아 고치는 시간'이 늘어나므로, AI 도입 효과는 리뷰·검증 자동화를 함께 깔았는지에 달려 있다(리포트는 당연히 자사 도구에 유리한 프레이밍이니 숫자는 한 벤더의 주장으로 받아들일 것).

  • 수치(CodeRabbit 주장) — AI 관여 PR 10.83건/PR vs 사람 6.45건/PR ≈ 1.7배. 가독성 ~3.15배, 로직 결함 증가, 보안 1.5~2배대. 자사 리뷰 엔진으로 오픈소스 PR을 분석한 결과
  • 실무 교훈 — 'AI가 짰으니 리뷰 덜 해도 된다'는 정반대. AI 코드일수록 자동 코드리뷰(claude-code-security-review·Bugbot·/code-review 등)와 테스트 게이트를 PR 단계에 강제하라
  • 측정 — ROI를 보려면 'AI 작성 코드 비율 / PR당 결함 수 / 보안 발견 수'를 같이 추적. 도입률만 보면 품질 꼬리(review tail)가 숨는다. 단일 벤더 수치이니 사내 데이터로 교차검증
원본 →
AI 코딩 도구

GitHub Copilot, 정액제를 버리다 — 2026-06-01부터 'AI 크레딧' 사용량 과금으로 전환

GitHub가 2026-06-01부터 Copilot 전 요금제를 '프리미엄 리퀘스트 수'가 아니라 '소비한 토큰(=AI 크레딧)' 기반 사용량 과금으로 바꿨다. 모델과 입력·출력·캐시 토큰 양에 따라 비용이 매겨지고, 각 요금제에는 월 크레딧 할당량이 포함되며 초과분은 예산을 걸어 추가 구매한다. 고정 구독료는 그대로지만 '측정 단위'가 바뀐 셈이라, 에이전트 워크플로를 많이 돌리는 헤비 유저의 청구서가 출렁일 수 있다는 우려가 컸다(공식 디스커션에 400+ 댓글). 헤비 워크플로용 상위 'Copilot Max' 티어도 신설됐고, 코드 리뷰는 크레딧에 더해 Actions 분까지 소비하게 됐다.

  • 프리미엄 리퀘스트 → 토큰 기반 'AI 크레딧' 사용량 과금(2026-06-01)
  • 구독료는 유지·측정 단위만 변경 → 에이전트 헤비 유저 비용 변동성↑
  • 신규 'Copilot Max' 티어 추가, 코드 리뷰는 Actions 분도 소모
원본 →
AI 코딩 도구

Anthropic, '코드의 80%를 Claude가 쓴다' — 그리고 API 에러 800건을 자율로 고친 사례

Anthropic은 2026년 5월에 자사가 머지한 코드의 80% 이상을 Claude가 작성했다고 밝혔다. 대표 사례로, 한 엔지니어가 Claude를 붙여 끈질긴 API 에러군에 대해 800건 넘는 수정을 자율로 내보내 에러율을 1,000분의 1로 줄였다(엔지니어는 일감 선택·리뷰·머지 결정으로 루프 안에 남았다). 사양이 처음부터 명확하지 않은 가장 열린 사내 엔지니어링 과제에서의 성공률도 5월 76%로 6개월 만에 50%p 올랐다고 한다. 다만 보도는 '80% 작성·76% 성공'이 곧 '안전·유지보수·머지 가능'을 뜻하진 않는다고 분명히 선을 긋는다.

  • 2026-05 머지 코드의 80%+를 Claude가 작성(Anthropic 주장)
  • 엔지니어 1명이 Claude로 API 에러 800+건 자율 수정, 에러율 1/1000
  • '작성 비중·성공률'이 코드 품질·머지 적합성을 보장하진 않음(보도 명시)
원본 →
AI 코딩 도구

AGENTS.md는 정말 도움이 되나 — 실제 PR 124건으로 잰 '시간·토큰' 실증 연구(arXiv 2026)

에이전트 지침 파일 AGENTS.md를 두면 정말 빨라지는지를 실제 머지된 GitHub PR로 처음 정량 측정한 arXiv 연구다. 10개 레포·124개 PR을 골라 코드를 머지 직전 상태로 되돌린 뒤, AGENTS.md 유무만 다르게 해 OpenAI Codex(gpt-5.2-codex)를 도커에서 동일 조건으로 돌려 비교했다. 결과 AGENTS.md가 있을 때 실행 시간 중앙값이 약 28.6%(98.6s→70.3s) 줄고 출력 토큰 중앙값도 약 16.6% 감소했으며, 둘 다 통계적으로 유의했다. 다만 입력 토큰 중앙값은 거의 그대로였고, 토큰 절감은 '소수의 고비용 실행'에서 주로 나왔다. 정답 여부(정확성)는 50건 샘플로 '비어있지 않은 코드 변경'만 확인했을 뿐 본격 평가는 후속 과제로 남겼다.

  • 10레포·124 PR을 페어 설계로 비교(AGENTS.md 유무만 차이)
  • 실행 시간 중앙값 ≈ -28.6%, 출력 토큰 중앙값 ≈ -16.6%(유의)
  • 절감은 '소수 고비용 실행'에 집중, 정확성 평가는 후속 과제
원본 →
AI 코딩 도구

코딩 에이전트 7종 MCP 클라이언트 보안 비교 — '버그'가 아니라 '구조'가 뚫린다(arXiv 2026)

'AI 개발 도구는 프롬프트 인젝션에 면역인가'를 묻는 arXiv 연구가 MCP 클라이언트 7종(Claude Desktop, Claude Code, Cursor, Cline, Continue, Gemini CLI, Langflow)을 적대적으로 비교 테스트했다. Cursor(1.6.45)는 네 가지 공격이 모두 통해 가장 취약했고, Claude Code(2.0.25)는 '낮음~중간' 위험으로 결과가 갈렸다. 핵심 결론은 대부분의 취약점이 구현 버그가 아니라 '신뢰 모델·검증 계층 부재·샌드박싱 부재' 같은 근본 아키텍처 결정에서 나온다는 것 — LLM이 명령과 데이터를 같은 경로로 읽어 둘을 완벽히 구분하지 못하기 때문이다. 따라서 보안은 사후 추가가 아니라 설계 단계부터 넣어야 한다고 못박는다.

  • MCP 클라이언트 7종 적대 테스트: Cursor가 4개 공격 모두 통과(최취약)
  • 취약점 대부분은 구현 버그 아닌 '신뢰모델·검증·샌드박스 부재' 구조 문제
  • LLM이 명령·데이터를 한 경로로 읽음 → 보안은 설계 단계부터 넣어야
원본 →
AI 코딩 도구

PewDiePie의 'Odysseus' — 유튜버가 던진 MIT 라이선스 self-hosted AI 워크스페이스(2026-05-31)

구독자 최다 유튜버 Felix Kjellberg(PewDiePie)이 2026-05-31 자기 기기에서 통째로 돌리는 오픈소스 AI 워크스페이스 Odysseus를 공개했다. 채팅·자율 에이전트·딥리서치·문서·이메일·캘린더·노트에 더해, 에이전트가 파일 찾기·포맷 변환·코드 실행·웹 브라우징을 알아서 하고 영속 메모리로 학습한다. Python·FastAPI·SQLite·ChromaDB·Docker 스택에 Ollama·llama.cpp·vLLM 로컬 구동과 OpenAI·OpenRouter API를 함께 물린다(MIT). '데이터를 회사 서버에 안 넘긴다'는 프라이버시·소유권이 철학이지만, 클라우드 API를 붙이면 데이터가 외부로 나간다는 단서가 붙는다. 출시 48시간에 별 3만, 6/4 기준 4.4만+로 폭발적 관심을 모았다(주장).

  • 유튜버 PewDiePie가 만든 self-hosted AI 워크스페이스(MIT, 2026-05-31)
  • Python/FastAPI/SQLite/ChromaDB/Docker + Ollama·llama.cpp·vLLM 로컬 구동
  • '로컬이면' 프라이버시지만 클라우드 API 연결 시 데이터는 외부로
원본 →
AI 코딩 도구

OpenAI GPT-5.5 'Spud' — GPT-4.5 이후 첫 완전 재학습 에이전트 모델(2026-04-23)

OpenAI가 2026-04-23 코드네임 'Spud'로 GPT-5.5를 공개했다. GPT-4.5 이후 첫 '처음부터 다시 학습한' 베이스 모델이라는 점이 핵심으로, 최소한의 사람 개입으로 다단계 컴퓨터 작업을 끝내도록 설계된 에이전트형 모델이다. 공식 발표 기준 Terminal-Bench 2.0에서 82.7%, GDPval 84.9%를 찍었다고 한다(OpenAI 주장). ChatGPT의 Plus·Pro·Business·Enterprise와 Codex에 함께 풀렸다. 벤치마크는 '모델 단독'이 아니라 '에이전트+모델 쌍'으로 읽어야 하며, 같은 시점 Terminal-Bench 2.1 공개 리더보드에서는 Codex CLI+GPT-5.5가 1위(83.4%)로 보고됐다.

  • GPT-4.5 이후 첫 완전 재학습 베이스 모델, 코드네임 'Spud'(2026-04-23)
  • Terminal-Bench 2.0 82.7%·GDPval 84.9%(OpenAI 공식 발표 주장)
  • ChatGPT 유료 티어·Codex에 동시 배포, 에이전트형 다단계 작업 지향
원본 →
AI 코딩 도구

Cursor Composer 2.5 — 'Composer 2 두 달 만'에 나온 자체 모델, Bugbot까지 갈아끼우다

Cursor가 자체 에이전트 모델 Composer 2를 낸 지 약 두 달 만에 Composer 2.5를 내놨다. CursorBench 과제를 평균 1달러 미만으로 끝낸다고 주장하는데, 같은 과제에서 Opus 4.7·GPT-5.5는 3~11달러가 든다는 비교를 함께 내세운다. 가격은 Standard 티어가 입력 100만 토큰당 $0.50·출력 $2.50, Fast 티어가 입력 $3.00·출력 $15.00다. Composer 2.5는 Cursor의 PR 리뷰 봇 Bugbot도 구동하게 됐는데, 평균 리뷰 시간이 약 5분에서 ~90초로 줄고 리뷰당 버그 검출이 평균 0.56→0.62로 10% 늘면서 실행 비용은 ~22% 낮아졌다고 한다(모두 Cursor 주장).

  • Composer 2 출시 ~2개월 만의 자체 모델, CursorBench 과제 평균 <$1 주장
  • 가격: Standard 입력 $0.50/출력 $2.50, Fast 입력 $3.00/출력 $15.00(100만 토큰)
  • Bugbot도 2.5로 전환 → 리뷰 ~90초·검출 +10%·비용 -22%(주장)
원본 →
AI 코딩 도구

SlopCodeBench — 코딩 에이전트가 '오래 고칠수록' 코드가 망가지는 걸 재는 벤치마크(arXiv 2026)

장기·반복 작업에서 코딩 에이전트가 시간이 갈수록 코드를 어떻게 퇴화시키는지를 따로 재겠다는 언어 비종속 벤치마크 SlopCodeBench(SCBench)다. 20개 문제를 93개 체크포인트로 쪼개, '정확성 테스트는 통과하지만 구조는 침식되는' 구간을 추적한다. 핵심 관찰은 (1)코드가 특정 '구조적 끌개(attractor)'로 수렴하고, (2)품질이 실행 궤적마다 갈라지며, (3)리팩터링·개선이 정확성 테스트로는 안 잡히는 결함을 새로 들여온다는 것. 기존 연구가 시간에 따른 장황함·구조 침식을 추적하지 않았다는 공백을 메운다고 주장한다.

  • 장기 반복 작업의 '코드 퇴화'를 20문제·93체크포인트로 추적
  • 정확성 테스트는 통과해도 구조가 침식 → 새 결함이 숨어듦
  • 기존 벤치마크가 안 보던 '시간에 따른 구조 침식'을 겨냥
원본 →
AI 코딩 도구

Builder Methods 'Agent OS v3' — 스펙 작성은 'Plan Mode'에 넘기고 표준만 주입하는 SDD 키트(2026)

스펙 주도 개발(SDD) 도구 Agent OS가 '2026용으로 더 가볍고 정렬된' v3를 냈다. 가장 큰 변화는 스펙 작성을 Agent OS 명령이 직접 하지 않고 Claude Code(또는 Cursor 등)의 Plan Mode에 위임한다는 점 — 대신 /shape-spec이 표준·제품 미션을 고려한 질문을 던져 더 정렬된 스펙을 만들고 그 계획을 Agent OS 스펙 폴더에 자동 저장한다. /discover-standards로 코드베이스에서 표준을 발굴·제안·생성하고, /inject-standards로 대화·플랜·스킬 어디에든 index.yml 기반으로 관련 표준만 골라 주입한다. 산출물이 전부 마크다운이라 도구를 안 가린다.

  • v3 핵심: 스펙 작성을 에이전트의 'Plan Mode'에 위임
  • /shape-spec(정렬된 스펙)·/discover-standards·/inject-standards(index.yml)
  • 산출물이 마크다운 → Claude Code·Cursor 등 도구 비종속
원본 →
AI 코딩 도구

SWE-bench Pro 공개셋 현황(2026-06) — 1위 GPT-5.4도 60% 못 넘고, 비공개셋은 더 떨어진다

오염(학습 시 정답 노출)에 강한 차세대 벤치마크 SWE-bench Pro의 공개셋(731 태스크, Pass@1) 2026-06-09 기준 현황이다. GPT-5.4(xHigh)가 59.1%로 1위로, 신규 Muse Spark보다 4.1%p, 최고 Claude 런(Opus 4.6 thinking, 51.9%)보다 7.2%p 앞선다. 핵심은 오염 통제용 '비공개 상용셋'으로, 인터넷에 없는 스타트업 18곳의 비공개 코드베이스 276 태스크에서 점수가 크게 떨어진다는 점 — 가장 강한 오염 통제 장치라는 주장이다. 오픈웨이트는 Pro에서 크게 밀려, 표준 스캐폴딩 리더보드 1위가 qwen3-coder-480b로 38.7%에 그친다.

  • 공개셋(731태스크) 1위 GPT-5.4 59.1% — 최고 Claude 51.9%(Opus 4.6)
  • 비공개 상용셋 276태스크(스타트업 18곳)에서 점수 급락 = 오염 통제
  • 오픈웨이트는 Pro에서 부진(표준 스캐폴딩 1위 qwen3-coder 38.7%)
원본 →
AI 코딩 도구

백그라운드 코딩 에이전트 — '맡기고 잊는' 비동기 에이전트가 2026 주류가 되다

백그라운드 코딩 에이전트란 격리된 클라우드 샌드박스에서 비동기로 도는 'AI 소프트웨어 엔지니어'다. GitHub 이슈·Linear 티켓·Slack 메시지 같은 일감을 맡기면 수 분~수 시간 혼자 일한 뒤 PR을 돌려준다 — 타이핑을 보조하는 인라인 도구와 정반대로 '티켓→클라우드 샌드박스→자율 편집→PR→사람 리뷰' 한 사이클을 돈다. Devin(2024 말)으로 장기 에이전트 역량이 무르익은 뒤 2025년 Codex Cloud·Cursor Background Agents·Jules가 쌓였고, Anthropic의 Claude Code Remote Tasks가 2026-03-20 합류하며 카테고리가 주류가 됐다. 다만 모든 백그라운드 에이전트는 레포·CI 시크릿을 만지려 '범위가 좁고 회수 가능한 비인간 ID'가 필요해, 기업이 보안 통제로 다루기 시작했다.

  • '티켓→클라우드 샌드박스→자율 편집→PR→리뷰' 비동기 사이클
  • Devin→Codex Cloud·Cursor BG·Jules→Claude Code Remote Tasks(2026-03-20)
  • 에이전트마다 '범위 좁고 회수 가능한 비인간 ID'가 새 보안 통제 지점
원본 →
AI 코딩 도구

Greptile — 디프가 아니라 '레포 전체'를 인덱싱해 파일·서비스 사이 버그를 잡는 코드리뷰 봇

Greptile은 PR의 디프만 보는 게 아니라 코드베이스 전체를 인덱싱해, 파일·서비스·의존성 '사이'에 숨은 버그를 찾는 AI 코드리뷰 도구다. 변경이 아키텍처를 타고 어떻게 번지는지를 추적하고, 발견을 심각도로 분류해 신호 대 잡음비를 높이려 한다. 가격은 사용자당 월 $30(오픈소스·시리즈A 이전 스타트업은 무료/할인). 독립 평가에서 '버그 검출률이 가장 높지만 오탐률도 가장 높다'는 트레이드오프가 거론된다 — 진짜 버그도, 잡음도 더 많이 나온다는 뜻(평가 출처별 편차 큼). 2026년 코드리뷰 시장은 PR 리뷰 댓글의 상당수를 자동 리뷰어가 다는 단계로 성숙했다.

  • 디프가 아니라 '레포 전체 인덱싱'으로 파일·서비스 간 결함 추적
  • 가격 사용자당 월 $30(OSS·초기 스타트업 무료/할인)
  • '최고 검출률 ↔ 최고 오탐률' 트레이드오프(평가 출처별 편차)
원본 →
AI 코딩 도구

한국 IT 기업 코딩 에이전트 도입 사례 — 토스페이먼츠·당근·채널톡의 공통 원칙

2026년 한국 IT 기업들의 코딩 에이전트 도입 사례에서 공통 패턴이 보인다. 토스페이먼츠는 MCP 기반 AI 연동 서버를 만들어 PG 연동을 자동화하되, 아키텍처 설계와 결제 안정성 판단은 엔지니어가 쥐었다. 당근은 전사 AI 전환을 선언하고 해커톤·피처톤으로 지표 요약·에러 분석·매물 요약 같은 반복 업무를 자동화해 실험·배포 주기를 높이되 제품 방향과 핵심 의사결정은 사람 중심으로 뒀다. 채널톡은 Cursor를 전사 도구로 도입해 IDE까지 바꾸고 온보딩·리팩터링·PR 리뷰·UI 구현을 AI 중심으로 재설계했지만 구조 설계·품질 최종 책임은 사람이 진다. 세 사례의 공통 원칙: '정형·반복 작업은 위임하되, 설계·품질·핵심 판단은 사람이 책임진다.'

  • 토스페이먼츠: MCP 연동 서버로 PG 연동 자동화(안정성 판단은 사람)
  • 당근: 전사 전환·해커톤으로 반복 업무 자동화(의사결정은 사람 중심)
  • 채널톡: Cursor 전사 도입으로 IDE까지 교체(품질 책임은 사람)
원본 →
AI 코딩 도구

SWE-Skills-Bench — 에이전트 스킬은 만능 부스터가 아니라 '맞춤 지식'이다

SWE-Skills-Bench는 SKILL.md 같은 절차 지식이 실제 소프트웨어 작업에 얼마나 도움 되는지 재는 벤치마크다. 공개 레포의 고정 커밋, 명확한 요구사항, 검증 테스트, 스킬 문서를 짝지어 '스킬 있음/없음'을 비교한다. 논문 초록의 핵심 결과는 차갑다: 49개 스킬 중 39개는 pass-rate 향상이 0이고 평균 이득은 +1.2%에 그쳤다. 토큰 오버헤드는 경우에 따라 451%까지 늘었고, 버전이 안 맞는 지침은 오히려 성능을 깎았다. 교훈은 스킬을 많이 까는 게 아니라, 현재 레포·버전·작업에 정확히 맞는 좁은 스킬만 쓰는 것이다.

  • 49개 public SWE skills + 고정 커밋 레포 + 요구사항 + 실행 테스트로 paired 평가
  • 39/49 스킬은 pass-rate 향상 0, 평균 이득 +1.2%; 일부는 버전 불일치로 성능 하락
  • 스킬은 범용 마법이 아니라 도메인·버전·작업 적합성이 맞을 때만 값이 난다
원본 →
AI 코딩 도구

Codex /usage — 토큰 활동을 CLI 안에서 바로 보는 새 계기판

OpenAI Codex CLI 0.140.0은 `/usage` 뷰를 추가해 계정 토큰 활동을 일간·주간·누적 단위로 볼 수 있게 했다. 코딩 에이전트를 오래 돌릴 때 가장 먼저 무너지는 것은 코드가 아니라 운영 가시성이다. 사용량을 외부 대시보드나 추측에 맡기면 자동화 루프가 한도에 부딪힌 뒤에야 멈춘다. `/usage`는 터미널 작업 흐름 안에서 비용·한도 신호를 바로 확인하게 해, 긴 세션·서브에이전트·반복 검증을 어디까지 밀어도 되는지 판단하는 작은 제어면이 된다. 같은 릴리스는 `/goal` 대용량 입력 보존, 영구 세션 삭제, Claude Code 설정 가져오기 같은 운영 기능도 함께 넣었다. GitHub 레포는 2026-06-18 조회 기준 91.8k★, 최신 릴리스 0.140.0(2026-06-15)으로 활발히 유지되고 있다.

  • 0.140.0 신기능: `/usage`로 일간·주간·누적 토큰 활동 확인
  • 긴 자동화 루프에서 비용·한도 신호를 터미널 안에 고정
  • GitHub 91.8k★·848 릴리스, 최신 0.140.0(2026-06-15) 기준
원본 →
AI 코딩 도구

GitHub Agent Apps — 마켓플레이스 앱처럼 설치하는 코딩 에이전트

GitHub Agent Apps는 AI 에이전트를 GitHub App처럼 설치해 이슈·PR·Agents UI에서 바로 호출하게 하는 기능이다. GitHub의 2026-06-02 changelog는 첫 파트너 앱을 Marketplace에서 설치하고, 관리자가 활성화하면 세 가지 진입점 — 이슈 assignee로 지정, PR 댓글에서 @멘션, Agents UI에서 프롬프트 입력 — 으로 쓸 수 있다고 설명한다. 중요한 변화는 에이전트가 IDE 밖으로 나와 GitHub 워크플로 자체의 '할당 가능한 작업자'가 된다는 점이다. Amplitude, Bright Security, Endor Labs, LaunchDarkly, Miro, Sonar, PagerDuty, Packfiles, Octopus Deploy가 첫 wave로 공개됐고, GitHub Docs는 사용량이 Copilot cloud agent와 같은 방식으로 AI credits를 소비한다고 못박는다.

  • 설치 모델: GitHub Marketplace의 GitHub App처럼 설치·관리자 활성화
  • 진입점: 이슈 assignee, PR @멘션, Agents UI 프롬프트
  • 첫 wave 9개 파트너, 사용량은 Copilot cloud agent처럼 AI credits 과금
원본 →
AI 코딩 도구

GitHub Agentic Workflows — 자연어 마크다운을 Actions YAML로 컴파일하는 에이전트 자동화

GitHub Agentic Workflows는 이슈 분류, CI 실패 분석, 문서 업데이트처럼 추론이 필요한 반복 작업을 GitHub Actions 안의 코딩 에이전트로 자동화하는 public preview다. 핵심은 자동화를 자연어 Markdown 파일로 정의하면 표준 Actions YAML로 컴파일된다는 점이다. 그래서 새 에이전트 플랫폼을 따로 운영하는 대신 기존 runner group, 정책, Actions 승인 흐름을 재사용한다. 보안 장치도 제품의 중심에 있다: 기본 읽기 전용 권한, sandboxed container, Agent Workflow Firewall, safe outputs, threat detection 작업을 거친다. 같은 날 업데이트로 장기 PAT 없이 Actions 기본 GITHUB_TOKEN을 쓸 수 있게 됐고, 조직 과금은 copilot-requests: write 권한과 비용 관리 도구로 통제한다.

  • 자연어 Markdown 자동화 정의 → 표준 GitHub Actions YAML로 컴파일
  • 기본 read-only, sandbox, firewall, safe outputs, threat detection으로 안전장치 내장
  • PAT 없이 GITHUB_TOKEN 사용 가능, 조직 AI credits 과금·사용량 cap 관리
원본 →
AI 코딩 도구

Supabase Agent Plugin — MCP 서버와 스킬을 한 번에 까는 백엔드 작업 키트

Supabase Agent Plugin은 AI 코딩 에이전트가 Supabase 프로젝트를 다룰 때 필요한 MCP 서버와 agent skills를 한 번에 설치하게 해주는 공식 플러그인이다. MCP 서버는 테이블 조회, SQL 실행, 마이그레이션 적용, 로그·보안/성능 advisor 조회 같은 도구를 에이전트에 붙이고, 스킬은 Supabase·Postgres 작업 절차와 베스트프랙티스를 컨텍스트로 준다. 핵심은 "DB를 아는 척하는 에이전트"가 아니라 실제 프로젝트에 연결된 도구와 좁은 절차 지식을 함께 주는 것. 공식 배포 repo는 Claude Code, Cursor, Codex, GitHub Copilot, Gemini용 매니페스트와 MCP 어댑터를 나눠 둔다.

  • 한 번 설치로 Supabase MCP 서버 + agent skills를 함께 제공
  • 도구: 테이블/확장/마이그레이션/SQL/로그/advisor 등 프로젝트 직접 조작
  • 지원 표면: Claude Code·Cursor·Codex·GitHub Copilot·Gemini 배포 repo
원본 →
AI 코딩 도구

GitHub Code Quality GA — AI 리뷰·품질 게이트·과금 경계를 같이 설계

GitHub Code Quality는 2026-07-20부터 public preview를 끝내고 GitHub Team·Enterprise Cloud 유료 제품으로 GA 전환된다. 10,000+ enterprise가 preview에서 유지보수성·신뢰성 이슈·quality gate·coverage tracking에 활용했다. GA 뒤 활성 committer당 월 $10 기본 + AI-powered 기능 usage-based billing. CodeQL deterministic 분석은 Actions minutes, Copilot code review·AI-assisted detection·Autofix는 별도 사용량. AI 리뷰를 "공짜 보조 댓글"로 보지 말고 PR ruleset·coverage threshold·Autofix 권한을 비용·품질·책임 경계와 함께 정해야 한다.

  • 2026-07-20 GA — committer 월 $10 + AI 기능 usage-based billing
  • CodeQL=Actions minutes, AI review·Autofix=별도 사용량 모델
  • PR quality gate·coverage threshold·Autofix 권한을 운영 정책으로 정의
원본 →
AI 코딩 도구

ARD(Agentic Resource Discovery) — AI 에이전트가 필요한 도구를 '런타임에 직접 찾는' 개방형 표준(Apache-2.0·MS+Google+HF 공동)

ARD는 AI 에이전트가 MCP 서버·스킬·API를 런타임에 동적으로 발견·검증·연결할 수 있게 하는 개방형 사양이다. Microsoft·Google·GitHub·Hugging Face·Nvidia·Salesforce 등이 공동 개발했고, ai-catalog.json 매니페스트 파일 하나로 조직이 자체 레지스트리를 운영할 수 있다. GitHub Agent Finder가 첫 번째 상용 구현으로 Copilot이 필요한 도구를 자동 검색해 context window에 주입한다. 에이전트 생태계가 "미리 설치" 모델에서 "필요할 때 발견" 모델로 전환되는 인프라 시그널이다.

  • MS·Google·GitHub·HF·Nvidia 등 11개사 공동 개발, Apache-2.0
  • ai-catalog.json 매니페스트 기반 연합형(federated) 레지스트리
  • GitHub Agent Finder: Copilot이 ARD로 도구를 런타임 검색 → context window 절약
원본 →
AI 코딩 도구

Open Code Review(Alibaba) — 수백만 건 실전 검증 AI 코드리뷰 CLI(Apache-2.0·~8k★)

Alibaba 내부에서 2년간 수만 명 개발자, 수백만 건 결함 탐지에 사용된 AI 코드리뷰 도구가 오픈소스로 공개됐다. 결정론적 파이프라인 + LLM 에이전트 하이브리드 아키텍처로, 에이전트가 파일 전체 읽기·코드베이스 검색·다른 변경 파일 교차 참조를 수행해 line 단위 정밀 코멘트를 생성한다. NPE·스레드 안전성·XSS·SQL 인젝션 등 내장 규칙셋을 포함하고, OpenAI·Anthropic API 호환. Claude Code의 /code-review보다 벤치마크 점수가 높다는 자체 평가(200 PR·50개 OSS 저장소)도 공개했다.

  • Alibaba 내부 2년: 수만 명 개발자·수백만 건 결함 탐지, 결정론적 규칙(NPE·XSS·SQLi)+LLM 에이전트 하이브리드
  • Git diff 기반 라인 레벨 코멘트, 파일 전체·코드베이스 검색·교차 참조 도구 사용
  • 200 PR·50 OSS repo 자체 벤치에서 Claude Code /code-review 상회(자체 평가)
원본 →
AI 코딩 도구

ProjDevBench — 버그 패치가 아닌 '프로젝트를 처음부터 통째로 만들기'를 평가하는 코딩 에이전트 벤치마크

기존 SWE-bench는 이미 있는 코드베이스에서 버그를 고치는 패치 생성 능력만 측정한다. ProjDevBench는 이와 달리 '프로젝트 스펙을 받고 전체 레포지토리를 처음부터 구축'하는 end-to-end 개발 능력을 평가한다. Online Judge 실행 검증과 LLM 기반 코드리뷰를 결합한 이중 평가, 틀린 유형별 진단(Wrong Answer·TLE·MLE· Runtime Error) 피드백이 특징이다. Claude Code·Cursor·Codex·Augment 등 6종 에이전트를 평가할 수 있고, 현재 최고 점수는 Codex+GPT-5의 77.85%다.

  • SWE-bench와 반대: '패치'가 아닌 '처음부터 전체 레포 구축' 평가
  • 이중 평가: Online Judge 실행 검증 + LLM 코드리뷰
  • 현재 1위 Codex+GPT-5 77.85%, Cursor+Gemini 75.32%
원본 →
AI 코딩 도구

Roborev — AI 코딩 에이전트가 짠 코드를 '쓰는 즉시 백그라운드에서 리뷰'하는 도구(MIT·~1.4k★)

Roborev는 코딩 에이전트(Claude Code·Codex·Cursor 등)가 코드를 생성하는 동안 백그라운드에서 매 커밋을 리뷰하고, 이슈를 초 단위로 표면화하는 도구다. 핵심은 "컨텍스트가 신선할 때 리뷰"—에이전트가 방금 짠 코드를 에이전트 루프 안에서 바로 검토해 문제가 쌓이기 전에 잡는다. vim 스타일 TUI로 리뷰 큐를 탐색하고, roborev fix로 자동 수정, roborev refine으로 수정→재리뷰 반복 루프도 지원한다. Codex·Claude Code· Gemini·Copilot·Cursor 등 10개+ 에이전트와 호환된다.

  • 백그라운드 상시 리뷰: 에이전트가 코드 생성하는 동안 커밋 단위로 리뷰
  • refine 루프: 자동 수정 → 재리뷰 → 반복으로 품질 수렴
  • 10개+ 에이전트 호환: Codex·Claude Code·Gemini·Copilot·Cursor 등
원본 →
AI 코딩 도구

nit — 프로젝트 스택을 자동 감지해 unit~E2E 테스트를 생성하는 로컬 AI 품질 에이전트(MIT·~3.5k★)

nit은 프로젝트에 떨어뜨리면 언어·프레임워크·테스트 인프라를 자동 감지하고, 커버리지 갭을 찾아 Vitest· pytest·Jest·Playwright 등 네이티브 프레임워크 테스트를 생성하는 로컬 AI 에이전트다. 생성된 테스트를 실행해 실패하면 최대 3회 자동 수정하고, 기존 테스트 패턴을 학습해 프로젝트 스타일에 맞춘다. 모노레포(Turborepo·Nx·Cargo 등)도 지원하며, Python·TS·Go·Rust·Java·C++ 등 주요 언어를 커버한다. SaaS 의존 없이 로컬에서 돌아가는 점이 차별점이다.

  • 스택 자동 감지: 언어·프레임워크·테스트 러너를 config 없이 탐지
  • 자가 반복: 생성 → 실행 → 실패 시 최대 3회 자동 수정
  • 로컬 퍼스트: SaaS 의존 없이 로컬 실행, 모노레포 지원
원본 →
AI 코딩 도구

Augment Code — 40만+ 파일 모노레포를 통째로 이해하는 엔터프라이즈 코딩 에이전트(ISO 42001 인증)

Augment Code는 '에이전트 자율 실행'보다 '코드베이스 깊은 이해'에 베팅한 코딩 에이전트다. 40만+ 파일 규모의 레거시 모노레포를 인덱싱해 정확한 컨텍스트를 제공하는 게 핵심이고, ISO/IEC 42001 인증을 받아 규제 산업 엔터프라이즈를 타깃한다. Windsurf가 자율 실행 속도에 강하다면, Augment는 복잡한 레거시 코드베이스에서 AI 정확도가 강점. 규모와 규제가 병목인 조직에 적합하다.

  • 40만+ 파일 모노레포 인덱싱 — 레거시 코드베이스 정확도에 특화
  • ISO/IEC 42001 인증 — 규제 산업 엔터프라이즈 대상
  • 자율 실행보다 '이해 기반 어시스트' — Windsurf와 반대 전략
원본 →
AI 코딩 도구

Unsloth — 소비자 GPU 1장으로 LLM 파인튜닝 2~5배 가속, MoE 모델 12배 빠른 학습(MIT·~54k★)

Unsloth은 LLM 파인튜닝 속도와 VRAM 효율을 극한까지 끌어올린 오픈소스 도구다. 커스텀 Triton 커널로 역전파를 수동 재작성해 LoRA/QLoRA 학습을 2~5배 가속하고 VRAM 35% 절감. 2026년 2월 MoE 학습 지원을 추가해 DeepSeek 스타일 모델에서 12배 가속을 달성했다. PyTorch 공식 생태계에도 합류(2026-05). Axolotl YAML에서 unsloth: true 한 줄로 속도 이점을 그대로 가져올 수 있다.

  • 커스텀 Triton 커널: LoRA/QLoRA 2~5배 가속 + VRAM 35% 절감
  • 2026-02 MoE 학습: DeepSeek 스타일 12배 가속, 50k★ 돌파
  • Axolotl 백엔드 호환: YAML에 unsloth: true 한 줄이면 속도 이점 적용
원본 →
AI 코딩 도구

RAGFlow — 8만★ 돌파, '딥 문서 이해' 특화 RAG 엔진(Apache-2.0·InfiniFlow)

RAGFlow는 복잡한 레이아웃(표·이미지·수기 노트)의 문서를 정밀 파싱하는 데 특화된 오픈소스 RAG 엔진이다. 커버가능 파이프라인과 에이전트 템플릿을 내장하고, 2026년 6월 기준 Feishu·Discord·Telegram·Line 등 다채널 챗봇 연동을 지원한다. 에이전트 워크플로우 + MCP + Python/JS 코드 실행기를 갖춰 단순 검색을 넘어선 자율 행동이 가능하다. LangChain이 오케스트레이션, LlamaIndex가 인덱싱이라면, RAGFlow는 '문서 파싱 품질'이 핵심.

  • 82k★: 가장 빠르게 성장하는 RAG 엔진, Apache-2.0
  • 딥 문서 이해: 표·이미지·수기 노트 포함 PDF/DOCX 정밀 파싱
  • 에이전트 + MCP + 코드 실행: 검색 넘어 자율 행동 가능
원본 →
AI 코딩 도구

cc-sdd(Spec-Driven Development) — Kiro의 '스펙→설계→태스크' 워크플로우를 아무 코딩 에이전트에서 쓰기(오픈소스)

cc-sdd는 Kiro식 spec-driven development를 여러 코딩 에이전트에 옮기는 MIT 라이선스 CLI다. v3.0부터는 명령 파일보다 Agent Skills 중심으로 재편되어, discovery → requirements → design → tasks → kiro-impl 흐름을 Claude Code·Codex 안정 지원, Cursor·Copilot·Windsurf·OpenCode·Gemini CLI·Antigravity 베타 지원으로 설치한다. 핵심 변화는 "문서 3개 만들기"가 아니라 경계다. design.md의 File Structure Plan과 tasks.md의 Boundary/Depends 표기가 작업 단위를 정하고, kiro-impl은 태스크마다 새 구현자·독립 리뷰어·자동 디버그 패스를 돌린다. 교훈은 스펙을 코드보다 위의 명령서로 보지 말고, AI와 사람이 병렬로 일할 수 있게 파일·책임·의존성 경계를 고정하는 계약으로 보라는 점이다.

  • v3.0: 17개 Agent Skills, Claude Code·Codex stable, Cursor·Copilot·Windsurf·OpenCode·Gemini CLI·Antigravity beta
  • kiro-discovery가 새 스펙·기존 스펙 확장·직접 구현·멀티스펙 분해를 먼저 분류
  • kiro-impl: 태스크별 TDD 구현자 + 독립 리뷰어 + auto-debug, Boundary/Depends로 범위 위반 감시
원본 →
AI 코딩 도구

Axolotl — YAML 한 장으로 멀티GPU LLM 파인튜닝 파이프라인을 관리하는 엔터프라이즈 오케스트레이터(Apache-2.0·~11k★)

Axolotl은 "모델 한 번 학습"보다 "학습 파이프라인을 재현 가능하게 굴리기"에 가까운 오픈소스 LLM 파인튜닝 프레임워크다. YAML 하나로 데이터 전처리, 학습, 평가, 양자화, 추론 설정을 재사용하고, LoRA·QLoRA·풀 파인튜닝뿐 아니라 DPO/KTO/ORPO 같은 preference tuning, GRPO/GDPO, reward/process reward modelling까지 다룬다. 현재 README는 FSDP1/2·DeepSpeed·torchrun/Ray 멀티노드, Flash Attention 2/3/4, Liger Kernel, Cut Cross Entropy, ScatterMoE 같은 최적화 축을 같이 문서화한다. 2026-06-29 재검증 기준 12,099★·Apache-2.0·최신 릴리스 v0.17.0. 실무 교훈은 파인튜닝 코드를 노트북 조각으로 남기지 말고, 데이터·모델·분산전략·평가를 버전 관리되는 설정으로 고정하라는 점이다.

  • YAML 재사용 — 데이터 전처리·학습·평가·양자화·추론을 설정 파일로 고정
  • 학습 범위 — SFT/LoRA/QLoRA/full fine-tune + DPO/KTO/ORPO + GRPO/GDPO + reward modelling
  • 운영 신호 — FSDP1/2·DeepSpeed·Ray 멀티노드, agent-docs/config-schema, 12,099★·v0.17.0
원본 →
AI 코딩 도구

Qwen3-Coder-Next — 80B MoE에서 3B만 활성화하는 로컬 개발용 코딩 에이전트(오픈웨이트·256K ctx)

Qwen3-Coder-Next는 Alibaba Qwen 팀이 만든 코딩 에이전트 전용 오픈웨이트 모델이다. Qwen3-Next-80B-A3B-Base 위에 만든 하이브리드 attention+MoE 구조라 전체 파라미터는 80B지만 추론 때는 3B만 활성화한다. 기본 컨텍스트는 256K이고 Yarn으로 1M까지 확장 가능해, 저장소 단위 이해와 긴 에이전트 세션에 맞춘 모델이다. 학습도 일반 코드완성보다 에이전트 실행에 맞춰져 있다. 대규모 실행 가능 코딩 태스크를 합성하고, 환경 상호작용과 강화학습을 붙여 긴 추론, 도구 호출, 실행 실패 복구 능력을 키웠다. SGLang·vLLM의 qwen3_coder tool parser, Claude Code·Cline·Qwen Code 같은 scaffold 적응성이 실전 포인트다.

  • 80B total / 3B active: 큰 모델 지식과 낮은 추론비용을 같이 노리는 MoE 구조
  • 256K 기본 컨텍스트, Yarn 1M 확장 — 저장소 단위 agentic coding에 맞춘 길이
  • 에이전트 훈련: 실행 가능 태스크 합성 + 환경 상호작용 + 강화학습 + tool parser
원본 →
AI 코딩 도구

DSPy — '프롬프트를 짜지 말고 프로그래밍하라', Stanford NLP의 LLM 파이프라인 최적화 프레임워크(MIT·~35k★)

DSPy는 Stanford NLP가 만든 "프롬프트 대신 프로그램" 프레임워크다. 입출력 계약은 Signature로 쓰고, Predict·ChainOfThought·ReAct 같은 Module을 조합한 뒤, Evaluate와 메트릭으로 성능을 재고 Optimizer가 프롬프트나 few-shot 예시를 컴파일한다. 최신 문서의 중심은 GEPA처럼 실행 trace와 피드백을 보고 instruction을 반성적으로 고치는 최적화 루프, 그리고 ReAct가 MCP 서버 도구를 가져와 쓸 수 있는 도구 연결이다. 2026-06-29 재검증 기준 35,575★·MIT·최신 릴리스 3.2.1. 실무 교훈은 프롬프트 문구를 감으로 고치지 말고, 계약·모듈·메트릭·최적화를 코드 리뷰 가능한 파이프라인으로 남기라는 점이다.

  • 계약: Signature로 입출력을 고정하고 Module(Predict·CoT·ReAct)을 조합
  • 검증: Evaluate/metric을 먼저 만든 뒤 Optimizer·GEPA로 instruction과 예시를 컴파일
  • 도구화: ReAct가 MCP 서버 도구를 가져와 쓰는 에이전트 파이프라인까지 확장
원본 →
AI 코딩 도구

LiteLLM — 100+ LLM 프로바이더를 OpenAI 호환 API 하나로 통합하는 셀프호스팅 게이트웨이(~51.9k★)

LiteLLM은 OpenAI·Anthropic·Gemini·Bedrock·Azure·Cohere·Ollama 등 100+ LLM을 OpenAI 형식 하나로 호출하게 하는 Python SDK 겸 AI Gateway다. 팀 서비스로 띄우면 virtual key, spend tracking, load balancing, guardrails, admin dashboard를 한 곳에서 관리한다. 2026년 README 기준으로 MCP Gateway와 A2A Agent Gateway도 같은 프록시에 붙어, 모델 호출·도구 호출·에이전트 호출을 같은 인증/비용 경계 안에 넣을 수 있다. 교훈은 LLM 게이트웨이를 "모델 추상화"가 아니라 멀티테넌트 예산·관측·도구 보안의 운영 경계로 보라는 점이다.

  • 100+ LLM provider를 OpenAI format으로 통합 — SDK 또는 중앙 AI Gateway로 사용
  • virtual key·spend tracking·load balancing·guardrails·admin dashboard를 프록시에서 관리
  • MCP Gateway와 A2A Agent Gateway까지 같은 인증/비용 경계에 연결
원본 →
AI 코딩 도구

E2B — AI 에이전트가 생성한 코드를 Firecracker 샌드박스에서 실행하는 클라우드 인프라(Apache-2.0·~12.8k★)

E2B는 AI 에이전트가 생성한 코드를 클라우드의 격리 샌드박스에서 실행하게 해 주는 오픈소스 인프라다. JavaScript/TypeScript와 Python SDK로 sandbox를 만들고 `commands.run()`으로 셸 명령을 실행하거나, 별도 Code Interpreter SDK의 `runCode()`로 코드 실행 결과를 받을 수 있다. 셀프호스팅은 별도 `e2b-dev/infra` 저장소에서 Terraform 기반으로 안내되고, AWS/GCP 배포와 Firecracker 구성 요소 복사를 포함한다. 현재 README가 직접 보장하지 않는 "Fortune 100 88%" 같은 마케팅 숫자보다, 실무 포인트는 LLM이 만든 코드를 앱 서버가 아니라 짧게 사는 격리 실행면으로 밀어 넣고 API 키·네트워크·템플릿 경계를 따로 설계하는 것이다.

  • JS/TS·Python SDK로 sandbox 생성, 명령 실행, Code Interpreter 실행을 분리
  • 셀프호스팅은 `e2b-dev/infra`의 Terraform 기반 AWS/GCP 경로로 관리
  • Firecracker 기반 sandbox는 코드 실행면을 앱 서버와 분리하는 보안 경계
원본 →
AI 코딩 도구

Dify — 비주얼 캔버스로 agentic workflow·RAG·LLMOps를 묶는 LLM 앱 플랫폼(~147k★)

Dify는 LLM 앱을 프로토타입에서 운영까지 가져가기 위한 오픈소스 플랫폼이다. README 기준 핵심은 visual workflow canvas, RAG pipeline, Agent capabilities, model management, observability, Backend-as-a-Service API를 한 화면에 묶는 점이다. 에이전트는 Function Calling 또는 ReAct 기반으로 정의하고 50개 이상 내장 도구나 커스텀 도구를 붙일 수 있으며, GPT·Mistral·Llama·OpenAI 호환 모델 같은 여러 provider를 교체한다. 라이선스는 GitHub API가 `NOASSERTION`으로 반환하고, LICENSE는 Apache 2.0 기반이지만 멀티테넌트 운영과 프런트엔드 로고/저작권 조건이 붙은 Dify Open Source License라고 명시한다. 실무 교훈은 "노코드 챗봇"보다, RAG·도구·모델·관측성·API 경계를 한 LLMOps 런타임으로 관리하는 선택지로 봐야 한다는 점이다.

  • Workflow canvas + RAG pipeline + Agent capabilities + observability를 한 플랫폼에 묶음
  • Function Calling/ReAct 에이전트와 50+ 내장 도구, 커스텀 도구, 수백 개 모델 provider 지원
  • 2026-06-29 확인 기준 GitHub 146,965★; 라이선스는 Apache 2.0 기반 추가조건부 Dify Open Source License
원본 →
AI 코딩 도구

Keploy — 실제 트래픽을 eBPF로 녹화해 API·통합 테스트와 mocks를 만드는 AI 테스트 도구(~17.8k★)

Keploy는 실제 API 호출, DB query, streaming event를 기록해 테스트와 data mock으로 replay하는 API·통합 테스트 도구다. README는 eBPF로 네트워크 계층 트래픽을 잡기 때문에 SDK 삽입이나 코드 변경 없이 `keploy record -c "CMD"`로 시작한다고 설명한다. AI 각도는 UI locator가 아니라 API coverage 확장이다. 기존 recording과 Swagger/OpenAPI schema를 이용해 boundary value, 누락/추가 필드, 타입 오류, 순서 뒤집힘, retry/timeout 같은 케이스를 찾아 schema·statement·branch coverage를 넓힌다. 실무 교훈은 에이전트가 테스트를 "상상해서" 쓰게 하기보다, 운영에 가까운 트래픽을 재현 가능한 회귀 테스트와 mock으로 먼저 고정하고 그 위에서 AI로 빈 구간을 채우는 것이다.

  • eBPF traffic capture — API 호출·DB query·streaming event를 코드 변경 없이 record/replay
  • AI coverage expansion — OpenAPI와 recording에서 boundary·누락 필드·타입 오류·retry/timeout 케이스 생성
  • 2026-06-29 확인 기준 GitHub 17,813★·Apache-2.0, CI/PR에서 API·integration·unit·E2E coverage report 지원
원본 →
AI 코딩 도구

Instructor — Pydantic 스키마로 LLM JSON 파싱·검증·재시도를 한 API에 묶기(MIT·~13.3k★)

Instructor는 LLM에게 "JSON으로 답해"라고 부탁한 뒤 직접 파싱하는 코드를 줄이는 구조화 출력 라이브러리다. Pydantic 모델을 `response_model`로 넘기면 타입 안전성, validation error 처리, 실패 시 자동 재시도, nested object 추출을 같은 인터페이스로 처리한다. 공식 문서는 OpenAI·Anthropic·Google·Ollama 등 주요 provider를 `from_provider` 하나로 바꾸고, 부분 객체 스트리밍(`Partial`)도 지원한다고 설명한다. README도 에이전트 런타임이 필요하면 PydanticAI를 쓰고, Instructor는 schema-first extraction을 단순하고 싸게 유지하는 도구라고 선을 긋는다. 실무 교훈은 LLM 출력 안정화를 거대한 에이전트 프레임워크로 시작하지 말고, 먼저 스키마·검증·재시도 경계를 함수 호출 한 곳에 고정하라는 것이다.

  • Pydantic `response_model`로 JSON parsing, validation, retry, nested extraction을 통합
  • `from_provider`로 OpenAI·Anthropic·Google·Ollama 등 provider 교체, streaming partial object 지원
  • 2026-06-29 확인 기준 GitHub 13,306★·MIT; agent runtime이 아니라 schema-first extraction용
원본 →
AI 코딩 도구

Outlines — 로컬 LLM 출력을 FSM·grammar로 제약해 구조화 생성하는 엔진(Apache-2.0·~13k★)

Outlines는 LLM이 토큰을 생성하는 동안 FSM이나 grammar로 허용 토큰만 남겨 구조화 출력을 만드는 Python 라이브러리다. 공식 문서는 이를 "structured outputs during generation"으로 설명하고, `model(prompt, output_type)` 패턴으로 JSON Schema, regex, CFG 같은 구조를 지정하게 해준다. 또한 OpenAI·Ollama·vLLM·transformers·llama.cpp·MLX 같은 백엔드와 함께 동작한다고 안내한다. Instructor가 후처리 검증과 재시도로 형식을 맞춘다면, Outlines는 생성 시점 제약으로 로컬 모델이나 대량 처리 파이프라인의 재시도 비용을 줄이는 쪽에 가깝다.

  • 생성 시점 제약: FSM/grammar로 허용 토큰만 남겨 구조화 출력
  • `model(prompt, output_type)` 패턴으로 JSON Schema·regex·CFG를 직접 지정
  • Instructor(후처리 검증+재시도)와 대비되는 generation-time structured generation
원본 →
AI 코딩 도구

GraphRAG(Microsoft) — 지식 그래프로 RAG를 강화, '벡터만으로는 못 잡는 관계'를 추론(오픈소스)

Microsoft GraphRAG는 비정형 텍스트에서 LLM으로 지식 그래프와 커뮤니티 리포트를 뽑아, 질의 성격에 따라 local search·global search·DRIFT search를 나눠 쓰는 RAG 파이프라인이다. README는 이를 "data pipeline and transformation suite"로 소개하고, 리포지터리 guidance에서 공식 지원 제품이 아닌 데모 코드라고 밝힌다. 실무 포인트는 벡터 top-k만으로는 관계 질문이 약할 때, 엔티티·관계·커뮤니티 요약을 조합해 검색 경로를 바꾸는 것이다.

  • 비정형 텍스트 → 지식 그래프 + 커뮤니티 리포트, LLM 기반 indexing pipeline
  • local / global / DRIFT search로 개별 엔티티·전체 코퍼스·혼합 질의를 분리
  • 공식 지원 제품이 아닌 데모 코드 — 벡터-only 한계를 관계 요약으로 보완
원본 →
AI 코딩 도구

Argilla — LLM 파인튜닝용 데이터를 사람이 검수·큐레이션하는 오픈소스 플랫폼(Apache-2.0·HuggingFace)

Argilla는 AI 엔지니어와 도메인 전문가가 함께 쓰는 데이터 협업 도구로, LLM 파인튜닝·평가에 필요한 instruction·preference 데이터를 검수·라벨링·큐레이션하게 해준다. Dataset·Record·Question·Workspace 중심으로 피드백 형태를 설계하고, suggestions·filters·semantic search로 annotator 작업을 돕는다. distilabel과 붙이면 합성 데이터 생성 → Argilla에서 사람 검수 흐름을 만들 수 있고, Hugging Face Hub나 Docker로 바로 배포해 데이터 소유권을 유지한 채 반복 개선하기 좋다.

  • LLM/RAG/pref-tuning용 피드백 데이터에 맞춘 협업 라벨링
  • Dataset·Record·Question·Workspace + suggestions·semantic search
  • distilabel로 합성 데이터 생성 → 사람 검수 파이프라인
원본 →
AI 코딩 도구

Plandex — AI가 만든 변경을 '리뷰 샌드박스'에 격리해 승인 전까지 실제 파일과 분리하는 터미널 코딩 에이전트

Plandex는 큰 코드베이스와 여러 단계의 작업을 다루도록 만든 터미널형 AI 코딩 에이전트다. 핵심은 AI가 만든 변경을 바로 실제 파일에 쓰지 않고 버전 관리되는 누적 diff 리뷰 샌드박스에 먼저 쌓아 두었다가, 검토가 끝난 뒤에만 적용하게 하는 점이다. 공식 문서는 직접 컨텍스트 최대 2M 토큰과 tree-sitter 프로젝트 맵으로 20M 토큰 이상을 인덱싱할 수 있다고 설명하고, self-hosted에서는 custom models/providers/model packs를 모두 지원하며 cloud에서는 BYO API keys 또는 integrated models 조합을 안내한다. 이 흐름 위에 command execution 제어와 git 연동을 얹어 대규모 수정을 안정적으로 돌리게 만든다.

  • 태그라인 'Open source AI coding agent. Designed for large projects and real world tasks' · MIT · GitHub 15.5k★
  • 변경은 version-controlled cumulative diff sandbox에 먼저 쌓이고, 검토 후 적용
  • 직접 컨텍스트 최대 2M 토큰, tree-sitter 프로젝트 맵으로 20M+ 토큰 인덱싱
  • self-hosted는 custom models/providers/model packs를 모두 지원, cloud는 BYO API keys 또는 integrated models 지원
  • command execution 제어와 git 연동으로 롤백·디버깅을 쉽게 유지
  • 모델 비종속(Anthropic·OpenAI·Google·오픈소스 provider들)
원본 →
AI 코딩 도구

SWE-agent — GitHub 이슈를 직접 고치는 ACI 연구용 에이전트

SWE-agent는 GitHub 이슈나 문제 설명을 받아 LM이 저장소를 탐색·편집·실행 도구로 직접 쓰며 실제 리포지토리 버그를 고치게 하는 MIT 연구용 에이전트다. 핵심 기여는 repo-level 작업을 위한 Agent-Computer Interface(ACI) 설계다. 공식 docs는 지금 mini-swe-agent를 새 권장안으로 안내하고 SWE-agent를 maintenance-only mode로 둔다. 그래서 이 카드는 원조 ACI 설계와 단일 YAML 설정, 개별 이슈 중심 CLI를 읽는 기준점으로 보는 편이 정확하다.

  • 태그라인 'SWE-agent takes a GitHub issue and tries to automatically fix it, using your LM of choice' · MIT · GitHub ~19.7k★
  • {"핵심"=>"ACI(Agent-Computer Interface) — LM-centric commands와 feedback으로 browse·view·edit·execute를 묶는 설계"}
  • 현재 docs는 mini-swe-agent를 새 권장안으로 안내하고, SWE-agent는 maintenance-only mode로 둔다
  • CLI 튜토리얼은 individual issues 중심이고, 구성은 단일 YAML 파일로 관리한다
  • 연구용 원조 설계를 읽는 기준점으로는 유효하지만, 새 프로젝트 시작점은 mini-swe-agent가 더 맞다
원본 →
AI 코딩 도구

llama.cpp + GGUF — HF→GGUF→quantize, 로컬 배포의 기본 파이프라인

llama.cpp는 최소 의존성 C/C++ LLM 추론 엔진이고, GGUF는 그 모델 파일 경계다. 공식 README와 quantize 문서는 HF 모델을 GGUF로 변환한 뒤 다시 양자화하는 2단계 파이프라인을 명시한다. lower-bit 품질을 더 챙길 때는 importance matrix(imatrix)를 쓰는 흐름이 붙고, README와 문서는 Q4_K_M을 실용적인 예시 baseline으로 보여 준다. 실무에선 "모델을 고른다"보다 먼저 "GGUF로 바꾸고 어떤 정밀도로 줄일지"를 정하는 게 맞다.

  • GGUF = inference용 파일 경계, convert는 먼저·quantize는 나중
  • imatrix는 lower-bit 양자화 품질을 돕는 보조 단계
  • Q4_K_M은 업스트림 문서가 보여 주는 실용 baseline
원본 →
AI 코딩 도구

KnowU-Bench — Android 에뮬레이터에서 개인화·프로액티브 모바일 에이전트를 재는 벤치마크

KnowU-Bench는 재현 가능한 Android 에뮬레이션 환경에서 personalized/proactive mobile agents를 평가하는 온라인 벤치마크다. 에이전트에게는 사용자 프로필이 아니라 행동 로그만 주고, 다이얼로그를 통해 선호를 추론하게 만든다. 공식 프로젝트 페이지와 arXiv 초록은 42 general GUI·86 personalized·64 proactive tasks, LLM-driven user simulator, consent negotiation, post-rejection restraint, hybrid rule-based verification + LLM-as-a-Judge를 공개한다. 실무 교훈은 모바일 AI를 GUI 자동화로만 보면 안 되고, 선호 추론·개입 타이밍·동의 설계를 함께 봐야 한다.

  • 42 general GUI·86 personalized·64 proactive tasks
  • User profile hidden, behavioral logs only — preference inference not lookup
  • Hybrid verification: rule-based checks + LLM-as-a-Judge / reproducible Android emulator
원본 →
AI 코딩 도구

Llamatik — KMP로 Android·iOS·Desktop에서 오프라인 AI를 한 API로 묶기(Maven Central)

Llamatik은 Kotlin Multiplatform에서 llama.cpp·whisper.cpp·stable-diffusion.cpp를 묶어 Android·iOS·Desktop·WASM에서 오프라인 AI를 돌리는 라이브러리다. 공통 `LlamaBridge` API로 로컬·원격 추론을 추상화하고, Android AAR/Maven Central 배포로 별도 네이티브 툴체인 없이 쓸 수 있게 한다. LLM 쪽은 streaming·context-aware generation·schema-constrained JSON·embeddings·KV cache 세션·concurrent sessions를 지원하고, Whisper/STT와 Stable Diffusion까지 같은 Kotlin API로 감싼다. Compose Multiplatform 샘플이 있어 "모바일 앱에 로컬 AI를 넣는 방법"을 바로 보여 주는 교육용 카드로 좋다.

  • Android·iOS·Desktop·WASM, single Kotlin API
  • GGUF/BIN + fully offline, no required servers
  • Maven Central 배포 + Compose Multiplatform 샘플
원본 →
AI 코딩 도구

Qwen3-VL — 오픈소스 비전-언어 모델 1위, OCR 32개 언어·문서·차트·GUI 에이전트까지(Apache-2.0)

Qwen3-VL은 Alibaba가 만든 오픈소스 비전-언어 모델로, 2026년 기준 DocVQA 96.5%·MathVista 85.8%로 오픈소스 VLM 중 최강이다. 72B·32B·7B 사이즈 제공, 256K 네이티브 컨텍스트(1M 확장), OCR 32개 언어 지원. GUI 에이전트·차트 이해·디자인→코드 변환까지 커버한다. InternVL3(OpenGVLab)가 범용 시각 추론에 강하다면, Qwen3-VL은 문서·OCR·수학·에이전트 특화. HuggingFace transformers·vLLM 통합.

  • DocVQA 96.5%: 오픈소스 VLM 최고, 프론티어 모델과 경쟁
  • OCR 32개 언어 + GUI 에이전트 + 디자인→코드
  • 72B/32B/7B, Apache-2.0, vLLM·transformers 통합
원본 →
AI 코딩 도구

Kokoro-82M — 82M 파라미터로 14배 큰 모델을 이기는 경량 오픈소스 TTS(Apache-2.0·~7.5k★)

Kokoro-82M은 82M 파라미터의 초경량 TTS 모델로, 14배 큰 모델과 동등한 음성 품질을 달성한다. StyleTTS2+ ISTFTNet 아키텍처로 인코더·디퓨전 없이 빠른 합성이 가능하고, 소비자 하드웨어와 엣지 디바이스에서도 실행된다. 44개 음성·다국어(영·중·일·이탈리아어 등)·음성 블렌딩 지원. pip install kokoro 한 줄로 시작. Fish Audio S2 Pro(4B, 1000만시간 학습)가 최고 품질이라면, Kokoro는 속도·비용·접근성의 최적점.

  • 82M 파라미터: 14배 큰 모델과 동등 품질, 엣지 실행 가능
  • 44개 음성·다국어·음성 블렌딩 지원
  • Apache-2.0, pip install kokoro 한 줄 시작
원본 →
AI 코딩 도구

Dia2(Nari Labs) — 웃음·기침·한숨까지 재현하는 대화 전용 TTS 모델(Apache-2.0·1.6B)

Dia2는 Nari Labs가 만든 1.6B+ 파라미터 대화 전용 TTS 모델로, 멀티스피커 대화에서 웃음·기침·한숨 등 비언어적 요소까지 자연스럽게 생성한다. 팟캐스트·오디오 드라마·게임 대사·대화형 인터페이스에 최적화. Kokoro(82M)가 범용 경량 TTS, Fish Audio S2 Pro(4B)가 감정·프로소디 최강이라면, Dia2는 '멀티턴 대화 리얼리즘'에 특화. Apache-2.0 라이선스로 상업 사용 가능.

  • 대화 특화: 멀티스피커 + 비언어적 요소(웃음·기침·한숨) 생성
  • 1.6B 파라미터: 팟캐스트·게임 대사·대화형 UI에 최적
  • Apache-2.0, 상업·비상업 모두 무료
원본 →
AI 코딩 도구

Tabby — Rust로 만든 셀프호스팅 코드 자동완성 서버, 팀 전체에 Copilot을 내부망에서 제공(Apache-2.0·~28k★)

Tabby는 Rust로 작성된 셀프호스팅 코드 자동완성 서버다. Docker 한 줄로 배포하면 VS Code·JetBrains·Vim 확장을 통해 팀 전체에 AI 자동완성을 제공한다. 리포지토리 인덱싱으로 코드베이스 패턴을 학습하고, 관리자 대시보드·사용량 분석·LDAP/SSO를 기본 지원해 엔터프라이즈에 적합하다. Continue.dev(25k★)가 개인 개발자 대상 IDE 확장(Ollama 연결)이라면, Tabby는 팀 중앙 서버 아키텍처. 추천 모델은 Qwen2.5-Coder 7B·Codestral 7B.

  • Rust 서버: Docker 한 줄 배포, 리포지토리 전체 인덱싱
  • 팀 관리: 관리자 대시보드·사용량 분석·LDAP/SSO
  • VS Code·JetBrains·Vim·Eclipse 확장 지원
원본 →
AI 코딩 도구

ComfyUI — 116k★, Stable Diffusion·FLUX를 노드 그래프로 조합하는 오픈소스 이미지 생성 엔진(GPL-3.0)

ComfyUI는 노드 기반 UI로 Stable Diffusion·FLUX·HunyuanVideo·AnimateDiff 등 오픈소스 이미지/비디오 생성 모델을 실행하는 엔진이다. 116k+ GitHub 스타로 AI 이미지 생성 도구 중 가장 인기 있고, 워크플로우를 JSON으로 저장해 재현 가능. FLUX.1 Dev(리얼리즘 최강)·FLUX.2 Klein(4B, 소비자 GPU)을 네이티브 지원. Midjourney 대비 월 $0·무제한·프라이버시 보장. API 모드로 n8n 등 자동화 연동도 가능.

  • 116k★: 가장 인기 있는 AI 이미지 생성 UI, GPL-3.0
  • 노드 그래프: 워크플로우 JSON 재현, LoRA·ControlNet 확장
  • FLUX 네이티브: 소비자 GPU(12GB+)에서 프로급 이미지
원본 →
AI 코딩 도구

BGE-M3 — 100+ 언어·밀집+희소+멀티벡터를 하나의 모델로, RAG 임베딩의 사실상 표준(MIT·BAAI)

BGE-M3(BAAI)는 단일 모델로 밀집(dense)·희소(sparse)·멀티벡터(ColBERT) 3가지 검색 방식을 모두 지원하는 임베딩 모델이다. 100+ 언어, 8192 토큰 컨텍스트. 2026년 기준 '범용 RAG 임베딩을 하나만 고르라면 BGE-M3'가 업계 컨센서스. 568M 파라미터로 GPU 없이도 실행 가능. Qwen3-Embedding-8B(MTEB 70.6)가 정확도 최강이라면, BGE-M3는 다용도·다국어·하이브리드 검색의 최적점.

  • 3-in-1: 밀집+희소+멀티벡터(ColBERT) 단일 모델
  • 100+ 언어, 8192 토큰 컨텍스트, MIT 라이선스
  • 568M: GPU 없이 실행 가능, Ollama 지원
원본 →
AI 코딩 도구

Qwen3-Embedding — MTEB 70.6으로 OpenAI·Google을 넘은 오픈소스 임베딩 모델 1위(Apache-2.0·Alibaba)

Qwen3-Embedding-8B는 2026년 6월 기준 MTEB 벤치마크 70.6점으로 오픈소스 임베딩 모델 중 1위다. OpenAI text-embedding-3-large(64.6)과 Google Gemini Embedding(68.3)을 모두 추월. 차원 수를 32~4096으로 자유롭게 설정 가능하고, 40K 토큰 컨텍스트·다국어 지원. Ollama에서 qwen3-embedding:8b(4.7GB)·4b(2.5GB)·0.6b(639MB) 3가지 사이즈로 로컬 실행 가능. 정확도가 최우선이면 Qwen3, 범용 하이브리드라면 BGE-M3.

  • MTEB 70.6: 오픈소스 1위, OpenAI(64.6)·Google(68.3) 추월
  • MRL: 차원 32~4096 자유 설정, 40K 토큰 컨텍스트
  • Ollama 3종: 8B(4.7GB)·4B(2.5GB)·0.6B(639MB)
원본 →
AI 코딩 도구

BentoML — Python 코드 그대로 AI 모델을 API·Docker·배포까지, ML엔지니어 친화 서빙 프레임워크(Apache-2.0)

BentoML은 Python 코드에서 모델 서빙 API를 자동 생성하고 Docker 이미지까지 원클릭으로 만드는 오픈소스 ML 서빙 프레임워크다. 동적 배칭·모델 병렬화·멀티스테이지 파이프라인을 내장하고, PyTorch·TensorFlow· Scikit-learn·LLM 모두 지원. NVIDIA Triton이 GPU 최적화 최강, Ray Serve가 분산 DAG 파이프라인 최강이라면, BentoML은 '데이터 사이언티스트가 가장 빨리 프로덕션에 올리는 도구'. BentoCloud로 관리형 배포도 가능.

  • Python 네이티브: 코드 → API → Docker 자동 생성
  • 동적 배칭·모델 병렬화·멀티모델 파이프라인 내장
  • Apache-2.0, BentoCloud 관리형 배포 옵션
원본 →
AI 코딩 도구

MLflow — ML 실험 추적·모델 레지스트리·LLM 관측성까지, AI 엔지니어링의 사실상 표준(Apache-2.0·Linux Foundation)

MLflow는 Databricks가 만들고 Linux Foundation에 기증한 오픈소스 ML 플랫폼이다. 실험 추적(파라미터· 메트릭·아티팩트)·모델 레지스트리·배포까지 커버하고, 2026년 기준 LLM 관측성·프롬프트 최적화·AI Gateway도 추가됐다. Apache-2.0으로 셀프호스팅 비용 $0. W&B(SaaS, $50/user/mo)가 UX·협업·시각화 최강이라면, MLflow는 벤더 비종속·데이터 주권·비용 효율의 최적점. 10인 팀 기준 연 $6,000(W&B) vs ~$2,000(MLflow 인프라).

  • Apache-2.0, Linux Foundation: 벤더 비종속, 셀프호스팅 $0
  • 실험 추적 + 모델 레지스트리 + LLM 관측성 + AI Gateway
  • 비용: 10인 ~$2K/yr vs W&B ~$6K/yr
원본 →
AI 코딩 도구

Distilabel — LLM을 교사로 활용해 파인튜닝·RLHF용 합성 데이터셋을 자동 생성하는 파이프라인 프레임워크(Apache-2.0·Argilla)

Distilabel은 Argilla가 만든 합성 데이터 생성 프레임워크로, LLM 생성기와 판정기(judge)를 체인으로 엮어 instruction·preference·임베딩 학습용 데이터셋을 자동 생성한다. Evol-Instruct·UltraFeedback·Magpie 등 검증된 연구 기법을 내장하고, 모든 교사 모델(OpenAI·Anthropic·Ollama)을 사용 가능. Argilla(인간 검수)와 연동하면 합성→검수 파이프라인이 완성된다. 직접 프롬프팅은 빠르지만 재현 불가, Distilabel은 감사 가능한 재현 파이프라인이 핵심 차별점.

  • 연구 기반: Evol-Instruct·UltraFeedback·Magpie 내장
  • Argilla 연동: 합성 → 인간 검수 파이프라인
  • Apache-2.0, 모든 교사 모델 사용 가능
원본 →
AI 코딩 도구

Core AI(WWDC26) — Apple이 Apple Intelligence를 구동하는 온디바이스 AI 프레임워크를 개발자에게 공개

Core AI는 WWDC26에서 발표된 Apple의 차세대 온디바이스 AI 프레임워크다. Apple Intelligence를 구동하는 동일 엔진을 개발자가 Swift API로 사용할 수 있게 됐다. AOT(Ahead-of-Time) 컴파일로 첫 실행 시간을 대폭 단축하고, Xcode 내장 Core AI Instruments로 텐서 값을 Python 소스까지 추적 디버깅 가능. Qwen· Mistral·SAM3 등 인기 오픈소스 모델을 Apple Silicon에 최적화한 Core AI Models 리포를 제공한다. 서버 비용 $0, 토큰당 비용 $0, 클라우드 레이턴시 0.

  • Apple Intelligence 동일 엔진: Swift API, AOT 컴파일, Neural Engine 최적화
  • Core AI Instruments: Xcode에서 텐서 값 → Python 소스 추적 디버깅
  • Core AI Models 리포: Qwen·Mistral·SAM3 변환 스크립트 + Swift 런타임 라이브러리
원본 →
AI 코딩 도구

Gemma 4 — Apache-2.0로 풀린 Google의 에이전트급 온디바이스 모델, 140+ 언어·멀티모달·Function Calling

Gemma 4는 Google DeepMind가 Apache-2.0으로 공개한 온디바이스 AI 모델 패밀리다. 챗봇을 넘어 멀티스텝 계획·자율 행동·오프라인 코드 생성·오디오/비전 처리까지 디바이스에서 실행 가능. 140+ 언어 지원. Android AICore에 내장되어 시스템 전체에서 접근 가능하고, LiteRT-LM으로 iOS·Web·Desktop에도 배포. Gemma4-E2B(2.6B)는 Samsung S26 Ultra에서 557 tok/s(prefill) 달성.

  • Apache-2.0: 에이전트급 온디바이스 모델, 140+ 언어
  • Android AICore 내장: 시스템 전체에서 Gemma 4 접근
  • Gemma4-E2B: S26 Ultra에서 557 tok/s prefill
원본 →
AI 코딩 도구

Maestro — YAML 한 줄로 모바일 E2E 테스트, AI 어시스턴트로 테스트 자동 생성(Apache-2.0)

Maestro는 선언적 YAML로 Android·iOS·React Native·Flutter·Web E2E 테스트를 작성하는 프레임워크다. 자동 대기·재시도로 flakiness를 흡수하고, Maestro Studio로 시각적 녹화·인스펙션이 가능. MaestroGPT로 자연어에서 YAML 플로우를 자동 생성한다. Appium(WebDriver 기반, 크로스플랫폼 표준)이 규모·유연성에 강하다면, Maestro는 설정 속도·유지보수 비용·로우코드에 특화. Detox는 React Native 전용 그레이박스.

  • 선언적 YAML: 컴파일 없이 해석 실행, 자동 대기·재시도
  • MaestroGPT: 자연어 → YAML 테스트 플로우 자동 생성
  • 크로스플랫폼: Android·iOS·RN·Flutter·Web 단일 수트
원본 →
AI 코딩 도구

Koog(JetBrains) — Kotlin으로 AI 에이전트를 만드는 멀티플랫폼 프레임워크, MCP 네이티브(Apache-2.0·~4.3k★)

Koog는 JetBrains가 만든 Kotlin 기반 AI 에이전트 프레임워크다. JVM·Android·iOS·JS·WasmJS 타겟을 지원하는 Kotlin Multiplatform 프로젝트로, MCP(Model Context Protocol) 네이티브 통합·Spring Boot·Ktor 연동을 제공한다. OpenAI·Anthropic·Google·DeepSeek·Ollama 등 다양한 LLM 프로바이더를 지원. 1.0.0 GA(2026-05). LangChain(Python)이나 LangGraph의 Kotlin 네이티브 대안.

  • Kotlin Multiplatform: JVM·Android·iOS·JS·WasmJS 에이전트
  • MCP 네이티브 + Spring Boot·Ktor 통합
  • 1.0.0 GA(2026-05), Apache-2.0, JetBrains 주도
원본 →
AI 코딩 도구

kmp-ai — Kotlin Multiplatform llama.cpp 런타임으로 Android·iOS·Desktop에서 오프라인 LLM 돌리기(Maven Central)

kmp-ai는 Kotlin Multiplatform에서 llama.cpp를 감싼 오프라인 LLM 런타임이다. JVM·Android·iOS를 같은 API로 묶고, `Flow` 스트리밍, HuggingFace/URL/local-file 모델 로드, SHA-256 검증, 재개 가능한 다운로드, KV-cache 재사용, GBNF 제약 생성, 모델 카탈로그를 제공한다. Maven Central AAR에는 Android용 프리빌트 `.so`가 들어가서 소비자는 NDK를 직접 준비하지 않아도 된다. Compose Multiplatform 샘플 앱은 모바일·데스크톱 통합 그림을 빠르게 보여 준다.

  • KMP: JVM·Android·iOS를 같은 llama.cpp API로 묶기
  • Flow 스트리밍, 재개 다운로드, KV-cache reuse, GBNF 제약 생성
  • Maven Central AAR + prebuilt .so, Compose Multiplatform sample
원본 →
AI 코딩 도구

Google Stitch(구 Galileo AI) — 텍스트·음성으로 모바일·웹 UI와 프런트엔드 코드를 빠르게 시도하는 Google Labs 도구

Google Stitch는 Google Labs의 AI UI 도구로, 자연어·이미지로 모바일·웹 UI를 만들고 대화식으로 계속 다듬게 해 준다. 화면을 이어 붙여 인터랙티브한 앱 흐름을 확인할 수 있고, 음성으로 캔버스와 대화하면서 색상·메뉴·레이아웃 변형을 요청할 수 있다. Stitch는 MCP 서버·SDK·skills로 다른 개발 도구와 연결되고, AI Studio나 Antigravity로 넘겨 후속 작업을 이어갈 수 있다.

  • 자연어·이미지 입력으로 모바일·웹 UI와 프런트엔드 코드 생성
  • 화면을 이어 붙여 인터랙티브한 앱 흐름을 바로 확인
  • 음성 편집 + MCP/SDK/skills로 다른 도구와 연결
원본 →
AI 코딩 도구

v0(Vercel) — 프롬프트·스크린샷·Figma에서 프로덕션급 React UI 코드를 생성하는 AI UI 빌더

v0는 Vercel이 만든 AI UI 생성 도구로, 텍스트·스크린샷·Figma 파일에서 shadcn/ui 기반 프로덕션 React 컴포넌트를 생성한다. Design Mode로 비개발자도 시각적으로 타이포·색상·레이아웃을 편집 가능하고, Cmd+K로 인라인 AI 편집. Figma 디자인 토큰을 추출해 브랜드 일관성 유지. Claude Design이 동작 구현에 강하다면, v0는 React/Next.js 컴포넌트 코드 품질에 특화.

  • Figma → React: 디자인 토큰 추출, shadcn/ui 기반 프로덕션 코드
  • Design Mode: 비개발자 시각적 편집, Cmd+K 인라인 AI
  • 무료 티어 + Premium $20/mo
원본 →
AI 코딩 도구

React Native ExecuTorch + RAG — RN 앱에서 온디바이스 LLM과 벡터 검색을 결합해 프라이버시 우선 AI 구현

react-native-executorch(Software Mansion)는 React Native에서 ExecuTorch를 래핑해 온디바이스 AI 추론을 제공한다. react-native-rag를 결합하면 로컬 문서 임베딩 + 벡터 검색 + LLM 생성까지 완전 오프라인 RAG가 가능. Llama 3.2 1B 모델 + ALL_MPNET_BASE_V2 임베딩을 사용하고, XNNPACK(CPU)·CoreML(iOS Neural Engine) 백엔드 선택 가능. Private Mind 데모 앱으로 검증. 데이터가 디바이스를 떠나지 않는 프라이버시 우선 아키텍처.

  • 완전 오프라인 RAG: 임베딩 + 벡터 검색 + LLM 생성, 클라우드 $0
  • ExecuTorch 백엔드: XNNPACK(CPU)·CoreML(iOS Neural Engine)
  • react-native-rag: useRAG 훅으로 선언적 RAG 구현
원본 →
AI 코딩 도구

gptme: 터미널 안에서 셸·파이썬·브라우저·파일 도구를 직접 쓰는 로컬-우선 코딩 에이전트

gptme는 "Your agent in your terminal" — 셸·파이썬(ipython)·파일 패치·브라우저(Playwright)· 비전/스크린샷·rag·tmux·subagent 등 로컬 도구를 직접 다루는 local-first 개인 코딩 에이전트다. 노트북·SSH·헤드리스·CI 어디서나 돌고, 모델 비종속이라 클라우드 LLM부터 llama.cpp 완전 로컬까지 붙는다.

  • MIT 라이선스·약 4.3k★, 릴리스 100회로 활발히 유지보수(v0.31.0, 2025-12)
  • 내장 도구: shell·python·파일 read/save/append/patch·browser·vision·rag·gh·tmux·subagent
  • local-first·self-host(웹 UI 포함) — 노트북·SSH·tmux·헤드리스·CI 어디서나 실행
  • 모델 비종속: Anthropic·OpenAI·Google·xAI·OpenRouter 100+ 또는 llama.cpp 완전 로컬
원본 →
AI 코딩 도구

Copilot Code Review — AGENTS.md·MCP·Skills로 리뷰 컨텍스트 고정

GitHub Copilot code review(2026 GA)는 diff만 보는 리뷰에서 벗어나 레포·외부 도구·스킬로 컨텍스트를 고정하는 방향으로 진화했다. 2026-06-18부터 루트 AGENTS.md를 자동 읽어 코드 스타일·테스트·보안 기준을 PR마다 재현하고, .github/copilot-instructions.md·경로별 instructions·agent skills·MCP 서버도 리뷰 입력으로 연결된다. MCP로 이슈 키·incident ID·내부 규칙을 따라 외부 컨텍스트를 가져오고, `.github/skills/code-review/SKILL.md`로 리뷰 기준을 저장소 안에 둔다. Low/Medium review tier로 코드 중요도와 AI Credits 예산을 맞춘다. 핵심: "더 세게 봐달라"가 아니라 조직 규칙·운영 도구·비용 등급을 리뷰 입력으로 명시해 반복 질문과 팀별 편차를 줄인다.

  • 2026-06-18 GA: 루트 AGENTS.md 자동 활용 + copilot-instructions·경로별 rules
  • MCP 서버로 이슈·incident·내부 도구 컨텍스트를 diff 밖에서 연결
  • `.github/skills/code-review/SKILL.md` + Low/Medium tier로 기준·예산 분리
원본 →
AI 코딩 도구

smol developer: 제품 스펙(마크다운)만 주면 코드베이스 전체를 스캐폴딩하는 '주니어 개발자' 에이전트

smol developer는 프롬프트(마크다운 스펙)를 소스로 보고 프로그램 전체를 한 번에 합성하는 초기 코딩 에이전트다. "prompt engineering이 아니라 engineering with prompts" 철학으로, 스펙을 코드베이스의 진짜 소스코드처럼 다룬다. 앱에 임베드하는 라이브러리 형태를 처음 제시해 이후 수많은 코드 생성 에이전트에 영향을 줬다.

  • MIT 라이선스·약 12.2k★ — 태그라인 '앱에 developer agent를 임베드하는 최초의 라이브러리'
  • shared_dependencies.md 중간 단계로 생성 파일 간 이름·의존성 일관성 확보
  • 사용 모드 3종: Git Repo 스캐폴딩 / 라이브러리 임베드 / API(Agent Protocol)
  • '전체 코드베이스를 cat해서 디버깅' — 작은 프로젝트를 통째로 컨텍스트에 올리는 접근
원본 →
AI 코딩 도구

AgenTest — AI 코딩 에이전트가 실제 에뮬레이터에서 앱을 테스트하는 MCP 서버, testID·프레임워크 불필요

AgenTest는 AI 코딩 에이전트(Cursor·Claude)가 실제 Android 에뮬레이터에서 앱을 직접 테스트할 수 있게 하는 MCP 서버다. 접근성 트리를 ~80ms에 읽고, gRPC로 60fps 입력을 주입하며, React Native·Flutter 프레임워크 감지까지 자동. testID·보일러플레이트·테스트 프레임워크 없이 AI가 코드를 읽고 테스트 케이스를 생성·실행. SharedPreferences·SQLite 인스펙션, 네트워크 시뮬레이션(offline·2g·3g·lte)까지 지원.

  • MCP 서버: AI 에이전트가 에뮬레이터를 직접 제어, testID 불필요
  • ~80ms UI 트리 읽기 + gRPC 60fps 입력 주입
  • 네트워크 시뮬레이션·SharedPreferences·SQLite 인스펙션
원본 →
AI 코딩 도구

MobileSAM — 5M 파라미터로 SAM과 동등한 세그멘테이션, 모바일에서 12ms 추론(MIT)

MobileSAM은 Meta SAM의 ViT-H 인코더(632M)를 Tiny-ViT(5M)로 교체해 모바일에서 ~12ms에 이미지 세그멘테이션을 실행하는 경량 모델이다. 원본 SAM 파이프라인(전처리·후처리·인터페이스)을 100% 유지하면서 5배 작고 7배 빠르다. YOLO와 결합해 '검출→세그멘테이션' 파이프라인을 구성하면 모바일 AR·분석·실시간 객체 분리에 적합. ONNX 내보내기 지원, Ultralytics 통합.

  • 5M 파라미터: SAM 대비 5배 작고 7배 빠름, 12ms 추론
  • SAM 파이프라인 100% 호환: 전처리·후처리·인터페이스 동일
  • YOLO 결합: 검출→세그멘테이션 파이프라인으로 모바일 AR
원본 →
AI 코딩 도구

MediaPipe — Google이 만든 모바일 실시간 AI, 30~60fps로 손·포즈·얼굴 추적(Apache-2.0)

MediaPipe는 Google이 만든 모바일 실시간 ML 프레임워크로, CPU/GPU/NPU 자동 디스패치+XNNPACK 최적화로 30~60fps를 보장한다. Hand Landmarker(21점)·Pose Landmarker(33점)·Face Landmarker(478점)·Image Segmenter· Object Detector·Gesture Recognizer 등 사전학습 솔루션을 제공. 동일 작업을 PyTorch로 실행하면 5fps 수준인 반면 MediaPipe는 60fps. Android·iOS·Web·Python 지원.

  • 30~60fps 보장: CPU/GPU/NPU 자동 디스패치 + XNNPACK
  • 사전학습 솔루션: 손·포즈·얼굴·제스처·세그멘테이션·객체 검출
  • Android·iOS·Web·Python 크로스플랫폼
원본 →
AI 코딩 도구

Genkit Dart — Flutter·Dart에서 AI 앱을 만드는 Google의 오픈소스 프레임워크, 온디바이스+클라우드 하이브리드

Genkit Dart는 Google이 만든 오픈소스 AI 프레임워크로, Flutter·Dart 개발자가 단일 API로 Google· Anthropic·OpenAI·Ollama 모델에 접근한다. genkit_flutter_gemma 플러그인으로 Gemma 4를 온디바이스 실행하고, genkit_foundation_models로 Apple Intelligence(iOS 26+)를 연동. 프론트엔드와 백엔드가 모두 Dart이므로 AI 로직을 클라이언트↔서버 간 자유롭게 이동 가능. Dev UI로 프롬프트 디버깅.

  • 모델 무관: Google·Anthropic·OpenAI·Ollama 단일 API
  • 온디바이스: genkit_flutter_gemma(Gemma 4) + genkit_foundation_models(Apple Intelligence)
  • Dart 풀스택: AI 로직을 클라이언트↔서버 자유 이동
원본 →
AI 코딩 도구

Sentry — 모바일 크래시·ANR·성능을 코드 레벨까지 추적, AI가 94.5% 정확도로 원인 분석(BSD)

Sentry는 모바일 앱의 크래시·ANR·성능 이슈를 스택 트레이스·디바이스 상태·사용자 행동 컨텍스트와 함께 추적하는 오픈소스 모니터링 플랫폼이다. iOS·Android·React Native·Flutter·Unity SDK 제공. Seer AI 에이전트가 94.5% 정확도로 루트 코즈를 분석하고, GitHub PR로 수정을 제안. Suspect Commits로 문제를 도입한 커밋·작성자를 자동 식별. Crashlytics 대비 더 깊은 비크래시 에러·Compose 지원.

  • Seer AI: 94.5% 정확도 루트 코즈 분석 + GitHub PR 자동 생성
  • Suspect Commits: 문제 도입 커밋·작성자 자동 식별
  • 크로스플랫폼: iOS·Android·RN·Flutter·Unity, 오프라인 캐싱
원본 →
AI 코딩 도구

Novu — 오픈소스 멀티채널 알림 인프라, Push·Email·SMS·In-App을 단일 API로 통합(MIT·~36k★)

Novu는 MIT 라이선스 오픈소스 알림 인프라로, Push·Email·SMS·In-App·채팅을 단일 API로 통합한다. 콘텐츠 관리·구독자 선호도·채널 라우팅·지연/다이제스트 워크플로우를 코드 또는 UI에서 정의 가능. FCM·APNs·SendGrid·Twilio 등 다양한 프로바이더를 지원하고, 셀프호스팅 무료. 36k+ GitHub 스타로 오픈소스 알림 인프라 중 가장 인기. OneSignal이 관리형 SaaS라면, Novu는 셀프호스팅 대안.

  • 단일 API: Push·Email·SMS·In-App·채팅 통합
  • 셀프호스팅 무료: MIT, 36k+ GitHub 스타
  • 프로바이더 교체 가능: FCM·APNs·SendGrid·Twilio
원본 →
AI 코딩 도구

GrowthBook — 오픈소스 Feature Flag + A/B 테스트 플랫폼, 데이터웨어하우스 네이티브(MIT·~7k★)

GrowthBook는 MIT 라이선스 오픈소스 Feature Flag + A/B 테스트 플랫폼이다. BigQuery·Snowflake· Redshift 등 데이터웨어하우스에 직접 연결해 실험 결과를 분석하므로 데이터를 외부로 보내지 않는다. Bayesian 통계 엔진으로 CUPED·Sequential Testing을 지원하고, Android·iOS·React Native·Flutter SDK 제공. Firebase A/B Testing이 무료지만 Google 생태계 종속이라면, GrowthBook는 벤더 비종속 대안. Statsig(상용)이 자동 통계+파워 분석에 강하다면, GrowthBook는 셀프호스팅+데이터 주권이 차별점.

  • 데이터웨어하우스 네이티브: BigQuery·Snowflake 직접 연결
  • MIT 셀프호스팅: 데이터가 외부로 나가지 않음
  • Android·iOS·RN·Flutter SDK, Bayesian+CUPED
원본 →
AI 코딩 도구

Firebase Remote Config + A/B Testing — 앱 업데이트 없이 AI 모델·프롬프트·UI를 원격 제어(무료)

Firebase Remote Config는 앱 업데이트 없이 파라미터(AI 모델명·프롬프트·UI 설정)를 원격으로 변경하는 Google 무료 서비스다. Firebase A/B Testing과 연동해 모델 버전·시스템 프롬프트·UI 변형을 사용자 세그먼트별로 실험하고, 우승 변형을 점진적으로 롤아웃 가능. Remote Config Personalization은 ML로 개별 사용자에게 최적 설정을 자동 적용. GenAI 앱에서 모델 폐기·비용 최적화에 필수.

  • 앱 업데이트 불필요: AI 모델명·프롬프트·UI를 원격 변경
  • A/B Testing 통합: 모델 버전·프롬프트를 세그먼트별 실험
  • Personalization: ML이 개별 사용자 최적 설정 자동 적용
원본 →
AI 코딩 도구

AI 로컬라이제이션 CLI — strings.xml·.arb·.xcstrings를 AI로 자동 번역, 모바일 다국어 자동화

2026년 기준 모바일 앱 로컬라이제이션을 AI로 자동화하는 오픈소스 CLI 도구들이 등장했다. android-llm-localization(Python)은 Android strings.xml을 Gemini·OpenAI·Ollama로 번역하고 포맷 스페시파이어(%1$s)를 보존한다. LocalizeKit(Dart)는 Flutter .arb 파일에 특화, 변경된 문자열만 재번역하는 스마트 캐싱. Localization-CLI(Swift)는 iOS .xcstrings 전용. 앱 컨텍스트를 제공하면 도메인에 맞는 용어를 선택한다. Tolgee(오픈소스)는 웹 UI+번역 메모리+인간 검수 워크플로우.

  • 플랫폼별 전용: Android(strings.xml)·Flutter(.arb)·iOS(.xcstrings)
  • 포맷 보존: %1$s·플레이스홀더·복수형 자동 처리
  • 스마트 캐싱: 변경된 문자열만 재번역 → API 비용 절감
원본 →
AI 코딩 도구

LinkForty — Firebase Dynamic Links 종료 후 오픈소스 셀프호스팅 딥링크 엔진(AGPL-3.0)

LinkForty는 Firebase Dynamic Links(2025-08 종료)의 오픈소스 대체재다. 셀프호스팅 PostgreSQL 위에서 디바이스 감지·스마트 라우팅·디퍼드 딥링크·QR코드 생성·클릭 분석·웹훅을 제공한다. iOS Universal Links· Android App Links를 지원하고, UTM 파라미터 추적·커스텀 도메인까지 무료. Branch.io(상용)와 동일 기능을 벤더 종속 없이 자체 인프라에서 운영. 클릭당 과금 없음, 데이터 완전 소유.

  • FDL 대체: 디퍼드 딥링크·QR코드·UTM 추적·웹훅
  • 셀프호스팅: PostgreSQL, 클릭당 과금 $0, 데이터 완전 소유
  • iOS Universal Links + Android App Links 네이티브
원본 →
AI 코딩 도구

RevenueCat SOSA 2026 — AI 앱은 41% 더 벌지만 30% 더 빠르게 이탈, 하드 페이월이 프리미엄 5배

RevenueCat의 State of Subscription Apps 2026 리포트(115,000 앱·$16B 매출·10억 트랜잭션)에 따르면, AI 앱은 유저당 매출 41% 높지만 이탈율 30% 높다. 하드 페이월(즉시 결제 요청)은 프리미엄 대비 전환율 5배 (10.7% vs 2.1%). AI 앱은 LLM 한계비용 때문에 관대한 프리미엄 축소·연간 플랜 유도·AI 전용 상위 티어 도입 추세. 월 중위 구독료 $4.99~$9.99(월), $29~$39.99(연). 3~6개월 리텐션이 핵심.

  • AI 앱: 유저당 매출 41%↑, 이탈율 30%↑ — 리텐션이 핵심
  • 하드 페이월: 프리미엄 대비 전환율 5배(10.7% vs 2.1%)
  • 데이터: 115,000 앱·$16B 매출·10억 트랜잭션 분석
원본 →
AI 코딩 도구

ADK for Android 0.1.0 — Gemini Nano 4·AppFunctions·A2UI 하이브리드 온디바이스 에이전트

ADK(Agent Development Kit) for Android 0.1.0(2026-05)은 Google의 앱 내 AI 에이전트 프레임워크다. `com.google.adk:google-adk-kotlin-core-android:0.1.0`으로 시작, GenaiPrompt(ML Kit GenAI)로 Gemini Nano 4 Fast/Full 온디바이스 + 클라우드 Gemini hybrid — root orchestrator는 cloud, privacy-sensitive subagent는 on-device. Nano 4(Gemma 4 E2B/E4B distill·12GB+ RAM·NPU) roadmap — tool calling·structured output·system prompt·thinking mode로 cloud agent feature set 수렴 예정. AppFunctions(Android MCP)로 앱 도구·서비스·데이터를 시스템 에이전트에 노출, A2UI Compose Renderer로 에이전트 UI 자동 렌더링. ADK Python 2.0(서버)과 달리 Android AICore·EXECUTE_APP_FUNCTIONS 권한 경계가 핵심.

  • GenaiPrompt hybrid — cloud orchestrator + on-device subagent privacy boundary
  • Nano 4 roadmap — tool calling·structured output, AICore preview→ML Kit production path
  • AppFunctions + A2UI — 앱 action API + agent-rendered Compose UI
원본 →
AI 코딩 도구

OWASP MASVS-RESILIENCE + R8 — 모바일 앱 리버스 엔지니어링 방어의 2026년 표준 가이드

OWASP MASVS v2.0의 MASVS-RESILIENCE 카테고리는 모바일 앱의 리버스 엔지니어링·변조 방어 표준이다. Layer 1: R8(ProGuard 후속)로 이름 난독화·데드 코드 제거(무료, 필수), Layer 2: RASP(루트·디버거· Frida 후킹 탐지), Layer 3: Google Play Integrity API·Apple App Attest로 서버사이드 검증. R8는 제어 흐름 난독화·문자열 암호화 미지원 → jadx로 디컴파일 시 구조 노출. 핵심 로직은 서버에.

  • 3단계 방어: R8(난독화) → RASP(런타임) → Play Integrity(검증)
  • R8 한계: 이름 변경만, 제어 흐름·문자열 암호화 없음
  • OWASP MASVS v2.0: RESILIENCE-1~4, 모든 모바일 앱 보안 기준
원본 →
AI 코딩 도구

ObjectBox — 모바일/엣지 온디바이스 벡터 DB, HNSW 검색 + ACID + 오프라인 우선(Apache-2.0·~4.6k★)

ObjectBox는 Java·Kotlin·Swift·Flutter·C/C++용 온디바이스 NoSQL+벡터 데이터베이스다. HNSW 인덱스로 ANN 검색을 지원하고, 바이너리 <8MB·동적 RAM KB 수준으로 모바일에 최적화. ACID 트랜잭션·양방향 동기화· 오프라인 우선 설계. 벡터와 일반 객체 데이터를 함께 저장 가능해 RAG·시맨틱 검색에 적합. LG G8S(5년 전 단말)에서 쿼리당 ~0.25ms, 4,000 QPS 달성. LangChain VectorStore 통합.

  • 온디바이스 벡터 DB: HNSW ANN, <8MB 바이너리, KB급 RAM
  • ACID + 오프라인 우선 + 양방향 동기화
  • LangChain 통합: from_documents/from_texts로 RAG 구성
원본 →
AI 코딩 도구

sqlite-vector — SQLite에 벡터 검색 추가, 30MB RAM으로 온디바이스 Edge AI(크로스플랫폼)

sqlite-vector는 SQLite에 벡터 검색 기능을 추가하는 크로스플랫폼 C 확장이다. Float32·Float16·BFloat16· Int8·1Bit·TurboQuant 2/3/4bit 양자화를 지원하고, SIMD 가속으로 초고속 거리 계산. 30MB RAM으로 동작하며, 가상 테이블 없이 일반 테이블의 BLOB 컬럼에 벡터를 저장. iOS·Android·Windows·Linux·macOS 모두 지원. sqlite-ai(온디바이스 LLM)·sqlite-agent·sqlite-mcp와 연동해 로컬 AI 에이전트 구성 가능.

  • SQLite 확장: 30MB RAM, BLOB 컬럼에 벡터 저장, 가상 테이블 불필요
  • TurboQuant: SIMD 2/3/4bit 양자화 스캔 지원
  • 생태계: sqlite-ai·sqlite-agent·sqlite-mcp 로컬 AI 연동
원본 →
AI 코딩 도구

Aide — Gemma 4 온디바이스로 구동하는 안드로이드 AI 키보드·어시스턴트, 37개 언어 번역(오프라인)

Aide는 Gemma 4를 LiteRT-LM으로 온디바이스 실행하는 Android AI 앱이다. 시스템 키보드(InputMethodService)· 음성 어시스턴트·채팅을 하나의 모델로 통합. 키보드 트랜스폼 바에서 재작성·요약·문법 교정·톤 변경·번역 (37개 언어)을 로컬에서 처리. Sherpa-ONNX로 STT·TTS·VAD까지 온디바이스. Gemma 4 Function Calling으로 알람·캘린더·연락처·파일시스템·웹 검색까지 도구 호출. 모든 처리가 디바이스를 떠나지 않는다.

  • 키보드+어시스턴트+채팅: 하나의 Gemma 4 모델로 통합
  • 37개 언어 번역·재작성·요약·문법 교정: 완전 온디바이스
  • Function Calling: 알람·캘린더·연락처·웹 검색 도구 호출
원본 →
AI 코딩 도구

AppFollow — App Store·Google Play 리뷰를 AI로 자동 분석·태깅·응답, ASO까지 통합(Discord·Opera 사용)

AppFollow는 App Store·Google Play·Amazon 등 앱 스토어 리뷰를 단일 인박스에서 관리하는 플랫폼이다. AI가 리뷰를 자동 태깅(버그·기능 요청·가격·온보딩)하고, 감정 분석·트렌드 대시보드·경쟁사 리뷰 비교를 제공. AI 자동 응답은 감정·언어·앱 컨텍스트에 맞춰 초안을 생성하고, Zendesk·Slack·Jira 연동으로 워크플로우 자동화. Discord·Flo·Opera 등 사용. Google 데이터 기준 응답 시 평점 +0.7★ 상승 효과.

  • 단일 인박스: App Store·Google Play·Amazon 리뷰 통합 관리
  • AI 자동 태깅+감정 분석+자동 응답 초안 생성
  • 응답 효과: Google 데이터 기준 평점 +0.7★ 상승
원본 →
AI 코딩 도구

koog-compose — Koog + Compose로 온디바이스 AI 에이전트를 Android·iOS UI에 직접 통합(MIT)

koog-compose는 JetBrains Koog 위에 Compose Multiplatform UI를 결합한 온디바이스 AI 에이전트 런타임이다. koogCompose { } DSL 블록으로 LLM 대화·디바이스 도구(GPS·알람·WorkManager)·멀티스텝 플로우·토큰 스트리밍을 서버 없이 구현. koog-compose-mediapipe 모듈로 Gemma 4(LiteRT-LM)·Apple Foundation Models를 온디바이스 실행. Material 3 채팅 UI 컴포넌트·Room 기반 세션 영속화·테스트 유틸리티까지 제공.

  • DSL: koogCompose { } 블록으로 에이전트+UI 선언적 구현
  • 온디바이스: Gemma 4(LiteRT-LM) + Apple Foundation Models
  • 디바이스 도구: GPS·알람·WorkManager·파일시스템 접근
원본 →
AI 코딩 도구

Driftx — AI 코딩 에이전트에게 모바일 앱의 눈과 손을 주는 KMP 테스트 프레임워크(MIT)

Driftx는 Cursor·Claude Code 같은 AI 코딩 에이전트가 iOS 시뮬레이터·Android 에뮬레이터에서 실행 중인 앱을 직접 보고 조작할 수 있게 하는 MCP 서버다. 컴포넌트 트리 인스펙션·접근성 감사(대비·라벨·터치 타겟)· 시각적 회귀 테스트·Figma 디자인 비교를 지원. 4단계 탭 해석(CDP fiber → XCUITest → 접근성 쿼리 → measureInWindow)으로 정확한 요소 인터랙션. iOS용 XCUITest 컴패니언이 npm에 번들되어 Xcode 빌드 불필요.

  • MCP 서버: AI 에이전트가 앱을 직접 보고 조작, npx로 실행
  • 접근성 감사: 대비·라벨·터치 타겟 자동 검사
  • 시각적 회귀: 빌드 간 스크린샷 픽셀 비교, Figma 디자인 대조
원본 →
AI 코딩 도구

Autonoma — 자연어로 웹·iOS·Android E2E 테스트, AI가 요소를 비전으로 찾아 셀프힐링(오픈소스)

Autonoma는 자연어로 테스트 케이스를 작성하면 AI가 실제 브라우저(Playwright)·실제 디바이스(Appium)에서 실행하는 에이전트형 E2E 테스트 플랫폼이다. CSS 셀렉터·XPath 대신 비전 모델(Gemini·Moondream)로 UI 요소를 찾아 셀프힐링. 스크린샷 → LLM 판단 → 액션 실행 → 기록 루프로 동작. React 19·Hono·tRPC·Prisma· Redis 스택. PR마다 자동 회귀 테스트 실행으로 리그레션을 조기 발견.

  • 비전 기반: CSS/XPath 불필요, Gemini·Moondream이 요소 탐지
  • 크로스플랫폼: Playwright(웹) + Appium(iOS·Android) 통합
  • 셀프힐링: UI 변경 시 비전 모델이 자동으로 요소 재탐지
원본 →
AI 코딩 도구

Luciq Resolve Agent — 모바일 크래시를 AI가 자동 분석·코드 수정·PR 생성하는 에이전틱 디버깅 플랫폼

Luciq는 모바일 앱 크래시를 AI 에이전트가 자동으로 루트 코즈 분석하고 코드 수정 PR을 생성하는 에이전틱 옵저버빌리티 플랫폼이다. 스택 트레이스 + 디바이스 상태 + 피처 플래그 상관관계를 분석해 '90% 발생이 Login V2 플래그 활성화 + iOS 26일 때'와 같은 패턴을 자동 식별. 대시보드에서 diff 형태로 수정 제안을 보여주고, 피드백 5회까지 반복 개선. 코딩 에이전트(Cursor·Claude) 연동 예정.

  • 에이전틱 디버깅: 크래시 → 루트 코즈 → 코드 수정 PR 자동 생성
  • 패턴 인사이트: 피처 플래그·디바이스·SDK 버전 상관관계 자동 식별
  • 반복 개선: 피드백 5회까지 수정 반복, 대시보드 내 diff 표시
원본 →
AI 코딩 도구

Baidu Stability Analysis Agent — 크래시·ANR·OOM 로그를 AI가 파싱→심볼화→수정 제안하는 오픈소스 에이전트

Baidu Maps의 Stability Analysis Agent는 크래시·ANR·OOM·프리즈 로그를 자동으로 파싱하고, addr2line/atos로 심볼화하고, 소스 코드 컨텍스트를 추출한 뒤, LangGraph 멀티턴 추론으로 루트 코즈를 분석하고 수정을 제안하는 오픈소스 프레임워크다. ChromaDB 기반 RAG 지식 베이스로 이전 분석 결과를 학습. iOS·Android· macOS·Linux·Windows 지원. CLI·HTTP(SSE)·Python API 인터페이스. 자동 수정 적용 + 백업도 가능.

  • LangGraph 멀티턴: 파싱→심볼화→코드 추출→LLM 추론→수정 제안
  • RAG 지식 베이스: ChromaDB, 이전 분석 결과 누적 학습
  • 5개 OS 지원: iOS·Android·macOS·Linux·Windows
원본 →
AI 코딩 도구

KotlinSyft — OpenMined의 Android 연합학습 라이브러리, 온디바이스 학습으로 데이터가 디바이스를 안 떠남

KotlinSyft는 OpenMined이 만든 Android 연합학습(Federated Learning) 라이브러리다. PySyft 모델을 디바이스에서 직접 학습·추론하며, 사용자 데이터를 중앙 서버로 보내지 않는다. 충전 감지·WiFi 감지로 백그라운드 학습 시 디바이스 리소스를 보호. Secure Aggregation·Secure Multi-Party Computation 프로토콜 지원. iOS용 SwiftSyft, 웹용 syft.js와 함께 모바일+웹 연합학습 생태계를 구성.

  • 온디바이스 학습: 데이터가 디바이스를 떠나지 않음, PyTorch·TF 모델
  • Secure Aggregation: 모델 업데이트만 암호화된 채로 전송
  • 리소스 보호: 충전 감지·WiFi 감지·배터리 수준 체크
원본 →
AI 코딩 도구

MLC LLM — 크로스플랫폼 온디바이스 LLM 런타임, 같은 체크포인트로 iOS Metal·Android GPU·WebGPU 실행

MLC LLM은 같은 양자화 체크포인트를 iOS Metal·Android Adreno/Mali·WebGPU에서 실행하는 유일한 성숙한 크로스플랫폼 온디바이스 LLM 런타임이다. TVM Unity 컴파일러로 모델을 타겟 하드웨어에 최적화하고, pre-quantized 모델 zoo를 제공. Llama·Qwen·Gemma·Mistral·Phi 등 인기 모델 아키텍처를 지원. ExecuTorch(PyTorch 네이티브)·llama.cpp(GGUF 포터블)와 함께 2026년 온디바이스 LLM 3대 런타임.

  • 크로스플랫폼: 같은 체크포인트 → iOS Metal + Android GPU + WebGPU
  • TVM Unity 컴파일러: 타겟 하드웨어 자동 최적화
  • 모델 zoo: Llama·Qwen·Gemma·Mistral·Phi pre-quantized
원본 →
AI 코딩 도구

RunAnywhere SDK — Android 온디바이스 AI SDK, VAD→STT→LLM→TTS 보이스 파이프라인 올인원(Kotlin)

RunAnywhere는 Android용 프로덕션급 온디바이스 AI SDK로, VAD(음성 활동 감지)→STT(Whisper)→LLM(LlamaCPP) →TTS(Sherpa-ONNX) 전체 보이스 파이프라인을 오프라인에서 실행한다. Kotlin Coroutines+Flow 기반 비동기 아키텍처. LoRA 어댑터 런타임 핫스왑·온디바이스 RAG(벡터 검색+생성)까지 지원. iOS Swift SDK와 미러 API 제공으로 크로스플랫폼 개발 가능. 모델 라이프사이클 관리·분석·로깅 내장.

  • 보이스 파이프라인: VAD→STT→LLM→TTS, 완전 오프라인
  • LoRA 핫스왑: 런타임에 어댑터 교체, 모델 리로드 불필요
  • 온디바이스 RAG: 임베딩+벡터 검색+LLM 생성, 클라우드 $0
원본 →
AI 코딩 도구

V8V — KMP 크로스플랫폼 음성 오케스트레이션 프레임워크, 음성→로컬 액션·MCP·웹훅(MIT)

V8V는 Kotlin Multiplatform으로 만든 크로스플랫폼 음성 오케스트레이션 프레임워크다. 온디바이스 STT로 음성을 인식하고, 3가지 콜백(Local·MCP·Remote/웹훅)으로 로컬 앱 액션·크로스앱 MCP 명령·원격 워크플로우를 실행한다. Android·iOS·macOS·Web·Flutter·React Native 6개 플랫폼 지원. 오프라인 우선·다국어·프라이버시 보장. Maven Central(Android)·SPM(iOS)·npm(Web) 배포.

  • 3가지 콜백: Local(앱 내)·MCP(크로스앱)·Remote(웹훅)
  • 6개 플랫폼: Android·iOS·macOS·Web·Flutter·React Native
  • KMP 기반: 오프라인 우선, 다국어, 프라이버시 보장
원본 →
AI 코딩 도구

RecGPT-Mobile — Taobao가 실전 검증한 온디바이스 LLM 추천 에이전트, 사용자 의도를 실시간 해석

RecGPT-Mobile은 Taobao(알리바바)가 수백만 실사용자로 검증한 온디바이스 LLM 기반 추천 프레임워크다. 경량 LLM을 디바이스에 배포해 사용자의 암묵적 행동(클릭·스크롤·체류시간)을 명시적 의도 쿼리로 변환하고, 추천 결과를 실시간으로 조정한다. 빈도 제어 메커니즘으로 불필요한 추론을 줄여 디바이스 리소스를 최적화. 클라우드 LLM 추론 대비 레이턴시와 비용을 대폭 절감하면서도 추천 정확도와 해석 가능성 모두 향상.

  • 온디바이스 의도 에이전트: 암묵적 행동 → 명시적 의도 쿼리 변환
  • Taobao 프로덕션: 수백만 실사용자, 추천 정확도+해석 가능성 향상
  • 빈도 제어: 중복 추론 방지로 디바이스 리소스 최적화
원본 →
AI 코딩 도구

OD-LLM — 온디바이스 LLM 순차 추천을 위한 태스크 적응형 압축 프레임워크(학술 논문)

OD-LLM은 LLM을 모바일 디바이스에서 순차 추천(Sequential Recommendation)에 사용하기 위해 설계된 최초의 태스크 적응형 압축 프레임워크다. 토큰 레벨 정규화·저랭크 구조 분해(SVD)·점진적 정렬을 통합해 사용자-아이템 상호작용의 시간적 패턴을 보존하면서 모델을 대폭 압축. 기존 범용 양자화(GPTQ·AWQ)와 달리 추천 시스템의 행동 민감성에 맞춤 설계. 프라이버시 보장·실시간 개인화·오프라인 추천을 동시에 달성.

  • 태스크 적응형: 추천 시스템의 행동 민감성에 맞춘 LLM 압축
  • 3가지 기법 통합: 토큰 정규화 + SVD 분해 + 점진적 정렬
  • 프라이버시+실시간: 데이터가 디바이스를 안 떠남, 오프라인 동작
원본 →
AI 코딩 도구

Project KARL — Kotlin 온디바이스 적응형 AI 라이브러리, 데이터가 디바이스를 절대 안 떠나는 프라이버시 우선(Apache-2.0)

Project KARL은 프라이버시 우선 온디바이스 적응형 AI를 위한 Kotlin 라이브러리다. 모든 학습과 추론이 사용자 디바이스에서만 실행되어 데이터가 절대 외부로 전송되지 않는다(Zero Data Egress). 조합 가능한 컨테이너(Composable Container) 아키텍처로 AI 상태와 로직을 정의된 경계 내에서 관리. 사용자 행동에서 직접 학습해 키보드·생산성·건강·습관 앱 등의 개인화를 구현. Apache-2.0 라이선스.

  • Zero Data Egress: 모든 학습·추론이 디바이스에서만 실행
  • Composable Container: AI 상태·로직을 정의된 경계 내 관리
  • 온디바이스 적응: 사용자 행동에서 직접 학습, 서버 불필요
원본 →
AI 코딩 도구

Apple Trust Insights(iOS 27) — 소셜 엔지니어링·코칭 사기를 온디바이스 ML로 탐지하는 프레임워크

Trust Insights는 iOS 27에서 도입된 프레임워크로, 사용자가 사기범에게 코칭 받으면서 위험한 행동을 하는 상황을 온디바이스 ML로 탐지한다. 결제·계정 변경·원격 접근 같은 민감한 순간에 행동 컨텍스트를 분석해 IsLikelyBeingCoachedInsight(unknown/medium/high)를 반환. 개인 콘텐츠(사진·메시지)에 접근하지 않고 인터랙션 패턴·타이밍·센서 데이터만 분석. reportConsumption 필수, Apple Business Register로 오프라인 피드백.

  • 온디바이스 ML: 행동 패턴·타이밍·센서로 코칭 사기 탐지
  • 프라이버시: 개인 콘텐츠 접근 없이 위험 신호만 반환
  • 피드백 루프: reportConsumption(필수) + 오프라인 사기 라벨
원본 →
AI 코딩 도구

flutter_doclayout_kit — PP-DocLayout ONNX로 문서 구조를 온디바이스 분석, 23종 요소 감지(Flutter)

flutter_doclayout_kit는 PaddlePaddle의 PP-DocLayout 모델을 ONNX Runtime으로 모바일에서 실행해 문서 레이아웃을 분석하는 Flutter 플러그인이다. 텍스트·제목·표·수식·그림 등 23종 문서 요소를 감지. Medium 모델(22MB)과 Large 모델(123MB) 선택 가능. 오프라인 완전 지원, iOS는 Core ML Execution Provider로 가속(메모리 ~1.5GB). 카메라 실시간 스캔·정적 이미지 분석·폼 재구성까지 엔드투엔드 워크플로우.

  • 23종 요소 감지: 텍스트·제목·표·수식·그림·헤더·참조·방정식
  • PP-DocLayout: Medium(22MB, 빠름) / Large(123MB, 정확)
  • iOS Core ML 가속 + Android ONNX Runtime, 완전 오프라인
원본 →
AI 코딩 도구

Locanara — LangChain에서 영감받은 모바일 온디바이스 AI 프레임워크, 체인·RAG·가드레일 DSL(AGPL-3.0)

Locanara는 LangChain에서 영감받아 모바일 전용으로 설계된 온디바이스 AI 프레임워크다. llama.cpp·CoreML· MLX·Apple Foundation Models 백엔드를 지원하고, InferenceRouter가 디바이스 하드웨어(NPU·메모리·칩셋)를 자동 감지해 최적 엔진을 선택. 체이닝 DSL·WindowMemory·SummaryMemory·온디바이스 RAG(벡터스토어+임베딩+ 쿼리)·가드레일을 제공. iOS 18.1+ / Android 15+, Swift API.

  • LangChain for Mobile: 체인 DSL, 메모리, RAG, 가드레일
  • InferenceRouter: NPU·메모리·칩셋 자동 감지 → 최적 엔진
  • 4개 백엔드: llama.cpp·CoreML·MLX·Apple Foundation Models
원본 →
AI 코딩 도구

PowerLens — LLM 에이전트로 Android 전력 관리를 자동화, 38.8% 에너지 절감·0.5% 배터리 소모(학술)

PowerLens는 LLM 에이전트가 UI 시맨틱과 사용자 활동을 인식해 18개 디바이스 파라미터에 걸쳐 개인화된 전력 정책을 생성하는 Android 시스템이다. PDL 기반 제약 프레임워크가 모든 액션을 실행 전 검증하고, 2계층 메모리(STM+LPM)가 3~5일 내에 사용자 선호도를 학습. 주식 Android 대비 38.8% 에너지 절감, 81.7% 액션 정확도, 시스템 자체는 일일 배터리의 0.5%만 소모. 루팅 Android 디바이스에서 검증.

  • 38.8% 에너지 절감: 18개 파라미터 개인화 전력 정책
  • PDL 안전 검증: 모든 액션을 실행 전 제약 조건 체크
  • 2계층 메모리: 3~5일 내 사용자 선호도 자동 학습
원본 →
AI 코딩 도구

MNN-AECS — 모바일 LLM 디코딩 에너지를 23% 절감, 루트 없이 엔진 레벨 코어 선택 최적화

MNN-AECS는 모바일 디바이스에서 LLM 디코딩 시 에너지를 절감하는 최초의 엔진 레벨 솔루션이다. 메모리 바운드인 디코드 페이즈에서 저전력 CPU 코어를 동적으로 선택해, 속도 저하 없이 평균 23% 에너지 절감(7대 Android·iOS 디바이스, 5개 LLM). llama.cpp·ExecuTorch·MediaPipe 대비 39~78% 에너지 절감 + 12~363% 속도 향상. 루트 접근·OS 수정 불필요. MNN 엔진에 통합.

  • 23% 에너지 절감: 디코드 페이즈 저전력 코어 동적 선택
  • 루트 불필요: 앱 레벨에서 엔진 내 AECS 적용
  • 경쟁 엔진 대비: llama.cpp 대비 39~78% 에너지 절감
원본 →
AI 코딩 도구

AgentStop(Brave) — 온디바이스 AI 에이전트의 낭비적 추론을 조기 종료해 15~20% 에너지 회수

AgentStop는 Brave가 만든 경량 효율성 감독자(supervisor)로, 로컬 AI 에이전트의 LLM 추론을 실시간 모니터링하다가 성공 가능성이 낮은 체인을 조기 종료해 배터리를 절약한다. 실패한 코딩 시도 하나가 ~3,000mWh(100Wh 노트북의 ~3%)를 소모하는 문제를 해결. 태스크 완료율 5% 미만 하락으로 15~20% 낭비 에너지 회수. SWE-Bench Verified(Qwen3-Coder-30B-A3B)에서 검증.

  • 15~20% 에너지 회수: 태스크 완료율 <5% 하락
  • 실시간 감독: 성공 가능성 예측 → 낭비적 추론 조기 종료
  • Brave 검증: SWE-Bench, 코딩 에이전트 실전 테스트
원본 →
AI 코딩 도구

vision_ai — Flutter 온디바이스 손 제스처 13종 + 얼굴 감정 7종, 25~30fps 실시간 인식(MIT)

vision_ai는 Flutter용 온디바이스 손 제스처 인식 + 얼굴 감정 감지 패키지다. MediaPipe Gesture Recognizer(~8MB)로 13종 제스처(주먹·평손·피스·엄지·포인팅·ILY·OK·1~5)를 인식하고, TFLite CNN(~2MB)으로 7종 감정(행복·슬픔·놀람·분노·혐오·공포·중립)을 감지. 커스텀 제스처 패턴 정의, 21개 손 랜드마크 좌표, 모션 추적(속도·방향), 양손 인터랙션(핀치·박수). 25~30fps, 클라우드 $0.

  • 13종 제스처 + 7종 감정: MediaPipe + TFLite, 총 ~10MB
  • 25~30fps: GPU 가속 + 자동 CPU 폴백
  • 커스텀 제스처: 와일드카드 패턴으로 새 제스처 정의
원본 →
AI 코딩 도구

Gemini Agent Mode(Android Studio) — IDE 내장 AI 에이전트, 멀티파일 편집·Compose UI 생성·빌드 에러 수정

Gemini Agent Mode는 Android Studio Quail(2026.1.1)에 내장된 AI 코딩 에이전트다. 복잡한 멀티스테이지 개발 태스크(유닛 테스트 생성·UI 변경·에러 수정)를 설명하면 실행 계획을 수립하고 여러 파일에 걸쳐 편집을 제안. 와이어프레임·목업 이미지를 첨부하면 Compose UI 코드로 변환. Gradle 빌드 에러·크래시 분석에 특화. SKILL.md/AGENTS.md 형식이 Claude Code와 호환되어 에이전트 간 스킬 공유 가능.

  • IDE 네이티브: Android Studio 내장, 컨텍스트 전환 없음
  • 이미지→코드: 와이어프레임·목업 첨부 → Compose UI 생성
  • 스킬 호환: SKILL.md/AGENTS.md가 Claude Code와 공유 가능
원본 →
AI 코딩 도구

Mobile Agency — Android·iOS·Flutter·RN·Unity·Unreal용 AI 에이전트 스킬 패키지, 16명 전문가 에이전트

Mobile Agency는 모바일·게임 개발 전용 AI 에이전트 스킬·프롬프트·워크플로우 컬렉션이다. Claude Code·Cursor·Windsurf·GitHub Copilot·Codex·Gemini에 npx 한 줄로 설치. 16명 전문가 에이전트 (@CRASHER: 크래시 디버깅, @AXIOM: Kotlin 코드 리뷰, @MOBILE-HARNESS: 기능 빌드·테스트·검증)와 13개 엔드투엔드 워크플로우(/flutter-review, /perf-audit, /mobile-mcp-qa). Android·iOS·Flutter· React Native·Unity·Unreal Engine 6개 플랫폼 지원.

  • 16명 전문가 에이전트: @CRASHER·@AXIOM·@MOBILE-HARNESS 등
  • 6개 도구 지원: Claude·Cursor·Windsurf·Copilot·Codex·Gemini
  • 6개 플랫폼: Android·iOS·Flutter·RN·Unity·Unreal
원본 →
AI 코딩 도구

NeuralPulse — Wear OS 7 + Android 16 임상급 헬스 생태계, PPG·ECG·EDA를 FHIR R4로 내보내기(오픈소스)

NeuralPulse은 Samsung Galaxy Watch + Android 16용 임상급 건강 모니터링 오픈소스 생태계다. 웨어러블 센서 허브에서 PPG·ECG·EDA·BIA 고주파 생체 데이터를 스트리밍하고, 온디바이스 DSP 필터링 + MediaPipe INT8 MobileNetV3 + 로컬 Gemma 모델로 엣지 AI 분석. Android 16 Health Connect FHIR R4 관측 스키마로 임상 기록 동기화. 카메라 기반 영양 분석까지 단일 코드베이스에 통합한 유일한 오픈소스 플랫폼.

  • 임상급: PPG·ECG·EDA·BIA 고주파 생체 데이터 + FHIR R4 내보내기
  • 엣지 AI: MediaPipe MobileNetV3(INT8) + 로컬 Gemma 모델
  • 단일 코드베이스: 웨어러블 생체 + FHIR + 영양 분석 통합
원본 →
AI 코딩 도구

nsfw_detect(Flutter) — 온디바이스 NSFW 감지, 이미지·비디오·카메라·갤러리 스캔 통합(Core ML·TFLite)

nsfw_detect는 Flutter용 온디바이스 NSFW 콘텐츠 감지 패키지다. iOS Core ML + Android TFLite로 추론하며, 이미지 파일·비디오·메모리 바이트·URL·갤러리 에셋·라이브 카메라까지 7가지 입력 소스를 지원. 텔레메트리 없음, 네트워크 전송 없음(scanUrl 제외). confidenceThreshold 튜닝으로 제품별 위험 수준 조절 가능. 배치 처리·백그라운드 아이솔레이트(compute())로 UI 블로킹 없이 대량 스캔.

  • 7가지 입력: 파일·비디오·바이트·URL·에셋·갤러리·카메라
  • 프라이버시: 텔레메트리 $0, 이미지가 디바이스를 안 떠남
  • 배치+백그라운드: compute() 아이솔레이트로 UI 논블로킹
원본 →
AI 코딩 도구

SideEye — 4B VLM으로 갤러리를 온디바이스 스캔, 민감한 사진을 AES-256 볼트에 격리(오픈소스·Android)

SideEye는 OmniNeural-4B VLM을 Qualcomm NPU에서 온디바이스 실행해 사진 갤러리를 스캔하고 민감한 콘텐츠(누드·약물·당혹)를 자동 분류하는 Android 앱이다. 플래그된 이미지를 스와이프 UI에서 삭제·유지· 볼트 중 선택. AES-256-GCM 암호화 볼트(PIN+생체 인증, 15분 세션 타임아웃)로 안전 보관. Google Photos 클라우드 백업 감지 경고로 민감한 이미지의 의도치 않은 동기화를 방지.

  • 온디바이스 4B VLM: Nexa SDK + Qualcomm NPU, 서버 전송 $0
  • AES-256 볼트: PIN + 생체 인증, 15분 세션 타임아웃
  • Google Photos 경고: 민감 이미지 클라우드 동기화 방지
원본 →
AI 코딩 도구

ORB-SLAM2s(Android) — 모든 Android 폰에서 6DoF SLAM·포인트 클라우드·재위치 추정(오픈소스)

ORB-SLAM2s는 ORB-SLAM2를 Android에 이식한 공간 컴퓨팅 도구다. 단안 카메라 입력으로 실시간 희소 포인트 클라우드 매핑, 맵 저장·로드, 재위치 추정(Relocalization)을 수행. 키포인트 시각화·매칭 통계· 바닥/표면 평면 감지·OpenGL ES AR 렌더링까지 지원. 어두운 프레임 자동 스킵으로 SLAM 스레드 블로킹 방지. VIO(Visual-Inertial Odometry) 통합과 FPS 최적화가 로드맵에 있음.

  • 6DoF SLAM: 단안 카메라로 실시간 포인트 클라우드 매핑
  • 맵 영속성: 로컬 저장 → 로드 → 재위치 추정
  • OpenGL ES AR: 감지된 평면에 3D 오브젝트 배치
원본 →
AI 코딩 도구

YOLO26 — NMS 없는 엣지 퍼스트 객체 감지, CPU 추론 43% 빠름(Ultralytics, 모바일·IoT)

YOLO26은 Ultralytics가 엣지 디바이스 전용으로 설계한 실시간 객체 감지 모델 패밀리다. One-to-One 감지 헤드로 NMS 후처리를 완전 제거해 결정론적·저레이턴시 추론을 달성. Nano 모델은 YOLO11 대비 CPU 추론 43% 빠름. 감지·세그멘테이션·포즈 추정·분류·OBB 5개 태스크 통합. CoreML(Apple)·TFLite (Android)·TensorRT·OpenVINO 19개 포맷 내보내기. INT8/FP16 양자화 안정성 내장.

  • NMS-Free: 후처리 없이 결정론적 추론, 엣지 배포 단순화
  • CPU 43% 빠름: Nano 모델, 모바일·스마트 카메라·IoT
  • 5개 태스크: 감지·세그멘테이션·포즈·분류·OBB 통합
원본 →
AI 코딩 도구

MobileLLM-Flash(Meta) — 하드웨어 인더 루프 아키텍처 검색으로 모바일 최적 LLM 설계, ExecuTorch 호환

MobileLLM-Flash는 Meta가 모바일 레이턴시에 최적화된 LLM을 설계하기 위해 만든 하드웨어 인더 루프 아키텍처 검색(NAS) 프레임워크다. 사전학습된 백본의 가중치를 상속받아 프루닝 기반 후보를 생성하고, 레이턴시 모델을 학습해 파레토 최적 아키텍처를 찾는다. 얕고 넓은(shallow-and-wide) 구조 + 인터리브드 스킵 어텐션이 모바일 CPU에서 최적. ExecuTorch 호환, 학습 토큰 35%만으로 동등 품질 달성.

  • 하드웨어 인더 루프 NAS: 레이턴시 모델 학습 → 파레토 최적 검색
  • 35% 토큰으로 동등 품질: 프루닝 기반 가중치 상속
  • ExecuTorch 호환: shallow-and-wide + 스킵 어텐션
원본 →
AI 코딩 도구

NexaSDK — NPU 퍼스트 온디바이스 AI SDK, Snapdragon에서 LLM·VLM·ASR·TTS 올인원 추론(Qualcomm)

NexaSDK는 Qualcomm이 투자한 온디바이스 AI 추론 프레임워크로, Hexagon NPU를 최우선으로 활용한다. Android·Windows·Linux에서 LLM·VLM·ASR·TTS·임베딩·리랭크까지 풀 멀티모달 지원. Day-0 모델 지원 (새 모델 출시 당일 배포), OpenAI 호환 API + Function Calling. Ollama·llama.cpp·LM Studio 대비 NPU 지원·Android SDK·멀티모달·크로스플랫폼에서 차별화.

  • NPU 퍼스트: Snapdragon Hexagon, GPU·CPU 폴백
  • Day-0 모델 지원: 새 모델 출시 당일 배포
  • 풀 멀티모달: LLM·VLM·ASR·TTS·임베딩·리랭크
원본 →
AI 코딩 도구

ACE-Step 1.5 — 오픈소스 AI 음악 생성, RTX 3090에서 10초에 한 곡·<4GB VRAM·LoRA 커스텀(MIT·11k★)

ACE-Step 1.5는 상용 수준을 뛰어넘는 오픈소스 음악 생성 파운데이션 모델이다. A100에서 2초, RTX 3090에서 10초에 한 곡을 생성하고, <4GB VRAM으로 동작. 10초~10분 유연한 길이, 배치 8곡 동시 생성. LoRA로 몇 곡만으로 개인 스타일 학습 가능. Apple Silicon MLX 백엔드 지원(0.6B 모델, 16GB+ Mac). CUDA·MPS· ROCm·Intel XPU·CPU 크로스 하드웨어. MIT 라이선스, 상업 이용 가능.

  • <4GB VRAM: RTX 3090에서 10초/곡, A100에서 2초/곡
  • LoRA 커스텀: 몇 곡으로 개인 스타일 학습
  • Apple Silicon: MLX 백엔드, 16GB+ Mac에서 0.6B 모델
원본 →
AI 코딩 도구

Cadence — 생체 데이터로 실시간 개인화 음악을 생성하는 iOS·Android AI 앱, iso-principle 기반(오픈소스)

Cadence는 심박수·HRV·수면·스트레스 생체 데이터를 읽어 실시간으로 개인화된 음악을 생성하는 AI 앱이다. iso-principle(현재 감정 상태에 매칭 → 점진적으로 목표 감정으로 유도)을 구현. 2단계 파이프라인: (1) LLM이 생체 데이터를 곡 스타일로 변환, (2) 텍스트-투-뮤직 엔진이 음악 생성. 로컬 서버(Ollama· SongGeneration) 연결로 완전 프라이빗 배포 가능. HealthKit·Health Connect 연동.

  • iso-principle: 현재 감정 매칭 → 목표 감정으로 점진 유도
  • 2단계 파이프라인: LLM(생체→스타일) + 텍스트-투-뮤직
  • 로컬 배포: Ollama + SongGeneration 자체 서버 연결 가능
원본 →
AI 코딩 도구

GitHub Issues MCP 필드 — 에이전트가 이슈 우선순위·영역·날짜를 구조화해 자동 triage

GitHub는 2026년 6월 18일 Changelog에서 GitHub MCP 서버가 issue fields를 읽고 쓸 수 있게 됐다고 발표했다. AI 도구가 연결되면 이슈를 만들 때 Priority·Area·Date 같은 필드를 자동으로 채우고, 필드값으로 기존 이슈를 필터링할 수 있다. 같은 업데이트에는 이슈 생성 중 중복 후보를 최대 3개까지 inline으로 보여주는 public preview도 포함됐다. GitHub MCP 서버는 공식 저장소 기준 30.8k★이며, issue fields는 1,000개 이상 조직이 preview에서 채택한 구조화 메타데이터 기능이다.

  • MCP 서버가 issue fields 읽기/쓰기 지원: Priority·Area·Date 자동 설정
  • 중복 이슈 후보 최대 3개 inline 표시로 maintainer triage 시간 절감
  • 공식 GitHub MCP 서버 30.8k★ + issue fields 1,000+ 조직 preview 채택
원본 →
AI 코딩 도구

AppFunctions(Android MCP) — alpha09·UriGrant·suspend IO·EXECUTE_APP_FUNCTIONS

AppFunctions는 Android 앱이 자기 기능을 온디바이스 MCP 도구처럼 노출하는 Android 플랫폼 API+Jetpack(1.0.0-alpha09 May 2026). @AppFunction+KSP compiler→assets/app_function_v2.xml OS registry index. caller EXECUTE_APP_FUNCTIONS permission+isAppFunctionEnabled(package,functionId) pre-check. alpha09 — AppFunctionUriGrant(auto permission grant returned URI), Int/String value constraints, AppFunctionTestRule(Robolectric), suspend+withContext(Dispatchers.IO) mandatory(UI thread default). first param AppFunctionContext required. Gemini integration private preview(EAP register), Android 16+ experimental — adb shell cmd app_function list-app-functions local verify. vs cloud MCP server — zero network round-trip·permission-gated local tool call.

  • alpha09 AppFunctionUriGrant — returned content URI permission auto-grant to caller
  • suspend+Dispatchers.IO — @AppFunction runs UI thread by default, block work off-main
  • EXECUTE_APP_FUNCTIONS gate — discover+execute requires platform permission not just intent
원본 →
AI 코딩 도구

Android AI Sample Catalog — Firebase AI Logic과 ML Kit GenAI 샘플을 한 앱에서 복사해 배우기

Android AI Sample Catalog는 Google이 공개한 AI 샘플 모음 앱이다. Imagen 이미지 생성, Gemini Nano 온디바이스 요약, Gemini Nano 이미지 설명, 음성으로 제어하는 할 일 앱, 온디바이스 rewrite assistance 같은 예제를 한 프로젝트에서 실행해 볼 수 있다. 클라우드 추론 샘플은 Firebase AI Logic SDK를, 온디바이스 추론 샘플은 ML Kit GenAI API를 사용한다. 각 샘플은 관련 README와 코드 조각을 포함하고, AI 기능 코드가 독립적으로 복사하기 쉽게 구성돼 있다. 새 API를 문서만 읽지 말고 최소 동작 샘플로 비교할 때 유용하다.

  • 클라우드 샘플은 Firebase AI Logic, 온디바이스 샘플은 ML Kit GenAI
  • Gemini Nano 요약·이미지 설명·rewrite assistance를 직접 실행
  • GitHub 소스와 README 중심: 학습용으로 복사 가능한 self-contained 샘플
원본 →
AI 코딩 도구

Android CLI + Skills — 어떤 코딩 에이전트든 Android 개발 규칙에 맞게 접지

Google은 2026년 4월 Android CLI, Android skills, Android Knowledge Base를 에이전트용 개발 표면으로 공개했다. 핵심은 Android Studio 밖의 Claude Code, Codex, Antigravity 같은 에이전트도 SDK 설치, 프로젝트 생성, 에뮬레이터 생성, 실행 같은 Android 작업을 추측 없이 수행하게 만드는 것이다. 공식 블로그는 내부 실험에서 표준 도구만 쓸 때보다 LLM 토큰 사용을 70% 이상 줄이고 작업을 3배 빠르게 끝냈다고 설명한다. skills는 Navigation 3, edge-to-edge, AGP 9, XML-to-Compose, R8 분석 같은 반복 작업을 SKILL.md 지침으로 제공하고, Knowledge Base는 최신 Android/Firebase/Kotlin 문서를 에이전트 컨텍스트로 가져오게 한다.

  • Android CLI: sdk install, create, emulator, run, update를 에이전트가 터미널에서 호출
  • 공식 내부 실험: 토큰 사용 70%+ 감소, 작업 3배 빠름
  • Android skills + Knowledge Base: 최신 권장 패턴으로 에이전트 응답 접지
원본 →
AI 코딩 도구

Google AI Studio Android 프로토타이핑 — 프롬프트에서 Compose 앱까지

Google I/O 2026 Android 개발자 요약에서 Google은 AI Studio에서 프롬프트만으로 네이티브 Android 앱을 만들 수 있다고 발표했다. 생성되는 앱은 Jetpack Compose, Kotlin, Google 권장 패턴을 바탕으로 하고, 브라우저 안의 임베디드 에뮬레이터로 반복 테스트한 뒤 실제 기기에 배포할 수 있다. 만든 앱은 Play Console의 internal testing track으로 공유하고, 더 넓은 출시 전에는 Android Studio로 가져가 고급 디버깅, 테스트, UI polish를 이어가는 흐름이다. 실무 포인트는 '프로덕션 IDE 대체'가 아니라 아이디어 검증과 초기 샘플 생성 시간을 줄이는 프로토타이핑 입구로 보는 것이다.

  • 프롬프트 → Kotlin/Compose 네이티브 Android 앱 초안 생성
  • AI Studio 내 임베디드 에뮬레이터로 반복 테스트, 실제 기기 배포 가능
  • Play internal testing 공유 후 Android Studio에서 디버깅·테스트·UI polish
원본 →
AI 코딩 도구

Android Studio Agent Mode 병렬 대화 — 테스트·기획·문서화를 분리해 동시에 진행

Android Studio I/O Edition 도구 업데이트는 Gemini Agent Mode에 병렬 conversation 흐름을 추가했다. 한 대화에서는 테스트를 실행해 기다리고, 다른 대화에서는 새 기능의 planning mode를 돌리며, 또 다른 대화에서는 문서를 작성하는 식으로 작업 맥락을 분리한다. 같은 업데이트는 Agent Mode가 Compose UI에 직접 진입해 프리뷰 생성, 이미지 기반 UI 생성, UI 변환 같은 작업을 돕는 흐름도 강조한다. 이미 Agent Mode 자체는 기존 카드에서 다뤘으므로, 이 카드는 '에이전트 하나와 긴 채팅 하나'가 아니라 독립 작업을 대화 단위로 쪼개 병렬화하는 운영 패턴에 초점을 둔다.

  • 병렬 conversations: 테스트 대기 중 기획·문서화 대화를 별도로 진행
  • 작업별 맥락 분리로 Agent Mode 응답 범위를 좁힘
  • Compose Preview·이미지 기반 UI 생성·UI 변환 등 UI 작업 진입점 확대
원본 →
AI 코딩 도구

Android XR + Gemini — Geospatial 좌표를 구조화 JSON 투어로 바꾸는 패턴

2026년 6월 Android Developers Blog의 XR 예제는 Android XR, ARCore for Jetpack XR의 Geospatial API, Firebase AI Logic의 Gemini API를 묶어 혼합현실 투어 가이드를 만든다. 앱은 디바이스 포즈를 위도·경도와 방향 정확도로 변환하고, 정확도가 충분할 때 Gemini에 현재 좌표를 넘긴다. Gemini 호출에는 Google Maps grounding과 JSON response schema를 함께 설정해, 주변 도보 투어 3개를 title, description, stops 같은 구조화 데이터로 받는다. 학습 포인트는 멀티모달 '멋진 데모'보다 위치 정확도 게이트와 스키마 기반 출력으로 XR UI가 바로 소비할 수 있는 데이터를 만드는 설계다.

  • ARCore for Jetpack XR Geospatial API: 디바이스 포즈 → 위도·경도·방향 정확도
  • Firebase AI Logic + Gemini + Google Maps grounding으로 주변 투어 생성
  • responseSchema + application/json으로 XR UI가 바로 쓰는 구조화 결과 수신
원본 →
AI 코딩 도구

Android 17 AppFunctions Agent Skill — 앱 기능을 에이전트 도구 코드로 생성·검증

Android 17은 AppFunctions를 '인텔리전스 시스템'의 핵심 앱 통합 지점으로 확장한다. 앱은 @AppFunction을 붙인 Kotlin 함수와 KDoc으로 노트 생성, 장바구니 추가 같은 기능을 선언하고, Android MCP의 온디바이스 도구처럼 에이전트에 노출한다. 새 AppFunctions agent skill은 앱의 핵심 워크플로우를 분석해 필요한 Kotlin 코드를 만들고, LLM tool-calling에 맞게 KDoc을 다듬으며, ADB 테스트·디버깅 명령까지 제안한다. Gemini 통합은 private preview라 바로 배포 기능으로 보면 안 되고, 지금은 함수 경계와 설명 문서를 에이전트가 호출하기 좋게 설계하는 준비 단계로 보는 것이 맞다.

  • @AppFunction + KDoc: 앱 기능을 OS/에이전트가 발견할 수 있는 도구로 선언
  • agent skill: Kotlin 코드 생성, KDoc 최적화, ADB 테스트 명령 제안
  • Gemini 통합은 private preview: 프로덕션 전 함수 경계 설계가 핵심
원본 →
AI 코딩 도구

Android 17 NPU 접근 선언 — 온디바이스 AI 앱은 하드웨어 기능을 명시해야 한다

Android 17에서 앱이 NPU에 직접 접근해야 한다면 manifest에 FEATURE_NEURAL_PROCESSING_UNIT을 선언해야 한다. 대상은 LiteRT NPU delegate, 벤더별 NPU SDK, deprecated NNAPI를 쓰는 앱까지 포함된다. 선언이 없으면 target SDK 37 이상 앱은 NPU 접근이 차단될 수 있다. 온디바이스 LLM, 비전 모델, 음성 모델처럼 가속기 의존도가 큰 기능은 단순히 라이브러리만 붙이는 문제가 아니라, 기기 기능 선언·fallback 경로·성능 테스트를 함께 관리해야 한다. AI 기능을 출시할 때 CPU/GPU/NPU 경로를 명확히 나누는 체크리스트가 필요해진다.

  • target SDK 37+: NPU 직접 접근 시 FEATURE_NEURAL_PROCESSING_UNIT 선언 필요
  • LiteRT NPU delegate·벤더 SDK·NNAPI 사용 앱까지 영향
  • 온디바이스 AI는 manifest, fallback, 성능 테스트를 함께 설계
원본 →
AI 코딩 도구

ML Kit GenAI Structured Output — Gemini Nano 결과를 파싱 대신 스키마로 받기

Google I/O 2026 AI on Android 업데이트는 ML Kit GenAI Prompt API의 프로덕션화 방향을 제시했다. Gemini Nano 4는 AICore Developer Preview에서 미리 써보고, production-ready 앱에서는 ML Kit GenAI Prompt API로 전환하는 흐름이다. 새 Structured Output API는 Prompt API 결과를 개발자가 정의한 객체 클래스로 받게 해, 문자열을 직접 파싱하는 불안정한 코드를 줄인다. Prefix Caching은 반복되는 프롬프트 앞부분의 중간 LLM 상태를 재사용해 온디바이스 추론 시간을 줄인다. 핵심은 '맞춤 프롬프트'를 데모로 끝내지 않고, 스키마·캐시·fallback으로 앱 기능처럼 운영하는 것이다.

  • Structured Output: Prompt API 결과를 정의한 객체 클래스로 수신
  • Prefix Caching: 반복 프롬프트의 중간 LLM 상태 재사용
  • Gemini Nano 4: preview 실험 후 ML Kit GenAI Prompt API로 production 경로 전환
원본 →
AI 코딩 도구

A2A 1년 — MCP가 도구 연결이라면 A2A는 에이전트끼리 업무를 넘기는 규약

Google Developers Blog는 2026년 6월 18일 A2A(Agent-to-Agent) 1주년 업데이트에서 협업형 에이전트 패턴을 정리했다. MCP가 한 에이전트가 도구와 데이터에 접근하는 통로라면, A2A는 서로 다른 에이전트가 능력을 발견하고 업무를 위임하며 결과를 주고받는 통신 계층이다. 실무 포인트는 거대한 단일 에이전트에 모든 컨텍스트를 밀어 넣는 대신, 결제·데이터 분석·DevOps·고객지원처럼 권한과 지식 경계가 다른 작업을 전문 에이전트로 분리하는 것이다. Android 앱도 AppFunctions나 MCP로 앱 내부 도구를 열고, 외부 업무는 A2A 에이전트에 위임하는 구조를 상상할 수 있다.

  • MCP: agent-to-tool, A2A: agent-to-agent 협업 계층
  • 전문 에이전트에 업무 위임: 컨텍스트 오염과 권한 범위 확대를 줄임
  • 모바일 앱은 내부 기능은 AppFunctions, 외부 업무는 A2A로 분리 가능
원본 →
AI 코딩 도구

Android Computer Control — 코드 변경 없이 앱 UI를 에이전트 자동화 대상으로 준비

Android Computer Control은 OEM 선탑재 AI 어시스턴트가 사용자의 허가를 받은 뒤 설치된 앱을 가상 디스플레이에서 실행하고, 스크린샷 분석과 탭·스와이프·텍스트 입력으로 다단계 작업을 수행하는 preview 프레임워크다. target app은 별도 SDK 통합 없이 기존 UI를 자동화 대상으로 둘 수 있지만, 실제 자동화 품질은 적응형 레이아웃, 생명주기 처리, 명확한 화면 상태 같은 기본 앱 품질에 좌우된다. AppFunctions가 명시적 도구 API라면 Computer Control은 UI 자동화 fallback에 가깝다.

  • OEM 선탑재 assistant + 사용자 권한으로 target app 자동화
  • 가상 디스플레이에서 앱 실행 후 screenshot 분석, tap/swipe/text 입력
  • target app 코드 변경은 없지만 adaptive UI·lifecycle 품질이 자동화 안정성 좌우
원본 →
AI 코딩 도구

Imagen Android 종료 — Firebase AI Logic 이미지는 Gemini Image(Nano Banana)로 이전

Android Developers 문서는 Imagen 모델이 2026년 6월 24일 종료되며 Gemini Image 모델, 즉 'Nano Banana' 계열로 이전하라고 안내한다. 기존 Android 앱은 Firebase AI Logic SDK로 Imagen을 호출해 아바타나 개인화 시각 자산을 만들 수 있었고, Gemini Developer API 또는 Vertex AI provider를 선택했다. 운영 관점의 핵심은 이미지 생성 기능을 단순 모델 교체로 보지 말고, 종료일 전에 모델명, safety/person filter, watermark, output format, prompt 평가 흐름을 함께 점검하는 것이다.

  • Imagen 모델 shutdown: 2026-06-24
  • 대체 경로: Gemini Image 모델, 문서상 Nano Banana 계열
  • Firebase AI Logic 앱은 safety·watermark·format·prompt 평가까지 이전 체크
원본 →
AI 코딩 도구

Kakao Mobility Gemini Nano — 온디바이스 주소 추출로 주문 완료 시간 24% 단축

Kakao Mobility는 ML Kit GenAI Prompt API와 Gemini Nano를 사용해 배달 주문 메시지에서 이름·주소·전화번호를 추출하는 기능을 온디바이스로 구현했다. 전통 ML처럼 대규모 학습 데이터와 전문 모델링을 준비하는 대신, 약 200개의 고품질 평가 예시와 few-shot prompting으로 hallucination을 줄이는 방향으로 튜닝했다. 결과적으로 배달 주문 완료 시간이 24% 줄고, 신규 사용자 전환율은 45%, 기존 사용자 전환율은 6% 증가했다. 피크 시즌에는 AI 기반 주문이 200% 이상 늘었다. 실무 포인트는 온디바이스 AI도 평가셋과 fallback을 갖춰야 production 품질에 가까워진다는 점이다.

  • ML Kit Prompt API + Gemini Nano로 자연어 주문 메시지 entity extraction
  • 평가 예시 약 200개 + few-shot prompting으로 hallucination 최소화
  • 주문 완료 시간 24% 감소, 신규 전환율 45% 증가, 피크 AI 주문 200%+ 증가
원본 →
AI 코딩 도구

Firebase AI Logic Hybrid API — Android AI 추론을 온디바이스·클라우드로 라우팅

Firebase AI Logic Hybrid API는 Android 앱에서 Gemini API 호출을 온디바이스와 클라우드 사이에 나누는 단일 인터페이스다. onDeviceConfig의 inference mode로 PREFER_ON_DEVICE, PREFER_IN_CLOUD, ONLY_ON_DEVICE, ONLY_IN_CLOUD를 고를 수 있고, Gemini Nano 같은 온디바이스 모델이 없거나 요청을 지원하지 않을 때 클라우드 fallback을 설계할 수 있다. 공식 문서는 이 기능을 experimental로 표시하므로 SLA나 호환성 보장을 전제하면 안 된다. 실무 포인트는 '항상 로컬'이 아니라 개인정보·오프라인·비용이 중요한 요청은 로컬 우선, 고성능·범용성이 필요한 요청은 클라우드 우선으로 정책을 명시하는 것이다.

  • onDeviceConfig로 PREFER/ONLY 온디바이스·클라우드 모드 선택
  • 온디바이스 모델 미지원 시 클라우드 fallback으로 도달 범위 확대
  • Experimental 기능: SLA·호환성 변경 가능성을 운영 리스크로 반영
원본 →
AI 코딩 도구

ML Kit Prefix Caching — 반복 프롬프트를 캐시해 Gemini Nano 지연 줄이기

ML Kit Prompt API의 Prefix Caching은 반복되는 프롬프트 앞부분을 static prefix로 분리하고, 매번 바뀌는 내용만 dynamic suffix로 보내 온디바이스 LLM의 중간 상태를 재사용한다. 문서 기준 Pixel 9 예시에서 300토큰 prefix+50토큰 suffix는 0.82초에서 cache hit 0.45초, 1000토큰 prefix+100토큰 suffix는 2.11초에서 0.5초로 줄었다. 단, 현재 experimental이고 일부 기기에서만 가능하며 text-only 입력만 지원한다. 앱 설계 관점에서는 긴 시스템 지침, 고정 분류 기준, 반복 템플릿을 prefix로 빼고 이미지 입력이나 민감 prefix 저장 정책은 별도로 검토해야 한다.

  • 반복 promptPrefix + 매번 바뀌는 dynamicSuffix로 중간 LLM 상태 재사용
  • Pixel 9 예시: 2.11초 → cache hit 0.5초(1000+100토큰)
  • Experimental·일부 기기·text-only 제한, 캐시 저장 정책 검토 필요
원본 →
AI 코딩 도구

GitHub third-party agent security validation — Codex·Claude PR도 CodeQL·의존성·secret 검사

GitHub는 2026년 6월 9일 third-party coding agents 보안 검증을 일반 제공한다고 발표했다. Claude나 OpenAI Codex처럼 저장소에서 직접 기능 구현, 버그 수정, 테스트 보강을 수행하는 에이전트가 만든 코드도 Copilot cloud agent와 같은 자동 보안 검증을 받는다. 검증은 CodeQL 취약점 분석, GitHub Advisory Database 기반 신규 의존성 확인, secret scanning으로 API 키·토큰 노출 탐지를 포함한다. 설정은 기존 Copilot validation 설정을 따르고 Advanced Security 라이선스가 필요 없다고 설명된다. 실무 포인트는 에이전트 산출물을 신뢰하는 대신, PR 완료 전 자동 검증을 기본 안전망으로 두는 것이다.

  • third-party coding agents 코드도 Copilot cloud agent와 같은 보안 검증 적용
  • CodeQL, GitHub Advisory Database, secret scanning으로 신규 위험 확인
  • Copilot 설정을 따르며 Advanced Security 라이선스 없이 사용 가능
원본 →
AI 코딩 도구

Google Agents CLI — 코딩 에이전트에게 Agent Platform 빌드·평가·배포 명령을 주입

Google은 2026년 4월 Agents CLI in Agent Platform을 공개했다. 이 CLI는 Gemini CLI, Claude Code, Cursor 같은 코딩 에이전트가 Google Cloud Agent Platform, Cloud Run, A2A Integration에 접근할 수 있는 machine-readable 경로를 제공한다. `uvx google-agents-cli setup`으로 bundled skills와 API reference를 주입하고, `agents-cli create`, `eval run`, `eval compare`, `infra`, `deploy`, `publish` 같은 명령으로 에이전트 생성부터 평가와 배포까지 이어간다. 실무 포인트는 에이전트에게 문서를 통째로 읽히는 대신, 검증 가능한 CLI 명령과 평가 하네스를 주어 local-to-cloud 전환을 반복 가능하게 만드는 것이다.

  • `uvx google-agents-cli setup`으로 코딩 에이전트용 skills·API reference 주입
  • `eval run`·`eval compare`로 배포 전 trajectory와 품질 비교
  • `infra`·`deploy`·`publish`로 Agent Runtime/Cloud Run/Gemini Enterprise까지 연결
원본 →
AI 코딩 도구

Copilot SDK GA — 에이전트 루프를 제품 안에 심는 여섯 언어 SDK·v1.0.2 memory·defer

GitHub Copilot SDK는 2026-06-02 GA·v1.0.2(2026-06-18). Node.js/TypeScript, Python, Go, .NET, Rust, Java 여섯 언어 — 제품 안에 Copilot agent runtime(planning·tool·file edit·streaming·multi-turn)을 직접 embed. v1.0.2 — session create/resume에 memory:{enabled:true} opt-in persistent memory across turns; tool definition defer:"auto"|"never"로 lazy tool search vs eager preload. GA 이후 — Rust/Java SDK 추가·multi-client same session tool/permission contribute·slash command+interactive prompt 전 언어·stable semver API. custom tools·MCP·prompt section·OpenTelemetry·GitHub OAuth/Apps/BYOK·cloud remote session·hook system. vs Copilot app(Canvas orchestration) ·Copilot CLI(TUI) — SDK=embed runtime in your product.

  • memory opt-in — cross-turn recall without re-prompting full context
  • defer auto/never — token budget vs tool discovery latency tradeoff
  • GA 6 languages — Rust/Java new, multi-client session sharing
원본 →
AI 코딩 도구

GitHub MCP Secret Scanning GA — 커밋 전 에이전트에게 노출 키를 찾게 하기

GitHub는 2026년 5월 5일 MCP Server의 secret scanning 기능을 GA로 전환했다. MCP 호환 IDE나 GitHub Copilot CLI 같은 AI coding agent 환경에서 현재 변경분을 검사해 API 키와 토큰 같은 secret이 커밋이나 PR 전에 들어가지 않게 막는 방식이다. GA 버전은 기존 repository나 organization의 push protection customization을 존중해 탐지와 bypass 동작을 일관되게 맞춘다. 실무 포인트는 보안 검사를 CI 마지막 단계로 미루지 말고, 에이전트가 파일을 고치는 같은 루프 안에서 "현재 diff를 secret scanning 해 달라"고 호출하는 것이다.

  • GitHub MCP Server에서 secret scanning이 GA
  • MCP 호환 IDE·Copilot CLI 에이전트가 커밋 전 현재 변경분 검사
  • 기존 push protection customization을 반영해 탐지·bypass 정책 일관화
원본 →
AI 코딩 도구

Codex Plugins·Sites·Annotations — 코딩 에이전트에서 역할별 업무 에이전트로 확장

OpenAI는 2026년 6월 2일 Codex에 역할별 plugins, Sites, annotations를 추가한다고 발표했다. 역할별 plugin은 앱·스킬·지시문·워크플로우를 묶어 분석가, 디자이너, 영업, 투자, 뱅킹 같은 업무에 맞춘 에이전트 표면을 제공한다. 공개된 6개 plugin 묶음은 62개 앱과 110개 스킬을 포함한다고 설명됐다. Sites는 Codex 결과를 URL로 공유 가능한 interactive website/app 형태로 만들고, annotations는 결과물을 제자리에서 고치게 하는 피드백 표면이다. 실무 포인트는 AI 코딩 도구의 다음 경쟁축이 모델 성능만이 아니라 역할별 컨텍스트 패키징과 결과물 협업 UX라는 점이다.

  • role-specific plugin: apps + skills + instructions + workflows 묶음
  • 초기 6개 plugin에 62개 앱, 110개 스킬 포함
  • Sites는 URL 공유 결과물, annotations는 결과물 위 직접 피드백
원본 →
AI 코딩 도구

Google Colab CLI — 코딩 에이전트에게 GPU 런타임을 빌려주는 터미널 브리지

Google Colab CLI는 로컬 터미널과 원격 Colab 런타임을 잇는 명령줄 도구다. 핵심은 개발자뿐 아니라 터미널 접근이 있는 AI 에이전트가 `colab --gpu T4`, `colab exec`, `colab download`, `colab log` 같은 명령으로 GPU/TPU 런타임을 요청하고, 로컬 파이썬 스크립트를 원격에서 실행하고, 모델·로그·노트북 산출물을 다시 가져올 수 있다는 점이다. Google은 Colab CLI에 에이전트용 skill file도 함께 제공해 Claude Code, Codex, Gemini류 터미널 에이전트가 사용법을 매번 추측하지 않게 한다. 실무 포인트는 파인튜닝·평가처럼 로컬 노트북에는 무겁고 클라우드 IaC에는 과한 작업을 에이전트 루프 안에서 짧게 원격 실행할 수 있다는 것이다.

  • 로컬 터미널 -> Colab GPU/TPU 런타임을 CLI로 연결
  • `colab exec`로 로컬 ML 스크립트를 원격 실행, `colab download/log`로 산출물 회수
  • 에이전트용 skill file 제공: 터미널 AI가 Colab 사용법을 컨텍스트로 받음
원본 →
AI 코딩 도구

Copilot 1M 컨텍스트·추론 레벨 — 큰 창은 기본값이 아니라 고비용 모드

GitHub Copilot은 2026년 6월 4일 더 큰 컨텍스트 창과 configurable reasoning levels를 공개했다. 100만 토큰 컨텍스트는 큰 코드베이스, 긴 문서, 복잡한 다중 파일 작업을 한 세션에 담기 위한 장치이고, 추론 레벨은 속도와 깊이를 작업 난이도에 맞춰 조절하는 손잡이다. 중요한 반대편은 비용이다. GitHub는 큰 컨텍스트 창이나 높은 추론 레벨을 선택하면 상호작용당 AI credits가 더 많이 든다고 설명하며, 일상 작업에는 기본 컨텍스트와 기본 추론을 권한다. 실무 포인트는 "항상 최대"가 아니라, 아키텍처 변경, 장기 디버깅, 다중 파일 리팩터링처럼 정보 손실 비용이 큰 작업에만 큰 창과 깊은 추론을 켜는 운영 규칙을 정하는 것이다.

  • 1M 컨텍스트: 큰 코드베이스·긴 문서·복잡한 다중 파일 작업용
  • reasoning level: 속도와 깊이를 작업 난이도에 맞춰 조절
  • 큰 컨텍스트·높은 추론은 AI credits를 더 쓰므로 기본값으로 쓰지 않기
원본 →
AI 코딩 도구

Copilot Sandboxes — 에이전트 명령 실행을 로컬·클라우드 격리층에 넣기

GitHub Copilot의 cloud/local sandboxes public preview는 에이전트가 실행하는 셸 명령을 격리된 환경에 넣는 기능이다. 로컬 sandbox는 Copilot CLI 세션 안에서 `/sandbox enable`로 켜고, 파일시스템·네트워크· 시스템 기능 접근을 제한한다. cloud sandbox는 `copilot --cloud`로 GitHub가 호스팅하는 일회성 Linux 환경에서 세션을 시작해 로컬 머신과 다른 세션에서 분리한다. GitHub 문서는 로컬 sandbox 정책을 Intune 같은 MDM으로 중앙 관리할 수 있고, cloud sandbox는 Azure Container Apps Sandboxes 위에 identity, policy, billing layer를 얹는다고 설명한다. 실무 포인트는 에이전트에게 명령 실행 권한을 줄 때 "믿기" 대신 쓰기 경로, 네트워크, 클라우드 실행 위치를 정책으로 좁히는 것이다.

  • 로컬: `/sandbox enable`로 Copilot CLI 명령 실행을 제한
  • 클라우드: `copilot --cloud`로 GitHub 호스팅 일회성 Linux sandbox 사용
  • 파일시스템·네트워크·MDM 정책으로 에이전트 실행 범위를 명시
원본 →
AI 코딩 도구

Copilot AI credits API — 에이전트 비용을 사람·팀 단위로 관측하기

GitHub는 2026년 6월 19일 Copilot usage metrics API의 user-level 리포트에 `ai_credits_used` 필드를 추가했다. 하루 또는 28일 단위로 각 사용자의 전체 Copilot 활동이 소비한 AI credits를 볼 수 있지만, GitHub가 설명한 성격은 청구서 원장이 아니라 adoption·budget planning을 위한 운영 지표다. 그래서 이 카드는 기존의 "사람 단위 관측"과 "팀 단위 예산 관리" 카드를 합친다. 중요한 질문은 누가 많이 썼느냐가 아니라, 어떤 팀의 어떤 에이전트 자동화·코드 리뷰·CLI 사용이 비용을 만들고 실제 가치로 이어졌는지다.

  • `ai_credits_used`: 사용자별 1일·28일 Copilot AI credits 소비량
  • enterprise admin·organization owner가 REST API로 조회
  • 청구서가 아니라 채택률·예산 예측·워크플로 가치 판단을 위한 metrics signal
원본 →
AI 코딩 도구

MAI-Code-1-Flash — Copilot 표면마다 작은 모델을 라우팅하기

GitHub는 Microsoft의 소형 코딩 모델 MAI-Code-1-Flash를 Copilot CLI, Copilot app, GitHub Chat, Visual Studio, GitHub Mobile, JetBrains, Eclipse, Xcode 등 여러 표면으로 확장한다고 공지했다. 기존 두 카드는 같은 공지를 "표면 전반 배치"와 "표면별 라우팅"으로 나눴지만, 실무 결론은 하나다. 짧은 설명, 반복 수정, 가벼운 CLI 질의처럼 대기시간과 비용이 중요한 작업은 경량 코딩 모델에 맡기고, 설계 변경이나 복잡한 디버깅은 강한 reasoning 모델로 올리는 정책을 제품/팀 단위로 정해야 한다.

  • Microsoft 제공 Copilot용 small-tier coding model
  • CLI·앱·모바일·IDE 등 여러 Copilot 표면으로 확장
  • 가벼운 반복 작업은 경량 모델, 복잡한 판단은 강한 모델로 라우팅
원본 →
AI 코딩 도구

Copilot 모델 폐기 일정 — 자동화 프롬프트의 모델명을 운영 자산으로 관리하기

GitHub는 2026년 6월 18일 Opus 4.6 (fast)를 2026년 6월 29일 Copilot 전 표면에서 폐기하고 Opus 4.8 (fast)를 대안으로 쓰라고 공지했다. 앞서 2026년 6월 2일에는 GPT-4.1도 Copilot Chat, inline edits, ask, agent mode, code completions에서 폐기하고 GPT-5.5를 대안으로 제시했다. 이 변경은 단순 릴리스 노트가 아니라 에이전트 운영 리스크다. 스크립트, 사내 문서, AGENTS.md, CI 프롬프트, 팀별 워크플로에 모델명을 하드코딩하면 어느 날 같은 자동화가 실패하거나 다른 품질·비용 특성으로 바뀔 수 있다. 모델명은 설정으로 빼고, 폐기일 전 검증 루틴을 두는 것이 안전하다.

  • Opus 4.6 (fast): 2026-06-29 폐기 예정, 대안은 Opus 4.8 (fast)
  • GPT-4.1: 2026-06-01 Copilot 전 표면에서 폐기, 대안은 GPT-5.5
  • 모델명 하드코딩 대신 설정화·폐기일 전 검증 루틴 필요
원본 →
AI 코딩 도구

ML Kit APO — 온디바이스 Gemini Nano 프롬프트를 서버에서 자동 탐색하기

Android Developers Blog는 ML Kit GenAI Prompt API용 Automated Prompt Optimization(APO)을 소개했다. Android AICore는 공유 시스템 모델을 우선하므로 앱마다 LoRA adapter를 배포하는 방식은 운영 부담이 생길 수 있다. APO는 Vertex AI에서 서버 측 모델을 사용해 오류 패턴을 분석하고, 의미 지시문을 추출하고, 여러 후보 프롬프트를 병렬 테스트해 Gemini Nano v3용 시스템 지시문을 찾는다. 중요한 점은 최종 실행은 Android의 ML Kit GenAI API와 Gemini Nano 쪽에 남기면서, 품질 개선 탐색은 서버에서 자동화한다는 것이다. 온디바이스 AI 앱은 "프롬프트도 빌드 산출물"처럼 평가 데이터와 함께 관리해야 한다.

  • APO: Vertex AI에서 Gemini Nano v3용 프롬프트 후보를 자동 탐색
  • 오류 분석·semantic instruction distillation·병렬 후보 테스트
  • 온디바이스 실행을 유지하면서 프롬프트 품질 개선 루프를 운영
원본 →
AI 코딩 도구

ADK 장기 실행 에이전트 — 대화 기록 대신 상태 머신으로 재개하기

Google의 ADK 장기 실행 에이전트 튜토리얼은 며칠 동안 멈췄다 재개되는 업무를 대화 기록에 맡기지 말라고 설명한다. 핵심은 START, WELCOME_SENT, DOCUMENTS_SIGNED 같은 명시적 state machine을 만들고, 시스템 지시문이 현재 단계를 session state에서 읽게 하는 것이다. 각 tool call은 ToolContext.state를 갱신해 자동 checkpoint가 되고, 세션 저장소를 DatabaseSessionService(SQLite 또는 Cloud SQL)로 바꾸면 컨테이너 재시작 뒤에도 같은 단계에서 이어갈 수 있다. AI 에이전트 설계 포인트는 "모델이 기억한다"가 아니라 "워크플로 상태를 코드와 저장소가 소유한다"는 점이다.

  • 대화 기록이 아니라 명시적 state machine이 진행 상태를 소유
  • ToolContext.state 갱신이 tool call마다 자동 checkpoint 역할
  • DatabaseSessionService로 SQLite/Cloud SQL에 세션을 영속화
원본 →
AI 코딩 도구

MCP EMA stable — Enterprise-Managed Auth·IdP zero-touch SSO

MCP Enterprise-Managed Authorization extension(io.modelcontextprotocol/enterprise-managed-authorization)이 2026-06-18 stable. 조직 IdP(Okta launch·Cross App Access ID-JAG)가 MCP 서버 접근을 중앙 provision — 사용자는 per-server OAuth consent 없이 첫 로그인부터 승인된 커넥터 상속. Client — Claude·Claude Code·Cowork(Anthropic shared MCP layer), VS Code(Copilot·third-party MCP). Server launch — Asana·Atlassian·Canva·Figma·Granola·Linear·Supabase·Slack 추가 중. regulated enterprise에서 MCP를 SaaS 권한 평면과 동일 audit·revoke로 다루는 신호.

  • Stable 2026-06-18 — ID-JAG via Okta XAA, zero-touch first login
  • Client — Claude family·VS Code; Server — Linear·Supabase·Figma 등
  • IdP group scope·deprovision revoke — per-user OAuth 대체
원본 →
AI 코딩 도구

Claude WIF GA — 에이전트 자동화에서 정적 API 키 없애기

Claude Platform의 Workload Identity Federation(WIF)은 2026년 6월 17일 GA가 됐다. WIF는 정적 API 키 대신 요청 시점에 짧게 살아 있는 scoped credential을 발급하고, AWS IAM role, GCP/Kubernetes service account, Azure managed identity, GitHub Actions token, Okta 같은 OIDC 호환 identity provider와 연결된다. 적용 범위는 Claude API endpoints, first-party SDK, Claude Code 접근까지 포함된다. 에이전트 자동화에서는 API 키를 저장소·CI 변수·로컬 설정에 오래 보관하지 않고, workload별 service account와 audit log로 호출 주체를 분리할 수 있다는 점이 핵심이다.

  • 정적 API key 대신 짧게 살아 있는 scoped credential을 요청 시 발급
  • AWS/GCP/Kubernetes/Azure/GitHub Actions/Okta 등 OIDC identity와 연동
  • workload별 service account·role·audit trail로 에이전트 호출 주체 분리
원본 →
AI 코딩 도구

A2UI + MCP Apps — 에이전트 UI를 iframe과 네이티브 렌더링 사이에서 설계하기

Google Developers Blog의 A2UI + MCP Apps 글은 에이전트 UI가 단순 텍스트를 넘어가면 두 선택지 사이에서 흔들린다고 설명한다. MCP Apps는 iframe 안에서 HTML/CSS/JavaScript로 자유롭게 만들 수 있지만, 호스트와 디자인·스크롤·보안 경계가 어긋날 수 있다. A2UI는 JSON payload로 무엇을 렌더링할지 선언하고 호스트가 네이티브 컴포넌트로 그려 일관성과 보안을 얻지만, 복잡한 클라이언트 로직에는 약하다. 실무 포인트는 "에이전트가 UI를 만든다"가 아니라, 표·폼·차트 같은 구조 데이터는 A2UI, 복잡한 상호작용은 MCP Apps, 혼합 화면은 두 방식을 조합하는 아키텍처 문제로 보는 것이다.

  • MCP Apps: iframe 기반 자유도는 높지만 디자인·성능·보안 경계 비용이 있음
  • A2UI: JSON 선언을 호스트 네이티브 UI로 렌더링해 일관성과 접근성을 얻음
  • 구조 데이터·복잡한 앱·혼합 화면을 패턴별로 나눠 선택
원본 →
AI 코딩 도구

Jetpack Compose Adaptive Skill — Android 17 대화면 대응을 AI 워크플로로 고정하기

Android 17은 대화면 resizability를 더 강하게 요구하면서, Jetpack Compose adaptive skill을 함께 공개했다. 이 스킬은 일반 Android 레이아웃 팁이 아니라 AI-powered developer workflow다. NavigationSuiteScaffold로 모바일 bottom navigation과 대화면 navigation rail을 전환하고, Navigation 3 Scenes로 list-detail·supporting pane을 구성하며, Compose 1.11의 동적 레이아웃·trackpad/mouse 지원·window state 대응까지 점검하게 한다. AI+Android 관점의 핵심은 에이전트에게 "화면을 예쁘게 바꿔줘"가 아니라, Android 17 적응형 기준을 체크리스트 겸 실행 절차로 주는 것이다.

  • Android 17의 adaptive-first 요구를 AI-powered developer workflow로 다룸
  • NavigationSuiteScaffold·Navigation 3 Scenes·Compose 1.11 동적 레이아웃을 점검
  • 에이전트 프롬프트를 대화면 기준과 테스트 가능한 작업 목록으로 접지
원본 →
AI 코딩 도구

R8 Agent Skill — 난해한 keep rule 정리를 AI에게 맡기되 검증은 사람이 닫기

Android 17 메모리 효율 가이드는 R8 Configuration Analyzer와 함께 R8 Agent Skill을 언급한다. Analyzer는 obfuscation, optimization, shrinking 점수와 broad keep rule, redundant rule, unused rule을 보여주고, R8 Agent Skill은 Android Studio agent나 다른 AI 도구로 misconfiguration을 해결하고 규칙을 다듬는 흐름에 붙는다. 중요한 단서도 같이 있다. AI-driven skill의 insight는 기술 검증이 필요하다. 즉 R8 규칙은 앱 동작과 라이브러리 공개 API를 깨뜨릴 수 있으므로, 에이전트가 후보 패치를 만들고 Configuration Analyzer·릴리즈 빌드· 회귀 테스트가 최종 판정을 내려야 한다.

  • Configuration Analyzer로 broad/redundant/unused keep rule을 먼저 드러냄
  • R8 Agent Skill은 misconfiguration 해결과 rule refinement 후보를 생성
  • AI 제안은 릴리즈 빌드·회귀 테스트·분석 점수로 반드시 기술 검증
원본 →
AI 코딩 도구

Media3 AI Effects — 효과 이름이 아니라 디바이스별 실행 경로를 추상화하기

Google I/O 26 Android premium experiences 글은 Media3 AI Effects library를 예고했다. 목표는 Image & Video Enhance, Magic Eraser, Studio Sound 같은 프리미엄 AI 효과를 앱마다 따로 연결하는 것이 아니라, Media3가 unified interface를 제공하고 디바이스에 맞는 효율적이고 신뢰 가능한 경로 선택을 맡는 것이다. Android 개발자에게 중요한 점은 AI 미디어 기능을 모델 호출 한 번으로 보지 않는 것이다. CameraX 캡처, Media3 AI Effects 처리, Media3 Transformer 합성, CodecDB 기반 인코딩 권장까지 하나의 미디어 파이프라인으로 설계해야 폴더블·태블릿·칩셋 차이에서도 일관된 품질을 낼 수 있다.

  • Media3 AI Effects는 Image/Video Enhance·Magic Eraser·Studio Sound용 unified interface를 지향
  • 효과 실행 경로 선택을 디바이스별 효율·신뢰성 문제로 추상화
  • CameraX→AI Effects→Transformer→CodecDB를 한 파이프라인으로 설계
원본 →
AI 코딩 도구

모바일 에이전트 테스트 — agent-device vs Mobilerun, 접근성 트리로 앱의 눈과 손 주기

모바일 AI 에이전트 테스트는 "스크린샷을 비전 모델에 던지기"가 아니라 접근성 트리+semantic ref로 UI를 구조화해 토큰을 아끼고 재현 가능한 증거를 남기는 문제다. Callstack agent-device(MIT·~2.9k★)는 `@e2` 같은 ref로 click/fill/scroll/get/replay를 `.ad` 스크립트로 deterministic replay한다. Mobilerun(MIT·~8.6k★)은 Android/iOS를 CLI·Python API로 제어하고 OpenAI·Anthropic·Gemini·Ollama 등 멀티 모델·manager-executor reasoning·Phoenix/Langfuse trace·app cards를 지원한다. 선택 기준: CI용 경량 replay·스크립트 증거 → agent-device, 멀티모델 탐색·관측성·긴 워크플로 → Mobilerun.

  • agent-device — semantic ref(@e2)·.ad replay·ADB 백엔드, 토큰 적은 deterministic 검증
  • Mobilerun — 멀티 LLM·manager-executor·Phoenix/Langfuse trace·app cards·custom tools
  • {"선택"=>"CI replay 증거(agent-device) vs 멀티모델 탐색+관측(Mobilerun)"}
원본 →
AI 코딩 도구

Copilot Auto Mode — 모델 선택을 프롬프트가 아니라 라우터에 맡기기

GitHub Copilot Chat의 auto model selection은 2026년 6월 17일 github.com과 GitHub mobile app에서 모든 Copilot plan에 GA로 열렸다. 사용자가 매번 Claude Sonnet, GPT-5.4 계열, Haiku 같은 모델명을 고르는 대신, Copilot이 요청 복잡도와 실시간 가용성을 보고 모델을 라우팅한다. 응답에 어떤 모델이 쓰였는지 확인할 수 있고, 사용자·관리자 model policy를 존중하며, paid subscriber에게는 auto 사용 토큰이 10% 할인된다. 개발팀 관점의 핵심은 모델명을 자동화 스크립트의 상수처럼 박지 말고, 단순 질의는 auto, 재현 가능한 평가나 규제 워크플로는 고정 모델처럼 운영 모드를 분리하는 것이다.

  • 요청 복잡도와 실시간 가용성에 따라 모델을 동적으로 라우팅
  • 사용된 모델은 확인 가능하고 관리자 model policy를 존중
  • 일반 채팅은 auto, 평가·회귀 자동화는 고정 모델로 분리
원본 →
AI 코딩 도구

Codex 안전 운영 — 키 파일보다 OS keyring과 워크스페이스 고정

OpenAI의 Codex 안전 운영 글은 코딩 에이전트를 빠르게 쓰는 방법보다, 조직 안에서 누가 어떤 권한으로 실행하는지 고정하는 방법을 강조한다. 예시는 CLI auth와 MCP OAuth credentials를 OS keyring에 저장하고, 로그인 방식을 ChatGPT로 강제하며, 특정 ChatGPT enterprise workspace에 접근을 묶는다. 그러면 Codex 활동이 workspace-level control과 compliance log에 연결된다. 실무 포인트는 Codex를 개인 토큰이 든 로컬 도구로 방치하지 않고, MCP 권한·CLI 로그인·감사 로그를 같은 보안 경계로 묶어 에이전트 실행 주체를 추적 가능하게 만드는 것이다.

  • `cli_auth_credentials_store`와 `mcp_oauth_credentials_store`를 keyring으로 설정
  • `forced_login_method`와 workspace ID로 조직 계정 경계를 고정
  • MCP 권한과 Codex 실행 로그를 compliance 관측 대상으로 올림
원본 →
AI 코딩 도구

Agents SDK Sandbox — Manifest workspace·dual memory·8 provider sandbox

OpenAI Agents SDK v0.14(2026-04) Sandbox Agents는 SandboxAgent+Manifest+SandboxRunConfig로 persistent isolated workspace에서 shell·filesystem·skills·compaction을 capability로 bind한다. Blaxel·Cloudflare·Daytona·E2B·Modal·Runloop·Vercel 8 hosted provider + Docker/UnixLocal BYO. Session memory(대화 히스토리)와 Sandbox memory(완료 run에서 distill한 lessons→memories/MEMORY.md)를 분리 — progressive disclosure로 memory_summary.md만 inject하고 Shell+Filesystem로 deep search·live stale update. RunState·SandboxSessionState·snapshot으로 resume, S3/R2/GCS mount. E2B·Runloop 개별 provider 카드와 달리 SDK-native manifest·capability·dual-memory harness layer.

  • SandboxAgent+Manifest — workspace root·mount·capability(Shell/FS/Memory/Skills) 선언
  • Dual memory — Session(메시지) vs Sandbox memory(rollout lessons, MemoryLayoutConfig isolation)
  • 8 provider extras — Blaxel/Cloudflare/Daytona/E2B/Modal/Runloop/Vercel + snapshot resume
원본 →
AI 코딩 도구

ChatGPT Enterprise 사용량 분석 — Codex 비용도 운영 지표로 보기

OpenAI는 2026년 6월 18일 ChatGPT Enterprise에 credit usage analytics와 업데이트된 spend controls를 공개했다. Global Admin Console은 ChatGPT와 Codex credit usage를 한 화면에 묶고, 사용자·제품·모델별 credit spend와 usage trend를 보여준다. 같은 데이터를 unified Cost API로 가져가 내부 분석 시스템에 연결할 수도 있다. 관리자는 workspace 기본 한도, 그룹별 한도, 개인별 override를 설정하고, 사용자는 남은 credit과 요청 사유를 함께 볼 수 있다. 에이전트 운영에서 중요한 점은 비용을 사후 청구서가 아니라 adoption, 모델 선택, 자동화 범위 조정에 쓰는 관측 신호로 다루는 것이다.

  • Global Admin Console에서 ChatGPT·Codex credit usage를 사용자·제품·모델별로 분해
  • unified Cost API로 사내 비용 분석과 연결 가능
  • workspace/group/user 한도를 나눠 에이전트 사용량을 업무 중요도에 맞게 제어
원본 →
AI 코딩 도구

Google Pay & Wallet MCP — 도메인 API 통합을 에이전트 도구로 감싸기

Google Pay & Wallet Developer MCP server는 결제·패스 통합에 필요한 문서, 계정 상태, 검증, 운영 지표를 AI 개발 도구가 직접 조회하게 하는 공식 MCP 사례다. search_documentation 도구는 Google Pay & Wallet 공식 문서에서 RAG로 답과 코드 샘플을 가져오고, 다른 도구는 merchant identifier, pass class 목록, Wallet pass JWT/JSON 검증, 성능 지표와 오류 추세, Google Pay API integration 생성까지 IDE 안에서 다루게 한다. 개발자 카드로 볼 포인트는 "MCP 서버를 하나 더 붙인다"가 아니라, 일반 API 문서 검색과 계정별 실제 상태 확인과 검증기를 한 도메인 서버로 묶어 LLM 답변을 최신 문서와 운영 데이터에 접지하는 것이다.

  • 문서 RAG, 계정·통합 상태 조회, Wallet pass JWT/JSON 검증을 한 MCP 서버로 제공
  • 성능 지표·오류 추세까지 IDE의 AI assistant가 확인 가능
  • 도메인 API 통합에서 MCP는 문서 검색보다 account-aware 검증 계층에 가까움
원본 →
AI 코딩 도구

AI Edge Gallery MCP — 온디바이스 모델에 작은 도구 설명만 주기

Google AI Edge Gallery는 Android 앱에서 MCP over Streamable HTTP를 실험 기능으로 지원한다. 사용자가 MCP URL을 등록하면 앱이 tool definition과 resource schema를 온디바이스 모델의 system prompt에 가져오고, Gemma 4가 어떤 도구가 필요한지 로컬에서 판단한 뒤 MCP 서버를 호출한다. Google은 on-device model의 context window가 서버 모델보다 작으므로 MCP tool description은 짧게, 반환 데이터는 긴 본문보다 작은 snippet으로 유지하라고 권한다. AI+Android 설계 포인트는 프라이버시 좋은 로컬 추론과 외부 도구 호출을 같이 쓰려면, 모델 크기보다 tool schema와 응답 payload를 모바일 컨텍스트 예산에 맞춰 설계해야 한다는 점이다.

  • Android AI Edge Gallery가 MCP over Streamable HTTP를 실험 지원
  • 도구 선택 reasoning은 폰 안의 Gemma 4가 하고, 실행은 MCP 서버가 담당
  • 모바일 온디바이스 모델에는 짧은 tool description과 작은 응답 snippet이 중요
원본 →
AI 코딩 도구

Copilot App GA — IDE 밖에서도 같은 에이전트 루프 유지하기

GitHub Copilot app은 2026년 6월 18일 iOS와 Android에서 GA가 되었고, 채팅과 코드 질문, 저장소·이슈·PR 컨텍스트 조회, voice input, image upload, local file attachment를 지원한다. 같은 글은 Copilot Spaces와 GitHub MCP server 연결도 언급해, 모바일 표면이 단순 Q&A 앱이 아니라 개발 컨텍스트를 들고 다니는 에이전트 입구가 됐음을 보여준다. 실무 포인트는 "폰으로 코딩한다"가 아니라, 이동 중 분류·리뷰·질문 같은 낮은 위험 작업은 모바일에서 이어가고, 실제 파일 변경과 검증은 IDE·CI 같은 재현 가능한 환경으로 넘기는 작업 경계를 정하는 것이다.

  • iOS·Android GA, 채팅·voice input·image upload·file attachment 지원
  • 저장소·이슈·PR 컨텍스트와 Copilot Spaces/MCP 연결을 모바일에서 사용
  • 모바일은 triage·리뷰·질문, 변경·검증은 재현 가능한 개발 환경으로 분리
원본 →
AI 코딩 도구

Copilot Automations — 클라우드 에이전트에게 반복 유지보수를 맡기는 법

GitHub은 2026년 6월 20일 Copilot coding agent의 automations public preview를 공개했다. 사용자는 자연어로 예약 작업을 만들 수 있고, Copilot은 GitHub Actions처럼 repository secrets와 hosted runner를 이용해 정해진 주기마다 에이전트 작업을 실행한다. 예시는 매주 TODO comments 정리, dependency update, failing tests 조사처럼 반복 유지보수에 가깝다. 교육적 포인트는 에이전트 자동화가 cron을 대체한다는 뜻이 아니라, 반복 작업을 "명령 실행"이 아닌 issue/PR 산출물과 review gate가 있는 maintenance loop로 설계해야 한다는 점이다.

  • 자연어로 예약된 Copilot coding agent 작업을 만들 수 있는 public preview
  • repository secrets와 hosted runner를 사용해 GitHub Actions와 비슷한 실행 경계 제공
  • 반복 유지보수는 issue/PR 산출물과 review gate가 있는 루프로 설계
원본 →
AI 코딩 도구

VS Code Agents Window — 채팅 패널이 아니라 에이전트 작업대

Visual Studio Code의 2026년 5월 Copilot 릴리스는 Agents Window, plan mode, remote cloud agent sessions, custom instructions, terminal auto-approval controls를 함께 묶어 보여준다. 의미 있는 변화는 AI가 사이드바에서 답만 하는 형태를 넘어, 계획을 세우고 원격 세션에서 작업하며 터미널 명령 승인 정책을 따르는 개발 작업대로 들어온다는 점이다. 실무에서는 "에이전트가 알아서 해준다"가 아니라, plan mode로 변경 의도를 먼저 고정하고 custom instructions와 terminal approval rule로 위험한 실행 경계를 좁힌 뒤 검증 가능한 단위로 결과를 받는 운영 습관이 필요하다.

  • Agents Window와 plan mode로 에이전트 작업을 별도 표면에서 관리
  • remote cloud agent sessions와 custom instructions로 작업 컨텍스트를 유지
  • terminal auto-approval controls로 명령 실행 경계를 정책화
원본 →
AI 코딩 도구

Copilot Chronicle — 에이전트 세션 기록을 팀 지식으로 바꾸기

GitHub은 Copilot CLI의 `/chronicle`이 Copilot cloud agent, code review, Copilot app, VS Code, JetBrains 세션까지 더 넓게 읽게 됐다고 밝혔다. Chronicle은 개인 에이전트 세션 기록에서 standup summary, personalized tips, custom instructions를 만들어 이전 작업 맥락을 다시 쓰게 한다. 로컬 세션은 GitHub 계정에 동기화되어 저장소 Agents 탭에서 함께 볼 수 있고, 기본은 개인 비공개이며 필요하면 view-only 형태로 공유할 수 있다. 실무 포인트는 "채팅 로그 저장"이 아니라, 에이전트가 만든 결정·실패·검증 흔적을 다음 세션의 지시문과 팀 공유 자료로 승격시키는 운영 루프를 설계하는 것이다.

  • `/chronicle`이 여러 Copilot 표면의 세션 기록을 요약·팁·custom instructions로 변환
  • 로컬 세션도 GitHub 계정과 저장소 Agents 탭에 동기화 가능
  • 기록은 기본 비공개, 필요할 때 view-only 공유로 팀 맥락 제공
원본 →
AI 코딩 도구

Copilot BYOK — CLI·Copilot app enterprise BYOK·LM Studio·Ollama

GitHub Copilot BYOK(2026-06) — enterprise admin이 외부 LLM을 등록하면 Copilot CLI `/model` picker와 Copilot app(2026-06-23 GA)에서 동일 모델 선택. 지원: OpenAI·Azure OpenAI·Microsoft Foundry·Anthropic·LM Studio·Ollama·OpenAI-compatible endpoint. CLI(6/17)와 app(6/23) 양쪽 — 터미널 agent와 데스크톱 Copilot app이 같은 기업 모델 정책 공유. 개인 사용자는 클라이언트 로컬·외부 모델도 구성 가능. LiteLLM(gateway) ·OpenRouter(400+ model)와 달리 Copilot-native — AI credits·usage metrics API와 같은 billing surface.

  • CLI /model picker(6/17) + Copilot app BYOK(6/23) — unified enterprise model policy
  • OpenAI·Azure·Foundry·Anthropic·LM Studio·Ollama·compatible endpoints
  • Model choice = governance not prompt constant — audit via usage metrics API
원본 →
AI 코딩 도구

Copilot Bypass Controls — yolo 모드를 조직 정책으로 끄기

GitHub은 enterprise-managed settings에 첫 governance capability로 `disableBypassPermissionsMode`를 추가했다. 관리자가 enterprise-managed `settings.json`에 이 값을 `disable`로 두면 Copilot CLI와 VS Code가 permission prompt를 자동으로 건너뛰는 auto-approve, 이른바 yolo mode를 막을 수 있다. 설정은 `.github-private` 기반 관리 저장소에서 배포되고, VS Code 1.122 이상은 해당 정책을 따른다. 개발팀 관점의 핵심은 에이전트 속도보다 실행 권한 경계를 먼저 표준화하는 것이다. 자동 명령 승인은 개인 편의 기능이 아니라 보안·감사 정책으로 통제해야 할 운영 리스크다.

  • `disableBypassPermissionsMode: disable`로 Copilot CLI·VS Code의 자동 승인 우회를 차단
  • enterprise-managed settings와 `.github-private` 관리 저장소로 정책 배포
  • 에이전트 명령 실행은 개인 습관이 아니라 조직 governance 설정으로 관리
원본 →
AI 코딩 도구

Codex 자기개선 루프 — 운영 피드백을 eval로 바꿔 다시 고치기

OpenAI와 Thrive Holdings는 Tax AI 사례에서 Codex를 이용한 self-improving agent 패턴을 공개했다. 핵심 구조는 전문가 피드백, production traces, Codex-driven eval iteration 세 가지다. Crete 참여 회계법인 네트워크에서 파일럿 동안 7,000건의 세무 신고를 처리했고, 작성 시간을 약 3분의 1 줄이며 최대 97% 정확도와 약 50% 처리량 증가를 보고했다. 더 중요한 교육 포인트는 숫자보다 루프다. 현업 전문가의 수정이 실패 신호가 되고, 제품 trace가 재현 가능한 eval로 바뀌며, Codex가 그 eval을 넘기도록 제품을 고치는 구조를 만들면 배포 후 실패가 수동 티켓이 아니라 지속 개선 재료가 된다.

  • 구조: practitioner feedback + production traces + Codex-driven eval iteration
  • 파일럿: 7,000건 세무 신고 처리, 최대 97% 정확도와 약 50% 처리량 증가 보고
  • 운영 실패를 trace와 eval로 보존해야 에이전트가 안전하게 자기개선할 수 있음
원본 →
AI 코딩 도구

Ona + Codex — 오래 걸리는 에이전트 작업은 실행 장소가 제품이다

OpenAI는 2026년 6월 11일 Ona 인수 계획을 발표하며, Codex를 단일 노트북·단일 세션에 묶인 도구에서 보안·거버넌스가 있는 지속 실행 환경으로 확장하겠다고 밝혔다. 핵심은 모델 성능만이 아니라 에이전트가 몇 시간 또는 며칠 동안 접근할 도구, 시스템, 컨텍스트, 로그, credential scope를 어디서 통제하느냐다. 개발팀이 배울 점은 "코딩 에이전트를 클라우드에서 돌린다"가 아니라, 장시간 작업을 맡길수록 sandbox, 리뷰 게이트, 활동 로그, 데이터 경계를 먼저 설계해야 한다는 점이다. 에이전트의 생산성은 프롬프트보다 신뢰할 수 있는 작업공간에서 결정된다.

  • Ona는 Codex에 secure, persistent execution 환경을 붙이는 방향
  • 장시간 에이전트 작업은 도구 접근·로그·credential scope가 핵심 설계 대상
  • 모델 선택보다 먼저 실행 장소와 governance 경계를 정해야 함
원본 →
AI 코딩 도구

AgentKit 종료 공지 — 시각 빌더보다 코드로 남는 에이전트가 오래간다

OpenAI는 AgentKit 글에 2026년 6월 3일 업데이트를 붙여 Agent Builder와 Evals 제품을 단계적으로 종료한다고 공지했다. 2026년 11월 30일 이후 OpenAI 플랫폼에서 사용할 수 없으며, 코드로 유지해야 하는 워크플로는 Agents SDK를 권장한다. 이 카드는 특정 제품 종료 소식보다 운영 교훈이 중요하다. 에이전트 워크플로가 실험 단계를 지나 반복 운영 자산이 되면, 화면에서 만든 플로우보다 버전 관리되는 코드, 테스트, 배포 파이프라인, 마이그레이션 가능한 추상화가 오래 버틴다. 에이전트 설계도 결국 소프트웨어 수명주기 안에 들어와야 한다.

  • Agent Builder와 Evals는 2026-11-30 이후 OpenAI 플랫폼에서 제공 중단 예정
  • 코드로 지속해야 하는 워크플로는 Agents SDK로 이전 권장
  • 운영 에이전트는 시각 플로우보다 버전 관리·테스트 가능한 코드 자산이어야 함
원본 →
AI 코딩 도구

DiffusionGemma — 토큰을 왼쪽부터 쓰지 않는 LLM 서빙

Google의 DiffusionGemma 개발자 가이드는 Gemma 4 기반 실험 모델이 자동회귀식 한 토큰 생성 대신 256-token canvas를 병렬로 정제하는 구조를 설명한다. GPU에서는 메모리 대역폭 병목을 계산 병목으로 옮겨 최대 4배 빠른 token generation을 목표로 하고, 26B MoE 중 inference 때 3.8B 파라미터만 활성화해 quantized 배포를 18GB VRAM 안에 맞추도록 설계됐다. 실무 포인트는 "새 모델이 빠르다"가 아니라, vLLM 같은 서빙 엔진도 autoregressive 전제에서 벗어나 denoising loop와 block 단위 KV cache를 다뤄야 하는 시대가 온다는 점이다.

  • 256-token canvas를 병렬 denoising으로 정제하는 diffusion-style generation
  • 26B MoE지만 inference 활성 파라미터는 3.8B, quantized 배포는 18GB VRAM 목표
  • vLLM 통합처럼 서빙 엔진이 autoregressive 전제 밖의 루프를 지원해야 함
원본 →
AI 코딩 도구

Copilot-authored PR 검색 — 에이전트 산출물도 사람 책임 뷰에 합치기

GitHub은 2026년 6월 18일 `author:` 검색이 Copilot cloud agent가 사용자 지시에 따라 연 PR까지 함께 보여주도록 바뀌었다고 공지했다. `author:@me`와 Created by me 뷰가 사람이 직접 만든 PR과 Copilot이 대신 연 PR을 함께 보여주며, GitHub Mobile과 웹 UI에 먼저 적용되고 REST/GraphQL API는 2026년 7월 16일 rollout 예정이다. 교육 포인트는 에이전트 PR을 별도 봇 산출물로 치워 두지 말라는 것이다. 사람이 시킨 작업이면 검색, 대시보드, 릴리스 노트, 감사 흐름에서 그 사람의 책임 범위로 함께 보여야 review와 ownership이 끊기지 않는다.

  • `author:@me`가 human-authored PR과 Copilot-authored PR을 함께 반환
  • 웹 UI와 GitHub Mobile 먼저 적용, REST/GraphQL API는 2026-07-16 rollout 예정
  • 에이전트 산출물도 요청한 사람의 ownership·review 흐름 안에 보여야 함
원본 →
AI 코딩 도구

Karrot Firebase AI Logic — 번역 AI는 품질보다 배포 경로가 먼저다

Google Android Developers Blog의 Karrot 사례는 AI+Android 기능 선택의 기준을 잘 보여준다. Karrot은 북미 사용자 중 비영어 기기 언어 사용자가 30%라는 문제를 확인했고, ML Kit Translation과 Gemini Nano를 먼저 시험했지만 품질과 모델 다운로드 장벽 때문에 Firebase AI Logic + Gemini Flash Lite를 선택했다. PoC는 3시간 안에 만들었고, 전용 백엔드 없이 2주 만에 프로덕션 기능으로 전환했다. 결과적으로 번역 배너를 본 비영어 사용자 3명 중 1명이 기능을 사용했고, 번역 기능을 제공받은 구매자는 판매자와 채팅을 시작할 가능성이 2.4배 높았다. 교훈은 모델 이름보다 배포 경로, UX opt-in, 프롬프트 운영을 먼저 검증하라는 점이다.

  • ML Kit Translation·Gemini Nano를 시험한 뒤 Firebase AI Logic + Gemini Flash Lite 선택
  • PoC 3시간, 전용 백엔드 없이 2주 만에 프로덕션 반영
  • 번역 제공 구매자는 판매자 채팅 시작 가능성이 2.4배 높았다고 보고
원본 →
AI 코딩 도구

RA.Aid — 연구·계획·구현 3단계로 개발 작업을 자율 수행하는 LangGraph 기반 코딩 에이전트

RA.Aid는 "Develop software autonomously"를 표방하는 오픈소스(Apache-2.0) 코딩 에이전트로, LangGraph 위에서 Research(정보·컨텍스트 수집) → Planning(작업 분해·전략) → Implementation(실행) 3단계 아키텍처로 멀티스텝 개발 작업을 거의 자율적으로 처리한다.

  • 3단계: Research(컨텍스트 수집) → Planning(작업 분해) → Implementation(실행)
  • 셸·파일·메모리·코드분석 툴셋 + Git 통합 + 자동 명령 실행, 대화형 CLI
  • 웹 리서치(Tavily)·전문가 추론 모델 활용, 선택적 HITL(사람 개입)
  • 모델 비종속(Anthropic·OpenAI·OpenRouter·Gemini 등), aider 통합(--use-aider)
원본 →
AI 코딩 도구

Devika — 한 줄 지시를 단계로 쪼개 리서치하고 코드를 작성하는 에이전틱 AI 소프트웨어 엔지니어

Devika는 "Agentic AI Software Engineer"를 표방하는 오픈소스(MIT) 도구로, 고수준 사람 지시를 이해해 단계로 분해하고 관련 정보를 리서치한 뒤 목표 달성 코드를 작성한다. README는 아직 매우 초기·실험 단계라고 밝힌다.

  • 고급 AI 계획·추론 + 집중 리서치용 문맥 키워드 추출
  • 웹 브라우징으로 정보 수집, 다중 프로그래밍 언어로 코드 작성
  • 동적 에이전트 상태 추적·시각화, 챗 기반 자연어 상호작용, 확장 가능한 아키텍처
  • 모델: Claude 3·GPT-4·Gemini·Mistral·Groq·Ollama 로컬 LLM 지원 / MIT·실험단계
원본 →
AI 코딩 도구

Copilot Custom Agents — 프롬프트가 아니라 역할 파일로 에이전트를 고정하기

GitHub Docs는 Copilot custom agents를 특정 워크플로, 코딩 규칙, use case에 맞춘 Copilot agent 버전으로 설명한다. 핵심 단위는 `.github/agents/*.agent.md` 같은 Markdown agent profile이고, YAML frontmatter에 name, description, target, tools를 두며 본문에는 최대 30,000자 prompt를 넣는다. repository, organization, enterprise 레벨에 둘 수 있고 GitHub.com의 cloud agent, IDE, Copilot CLI에서 선택해 쓸 수 있다. 교육 포인트는 "매번 길게 지시하기"가 아니라, 리뷰어·문서작성자·마이그레이션 담당처럼 반복되는 역할을 파일로 버전 관리하고 도구 권한까지 좁혀서 같은 작업 품질을 재현하는 것이다.

  • agent profile: Markdown + YAML frontmatter + 본문 prompt
  • tools를 지정하지 않으면 기본적으로 모든 사용 가능 도구에 접근
  • repo/org/enterprise 레벨에 두고 GitHub.com·IDE·CLI에서 선택
원본 →
AI 코딩 도구

Copilot 지시문 매트릭스 — 같은 파일명도 표면마다 다르게 먹힌다

Copilot custom instructions 지원표를 보면 지시문은 하나가 아니다. GitHub.com의 Copilot cloud agent는 `.github/copilot-instructions.md`, `.github/instructions/**/*.instructions.md`, `AGENTS.md`·`CLAUDE.md`·`GEMINI.md`, organization instructions를 읽지만, Copilot code review나 각 IDE는 지원 범위가 다르다. 예를 들어 Xcode의 cloud agent는 repo/path/agent instructions를 지원하지만, Eclipse의 code review custom instructions는 현재 지원되지 않는다. 실무 포인트는 "AGENTS.md 하나면 끝"이 아니라, 실제로 쓰는 표면별 지원표를 기준으로 repo-wide 규칙, path-specific 규칙, agent instruction을 분리해 검증해야 한다는 점이다.

  • cloud agent는 repo-wide·path-specific·agent·organization instructions를 조합
  • IDE와 code review 표면마다 지원 조합이 다름
  • 지시문 설계는 파일명보다 실행 표면별 지원 여부를 먼저 확인
원본 →
AI 코딩 도구

Copilot Jira 연동 — 티켓 문맥은 PR에 공개될 수 있다

GitHub Copilot for Jira 문서는 Jira work item에서 Copilot cloud agent를 호출해 PR 생성을 맡길 수 있다고 설명한다. 사용자는 Jira 이슈를 Copilot에 assign하거나 댓글에서 멘션하고, 진행 상황을 Jira 댓글에서 확인하며, 같은 work item에서 후속 지시를 이어갈 수 있다. 하지만 중요한 안전 문장이 있다. Jira에서 캡처된 컨텍스트는 pull request에 추가되며, 저장소가 public이면 모두에게 보일 수 있다. 또한 이 경로는 GitHub Actions minutes와 AI credits를 소비한다. 그래서 티켓 기반 에이전트 자동화는 "편한 연결"보다 공개 가능 문맥, 비용, 권한, 기본 custom agent·branch 규칙을 먼저 정해야 한다.

  • Jira work item assign/mention으로 Copilot cloud agent 세션 시작
  • Jira 컨텍스트가 PR에 들어가 public repo에서는 공개될 수 있음
  • 실행 비용은 GitHub Actions minutes + AI credits로 계산
원본 →
AI 코딩 도구

Copilot MCP 정책 — 도구 발견보다 허용 목록이 먼저다

GitHub Enterprise Cloud 문서는 조직·엔터프라이즈에서 MCP server usage를 정책으로 관리할 수 있다고 설명한다. 관리자는 MCP servers in Copilot로 MCP 사용 자체를 제어하고, MCP Registry URL로 개발자가 발견할 승인 서버 목록을 지정하며, Restrict MCP access to registry servers로 레지스트리에 있는 서버만 허용할 수 있다. Agent Finder처럼 런타임에 MCP 서버·도구·스킬을 찾아 쓰는 흐름이 커질수록, 실무 핵심은 "많이 연결하기"가 아니라 어떤 registry를 신뢰하고 어떤 서버만 조직 표면에 노출할지 정하는 것이다. MCP는 연결 표준인 동시에 권한 표면이다.

  • MCP servers in Copilot로 조직/엔터프라이즈 MCP 사용을 제어
  • MCP Registry URL로 승인된 서버 발견 경로를 지정
  • registry 서버만 허용해 런타임 도구 연결을 정책 경계 안에 둠
원본 →
AI 코딩 도구

AutoCodeRover — AST 기반 코드 검색으로 GitHub 이슈를 자동 해결하는 자율 프로그램 개선 시스템

AutoCodeRover(NUS)는 GitHub 이슈(버그 픽스·기능 추가)를 LLM과 프로그램 분석·디버깅으로 자동 해결한다. 문자열이 아닌 AST(프로그램 구조)를 이해하는 코드 검색으로 패치 위치를 우선순위화해 패치를 생성하는 "Autonomous Program Improvement" 접근이다.

  • 2단계: 컨텍스트 검색(Program Structure Aware한 AST 기반 코드검색 API) + 패치 생성
  • 테스트 스위트가 있으면 statistical fault localization으로 수리율 향상
  • SWE-bench Verified 46.20% / full 24.89% / lite 30.67%(pass@1), 태스크당 7분 미만·$0.7 미만
  • 논문 'AutoCodeRover: Autonomous Program Improvement'(arXiv 2404.05427), ISSTA 2024 / 라이선스는 README 미명시
원본 →
AI 코딩 도구

PR-Agent (Qodo Merge 오픈소스): AI 코드리뷰 에이전트

Qodo가 커뮤니티로 유지하는 오픈소스 AI 코드리뷰 에이전트. PR에 명령을 달면 자동 리뷰·설명·개선제안을 수행한다. GitHub·GitLab·BitBucket·Azure DevOps·Gitea를 지원하고 GitHub Action·CLI·Docker·self-hosted·webhook으로 실행한다.

  • 핵심 명령: /review(리뷰) /describe(PR 설명 생성) /improve(코드 개선제안) /ask(코드 라인 질의)
  • 각 도구는 단일 LLM 호출(README: ~30초, 저비용)로 동작
  • 플랫폼 무관: 여러 git 제공자·배포방식·AI 모델(OpenAI GPT, Claude 등) 지원
  • 실행: GitHub Action(권장)·CLI(로컬)·Docker·self-hosted·webhook
원본 →
AI 코딩 도구

Agent Zero: Docker 컨테이너에 'AI 에이전트용 완전한 리눅스 시스템'을 주는 동적 에이전트 프레임워크

"A full Linux system for your AI agent" — 오픈·동적·유기적 에이전트 프레임워크. Docker 컨테이너 하나에 XFCE 데스크톱이 도는 완전한 리눅스 시스템과 플러그인 허브를 담아, 에이전트가 Skills로 스스로 확장한다.

  • 컨테이너 안에 실제 XFCE 데스크톱 세션이 돌고, 에이전트가 Skills로 기능 확장
  • 멀티에이전트: 모든 에이전트가 하위 에이전트를 만들어 작업을 분해(상위가 지시·보고 수신, 하위는 독립 컨텍스트)
  • 확장형: prompts/ tools/ 플러그인 직접 수정, 플러그인·MCP·A2A·프로젝트별 설정 지원
  • 모델: OpenAI Codex 플랜을 OAuth로 연동(Gemini CLI·Claude Code 통합 예고)
원본 →
AI 코딩 도구

Claude Engineer v3: 대화 도중 스스로 도구를 만들어 핫리로드하는 자기개선형 코딩 어시스턴트

"A powerful self-improving AI Assistant designed for creating and managing AI tools with Claude 3.5." 대화 중 새 도구의 필요를 스스로 식별해 설계·구현하고, 재시작 없이 핫리로드해 쓴다. 쓸수록 능력이 늘어나는 자기개선 구조. CLI(ce3.py)와 웹 UI(app.py) 둘 다 제공.

  • 자기개선: 자율 도구 식별·생성, 대화 중 동적 능력 확장, 능력 공백 자동 탐지, 기존 도구 자가 최적화
  • 핵심: 동적 도구 생성·로딩 + 핫리로드(새 도구를 재시작 없이 즉시 사용)
  • 모델 Claude 3.5 Sonnet, Anthropic 토큰 카운팅 API로 토큰 사용 추적·시각화
  • 실행: uv로 설치 후 웹 UI(uv run app.py, localhost:5000) 또는 CLI(uv run ce3.py)
원본 →
AI 코딩 도구

ShellSage: tmux 히스토리·패널을 읽어 현재 작업 맥락을 이해하는 터미널 네이티브 AI 어시스턴트

"AI-powered command-line assistant that integrates seamlessly with your terminal workflow through tmux." tmux 히스토리(여러 패널 포함)를 자동으로 읽어 지금 무슨 일이 벌어지는지 맥락을 잡고 도와준다. Answer.AI(Jeremy Howard 랩) 작품, nbdev로 개발. License: MIT.

  • tmux 패널 히스토리 자동 판독 + 특정 패널 지정(ssage --pid %2)으로 그 패널 상황 분석
  • 제안 명령 추출: Ctrl+B E 후 블록 인덱스 입력하면 해당 명령을 바로 전송
  • 실행 전 curated allow-list로 명령 검증(safecmd), 모든 상호작용을 SQLite로 로깅 가능
  • 모델 비종속: Claude·GPT·Ollama 등 여러 LLM 제공자 지원, 기본은 Claude
원본 →
AI 코딩 도구

bolt.new: 브라우저 안 WebContainers에서 풀스택 웹앱을 프롬프트로 만들고 실행·배포하는 AI 개발 에이전트

"AI-Powered Full-Stack Web Development in the Browser." StackBlitz WebContainers 위에서 로컬 설치 없이 브라우저만으로 풀스택 개발을 한다. AI에게 환경 전체의 제어권을 줘서 프롬프트→실행→편집→배포를 한자리에서 처리한다.

  • AI가 환경 전체를 제어: 파일시스템·node 서버·패키지매니저·터미널·브라우저 콘솔
  • npm 도구·라이브러리(Vite·Next.js 등) 설치·실행, Node.js 서버 구동
  • 서드파티 API 연동, 채팅에서 바로 프로덕션 배포, URL로 작업물 공유
  • WebContainers 기반이라 로컬 환경 설정 없이 브라우저에서 전 과정 수행
원본 →
AI 코딩 도구

OpenAI on OCI — 모델 도입은 API 키보다 구매 경로가 막는다

OpenAI와 Oracle은 2026년 6월 10일 Oracle Cloud Infrastructure 고객이 기존 Oracle Universal Credits를 OpenAI 모델과 Codex 접근에 적용할 수 있는 경로를 예고했다. 개발자에게 중요한 교육 포인트는 기술 통합보다 조달·거버넌스다. 기업 AI 에이전트 도입은 "어떤 SDK를 붙일까"보다 기존 클라우드 약정, 승인된 구매 프로세스, 비용 귀속, 보안 심사 안에서 모델과 Codex를 쓸 수 있는지가 먼저 병목이 된다. 자동화 계획에는 코드뿐 아니라 사용량 관측, 예산 주체, 클라우드 계약 경계도 포함해야 한다.

  • OCI 고객은 적격 Oracle Universal Credits를 OpenAI 모델·Codex에 적용 예정
  • 기존 구매 워크플로와 클라우드 약정 안에서 AI 도입 마찰을 줄이는 전략
  • 에이전트 운영 설계에는 SDK 선택뿐 아니라 조달·예산·거버넌스 경계를 포함
원본 →
AI 코딩 도구

Notion Codex 워크플로 — 스펙과 검증 방법을 같이 주면 에이전트가 오래 간다

OpenAI의 2026년 6월 9일 Notion 사례는 코딩 에이전트 운용법을 잘 보여준다. Notion은 모바일에 이미 있던 AI voice input을 웹으로 옮길 때 Codex에 모바일 코드베이스, 웹에서 필요한 모양, 결과 검증 방법을 함께 제공했다. Codex는 모바일 구현을 탐색한 뒤 웹 구현 초안을 만들었고, Notion은 예전이면 2주 걸릴 일을 3~4시간 정도에 끝냈다고 설명했다. 핵심은 "한 줄 지시"가 아니라, 비교할 기존 구현과 성공 판정 루프를 같이 주면 에이전트가 코드베이스 규칙을 따라갈 가능성이 커진다는 점이다.

  • 기존 모바일 구현 + 웹 요구사항 + 검증 방법을 함께 제공
  • Notion 사례: 2주 예상 작업을 3~4시간 수준으로 단축했다고 보고
  • 에이전트에게는 요청보다 스펙·참조 구현·검증 루프가 중요
원본 →
AI 코딩 도구

Codex Security — threat model·격리 검증·SARIF export까지 AI 보안 자동화 파이프라인

OpenAI Codex Security(2026)는 코드베이스별 threat model을 만들고 attack path를 탐색한 뒤, 격리 환경에서 이슈를 검증하고 사람이 리뷰할 패치를 제안한다. Trusted Access for Cyber·GPT-5.5-Cyber처럼 보안 작업 권한을 단계화하며, "AI에게 취약점 찾아줘" 전에 소유권·권한 등급·격리·사람 리뷰를 먼저 정해야 한다. plugin 0.1.9부터는 findings workspace에서 coverage·severity·confidence·evidence를 함께 검토하고 JSON·CSV·SARIF로 export — scan-manifest.json·findings.json·coverage.json 맥락 보존. backlog triage는 scanner·advisory·bug bounty·GitHub/Jira/Linear 결과를 현재 코드와 대조해 confirmed·needs_review·not_actionable verdict·우선순위 큐 생성. Linear/GitHub/Jira issue·private draft GitHub Security Advisory는 승인 전 쓰지 않음. claude-code-security-review(Anthropic PR diff)와 달리 threat model 기반 proactive scan + portable artifact handoff.

  • Threat model→attack path→격리 검증→패치 제안, Trusted Access for Cyber 권한 등급
  • Findings workspace + SARIF/JSON/CSV export, manifest·coverage 맥락 보존
  • Triage/Track: verdict·priority 큐, 티켓·GSA 쓰기는 approval-gated
원본 →
AI 코딩 도구

Potpie: 코드베이스 전체를 Neo4j 지식 그래프로 인덱싱해 디버깅·Q&A·스펙 전문 에이전트를 붙이는 도구

Potpie는 저장소를 파싱해 모든 파일·클래스·함수와 호출관계를 담은 지식 그래프(Neo4j)로 만든다. 이 그래프가 모든 에이전트의 컨텍스트 backbone이 되어, 실제 코드에 근거한 답·코드·문서를 낸다. License: Apache 2.0.

  • 지식 그래프: 함수·클래스·파일·import·호출관계를 Neo4j에 저장한 구조적 인덱스
  • 프리빌트 에이전트: Debugging(스택트레이스 분석·단계별 가이드)·Codebase Q&A·Code Generation(기능 생성·리팩터)·Spec(스펙/PRD/아키텍처 문서)
  • Custom Agent 빌더: System Instructions·Tasks·Tools로 반복 작업용 맞춤 에이전트 설계
  • 모델 비종속: openai·ollama·anthropic·openrouter (LiteLLM provider/model_name 형식)
원본 →
AI 코딩 도구

Rawdog: CLI 요청에 답하려 파이썬 스크립트를 즉석 생성·자동 실행하고 그 출력을 맥락에 넣어 스스로 재호출하는 어시스턴트

"An CLI assistant that responds by generating and auto-executing a Python script." RAWDOG = "Recursive Augmentation With Deterministic Output Generations". 스크립트를 돌려 출력을 대화에 추가하고 자기 자신을 다시 호출하는 자가 컨텍스트 선택 방식이 특징.

  • 동작: 스크립트를 실행해 결과를 출력·대화에 추가 후 자기 자신을 재호출(self-select context)
  • 안전 경고 명시: 지시에 따라 해를 끼칠 수 있으니 주의 / --leash로 스크립트마다 수동 승인, --retries(기본 2)로 에러 시 재시도
  • 두 모드: Direct(단일 프롬프트 실행 후 종료)·Conversation(왕복 대화, 자기 스크립트·출력 참조)
  • litellm 사용, 기본 gpt-4-turbo-preview / Ollama로 Mixtral 로컬 실행·Anthropic claude 설정 가능
원본 →
AI 코딩 도구

llm (Simon Willison): 명령줄에서 LLM에 프롬프트를 보내고 입출력을 SQLite에 저장하며 플러그인으로 모델을 확장하는 CLI 겸 파이썬 라이브러리

"A CLI tool and Python library for interacting with OpenAI, Anthropic's Claude, Google's Gemini, Meta's Llama and dozens of other Large Language Models." 터미널과 파이썬 양쪽에서 LLM을 다루고, 원격 API뿐 아니라 로컬 머신 모델도 플러그인으로 붙인다. License: Apache 2.0.

  • 명령줄에서 프롬프트 실행 + 모든 프롬프트·응답을 SQLite에 저장
  • 임베딩 생성·저장, 텍스트/이미지에서 구조화 데이터 추출, 모델에 도구(함수) 실행 권한 부여
  • 플러그인으로 로컬·원격 모델 확장(OpenAI·Claude·Gemini·Llama 등 수십 종)
  • 설치: pip·brew·pipx·uv / 문서 llm.datasette.io
원본 →
AI 코딩 도구

OpenCommit: AI가 git 커밋 메시지 자동 생성

스테이지된 변경(diff)을 LLM에 보내 의미 있는 커밋 메시지를 만들어주는 CLI. `oco` 한 번이면 add부터 commit까지 처리. GitHub 2023 해커톤 수상작.

  • 설치: npm install -g opencommit, 실행은 oco
  • prepare-commit-msg git hook으로 등록 가능(커밋 전 메시지 편집)
  • provider: openai(기본)·anthropic·azure·ollama·gemini 등, 로컬모델(Ollama/llama.cpp) 지원
  • --yes로 확인 없이 커밋, GitMoji·.opencommitignore·commitlint 연동
원본 →
AI 코딩 도구

AI Shell: 자연어를 셸 명령으로 바꿔주는 CLI

"list all log files" 같은 자연어를 셸 명령으로 변환해 제안하고, 설명을 붙여 실행 전에 실행·수정·취소를 물어보는 오픈소스 CLI.

  • 설치: npm install -g @builder.io/ai-shell, 실행은 ai <프롬프트>
  • 제안 명령에 Explanation 표시, Yes(실행)/Revise(수정)/Cancel 선택
  • ai chat 대화 모드, -s(--silent)로 설명 생략
  • 출력 언어 전환(한국어 포함), OPENAI_API_ENDPOINT로 커스텀 엔드포인트, 기본 gpt-4o-mini
원본 →
AI 코딩 도구

Micro Agent: 테스트 먼저 만들고 통과할 때까지 코드를 고치는 AI 에이전트

프롬프트를 주면 먼저 테스트를 생성하고, 그 테스트가 모두 통과할 때까지 코드를 반복 수정. "한 가지를 잘하기" — 명확한 합격 기준(테스트)으로 피드백 루프를 좁힌 작은 에이전트.

  • 설치: npm install -g @builder.io/micro-agent (Node 18+)
  • 대화형은 micro-agent, 수동 모드는 micro-agent ./file.ts -t 'npm test'
  • Claude·OpenAI·Ollama 등 OpenAI 호환 provider 지원, 기본 gpt-4o(claude 별칭 가능)
  • 실험적 --visual: 렌더 결과를 스크린샷과 비교해 디자인 매칭(Anthropic 키 필요)
원본 →
AI 코딩 도구

Dell + Codex — 엔터프라이즈 에이전트는 데이터가 있는 곳으로 간다

OpenAI와 Dell은 2026년 5월 Codex를 하이브리드·온프레미스 환경에 더 가깝게 배포하는 협력을 발표했다. 당시 OpenAI는 Codex가 주간 개발자 400만 명 이상을 보유하고, 코드 리뷰·테스트 커버리지·사고 대응·대형 저장소 추론뿐 아니라 보고서 작성, 피드백 라우팅, 영업 리드 선별 같은 업무에도 쓰인다고 설명했다. 실무 포인트는 엔터프라이즈 AI 에이전트의 병목이 모델 호출이 아니라 내부 코드·문서·업무 시스템·거버넌스 데이터에 안전하게 가까워지는 배치 전략이라는 점이다.

  • Codex 주간 개발자 400만+ 시점의 엔터프라이즈 배포 협력
  • Dell AI Data Platform·AI Factory 같은 하이브리드/온프레미스 경계가 핵심
  • 에이전트 도입은 모델보다 데이터 위치·권한·거버넌스 설계가 먼저
원본 →
AI 코딩 도구

GPT-5.1-Codex-Max — 긴 작업은 큰 창보다 반복 압축이 핵심이다

OpenAI는 GPT-5.1-Codex-Max를 Codex용 장시간 에이전트 코딩 모델로 소개했다. 핵심은 컨텍스트가 커지는 것보다 compaction이다. 세션이 한계에 가까워지면 중요한 작업 상태를 남기고 새 컨텍스트 창으로 이어가며, 복잡한 리팩터링· 심층 디버깅·멀티아워 에이전트 루프를 지속한다. 공개 수치로는 SWE-bench Verified가 73.7%에서 77.9%, Terminal-Bench 2.0이 52.8%에서 58.1%로 개선됐다. 개발자에게는 "프롬프트를 더 길게"보다 상태 요약·검증 로그·리뷰 루프를 남기는 설계가 더 중요하다.

  • compaction으로 여러 컨텍스트 창을 이어 장시간 작업 지속
  • SWE-bench Verified 73.7%→77.9%, Terminal-Bench 2.0 52.8%→58.1%
  • 기본 권장 운영: 샌드박스, 도구 로그, 테스트 결과, 사람 리뷰
원본 →
AI 코딩 도구

README-AI: 저장소를 분석해 README를 자동 생성하는 CLI

저장소 처리 엔진과 LLM을 결합해 구조화된 README를 명령 한 번에 생성. 배지·프로젝트 구조·기능 표·시작 가이드 등을 자동으로 채워준다. MIT 라이선스.

  • 설치: pip install -U readmeai (Python 3.9+)
  • 소스: 로컬 파일시스템·GitHub·GitLab·Bitbucket 지원
  • model agnostic — OpenAI·Anthropic·Gemini·Ollama, 기본 gpt-3.5-turbo
  • 오프라인 모드(--api offline): LLM API 없이 README 생성
원본 →
AI 코딩 도구

Mem0 — AI 에이전트에 장기 메모리를 추가하는 드롭인 레이어, 벡터+그래프 하이브리드(Apache-2.0·~48k★)

Mem0는 AI 에이전트와 어시스턴트에 장기 메모리를 추가하는 프로덕션급 오픈소스 레이어다. 벡터 검색+ 그래프 기반 하이브리드 아키텍처로, 세션을 넘어 사용자 선호·이전 대화·변경된 사실을 기억한다. 시맨틱 유사성+키워드 매칭+엔티티 매칭으로 관련 메모리를 검색해 context window에 주입. 20개 벡터 스토어 백엔드(Qdrant·Chroma·Pinecone·PGVector 등), 21개 프레임워크 통합. OpenMemory MCP 서버로 Claude Desktop·Cursor·VS Code에서 로컬 메모리 사용 가능.

  • 하이브리드: 벡터 검색 + 그래프 + 시맨틱/키워드/엔티티 매칭
  • 20개 벡터 스토어 + 21개 프레임워크 통합
  • OpenMemory MCP: Claude·Cursor·VS Code 로컬 메모리
원본 →
AI 코딩 도구

Graphiti(Zep) — 시간을 1등 시민으로 다루는 AI 에이전트 메모리, 사실의 유효 기간을 추적하는 시간 지식 그래프

Graphiti는 Zep이 만든 시간 지식 그래프 기반 AI 에이전트 메모리 엔진이다. 모든 사실에 bi-temporal 유효 기간(세계에서 언제 참이었나 + 그래프에서 언제 참이었나)을 부여하고, 모순되는 새 사실이 들어오면 이전 사실을 삭제하지 않고 무효화+경계를 기록. '지금 참인 것'과 '3월 5일에 참이었던 것'을 별도로 조회 가능. 시맨틱 임베딩+BM25 키워드+그래프 순회 하이브리드 검색. sub-200ms(관리형), ~700ms p95(OSS).

  • bi-temporal: 사실의 세계 유효 기간 + 그래프 유효 기간 추적
  • 비파괴 업데이트: 모순 사실 → 이전 사실 무효화, 삭제 안 함
  • 하이브리드 검색: 시맨틱 + BM25 + 그래프 순회
원본 →
AI 코딩 도구

MLPerf Mobile v6.0 — 온디바이스 LLM 성능을 표준화된 벤치마크로 비교, Llama 3.2·Dimensity 9500 지원

MLPerf Mobile v6.0은 MLCommons가 발표한 온디바이스 GenAI 벤치마크다. Llama 3.2 1B/3B·Llama 3.1 8B로 TinyMMLU·IFEval 데이터셋 기반 성능·정확도를 측정. Qualcomm Snapdragon 8 Elite Gen 5에서 NPU 가속 실행 지원, MediaTek Dimensity 9500·Samsung Exynos 2600도 추가. 이미지 생성·객체 감지·초해상도 벤치마크도 포함. MLPerf Mobile 앱으로 누구나 자기 디바이스에서 테스트 가능.

  • GenAI 벤치마크: Llama 3.2/3.1, TinyMMLU·IFEval 기반
  • NPU 가속: Snapdragon 8 Elite Gen 5, Dimensity 9500, Exynos 2600
  • 표준화: MLCommons, 120+ 디바이스에서 비교 가능
원본 →
AI 코딩 도구

Dagster — 데이터 자산 중심 파이프라인 오케스트레이터, dbt 네이티브·리니지·품질 검증 내장(Apache-2.0)

Dagster는 태스크가 아니라 데이터 자산(테이블·모델·리포트)을 1등 시민으로 다루는 오케스트레이터다. @asset 데코레이터로 파이프라인을 선언적으로 정의하고, 자산 간 의존성·리니지·품질 검증을 내장. dbt와 네이티브 통합(dbt 모델 = Dagster 자산). AI 에이전트 워크플로우에 자연스럽게 적용 가능 (에이전트가 자산 선언을 이해하기 쉬움). Airflow(태스크 중심)·Prefect(플로우 중심) 대비 자산 중심이 차별점. Dagster 1.13: Components + dg CLI GA, Compass AI 어시스턴트.

  • 자산 중심: @asset 선언적 정의, 리니지·품질 검증 내장
  • dbt 네이티브: dbt 모델 = Dagster 자산, 컬럼 레벨 리니지
  • AI 친화: 에이전트가 자산 선언을 이해하기 쉬운 구조
원본 →
AI 코딩 도구

AutoSchemaKG — 사전 정의 스키마 없이 비정형 텍스트에서 지식 그래프를 자동 구축하는 프레임워크(MIT·~755★)

AutoSchemaKG는 HKUST가 만든 자동 지식 그래프 구축 프레임워크다. 사전 정의 스키마 없이 LLM으로 비정형 텍스트에서 엔티티·이벤트 트리플을 추출하고, 개념화(conceptualization)를 통해 스키마를 자동 유도한다. 서로 다른 도메인의 정보를 시맨틱 브릿지로 연결해 제로샷 크로스 도메인 추론 가능. ATLAS는 Wikipedia·PeS2o·Common Crawl에서 구축한 대규모 지식 그래프 패밀리. RAG 검색 지원.

  • 스키마 없이: LLM 트리플 추출 + 자동 스키마 유도
  • 시맨틱 브릿지: 도메인 간 정보 연결, 제로샷 추론
  • ATLAS: Wikipedia·PeS2o·Common Crawl 대규모 KG
원본 →
AI 코딩 도구

Wan2.2(Alibaba) — MoE 기반 오픈소스 비디오 생성, 5B 밀집+14B MoE 모델·시네마틱 스타일 제어(Apache-2.0·~16k★)

Wan2.2는 Alibaba가 만든 대규모 오픈소스 비디오 생성 모델이다. Mixture-of-Experts(MoE) 아키텍처로 5B 밀집 모델(TI2V-5B)과 14B MoE 모델(T2V-A14B)을 제공. 텍스트→비디오·이미지→비디오를 단일 프레임 워크로 통합. 시네마틱 조명·구도·색감 제어 가능. TI2V-5B는 소비자 GPU(RTX 4090)에서 5초 720P 비디오를 ~9분에 생성. 4×32×32 압축 비율 달성. Diffusers·ComfyUI 호환.

  • MoE: 5B 밀집 + 14B MoE, 텍스트/이미지→비디오 통합
  • 소비자 GPU: TI2V-5B, RTX 4090에서 720P 생성 가능
  • 시네마틱 제어: 조명·구도·색감·콘트라스트 라벨
원본 →
AI 코딩 도구

Mochi 1(Genmo) — 10B 파라미터 비디오 생성, 비대칭 확산 트랜스포머로 높은 모션 충실도(Apache-2.0)

Mochi 1은 Genmo가 만든 10B 파라미터 비디오 생성 모델이다. 비대칭 확산 트랜스포머(AsymmDiT) 아키텍처로 처음부터 학습되었으며, 높은 모션 충실도와 강한 프롬프트 준수가 특징. 사실적 스타일에 최적화(애니메이션은 약함). 학습 코드 포함 공개, LoRA 파인튜닝 지원(H100/A100 80GB). Apache-2.0으로 상업 이용 가능. ComfyUI 네이티브 통합. 오픈소스와 상용 비디오 생성의 격차를 크게 좁힘.

  • 10B AsymmDiT: 높은 모션 충실도 + 프롬프트 준수
  • 학습 코드 공개: LoRA 파인튜닝, H100/A100 80GB
  • Apache-2.0: 상업 이용 가능, ComfyUI 통합
원본 →
AI 코딩 도구

vLLM — 프로덕션 LLM 추론의 사실상 표준, PagedAttention으로 GPU 메모리 효율 극대화(Apache-2.0)

vLLM은 2026년 프로덕션 LLM 추론의 사실상 표준 오픈소스 엔진이다. PagedAttention으로 GPU 메모리 낭비를 제거해 같은 하드웨어에서 더 많은 동시 요청 처리. NVIDIA·AMD·Intel·Trainium·TPU 최광범위 하드웨어 지원. OpenAI 호환 API, H100에서 Llama 8B 기준 ~12,500 tok/s. v0.17.1에서 Model Runner V2로 56% 처리량 향상. SGLang(멀티턴·구조화 출력 특화) 대비 범용성·커뮤니티·배포 성숙도가 장점.

  • PagedAttention: GPU 메모리 낭비 제거, 동시 요청↑
  • 최광범위 HW: NVIDIA·AMD·Intel·Trainium·TPU
  • 사실상 표준: HuggingFace 공식 추천(TGI 후속)
원본 →
AI 코딩 도구

Docling(IBM) — PDF·DOCX·PPTX를 통합 구조화 문서로 변환, 테이블·수식·OCR 내장(MIT·~62k★)

Docling은 IBM Research가 만든 AI 기반 문서 변환 오픈소스 툴킷이다. PDF·DOCX·PPTX·XLSX·HTML·EPUB· 이메일·이미지·LaTeX 등 다양한 형식을 통합 DoclingDocument 구조로 변환. DocLayNet(레이아웃 분석)+ TableFormer(테이블 인식) AI 모델 내장. Markdown·HTML·JSON·DocTags 등 다양한 출력 형식. LangChain· LlamaIndex·Crew AI·Haystack 플러그인 통합. RAG 파이프라인용 시맨틱 청킹 네이티브 지원.

  • 다형식: PDF·DOCX·PPTX·이미지·이메일·LaTeX 등 변환
  • AI 내장: DocLayNet(레이아웃) + TableFormer(테이블) 모델
  • RAG 통합: LangChain·LlamaIndex 네이티브, 시맨틱 청킹
원본 →
AI 코딩 도구

Fish Audio S2 Pro — 1,000만 시간 학습·80언어 TTS, 10~30초 음성으로 즉시 보이스 클로닝(Dual-AR)

Fish Audio S2 Pro는 1,000만 시간 이상의 오디오로 학습된 최첨단 텍스트-투-스피치 모델이다. Dual-AR (Slow 4B + Fast 400M) 아키텍처 + GRPO 강화학습 정렬. 80+ 언어 지원, [laugh]·[whisper]·[excited] 등 자연어 태그로 세밀한 감정·운율 인라인 제어. 10~30초 참조 오디오로 음색·화법·감정까지 복제하는 즉시 보이스 클로닝. SGLang 스트리밍 추론(RTF 0.195, TTFA ~100ms). PyPI/Docker 배포.

  • Dual-AR: 4B+400M, GRPO 정렬, 80+ 언어
  • 인라인 감정 제어: [laugh]·[whisper] 등 자연어 태그
  • 즉시 클로닝: 10~30초 참조로 음색·감정 복제
원본 →
AI 코딩 도구

SAM 2(Meta) — 이미지+비디오 통합 세그멘테이션 파운데이션 모델, 스트리밍 메모리로 실시간 추적(Apache-2.0)

SAM 2는 Meta가 만든 프롬프터블 비주얼 세그멘테이션 파운데이션 모델이다. 이미지를 '1프레임 비디오'로 취급해 이미지+비디오 세그멘테이션을 단일 모델로 통합. 스트리밍 메모리 모듈로 실시간 비디오 처리· 객체 추적 지원(일시 가림 후에도 이전 프레임 컨텍스트로 재추적). 클릭·바운딩 박스·마스크 프롬프트. SAM 2.1 업데이트: tiny/small/base/large 체크포인트. SA-V(최대 비디오 세그멘테이션 데이터셋) 공개.

  • 통합: 이미지+비디오 세그멘테이션 단일 모델
  • 스트리밍 메모리: 실시간 추적, 가림 후 재추적
  • 프롬프터블: 클릭·박스·마스크 입력
원본 →
AI 코딩 도구

Stagehand v3 — hybrid CUA+DOM agent·Browserbase MCP Streamable HTTP

Stagehand(browserbase/stagehand·MIT·~23k★·v3.6)는 Playwright+AI 하이브리드 브라우저 자동화 SDK. v3 agent() 3 mode — DOM(text tool call) ·CUA(coordinate Computer Use) ·Hybrid(both). act/extract/observe atomic + agent() multi-step with step cache(cache hit→no LLM). Browserbase MCP Server — hosted Streamable HTTP(권장) or local STDIO, natural language browser control for coding agents. Browser Use(CDP library) ·Playwright MCP(a11y tree) ·agent-browser(CLI wrapper)와 달리 code+NL hybrid with self-healing cache.

  • v3 agent() — DOM·CUA·Hybrid modes ·custom tool injection
  • Step cache — successful actions replay without LLM re-call
  • Browserbase MCP Streamable HTTP — hosted browser for Claude/Cline agents
원본 →
AI 코딩 도구

Jina Reranker v3 — 리스트와이즈 아키텍처로 64문서 동시 스코어링, 131k 토큰·nDCG@10 61.94(CC-BY-NC)

Jina Reranker v3은 0.6B 파라미터 리스트와이즈 리랭커다. 기존 크로스인코더가 쿼리-문서 쌍을 하나씩 처리하는 것과 달리, 최대 64개 문서를 131,000 토큰 윈도우에서 동시에 스코어링. BEIR nDCG@10 61.94로 오픈 모델 중 최고 점수. RAG 파이프라인에서 벡터 검색 후 2단계 리랭킹으로 precision@5를 10~30% 향상. TEI(Text Embeddings Inference)로 배포. CC-BY-NC 4.0 라이선스(상업용은 별도 계약).

  • 리스트와이즈: 64문서 동시 스코어링, 131k 토큰
  • nDCG@10 61.94: 오픈 모델 BEIR 최고 점수
  • 2단계 RAG: 벡터 검색 → 리랭킹으로 precision 10~30%↑
원본 →
AI 코딩 도구

Feast — 오픈소스 ML 피처 스토어, 오프라인(학습)+온라인(서빙) 듀얼 스토리지로 학습-서빙 스큐 방지

Feast는 가장 널리 사용되는 오픈소스 ML 피처 스토어다. 오프라인 스토어(BigQuery/Redshift/S3 — 학습용 히스토리컬 데이터)와 온라인 스토어(Redis/DynamoDB — 서빙용 저지연 조회) 듀얼 아키텍처로 동일한 피처 정의에서 학습-서빙 간 일관성을 보장. Git 기반 피처 레지스트리(피처 정의=코드). point-in-time 조인으로 시간 여행 쿼리 지원. Kafka/Kinesis 스트리밍 머터리얼라이제이션. Python SDK.

  • 듀얼 스토리지: 오프라인(학습) + 온라인(서빙) 일관성
  • Git 레지스트리: 피처 정의를 코드로 관리
  • point-in-time 조인: 학습 시 정확한 시점 데이터 보장
원본 →
AI 코딩 도구

OpenCode(anomalyco) — Models.dev 75+ 프로바이더·Mission Control TUI·~179k★

OpenCode(anomalyco/opencode·MIT·~179k★)는 터미널 네이티브 오픈소스 코딩 에이전트 — 2026년 repo가 sst/opencode에서 anomalyco/opencode로 이전·TypeScript TUI. Models.dev 카탈로그로 75+ LLM 프로바이더(OpenAI·Anthropic·Google·Bedrock·Vertex·Ollama·ChatGPT Plus·GitHub Copilot 구독 재사용) hot-swap. Mission Control TUI — 멀티파일 agent task를 단일 pane에서 시각 관리. honor agent step limits·Copilot custom headers·Devstral model detection 등 v1.17.x active release. Goose(AAIF·범용 agent) ·OpenHands(Docker sandbox)와 달리 provider breadth+TUI-first coding agent.

  • anomalyco/opencode ·MIT ·~179k★ ·Models.dev provider catalog
  • Mission Control TUI — multi-file task organizer in terminal
  • ChatGPT/Copilot subscription reuse ·75+ provider config-only switch
원본 →
AI 코딩 도구

SGLang — 멀티턴·구조화 출력 특화 LLM 서빙, RadixAttention으로 공유 프리픽스 캐싱(vLLM 대비 29%↑)

SGLang은 멀티턴 대화·RAG·에이전트 워크플로우에 특화된 LLM 추론 엔진이다. RadixAttention으로 요청 간 공유 프리픽스를 Radix 트리에 캐싱해 중복 연산을 제거. H100에서 Llama 8B 기준 ~16,200 tok/s (vLLM 대비 29% 높은 처리량). 구조화 출력(JSON/Grammar) 생성 시 오버랩 마스크 생성으로 추가 속도 향상. Multi-LoRA 네이티브 스케줄링. 분리형 서빙(disaggregated) 프로덕션 사례 다수.

  • RadixAttention: 공유 프리픽스 캐싱, 멀티턴 29%↑
  • 구조화 출력: JSON/Grammar 오버랩 마스크 생성
  • 16,200 tok/s: H100 Llama 8B, vLLM 대비 29% 높은 처리량
원본 →
AI 코딩 도구

Edge LLM 리더보드 2026 — Gemma 3 4B·Phi-4-Mini·Qwen 2.5 3B, iPhone에서 27~55 tok/s 실시간 추론

2026년 엣지/모바일 LLM 리더보드에서 Gemma 3 4B IT가 종합 1위다. iPhone 16 Pro에서 ~27 tok/s, 3GB RAM(Q4)으로 실시간 추론. Phi-4-Mini(3.8B)는 추론 품질 1위(GSM8K 88.6%, ARC-C 83.7%). Qwen 2.5 3B는 파라미터 대비 최고 MMLU(65.6). Gemma 3 1B는 ~55 tok/s로 가장 빠른 유용한 모델. MLPerf Mobile v6.0이 Llama 3.2/3.1 기반 표준 벤치마크 제공. Google AI Edge Portal로 120+ 기기 자동 벤치마크.

  • Gemma 3 4B: iPhone 27 tok/s, 종합 1위
  • Phi-4-Mini: GSM8K 88.6%, 추론 품질 최고
  • MLPerf Mobile v6.0: Llama 3.2/3.1 표준 벤치마크
원본 →
AI 코딩 도구

avante.nvim: Neovim을 Cursor AI IDE처럼 만드는 AI 플러그인

"Use your Neovim like using Cursor AI IDE" — AI 코드 제안을 소스 파일에 원클릭으로 적용. avante.md로 프로젝트별 지시를 주고, Zen Mode·Fast Apply·ACP·RAG·MCP까지 통합. Apache-2.0.

  • AI 코드 제안 → One-Click Application으로 소스에 바로 반영
  • Zen Mode·avante.md(프로젝트별 지시)·RAG·MCP(mcphub.nvim) 통합
  • ACP(Agent Client Protocol)로 Gemini CLI·Claude Code·Goose·Codex 등 외부 에이전트 연동
  • provider: Claude·OpenAI·Azure·Gemini 등, 웹검색 Tavily/Brave/Kagi/SerpApi 등 연동
원본 →
AI 코딩 도구

n8n — 100k+★ 비주얼 워크플로우 자동화, AI 네이티브 노드(LangChain) 내장·400+ 통합(Fair-Code)

n8n은 가장 빠르게 성장하는 워크플로우 자동화 플랫폼이다. 노드 기반 비주얼 에디터로 400+ 통합을 제공하고, AI 네이티브 노드(LangChain 기반)로 LLM 워크플로우를 직접 구축할 수 있다. JavaScript/Python 코드 삽입 가능. 2025년 NVIDIA Ventures 참여 Series C $180M 유치($2.5B 밸류에이션). Temporal(내구 실행)·Kestra(YAML 오케스트레이션)·Windmill(코드 우선) 대비 가장 접근성이 높은 로우코드 도구.

  • 비주얼+코드: 노드 그래프 + JS/Python 코드 삽입
  • AI 네이티브: LangChain 기반 에이전트 노드 내장
  • $2.5B 밸류에이션: NVIDIA Ventures 참여 Series C
원본 →
AI 코딩 도구

AI 코딩 에이전트 2026 비교 — Claude Code(SWE-bench 80.8%) vs Cursor(IDE 1위) vs Codex(비동기 클라우드)

2026년 AI 코딩 도구는 IDE형과 터미널 에이전트형으로 양분된다. Cursor(VS Code 포크)는 인에디터 자동완성+Composer 멀티파일 편집으로 IDE 1위. Claude Code(터미널 CLI)는 Opus 4.6의 1M 토큰 context로 대규모 리팩토링·탐색에 강점, SWE-bench Verified 80.8%. Codex(OpenAI)는 샌드박스 비동기 클라우드 에이전트. Aider/OpenCode는 오픈소스·BYOK 터미널 대안. 실무 개발자 대부분이 Cursor+Claude Code 조합으로 80% 작업을 처리하는 추세.

  • Cursor: IDE 1위, 인에디터 자동완성+Composer
  • Claude Code: SWE-bench 80.8%, 1M context, 터미널
  • 실무 조합: Cursor(편집) + Claude Code(에이전트) 주류
원본 →
AI 코딩 도구

Sherpa-ONNX — 온디바이스 음성 AI 올인원, Android에서 Whisper 51x 빠른 추론·13k★(Apache-2.0)

Sherpa-ONNX는 k2-fsa 팀이 만든 ONNX Runtime 기반 온디바이스 음성 처리 올인원 툴킷이다. STT·TTS· 화자 분리·음성 활동 감지·키워드 스포팅을 단일 프레임워크로 통합. Whisper·Moonshine·SenseVoice· Zipformer 등 다양한 모델 지원. Android에서 Whisper Tiny 기준 whisper.cpp 대비 51x 빠른 추론(VoicePing 벤치마크). 12개 프로그래밍 언어 바인딩. Expo/React Native 래퍼(expo-sherpa-onnx) 제공.

  • 51x 빠른 추론: Android Whisper Tiny, whisper.cpp 대비
  • 올인원: STT·TTS·화자 분리·VAD·키워드 스포팅
  • 12개 언어 바인딩: C++·Python·Java·Swift·Kotlin 등
원본 →
AI 코딩 도구

Label Studio — 오픈소스 데이터 라벨링+AI 평가 플랫폼, 이미지·텍스트·오디오·비디오·LLM 평가 통합

Label Studio는 HumanSignal이 만든 가장 널리 사용되는 오픈소스 데이터 라벨링 플랫폼이다. 이미지· 텍스트·오디오·비디오·타임시리즈·멀티모달 데이터를 단일 UI에서 라벨링. ML 백엔드 연동으로 모델 예측→인간 검수 Active Learning 루프 구축 가능. 2026년 LLM/에이전트 평가 기능 추가: RLHF 선호도 라벨링, RAG 검색 QA, 에이전트 트레이스 리뷰. Vibe Code로 커스텀 인터페이스 생성(Enterprise).

  • 멀티모달: 이미지·텍스트·오디오·비디오·타임시리즈
  • ML 백엔드: Active Learning 루프, 모델 예측→인간 검수
  • LLM 평가: RLHF·RAG QA·에이전트 트레이스 리뷰
원본 →
AI 코딩 도구

LlamaIndex — RAG 데이터 프레임워크의 골드 스탠다드, 160+ 커넥터·하이브리드 검색·LlamaParse(Apache-2.0)

LlamaIndex는 2026년 RAG 프레임워크의 사실상 표준이다. 160+ 데이터 커넥터(LlamaHub)로 PDF·DB·API· 비정형 텍스트를 인덱싱. Sentence Window·하이브리드 검색·계층적 검색·Auto-Merging 등 고급 검색 전략 내장. LlamaParse는 복잡한 테이블·이미지·레이아웃 포함 문서를 기존 텍스트 파싱 대비 10x 정확도로 처리. LangChain(에이전트 오케스트레이션) 대비 검색 깊이가 차별점. 많은 팀이 LlamaIndex(검색) + LangChain(오케스트레이션) 조합 사용.

  • 160+ 커넥터: PDF·DB·API·비정형 텍스트 인덱싱
  • 고급 검색: Sentence Window·하이브리드·계층적·Auto-Merging
  • LlamaParse: 복잡 문서 10x 정확도 파싱
원본 →
AI 코딩 도구

LangGraph 1.0 — durable agent runtime GA, checkpointing·HITL·LangChain 상호운용

LangGraph 1.0(2025-10 GA)은 production-ready durable agent framework 첫 stable major — 1년+ Uber·LinkedIn·Klarna·Replit adoption 후 semver 보장. 방향 그래프(상태 머신)로 분기·루프·human-in-the-loop·streaming·persistence를 low-level 제어. Postgres checkpointing으로 crash·multi-day resume. langgraph.prebuilt deprecated→langchain.agents로 이동 — LangChain 1.0 create_agent(high-level)와 LangGraph(custom graph) composable, lock-in 없이 drop-down. Deep Agents·LangSmith Deployment·Temporal integration과 3층 — LangGraph=OSS runtime, LangChain=agent loop abstraction, LangSmith=obs+deploy+Engine.

  • v1.0 GA 2025-10 — first stable durable agent framework semver
  • langgraph.prebuilt→langchain.agents — high-level/low-level composable stack
  • Postgres checkpoint ·HITL ·Klarna/Uber/LinkedIn production
원본 →
AI 코딩 도구

Mobile-O — 온디바이스 통합 멀티모달(VLM+확산 생성), iPhone에서 이미지 생성 3초·VQA 0.4초(1.6B)

Mobile-O는 온디바이스용 통합 비전-언어-확산 모델이다. FastVLM(FastViT+Qwen2-0.5B) 기반 멀티모달 이해(VQA·OCR·추론)와 SANA(600M DiT) 기반 512×512 이미지 생성을 단일 아키텍처로 통합. iPhone 15 Pro에서 이미지 생성 ~3초, 시각 이해 ~0.4초. 메모리 2GB 미만. MLP 커넥터(~2.4M)가 VLM과 확산 디코더를 경량 연결. MLX+CoreML 최적화. 클라우드 의존 없이 완전 온디바이스 실행.

  • 통합: VLM(이해) + 확산(생성), 단일 아키텍처
  • iPhone 실시간: 이미지 생성 3초, VQA 0.4초
  • 경량: 1.6B 파라미터, 메모리 2GB 미만
원본 →
AI 코딩 도구

DeepEval — LLM용 Pytest, CI/CD에서 품질 게이트로 50+ 메트릭·Ragas와 상호보완(Apache-2.0)

DeepEval은 Confident AI가 만든 오픈소스 LLM 평가 프레임워크로 'LLM용 Pytest'를 표방한다. Pytest 네이티브 통합으로 LLM 테스트를 유닛 테스트처럼 작성하고 CI/CD 파이프라인에서 빌드 실패 트리거. 50+ 메트릭: RAG(faithfulness·context precision·recall), 에이전트(tool selection·planning quality), safety(hallucination·bias·toxicity). G-Eval로 커스텀 메트릭 생성. Ragas(RAG 학술 메트릭 특화)와 상호보완: DeepEval=CI 게이트, Ragas=프로덕션 모니터링.

  • Pytest 네이티브: LLM 테스트를 유닛 테스트처럼 CI/CD
  • 50+ 메트릭: RAG·에이전트·safety·hallucination
  • Ragas 상호보완: DeepEval=CI, Ragas=프로덕션 모니터링
원본 →
AI 코딩 도구

FLUX.2 — Black Forest Labs 오픈소스 이미지 생성, Klein 4B(Apache-2.0)는 8GB GPU에서 실시간(ComfyUI)

FLUX.2는 Black Forest Labs가 만든 최신 오픈소스 이미지 생성 모델 패밀리다. Klein 4B(Apache-2.0)는 ~8GB VRAM의 소비자 GPU(RTX 4070/3090)에서 서브초 생성 가능. Klein 9B(16GB)와 Dev 32B(고품질· 비상업)도 제공. 텍스트→이미지+이미지 편집(단일/다중 참조)을 단일 모델로 통합. ComfyUI가 표준 인터페이스. Stable Diffusion 3.5(LoRA/ControlNet 생태계 최대) 대비 포토리얼리즘·텍스트 렌더링 우수.

  • Klein 4B: Apache-2.0, 8GB GPU에서 서브초 생성
  • 통합: 텍스트→이미지 + 이미지 편집, 단일 모델
  • ComfyUI 표준: 노드 기반 워크플로우, 커스터마이징
원본 →
AI 코딩 도구

GPT-SoVITS — 1분 음성으로 프로덕션급 TTS 클로닝, 5초 제로샷·RTF 0.014(4090)·57k+★(MIT)

GPT-SoVITS는 RVC-Boss 팀이 만든 Few-shot 음성 클로닝+TTS 프레임워크다. 5초 참조 오디오로 제로샷 TTS, 1분 데이터로 고충실도 파인튜닝. GPT 시맨틱 토큰 예측기+SoVITS(VITS 기반) 보코더 결합. 4090에서 RTF 0.014(실시간의 71배 속도). 영어·일본어·한국어·광동어·중국어 크로스링구얼 합성. WebUI로 음원 분리·자동 세그멘테이션·ASR·라벨링 도구 내장. RVC(실시간 음성 변환)와 상호보완.

  • 5초 제로샷: 참조 오디오로 즉시 TTS
  • RTF 0.014: 4090에서 실시간 71배 속도
  • 크로스링구얼: 영·일·한·광·중 5개 언어
원본 →
AI 코딩 도구

ExecuTorch 1.0(Meta) — 온디바이스 LLM 프로덕션 프레임워크, 50KB 런타임·12+ HW 백엔드·Instagram/WhatsApp 사용

ExecuTorch는 Meta가 만든 프로덕션급 온디바이스 추론 프레임워크로 2025년 10월 1.0 GA를 달성했다. PyTorch torch.export 파이프라인으로 학습→모바일 배포 원스텝. 50KB 베이스 런타임으로 마이크로 컨트롤러부터 고급 스마트폰까지 지원. CoreML·Qualcomm QNN·MediaTek·XNNPACK 등 12+ HW 백엔드. Instagram·WhatsApp·Messenger·Facebook에서 수십억 사용자 서빙. llama.cpp(CPU·GGUF·프로토타입) 대비 NPU 가속+HW 최적화+프로덕션 안정성이 차별점.

  • 50KB 런타임: MCU부터 스마트폰까지 배포
  • 12+ HW 백엔드: CoreML·QNN·MediaTek·XNNPACK
  • Meta 스케일: Instagram·WhatsApp·Messenger 프로덕션
원본 →
AI 코딩 도구

LLM 벤치마크 2026 — SWE-bench·GPQA·HLE만 유의미, MMLU/GSM8K는 포화(상위 93%+), 포트폴리오 접근 필수

2026년 LLM 벤치마크에서 MMLU(93%)·GSM8K(99%)·HumanEval은 포화되어 프론티어 모델 구분 불가. 유의미한 벤치마크: SWE-bench Verified(실제 GitHub 버그 수정, Opus 4.6 80.8%), GPQA Diamond(PhD급 과학 추론, Gemini 3.1 94.3%), HLE(전문가 지식, 미포화), LiveCodeBench(월간 갱신 코딩). 평가 시 스캐폴드에 따라 5~15% 점수 변동 가능. 단일 벤치마크가 아닌 학술(GPQA)+에이전트(SWE-bench) +선호도(Chatbot Arena) 포트폴리오 접근 필수.

  • 포화: MMLU 93%+, GSM8K 99%+, 프론티어 구분 불가
  • 유의미: SWE-bench·GPQA·HLE·LiveCodeBench
  • 포트폴리오: 학술+에이전트+선호도 삼각 검증
원본 →
AI 코딩 도구

Structured Outputs — LLM에서 스키마 준수 JSON을 보장하는 프로덕션 패턴, strict:true로 제약 디코딩

Structured Outputs는 LLM이 JSON 스키마를 토큰 생성 레벨에서 강제 준수하게 하는 기능이다. OpenAI response_format(type:json_schema, strict:true)로 정확한 스키마 출력 보장. Function Calling(tool use)은 모델이 외부 도구 호출을 결정할 때 사용. JSON 모드는 '아무 JSON', Structured Outputs는 '정확한 스키마 JSON', Function Calling은 '액션 결정'. 프로덕션 패턴: Function Calling(라우팅) + Structured Outputs(포맷 보장). Instructor 라이브러리로 Pydantic 검증+자동 재시도.

  • strict:true: 토큰 레벨 스키마 강제(제약 디코딩)
  • 3가지 구분: JSON 모드 vs Structured Outputs vs Function Calling
  • 프로덕션: FC(라우팅) + SO(포맷) + Instructor(검증)
원본 →
AI 코딩 도구

DeepSeek R1 — 오픈웨이트 추론 모델, 671B MoE에서 37B만 활성·투명한 CoT·o3 대비 73% 저렴(MIT)

DeepSeek R1은 오픈웨이트 추론 모델로 GRPO 강화학습으로 학습되었다. 671B MoE 아키텍처에서 토큰당 37B만 활성화하여 비용 효율적. 핵심 차별점: 추론 과정(Chain-of-Thought)이 완전 투명하게 스트리밍되어 디버깅·감사·컴플라이언스에 유리. o3 대비 토큰당 73% 저렴($0.55/$2.19 vs $2/$8). 대부분의 실무 추론 태스크에서 o3의 85~97% 성능. 의료·법률·금융 분야에서 감사 가능성 때문에 R1 선호.

  • MoE: 671B 중 37B만 활성, 73% 저렴
  • 투명 CoT: 추론 과정 완전 공개, 감사 가능
  • 오픈웨이트(MIT): 셀프호스팅, 커스터마이징 가능
원본 →
AI 코딩 도구

Semblance — 완전 로컬 주권형 개인 AI, 네트워크 접근 아키텍처적 불가능·이메일/캘린더/건강 데이터 통합

Semblance는 완전 로컬에서 실행되는 주권형 개인 AI 어시스턴트다. AI 코어 프로세스가 아키텍처적으로 네트워크 접근 불가능(HTTP 라이브러리 없음, OS 샌드박스 격리). 이메일·파일·캘린더·메시지·건강· 금융 데이터를 로컬 지식 그래프에 수집하여 추론. 외부 통신은 단일 Gateway 프로세스를 통해 사용자 허용 서비스만 가능. LanceDB(벡터)+SQLite(구조화) 로컬 저장. Ollama/llama.cpp/MLX 선택. React Native 모바일은 로컬 추론 피어 디바이스로 동작.

  • 제로 네트워크: AI 코어에 HTTP 라이브러리 없음
  • 로컬 지식 그래프: 이메일·캘린더·건강·금융 통합
  • Gateway 격리: 사용자 허용 서비스만 외부 통신
원본 →
AI 코딩 도구

CodeGraph — 코드베이스를 시맨틱 그래프로 변환, 37언어·45 MCP 도구·호출 체인·아키텍처 문서 자동 생성

CodeGraph는 코드베이스를 시맨틱 그래프로 구축하고 AI 에이전트에게 구조화된 코드 이해를 제공하는 도구다. tree-sitter로 37개 언어 파싱. symbol_search(BM25+시맨틱 하이브리드), get_callers/callees (호출 체인), get_dependency_graph(의존성), blast_radius(영향 범위 분석) 등 45개 MCP 도구. verify_design(문서↔코드 교차 검증), generate_architecture_doc(ARCHITECTURE.md 자동 생성). 파일 grep 대신 구조화된 심볼 조회로 토큰 최대 5,700x 절감(GraphMind 유사).

  • 37언어·45 MCP 도구: 심볼 검색·호출 체인·의존성
  • 토큰 절감: grep 대비 최대 5,700x 적은 컨텍스트
  • 아키텍처 자동 생성: 코드 그래프 기반 ARCHITECTURE.md
원본 →
AI 코딩 도구

Auto-Use — 접근성 트리+비전 하이브리드로 OS 전체를 AI 에이전트가 제어, macOS/Windows 통합(MIT)

Auto-Use는 AI가 데스크톱 OS 전체를 제어하는 Computer Use 에이전트다. 3단계 하이브리드: ①접근성 트리(AXUIElement) 추출 → ②마젠타 바운딩 박스 오버레이 스크린샷 생성 → ③비전 모델(Claude/GPT-4o/ Gemini)에 번호 인덱스+엘리먼트 트리 전송. 순수 스크린샷(비주얼봇) 대비 안정적이고 정확한 요소 타게팅. 브라우저 자동화+시스템 제어+코딩 태스크를 단일 에이전트로 통합. macOS+Windows 빌드 통합. Python app.py(데스크톱 UI) 또는 main.py(터미널) 실행.

  • 하이브리드: 접근성 트리 + 비전, 순수 스크린샷 대비 정확
  • OS 전체 제어: 브라우저+시스템+코딩 단일 에이전트
  • 번호 인덱스: 오버레이 번호로 요소 타게팅, 좌표 불필요
원본 →
AI 코딩 도구

GPT Researcher: 웹/로컬을 깊게 조사해 인용 달린 리포트를 자동 생성

"the first open deep research agent" — planner가 연구 질문을 만들고 execution 에이전트들이 정보를 수집, publisher가 종합 리포트로 묶는다. 20+ 소스를 모아 2,000단어 이상 리포트 생성. Apache-2.0.

  • planner→execution agents→publisher 구조로 자율 조사 수행
  • 20+ 소스 집계, 인용 포함, PDF·Word 등으로 내보내기
  • Deep Research: 트리형 재귀 탐색으로 깊이·넓이 확장
  • 기본 OpenAI+Tavily, OpenAI 호환 API(로컬모델 등) 연동, MCP로 GitHub·DB·커스텀 API 연결
원본 →
AI 코딩 도구

SeaGOAT: 코드베이스를 로컬에서 의미 기반으로 검색

"A code search engine for the AI age" — 벡터 임베딩으로 코드베이스를 의미 단위로 검색. 3rd party·원격 API 없이 전부 로컬 실행, 인터넷 없이도 동작.

  • 설치: pipx install seagoat, 서버는 seagoat-server start /path/to/repo
  • 질의: gt "Where are the numbers rounded" (gt/seagoat 명령)
  • 로컬 벡터DB ChromaDB + 임베딩(텔레메트리 기본 off), ripgrep로 정규식/키워드 매칭 병행
  • Python·C/C++·TS/JS·Go·Java·PHP·Ruby 등 다언어 인덱싱
원본 →
AI 코딩 도구

code2prompt + files-to-prompt — 코드베이스를 LLM 컨텍스트로 포장하는 두 방식

code2prompt와 files-to-prompt는 모두 디렉터리 파일을 LLM에 넣기 좋은 한 덩어리로 만드는 context engineering 도구라 별도 카드로 두기보다 비교 카드가 더 유용하다. code2prompt는 Rust 기반으로 소스트리, Handlebars 템플릿, 토큰 카운트, Git diff/log/브랜치 비교, TUI, MCP 서버까지 제공해 "코드베이스를 분석 가능한 프롬프트 패키지"로 만드는 쪽에 가깝다. files-to-prompt는 Simon Willison의 단순한 Python CLI로 상대경로 헤더와 파일 내용을 이어붙이고 Claude XML/Markdown 출력, 확장자·gitignore·NUL 입력 필터를 제공한다. 큰 저장소 분석은 code2prompt, 빠른 파일 묶음 전달은 files-to-prompt가 맞다.

  • code2prompt: 템플릿·토큰·Git 컨텍스트·MCP까지 포함한 구조화 패키징
  • files-to-prompt: 빠른 디렉터리 concat, Claude XML/Markdown 출력과 필터링
  • 실무 포인트: 컨텍스트를 많이 넣기보다 재현 가능하게 선별·포맷하는 것이 핵심
원본 →
AI 코딩 도구

Open Interpreter: 저비용 모델을 위한 코딩 에이전트(Rust 버전)

"A coding agent for low-cost models" — 현재 README는 새 Rust 버전으로, OpenAI Codex의 fork. macOS·Linux·Windows 네이티브 샌드박싱 안에서 명령을 실행한다. Apache-2.0.

  • TUI에서 /model로 프로바이더·모델 전환, /harness로 Rust 네이티브 하니스 전환
  • exec·MCP·skills·hooks·permissions·AGENTS.md 지원
  • 내장 QA 스킬로 웹·네이티브 앱 테스트, interpreter acp로 에디터용 ACP 에이전트 동작
  • 설정·세션 상태는 ~/.openinterpreter에 로컬 저장
원본 →
AI 코딩 도구

Flowise: 노드를 시각적으로 연결해 AI 에이전트를 만드는 빌더

"Build AI Agents, Visually" — 드래그·연결만으로 LLM 에이전트·앱을 구성하는 오픈소스 비주얼 빌더. server·ui·components 3개 모듈 모노레포. 소스코드 Apache-2.0.

  • 설치: npm install -g flowise → npx flowise start → localhost:3000 (NodeJS 20+)
  • Docker: docker run -d --name flowise -p 3000:3000 flowise (Compose도 지원)
  • 모듈: server(Node API)·ui(React)·components(서드파티 노드)·api-documentation(swagger-ui)
  • 자체 호스팅(AWS·Azure·GCP 등) 및 Flowise Cloud 호스팅 옵션
원본 →
AI 코딩 도구

Kortix(Suna): 역할별 AI 에이전트 인력을 굴리는 AI 커맨드 센터

"A workforce of AI agents that does the real work — and everything is code you own." 회사 단위로 실제 업무를 수행하는 에이전트 워크포스 — 모든 게 내가 소유한 코드. 자기 인프라(노트북·VPS·VPC·에어갭)에서 자체 호스팅.

  • 구성: Agents(역할별 마크다운 페르소나)·Skills(재사용 노하우)·Connectors(3,000+ 앱·MCP·OpenAPI·GraphQL)
  • Secrets(런타임 주입)·Channels(Slack 등)·Triggers(cron·서명 웹훅)·Memory(파일 기반 회사 두뇌)
  • 샌드박스에서 에이전트가 install·run·break 자유, commit한 것만 살아남음
  • 코딩 에이전트(OpenCode)가 작업·commit·push 수행, 노트북~에어갭까지 자체 호스팅
원본 →
AI 코딩 도구

gpt-engineer: 자연어로 명세하면 AI가 코드베이스를 작성

"Specify software in natural language, sit back and watch as an AI writes and executes the code." 원하는 소프트웨어를 자연어로 적으면 AI가 코드를 짜고 실행, 개선 요청도 반영하는 코드 생성 실험 플랫폼.

  • 설치: python -m pip install gpt-engineer, 실행 gpte
  • 프로젝트 폴더에 확장자 없는 prompt 파일을 만들어 지시 작성
  • AI가 전체 코드베이스 생성·실행, 이후 개선 요청 반복 가능
  • bench 바이너리로 자체 에이전트 구현을 벤치마킹하는 인터페이스 제공
원본 →
AI 코딩 도구

Gemini Live API on Android — 실시간 음성 에이전트를 백엔드 없이 붙이기

Android Developers의 Gemini Live API 가이드는 Firebase AI Logic을 통해 Android 앱에서 Gemini Live API를 직접 호출하는 흐름을 보여준다. 목적은 일반 텍스트 챗봇이 아니라 실시간·저지연 음성 지원이 필요한 챗봇이나 에이전트 상호작용이다. 앱은 Firebase BoM과 `firebase-ai`를 추가하고, `RECORD_AUDIO` 권한을 선언한 뒤 `LiveModel`을 초기화해 오디오 응답 모델을 스트리밍한다. 단, Firebase AI Logic의 Live API 사용은 개발자 프리뷰라 호환성 변경 가능성과 제한이 있다. Android AI 설계 포인트는 "마이크 권한을 붙인다"가 아니라, 음성 UX·세션 수명·비용/쿼터·모델명 원격 변경을 제품 요구사항으로 다뤄야 한다는 점이다.

  • Firebase AI Logic으로 Android 앱에서 Gemini Live API를 직접 호출
  • `firebase-ai` 의존성 + RECORD_AUDIO 권한 + LiveModel 초기화가 기본 흐름
  • 개발자 프리뷰: 세션·쿼터·비용·호환성 변경을 출시 전 리스크로 관리
원본 →
AI 코딩 도구

TPU Developer Hub — AI 가속기는 코드 레시피와 관측 도구까지 같이 배워야 한다

Google은 2026년 6월 16일 TPU Developer Hub를 공식 출시했다. 이 허브는 Cloud TPU를 단순한 하드웨어 소개가 아니라, 사전학습·후학습·추론까지 이어지는 AI 개발 생애주기 자료로 묶는다. 범위는 TPU 하드웨어와 인프라 선택, XLA와 컴파일러 스택, PyTorch의 TPU 이전, XProf 기반 tracing/debugging, 멀티칩 병렬화, Pallas 커널 최적화, KV cache offloading, 네트워킹과 보안까지 포함한다. 개발자에게 중요한 점은 "더 빠른 칩을 쓰자"가 아니라, 모델 코드·컴파일러·프로파일러·네트워크를 한 루프로 보고 병목을 추적해야 TPU 성능이 실제 제품 추론과 학습 처리량으로 이어진다는 것이다.

  • 공식 출시: 2026-06-16, Cloud TPU용 중앙 교육/레시피 허브
  • 범위: pre-training, post-training, inference, XLA, PyTorch, XProf, Pallas, KV cache offloading
  • 자료는 code-first와 agent-ingestion friendly를 지향해 AI 보조 개발 도구가 읽기 쉽게 설계
원본 →
AI 코딩 도구

Colab MCP Server — 에이전트에게 클라우드 노트북을 실행 도구로 붙이기

Google은 2026년 3월 Colab MCP Server를 공개해, Gemini CLI·Claude Code 같은 MCP 호환 에이전트가 로컬 터미널에서 Google Colab 노트북을 직접 제어하게 했다. 핵심은 "코드 조각을 복사해 Colab에 붙여넣기"가 아니라, 에이전트가 .ipynb 셀을 만들고, 마크다운 설명을 넣고, Python 코드를 실행하고, 의존성을 설치하며, 결과 노트북을 클라우드 실행 산출물로 남기는 흐름이다. 로컬 머신에서 무거운 GPU/데이터 작업을 돌리거나 자율 에이전트에게 직접 하드웨어 접근을 주기 부담스러울 때, Colab을 MCP 도구화된 샌드박스로 쓰는 패턴이다. 공개 GitHub 저장소는 Apache-2.0이고, 같은 런에서 691★를 확인했다.

  • 공식 발표: 2026-03-17, Colab을 MCP 호환 에이전트의 클라우드 작업공간으로 연결
  • 기능: 셀 생성·정렬, 코드 실행, 의존성 설치, 재현 가능한 노트북 산출물 생성
  • 실무 포인트: 로컬 에이전트와 GPU/노트북 환경을 복사-붙여넣기 없이 분리
원본 →
AI 코딩 도구

Qubot — 데이터 분석 에이전트는 쿼리보다 컨텍스트 계층이 먼저다

GitHub은 2026년 6월 19일 내부 Copilot 기반 데이터 분석 에이전트 Qubot의 설계를 공개했다. Qubot은 Slack, VS Code, Copilot CLI에서 자연어 질문을 받아 GitHub 데이터 웨어하우스의 Kusto와 Trino 쿼리로 답한다. 핵심 구조는 UI, 컨텍스트 계층, 쿼리 엔진 세 부분이다. 컨텍스트 계층은 bronze 원시 이벤트, silver 공통 fact/dimension, gold 비즈니스 지표 정의를 나눠 문서·예시 쿼리·필수 필터·메타데이터를 런타임에 MCP 서버로 공급한다. 실무 교훈은 모델에게 SQL을 잘 쓰라고만 시키는 것이 아니라, 데이터 모델의 grain, 필터, 지표 정의, 평가 케이스를 버전 관리되는 컨텍스트로 만들어야 분석 에이전트가 빨라지고 회귀를 막을 수 있다는 점이다.

  • 구조: Slack/VS Code/Copilot CLI UI + federated context layer + Kusto/Trino query engine
  • 컨텍스트는 MCP 서버로 런타임 주입, 팀별 문서와 지표 정의를 표준 형식으로 정규화
  • 변경 전 offline eval: 정답 SQL·메타데이터가 있는 테스트 케이스로 정확도·지연·회귀를 비교
원본 →
AI 코딩 도구

Deployment Simulation — 에이전트 모델 출시 전에 실제 분포를 재생하기

OpenAI의 Deployment Simulation은 새 모델을 배포하기 전에 과거 대화에서 기존 assistant 답변을 제거하고, 후보 모델이 같은 맥락에 어떻게 답하는지 재생해 위험을 추정하는 방법이다. 전통적인 eval은 어렵고 위험한 케이스를 잘 찌르지만, 실제 배포 분포에서 어떤 실패가 얼마나 자주 나올지는 놓칠 수 있다. OpenAI는 GPT-5 계열 Thinking 배포 연구에서 약 130만 개 비식별 대화를 분석했고, 이 방법을 도구 사용이 포함된 agentic coding 설정에도 적용할 수 있다고 설명했다. 실무 교훈은 코딩 에이전트 평가도 문제집 점수만 볼 것이 아니라, 실제 작업 로그와 도구 환경을 재현해 배포 전 행동 빈도를 예측해야 한다는 점이다.

  • 방법: 과거 대화 prefix를 후보 모델로 재생해 배포 전 행동을 추정
  • 장점: synthetic eval보다 실제 사용 분포의 비꼬리 위험을 보기 좋음
  • 에이전트 적용: tool simulation이 있으면 agentic coding rollout 위험 평가에도 확장 가능
원본 →
AI 코딩 도구

AIChat: 셸 어시스턴트·REPL·RAG·에이전트를 한 CLI에

"All-in-one LLM CLI tool" — Shell Assistant, 대화형 Chat-REPL, RAG, 함수호출/도구, AI 에이전트(CLI판 GPTs), 로컬 서버까지 한 도구에 담은 Rust CLI. MIT/Apache-2.0 듀얼.

  • 설치: cargo install aichat 또는 brew install aichat (Termux는 pkg)
  • Shell Assistant로 자연어→명령, Chat-REPL 대화 모드
  • RAG·Function Calling·MCP·AI Agents·로컬 서버 기능 내장
  • provider: OpenAI·Claude·Gemini·Ollama·Groq·Azure·Bedrock 등 OpenAI 호환 API 폭넓게 지원
원본 →
AI 코딩 도구

mods: 셸 파이프라인에 AI를 끼워넣는 CLI

"AI for the command line, built for pipelines" — 표준입력을 읽어 mods 인자의 프롬프트를 앞에 붙여 LLM에 보내고, 응답을 마크다운으로 포맷. 기존 셸 파이프에 AI를 자연스럽게 합류시킨다. MIT.

  • 설치: brew install charmbracelet/tap/mods (winget·yay·nix·go install도 지원)
  • stdin을 받아 처리 → cat file | mods '요약해줘' 식 파이프라인 구성
  • provider: OpenAI·Cohere·Groq·Azure OpenAI, LocalAI로 로컬 모델
  • charmbracelet의 charm 생태계 도구 — settings는 mods --settings
원본 →
AI 코딩 도구

ShellGPT(sgpt): AI로 셸 명령·코드를 만드는 CLI 생산성 도구

"A command-line productivity tool powered by AI large language models" — 셸 명령·코드 스니펫·문서를 생성하고 바로 실행. Linux·macOS·Windows, 주요 셸 모두 지원.

  • 설치: pip install shell-gpt, 실행은 sgpt
  • 셸 명령 생성·실행, 코드만 생성, 명령 설명(describe) 기능
  • Chat·REPL 모드로 대화 유지, Roles로 커스텀 역할 정의, Function calling
  • LLM 함수호출 지원, 셸/OS 자동 감지로 환경에 맞는 명령 생성
원본 →
AI 코딩 도구

fabric: 프롬프트를 Pattern으로 모아 쓰는 AI 증강 프레임워크

"an open-source framework for augmenting humans using AI" — AI의 기본 단위인 프롬프트 자체를 마크다운 'Pattern'으로 만들어 정리·재사용. summarize·extract_wisdom 등.

  • 설치: go install .../fabric/cmd/fabric@latest 또는 brew install fabric-ai
  • Pattern = 작업별 마크다운 프롬프트, 가독성·편집성 위해 Markdown 사용
  • stdin 파이프로 실행: pbpaste | fabric --pattern summarize
  • 유튜브 등 입력도: fabric -y URL --pattern extract_wisdom, provider OpenAI·Anthropic·Gemini·Ollama
원본 →
AI 코딩 도구

tgpt: 터미널에서 AI를 쓰는 크로스플랫폼 CLI

"a Cross-platform Command-Line Interface (CLI) tool that allows you to use AI in your Terminal." 별도 페이지에 정리된 여러 provider를 골라 터미널에서 바로 AI를 호출하는 Go 기반 도구. GPL-3.0.

  • 설치(Linux/macOS): curl -sSL .../tgpt/main/install | bash -s /usr/local/bin
  • pacman -S tgpt · brew install tgpt · Chocolatey · go install로도 설치
  • Windows·FreeBSD 등 크로스플랫폼, 릴리스 바이너리 직접 다운로드 가능
  • 프록시 지원(환경변수 또는 설정파일), provider 목록은 별도 문서 제공
원본 →
AI 코딩 도구

Gorilla CLI: 목표를 영어로 말하면 실행할 명령 후보를 제안

"powers your command-line interactions with a user-centric tool" — 하려는 일을 평문으로 적으면 여러 LLM이 후보 명령을 만들어 화살표로 골라 실행. ~1500개 API(Kubernetes·AWS·GCP·Azure·GitHub 등). Apache-2.0.

  • 설치: pip install gorilla-cli, 실행은 gorilla <하려는 일>
  • Gorilla LLM·GPT-4·Claude 등 복수 LLM 응답을 모아 랭킹
  • 후보 명령을 화살표로 선택→Enter로 실행, 사용자 승인 없인 실행 안 함
  • stdout 출력은 절대 수집 안 함(쿼리·에러로그만 개선에 사용)
원본 →
AI 코딩 도구

QLoRA — 4비트 NF4 양자화+LoRA로 70B 모델을 단일 GPU에서 파인튜닝, VRAM 4x 절감(PEFT 표준)

QLoRA는 2026년 LLM 파인튜닝의 사실상 기본값이다. 기저 모델을 4비트 NF4 양자화로 동결하고, 0.1~1%의 LoRA 어댑터만 16비트로 학습. 70B 모델을 단일 A100 80GB에서 파인튜닝 가능(풀 파인튜닝 대비 4x VRAM 절감). 7B 모델은 RTX 4090(~6GB)에서 가능. PEFT 라이브러리로 LoraConfig(r=16, alpha=32, target_modules="all-linear") 몇 줄로 설정. merge_and_unload()로 프로덕션 배포 시 추론 오버헤드 제로. DPO/GRPO와 결합해 선호도 정렬도 가능.

  • 4비트 NF4: 70B 모델 단일 GPU 파인튜닝
  • PEFT 표준: LoraConfig 몇 줄로 설정
  • 추론 제로 오버헤드: merge_and_unload 병합
원본 →
AI 코딩 도구

Langfuse — 오픈소스(MIT) LLM 옵저버빌리티, OTel 기반·프롬프트 관리·평가·2,300+ 기업 사용

Langfuse는 가장 널리 채택된 오픈소스 LLM 엔지니어링 플랫폼이다. 트레이싱·프롬프트 관리·평가· 분석 대시보드를 단일 플랫폼으로 통합. OpenTelemetry 기반으로 80+ 프레임워크 통합, 프레임워크 종속 없음. 2,300+ 기업이 사용, 월 수십억 관측 처리. 2026년 1월 ClickHouse에 인수(MIT 유지). 셀프호스트 무료(ClickHouse+Postgres+Redis+S3 필요). Arize Phoenix(RAG 평가·드리프트 감지 특화)와 상호보완. LangSmith는 LangChain 생태계에 종속적.

  • OTel 기반: 80+ 프레임워크, 프레임워크 종속 없음
  • 2,300+ 기업: 월 수십억 관측 처리
  • MIT 오픈소스: 셀프호스트 무료, ClickHouse 인수
원본 →
AI 코딩 도구

벡터 DB 선택 2026 — Qdrant(성능)·Weaviate(하이브리드)·Pinecone(매니지드)·pgvector(50M 이하 기본)

2026년 벡터 DB는 용도별 선택이 핵심이다. pgvector(PostgreSQL 확장): 50M 벡터 이하에서 별도 DB 없이 가장 효율적. Pinecone: 제로 운영 매니지드, SOC2/HIPAA, 빠른 시작. Qdrant(Rust): 셀프호스트 성능 1위, p99 6~15ms, 고급 페이로드 필터링. Weaviate: 네이티브 BM25+벡터 하이브리드 검색 최강. Milvus/Zilliz: 10B+ 벡터 대규모 분산 배포. Chroma: 로컬 프로토타이핑. 대부분 프로덕션 RAG에서 매니지드 벡터 DB + 리랭커(Cohere/Voyage) 조합.

  • pgvector: 50M 이하 PostgreSQL 확장, 가장 효율적
  • Qdrant: Rust, p99 6~15ms, 필터링 성능 1위
  • Weaviate: 네이티브 BM25+벡터 하이브리드 최강
원본 →
AI 코딩 도구

NeMo Guardrails — NVIDIA LLM 안전장치 프레임워크, 5종 레일(입력·대화·검색·실행·출력)·Colang DSL(Apache-2.0)

NeMo Guardrails는 NVIDIA가 만든 LLM 안전장치 오픈소스 프레임워크다. 5종 레일: 입력(탈옥·프롬프트 인젝션), 대화(토픽 제한·흐름 제어), 검색(RAG 검증), 실행(도구 호출 게이팅), 출력(팩트체크· 할루시네이션·PII). Colang DSL로 멀티턴 대화 제약을 선언적으로 정의. Llama Guard 3·Nemotron Content Safety 모델 통합. LangChain·LangGraph 연동. 다른 가드레일 툴(Guardrails AI 등) 대비 대화 관리까지 포함하는 유일한 프레임워크.

  • 5종 레일: 입력·대화·검색·실행·출력 전 구간 커버
  • Colang DSL: 멀티턴 대화 제약 선언적 정의
  • 모델 통합: Llama Guard 3·Nemotron Content Safety
원본 →
AI 코딩 도구

Surya 2 — 650M VLM 단일 모델로 OCR·레이아웃·테이블 인식, 90+ 언어·RTX 5090에서 5페이지/초

Surya 2는 Datalab이 만든 650M 파라미터 VLM 기반 문서 OCR 올인원 툴킷이다. 단일 모델로 텍스트 인식(OCR)·레이아웃 분석·리딩 오더·테이블 인식을 처리. 90+ 언어 지원(한·중·일 포함). olmOCR-bench 83.3%(3B 미만 최고 점수). RTX 5090에서 5페이지/초 처리량. vllm(GPU) 또는 llama.cpp(CPU/Apple Silicon) 백엔드. Marker(같은 팀)는 Surya 위에 구축된 PDF→Markdown 변환기로 수식·테이블 특화.

  • 단일 VLM: OCR·레이아웃·테이블, 650M 파라미터
  • 90+ 언어: 한·중·일 포함, olmOCR-bench 83.3%
  • Marker 연계: PDF→Markdown, 수식·테이블 특화
원본 →
AI 코딩 도구

Ollama v0.30 — 로컬 LLM 런타임→AI 플랫폼 진화, ollama launch·클라우드 하이브리드·175k★(MIT)

Ollama는 2026년 v0.30 시리즈로 단순 모델 런너에서 AI 플랫폼으로 진화했다. 4,500+ 모델 라이브러리. ollama launch로 전체 에이전트 앱(Claude Code·Hermes Desktop) 원커맨드 배포. :cloud 접미사로 로컬/클라우드 모델을 동일 API로 라우팅. OpenAI+Anthropic 호환 API로 LangChain·LlamaIndex·Claude Code 등 에이전트 프레임워크와 무설정 연동. MLX 엔진으로 Apple Silicon 네이티브 가속. 웹 검색 도구 호출 지원. 175k+ GitHub 스타.

  • ollama launch: Claude Code·Hermes 원커맨드 배포
  • 하이브리드: :cloud로 로컬/클라우드 동일 API
  • 호환 API: OpenAI+Anthropic, 에이전트 무설정 연동
원본 →
AI 코딩 도구

AI 지식 그래프 자동 구축 — LLM이 추출·검증 엔진이 보장하는 'Propose-Verify' 아키텍처가 2026 표준

2026년 AI 지식 그래프 구축은 LLM이 엔티티·관계를 추출(propose)하고, SHACL/규칙 기반 엔진이 논리적 일관성을 검증(verify)하는 이중 구조가 표준이다. 온톨로지 엔지니어는 '빌더'에서 '거버너'로 역할 전환: AI가 자율 구축하되, 엔지니어가 제약·규칙·shape map을 정의. MyKG(문서→RDFS/OWL KG, 신뢰도 점수), HyDRA(Design-by-Contract 검증), OntoKG(Wikidata 규모 94모듈·34M 노드) 등 오픈소스 도구 등장. 기존 수동 큐레이션 대비 규모 확장성 획기적 개선.

  • Propose-Verify: LLM 추출 + 검증 엔진 보장
  • 거버너 패턴: 제약·규칙 정의 → AI 자율 구축
  • MyKG/HyDRA: RDFS/OWL, 신뢰도 점수, DbC 검증
원본 →
AI 코딩 도구

LTX-2 — 오픈소스 AI 비디오 생성, 네이티브 4K·동기화 오디오·12GB GPU에서 로컬 실행(Apache-2.0)

LTX-2는 Lightricks가 만든 오픈소스 AI 비디오 생성 모델이다. 네이티브 4K 해상도·동기화 오디오 생성·최대 32초 클립을 지원. 12GB VRAM GPU에서 로컬 추론 가능(차세대 모델 대비 18x 효율적). Apache-2.0 라이선스로 상업 사용 가능. ComfyUI 워크플로우 지원. Wan 2.6(Alibaba, MIT, 멀티샷· 오디오·1080p)과 HunyuanVideo 1.5(Tencent, 얼굴 품질)가 경쟁. 상업 서비스(Sora 2·Veo 3.1)에 근접하는 품질을 무료 로컬 실행으로 제공.

  • 4K+오디오: 네이티브 4K, 동기화 오디오 생성
  • 12GB GPU: 로컬 실행, 차세대 대비 18x 효율
  • Apache-2.0: 상업 사용 가능, ComfyUI 워크플로우
원본 →
AI 코딩 도구

LiteRT(구 TFLite) — Google 온디바이스 ML 표준, CompiledModel·Tensor SDK·Arm SME2

LiteRT는 Google이 TensorFlow Lite를 리브랜딩한 온디바이스 ML 프레임워크다. CompiledModel API가 Interpreter 대체: 자동 HW 선택·비동기 실행으로 NPU CPU 대비 100x·GPU 10x 가속. 2026년 Tensor ML SDK Beta가 LiteRT와 통합 — Pixel 10 Tensor TPU 경로, PyTorch/TFLite→LiteRT Torch 변환, Play Feature Delivery·AI Packs 배포, TPU 우선+CPU/GPU fallback. Arm SME2는 XNNPACK·KleidiAI로 자동 활용, INT8/FP16 양자화로 Android SME2 기기 14초→6.6초 사례. Qualcomm·MediaTek NPU 프로덕션, MediaPipe Tasks(LLM·비전) 조합. Stable Audio Open Small PyTorch→LiteRT 변환·Model Explorer 양자화 검증 사례 포함.

  • CompiledModel API: NPU 100x, GPU 10x, Qualcomm·MediaTek NPU
  • Tensor SDK Beta: Pixel TPU + LiteRT Torch + Play Feature Delivery
  • Arm SME2: XNNPACK·KleidiAI 자동 delegate, CPU fallback도 제품급
  • Stable Audio→LiteRT: DiT submodel 4x 축소, SME2 Android 14s→6.6s
원본 →
AI 코딩 도구

Open WebUI — 셀프호스팅 ChatGPT 대안, Ollama+OpenAI 통합·RAG·RBAC·142k★·Docker 원커맨드

Open WebUI는 142k+ GitHub 스타의 셀프호스팅 AI 채팅 플랫폼이다. Ollama(로컬 모델)와 OpenAI/ Anthropic 호환 API를 단일 인터페이스에서 통합. 내장 RAG(문서 기반 지식 베이스), 음성·비전·검색 지원. RBAC·SSO·LDAP으로 엔터프라이즈 팀 관리(ChatGPT Team $30+/월 기능을 무료 제공). Docker 원커맨드 배포(pip install open-webui도 가능). Python 파이프라인으로 확장. 주의: 커스텀 라이선스 (MIT 아님), 엄격한 OSS 필요 시 LibreChat 대안.

  • 통합 UI: Ollama(로컬) + OpenAI/Anthropic(클라우드)
  • 내장 RAG: 문서 기반 지식 베이스 구축
  • RBAC·SSO: 엔터프라이즈 팀 관리, Docker 원커맨드
원본 →
AI 코딩 도구

Copilot JetBrains 6월 업데이트 — 에이전트 선택·중간 개입·권한 상태를 한 화면에서 다루기

GitHub의 2026년 6월 22일 JetBrains Copilot 업데이트는 코딩 에이전트를 "채팅창 기능"이 아니라 운영 가능한 세션으로 다루게 만드는 변화다. 조직·엔터프라이즈 관리자가 배포한 custom agent를 JetBrains IDE 안의 agent picker에서 고르고, Copilot CLI 세션이 도는 중에도 메시지를 큐에 넣거나 현재 요청을 다음 도구 실행 뒤 방향 전환시킬 수 있다. Agent Debug 패널은 세션 활동 요약을 보여주고, Claude Code CLI를 agent provider로 붙이는 공개 프리뷰도 제공한다. 단, GitHub는 Claude provider가 현재 bypass permissions mode로 실행되어 파일 편집과 도구 호출이 자동 승인된다고 명시한다.

  • 조직/엔터프라이즈 custom agent를 JetBrains IDE의 agent picker에서 선택
  • 긴 Copilot CLI 실행 중 Add to Queue / Steer with Message / Stop and Send로 개입
  • Claude provider preview는 현재 bypass permissions mode라 권한 정책 확인이 선행
원본 →
AI 코딩 도구

yai: 평문으로 말하면 터미널 명령을 만들고 실행해 주는 AI 어시스턴트

yai(your AI)는 터미널용 AI 어시스턴트. OS·배포판·사용자명·셸·홈 디렉터리·선호 에디터를 인지한 채로, 일상 언어로 설명한 작업을 명령으로 빌드·실행하고 일반 질문에도 답한다.

  • 설치: curl -sS https://raw.githubusercontent.com/ekkinox/yai/main/install.sh | bash
  • 환경 인지 — OS/배포판, 사용자명, 셸, 홈 디렉터리, 선호 에디터를 컨텍스트로 사용
  • 일상 언어 → 명령 빌드·실행, 그리고 일반 질문 답변 모두 지원
  • OpenAI ChatGPT 기반, 첫 실행 시 OpenAI API 키 입력. License: MIT
원본 →
AI 코딩 도구

DeepSeek-V4 — 1.6T MoE(49B 활성), CSA+HCA로 KV캐시 90% 절감·1M 컨텍스트·FP4 MoE(MIT)

DeepSeek-V4는 2026-04 출시된 차세대 MoE 모델이다. V4-Pro(1.6T/49B 활성)와 V4-Flash(284B/13B 활성) 2종. CSA(Compressed Sparse Attention)+HCA(Heavily Compressed Attention) 하이브리드로 1M 토큰 컨텍스트에서 V3.2 대비 KV캐시 90% 절감, 추론 FLOPs 73% 감소. mHC(Manifold-Constrained Hyper-Connections)로 잔차 연결 개선, Muon 옵티마이저로 32T+ 토큰 학습 안정화. MoE 전문가 FP4+나머지 FP8 혼합 정밀도. Non-think/Think High/Think Max 3단계 추론 모드. GPQA Diamond 94.3%, SWE Verified 80.6%. GB200 NVL72에서 150+ tok/s/user.

  • CSA+HCA: KV캐시 90% 절감, FLOPs 73% 감소
  • 1.6T/49B 활성: MIT 라이선스 오픈웨이트
  • 3단계 추론: Non-think → Think High → Think Max
원본 →
AI 코딩 도구

Mistral Large 3 — EU 오픈웨이트 675B MoE(41B 활성), 네이티브 비전·256K·Apache-2.0

Mistral Large 3는 Mistral AI의 플래그십 멀티모달 MoE 모델이다. 675B 총 파라미터/41B 활성, 256K 컨텍스트, Apache-2.0 라이선스. 2.5B 비전 인코더가 아키텍처에 퓨전되어 이미지·PDF·차트·OCR을 1등 시민으로 처리. H200 3,000장으로 학습. 8xH100 단일 노드(FP8/NVFP4)에 배포 가능. Function calling·Structured Outputs·FIM·OCR·오디오 전사·TTS 엔드포인트 내장. 23개 언어 지원으로 비영어권 멀티링구얼 최강. GDPR 민감 엔터프라이즈에 적합한 유일한 EU 프론티어 오픈웨이트.

  • 675B/41B 활성: Apache-2.0, 8xH100 배포
  • 네이티브 비전: 2.5B 인코더 퓨전, PDF·차트·OCR
  • EU 프론티어: GDPR 적합, 멀티링구얼 최강
원본 →
AI 코딩 도구

Cursor Tab — 272K 컨텍스트+온라인 RL로 에디터 행동을 예측하는 AI 자동완성(일 4억 요청)

Cursor Tab은 단순 코드 삽입이 아닌 '다음 편집 행동'을 예측하는 AI 자동완성이다. 272K 토큰 컨텍스트 윈도우로 현재 파일·열린 탭·최근 편집·프로젝트 구조·린터 에러를 종합. 키 입력/커서 이동마다 Tab 모델이 실행되며 일 4억+ 요청 처리. 멀티라인 diff, 파일 간 점프, import 자동 추가 지원. 온라인 RL로 모델을 매일 수차례 업데이트: 사용자 수락/거절 데이터로 학습 → 제안 21% 감소, 수락률 28% 향상. 높은 예측 수락률의 제안만 표시해 노이즈 최소화.

  • 272K 컨텍스트: 파일·탭·편집·린터 종합
  • 온라인 RL: 일 4억 요청 → 수락률 28% 향상
  • 편집 예측: 삽입뿐 아니라 수정·삭제·파일 점프
원본 →
AI 코딩 도구

AI 모바일 테스트 2026 — Vision AI(Drizz·Quash)·에이전틱 LLM(QA Wolf)·디바이스 클라우드 3축

2026년 AI 모바일 테스트 도구는 3축으로 분류된다. Vision AI 네이티브(Drizz·Quash): 자연어로 테스트 의도 기술, 셀렉터 없이 비전 AI가 실행·자가 수정, 5% 플레이크율. 에이전틱 LLM(QA Wolf· Panto AI): LLM이 Playwright/Appium 코드를 생성, 결정론적 실행+코드 감사 가능. AI 강화 디바이스 클라우드(BrowserStack·Sauce Labs): 30K+ 실제 디바이스에 셀프힐링 로케이터 적용. PRD/Figma에서 자동 테스트 생성(Quash), 자연어 E2E(testRigor·Autonoma), CI/CD 파이프라인 통합이 공통 트렌드.

  • Vision AI: 셀렉터 없음, 5% 플레이크율
  • 에이전틱 LLM: 코드 생성+결정론적 실행
  • PRD→테스트: Quash가 요구사항에서 자동 생성
원본 →
AI 코딩 도구

LoRAX — 단일 GPU에서 수천 개 LoRA 어댑터를 동시 서빙, 이종 연속 배칭으로 처리량 유지

LoRAX(LoRA eXchange)는 Predibase의 오픈소스 추론 서버로, 하나의 베이스 모델 위에 수천 개 파인튜닝 LoRA 어댑터를 동적으로 로딩해 서빙한다. 핵심 기술 3가지: 동적 어댑터 로딩(요청마다 JIT 로드, 동시 요청 미차단), 이종 연속 배칭(서로 다른 어댑터 요청을 같은 배치에 패킹 → 어댑터 수 증가해도 처리량/지연 거의 일정), 티어드 가중치 캐싱(GPU↔CPU 비동기 프리페치). HuggingFace·S3·로컬 파일시스템에서 어댑터 로드. 요청별 어댑터 병합(Linear·TIES·DARE) 지원. 5개 어댑터 → 호스팅 비용 80% 절감.

  • 이종 배칭: 다른 어댑터 요청을 같은 배치에
  • JIT 로딩: 동시 요청 미차단, GPU↔CPU 캐싱
  • 어댑터 병합: 요청별 Linear·TIES·DARE 앙상블
원본 →
AI 코딩 도구

Speculative Decoding — 드래프트 모델이 미리 예측, 타겟 모델이 한 번에 검증해 추론 2~3배 가속(무손실)

Speculative Decoding은 작은 드래프트 모델(0.5~2B)이 3~5토큰을 투기적으로 생성하고, 큰 타겟 모델이 단일 포워드 패스로 병렬 검증하는 추론 최적화 기법이다. 출력 품질은 표준 자기회귀와 동일(무손실). 수락률 60~80%에서 배치 사이즈 1~4 기준 2~3배 속도 향상. 배치 32+에서는 효과 감소. EAGLE-3가 2026년 산업 표준: 타겟 모델 내부 레이어에 경량 예측 헤드를 부착해 별도 드래프트 모델 불필요. vLLM·SGLang·TensorRT-LLM에 프로덕션 구현. 코드 생성·요약 등 예측 가능한 태스크에 최적.

  • 무손실 2~3배: 드래프트 예측 → 타겟 병렬 검증
  • EAGLE-3: 별도 드래프트 모델 불필요, 산업 표준
  • 배치 1~4 최적: 고처리량 환경은 양자화 우선
원본 →
AI 코딩 도구

W&B 생태계 개요 — Weave·Registry·Sweeps·Artifacts·Reports·Launch를 한 UI로

Weights & Biases는 ML 실험 tracking부터 LLM 에이전트 eval·모델 CI/CD·원격 GPU 실행까지 한 워크스페이스로 묶는 MLOps/LLMOps 플랫폼이다. Weave는 @weave.op·start_session/start_turn/start_llm/start_tool로 에이전트 session→turn→LLM→tool 계층 trace와 weave.Evaluation 스코어링. Run+Artifacts는 dataset·model v1,v2… 버전·lineage — 프로덕션에서 :latest 금지, alias(staging/production) 또는 pinned version. Model Registry는 run.link_artifact() promote로 artifact CI/CD gate. Sweeps는 bayes/grid/random+Hyperband HP 탐색, wandb agent로 multi-GPU 병렬. Tables·Panels·Reports는 row-level 탐색·live metric dashboard·스냅샷 공유 문서. Launch는 Git/Docker Job Artifact→Queue→kubernetes|SageMaker|Vertex dispatch. Langfuse(OSS LLM trace)·MLflow(LF·셀프호스트)와 달리 ML+LLM eval+artifact lifecycle+compute dispatch 통합 SaaS.

  • Weave — @weave.op + Agents SDK(session/turn/llm/tool), Evaluation+스코어러
  • Artifacts+Registry — lineage·alias CI/CD gate, :latest race condition 금지
  • Sweeps+Launch — HP 탐색+원격 cluster dispatch, Reports/Tables/Panels 협업 UI
원본 →
AI 코딩 도구

Groq LPU — SRAM 기반 결정론적 추론 칩, Llama 70B 276 tok/s(GPU 대비 3~10배)·TTFT <1초

Groq의 LPU(Language Processing Unit)는 온칩 SRAM 기반 데이터플로우 아키텍처로, DRAM/HBM 병목을 제거해 결정론적 추론 속도를 달성한다. Artificial Analysis 독립 벤치마크(72시간 중앙값): Llama 3.3 70B 276 tok/s(Fireworks 83 tok/s의 3배), Llama 3.1 8B 840 tok/s. TTFT 0.6~0.9초. GroqCloud API 전용(클라우드 온리, 하드웨어 구매 불가). OpenAI 호환 API로 base_url 변경만으로 전환. 2025년 NVIDIA가 Groq 핵심 기술 인수 → Groq 3 LPU가 Vera Rubin 플랫폼의 추론 코프로세서로 통합. 실시간 음성·채팅 등 지연 민감 워크로드에 최적.

  • 276 tok/s: Llama 70B, GPU 대비 3~10배
  • SRAM 아키텍처: 결정론적 처리량, DRAM 병목 제거
  • API 전용: OpenAI 호환, base_url 변경만으로 전환
원본 →
AI 코딩 도구

ColPali — OCR 없이 문서 이미지를 직접 검색, VLM+ColBERT MaxSim으로 레이아웃·표·차트 포함 임베딩

ColPali는 VLM(PaliGemma-3B 등)으로 문서 페이지를 이미지 그대로 인덱싱하는 멀티모달 검색 기법이다. OCR·레이아웃 분석·텍스트 추출 파이프라인 불필요. 페이지를 이미지 패치로 분할 → 각 패치를 128차원 멀티벡터 임베딩 → ColBERT late-interaction(MaxSim)으로 쿼리 토큰과 패치 간 세밀한 유사도 계산. ViDoRe 벤치마크에서 텍스트 기반 검색+OCR 파이프라인 상회. Qdrant·Milvus·Vespa 등 벡터DB와 통합. 표·차트·수식·레이아웃이 많은 문서(재무·법률·의료)에서 기존 RAG 대비 검색 품질 획기적 개선.

  • OCR 불필요: 페이지 이미지 직접 임베딩
  • ColBERT MaxSim: 패치↔쿼리 토큰 세밀 매칭
  • ViDoRe 1위: 기존 텍스트+OCR 파이프라인 상회
원본 →
AI 코딩 도구

SambaNova Cloud — RDU 기반 초고속 추론, 무료 영구 티어(20RPD·200K TPD)·OpenAI 호환 API

SambaNova Cloud는 자체 설계 RDU(Reconfigurable Dataflow Unit) 칩 기반 추론 클라우드 서비스다. 무료 영구 티어: 신용카드 불필요, 20 RPM/20 RPD/200K TPD. 신규 계정 $5 크레딧(3개월). DeepSeek V3.1·Llama 3.3 70B·gpt-oss-120b·Gemma 4 31B 등 지원. Developer 티어: 결제 연결 시 RPM 60/RPD 12,000/일 20M 토큰으로 확장. OpenAI SDK 호환(base_url: api.sambanova.ai/v1). Groq와 함께 '전용 추론 칩' 진영의 양대 축. 프로토타이핑·모델 평가·속도 벤치마킹에 최적.

  • 무료 영구: 20RPD, 200K TPD, 신용카드 불필요
  • RDU 칩: 전용 추론 하드웨어, 초고속 토큰 생성
  • OpenAI 호환: base_url 변경만으로 SDK 전환
원본 →
AI 코딩 도구

Cohere Command A — 엔터프라이즈 RAG 특화 111B, 할루시네이션 23% 적음·Embed+Rerank 통합 스택

Cohere Command A는 111B 파라미터 엔터프라이즈 LLM으로, RAG·도구 사용·멀티스텝 에이전트에 최적화됐다. 256K 컨텍스트, 23개 언어 지원. A100/H100 2장에 배포 가능(경쟁 모델은 8장 필요). 네이티브 인용 생성으로 그라운딩 정확도 91.3%(GPT-4o 82.4%), 할루시네이션 23% 감소. Embed v3+ Rerank 3.5와 통합 스택(단일 API·SDK·과금)으로 RAG 파이프라인 구축. 일반 벤치마크(MMLU 82.1) 에서는 GPT-4o(88.7)에 뒤지나, RAG 정확도/비용 비율은 2026년 최고. Apache-2.0 웨이트 공개.

  • RAG 91.3%: GPT-4o 82.4% 대비 할루시네이션 23%↓
  • 2 GPU 배포: A100/H100 2장, 처리량 150% 향상
  • 통합 스택: Embed v3 + Rerank 3.5, 단일 API
원본 →
AI 코딩 도구

kubectl-ai: 자연어 의도를 정확한 쿠버네티스 작업으로 옮겨주는 AI 인터페이스

kubectl-ai는 사용자의 의도를 정밀한 Kubernetes 작업으로 번역하는 지능형 인터페이스. 대화형 채팅은 이전 상호작용의 컨텍스트를 유지하고, 비대화형 작업 모드와 stdin 파이핑도 지원한다.

  • 설치: curl -sSL https://raw.githubusercontent.com/GoogleCloudPlatform/kubectl-ai/main/install.sh | bash
  • 세션 영속 — 시작/목록/재개/삭제, 내장 도구로 kubectl·bash 사용
  • MCP Client/Server 모드 지원, kubectl 플러그인으로 'kubectl ai' 호출 가능
  • gemini·vertexai·azopenai·openai·bedrock 및 로컬 ollama·llama.cpp 지원. License: Apache-2.0
원본 →
AI 코딩 도구

GPTScript: 자연어 프롬프트로 LLM이 시스템·앱·파일과 상호작용하게 하는 프레임워크

GPTScript는 LLM이 로컬 실행파일, OpenAPI 스키마 앱, SDK, RAG 기반 솔루션 등 다양한 시스템과 상호작용하도록 프롬프트로 통합하는 프레임워크. 자연어 스크립트로 작업 흐름을 묶는다.

  • 설치: brew install gptscript 또는 curl https://get.gptscript.ai/install.sh | sh (Windows는 winget)
  • 주요 사용처 — 로컬 CLI와 대화, OpenAPI 엔드포인트와 대화
  • 로컬 파일·디렉터리와 대화, 자동화된 워크플로 실행
  • OpenAI API 키 필요. License: Apache-2.0 (Acorn Labs, Inc.)
원본 →
AI 코딩 도구

Elia: 터미널 안에서 키보드만으로 LLM과 대화하는 TUI 클라이언트

Elia는 전적으로 터미널에서 동작하는 LLM 대화 앱으로, 키보드 중심으로 설계됐다. 대화를 로컬 SQLite DB에 저장하고 다양한 모델을 한 자리에서 다룬다.

  • 설치: pipx install --python 3.11 elia-chat
  • 대화를 로컬 SQLite DB에 저장 — 오프라인 보관·재열람
  • YAML 파일로 커스텀 테마, import 명령으로 ChatGPT 대화 가져오기
  • Claude·ChatGPT·Gemini·Groq 및 로컬 ollama·LocalAI 등 다양한 모델 지원. License: Apache-2.0
원본 →
AI 코딩 도구

Butterfish: 셸을 대체하지 않고 감싸 AI 프롬프트를 더하는 "AI 셸"

Butterfish는 명령줄에서 일하는 사람을 위한 도구로, bash·zsh를 대체하지 않고 감싸(wrap) OpenAI 프롬프트를 더한다. 대문자로 명령을 시작하면 LLM에게 질문이 되고, Tab으로 자동완성한다.

  • 설치: brew install bakks/bakks/butterfish (또는 go install .../cmd/butterfish@latest)
  • Agent Mode(!) — 목표를 주면 명령을 실행하며 달성 시도, Unsafe(!!)는 확인 없이 실행
  • Action Mode(@) — 정확히 한 개의 셸 명령 시도, @@는 자동 실행
  • OpenAI 호환 API의 로컬 모델도 --base-url로 사용. License: MIT (Peter Bakkum)
원본 →
AI 코딩 도구

open-codex: 터미널에서 도는 경량 코딩 에이전트 — OpenAI Codex CLI 포크

open-codex는 터미널에서 동작하는 가벼운 코딩 에이전트로, OpenAI Codex CLI를 포크해 지원 모델을 넓히고 설치 방식을 바꿨다. API 키만 있으면 별도 설정 없이 바로 쓴다.

  • 설치: npm i -g open-codex
  • OpenAI Codex CLI 포크 — 여러 AI provider 지원으로 확장
  • OpenAI·Gemini·OpenRouter·Ollama provider 지원
  • Responses API 대신 Chat Completion API 사용, Zero setup. License: Apache-2.0
원본 →
AI 코딩 도구

agentmemory: 코딩 에이전트 기억을 MCP 서버로 분리하기

agentmemory는 Claude Code, Codex CLI, Copilot CLI, Cursor, Gemini CLI, OpenCode 같은 코딩 에이전트가 공유할 수 있는 지속 메모리 서버다. 같은 런에서 GitHub 23,739★, 1,952 forks, Apache-2.0, 최신 릴리스 v0.9.27(2026-06-07)을 확인했다. README 기준 핵심 구성은 MCP 서버, REST API, 에이전트별 hook/skill 연결, 53개 MCP 도구, 12개 자동 hook이다. 실무 교훈은 기억을 프롬프트 맨 위에 계속 붙이는 방식이 아니라, 검색·신뢰도·생명주기·지식 그래프를 가진 별도 도구 계층으로 빼야 반복 설명과 컨텍스트 낭비를 줄일 수 있다는 점이다.

  • 같은 런 검증: 23,739★, 1,952 forks, Apache-2.0, v0.9.27(2026-06-07)
  • Claude Code·Codex CLI·Copilot CLI·Cursor·Gemini CLI·OpenCode 등 MCP/훅/REST로 연결
  • 교훈: 장기 기억은 프롬프트가 아니라 검색 가능한 도구 계층으로 설계
원본 →
AI 코딩 도구

MCP Toolbox for Databases: 에이전트 DB 접근을 즉흥 SQL에서 구조화 도구로 바꾸기

Google의 MCP Toolbox for Databases는 AI 에이전트·IDE·애플리케이션을 엔터프라이즈 데이터베이스에 연결하는 오픈소스 MCP 서버다. 같은 런에서 GitHub 15,685★, 1,612 forks, Apache-2.0, 최신 릴리스 v1.5.0(2026-06-18)을 확인했다. 빌드 타임에는 Gemini CLI, Google Antigravity, Claude Code, Codex 같은 MCP 클라이언트가 list_tables·execute_sql 같은 prebuilt 도구로 스키마를 탐색하고, 런타임에는 tools.yaml로 제한된 쿼리·시맨틱 검색·NL2SQL 도구를 정의한다. 핵심은 "에이전트에게 DB 접속 문자열을 주기"가 아니라, 권한·쿼리 형태·관측성을 가진 데이터 접근 API를 만들어 주는 것이다.

  • 같은 런 검증: 15,685★, 1,612 forks, Apache-2.0, v1.5.0(2026-06-18)
  • prebuilt 도구로 스키마 탐색·SQL 실행, custom tools로 제한된 프로덕션 도구 정의
  • 지원 범위: AlloyDB·BigQuery·Cloud SQL·Spanner·PostgreSQL·MySQL·Oracle·MongoDB·Redis 등
원본 →
AI 코딩 도구

MobileWorld: MCP까지 포함한 모바일 에이전트 벤치마크

MobileWorld는 AndroidWorld 이후 모바일 에이전트 평가가 더 어려워져야 하는 이유를 보여 주는 ACL 2026 벤치마크다. arXiv v3는 201개 태스크, 20개 앱, 평균 27.8 step 장기 작업, 멀티앱 태스크 62.2%, agent-user interaction, MCP-augmented task를 제시한다. GitHub는 같은 런에서 Apache-2.0, 224★, 2026-06-23 push를 확인했다. 환경은 Docker-in-Docker 안에 rooted AVD, Mattermost·Mastodon·Mall4Uni 같은 오픈소스 앱 백엔드, API 서버를 넣고, DB 검증·로컬 저장소 검사·앱 콜백으로 성공 여부를 판정한다. 교훈은 모바일 에이전트 성능을 단일 앱 클릭 성공률로 재지 말고, 사용자와 대화하고 MCP 도구를 섞는 장기·교차앱 흐름으로 검증해야 한다는 점이다.

  • 벤치마크: 201 tasks / 20 apps / 평균 27.8 step / 멀티앱 62.2%
  • 새 축: agent-user interaction + MCP-augmented tasks
  • 검증: 컨테이너 AVD, 자체 앱 백엔드, DB·저장소·콜백 기반 deterministic evaluation
원본 →
AI 코딩 도구

Codex Record & Replay: 손으로 보여 준 반복 업무를 재사용 스킬로 바꾸기

OpenAI Codex의 Record & Replay는 말로 설명하기 애매한 반복 업무를 한 번 시연한 뒤, 다시 쓸 수 있는 스킬로 포장하는 macOS 기능이다. 2026-06-18 Codex changelog에 추가됐고, 초기 제공 지역은 EEA·영국·스위스를 제외하며 Computer Use가 켜져 있어야 한다. 사용자는 지출 처리, 이슈 생성, 리포트 다운로드처럼 선호도와 입력값이 섞인 워크플로를 짧게 녹화하고, Codex는 필요한 입력, 실행 단계, 검증 방법을 담은 skill 초안을 만든다. 재실행 때는 새 날짜·파일·이슈 제목처럼 달라지는 값만 주고 Computer Use, 브라우저 액션, 설치된 플러그인을 조합해 흐름을 반복한다. 실무 교훈은 "자동화 스크립트를 먼저 짜기"가 아니라, 안정적인 성공 기준이 있는 수작업을 시연-스킬-검증 루프로 작게 캡처한 뒤 팀에 배포할 것은 별도 플러그인으로 승격하라는 점이다.

  • 공식 changelog: 2026-06-18 Codex app 26.616에서 Record & Replay 추가
  • 조건: macOS, Computer Use enabled, 초기 제공 지역은 EEA·UK·Switzerland 제외
  • 짧고 완결된 시연 → 입력·단계·검증을 담은 reusable skill 초안 생성
원본 →
AI 코딩 도구

Codex App Server: Codex를 제품 안 리치 클라이언트로 붙이는 프로토콜

Codex App Server는 Codex VS Code 확장 같은 리치 클라이언트를 구동하는 공식 인터페이스다. OpenAI 문서는 제품 안에 Codex를 깊게 붙이고 싶을 때 인증, 대화 기록, 승인, 스트리밍 에이전트 이벤트를 다루는 경로로 app-server를 설명한다. 같은 런에서 openai/codex는 92,966★, 13,757 forks, Apache-2.0, 2026-06-23 push를 확인했고, app-server 디렉터리도 같은 날 커밋이 있었다. 프로토콜은 MCP처럼 JSON-RPC 2.0 기반 양방향 통신을 쓰며, 기본 stdio(JSONL), 실험적 WebSocket, Unix socket transport를 지원한다. 중요한 경계는 CI나 백그라운드 자동화에는 Codex SDK를 쓰고, 사용자가 보는 대화형 제품 통합에는 app-server를 쓰라는 점이다.

  • 공식 용도: 인증·대화 기록·승인·streamed agent events가 필요한 제품 내 Codex 통합
  • 프로토콜: JSON-RPC 2.0, stdio 기본, WebSocket은 experimental/unsupported, Unix socket 지원
  • 같은 런 검증: openai/codex 92,966★, 13,757 forks, Apache-2.0, app-server 2026-06-23 커밋
원본 →
AI 코딩 도구

Assistants API 종료 D-64: Responses API 이주는 모델 교체가 아니라 상태 모델 교체

OpenAI 공식 migration guide는 Assistants API가 Responses API와 기능 동등성에 도달한 뒤 deprecated 되었고, 2026-08-26에 종료된다고 명시한다. 이주는 단순히 엔드포인트 이름을 바꾸는 작업이 아니다. Assistants는 Assistant/Thread/Run/Run step 중심이었지만, 새 구조는 Prompt/Conversation/Response/Item으로 바뀐다. 도구 호출 루프도 더 명시적으로 관리하고, Responses API 쪽에서 deep research, MCP, computer use 같은 새 기능을 받는다. 따라서 마이그레이션 체크리스트는 "호출 API 교체"보다 먼저 상태 저장 위치, 대화 객체 수명, tool call 재시도, 파일 검색/검색 도구 사용법, 기존 thread 데이터 전환 여부를 분리해 보는 것이 안전하다.

  • 공식 종료일: Assistants API shutdown 2026-08-26
  • 개념 매핑: Assistants→Prompts, Threads→Conversations, Runs→Responses, Run steps→Items
  • 실무 포인트: tool loop·conversation state·file/search 도구를 별도 마이그레이션 항목으로 분리
원본 →
AI 코딩 도구

agent-browser — 브라우저 자동화를 AI 에이전트용 CLI로 얇게 빼기

Vercel Labs의 agent-browser는 AI 에이전트가 브라우저를 조작하기 위한 Rust 네이티브 CLI다. 2026-06-24 같은 런에서 GitHub 36,900★, 2,348 forks, Apache-2.0, 최신 릴리스 v0.29.0 (2026-06-21)을 확인했다. README 기준 핵심은 Playwright 스크립트를 매번 새로 짜는 것이 아니라 `snapshot`으로 접근성 트리와 `@e2` 같은 ref를 받고, `click`·`fill`·`get`·`screenshot`·`batch` 명령을 작은 도구 호출처럼 조합하는 것이다. Chrome for Testing을 내려받아 쓰고, 기존 Chrome, Brave, Playwright, Puppeteer 설치도 감지한다. 브라우저 상태 저장, 네트워크 route/HAR, 콘솔·에러, visual diff, React tree/Web Vitals까지 CLI 표면으로 노출하므로, 에이전트 브라우저 QA는 "비전으로 화면을 맞히기"보다 접근성 snapshot, 안정 ref, 재현 가능한 batch, 필요한 순간의 증거 캡처를 우선 설계하는 편이 낫다.

  • 같은 런 검증: 36,900★, 2,348 forks, Apache-2.0, v0.29.0(2026-06-21)
  • AI 친화 조작: accessibility snapshot refs + click/fill/get/screenshot + batch 실행
  • 검증 표면: state, network route/HAR, console/errors, visual diff, React tree, Web Vitals
원본 →
AI 코딩 도구

DeepMind AI Control Roadmap: 에이전트를 '잠재적 내부자 위협'으로 다루는 보안 설계

Google DeepMind가 2026-06-18 공개한 AI Control Roadmap은 강력한 에이전트가 완벽히 정렬되어 있다고 가정하지 않고, 내부 시스템에 접근한 잠재적 insider threat처럼 다루는 방어 심층 전략이다. 전통 보안(샌드박스·엔드포인트 보안·프롬프트 인젝션 저항) 위에 alignment를 1차 방어로 두되, 실패할 수 있다고 보고 supervisor AI가 에이전트의 reasoning·action·plan을 감시한다. 위험도는 detection evasion 능력(D1-D4)과 attack execution 능력(R1-R3)에 맞춰 올리고, 저위험 작업은 사후 transcript 리뷰·알림으로, 고위험 작업은 실시간 차단·접근 제한·종료 인프라로 대응한다. 실무 교훈은 에이전트 권한을 사람 계정과 똑같이 복사하지 말고, coverage·recall·time-to-response로 감시 품질을 재며 점진적으로 권한을 열어야 한다는 점이다.

  • 공식 발표: 2026-06-18 AI Control Roadmap, 내부 에이전트를 잠재적 insider threat로 threat-modeling
  • 통제 축: supervisor AI monitoring, asynchronous alert, synchronous block/response, capability-based escalation
  • 운영 지표: coverage·recall·time-to-response로 에이전트 보안 통제가 실제로 작동하는지 측정
원본 →
AI 코딩 도구

Agent Finder/ARD — Copilot·Gemini Enterprise runtime discovery, context bloat 방지

Agentic Resource Discovery(ARD·Apache-2.0·Microsoft+Google+GitHub+HF+GoDaddy·2026-06-17) — domain-hosted catalogs + federated registries로 MCP·skills·agents·tools를 publish/index/discover. GitHub Agent Finder — Copilot이 task description으로 registry 검색→ranked matches on-demand inject, auto-install 없음·managed settings gate. Google Gemini Enterprise Agent Registry — hosted search/onboarding, native ARD months内. 문제 정의: single client가 explicit wiring한 수십 도구 vs ecosystem 수십만 리소스 — orders-of-magnitude gap. vs MCP Tool Search(Claude preload) ·pre-wired MCP list — ARD=runtime catalog search across registries.

  • ARD spec — catalogs on org domain + registry index + client discovery handoff
  • GitHub Agent Finder — public 293 resources or private enterprise registry, no silent install
  • Google Agent Registry — Gemini Enterprise ARD backing, federated discovery same model
원본 →
AI 코딩 도구

Reusable prompts 종료: 프롬프트도 코드 리뷰·테스트 대상이 된다

OpenAI는 2026-06-03 reusable prompt objects의 deprecation을 공지했고, `v1/prompts` API와 reusable prompt objects를 2026-11-30에 종료할 예정이라고 문서화했다. 최신 prompt engineering 가이드는 새 작업에서 production prompt를 대시보드 객체로 저장하지 말고 애플리케이션 코드 안의 작은 prompt builder로 옮기라고 권한다. 동적 값은 typed function argument나 schema로 받고, 생성된 `instructions`와 `input`을 Responses API에 직접 넘기며, 변경 전에는 대표 fixture, 테스트, evaluation check를 붙이라는 흐름이다. 실무 교훈은 "프롬프트 관리 UI"에 의존하지 말고 프롬프트를 코드 변경처럼 diff, 리뷰, 테스트, feature flag, 배포 파이프라인으로 다루라는 점이다.

  • 공식 일정: 2026-06-03 deprecation 공지, 2026-11-30 `v1/prompts`/reusable prompt objects 종료 예정
  • 이주 방향: prompt content를 application code로 옮기고 Responses API에 instructions/input으로 전달
  • 운영 원칙: typed inputs, fixtures, tests, eval checks, staged rollout로 프롬프트 변경을 관리
원본 →
AI 코딩 도구

Codex rollout token budgets: 에이전트 루프를 토큰 예산으로 강제 중단하기

OpenAI Codex CLI 0.142.0은 "rollout token budget"을 추가해 여러 agent thread·sub-agent usage가 같은 shared ledger를 소비하고, 남은 예산을 알려 주며, exhausted 시 다음 usage-accounting boundary에서 TurnAborted로 cleanly 중단한다. app-server는 multi-agent delegation을 thread/turn별 disabled·explicit-request-only·proactive로 제어하고 indexed web-search mode를 추가했다. 0.142.2(2026-06-25)는 MCP tools에 tool search by default — 지원 모델·provider에서 전체 tool schema dump 대신 discovery 검색으로 context 절약·구형 모델 호환 fallback. 개발자에게 중요한 점은 에이전트 자동화를 "열심히 돌리기"가 아니라 예산·위임·MCP tool surface·웹 접근 경계를 먼저 정한 뒤 실행하는 운영 문제로 본다는 것이다.

  • 0.142.0: shared ledger token budget·sub-agent draw·TurnAborted clean abort
  • app-server: multi-agent delegation disabled·explicit-request-only·proactive
  • 0.142.2: MCP tool search default — schema dump→searchable discovery
원본 →
AI 코딩 도구

Claude Projects + Artifacts — 지속 워크스페이스와 인터랙티브 출력 패널

Claude Projects는 관련 대화·커스텀 지침·참조 문서를 한 공간에 모아 세션 간 컨텍스트를 유지하는 워크스페이스다. Pro/Team 무제한, Free 5개. 200K 컨텍스트(Enterprise 500K), RAG 방식으로 관련 섹션만 주입, Project-scoped memory로 채팅 간 학습 유지. Claude Artifacts는 HTML·React·SVG·Mermaid 등 독립 콘텐츠를 대화 옆 패널에 렌더링 — 2026년 Live Artifacts(MCP로 Google Sheets·Linear 실시간 연동), Pro+ 20MB persistent storage, 공개 링크 공유. 역할 분리: Projects=지속 컨텍스트 방, Artifacts=작업 결과물, Skills=반복 절차.

  • Projects: 200K ctx, RAG 주입, Project-scoped memory, Team 공유
  • Artifacts: Live MCP 연동, 20MB persistent storage, 공개 링크
  • Skills·Projects·Artifacts 3축 역할 분리 — 방·결과물·플레이북
원본 →
AI 코딩 도구

Llama 4 — Scout(10M ctx)·Maverick(128E MoE)·Behemoth(2T teacher), 네이티브 멀티모달 오픈웨이트

Meta Llama 4(2025-04-05)는 네이티브 멀티모달 MoE 패밀리다. Scout(109B total, 17B active, 16 experts)는 10M 토큰 컨텍스트·단일 H100(Int4) 배포. Maverick(400B total, 128 experts)는 1M ctx·GPT-4o급 범용·코딩. Behemoth(2T total, 288B active)는 STEM 벤치에서 GPT-4.5·Claude 3.7·Gemini 2.0 Pro 상회하나 아직 미공개(teacher distillation용). Early fusion으로 텍스트·이미지 동시 처리, 12개 언어 fine-tune, Hugging Face·llama.com 배포.

  • Scout 10M ctx: 단일 GPU 4-bit 양자화, 초장문 문서 처리
  • Maverick 128E MoE: 17B active로 400B total, BF16/FP8 배포
  • Behemoth: GPT-4.5 상회 STEM teacher, Scout/Maverick distillation
원본 →
AI 코딩 도구

Phi-4-mini — 3.8B·128K·함수호출, Microsoft SLM 패밀리의 엣지·비용 효율 플래그십

Microsoft Phi-4-mini-instruct(2025-02)는 3.8B dense decoder-only Transformer로 GQA·200K vocab·128K ctx·함수 호출을 지원한다. Phi-3.5-mini 대비 추론·수학·코딩·다국어(23개) 향상. Azure Foundry $0.000075/1K input, Ollama·Hugging Face·NVIDIA API Catalog 배포. Phi-4-multimodal(5.6B, 음성·비전·텍스트)과 Phi-4-mini-reasoning(2025-04, 수학·논리 특화)이 형제 모델. iPhone에서 27~55 tok/s 실시간 추론 가능한 엣지 LLM 리더보드 상위권.

  • 3.8B·128K ctx: A100 512 GPU 21일 학습, DPO+SFT
  • 함수 호출: 에이전트·도구 연동에 SLM로 충분한 성능
  • Phi-4-mini-reasoning: DeepSeek-R1 distillation, MATH 벤치 특화
원본 →
AI 코딩 도구

Whisper large-v3-turbo — 디코더 32→4층·809M, GPU 8배·Apple Silicon 2배 빠른 ASR

OpenAI Whisper large-v3-turbo(2024-09)는 large-v3의 디코더를 32층→4층으로 축소해 1.55B→809M 파라미터, VRAM ~6GB→~3.5GB. Distil-Whisper 영감, 번역 데이터 제외하고 전사 데이터로 2 epoch fine-tune. LibriSpeech·10시간 혼합 오디오에서 large-v3 대비 WER 1~2%p 차이, GPU ~8x·Apple Silicon ~2x 속도. CLI 기본 모델이 turbo로 변경(20240930+). `--task translate` 미지원(원어 반환). faster-whisper·Hugging Face 배포.

  • 809M·4-layer decoder: large-v2급 정확도, large-v3 대비 8x GPU
  • 전사 전용: 번역 task 미지원, multilingual ASR 90+ 언어
  • CLI 기본값: whisper audio.wav → turbo 자동 사용
원본 →
AI 코딩 도구

KAN — Kolmogorov-Arnold Networks, MLP 대신 엣지에 학습 가능 활성함수(ICLR 2025 Oral)

KAN(Liu et al., ICLR 2025 Oral)은 MLP의 고정 노드 활성함수 대신 엣지(가중치)에 스플라인으로 파라미터화된 1D 함수를 배치한다. Kolmogorov-Arnold 표현정리 영감, 동일 정확도에 더 작은 KAN·더 빠른 neural scaling law. 과학 ML·함수 근사·PDE·기호 회귀에서 MLP 대비 우수, 해석 가능성(시각화·인간 협업). 단점: 학습 느림, PolyKAN·G-KAN 등 하드웨어 가속 연구 중. MLP 레이어 drop-in 대체로 CNN·RNN·Transformer에 적용 가능.

  • 엣지 활성함수: 선형 weight matrix 없음, 스플라인 1D 함수
  • ICLR 2025 Oral: AI+Science에서 물리·수학 법칙 재발견 사례
  • 2026 연구: CKAN(Conv+KAN), PDE·시계열·continual learning 확장
원본 →
AI 코딩 도구

Mixture of Agents(MoA) — 다층 LLM 협업으로 GPT-4o 능가, AlpacaEval 2.0 65.1%(ICLR 2025)

MoA(Wang et al., ICLR 2025)는 추론 시 여러 LLM을 계층(layer)으로 배치해 proposer가 후보 생성→aggregator가 통합하는 프레임워크다. 파인튜닝 없이 프롬프트만으로 동작. 오픈소스만으로 AlpacaEval 2.0 65.1%(GPT-4o 57.5%), Arena-Hard·MT-Bench·FLASK SOTA. MoA-Lite(2층·Qwen-72B aggregator)도 GPT-4o 상회. 2025 후속: Self-MoA(단일 top 모델 다중 샘플이 mixed MoA보다 6.6%p 우수), RMoA(residual+다양성 선택), Attention-MoA(에이전트 간 semantic attention).

  • 3층 6-agent: Qwen-110B aggregator + 이종 proposer 혼합
  • Self-MoA: 단일 강력 모델 다중 출력이 이종 혼합보다 나을 수 있음
  • RMoA: ResNet식 residual로 cross-layer 정보 보존, ACL 2025
원본 →
AI 코딩 도구

RWKV-7 Goose — O(n) 선형시간·KV캐시 없는 RNN, Dynamic State Evolution(ICML 2025)

RWKV-7 "Goose"(2025, ICML)는 generalized delta rule로 벡터값 게이팅·in-context learning rate를 도입한 100% RNN LLM 아키텍처이다. O(n) 시간·O(d²) 상수 메모리(KV캐시 불필요), Transformer급 병렬 학습 가능. Mamba-2(TC0)와 달리 TC0 초월 expressiveness, 3B에서 MMLU 61.2(vs LLaMA-3.2 3B 63.4). 100K+ ctx·엣지 추론·다국어에 강점. BlinkDL/RWKV-LM GitHub, ChatRWKV 데모. v4→v7 진화: WKV→multi-head→data-dependent decay→dynamic state evolution.

  • KV캐시 제로: 토큰당 일정 메모리, 무한 ctx_len 이론적 가능
  • Mamba-2 대비: 벡터값 decay로 채널별 선택적 상태 업데이트
  • Pile 3B PPL 9.6: Transformer 9.8·RWKV-6 9.9 대비 개선
원본 →
AI 코딩 도구

Differential Transformer — 두 softmax attention 차분으로 노이즈 제거, Microsoft ICLR 2025

Microsoft Diff Transformer(ICLR 2025)는 Q/K를 두 그룹으로 나눠 두 softmax attention map의 차분을 attention score로 사용한다. 공통모드 노이즈 상쇄(노이즈 캔슬링 헤드폰 유사), sparse attention 유도. 장문 컨텍스트·핵심 정보 검색·할루시네이션 완화·in-context learning 순열 강건성 향상. FlashAttention 호환. Diff V2(2025): GQA 그룹 내 query head 2배, 커스텀 커널 불필요, 디코딩 속도 baseline Transformer 동급, attention sink 제거.

  • Differential attention: Attn = softmax(Q1K1) − λ·softmax(Q2K2)
  • 할루시네이션↓: irrelevant context에 대한 over-attention 완화
  • Diff V2: KV head 불변, 디코딩 memory-bound에서 속도 parity
원본 →
AI 코딩 도구

EU AI Act 2026 시행 — 8/2 투명성·GPAI 벌금, 12/27 고위험(Annex III) 의무

EU AI Act는 2024-08-01 발효, 단계적 적용 중이다. 2025-02-02 금지 관행(AI literacy), 2025-08-02 GPAI 모델 의무(문서화·저작권) 이미 시행. 2026-08-02: Article 50 투명성(합성 콘텐츠 라벨링), GPAI 벌금 집행, AI Sandbox 의무. Digital Omnibus(2026-06 EP 승인): 고위험 Annex III는 2027-12-02, Annex I 제품 내장 AI는 2028-08-02로 연기. 2026-12-02: 기존 GenAI 워터마킹·nudifier 앱 금지. 최대 벌금 GPAI 3%/매출, 고위험 35M€ 또는 7%.

  • 2026-08-02: Article 50 투명성 + EU AI Office GPAI 벌금 권한
  • 2027-12-02: 고위험(채용·교육·생체인식 등 Annex III) 의무
  • Omnibus: 워터마킹 2026-12-02, nudifier·CSAM 생성 AI 금지
원본 →
AI 코딩 도구

Snyk vs Semgrep — AI 코드 보안 2026, DeepCode AI(SAST+SCA) vs YAML 커스텀 규칙(SAST)

2026년 AI 코드 보안의 대표 대결. Snyk Code(DeepCode AI): ML 기반 opaque 엔진, SCA+SAST+컨테이너+IaC 통합, IDE 실시간 autofix(MTTR 84%↓), $59/dev/mo. Semgrep: YAML 패턴 규칙(감사·포크 가능), 10~30초 CI 스캔, 커스텀 규칙 업계 최고, CE 오픈소스 무료, $40/dev/mo. EASE 2024: Semgrep CE가 Snyk Code detection rate 우위. 실무 패턴: Snyk SCA + Semgrep SAST 조합이 Snyk Enterprise 단독보다 저렴. AI 생성 코드 검출: Snyk 92/100, Semgrep 87/100.

  • Snyk: DeepCode AI ML, autofix 85% 정확, SCA Forrester Leader
  • Semgrep: YAML 규칙 투명, reachability SCA, 20+ 언어
  • 조합 패턴: Snyk SCA + Semgrep 커스텀 SAST = 비용·커버리지 최적
원본 →
AI 코딩 도구

Anthropic RSP v3.0 — Frontier Safety Roadmap·Risk Report, ASL-3/4 임계값(2026-02-24)

Anthropic Responsible Scaling Policy v3.0(2026-02-24 발효)은 재앙적 AI 위험 관리 자발적 프레임워크의 전면 개정이다. Frontier Safety Roadmap(보안·정렬·가드레일·정책 목표), 3~6개월마다 Risk Report(능력·위협모델·완화조치). Capability Threshold: CBRN 개발 uplift, AI R&D 2단계(입문 연구 자동화·scaling 가속). ASL-2(현행 Sonnet/Haiku)→ASL-3(Opus 4, Constitutional Classifiers++)→ASL-4(임계값 초과 시, 사전 공개 약속). v2 대비 일방적 pause 약속 축소, 투명성·자기보고 중심으로 전환.

  • Risk Report: 3~6개월 주기, system card 초월 종합 위험 평가
  • CBRN threshold: 중간 자원 국가 프로그램 uplift 가능 수준
  • ASL-3: hardened weight storage, Constitutional Classifiers++ 배포
원본 →
AI 코딩 도구

Jamba 2 — AI21 SSM+Transformer 하이브리드, 3B 엣지·52B/12A MoE·256K ctx(Apache-2.0)

AI21 Labs가 2026-01 공개한 Jamba 2는 Mamba SSM과 Transformer attention을 교차 배치한 하이브리드 오픈웨이트 패밀리다. Jamba2 3B(dense)는 iPhone·Mac에서 돌릴 수 있는 엣지 모델, Jamba2 Mini(52B total·12B active MoE)는 256K 컨텍스트에서 reasoning 모델의 thinking token 오버헤드 없이 enterprise QA·RAG·장문 분석에 최적화됐다. 500B 토큰 mid-training(수학·코드·장문 비중↑) 후 on-policy RL(DPO→verifiable reward)로 instruction-following·grounding 벤치(IFBench·FACTS)에서 동급 Ministral3 14B 대비 통계적으로 유의한 우위를 보인다. Apache-2.0, Hugging Face·AI21 Studio·AWS Bedrock 제공.

  • 3B dense + Mini 52B/12A MoE, 256K ctx, Apache-2.0
  • SSM-Transformer 교차: 100K+ ctx에서도 메모리 효율·throughput 유지
  • Enterprise QA·grounded RAG 특화 — reasoning 모델 대비 낮은 compute
원본 →
AI 코딩 도구

Together AI — 200+ 오픈소스 모델 서버리스 추론, OpenAI 호환 API·배치 50% 할인

Together AI는 오픈소스 LLM 추론·파인튜닝·GPU 클러스터를 한 플랫폼에 묶은 full-stack AI 인프라다. Serverless Inference는 200+ 모델(Qwen·Kimi·DeepSeek·FLUX 등)을 per-token API로 호출하며 OpenAI SDK와 base_url만 바꿔 drop-in 연동 가능하다. Adaptive speculative decoding으로 GPT-OSS·Qwen 등 고난도 모델에서 최대 2.75× 빠른 서버리스 추론을 주장하고, 비실시간 워크로드는 Batch API로 50% 할인된다. Dedicated Endpoints는 GPU를 분 단위로 예약해 steady traffic·파인�uning 모델 서빙에 쓴다. LangChain·Vercel AI SDK·LlamaIndex·Helicone 등 서드파티 통합 제공.

  • OpenAI 호환: base_url=https://api.together.ai/v1, model만 교체
  • Serverless(per-token) vs Dedicated(GPU/min) — 트래픽 패턴에 선택
  • Batch 50% 할인·Helicone observability·100+ 모델 카탈로그
원본 →
AI 코딩 도구

Guardrails AI — Validator Hub로 LLM 입출력을 런타임 검증·구조화 출력 강제(MIT)

Guardrails AI는 LLM 애플리케이션에 런타임 안전장치를 씌우는 Python 프레임워크다. Guard 객체가 LLM 호출 전후로 Input/Output Guard를 실행하고, Guardrails Hub의 Validator(PiiDetection·ToxicLanguage·Jailbreak·Hallucination 등)를 조합해 위험을 탐지·정량화·완화한다. Pydantic/RAIL(XML) 스키마로 구조화 출력을 강제하며, 검증 실패 시 reask·filter·fix·exception 등 on-fail 액션을 설정한다. 2025-02 Guardrails Index 벤치마크로 Validator별 latency·accuracy 공개. 모델 비종속(OpenAI·Anthropic·로컬)이며 REST API 서버로도 배포 가능.

  • Guard + Validator Hub: PII·탈옥·유해·할루시네이션 등 조합
  • Pydantic/RAIL 스키마 → function calling 또는 prompt optimization
  • on-fail: reask·filter·fix·exception — Guardrails Index로 Validator 품질 비교
원본 →
AI 코딩 도구

MLX — Apple Silicon 전용 ML 프레임워크, unified memory·lazy compute·M5 Neural Accelerator(MIT·~26k★)

MLX는 Apple ML Research가 만든 Apple Silicon 전용 array 프레임워크로, unified memory 아키텍처를 활용해 GPU·CPU·Neural Engine 간 데이터 복사 없이 효율적 수치 연산·학습·추론을 제공한다. NumPy-like core + PyTorch/JAX-like nn·optimizer 패키지, lazy computation·automatic differentiation·function transformation을 지원한다. Python·Swift·C++·C API, WWDC25 공식 세션. MLX-LM으로 Hugging Face LLM 텍스트 생성·파인튜닝, macOS 26.2+ JACCL(RDMA over Thunderbolt)로 Mac 간 분산 학습. M5 Neural Accelerator(TensorOps·Metal 4) 지원으로 inference 가속.

  • Unified memory: GPU↔CPU 복사 없이 lazy compute·autograd
  • MLX-LM: HF LLM on-device 생성·파인튜닝, LM Studio·Apple Research 데모
  • JACCL 분산(Mac Thunderbolt 5)·M5 Neural Accelerator·MIT·26k★
원본 →
AI 코딩 도구

LangSmith — 프레임워크 비종속 LLM·에이전트 옵저버빌리티·평가·프롬프트 관리 플랫폼

LangSmith는 LangChain 팀의 managed AI agent engineering platform으로, trace 기반 디버깅·평가·모니터링·프롬프트 관리를 통합한다. OpenAI·Anthropic·CrewAI·Vercel AI SDK·Pydantic AI 등 80+ 프레임워크와 OpenTelemetry 연동, LangChain 종속 없이 @traceable 또는 SDK로 계측 가능. Polly AI assistant로 긴 trace 분석, Insights Agent로 usage pattern·failure mode 클러스터링, SmithDB(purpose-built DB)로 nested agent trace 검색. Online eval(LLM-as-judge·code eval)·dashboard·PagerDuty alert. 2025-10 Series B $125M($1.25B valuation), 월 10억+ trace 처리.

  • Trace-first: conversation thread·tool·sub-agent delegation 1급 개념
  • SmithDB + Polly + Insights Agent — nested trace 디버깅·패턴 분석
  • Online eval·cost/latency dashboard·OpenTelemetry·80+ framework
원본 →
AI 코딩 도구

Gemma 3n — MatFormer·PLE로 2GB RAM에 8B급, 텍스트·이미지·오디오 온디바이스(Gemma)

Gemma 3n은 Google DeepMind의 mobile-first 오픈 멀티모달 모델로, Gemini Nano와 공유 아키텍처를 Gemma로 먼저 공개한 버전이다. MatFormer(Matryoshka Transformer)로 E4B(8B raw·4B effective) 안에 E2B(5B raw·2B effective) 서브모델이 중첩되어 latency·품질 트레이드오프를 런타임에 조절한다. Per-Layer Embedding(PLE) caching으로 embedding을 CPU에 두고 accelerator에는 core transformer(~2B/4B)만 로드 — E2B 2GB·E4B 3GB RAM. MobileNet-v5 vision·오디오 encoder, 32K ctx·140개 언어. Google AI Edge·Android Gemma Gallery·LiteRT 배포.

  • MatFormer: E4B 안에 E2B 중첩, Mix-n-Match로 2B~4B 사이 커스텀
  • PLE: 8B raw → 4B effective, 2GB(E2B)·3GB(E4B) RAM
  • 텍스트·이미지·오디오·Gemini Nano 동일 아키·Android/Chrome 예정
원본 →
AI 코딩 도구

Letta(Letta Code) — MemGPT 후속, git-backed Context Repository로 학습하는 에이전트(MIT)

Letta(구 MemGPT)는 UC Berkeley Sky Computing Lab 출신 AI 연구실의 기계가 학습하는 에이전트 플랫폼이다. Letta Code는 stateful agent harness로 memory·identity·skills가 경험과 함께 진화한다. Context Repository(MemFS)는 에이전트 컨텍스트를 git-backed 로컬 파일시스템에 버전 관리 — /memfs로 활성화, memory subagent(dream·doctor)가 git worktree로 비동기 메모리 정리. Sleep-time Compute(드리밍): idle 중 reflection·defragmentation. Constellation 클라우드 백엔드 + 로컬 clone, GitHub Actions·chat.letta.com 연동. MemGPT(2023)·Context Constitution(2026) 연구 기반.

  • MemFS: git-backed memory, subagent worktree로 비동기 dream/doctor
  • Sleep-time compute: idle 중 메모리 정리·학습 — blocking 없음
  • Constellation 클라우드 + npm i -g @letta-ai/letta-code, MIT
원본 →
AI 코딩 도구

Hindsight — Retain·Recall·Reflect 3연산, 4-network agent memory(MIT·~17k★)

Hindsight(Vectorize.io)는 기억이 아니라 학습에 초점을 맞춘 agent memory 아키텍처다. 4개 논리 네트work(world·experience·observation·opinion)로 사실과 신념을 분리하고, retain(추출·저장)·recall(4-way parallel search+rerank)·reflect( disposition 기반 추론) 3연산을 제공한다. TEMPR(Temporal Entity Memory Priming Retrieval)이 pgvector+그래프+BM25+temporal filter 하이브리드 검색. LongMemEval 91.4%(Gemini-3 Pro)·83.6%(20B OSS)로 Mem0·Graphiti·full-context GPT-4o 초과. pip install hindsight-all, MCP 서버 내장, Microsoft Agent Framework 통합 사례.

  • 4 network: world/experience/observation/opinion — fact vs belief 분리
  • TEMPR: semantic+keyword+graph+temporal parallel → cross-encoder rerank
  • reflect: mission·directives·disposition(skepticism 등)로 추론 스타일 조절
원본 →
AI 코딩 도구

Qwen-Agent — Qwen3.5 네이티브 Function Calling·MCP·Code Interpreter·RAG(Apache-2.0·~16.6k★)

Qwen-Agent는 Alibaba가 Qwen 모델 생태계용으로 만든 Python agent 프레임워크다. Function Calling 템플릿·파서가 Qwen3/Qwen3.5에 최적화되어 generic framework 대비 tool call 안정성이 높다. Assistant·ReAct·GroupChat 에이전트, 내장 code_interpreter·browser·doc_parser·RAG, MCP(stdio·SSE·streamable-http) 동적 tool discovery. DashScope API 또는 vLLM/Ollama 로컬 OpenAI-compatible endpoint. 2026-02 Qwen3.5·Qwen3-Coder·reasoning_content·think-with-images(zoom·image search) 지원. Gradio GUI·Chrome extension·qwen-agent[gui,rag,mcp] extras.

  • Qwen-native FC: vLLM tool call parsing·reasoning_content·Qwen3.5 demo
  • MCPManager singleton: stdio/SSE/HTTP MCP → BaseTool 자동 등록
  • DashScope 또는 localhost:8000/v1 — code_interpreter·RAG·Browser 내장
원본 →
AI 코딩 도구

1/W Law — LLM 추론 에너지, ctx 2배마다 tok/W 절반·라우팅이 GPU 세대보다 강력

2026년 LLM inference 에너지 연구의 핵심 발견. 1/W Law: serving context window가 2배될 때마다 tokens-per-watt 효율이 절반으로 떨어진다 — KV-cache concurrency 한계 때문. FleetOpt two-pool routing(짧은 ctx pool + 긴 ctx pool)은 homogeneous fleet 대비 ~2.5× tok/W, H100→B200 GPU 업그레이드는 ~1.7× — 독립적으로 곱해져 ~4.25×. Watt Counts 벤치(5,000+ 실험·50 LLM·10 GPU)는 server scenario에서 UX 손실 없이 70%·batch 20% 에너지 절감 가능을 보여준다. ML 커뮤니티는 J/token·PUE·utilization을 accuracy/latency와 동등 1급 지표로 보고하자는 Position Paper(2026)도 제안.

  • 1/W Law: ctx 2× → tok/W ½ — agent 워크로드 전환 시 2~4× 효율 하락
  • Two-pool routing ~2.5× > GPU gen upgrade ~1.7× — gains multiply
  • Watt Counts: 50 LLM×10 GPU 에너지 DB, server -70%·batch -20% 가능
원본 →
AI 코딩 도구

Stable Diffusion 3.5 Large Turbo — ADD 4-step·MMDiT·typography·8.1B(MMDiT)

Stable Diffusion 3.5 Large Turbo는 Stability AI의 ADD(Adversarial Diffusion Distillation)로 4 inference step만에 Large급 품질을 내는 distilled MMDiT 모델이다. SD 3.5 Large(8.1B) 대비 ~4-6초/장(RTX 4090)으로 concept exploration·batch workflow에 최적. 3개 fixed text encoder·QK-normalization·guidance_scale=0.0. SDXL Turbo(1-step·512px·텍스트 렌더링 약함) 대비 prompt adherence·typography·complex scene 일관성이 크게 개선. ComfyUI·Diffusers StableDiffusion3Pipeline, Stability AI Enterprise API·self-host. FLUX.1 schnell(리얼리즘)과 상호보완 — SD 3.5는 LoRA/ControlNet 생태계가 SDXL보다 작지만 MMDiT 아키텍처 품질 천장이 높다.

  • ADD 4-step: num_inference_steps=4, guidance_scale=0.0
  • MMDiT 8.1B distilled — typography·complex prompt > SDXL Turbo
  • ComfyUI·HF Diffusers·Enterprise API — batch/concept용, final은 Large
원본 →
AI 코딩 도구

xAI Grok-3 — Colossus 200K H100·Think RL·DeepSearch·131K ctx(2025-02)

xAI Grok-3(2025-02-17)는 Colossus 슈퍼컴퓨터(200,000 H100)에서 10× compute로 학습된 reasoning LLM이다. Chatbot Arena Elo 1402(출시 시 1위), Think mode(RL chain-of-thought·backtrack·self-correct), DeepSearch(90+ 소스 동시 분석·인용 synthesis), Big Brain(max compute). 131K ctx, Grok-3 Mini($0.30/$0.50 per M). X(Twitter) 실시간 데이터 네이티브 통합 — trending·시장·뉴스 쿼리에 static cutoff 없음. 2025-07 Grok-4 후속 출시로 legacy화됐으나 Think/DeepSearch 패턴과 Colossus infra story는 2026 agentic research 참고점. API: grok-3·grok-3-mini·grok-3-fast.

  • Think: RL reasoning·visible CoT·backtrack — AIME 2025 93.3%(cons@64)
  • DeepSearch: multi-source agentic research·X 실시간·인용 응답
  • Colossus 200K H100·131K ctx·Grok-4(2025-07) 후 legacy — API 잔존
원본 →
AI 코딩 도구

NotebookLM Gemini 3.5 — Antigravity 클라우드 컴퓨터·소스 발견·다형식 출력

Google NotebookLM(2026-06)은 Gemini 3.5·Antigravity 에이전트 코딩 플랫폼으로 전면 업그레이드됐다. 각 노트북에 secure cloud computer가 붙어 100+ curated software skills로 코드 실행·데이터 분석·PDF·Excel·PowerPoint·차트·JSON/CSV를 생성한다. 채팅만으로 Google Search 기반 소스 발견·리포지토리 구축이 가능해 import 없이 리서치를 시작할 수 있다. step-by-step reasoning 가시성, Studio Panel에서 생성물 편집. AI Ultra·Workspace AI Ultra/Expanded Access부터, 무료 티어는 기존 Audio Overview 등 유지.

  • Gemini 3.5 + Antigravity: 노트북당 secure VM, 100+ skills로 코드·분석·파일 생성
  • 소스 발견: loose idea→Search로 웹 소스 수집·정리, discover 기능 확장
  • 출력: PDF·xlsx·pptx·png/svg 차트·Nano Banana 이미지 — Ultra/Workspace 우선 롤아웃
원본 →
AI 코딩 도구

OpenRouter — 400+ 모델 게이트웨이·공식 MCP Server(benchmarks·chat-send)

OpenRouter는 단일 OpenAI-compatible endpoint(https://openrouter.ai/api/v1)로 400+ 모델·70+ 프로바이더에 접근하는 managed LLM gateway다. model·provider failover·openrouter/auto·:nitro/:floor suffix·data policy. 2026 공식 OpenRouter MCP Server — 에이전트가 live catalog·Artificial Analysis/Design Arena benchmark·per-provider latency·chat-send test inference를 도구 호출로 조회. models-list·model-endpoints·benchmarks·rankings-daily·docs-search·credits-get. "어떤 모델이 코딩에 좋고 싸나"를 training cutoff가 아닌 live data로 답한다. community pricing MCP(Semicolon-D)와 달리 OpenRouter first-party·benchmark 통합·chat-send in-agent test.

  • Gateway: 2-layer routing·openrouter/auto·:nitro/:floor, LiteLLM self-host 대비 managed SaaS
  • Official MCP: models-list·benchmarks·chat-send — live AA/Design Arena score·cost·latency
  • Agent model pick — stale memory 대신 MCP tools로 catalog·ranking·test prompt grounding
원본 →
AI 코딩 도구

Fireworks AI — Disaggregated Inference Engine·Speculative Decoding·Day-0 OSS 모델

Fireworks AI는 OSS LLM 프로덕션 추론 플랫폼으로 30T+ tokens/day 처리를 주장한다. Disaggregated inference engine — multi-node expert parallelism·disaggregated KV cache·prompt-aware routing·speculative decoding(2-3× TTFT). FireOptimizer가 GPU 선택·sharding·scheduling을 자동 튜닝. Serverless(per-token·Priority/Fast)·On-Demand·Reserved GPU, LoRA/full SFT 후 즉시 serverless 배포. GLM 5.2·Kimi K2.7 Code day-zero, Whisper 4× cheaper·10× faster vs OpenAI 주장. OpenAI/Anthropic compatible API, Azure Foundry preview, 2026-07-01 prepaid billing 전환.

  • Speculative decoding: draft model→target parallel validate, code/agent 2-3× latency↓
  • vLLM 대비 3.5×+ latency 우위(StarCoder 벤치)·Artificial Analysis OSS 1위 주장
  • Serverless OpenAI-compatible·Fine-tune→deploy seconds·NVIDIA GTC 2026 파트너
원본 →
AI 코딩 도구

NVIDIA NIM — Inference Microservices·OpenAI 호환·build.nvidia.com 무료 API

NVIDIA NIM(NVIDIA Inference Microservices)은 LLM·비전·음성 등 AI 모델을 Docker 컨테이너로 패키징 — weights·TensorRT-LLM/vLLM/SGLang 엔진·OpenAI-compatible REST API가 번들. model-specific NIM(최적 manifest·quantization) vs model-free NIM(HF/NGC/S3 runtime 로드). Kubernetes nim-deploy·NIM Operator, LoRA adapter(HF/NeMo) multi-LLM container. build.nvidia.com: 100+ 모델 무료 API(nvapi- 키·1000 credits·40 RPM), GPU sandbox(Blackwell/Hopper), Blueprints(RAG·agentic), NemoClaw agent security. Self-host는 NVIDIA AI Enterprise license.

  • OpenAI /v1/chat/completions drop-in — cloud prototype→on-prem 동일 API
  • NIM LLM = vLLM upstream 협력·2.6× throughput vs raw vLLM(H100 Llama 8B 주장)
  • Free tier 1000 credits·40 RPM — Nemotron·Kimi·GLM 등 DGX Cloud hosted
원본 →
AI 코딩 도구

Graphite Agent — Diamond+Chat 통합, PR 페이지에서 대화·수정·머지까지

Graphite는 GitHub 위 stacked PR·merge queue 플랫폼이며 2026-01 Diamond(AI reviewer)+Chat을 Graphite Agent로 통합했다. 정적 코멘트가 아니라 PR 페이지에서 codebase context로 버그·보안·로직 이슈를 잡고, diff 설명·CI failure patch·one-click commit까지 대화형 collaborator. Custom rules(plain language)·exclusions·acceptance rate dashboard. Cursor 인수(2025) 이후 Cursor Cloud Agents가 Graphite PR에 embed — 로컬 코딩→PR 리뷰 seamless. stacked diffs·stack-aware merge queue는 Graphite 독점, CodeRabbit(리뷰만)·Greptile(whole-repo)과 축 분리.

  • PR-native Chat — static comment→explain·fix·commit loop, CI failure in-PR patch
  • Stacked PR+merge queue — 의존 PR chain auto-rebase·parallel CI batch
  • Cursor Cloud Agents in Graphite — IDE agent→PR review handoff, ~5% negative rate
원본 →
AI 코딩 도구

Replit Agent 4 — Design Canvas·병렬 task·Kanban 협업(March 2026)

Replit Agent 4(2026-03-11)는 브라우저 올인원 dev 환경에서 아이디어→프로덕션까지 돌리는 AI 에이전트다. Design Canvas(infinite board): web·mobile·slide·data viz artifact를 한 캔버스에서 variant 탐색→프레임 선택→Artifact 변환. 병렬 task: 팀원 각자 chat thread→동시 dispatch→isolated micro VM에서 실행→Kanban approve→main merge(~90% conflict auto-resolve 주장). Lite(10-60s tweak)·Economy(default)·Power(hard task)·Turbo(2.5×, Pro). fork-and-merge 폐기→single shared project. Reserved VM·Scheduled deploy·DB·auth 내장 — Cursor(기존 repo) vs Replit(greenfield browser) 포지셔닝.

  • Design Canvas: Design Mode 대체, 모든 artifact type·live preview·direct manipulation
  • Parallel agents: plan-while-building, isolated env→Kanban→explicit approve
  • Credit/effort pricing: Lite/Economy/Power/Turbo — greenfield·non-dev friendly
원본 →
AI 코딩 도구

Perplexity Computer — 19모델 오케스트레이션·Search as Code·Max 구독

Perplexity Computer(2026-02)는 chat→agent→workflow 진화의 정점으로, Opus 4.6 core reasoning + task별 sub-agent(Gemini research·Nano Banana image·Veo video·Grok speed·GPT long-context)를 orchestrate한다. hours~months 장기 workflow, browser·software stack을 human coworker처럼 조작. Search as Code(SaC): retrieval을 function call/MCP가 아닌 model-generated Python으로 SDK primitive 조합 — conditional·async·parallel pipeline. 자체 web index·pplx-embed, Agent API·Computer에 SaC 적용. Perplexity Max 구독자·Enterprise Max soon. Bumblebee(MCP scanner)와 달리 consumer/agent harness 제품.

  • Model-agnostic: task별 best model routing — multi-model이 commodity가 아닌 specialize
  • SaC: search stack primitive→Python orchestration, agent benchmark cost-performance↑
  • Digital worker: sub-agent spawn·browser operate·deliver — Max tier
원본 →
AI 코딩 도구

Microsoft Agent Framework 1.0 GA — AutoGen+Semantic Kernel 통합·graph Workflow

Microsoft Agent Framework(2026-04-03 GA)는 AutoGen(maintenance)·Semantic Kernel을 통합한 production-ready OSS SDK(.NET+Python)다. Single agent(chat client·tools·MCP)·graph-based Workflow(type-safe routing·checkpointing·human-in-the-loop). Multi-agent: sequential·concurrent·handoff·group chat·Magentic-One. Foundry·Azure OpenAI·Anthropic·Ollama 등 multi-provider, A2A·MCP cross-runtime. BUILD 2026: Agent Harness·Hosted Agents·CodeAct·Handoff pattern( directed edges + agent routing). AutoGen 0.7.x는 bugfix only — 신규는 pip install agent-framework / Microsoft.Agents.AI + migration guide.

  • Workflow vs Agent: open-ended conversational→agent, deterministic multi-step→workflow
  • 1.0 LTS: stable API·backward compatibility·OpenTelemetry·declarative YAML config
  • Handoff(BUILD26): router가 아닌 agent가 mid-turn peer transfer — topology는 dev가 선언
원본 →
AI 코딩 도구

GitHub Copilot Extensions — @멘션으로 서드파티 도구·SSE Agent·Marketplace GA

GitHub Copilot Extensions(2025-02 GA)는 Copilot Chat에서 @extension-name으로 Docker·Sentry·Stripe·Perplexity·Stack Overflow 등 서드파티 도구를 자연어 호출하는 통합이다. VS Code·Visual Studio·JetBrains·GitHub.com·Mobile(coming). GitHub App + HTTP backend(SSE streaming·OpenAI chat format), Agent(full conversation) vs Skill Provider(discrete capability). 조직 private extension(내부 API·모니터링) 또는 Marketplace public. OpenID Connect로 third-party auth. Copilot coding agent의 custom agents(.github/agents/)·MCP와 함께 'IDE 안에서 도구 생태계'를 완성.

  • Build: GitHub App→Copilot agent URL→SSE endpoint, @deploy-status 패턴
  • Marketplace GA: Perplexity·Docker·Sentry·Stripe 등 — Copilot license 전 tier
  • Private extension: enterprise homegrown tooling을 chat interface로 — OIDC auth
원본 →
AI 코딩 도구

GitHub Copilot Workspace — Issue→Plan→Implement→Test→PR 엔터프라이즈 GA

Copilot Workspace는 GitHub Issue 하나를 brainstorm plan·multi-file implementation·passing tests·linked PR까지 GitHub.com 안에서 완료하는 agentic SDLC 워크플로다(Enterprise GA). 3년간 IDE autocomplete bolt-on이었던 Copilot을 '조직 단위 workflow replacement'로 격상 — VS Code 없이 issue만으로 feature ship. Instrumented plans·diffs·audit trail for compliance. Coding agent(백그라운드 PR)·Copilot CLI(& cloud handoff)와 complementary — Workspace는 product intent→code visible to org. Custom agents·MCP·security scanning(coding agent 2026)과 함께 GitHub agent stack 완성.

  • Issue-in-PR-out: plan→implement→test→PR all in github.com — IDE optional
  • Enterprise GA: governance·IP protection·audit trail — team workflow ownership
  • vs coding agent: Workspace=greenfield feature, agent=background bugfix/debt/test
원본 →
AI 코딩 도구

Ell — LMP(Language Model Program) 함수·자동 버전·Ell Studio(MIT·~5.9k★)

ell(MadcowD/ell)은 prompt를 Python 함수(LMP)로 취급하는 lightweight prompt engineering library다. @ell.simple/complex decorator→static analysis로 source·call serialize, 변경마다 gpt-4o-mini autogenerated commit message + local SQLite store(checkpointing). ell.init(store='./logdir')→모든 LMP call 저장, ell-studio로 version diff·regression·invocation dataset 시각화. LangChain one-function-at-a-time migration, multimodal I/O. Instructor(validate-after) vs ell(version-track) vs Outlines(constrain-during) — prompt lifecycle의 'git for prompts'. pip install ell-ai[all].

  • LMP = versioned Python function, not string template — composable pipeline
  • Ell Studio: local-first SQLite, prompt evolution dashboard — no cloud dependency
  • vs Instructor/Outlines: versioning·monitoring focus, not structured output enforcement
원본 →
AI 코딩 도구

Apple Foundation Models framework AFM 3 — on-device·Private Cloud Compute·reasoning(iOS 27)

Apple AFM 3(2026, Google 협력 5-model family)은 on-device AFM 3 Core(3B dense)·AFM 3 Core Advanced(20B sparse·1-4B active·multimodal)와 Private Cloud Compute model(32K ctx·reasoning)로 구성. Foundation Models framework(Swift): LanguageModelSession·tool calling·guided generation·stateful sessions. iOS 26.4+ token counting·context size inspection API, guardrail false positive 개선(iOS 27). PrivateCloudComputeLanguageModel + reasoningLevel(deep reasoning). Core AI(WWDC26)와 LanguageModel protocol 연동 — custom on-device model을 system session infra에 plug. Core AI card와 complement: FM framework=Apple Intelligence API, Core AI=bring-your-own-model inference.

  • AFM 3 Core Advanced: 20B sparse, M5+ silicon, voice·dictation·multimodal on-device
  • Private Cloud Compute: 32K ctx reasoning model, reasoningLevel on contextOptions
  • Developer: Foundation Models framework(Swift) + Core AI custom model via LanguageModel protocol
원본 →
AI 코딩 도구

RAGAS — RAG 파이프라인을 faithfulness·context precision으로 자동 평가하는 프레임워크

RAGAS(Retrieval Augmented Generation Assessment)는 ground truth 없이 RAG 품질을 측정하는 오픈소스 평가 프레임워크다. retriever(검색)와 generator(생성)를 분리·통합 평가하며, faithfulness·answer relevancy·context precision·context recall 등 LLM-as-judge 메트릭을 제공한다. LangChain·LlamaIndex와 통합되고, ragas quickstart rag_eval CLI로 프로젝트 템플릿을 생성해 @experiment 데코레이터로 CI 친화적 eval 루프를 만든다. DeepEval(Pytest 스타일)과 상호보완 — RAGAS는 RAG 특화, DeepEval은 범용 LLM 품질 게이트.

  • 핵심 메트릭: faithfulness(환각)·answer relevancy·context precision/recall — retriever vs generator 병목 분리
  • ragas quickstart rag_eval -o ./my-project → evals.py·CSV 실험 추적·LangChain/LlamaIndex 통합
  • reference-free 평가로 golden set 없이도 반복 개선 루프 가능 — 프로덕션 RAG 필수 도구
원본 →
AI 코딩 도구

Anthropic Computer Use — 스크린샷·마우스·키보드로 데스크톱을 조작하는 API 도구(베타)

Claude Computer Use는 API 베타 기능으로, 에이전트가 스크린샷 캡처·마우스 이동·키보드 입력으로 데스크투를 자동화한다. Claude가 tool_use를 반환하면 애플리케이션이 VM/컨테이너에서 실행하고 tool_result를 돌려주는 agent loop 구조다. computer_20251124 타입 + anthropic-beta: computer-use-2025-11-24 헤더. Opus 4.8·Sonnet 4.6 등 지원. Cowork/Claude Code(데스크톱 제품)와 구분 — API는 빌더가 샌드박스·allowlist·human-in-the-loop·max_iterations를 직접 설계해야 한다.

  • API 계약: Claude→tool_use→앱이 VM에서 실행→tool_result→루프. Claude가 직접 실행하지 않음
  • 프로덕션: Docker/VM 격리·도메인 allowlist·max_iterations·민감 작업 human checkpoint 필수
  • Cowork(맥/윈도 데스크톱 위임) vs API(자체 제품 임베드) — 실행 주체가 다름
원본 →
AI 코딩 도구

LlamaIndex vs LangChain — 2026년 RAG·에이전트 하이브리드 스택 선택 가이드

2026년 LlamaIndex와 LangChain은 각각 RAG·에이전트 플랫폼으로 수렴했지만 강점이 다르다. LlamaIndex는 문서 ingestion·청킹·하이브리드 검색·LlamaParse에 특화 — retrieval 품질·토큰 효율(~33%↓) 우위. LangChain+LangGraph는 상태 머신·체크포인팅·human-in-the-loop·멀티에이전트 오케스트레이션 표준. 시니어 패턴: LlamaIndex=데이터 레이어, LangGraph=실행 레이어, LangSmith=옵저버빌리티 — 단일 프레임워크 고집보다 하이브리드가 프로덕션 정답.

  • LlamaIndex: 대량 PDF·엔터프라이즈 문서·복잡 retrieval(재귀·sub-question) → 데이터 레이어
  • LangGraph: 분기·상태·승인 게이트·장기 에이전트 → 실행 레이어
  • 하이브리드: QueryEngine을 LangGraph 노드에 넣어 retrieval+orchestration 분리
원본 →
AI 코딩 도구

Meticulous — 테스트 코드 없이 실제 세션을 녹화·재생하는 AI 프론트엔드 E2E 테스트

Meticulous는 JS recorder snippet으로 staging/preview에서 사용자 세션을 캡처하고, PR마다 동일 interaction을 결정론적으로 재생해 visual regression을 잡는 AI 테스트 플랫form이다. 네트워크 응답을 mock/replay해 flaky·데이터 의존성을 제거하고, Chromium 레벨 deterministic scheduling으로 flake-free를 목표한다. QA Wolf(Playwright 코드 생성)와 달리 "테스트를 쓰지 않는" 세션 리플레이 접근 — 버그 재현·UI regression에 특화.

  • recorder snippet → PR 시 relevant 세션 subset 재생 → 스크린샷 diff를 PR 코멘트로
  • 네트워크 mock/replay로 백엔드 side-effect 없이 프론트엔드 격리 테스트
  • CI: meticulous.yaml + static assets/Docker/Vercel preview URL 중 선택 — 120초 내 1000+ 화면
원본 →
AI 코딩 도구

Modal vs Baseten vs Replicate — GPU 추론·파인튜닝 플랫폼 2026 선택 가이드

2026년 AI 모델 서빙 플랫폼은 추상화 수준이 다르다. Replicate(Cloudflare): 5만+ 커뮤니티 모델·Cog 패키징·per-GPU-second 과금 — 프로토타입·이미지/비디오 모델에 최적, H100 $5.49/hr. Modal: Python decorator 서버less·per-second 과금·배치/파인튜닝/멀티스텝 파이프라인 — bursty·고볼륨에 유리, H100 ~$3.95/hr. Baseten: Truss+TensorRT-LLM/SGLang/vLLM·SOC2/HIPAA·per-minute dedicated — steady high-throughput 엔터프라이즈, H100 $6.50/hr.

  • Replicate: 모델 마켓플레이스·빠른 API·Cog push — 프로토타입·생성 AI
  • Modal: @app.function GPU decorator·scale-to-zero·파인튜닝 job — Python 네이티브 파이프라인
  • Baseten: Truss 엔진 선택·엔터프라이즈 SLA·token-priced Model API — 프로덕션 steady inference
원본 →
AI 코딩 도구

Unstructured.io — 64+ 파일형식을 RAG-ready JSON으로 변환하는 엔터프라이즈 ETL

Unstructured는 PDF·DOCX·PPTX·HTML·이메일 등 64+ 형식을 canonical JSON(Header·Table·NarrativeText 등 20+ element)으로 변환하는 GenAI 데이터 플랫폼이다. Auto/Fast/High Res/VLM 4종 partitioning 전략, By Title semantic chunking, 30+ connector·1,250+ pipeline으로 vector DB·data lake에 적재. Docling(IBM)·LlamaParse와 경쟁 — Unstructured는 엔터프라이즈 connector·거overnance·no-code UI+API 양쪽 제공. DIY 파싱 파이프라인 대신 표준 JSON+metadata로 RAG retrieval latency·품질을 안정화.

  • Auto partitioning: PDF 페이지별 Fast/VLM/High Res 자동 라우팅 — 품질·비용 최적
  • canonical JSON: Header·Table·Image 등 typed element + lineage metadata → chunking·filter
  • 30+ connector·vector store 적재 — DIY 파싱 rat's nest 대체
원본 →
AI 코딩 도구

Lovable — React+Supabase 풀스택을 자연어로 생성하는 AI 앱 빌더

Lovable(구 GPT Engineer)는 자연어로 React·TypeScript·Tailwind·Supabase 풀스택 웹앱을 생성하는 AI 플랫폼이다. Agent Mode(자율)·Chat Mode(반복)·Visual Edits(UI 직접 수정), GitHub sync로 코드 소유권 확보. bolt.new(WebContainers 풀스택)·v0(Vercel UI 컴포넌트)와 비교 — Lovable은 Supabase BaaS 통합·비개발자 MVP에 특화. 2026년 BOLA·RLS 미설정 이슈가 보고됐으므로 프로덕션 배포 전 credential rotation·row-level security 필수.

  • React+TS+Vite+Tailwind+Supabase — GitHub sync로 코드 portability
  • bolt.new=브라우저 풀스택·v0=UI 컴포넌트·Lovable=Supabase BaaS MVP
  • 보안: legacy public project BOLA 이슈 — RLS·credential audit 필수(2026)
원본 →
AI 코딩 도구

Claude Community Marketplace — 분산형 플러그인 생태계와 /plugin marketplace add

Claude Code 플러그인은 단일 스토어가 아니라 marketplace.json 레지스트리를 가진 GitHub repo 분산 구조다. 공식: claude-plugins-official(자동 제공)·anthropics/claude-plugins-community(수동 add·자동 검증). 커뮤니티: claudemarketplaces.com·SkillsMP(120만+ skill)·ccpi 등 — /plugin marketplace add owner/repo로 구독. marketplace.json→plugin.json→skills/agents/hooks/MCP 번들. 팀은 자체 marketplace repo로 내부 플러그인 배포 가능.

  • /plugin marketplace add owner/repo → /plugin install name@marketplace — Git·URL·로컬 경로 지원
  • 공식 vs community: community는 Anthropic 자동 검증+commit SHA pin, 그래도 출처 검증 필수
  • SkillsMP·claudemarketplaces.com — 21k+ skill·2.5k+ marketplace 큐레이션(2026-06)
원본 →
AI 코딩 도구

Braintrust — eval-first + agent observability(trace·drift·online eval) 통합

Braintrust는 LLM 앱을 "먼저 eval하고 ship"하는 eval-first 플랫form이다. Playground에서 prompt·model·tool 변형을 A/B하고, dataset+scorer로 CI/CD 품질 게이트를 걸며, production trace를 dataset으로 환류(feedback loop)한다. 2026 agent observability guide — LLM 단일 call이 아니라 tool selection·arguments·memory read/write·sub-agent handoff·decision branch를 nested span으로 캡처, trace inspect만으로는 부족한 online eval layer(production trace에 scorer attach→실패 alert→offline eval set 환류)를 같은 UI에 통합. behavioral drift — tool-call frequency·refusal rate·retrieval depth·latency distribution rolling baseline(24h/7d/30d) 이탈을 leading indicator로. LangSmith(프레임워크 종속)·RAGAS(RAG)·Datadog(infra MELT)와 달리 semantic agent behavior+eval gate. Loop(2026)로 에이전트 eval 자동화 확장.

  • trace+eval loop — production failing trace→dataset→CI gate, uptime만으로 silent failure 못 잡음
  • behavioral drift — tool/refusal/latency baseline shift = model·tool API·RAG corpus change signal
  • LangSmith=LangChain·RAGAS=RAG·Braintrust=범용 eval CI+agent semantic observability
원본 →
AI 코딩 도구

Claude Tag — Slack에서 @Claude를 팀원처럼 호출하는 협업 에이전트

Claude Tag는 Claude를 Slack 채널에 초대해 팀 대화, 선택한 도구, 데이터, 코드베이스 맥락 위에서 작업을 위임하는 Anthropic의 팀 협업 기능이다. 채널 멤버가 `@Claude`를 태그하면 Claude가 PR 작성·머지, 데이터 분석, 장애 원인 조사 같은 일을 맡고, 채널 기록을 따라가며 매번 배경 설명을 다시 요구하지 않도록 컨텍스트를 쌓는다. ambient behavior를 켜면 조용해진 스레드나 관련 정보를 먼저 짚어 주는 더 능동적인 패턴도 가능하다. 개발자 교훈은 "코딩 에이전트는 IDE 안 개인 도구"에서 "팀 채널의 공유 작업자"로 이동 중이라는 점이다. 단, 채널·도구 접근권한을 어디까지 줄지와 사람이 승인해야 할 작업 경계를 먼저 설계해야 한다.

  • Slack 채널에서 `@Claude` 호출 → 선택한 채널·도구·데이터·코드베이스 맥락으로 작업 위임
  • PR 작성·머지, 데이터 분석, 장애 조사처럼 팀 대화와 코드 작업을 잇는 협업형 에이전트
  • 운영 포인트: 채널 접근권한·도구 권한·승인 게이트를 설계해야 팀 맥락이 과노출되지 않는다
원본 →
AI 코딩 도구

Copilot enterprise-managed plugins — VS Code까지 내려오는 조직 표준 에이전트 배포

GitHub Copilot의 enterprise-managed plugins는 기업 관리자가 플러그인 마켓플레이스, 자동 설치 플러그인, hooks, MCP 설정을 한 번 정의해 Copilot CLI와 VS Code 사용자에게 같이 배포하는 기능이다. VS Code 1.122부터 Copilot CLI에서 시작한 enterprise-managed capability를 지원하며, 설정 파일은 `.github-private/.github/copilot/settings.json` 위치에 둔다. 플러그인은 custom agents와 skills를 자동 설치해 온보딩을 줄이고, 항상 켜야 하는 hook·MCP 구성을 조직 표준으로 밀어 넣을 수 있다. 교훈은 AI 도구 도입이 개인 설정 싸움에서 끝나지 않고, 보안·리뷰·도메인 지식을 중앙 정책으로 배포하는 플랫폼 운영 문제가 된다는 점이다.

  • `.github-private/.github/copilot/settings.json`으로 marketplace·자동 설치·hook·MCP 표준을 정의
  • Copilot Business/Enterprise 사용자의 Copilot CLI와 VS Code가 같은 조직 플러그인 정책을 적용
  • custom agents·skills를 자동 배포해 온보딩을 줄이고 리뷰·보안 기준을 도구 안에 고정
원본 →
AI 코딩 도구

AI-native engineering team — 코딩 에이전트는 SDLC 전체의 첫 패스가 된다

OpenAI의 AI-native engineering guide는 코딩 에이전트를 "코드 생성기"가 아니라 계획·설계·빌드·테스트·리뷰·문서·운영을 가로지르는 SDLC 첫 패스 실행자로 본다. 에이전트는 스펙을 코드베이스에 대조해 모호함과 의존성을 찾고, 디자인을 컴포넌트로 옮기며, 구현·테스트·문서 초안을 만들고, 로그·배포 이력·코드를 연결해 운영 원인 분석을 돕는다. 하지만 최종 소유권은 여전히 엔지니어에게 있다. 실무 적용은 큰 조직 개편보다 작은 워크플로부터 시작한다: 이슈 dedupe, 설계 초안, red-first 테스트, PR baseline review, 릴리스 노트처럼 검증 가능한 반복 작업을 에이전트에 맡기고 사람이 방향·품질·승인을 닫는다.

  • 에이전트 역할이 자동완성에서 계획·설계·빌드·테스트·리뷰·문서·운영 첫 패스로 확장
  • 테스트·스캐너·MCP·로그 도구를 직접 실행해야 정적 제안이 아니라 검증 가능한 결과가 된다
  • 사람은 아키텍처·제품 의도·최종 품질을 소유하고, 에이전트는 반복 가능한 하위 워크플로부터 맡긴다
원본 →
AI 코딩 도구

Cody(Sourcegraph) — 코드베이스 검색 API로 @-mention 멀티레포 컨텍스트를 IDE에 끼워 넣는 AI 어시스턴트

Sourcegraph Cody는 VS Code·JetBrains·Visual Studio·웹에서 동작하는 AI 코딩 어시스턴트다. 핵심 차별점은 Sourcegraph Search API — 로컬·원격 코드베이스 전체에서 API·심볼·사용 패턴을 검색해 @-mention으로 채팅·자동완성·Smart Apply에 끼워 넣는다. Enterprise는 멀티레포 컨텍스트, Context Filters로 특정 레포 제외, LLM 선택·프롬프트 라이브러리·MCP 지원. Auto-edit은 커서 이동·타이핑을 분석해 맥락 수정 제안. Amp(에이전트)와 달리 '코드 이해·검색'에 특화.

  • Sourcegraph Search API — @-mention으로 파일·심볼·원격 레포 컨텍스트 주입
  • Chat·Autocomplete·Smart Apply·Auto-edit·프롬프트 라이브러리·MCP
  • Enterprise: 멀티레포·Context Filters·온프레미스 추론(Ollama) — Amp와 역할 분리
원본 →
AI 코딩 도구

Sweep AI — GitHub 이슈·Jira 티켓을 'Sweep:' 라벨만으로 PR까지 자동 생성하는 AI 주니어 개발자

Sweep AI는 GitHub App + JetBrains 플러그인으로 동작하는 AI 코딩 어시스턴트(Y Combinator). 핵심 워크플로: 이슈에 'Sweep' 라벨 또는 제목 'Sweep:' 접두 → 코드베이스 읽기 → 변경 계획 → PR 생성 → CI 자동 수정·머지 충돌 해결. 주니어 개발자에게 일을 맡기듯 버그·소규모 기능·리팩터링을 자연어로 설명하면 된다. JetBrains 쪽은 에이전트 모드·무제한 autocomplete·Privacy Mode. Copilot 코딩 에이전트·SWE-agent와 달리 GitHub-native 이슈→PR 파이프라인에 특화.

  • GitHub App: 'Sweep' 라벨·'Sweep:' 접두 → 코드베이스 분석 → PR 자동 생성
  • CI 자동 수정·머지 충돌 해결 PR — PR 코멘트로 피드백 반복
  • JetBrains 플러그인: 에이전트 모드·autocomplete·Privacy Mode — GitHub-native 자동 PR
원본 →
AI 코딩 도구

Tabnine Enterprise — VPC·온프rem·air-gapped에서 전 스택(모델·Context Engine·거버넌스)을 로컬 실행

Tabnine Enterprise는 코드·프롬프트·텔레메트리가 기본적으로 환경 밖으로 나가지 않는 셀프호스팅 AI 코딩 플랫폼이다. 2026년 GA: 모델 추론·Context Engine(조직 지식 그래프)·거버넌스·정책 평가·오케스트레이션이 전부 고객 trust boundary 안에서 동작. VPC(AWS/GCP/Azure)·온프rem Kubernetes·완전 air-gapped 배포. Tabby(자동완성 서버)와 달리 Context Engine·코딩 에이전트·MCP·SSO·SOC2/ISO27001까지 엔터프라이즈 풀스택.

  • 로컬 퍼스트 — 추론·인덱싱·정책 평가·검색 전부 trust boundary 내부, air-gapped 지원
  • Context Engine = 아키텍처 결정·코딩 표준·의존성 정책·인시던트 이력 조직 지식 그래프
  • Tabby(자동완성)와 차별 — 에이전트·MCP·SSO·컴플라이언스 풀스택
원본 →
AI 코딩 도구

Temporal + AI — 크래시·rate limit에도 에이전트 상태가 살아남는 durable execution 오케스트레이션

LLM 에이전트를 프로덕션에 올리면 rate limit·서버 크래시·장시간 대기에서 상태가 유실된다. Temporal은 Workflow(결정적 오케스트레이션)·Activity(비결정적 LLM·도구 호출·자동 재시도)·Signal/Query(외부·휴먼 인터랙션)로 durable execution을 제공한다. OpenAI Agents SDK·Google ADK와 공식 통합. Nexus로 팀 간 에이전트 서비스 호출, workflow.patched()로 버전 마이그레이션. CrewAI·LangGraph와 달리 '에이전트 프레임워크'가 아니라 '에이전트가 돌아가는 인프라 레이어'.

  • Workflow = 오케스트레이션·상태, Activity = LLM·도구(자동 재시도·Event History)
  • Signal/Query = 휴먼 인더 루프, Nexus = 팀 간 버전드 에이전트 서비스 호출
  • OpenAI Agents SDK·ADK 통합 — 프레임워크가 아닌 durable execution 인프라
원본 →
AI 코딩 도구

ChromaDB — pip install 한 줄로 시작하는 임베디드 벡터 DB, dev→server→Cloud 동일 API

Chroma는 AI-native 오픈소스 임베딩 DB(Apache-2.0·16k★+)로, RAG 프로토타입의 사실상 기본 선택지다. 핵심 API 4개(add/query/update/delete), 자동 임베딩·메타데이터 필터·LangChain/LlamaIndex 통합. 배포 3패턴: Embedded(PersistentClient·로컬 폴더)·Server(HttpClient·Docker)·Chroma Cloud(관리형). 2026년 hybrid retrieval(벡터+BM25+sparse), collection forking, object storage tiering 추가. '벡터 DB 선택 2026' 비교 카드와 달리 '로컬 임베디드→프로덕션' 마이그레이션 경로에 특화.

  • Embedded(PersistentClient) → Server(HttpClient) → Cloud — 동일 API, 스레드-safe·프로세스-safe 주의
  • 자동 임베딩·메타데이터 필터·LangChain/LlamaIndex 1급 통합
  • 2026: hybrid retrieval·collection forking·object storage tiering
원본 →
AI 코딩 도구

Milvus 3.0 — External Collection·Snapshot으로 벡터 DB를 데이터 레이크와 zero-copy 통합(Zilliz Lakebase)

Milvus 3.0-beta(2026-05)는 벡터 DB를 Zilliz Vector Lakebase의 코어 커널로 확장한다. External Collection = Parquet·Iceberg·Lance 파일을 복사 없이 zero-copy 참조, Milvus는 스키마·인덱스·쿼리만 관리. Snapshot = MVCC 격리 read-only 뷰로 배치 분석·A/B 평가. EmbList+DiskANN(변长 벡터·ColBERT), nullable vector(온라인 컬럼 추가), MinHash dedup, Storage V3(manifest 기반 columnar). Qdrant·Pinecone 비교 카드와 달리 '레이크-native·대규모 배치+서빙 통합'에 특화.

  • External Collection — Parquet/Iceberg/Lance zero-copy, Refresh로 동기화
  • Snapshot — MVCC read-only 뷰, 라이브 Collection 쓰기와 병행
  • EmbList+DiskANN·nullable vector·MinHash·Storage V3 — Zilliz Lakebase 코어
원본 →
AI 코딩 도구

Pieces for Developers — OS 레벨 AI 동반자, 코드 스니펫·워크플로 컨텍스트를 로컬 장기 기억으로

Pieces는 Copilot·Cursor가 '새 코드 작성'을 돕는 반면, '전에 풀었던 코드를 어디서 찾지?' 문제를 푼다. OS 레벨 companion으로 클립보드·IDE·스크린샷(OCR)·브라우저 탭을 자동 캡처, AI가 태그·설명·관련 사람(Git history)으로 enrich. Long-term Memory로 자연어 검색, Copilot Chat에서 저장 스니펫 참조. 로컬 퍼스트(코드가 디바이스에 기본), GPT·Claude·Gemini·로컬 모델 선택. 개인 무료, Team $10/seat.

  • Auto-capture — 클립보드·IDE·스크린샷·브라우저 탭, AI enrich(태그·설명·PII/API key 감지)
  • Long-term Memory — 자연어로 과거 스니펫·컨텍스트 검색, Copilot Chat 연동
  • 로컬 퍼스트 — Copilot/Cursor(작성)와 다른 '개발자 기억' 카테고리
원본 →
AI 코딩 도구

Trae AI IDE — ByteDance VS Code 포크, Claude·GPT-4o·DeepSeek 무료 티어·Builder/SOLO 모드

Trae는 ByteDance(TikTok 모회사)가 2025년 출시한 VS Code 포크 AI IDE. Builder Mode로 자연어 한 줄에서 프로젝트 생성, SOLO Mode로 에이전트 병렬 실행. Claude Sonnet 4·GPT-4o·DeepSeek R1·Gemini를 API 키 없이 내장. 2026년 freemium: 무료 5,000 autocomplete/월·10 fast+50 slow premium 요청, Lite $3~Ultra $100. Windsurf·Cursor와 경쟁하나 프라이버시(텔레메트리·5년 데이터 보관) 이슈 — 사이드 프로젝트·학습용 적합, 프로prietary 코드엔 부적합.

  • VS Code 포크 — Builder(프로젝트 생성)·SOLO(에이전트 병렬), MCP·웹 프리뷰
  • Claude·GPT-4o·DeepSeek·Gemini 내장, 무료 티어 quota(Lite $3~Ultra $100)
  • Windsurf/Cursor 대비 무료 모델 접근 — ByteDance 텔레메트리·프라이버시 주의
원본 →
AI 코딩 도구

Function Calling vs Tool Use — OpenAI·Anthropic·Gemini 프로덕션 패턴 비교(2026)

세 제공자 모두 JSON Schema 기반 도구 호출을 지원하지만 API 설계가 다르다. OpenAI: tools+tool_calls, arguments는 JSON string(파싱 필요), strict:true로 스키마 강제. Anthropic: tool_use content block, arguments는 dict(사전 파싱), Tool Search로 대규모 레지스트리 lazy-load, 텍스트·도구 혼합 응답. Gemini: function_declarations, Google 서비스 통합. 공통: parallel tool calls, agentic loop는 직접 구현 또는 LiteLLM/Vercel AI SDK. Gemma·Qwen 모델별 언급과 달리 '크로스 프로바이더 프로덕션' 관점.

  • OpenAI: tool_calls·JSON string args·strict:true / Anthropic: tool_use block·dict args·Tool Search
  • Gemini: function_declarations·Google 서비스 grounding — parallel calls 공통
  • 프로덕션: agentic loop 직접 구현 또는 LiteLLM 추상화, is_error 플래그(Anthropic) 주의
원본 →
AI 코딩 도구

MMLU-Pro·HumanEval+ — 정적 벤치마크 포화와 EvalPlus 80x 테스트 강화(2026)

기존 MMLU·HumanEval은 프론티어 모델이 88-94%에 몰려 변별력이 사라졌다. MMLU-Pro = 12,000 graduate-level·10지선다·추론 중심(MMLU 대비 16-33%p 하락). HumanEval+ = EvalPlus 프레임워크로 테스트 케이스 80배 확장, 기능 정확도 엄격 평가. 그러나 2026년 MMLU-Pro도 88-94% 밴드로 재포화 중 — 정적 벤치 단독 신뢰 불가. SWE-bench·Terminal-Bench·Arena Elo와 포트폴리오로 triangulate해야 한다.

  • MMLU-Pro — 12k문항·10지선다·추론, 원 MMLU 16-33%p harder, 그러나 2026 재포화
  • HumanEval+ — EvalPlus 80x 테스트, Phi-4 Reasoning ~92.9% 등 코딩 정확도 엄격 측정
  • 정적 벤치 단독 금지 — SWE-bench·GPQA·Arena·자체 50-500 prompt eval 병행
원본 →
AI 코딩 도구

Mojo — Python 문법·C++ 속도의 AI 네이티브 언어, 1.0 beta(2026-05)

Modular(Swift·LLVM 창시자)가 MLIR 기반으로 만든 AI 네이티브 프로그래밍 언어. Python과 자연 상호운용(import/export)하면서 컴파일·정적 타입으로 GPU·CPU·ASIC 커널을 한 언어에서 작성. 2026-05 Mojo 1.0.0 beta 1 출시, 표준 라이브러리는 Apache-2.0 오픈소스, 컴파일러는 Fall 2026 오픈소스 예정. 두 언어 문제(Python 프로토타입→C++/CUDA 재작성)를 줄이려는 목표 — AI 인프라·커스텀 연산·HPC에 적합, 아직 프로덕션 기반으로 쓰기엔 API 변동·컴파일러 클로즈드 소스 리스크.

  • MLIR 기반 — CPU·GPU·가속기 하드웨어 비종속, Python 생태계와 양방향 interop
  • 2026-05 1.0.0b1 — 핵심 언어 기능 안정화 목표, stdlib Apache-2.0
  • Fall 2026 컴파일러 OSS 예정 — 현재는 beta·closed compiler, AI 커널/HPC 학습용
원본 →
AI 코딩 도구

Haystack — deepset의 프로덕션 RAG·에이전트 오케스트레이션 프레임워크(Apache-2.0)

deepset의 오픈소스 Python AI 오케스트레이션 프레임워크. 컴포넌트+파이프라인(DAG)으로 retrieval·routing·memory·generation을 명시적으로 조합 — LangChain/LlamaIndex와 달리 프로덕션 RAG에 특화. 내장 hybrid retrieval(BM25+밀집·RRF), YAML 정의 파이프라인, MRR/NDCG/faithfulness 평가 프레임워크. v2.30+(2026-06) 에이전트 워크플로·멀티모달·160+ 커넥터. Hayhooks로 REST API 노출, Enterprise Platform으로 거버넌스·관측성.

  • 컴포넌트 DAG — retrieval·router·memory·generator를 독립 교체·테스트
  • 내장 hybrid search·평가(MRR·faithfulness) — YAML 파이프라인 버전 관리
  • LlamaIndex(데이터)·LangChain(에이전트)과 하이브리드 스택으로 조합 가능
원본 →
AI 코딩 도구

Chainlit — Python만으로 ChatGPT급 LLM 앱 UI, 2025-05부터 커뮤니티 유지보수

@cl.on_message·@cl.step 데코레이터로 프론트엔드 없이 대화형 LLM 앱을 만드는 오픈소스 Python 프레임워크. LangChain·LlamaIndex·MCP·RAG 통합, 중간 단계(step) 시각화, 파일 업로드·인증·세션 지속. 2025-05-01 원 팀이 후퇴하고 @Chainlit/chainlit-maintainers가 공식 인계 — v2.11+ 유지보수·보안 패치(CVE-2026-22218/22219) 필수. Gradio(데모·API)와 달리 에이전트 워크플로 중간 과정 노출에 강점 — 내부 도구·RAG PoC에 적합.

  • @cl.on_message·@cl.step — JS/CSS 없이 ChatGPT형 UI·중간 단계 시각화
  • LangChain·LlamaIndex·MCP·ChromaDB 등 생태계 통합
  • 2025-05 커뮤니티 유지보수 전환 — v2.9.4+ 보안 패치 필수
원본 →
AI 코딩 도구

OpenAI Triton — Python DSL로 GPU 커널 작성, Blackwell CUDA Tile IR 백엔드(2026)

OpenAI Triton은 타일 기반 Python DSL로 CUDA 경험 없이 GPU 커널을 작성하는 오픈소스 컴파일러(MIT). PyTorch·vLLM·FlashAttention 등 AI 스택의 커스텀 연산 기반. 2026 NVIDIA가 Triton-to-TileIR 백엔드를 공식 통합 — ENABLE_TILE=1로 Blackwell GPU에서 CUDA Tile IR 직접 타겟(CUDA 13.1+). AMD ROCm·NVIDIA PTX 양쪽 지원으로 벤더 락인 완화. occupancy·num_ctas 튜닝이 Tile IR 성능의 핵심 — tensor-of-pointer 패턴은 TMA API 전환 전까지 비효율.

  • 타일 기반 Python DSL — MLIR→PTX/Tile IR, CUDA 전문 지식 없이 커널 작성
  • NVIDIA Triton-to-TileIR — Blackwell·CUDA 13.1, ENABLE_TILE=1로 차세대 Tensor Core
  • MIT·멀티벤더(AMD·NVIDIA) — AI 프레임워크 커스텀 연산의 사실상 표준
원본 →
AI 코딩 도구

TensorRT-LLM — NVIDIA GPU LLM 추론 최적화, AutoDeploy·FP4·PD 분리(2026)

NVIDIA의 오픈소스 LLM 추론 가속 라이브러리. PagedAttention·in-flight batching·FP8/FP4/NVFP4 양자화·speculative decoding(EAGLE-3)·TP/PP/EP/CP 병렬. v1.0은 PyTorch-native 모델 작성+안정 LLM API — vLLM·SGLang·Triton Server·NVIDIA Dynamo와 통합. 2026 AutoDeploy(beta)는 off-the-shelf PyTorch 모델을 컴파일러가 자동 최적화(수동 재구현 불필요). Disaggregated serving(beta)로 prefill·decode GPU 분리. B200 FP4·H100 FP8 네이티브.

  • Paged KV·in-flight batching·FP4/FP8·speculative decoding — NVIDIA HW 특화
  • AutoDeploy(beta) — PyTorch 모델→추론 최적화 그래프 자동 컴파일
  • vLLM 대비 — NVIDIA GPU·엔터프라이즈 멀티노드·NIM/Triton 생태계 깊이
원본 →
AI 코딩 도구

ONNX Runtime GenAI — 크로스플랫폼 GenAI 추론, Foundry Local·Android·WebGPU

Microsoft ONNX Runtime GenAI는 LLM·VLM·Whisper 등 생성 AI의 pre/post·KV cache·sampling·grammar(tool calling) 전체 루프를 추상화. Linux·Windows·macOS·Android, CPU·CUDA·DirectML·TensorRT-RTX·OpenVINO·QNN·WebGPU EP. v0.14(2026-05) — Llama·Phi·Mistral·Gemma·Qwen·DeepSeek·Whisper 등. Foundry Local·Windows ML·VS Code AI Toolkit 구동. LiteRT(모바일 TFLite)와 달리 ONNX 포맷·PyTorch export 경로 — 크로스플랫폼 배포·엔터프라이즈 Windows에 강점.

  • GenAI 전체 루프 — pre/post·KV cache·sampling·grammar·tool calling
  • CPU·CUDA·DirectML·QNN·WebGPU — Android·Windows·Linux 크로스플랫폼
  • Foundry Local·Windows ML 구동 — LiteRT(TFLite)와 ONNX 경로 선택
원본 →
AI 코딩 도구

DVC — Git for Data, ML 파이프라인·실험·대용량 아티팩트 버전 관리

Data Version Control(DVC)은 Git이 못 다루는 대용량 데이터·모델·실험을 메타파일(.dvc·dvc.yaml·dvc.lock)로 Git에 연결하고 실제 파일은 S3·GCS·Drive 등 원격 저장소에 둔다. dvc stage add→dvc repro로 Makefile형 ML 파이프라인 DAG — 변경된 스테이지만 재실행. dvc exp run으로 실험 분기·하이퍼파라미터 비교. LLM 파인튜닝·LoRA 체크포인트·데이터셋도 CI/CD(dvc push/pull)로 자동 버전 관리. MLflow(실험 추적)와 상호보완 — DVC는 데이터·파이프라인 재현성.

  • dvc.yaml DAG — dvc repro로 변경 스테이지만 재실행, dvc.lock으로 재현성
  • 원격 저장(S3·GCS·Drive) — Git에는 메타만, 대용량은 클라우드
  • LLM 파인튜닝·LoRA·데이터셋 CI/CD — MLflow(추적)와 역할 분리
원본 →
AI 코딩 도구

Gradio 5 — ML 데모·API를 Python 몇 줄로, SSR·보안·MCP(2026)

Hugging Face Gradio 5는 ML 모델·LLM·임의 Python 함수를 웹 UI+자동 REST API로 노출. Interface(단순)·Blocks(복합)·ChatInterface(대화) 3패턴, 40+ 컴포넌트. v5 핵심: server-side rendering(로딩 스피너 제거)·Groovy(Python→JS 트랜스파일)·FastRTC(저지연 A/V)·3rd-party 보안 감사. Hugging Face Spaces 무료 호스팅·MCP 연동. Chainlit(에이전트 중간과정)과 달리 모델 데모·API 마이크로서비스에 특화 — Gradio 6(2026) PWA·멀티페이지 예고.

  • gr.Interface·Blocks·ChatInterface — JS 없이 UI+자동 REST API
  • v5 SSR·Groovy·FastRTC·보안 감사 — 프로덕션 ML 앱 기반
  • HF Spaces 무료 호스팅·MCP — Chainlit(에이전트 UI)과 용도 분리
원본 →
AI 코딩 도구

Ray Serve LLM — 멀티노드·멀티모델 LLM 분산 서빙, PD 분리·OpenAI API(2026)

Ray Serve LLM은 vLLM/SGLang 엔진 위에 멀티노드 분산·오토스케일·장애 복구를 얹는 프로덕션 LLM 서빙 프레임워크. pipeline/tensor/expert parallelism·prefill-decode disaggregation·prefix-aware 라우팅·Multi-LoRA. Ray 2.56+(2026) HAProxy ingress·direct streaming·vLLM Ray executor v2로 오케스트레이션 오버헤드 대폭 감소 — GKE 벤치에서 5x throughput·8x latency 개선. BentoML(단일 노드 빠른 배포)과 달리 클러스터 전체를 하나의 LLM 서비스로 다루는 레이어.

  • pip install ray[serve,llm] — vLLM/SGLang 엔진·OpenAI-compatible API
  • PD disaggregation·Wide-EP·Multi-LoRA — 멀티노드 MoE·대형 모델
  • Ray 2.56+ HAProxy·direct streaming — GKE 5x throughput, BentoML과 역할 분리
원본 →
AI 코딩 도구

Hugging Face TGI — LLM 서빙 툴킷, 2025-12 maintenance mode·vLLM/SGLang 이주

Text Generation Inference(TGI)는 Rust+Python 기반 LLM 프로덕션 서빙 툴킷 — continuous batching·tensor parallelism·quantization·토큰 스트리밍. Hugging Chat·Inference API 구동. 2025-12-11 maintenance mode 전환 — bug fix·doc만 수용, HF는 vLLM·SGLang을 신규 배포 권장. v3.3.7(2025-12) 마지막 릴리스, GitHub archived. 기존 TGI 배포는 동작하지만 신규 모델·기능 없음 — long-context(13x faster prefill) 강점 있었으나 마이그레이션 계획 필수. vLLM 카드와 달리 레거시·이주 관점.

  • 2025-12-11 maintenance mode — HF 공식: 신규는 vLLM·SGLang
  • v3.3.7 마지막 — continuous batching·TP·quantization·OpenAI API
  • 기존 TGI → vLLM/SGLang 마이그레이션 계획 — long-context 레거시만 유지
원본 →
AI 코딩 도구

Cursor Auto-review — desktop·SDK headless 권한 classifier·permissions.json

Cursor Auto-review는 로컬 코딩 에이전트의 자율성을 전부 허용하거나 전부 묻는 방식 대신, 다음 행동의 위험도를 문맥에서 판단하는 안전장치다. Desktop(2026-02 GA·신규 사용자 default) — classifier가 도구 호출 전 사용자 의도·결과 위험·파일 맥락을 검토, 차단 시 부모 에이전트에 피드백. Cursor SDK v3.7(2026-06-04) — local.autoReview:true로 headless/CI run도 classifier 경유, permissions.json 자연어 지침으로 steer. JsonlLocalAgentStore — SQLite 대신 append-only JSONL로 agent state diff·VC check-in. nested subagents any depth·local.customTools MCP-free function exposure. vs allowManagedHooksOnly(Claude org lock) ·AGT intervention points — Auto-review=per-tool autonomy dial not org policy engine.

  • Desktop classifier — block feedback to parent, not popup-only deny
  • SDK local.autoReview — headless CI without human-in-loop bypass
  • JsonlLocalAgentStore — resume agent after restart, plain-text audit trail
원본 →
AI 코딩 도구

Patch the Planet — AI 보안 발견은 '사람 검증'을 지나야 패치가 된다

OpenAI의 Patch the Planet은 Daybreak 아래에서 Trail of Bits와 함께 오픈소스 유지관리자를 돕는 AI 보안 패치 프로그램이다. 2026-06-22 공개 글은 핵심을 분명히 한다. AI가 취약점 후보를 더 많이 찾는 것만으로는 사용자를 보호하지 못하고, 이미 바쁜 유지관리자에게 미검증 리포트가 쏟아지면 부담만 늘어난다. 그래서 프로그램은 frontier 모델과 Codex Security로 분석·패치·테스트·문서화를 지원하되, Trail of Bits 보안 엔지니어가 재현, 중복 제거, 심각도 재평가, 프로젝트 문서·위협모델 대조를 거쳐 유지관리자에게 전달한다. 초기 참여 프로젝트는 cURL, NATS Server, pyca/cryptography, Sigstore, aiohttp, Go, freenginx, Python, python.org 등이고, Trail of Bits는 19개 프로젝트에서 수백 건 이슈와 수십 개 패치를 보고했다고 밝혔다. 실무 교훈은 AI 보안 자동화의 병목이 탐지가 아니라 검증·우선순위·패치 수용이라는 점이다.

  • AI 발견 → 전문가 재현·중복 제거·심각도 재평가 → 유지관리자 승인 순서
  • Codex Security와 frontier 모델은 분석·패치·테스트·문서화 지원 도구로 사용
  • 오픈소스 보안 자동화의 핵심 병목은 더 많은 알림이 아니라 검증된 패치 흐름
원본 →
AI 코딩 도구

Vercel AI SDK 6 — ToolLoopAgent·스트리밍·AI Gateway를 TypeScript 한 스택으로

Vercel AI SDK 6(2025-12 GA)는 React·Next.js·Node.js에서 LLM·에이전트·UI 스트리밍을 통합하는 TypeScript 툴킷이다. AI SDK Core(generateText/streamText)와 AI SDK UI(useChat 등)로 나뉘며, v6의 핵심은 ToolLoopAgent — model·instructions·tools·stopCondition을 한 번 정의하면 채팅 UI·백그라운드 job·API 엔드포인트에서 재사용. tool execution approval(needsApproval)로 휴먼 인더 루프, structured output+tool calling을 output 스키마(Zod)로 동시 지원. Vercel AI Gateway와 model string 하나('anthropic/claude-sonnet-4.6')로 400+ 모델 라우팅, DevTools로 step별 latency·토큰 추적. LangChain/LlamaIndex adapter rewrite·MCP·reranking·video generation(v6) 추가.

  • ToolLoopAgent — agent.stream()로 multi-step tool loop·structured output·approval 통합
  • AI Gateway 연동 — model ID string만으로 멀티 프로바이더, OIDC keyless auth(Vercel 배포)
  • OpenRouter(게이트웨이)와 달리 프론트엔드 UI streaming·React hooks·에이전트 추상화에 특화
원본 →
AI 코딩 도구

Portkey AI Gateway — 1600+ LLM 라우팅·폴백·가드레일을 Config JSON으로 분리

Portkey는 OpenAI 호환 universal API 위에 Gateway Config(JSON)로 라우팅 전략을 코드 밖으로 빼는 AI 게이트웨이다. Single·Load Balance·Fallback·Conditional(메타데이터 조건) 4모드 — config ID만 바꿔 재배포 없이 모델·프로바이더·예산·가드레일을 교체. 1600+ LLM·50+ 가드레일, 자동 retry·circuit breaker·semantic caching·PII sanitization. OpenAI SDK base_url='https://api.portkey.ai/v1' + config 헤더로 2분 내 통합. 오픈소스 self-host(npx @portkey-ai/gateway) + 관리형 SaaS — 로그 기록 한도 초과해도 라우팅은 계속(관측만 중단). OpenRouter(모델 마켓플레이스)와 달리 엔터프라이즈 거버넌스·조건부 라우팅·가드레일에 특화.

  • Gateway Config — conditional routing·fallback chain·load balance를 JSON config ID로 분리
  • OpenAI SDK 호환 — base_url+config 헤더, 40+ pre-built guardrail·semantic cache
  • OSS self-host + managed — OpenRouter(모델 선택)와 다른 프로덕션 제어·관측 레이어
원본 →
AI 코딩 도구

Spring AI 2.0 — Java 엔터프라이즈 LLM 통합, ChatClient·RAG·MCP·Spring Boot 4

Spring AI는 Spring Boot 생태계에 LLM·벡터DB·RAG·tool calling을 POJO·auto-configuration으로 끼워 넣는 Java/Kotlin AI 프레임워크(Apache-2.0·~8.8k★). OpenAI·Anthropic·Azure·Bedrock·Ollama 등 10+ 프로바이더 starter — 의존성+properties만 바꿔 모델 교체. ChatClient fluent API·Advisors(RAG·memory·logging)·자동 tool calling·structured output. 2026 Spring AI 2.0 RC — Spring Boot 4.x·v3 Language Model Spec·MCP 확장·immutable options. Microsoft Agent Framework(멀티에이전트 오케스트레이션)와 달리 '기존 Spring 앱에 LLM 한 기능 추가' 레이어 — start.spring.io에서 모델·벡터스토어 선택 후 바로 시작.

  • ChatClient + Advisors — RAG·memory·observability를 Spring 패턴으로, starter로 프로바이더 교체
  • Spring AI 2.0 RC — Boot 4.x·MCP·immutable API, 1.1.x는 Boot 3.5.x 유지
  • MS Agent Framework(에이전트 오케스트레이션)와 역할 분리 — Java 엔터프라이즈 LLM 통합 레이어
원본 →
AI 코딩 도구

Prefect + AI — Python 네이티브 durable execution, Pydantic AI 에이전트 상태 복구

Prefect는 YAML DAG 대신 Python control flow(while·분기·휴먼 승인)를 그대로 따르는 워크플로 오케스트레이터(v3.3·Apache-2.0·~22k★). LLM 에이전트는 rate limit·크래시에서 상태가 유실되는데, PrefectAgent(Pydantic AI 공식 통합)가 LLM 호출·tool call을 task로 기록해 실패 시 완료 task는 캐시에서 skip·실패 지점부터 재개 — redundant LLM API call 방지. Temporal(CQRS durable execution)과 달리 Python 데코레이터(@flow/@task) 한 줄·self-host server·에이전트 state machine(while loop·runtime branching) 네이티브. 2026 AI Teams 솔루션 — Horizon(MCP context serving)과 조합.

  • PrefectAgent — Pydantic AI agent를 flow/task로 wrap, 실패 시 LLM 재호출 없이 재개
  • Python control flow 네이티브 — precompiled DAG 없이 while·분기·human-in-the-loop
  • Temporal(인프라)과 역할 분리 — Python ML·데이터 팀 친화적 워크플로·에이전트 오케스트레이션
원본 →
AI 코딩 도구

ElevenLabs TTS API — Flash v2.5 75ms·보이스 클로닝·WebSocket 스트리밍

ElevenLabs는 REST·WebSocket TTS API로 32+ 언어·수천 보이스·Instant/Professional voice cloning을 제공하는 상용 음성 합성 플랫폼이다. Flash v2.5는 ~75ms TTFB로 실시간 voice agent에, Multilingual v2는 10,000자 long-form 내레이션에. POST /v1/text-to-speech/{voice_id} + xi-api-key, streaming endpoint·WebSocket stream-input으로 bidirectional 저지연. Speech-to-speech·voice isolation·dubbing API 확장. GPT-SoVITS(오픈소스 로컬 클로닝)와 달리 상용 SLA·글로벌 CDN·latency optimization guide·region routing(api.us.elevenlabs.io) — 프로덕션 voice agent·오디오북·다국어 더빙에 특화.

  • Flash v2.5 ~75ms — streaming·WebSocket, Multilingual v2 long-form·Eleven v3 expressiveness
  • Voice cloning·STS·dubbing — Python/TS SDK, xi-api-key 인증
  • GPT-SoVITS(로컬 OSS)와 달리 상용 API·latency SLA·70+ 언어 Eleven v3
원본 →
AI 코딩 도구

Mintlify — AI-native docs, Workflows PR 자동화·llms.txt·MCP 서버

Mintlify는 MDX+Git bi-directional sync로 docs-as-code를 유지하면서 AI 에이전트·검색엔진에 최적화된 문서 플랫폼이다. Anthropic·Cursor·Perplexity·Coinbase 등이 사용. Workflows agent가 코드 변경을 모니터링→doc 업데이트 PR 자동 생성, OpenAPI/AsyncAPI→interactive API playground. AI-native delivery: /llms.txt·skill.md·MCP server 자동 생성, content negotiation(HTML vs Markdown·토큰 30x 절감), AI traffic analytics(어떤 에이전트가 어떤 페이지를 읽는지). github.com→mintlify.com URL swap으로 레포에서 초기 docs 자동 생성. llms.txt(표준) 카드와 달리 풀스택 doc platform·CI 연동·API playground.

  • Workflows — 코드 diff→doc PR 자동, OpenAPI→playground·bi-directional Git sync
  • AI-native — llms.txt·MCP·Markdown content negotiation·agent traffic analytics
  • llms.txt(표준)와 달리 authoring·hosting·API reference·enterprise governance 통합
원본 →
AI 코딩 도구

Determined AI — PyTorch·TF 분산학습·HP 튜닝·GPU 스케줄링 올인원(MIT)

Determined AI(HPE)는 분산 딥러닝·하이퍼파라미터 튜닝·실험 추적·GPU 리소스 관리를 YAML 하나로 묶는 오픈소스 ML 플랫폼(MIT·v0.38+). resources.slots_per_trial: 8로 multi-GPU·multi-node 자동 분산 — ring all-reduce·computation-communication overlap. Adaptive ASHA searcher로 HP 탐색, Web UI에서 loss curve·cluster utilization·model registry. det deploy로 local·AWS·GCP·K8s·Slurm 배포. DVC(데이터 버전)·MLflow(실험)와 달리 'GPU 클러스터에서 학습 job을 돌리는' 인프라 — Axolotl(YAML 파인튜닝)과 조합해 multi-GPU LLM 학습 orchestration.

  • slots_per_trial — YAML만으로 multi-GPU/multi-node, weak scaling(global_batch_size 비례)
  • Adaptive ASHA HP tuning·experiment tracking·model registry·cluster scheduler
  • DVC(데이터)·Ray Serve(서빙)와 역할 분리 — 분산 학습·GPU 스케줄링 플랫폼
원본 →
AI 코딩 도구

Kong AI Gateway — OpenAI 호환 universal API·semantic routing·Redis VSS

Kong Gateway 3.6+ AI Gateway는 AI Proxy/AI Proxy Advanced 플러그인으로 OpenAI·Bedrock·Mistral 등 1600+ LLM을 provider-agnostic API 하나로 정규화한다. round-robin·priority·lowest-latency·semantic matching(프롬프트 intent→모델 description 벡터 매칭·Redis/pgvector) 로드밸런싱, fallback·circuit breaker·retry·PII sanitization·token-based rate limit. v3.10+ cross-provider fallback(OpenAI→Bedrock). Konnect·K8s·self-hosted 동일 플러그인. Portkey(관리형 AI gateway SaaS)와 달리 기존 Kong Gateway 인프라 위에 AI 레이어를 얹는 API-first 패턴 — MCP·A2A 트래픽 governance까지 확장.

  • AI Proxy Advanced — semantic routing(Redis VSS)·priority·fallback·cross-provider(v3.10+)
  • OpenAI-compatible universal API — credential 중앙관리·streaming·usage analytics
  • Portkey(SaaS gateway)와 달리 Kong 인프라 기존 사용자·API-first·MCP/A2A governance
원본 →
AI 코딩 도구

Runway Gen-3 Alpha Turbo API — image-to-video·비동기 task·5초 $0.25

Runway는 Gen-3 Alpha Turbo를 REST API(task 기반 비동기)로 제공하는 AI 비디오 생성 플랫폼이다. Python/Node SDK(runwayml), POST image-to-video→task ID→poll→output URL. gen3a_turbo 모델, 5초 $0.25·10초 $0.50(credit $0.01), prompt 512자·ratio 16:9/9:16. X-Runway-Version: 2024-11-06 필수 pin. Gen-4 Turbo 등 신규 모델 확장 중. 'Powered by Runway' 배너 필수. Meshy(3D)·Sora(미공개 API)와 달리 프로덕션 video generation API·motion transfer·cinematic control — 마케팅·UGC·프로토타입 영상 자동화.

  • Task async — create→poll SUCCEEDED→download, gen3a_turbo image-to-video
  • Python/Node SDK·credit billing($10 min)·X-Runway-Version header pin
  • Meshy(3D asset)와 달리 2D video generation API·motion transfer
원본 →
AI 코딩 도구

ZenML — Python-first ML 파이프라인 오케스트레이션, Dynamic Pipelines로 에이전트 워크플로까지(Apache-2.0)

ZenML은 MLflow·Vertex·K8s·SageMaker 등과 플러그인으로 연결되는 오픈소스 MLOps 프레임워크다. Orchestrator+Artifact Store+Metadata Store 3 Stack Component로 step 단위 캐싱·재현·협업을 제공한다. 2025-2026 Dynamic Pipelines는 런타임에 DAG를 생성 — fan-out/fan-in·step.submit() 병렬·zenml.wait() 휴먼 게이트·에이전트 RAG fan-out에 budget limit을 걸 수 있다. Prefect(범용 durable execution)·MLflow(실험 추적)·DVC(데이터 버전)와 달리 "ML step 파이프라인+클라우드 오케스트레이터" 레이어에 특화.

  • pip install zenml → Stack(Orchestrator·Artifact·Metadata) 조합으로 재현 가능 파이프라인
  • Dynamic Pipelines — 런타임 DAG·map/reduce·isolated runtime·K8s/Vertex/SageMaker
  • MLflow/W&B experiment tracker 플러그인 — Prefect·DVC와 역할 분리
원본 →
AI 코딩 도구

Metaflow — Netflix가 만든 human-centric ML, 노트북처럼 짜고 Maestro로 프로덕션까지(Apache-2.0)

Metaflow는 Netflix가 2019년 오픈소스한 "데이터 과학자가 인프라 몰라도" 노트북→프로덕션까지 가는 Python ML 프레임워크다. Outerbounds가 유지하며 Netflix 단독 3,000+ ML 프로젝트·수억 job을 처리한다. @step·@batch·@kubernetes 데코레이터로 로컬 실행→클라우드 스케일을 코드 변경 없이 전환, 모든 run의 코드·데이터·아티팩트를 자동 버전. Metaflow 2.19 Spin은 셀 단위처럼 개별 step만 반복 실행해 개발 속도를 높인다. Netflix는 대규모 오케스트레이션을 오픈소스 Maestro와 연동 — ZenML(파이프라인 조립)과 달리 DS 친화적 flow+데코레이터 모델.

  • @step/@batch/@kubernetes — 로컬→AWS Step Functions·K8s·Airflow·Maestro
  • Spin(2.19) — step 단위 iterative debug, 노트북 UX+프로덕션 workflow
  • 자동 run 버전(코드·데이터·아티팩트) — MLflow(추적 UI)와 상호보완
원본 →
AI 코딩 도구

ClearML — 2줄 코드 실험 추적+Agent+파이프라인+서빙 올인원 MLOps(Apache-2.0·v2.1.8)

ClearML(구 Trains)은 Task.init() 2줄로 코드·HP·메트릭·GPU·모델·콘솔·플롯을 자동 로깅하는 MLOps/LLMOps 플랫폼이다. ClearML Server(셀프호스트·SaaS)+ClearML Agent(K8s/클라우드/bare-metal job 큐)+Model Serving(NVIDIA Triton·모니터링)까지 한 스위트. 데이터셋 버전·HP 최적화(PBT)·원격 GPU worker 큐·GenAI job orchestration. MLflow(Linux Foundation·LLM Gateway 확장)와 달리 experiment+orchestration+serving을 단일 제품으로 — W&B(SaaS UX)와 달리 셀프호스트 $0 가능.

  • Task.init() 2줄 — PyTorch·TF·HF auto-logging, git diff·환경·GPU 자동 캡처
  • ClearML Agent — K8s/cloud GPU 큐·파이프라인·원격 실행
  • Model Serving(Triton) — MLflow(추적)와 달리 학습→서빙→모니터링 통합
원본 →
AI 코딩 도구

Comet ML — 실험 추적·모델 레지스트리·팀 협업 SaaS, VPC/on-prem 지원

Comet ML은 Uber·Autodesk·Ancestry 등 Fortune 100이 쓰는 실험 관리·모델 레지스트리 플랫폼이다. Experiment() 2줄로 파라미터·메트릭·코드 스냅샷·아티팩트·시스템 메트릭을 자동 로깅 — PyTorch·TF·Scikit·HF auto-logging. 2025-2026 compare view 10실험·parallel coordinates·block-based report editor·artifact 기반 실험 필터·Model Registry webhook·staging/production 태그. W&B Weave(LLM trace)·W&B Registry(artifact CI/CD)와 달리 전통 ML 실험 UX·협업·VPC/on-prem에 특화 — MLflow(오픈소스)와 달리 SaaS polish.

  • Experiment() 2줄 — 코드 스냅샷·offline/resume·프레임워크 auto-logging
  • Model Registry — 버전·태그·webhook·production baseline 비교
  • W&B Weave(LLM)와 역할 분리 — ML 실험 compare·report·팀 workspace
원본 →
AI 코딩 도구

Marimo — reactive Python 노트북, hidden state 없이 Git-friendly .py(Apache-2.0·~21k★)

Marimo는 Jupyter hidden state·out-of-order 실행 문제를 reactive execution으로 해결하는 Python 노트북이다. 셀 변경 시 dependent 셀 자동 재실행(또는 lazy stale 표시), 변수 삭제 시 program memory에서 제거. 노트북이 JSON이 아니라 순수 .py — git diff·merge·CLI 실행(marimo run)·웹 앱 배포·내장 SQL·Sliders/Tables 인터랙션. v0.23+(2026-06) — Jupyter·Streamlit·ipywidgets·papermill 대체 지향. Gradio(ML UI)·Chainlit(에이전트 UI)과 달리 "재현 가능한 Python 프로그램"으로서의 노트북.

  • reactive execution — dependency 자동 추적, hidden state 제거
  • 순수 .py 저장 — git-friendly·marimo run·앱 배포·SQL 내장
  • lazy runtime — expensive 셀 autorun 방지, Jupyter 대안
원본 →
AI 코딩 도구

AgentOps — 에이전트 전용 옵저버빌리티, time-travel debugging·400+ LLM 비용 추적

AgentOps는 CrewAI·LangGraph·AutoGen(AG2)·Agno·OpenAI Agents SDK 등에 2줄(agentops.init/end_session)로 붙는 에이전트 옵저버빌리티 SDK다. monkey-patch로 LLM 호출·tool call·multi-agent decision tree를 span hierarchy로 캡처 — prompt/completion·토큰·모델·temperature까지. time-travel debugging으로 세션을 step-by-step replay, infinite loop·비용 폭주($5k/3h) 원인 추적. LangSmith(LangChain)·Langfuse(OTel LLM trace)와 달리 "에이전트 reasoning chain+비용"에 특화 — Braintrust(eval-first)와 역할 분리.

  • pip install agentops → init()+end_session() 2줄, CrewAI·LangGraph·AutoGen 자동 계측
  • time-travel replay — multi-agent decision tree·토큰/비용 per operation
  • Langfuse(범용 LLM trace)와 달리 에이전트 reasoning·tool loop 디버깅
원본 →
AI 코딩 도구

Sentence Transformers — 임베딩·reranker·sparse encoder, v5.6 멀티모달+AI 학습 Agent Skill(HF·Apache-2.0)

Sentence Transformers(SBERT)는 Hugging Face가 2025년 인수한 임베딩 라이브러리 — 18k★·15,000+ 사전학습 모델·MTEB 리더보드 다수. SentenceTransformer.encode()·CrossEncoder reranker·Sparse Encoder(SPLADE)를 동일 API로 — semantic search·RAG·clustering·paraphrase. v5.4+ 멀티모달(text·image·audio·video) encoding, v5.5 train-sentence-transformers Agent Skill로 Claude/Codex/Cursor가 end-to-end fine-tuning. ColPali(멀티모달 RAG)와 달리 "범용 임베딩+reranker 파이프라인" 기반 — OpenAI embedding API(클라우드)와 달리 로컬·fine-tune 가능.

  • SentenceTransformer("all-MiniLM-L6-v2").encode() — 15k+ HF 모델·MTEB SOTA
  • v5.4 멀티모달·CrossEncoder reranker·Sparse Encoder(SPLADE)
  • v5.5 Agent Skill — AI 코딩 에이전트가 임베딩 fine-tuning end-to-end
원본 →
AI 코딩 도구

DeepL API — 프로덕션 번역 REST API, document·glossary·model_type(2026 v3.10)

DeepL API는 DeepL 번역 엔진을 REST로 제공 — text(/v2/translate)·document(PDF/DOCX/PPTX)·glossary·formality. 2025-03 GET/auth_key query 폐기 → POST+Authorization: DeepL-Auth-Key 헤더 필수. model_type으로 quality/latency 트레이드오ff, tag_handling v2(2025-10) HTML/XML 보존 개선. Python·JS·PHP·.NET·Java·Ruby 공식 SDK. Free(api-free.deepl.com) vs Pro(api.deepl.com). Google Cloud Translation(100+ 언어·AutoML)과 달리 "유럽어·문서 품질" 특화 — LLM 번역(컨텍스트)과 달리 deterministic·SLA 가능 API.

  • POST /v2/translate — text+target_lang, document API(PDF/DOCX) 별도
  • model_type·glossary·formality — 프로덕션 품질/속도 선택
  • Google Translate API와 달리 유럽어·문서 번역 품질·tag_handling v2
원본 →
AI 코딩 도구

Databricks Mosaic AI — Unity Catalog 거버넌스+AI Runtime GPU+Model Serving 250k QPS

Mosaic AI는 Databricks 위 엔터프라이즈 GenAI 플랫폼 — 학습·파인튜닝·서빙·에이전트·거버넌스를 Unity Catalog 하나로 묶는다. AI Runtime(2025 GA) — serverless NVIDIA A10/H100 on-demand, DBRX급 custom LLM 학습·LoRA 파인튜닝·MLflow 연동. Model Serving 250k+ QPS·자체 inference engine(vLLM 대비 1.5x 빠름 주장)·Agent Bricks·Unity AI Gateway. Determined AI(GPU 스케줄러)·Modal(서버리스)과 달리 "데이터 레이크+거버넌스+학습+서빙" 통합 — MLflow(추적)는 Mosaic AI의 한 컴포넌트.

  • AI Runtime — serverless GPU(A10/H100)·분산학습·LoRA·MLflow registry
  • Model Serving 250k QPS·자체 inference engine·Agent Bricks
  • Unity Catalog+AI Gateway — Determined AI(학습 infra)와 역할 분리
원본 →
AI 코딩 도구

Embedchain — 10줄 RAG 프로토타입, 30+ 데이터소스·Mem0 생태계(Apache-2.0)

Embedchain은 app.add(url)+app.query()로 RAG 파이프라인을 10줄 이내에 만드는 오픈소스 프레임워크다. PDF·YouTube·웹·Notion·CSV 등 30+ 소스 자동 로드→chunk→embed→vector store, Chroma·Pinecone·Qdrant·OpenAI·Ollama·HF LLM 교체 가능. 2026년 Mem0 생태계 편입 — Mem0(에이전트 장기 메모리)와 달리 "빠른 RAG ingestion+query" 특화. LlamaIndex(복잡 RAG·에이전트)·Haystack(프로덕션 파이프라인)·RAGFlow(딥 문서)와 달리 프로토타입·내부 도구 속도 최우선.

  • App().add(source).query() — chunk·embed·retrieve 자동, 30+ 소스
  • LLM·vector DB·embedding provider config 교체 — Mem0(메모리)와 역할 분리
  • LlamaIndex/Haystack과 달리 10줄 프로토타입·데모·내부 Q&A
원본 →
AI 코딩 도구

Kubeflow Pipelines v2 — K8s ML 워크플로 Python SDK, IR YAML·MLMD 아티팩트·Vertex 호환(Apache-2.0)

Kubeflow Pipelines(KFP) v2는 Kubernetes 위 ML 워크플로를 Python 데코레이터(@dsl.pipeline·@dsl.component)로 정의하는 오픈소스 플랫폼(Apache-2.0·v2.16+). v1 대비 Argo YAML 직결을 버리고 IR(Intermediate Representation) YAML로 컴파일 — Vertex AI Pipelines 등 다중 백엔드 지원. ML Metadata로 Dataset·Model·Metrics 아티팩트 추적, dsl.If·ParallelFor·캐싱·retry·GPU node selector. Dagster(데이터 자산)·ZenML(ML stack)·Prefect(범용 durable)와 달리 'K8s 네이티브 ML 파이프라인' 표준 — 기존 K8s 클러스터·Kubeflow Platform 위 배포.

  • @dsl.component·@dsl.pipeline — Python→IR YAML, Vertex AI·Argo 백엔드
  • MLMD 아티팩트 — Dataset·Model·Metrics lineage, 컴포넌트 캐싱
  • Dagster/ZenML과 역할 분리 — K8s 클러스터 ML 워크플로 표준
원본 →
AI 코딩 도구

Flyte 2 — pure Python 에이전트 런타임, self-healing·asyncio·Devbox 로컬 개발(v2.0.20)

Flyte 2(2026-06 v2.0.20)는 Netflix/Lyft 계보 워크플로 오케스트레이터의 근본적 재설계 — @workflow DSL 대신 pure Python(@env.task)·asyncio.gather·if/else·try/except. 동적 런타임 DAG·checkpointing·self-healing(실패 지점부터 재개)으로 장기 에이전트 워크플로에 특화. GenAI 예제(hello_agent.py)·LangGraph 통합·GPU/TPU·circuit breaker·OOM retrier 내장. flyte start devbox로 로컬 풀스택(Docker). OSS 백엔드는 2026년 공개 예정, 프로덕션은 Union.ai. Kubeflow(K8s DAG)·Prefect(범용)·ZenML(ML stack)과 달리 'durable agent runtime' 포지션.

  • Pure Python — @env.task·asyncio, Flyte 1 @workflow/@dynamic 마이그레이션
  • Self-healing·checkpoint — 장기 에이전트·fan-out 병렬, GenAI/LangGraph 예제
  • flyte start devbox — 로컬 풀백엔드+UI, Kubeflow와 역할 분리
원본 →
AI 코딩 도구

Evidently AI — ML+LLM 100+ eval·드리프트·모니터링, RAG·에이전트 품질 통합(Apache-2.0)

Evidently는 tabular ML부터 RAG·에이전트까지 100+ 내장 메트릭으로 evaluate·test·monitor하는 오픈소스 프레임워크(Apache-2.0·~25M 다운로드). Dataset+Descriptor+Report 파이프라인 — sentiment·toxicity·hallucination·data drift·LLM-as-judge. 오프라인 batch eval·CI/CD·self-host Monitoring UI(demo.evidentlyai.com). Arize Phoenix(OTel trace)·Langfuse(범용 LLM trace)와 달리 'ML+GenAI 품질 메트릭 라이브러리' — RAGAS(RAG eval)와 상호보완, DeepEval(Pytest)과 CI 게이트 조합.

  • 100+ metrics — data drift·LLM judge·RAG faithfulness·agent safety
  • Report+Test — batch eval·Monitoring UI self-host·Evidently Cloud
  • Phoenix/Langfuse와 역할 분리 — 품질 메트릭·드리프트 eval-first
원본 →
AI 코딩 도구

Hugging Face Spaces — Gradio·Docker ML 데모 무료 호스팅, ZeroGPU·1M+ Spaces

Hugging Face Spaces는 ML/LLM 데모를 Git push만으로 배포하는 무료(유료 GPU 업그레이드) 호스팅 플랫폼이다. SDK: Gradio(app.py)·Streamlit·Docker·Static HTML. 기본 16GB RAM·2 CPU·50GB disk, NVIDIA A100/L4·ZeroGPU(Pro 구독 on-demand GPU) 업그레이드. hf.co/new-space → app.py push → 자동 CI/CD 빌드. gr.load("space/name", src="spaces")로 Spaces 간 리믹스. Gradio 5(로컬 UI)·Modal(서버리스 GPU)과 달리 '공개 데모·프로토타입 배포' — llms.txt·MCP 없이도 URL 하나로 공유.

  • Gradio/Streamlit/Docker SDK — Git push CI/CD, app.py 자동 배포
  • ZeroGPU·A100/L4 — on-demand GPU, Pro 구독
  • Gradio 5(로컬)와 역할 분리 — 호스팅·공유·embed URL
원본 →
AI 코딩 도구

AgentBench FC — 8환경 LLM-as-Agent 벤치마크, Function Calling+AgentRL 통합(ICLR'24)

AgentBench(THUDM·ICLR 2024)는 LLM을 자율 에이전트로 평가하는 8환경 벤치마크 — OS shell·SQL·Knowledge Graph·Web Shopping·Web Browsing·ALFWorld 등. 2025-10 AgentBench FC는 function-calling 스타일+AgentRL end-to-end RL 프레임워크로 전환, fully-containerized 배포. Claude Opus 4.7 ~73% overall(2026 커뮤니티 추적). SWE-bench(코드 수정)·Terminal-Bench(터미널)와 달리 '범용 도구 사용·다중 환경 의사결정' — promptfoo(커스텀 eval)와 조합해 에이전트 선택 전 사전 검증.

  • 8 environments — OS·DB·KG·Web·ALFWorld, 5~50 turn multi-step
  • AgentBench FC — function calling+AgentRL, containerized 재현
  • SWE-bench와 역할 분리 — 범용 agent reasoning·tool use 평가
원본 →
AI 코딩 도구

온디바이스 ML 3종 — Core ML vs LiteRT vs ExecuTorch 2026 선택 가이드

2026년 모바일/엣지 ML 런타임은 플랫폼·export 파이프라인·모델 생태계 3축으로 갈린다. Core ML(Apple) — .mlpackage, ANE/GPU 직접 접근, 런타임 0, iOS/macOS 전용. LiteRT(구 TFLite) — Google 표준, CompiledModel API(NPU 100x), Android·iOS·Web·IoT, MediaPipe Tasks. ExecuTorch(Meta) — torch.export→.pte, 50KB·12+ 백엔드(CoreML delegate 포함), Instagram/WhatsApp 프로덕션. Apple-only+최대 ANE → Core ML. Google/Pixel NPU → LiteRT. PyTorch-first+cross-platform LLM → ExecuTorch(Apple에서 Core ML delegate).

  • Core ML — Apple 전용, ANE 직접, 런타임 의존성 0
  • LiteRT — CompiledModel NPU 100x, Qualcomm/MediaTek, 크로스플랫폼
  • ExecuTorch — PyTorch export, CoreML delegate, Meta 프로덕션 스케일
원본 →
AI 코딩 도구

Tabnine vs Copilot vs Cursor — IDE·에이전트·프라이버시 3축 2026 비교

2026년 AI 코딩 어시스턴트 3대 선택지. GitHub Copilot($10/월) — VS Code·JetBrains·Neovim 플러그인, GitHub PR·Actions·Workspace 통합, 가성비·폭넓은 IDE. Cursor($20/월) — VS Code 포크 AI-native IDE, Composer 멀티파일·코드베이스 인덱싱·에이전트 병렬, SWE-bench 강점. Tabnine($9~15/월) — VPC·on-prem·air-gapped 전체 스택, 코드가 인프라 밖으로 안 나감, 금융·의료·방산. Copilot=GitHub 워크플로, Cursor=IDE 1위 생산성, Tabnine=데이터 주권. Claude Code·Codex는 터미널/클라우드 축.

  • Copilot $10 — 플러그인·GitHub 생태계·Agent Workspace
  • Cursor $20 — AI-native IDE·Composer·worktree 병렬 에이전트
  • Tabnine — VPC/on-prem air-gapped, 프라이버시 non-negotiable 팀
원본 →
AI 코딩 도구

Fiddler AI — Centor Trust Models·Guardrails·에이전트 옵저버빌리티 엔터프라이즈

Fiddler AI는 ML·LLM·멀티에이전트를 통합 모니터링하는 엔터프라이즈 AI Observability+Security 플랫폼이다. Fiddler Centor(Trust) Models — in-environment 평가(<100ms), hallucination·toxicity·PII·drift 100+ 메트릭. Real-time Guardrails — prompt injection·유해 출력 차단. OTel trace→step-level agent debugging(Nielsen Ask Nielsen 사례). Arize Phoenix(OSS OTel trace)·Evidently(오픈소스 eval)와 달리 '엔터프라이즈 SOC2/HIPAA·Guardrails·agent lifecycle' — regulated industry 프로덕션.

  • Centor Trust Models — in-env eval, 100+ ML+LLM metrics, <100ms guardrails
  • Agent observability — OTel trace→span hierarchy, step-level RCA
  • Phoenix/Evidently와 역할 분리 — 엔터프라이즈 compliance+real-time block
원본 →
AI 코딩 도구

Optuna — define-by-run HP 최적화, TPE·Hyperband pruning·Optuna Dashboard(Apache-2.0·v4.9.0)

Optuna는 Preferred Networks 계열 오픈소스 hyperparameter optimization 프레임워크(Apache-2.0·v4.9.0·2026-06). define-by-run API로 Python if/for로 동적 search space 구성 — grid search 대비 TPE(Tree-structured Parzen Estimator) 샘플링+Hyperband/Median pruning으로 unpromising trial 조기 종료. study.optimize(objective, n_trials=100) 한 줄, PostgreSQL backend로 multi-worker 분산. Optuna Dashboard 실시간 web UI, AutoSampler·GPSampler로 multi-objective·constrained 최적화. W&B Sweeps(SaaS HP+실험 UI)와 달리 범용 OSS HP 엔진 — PyTorch·Ray Tune·MLflow와 조합.

  • define-by-run — 동적 search space, TPE+pruning으로 GPU 낭비 차단
  • PostgreSQL study — multi-worker 병렬, Optuna Dashboard 시각화
  • W&B Sweeps/Determined AI와 역할 분리 — OSS HP 엔진·프레임워크 무관
원본 →
AI 코딩 도구

Ray Train V2 — PyTorch·HF·JAX 분산 학습, async checkpoint·JaxTrainer(Apache-2.0·Ray 2.55+)

Ray Train은 단일 머신→클러스터 ML 학습/파인튜닝 스케일링 라이브러리(Apache-2.0·Ray 2.55+). 2025-08부터 Train V2가 기본 — Tune과 decouple, TorchTrainer·TensorFlowTrainer·JaxTrainer(TPU) 단일 컨트롤러 API. ray.train.torch.prepare_model()이 DDP·NCCL·gradient sync를 자동 처리, Ray Data와 결합해 HF datasets streaming+분산 학습. V2 신기능: async checkpoint(GPU I/O 중단 없음)·async validation·local mode 디버그. Ray Serve LLM(추론 서빙)과 역할 분리 — Train=학습, Serve=배포.

  • TorchTrainer+ScalingConfig — num_workers·use_gpu, DDP 자동
  • Train V2 — async checkpoint·validation, Tune decouple
  • Ray Serve와 역할 분리 — 학습(Train) vs 추론(Serve LLM)
원본 →
AI 코딩 도구

TruLens — RAG Triad·에이전트 eval, OTel trace·MLflow 3.10 scorer 통합(Snowflake OSS·v2.7)

TruLens(TruEra→Snowflake 인수 후 OSS 유지)는 feedback function으로 LLM 앱 품질을 측정하는 프레임워크다. RAG Triad(context relevance·groundedness·answer relevance)가 RAG eval 표준 어휘를 확립. 2026 v2.7 Unified Metric API — Metric 클래스로 Feedback·MetricConfig 통합, 7종 agentic eval(PlanAdherence·ToolSelection·ExecutionEfficiency 등). OTel span emit으로 Jaeger·Grafana·Datadog 연동, MLflow 3.10+ mlflow.genai.evaluate에 TruLens scorer first-class. DeepEval(Pytest CI)·promptfoo(회귀)·Phoenix(OTel trace UI)와 달리 커스텀 feedback+leaderboard 비교.

  • RAG Triad — context·groundedness·answer relevance 3축
  • Unified Metric API v2.7 — agent eval 7종, OTel native
  • MLflow scorer 통합 — DeepEval/promptfoo와 CI·회귀 조합
원본 →
AI 코딩 도구

Hugging Face Datasets v5 — load_dataset 한 줄·agent traces·Iceberg·100x streaming(Apache-2.0)

Hugging Face Datasets는 Hub+로컬 파일을 ML-ready dataloader로 변환하는 라이브러리(Apache-2.0·v5.0.0·2026-06). load_dataset("rajpurkar/squad") 한 줄, Arrow memory-map·streaming=True(Xet backend 100x faster). v5.0: agent traces(claude_code/pi/codex) teich 파싱→messages SFT, Apache Iceberg·3D mesh·robotics batching, multi-shard streaming shuffle. dataset.map(num_proc=N) 병렬 전처리, FAISS/Elasticsearch index 내장. DVC(Git for Data)와 달리 공개 Hub+전처리 파이프라인 — Ray Train·TRL·fine-tuning과 직결.

  • load_dataset — 467+ 언어·멀티모달·agent traces Hub
  • v5.0 streaming — Xet 100x, Iceberg·teich SFT messages
  • DVC와 역할 분리 — Hub 생태계·map(num_proc) 전처리
원본 →
AI 코딩 도구

NeMo Data Designer — Gretel 계보 synthetic data, dependency-aware·LLM-as-judge(Apache-2.0·v0.5.7)

NVIDIA NeMo Data Designer(구 Gretel, 2025-03 NVIDIA 인수)는 code-first synthetic data 생성 프레임워크(Apache-2.0·~1.6k★·v0.5.7). statistical sampler+LLM으로 scratch·seed data 생성, field dependency·Python/SQL/custom validator·LLM-as-judge scoring. preview mode→full-scale generation, NeMo Platform microservice로 Inference Gateway 경유 분산 job. Distilabel(Argilla·LLM teacher 파이프라인)과 달리 스키마·제약·검증 중심 SDG — fine-tuning·RAG eval·agent tool-use 데이터셋.

  • dependency-aware generation — validator·LLM judge 품질 게이트
  • NeMo Platform service — distributed job·artifact storage
  • Distilabel과 역할 분리 — 스키마 SDG vs LLM teacher 파이프라인
원본 →
AI 코딩 도구

OWASP LLM Top 10 2025 — GenAI 보안 10대 리스크, LLM01 Prompt Injection~LLM10 Unbounded Consumption

OWASP Top 10 for LLM Applications 2025(2024-11 GA)는 LLM 통합 앱 보안의 표준 awareness 문서다. LLM01 Prompt Injection·LLM02 Sensitive Info Disclosure·LLM03 Supply Chain·LLM04 Data/Model Poisoning·LLM05 Improper Output Handling·LLM06 Excessive Agency·LLM07 System Prompt Leakage(신규)·LLM08 Vector/Embedding Weaknesses(신규)·LLM09 Misinformation·LLM10 Unbounded Consumption. 2023 대비 agentic·RAG·비용 공격 벡터 반영. Garak(자동 스캔 도구)과 달리 위협 모델링 체크리스트 — 출력을 untrusted·도구 least-privilege·defense-in-depth가 실무 핵심.

  • 10 risks — prompt injection·excessive agency·embedding weakness 등
  • 2025 신규 — system prompt leakage·vector weakness·unbounded consumption
  • Garak/PyRIT(도구)과 역할 분리 — 표준 위협 모델·procurement questionnaire
원본 →
AI 코딩 도구

Langfuse vs LangSmith vs Phoenix — OTel LLM 옵저버빌리티 3축 2026 선택 가이드

2026년 LLM observability 3대 선택지. Langfuse(MIT·~2.3k org) — OTel 기반 self-host, prompt management·eval·cost tracking, EU on-prem·데이터 주권. LangSmith(LangChain) — managed SaaS, OpenAI·Anthropic·CrewAI·Pydantic AI 등 80+ 프레임워크·@traceable 계측, SmithDB+Polly+Insights Agent로 nested agent trace·failure cluster, online eval·PagerDuty. Arize Phoenix(ELv2·~10k★) — OpenInference OTel, single container·SQLite/Postgres 로컬 셀프호스팅, phoenix-evals RAG relevance·@experiment regression, RAG/embedding drift 특화 — Langfuse(프로덕션 SaaS/self-host) vs LangSmith(enterprise eval loop) vs Phoenix(로컬 디버깅·노트북). OpenLLMetry(instrumentation SDK)와 spec(GenAI semconv) 분리. 하이브리드: Phoenix(trace)+Langfuse(prompt)+DeepEval(CI) 조합 흔함.

  • Langfuse — MIT self-host, prompt·eval·cost, 데이터 주권
  • LangSmith — SaaS, SmithDB·Polly, 80+ framework·online eval
  • Phoenix — ELv2 OSS, OpenInference OTel, phoenix-evals·RAG drift·로컬 디버깅
원본 →
AI 코딩 도구

LLM API 비용 최적화 — routing·prefix cache·semantic cache·batch 4층 FinOps(2026)

2026년 LLM 프로덕션 비용은 routing+caching+batch 4층으로 60~80% 절감 사례가 보고된다. Model routing — 단순 분류·추출은 nano/mini, reasoning만 frontier, cascade(저가→escalate)로 40~60%↓. Prefix cache(프롬프트 캐싱) — 반복 system prompt·도구 정의·참조 문서를 저장: Anthropic cache_control 마커·읽기 90% 할인·쓰기 1.25x(5분)/2x(1h), OpenAI 1,024+ 토큰 자동 50% 할인, Gemini 명시적 cache 객체·시간당 스토리지. 핵심 규칙: 정적 콘텐츠를 프롬프트 맨 앞 배치. Semantic cache — embedding 유사 query hit 시 LLM 생략(GPTCache·Redis VSS) 20~50%↓, prefix cache와 병행. Batch API — async 24h 50% 할인. LiteLLM/Portkey(게이트웨이)와 달리 아키텍처 패턴 — cost per successful outcome·eval-driven routing gate 필수.

  • Model routing/cascade — task complexity별 cheapest capable model
  • Prefix cache — Anthropic 90%·OpenAI auto 50%·Gemini explicit, 정적 콘텐츠 맨 앞
  • Semantic cache+Batch 50% — GPTCache/Redis VSS·eval hold-out 200~500 query
원본 →
AI 코딩 도구

OpenLLMetry — OTel GenAI instrumentation, Traceloop SDK·ServiceNow 인수 후 OSS 유지(Apache-2.0)

OpenLLMetry(traceloop/openllmetry)는 OpenTelemetry 위에 LLM·Vector DB 호출을 auto-instrument하는 OSS 라이브러리(Apache-2.0·~6.9k★). traceloop-sdk Traceloop.init() 한 줄로 OpenAI·Anthropic·LangChain·LlamaIndex·Chroma·Pinecone 등 40+ provider span emit, OTel GenAI semantic conventions 준수. span을 Datadog·Honeycomb·Jaeger·Phoenix·Langfuse 등 기존 APM 백엔드로 export — vendor lock-in 없음. 2026-03 ServiceNow가 Traceloop($60-80M) 인수했으나 OpenLLMetry Apache-2.0·독립 유지 약속. Langfuse/Phoenix(SaaS UI)와 달리 instrumentation layer — 기존 OTel 파이프라인에 LLM span 추가.

  • Traceloop.init() — 40+ LLM/VectorDB auto-instrumentation
  • OTel GenAI conventions — Datadog·Honeycomb·Tempo 등 export
  • Langfuse/Phoenix와 역할 분리 — instrumentation vs UI, ServiceNow 인수 후 OSS
원본 →
AI 코딩 도구

Cohere Embed v4 — 128K·Matryoshka·멀티모달(text+image) 통합 임베딩, 100+ 언어

Cohere embed-v4.0(2025-04)은 엔터프라이즈 RAG용 flagship 임베딩 API다. 128K context·Matryoshka 256/512/1024/1536 dims·text+image+PDF mixed modality 단일 벡터 공간. input_type: search_document/search_query로 retrieval 최적화, 100+ 언어. AWS Bedrock·Azure AI Foundry·Cohere Platform 배포. BGE-M3(OSS·로컬)·Qwen3-Embedding(OSS)과 달리 API-only·멀티모달 PDF 스크린샷 ETL 불필요 — regulated enterprise·멀티모달 RAG. Cohere Command A(RAG LLM)와 Embed+Rerank 통합 스택.

  • 128K·Matryoshka·text+image mixed modality 단일 벡터
  • search_document/search_query input_type — retrieval 최적화
  • BGE-M3/Qwen3-Embedding(OSS)과 역할 분리 — API·멀티모달·enterprise
원본 →
AI 코딩 도구

Voyage AI 4 — shared embedding space·MoE voyage-4-large, asymmetric index/query(2026-01)

Voyage AI 4 시리즈(2026-01, MongoDB 인수)는 industry-first shared embedding space를 도입한 차세대 text embedding이다. voyage-4-large(MoE·40% 저비용)·voyage-4·voyage-4-lite·voyage-4-nano(Apache-2.0 HF) — 4시리즈 내 모든 모델 embedding 호환. index는 voyage-4-large, query는 voyage-4-lite로 asymmetric retrieval — re-index 없이 quality-latency-cost 트레이드오프. 32K context·Matryoshka 256/512/1024/2048·int8/binary quantization. MongoDB Atlas·GCP Vertex·AWS Marketplace. Cohere Embed v4(API multimodal)와 달리 text retrieval 특화·shared space asymmetric.

  • Shared embedding space — index large + query lite, re-index 불필요
  • voyage-4-large MoE — dense 대비 40% serving cost↓
  • voyage-4-nano Apache-2.0 — local dev→production 경로
원본 →
AI 코딩 도구

Hybrid Search — BM25+vector 병렬·RRF(k=60) 융합, RAG 1-stage retrieval 표준(2026)

Hybrid Search(하이브리드 검색)는 dense vector(semantic)와 sparse BM25(lexical)를 병렬 실행 후 Reciprocal Rank Fusion으로 합치는 RAG 1-stage retrieval 아키텍처다. 2026년 RAG 프로덕션의 사실상 기본값. Bi-encoder cosine은 product code·에러 메시지·고유명사에서 실패, BM25는 paraphrase에서 실패 — 병렬+RRF가 양쪽 강점 결합. RRF score = Σ 1/(k+rank), k=60 기본(튜닝 불필요·raw score scale 불일치 해결). Elasticsearch·OpenSearch·Qdrant·Weaviate·Pinecone·MongoDB Atlas native hybrid 지원. 최적화 경로: RRF 베이스라인 → 레이블 있으면 alpha/convex combination → cross-encoder rerank(2-stage). Pure vector RAG 대비 WANDS e-commerce NDCG 7.4%↑. Cross-encoder rerank(2-stage precision)와 역할 분리 — hybrid=recall top-50, rerank=precision top-10.

  • BM25 + vector 병렬 → RRF(k=60) rank-based fusion
  • product code·고유명사(BM25) + paraphrase(vector) 동시 커버
  • Elasticsearch·Qdrant·Weaviate·Pinecone native 지원
  • Cross-encoder rerank과 2-stage — hybrid top-50→rerank top-10
원본 →
AI 코딩 도구

Cross-encoder Reranking — RAG 2-stage precision, BGE-Reranker·Cohere Rerank·Jina v3

Cross-encoder reranking은 hybrid/vector 1-stage top-50~100 후보를 query-document pair로 joint scoring해 top-5~10을 LLM에 전달하는 RAG 2-stage precision layer다. Bi-encoder는 query·doc을 독립 encode(빠르지만 nuance 손실), cross-encoder는 pair-wise attention(느리지만 hyper-accurate). OSS: BGE-Reranker-v2-m3(568M·multilingual·~80ms/50doc CPU), Jina Reranker v3(listwise·nDCG@10 61.94). Managed: Cohere Rerank API($1/1k search). TEI(Text Embeddings Inference)로 production batching. Latency budget(<200ms)+circuit breaker fallback 필수. Jina Reranker v3(제품)와 달리 2-stage funnel 아키텍처 패턴.

  • 2-stage funnel — retrieve 50-100 → cross-encoder → top 5-10
  • BGE-Reranker-v2-m3(OSS) vs Cohere Rerank(managed) vs Jina v3(listwise)
  • Hybrid search(1-stage recall)과 짝 — NDCG@10 +5~15pt typical lift
원본 →
AI 코딩 도구

LangChain Expression Language (LCEL) — Runnable | pipe, invoke/stream/batch 자동(2026 표준)

LCEL(LangChain Expression Language)은 LangChain 컴포넌트를 `|` pipe operator로 조합하는 선언적 파이프라인 프로토콜이다. LLMChain·SequentialChain(deprecated) 대체 — prompt | model | StrOutputParser 한 줄. 모든 LCEL chain은 Runnable 인터face로 invoke·ainvoke·stream·astream·batch 자동 지원. RunnableParallel(동시 실행)·RunnablePassthrough(입력 전달)·RunnableBranch(조건 분기)·with_fallbacks(장애 failover). LangGraph(상태 머신 멀티에이전트)와 역할 분리 — LCEL=단일/병렬 chain, LangGraph=순환·조건부 에이전트 워크플로. LangSmith trace native 연동.

  • prompt | model | parser — invoke/stream/batch/async 자동
  • RunnableParallel·Passthrough·Branch·with_fallbacks
  • LangGraph와 역할 분리 — chain composition vs state machine agent
원본 →
AI 코딩 도구

Hugging Face Model Cards — README.md YAML metadata·discoverability·ModelCard.validate

Hugging Face Model Card는 model repo의 README.md — YAML frontmatter(pipeline_tag·library_name·license·language·base_model·eval_results) + Markdown 본문. discoverability·reproducibility·sharing의 핵심 — pipeline_tag로 task filter·widget·API 결정, eval_results는 Hub UI widget 자동 렌더. ModelCard.from_template() + ModelCard.validate()로 schema compliance, 누락 시 search hidden·manual review. safetensors·Spaces demo·Collection(모델 변형 그룹)·quantized GGUF(base_model link) best practice. HF Datasets(데이터)·Spaces(데모)와 역할 분리 — Model Card는 모델 artifact 문서·계약.

  • YAML: pipeline_tag·library_name·license·eval_results — search/filter
  • ModelCard.from_template + validate — schema compliance gate
  • Datasets/Spaces와 역할 분리 — 모델 README=artifact contract
원본 →
AI 코딩 도구

Azure AI Foundry Agent Service — Hosted agents·MAF·LangGraph·OTel GA(2026 Build)

Microsoft Foundry Agent Service(구 Azure AI Foundry Agents)는 prompt agent(포털 정의·코드 없음) + Hosted agents(컨테이너/zip 배포·자동 스케일) 이중 모델의 managed agent platform이다. Microsoft Agent Framework v1.0 GA — Python/.NET SDK, Foundry Toolkit for VS Code로 local trace→deploy. Hosted agents: per-session sandbox·Microsoft Entra identity·filesystem persistence·Responses API + Invocations protocol. Build 2026: long-running agents·routines(스케줄)·Teams/M365 Copilot publish·agent optimizer(eval loop). AWS Bedrock AgentCore(framework-agnostic Runtime/Gateway/Memory)와 3대 cloud agent platform 축. LangGraph·OpenAI Agents SDK·Anthropic SDK container deploy 지원.

  • Prompt agent(노코드) + Hosted agent(컨테이너·MAF/LangGraph)
  • Foundry Toolkit VS Code — local trace→deploy, OTel GA
  • Bedrock AgentCore와 역할 분리 — Azure Entra·M365·Teams 생태계
원본 →
AI 코딩 도구

LightRAG — dual-layer KG+vector, GraphRAG 대비 경량·증분 업데이트(EMNLP2025·~37k★)

LightRAG(HKUDS, MIT·~37k★, EMNLP2025)는 Microsoft GraphRAG의 경량 대안으로 knowledge graph+vector embedding dual-layer 아키텍처를 채택한다. GraphRAG의 Local/Global search 분기 대신 local+global keyword를 병렬 생성·동시 retrieval — entity·relationship+1-hop neighbor expansion을 한 패스에. incremental update algorithm으로 새 데이터 추가 시 full graph rebuild 불필요. v1.5.3(2026-06) — OpenSearch unified storage·role-specific LLM(EXTRACT/QUERY/KEYWORDS/VLM)·RagAnything multimodal merge(MinerU/Docling). GraphRAG(Microsoft, Leiden community)와 역할 분리 — LightRAG=빠른 indexing·incremental·dual-level retrieval.

  • Dual-layer — KG entity/relation + vector chunk, local+global 병렬 retrieval
  • Incremental update — full rebuild 없이 새 문서 통합
  • GraphRAG와 역할 분리 — 경량·속도 vs Microsoft community summarization
원본 →
AI 코딩 도구

RAPTOR — recursive clustering+summarization tree, multi-granularity RAG retrieval

RAPTOR(Recursive Abstractive Processing for Tree-Organized Retrieval)는 flat chunk RAG의 한계 — 긴 문서 전체 맥락·multi-hop 관계 추론 불가 — 를 해결하는 hierarchical RAG 프레임워크다. leaf=raw chunk → bottom-up clustering(GMM+UMAP) → abstractive summary → parent node 반복으로 tree 구축. inference 시 collapsed-tree(모든 레벨 동시) 또는 tree-traversal retrieval — abstract summary에서 시작해 drill-down. QuALITY benchmark GPT-4+RAPTOR 67.2%(baseline 62.2%). GraphRAG(community graph)와 역할 분리 — RAPTOR=within-document hierarchy·recursive summary. LlamaIndex·LangChain 통합 모듈 존재.

  • Bottom-up tree — cluster→summarize→repeat, leaf=chunk parent=summary
  • Collapsed-tree retrieval — multi-granularity 동시 검색
  • GraphRAG/LightRAG와 역할 분리 — document-internal hierarchy
원본 →
AI 코딩 도구

MergeKit — TIES·DARE·SLERP model merging, 8GB VRAM·MoE frankenmerge(Apache-2.0)

MergeKit(Arcee AI, Apache-2.0, EMNLP2024 Industry)는 사전학습 LLM checkpoint를 추가 학습 없이 합치는 오픈소스 툴킷이다. out-of-core lazy loading으로 CPU 또는 8GB VRAM에서 unreasonably elaborate merge 가능. TIES(Task Arithmetic+sparsification+sign consensus) — 다수 모델 interference 감소. DARE(Drop And REscale) — random pruning+rescale로 skill retention. SLERP·linear·Frankenmerge(layer-wise assembly)·MoE merge·LORA extraction·multi-stage pipeline. Meditron-7B+Llama2-7B-chat TIES merge가 USMLE·MedMCQA에서 base 초과. Unsloth/Axolotl(fine-tuning)과 역할 분리 — MergeKit=zero-training model composition.

  • TIES/DARE/SLERP — interference-aware multi-model merge
  • 8GB VRAM·out-of-core — CPU/GPU hybrid, MoE frankenmerge
  • Fine-tuning과 역할 분리 — training 없이 checkpoint composition
원본 →
AI 코딩 도구

GPTCache Semantic Caching — embedding 유사 query→LLM 생략, 20~50% API 절감

Semantic caching은 byte-identical이 아닌 의미적으로 유사한 query에 cached LLM response를 반환하는 2-tier cache layer다. Exact-match(hash) + Semantic(embedding cosine similarity) 2층 — "비밀번호 재설정" vs "forgotten password steps" 동일 hit. GPTCache(Zilliz, MIT) — LangChain·LlamaIndex native, SQLite→Redis/PostgreSQL scale-out. Redis Stack/RedisVL — FT.SEARCH KNN+TAG filter sub-ms. threshold 0.95 시작, factual 0.85~0.90·reasoning 0.95+. LLM-as-judge로 borderline(0.74~0.81) false positive 방지. Prefix cache(Anthropic/OpenAI provider-side)와 역할 분리 — semantic=paraphrase hit, prefix=identical prefix hit. FinOps 4층 중 semantic cache 구현 레이어.

  • 2-tier — exact hash + embedding cosine, threshold per category
  • GPTCache·Redis VSS·LangChain SemanticCache — production stack
  • Prefix cache와 역할 분리 — paraphrase vs identical prefix
원본 →
AI 코딩 도구

FlashAttention-3 — Hopper TMA·WGMMA·FP8, H100 75% utilization·Paged KV(SM90)

FlashAttention-3(Dao-AILab, 2024)는 NVIDIA Hopper(SM90) Tensor Core·TMA(Tensor Memory Accelerator)를 활용한 I/O-aware attention 최적화다. FlashAttention-2 H100 35% utilization → FA-3 FP16 740 TFLOPs/s(75%), FP8 ~1.2 PFLOPs/s. warp-specialization으로 matmul+softmax interleave, block quantization+incoherent processing으로 FP8 numerical error 2.6×↓. 2026-03 SM90 paged KV attention merge — page_size==block_size TMA path(fast) vs cp.async(general). vLLM PagedAttention(KV storage)과 역할 분리 — FA-3=attention computation kernel, PagedAttention=KV memory layout. SGLang·vLLM backend로 production 통합.

  • Hopper TMA+WGMMA — computation/communication overlap, FP8 2× throughput
  • SM90 paged KV — TMA vs cp.async auto-select, vLLM 통합
  • PagedAttention과 역할 분리 — compute kernel vs KV memory management
원본 →
AI 코딩 도구

Amazon Bedrock AgentCore — Runtime·Gateway·Policy(Cedar)·Memory·Identity

Amazon Bedrock AgentCore(AWS, 2026 GA)는 framework-agnostic managed agent infrastructure platform이다. AgentCore Runtime — Firecracker microVM per session(2 vCPU·8GB fixed), 8h max·100MB payload·SSE streaming, CrewAI/LangGraph/LlamaIndex container deploy. Gateway — API·Lambda→MCP-compatible tools zero-code, 1000 gateway·100 target/gateway. Policy in AgentCore(2026-03 GA) — Cedar policy engine가 Gateway에서 agent-to-tool 요청마다 default-deny·forbid-wins 평가, OAuth claim·tool input parameter·runtime context 조건, natural language→Cedar authoring, LOG_ONLY→ENFORCE 단계적 rollout. Memory — short-term(session) + long-term(cross-session insight). Identity(OAuth/IAM)·Observability(OTel)·Code Interpreter·Browser Use. Azure AI Foundry(MAF·Entra·M365)와 3대 cloud agent platform 축.

  • Runtime — microVM isolation·8h session·LangGraph/CrewAI deploy
  • Gateway+Policy — MCP tools zero-code, Cedar per-tool-call authorization at gateway
  • LOG_ONLY→ENFORCE — prompt instruction이 아닌 외부 deterministic tool gate
원본 →
AI 코딩 도구

LLaMA-Factory — 100+ LLM/VLM zero-code fine-tuning, LlamaBoard Web UI(ACL2024·~72k★)

LLaMA-Factory(hiyouga, Apache-2.0, ACL2024·~72k★)는 100+ LLM·VLM을 코드 없이 fine-tuning하는 unified framework다. LlamaBoard(Gradio Web UI)+CLI — SFT·DPO·KTO·ORPO·PPO·RM·pre-training. LoRA·QLoRA(2~8bit AQLM/AWQ/GPTQ)·DoRA·PiSSA·GaLore·OFT. LLaMA·Qwen3·DeepSeek·Gemma·Mistral·Phi·LLaVA 등. Axolotl(YAML orchestrator·multi-GPU enterprise)과 역할 분리 — LLaMA-Factory=zero-code breadth·Web UI. Unsloth(GPU kernel speedup)과 역할 분리 — LLaMA-Factory=method+model coverage, Unsloth=training speed. llamafactory-cli webui 한 줄 시작.

  • LlamaBoard Web UI — SFT/DPO/KTO/RLHF zero-code, 100+ model
  • LoRA·QLoRA·DoRA·GaLore — 2~8bit quantization stack
  • Axolotl/Unsloth와 역할 분리 — zero-code UI vs YAML orchestrator vs kernel speed
원본 →
AI 코딩 도구

Ring Attention — blockwise KV P2P ring, device-count× context scaling

Ring Attention(UC Berkeley, 2023)는 long sequence를 여러 GPU에 blockwise 분산해 near-infinite context를 달성하는 sequence parallelism 기법이다. 각 device가 sequence chunk의 KV block만 hold → ring topology P2P로 KV block circulate하면서 blockwise attention compute — communication+computation overlap. device N개 → context N× single-GPU limit, 100M+ token training without attention approximation. 2026 inference — pass-KV/pass-Q variant(Llama3 405B 1M ctx 77s/128 H100), TokenRing(bidirectional P2P). DeepSpeed-Ulysses(all-to-all, head-parallel)와 complementary — Ring=sequence dim, Ulysses=attention head dim. FlashAttention-3(blockwise compute) 위에 Ring(spatial distribution) 적층.

  • Blockwise KV ring — P2P overlap, context ∝ GPU count
  • pass-KV/pass-Q — inference latency optimization, 1M ctx 77s(405B)
  • Ulysses·FlashAttention-3와 역할 분리 — head-parallel vs sequence-parallel vs kernel
원본 →
AI 코딩 도구

Knowledge Distillation for LLM — teacher→student compression, task-specific vs general

LLM Knowledge Distillation은 large teacher model의 output distribution·reasoning trace·intermediate representation을 small student에 전달해 capability를 유지하면서 inference cost를 줄이는 기법이다. Response distillation — teacher generated answer를 SFT data로. Logit/token-level distillation — soft label(KL divergence)로 dark knowledge transfer. Reasoning distillation — DeepSeek-R1/Qwen3 등 CoT trace를 student SFT. Task-specific distillation(분류·NER) vs general capability distillation(범용 chat). MergeKit(zero-training merge)과 역할 분리 — distillation=training required. Unsloth/LLaMA-Factory(fine-tuning infra) 위에서 student SFT 실행. Eval — student/teacher gap on hold-out + latency/cost trade-off curve.

  • Response·logit·CoT distillation — SFT data vs soft label vs reasoning trace
  • Task-specific vs general — narrow domain vs broad capability retention
  • MergeKit과 역할 분리 — training-based compression vs checkpoint merge
원본 →
AI 코딩 도구

ReAct vs Reflexion vs LATS — 에이전트 추론 루프 3축 비교(2026)

ReAct(ICLR 2023)은 Thought→Action→Observation을 한 스텝씩 반복하는 기본 루프로, 탐색·도구 체인·대화형 작업에 적합하나 infinite loop 위험 → max_steps+no-progress detector 필수. Reflexion(NeurIPS 2023)은 Act→Critique→Revise로 자기 비평 후 재시도 — HumanEval 80→91% 등 검증 가능 작업(코드·추출)에 강하지만 토큰 3배+. LATS(Language Agent Tree Search)는 여러 reasoning path를 tree search로 탐색·backtrack — 복잡 최적화에 최고 품질이나 latency·비용 최대. 2026 실무: interactive→ReAct, high-stakes final output→Reflexion outer loop, complex planning→Plan-and-Execute, rare optimization→LATS.

  • ReAct: step-by-step 탐색, max_steps·escalation 필수 — LangGraph/CrewAI 기본
  • Reflexion: critic-budget·no-progress detector — 코드·검증 가능 출력
  • LATS: tree search·backtrack — 품질↑ 비용↑, ReAct+Reflexion hybrid가 흔함
원본 →
AI 코딩 도구

Plan-and-Execute — planner·executor 분리로 ReAct drift·비용을 줄이는 에이전트 패턴

Plan-and-Execute는 planner LLM이 전체 multi-step plan을 먼저 작성하고, executor(보통 더 싼 모델)가 순차 실행하는 2-phase 패턴이다. ReAct는 매 step마다 strong model 호출 → 긴 체인에서 비용·drift 누적. Plan-and-Execute는 plan 1회 + executor N회로 비용 예측 가능, known task shape(ETL·리포트·정형 파이프라인)에 최적. 실패 모드: stale plan(observation 변화 시 re-plan trigger), planner hallucination(plan validator 선행). LangGraph·CrewAI·OpenAI Agents SDK 모두 지원. ReAct와 hybrid — outer Plan-and-Execute + inner step ReAct.

  • Planner(strong 1회) + Executor(cheap N회) — 비용·latency bounded
  • Stale plan → observation-signal re-plan, plan validator로 hallucination 차단
  • 정형 파이프라인·반복 워크플로우 — ReAct drift 비용 누적 시 전환
원본 →
AI 코딩 도구

Supervisor Agent — hierarchical orchestration, LangGraph tool-calling handoff(2026)

Supervisor 패턴은 central supervisor agent가 specialized worker agent에게 task를 위임·라우팅하는 hierarchical multi-agent architecture다. LangGraph 2026 권장: langgraph-supervisor 라이브러리 대신 supervisor를 tool-calling agent로 직접 구현 — context engineering·handoff 제어가 유연. Supervisor는 communication flow·task delegation 전담, worker는 domain 특화(검색·코드·DB). Multi-level hierarchy(supervisor of supervisors)도 가능. 기존 멀티에이전트 오케스트레이션(Anthropic research) 카드가 개념이면, Supervisor는 LangGraph/CrewAI 구현 패턴·handoff tool·message history 관리에 특화.

  • Central supervisor → worker routing — LangGraph tool-based handoff 권장(2026)
  • Multi-level hierarchy — supervisor of supervisors, streaming·memory·HITL 내장
  • Anthropic research 패턴(개념) vs LangGraph supervisor(구현) — 역할 분리
원본 →
AI 코딩 도구

Microsoft Guidance + LLGuidance — Python 제약 + Rust grammar engine, OpenAI Structured Outputs 백엔드

Guidance(Microsoft Research)는 Python에서 JSON·SQL·regex·CFG 제약을 선언하면 inference layer에서 token-by-token constrained decoding으로 100% 스키마 준수를 보장하는 라이브러리(~17k★). 2025년 LLGuidance(Rust) v1.0이 grammar engine으로 교체 — ~50μs/token, llama.cpp·vLLM·SGLang·OpenAI Structured Outputs·Chromium에 통합. Instructor(Pydantic retry)·Outlines(FSM local)와 3축: Guidance=Python DSL+cloud/local+grammar engine, Outlines=로컬 FSM, Instructor=API retry. 30~50% latency·비용 절감(retry 제거), Azure Phi-3·전 모델 확장 예정.

  • LLGuidance v1.0 — ~50μs/token CFG mask, OpenAI Structured Outputs 백엔드
  • Instructor(retry)·Outlines(FSM local)와 3축 — grammar engine vs Pydantic vs FSM
  • Python f-string DSL — JSON·SQL·regex·select() 제약, retry 없이 100% 준수
원본 →
AI 코딩 도구

LMQL — LLM용 쿼리 언어, where 절로 타입·길이·포맷 제약을 생성 중 강제

LMQL(Language Model Query Language)은 SQL처럼 LLM 호출을 프로그래밍하는 Python 기반 쿼리 언어다. 전통 알고리즘 로직과 constrained LLM call을 interleave하고, where 절로 출력 타입·길이·포맷·regex 제약을 generation 중에 enforce한다. Instructor(Pydantic post-hoc)·Guidance(token mask)와 달리 쿼리 언어 관점 — branching·loop·aggregation을 LLM 파이프라인에 natively 표현. Decoding constraints·best-of-n·beam search·token budget을 선언적으로 제어. RAG·multi-step extraction·structured pipeline prototyping에 적합, Instructor/Guidance와 complementary.

  • where 절 — 타입·regex·길이·set 제약을 generation 중 enforce
  • Algorithm + LLM interleave — branching·loop·aggregation 쿼리 언어
  • Instructor(Pydantic)·Guidance(token mask)와 complementary — 선언적 파이프라인
원본 →
AI 코딩 도구

GPTQ vs AWQ vs BitsAndBytes — inference·training 양자화 3축 비교(2026)

LLM 양자화 3대 방법론. AWQ(activation-aware): activation magnitude 기반 weight scaling, 4bit inference 품질·속도 최고, vLLM native, calibration ~128 token. GPTQ(Hessian layer-wise): 4bit 표준·3bit extreme compression(8GB GPU), ExLlamaV2 backend, calibration 30분~수시간. BitsAndBytes(NF4/FP4): calibration 불필요·on-the-fly quantize, QLoRA fine-tuning 유일 지원(gradient flow). GGUF(llama.cpp 엣지)와 역할 분리. 2026 선택: production inference→AWQ 4bit, 3bit extreme→GPTQ, fine-tuning→BitsAndBytes+QLoRA.

  • AWQ 4bit — vLLM production default, activation-aware 최고 품질·속도
  • GPTQ — 3bit extreme·ExLlamaV2, calibration 필요·pre-quantized HF Hub
  • BitsAndBytes NF4 — QLoRA 유일·calibration-free, dev/experiment용
원본 →
AI 코딩 도구

Apache Airflow Common AI Provider — Pydantic AI·HookToolset·350+ hook을 에이전트 도구로

apache-airflow-providers-common-ai 0.1.0(2026-04)은 Airflow에 LLM·AI agent capability를 공식 provider로 추가한다. Pydantic AI 기반, @task.agent·@task.llm TaskFlow decorator, 20+ model provider(OpenAI·Anthropic·Bedrock·Ollama). HookToolset이 Airflow 350+ provider hook method를 typed agent tool로 노출 — s3_list_keys·SQL query 등 connection·secret backend 인증 그대로. durable=True로 retry 시 cached step replay, OTel GenAI semantic conventions native. Prefect+AI(Python durable)·Dagster(데이터 자산)와 3축 — Airflow=기존 350+ integration·HookToolset compound effect.

  • HookToolset — 350+ Airflow hook → agent tool, connection auth 재사용
  • @task.agent·durable=True — retry cached replay, OTel GenAI span
  • Prefect(durable Python)·Dagster(data asset)와 3축 — hook ecosystem compound
원본 →
AI 코딩 도구

OpenTelemetry GenAI — agent-spans v1.41·plan span·MCP semconv·gen_ai.*

OpenTelemetry GenAI SIG agent-spans v1.41.1(2026-05-11, Development). 6 agent span operation: create_agent·invoke_agent_client·invoke_agent_internal·invoke_workflow·execute_tool·plan(2026-06 #97) — plan은 task decomposition phase, LLM call은 plan child·tool span은 sibling. gen_ai.operation.name·gen_ai.tool.name·gen_ai.conversation.id·gen_ai.usage.reasoning.output_tokens. v1.39+ MCP semconv — mcp.method.name(Required), execute_tool span enrich(duplicate 방지). stable metric gen_ai.client.operation.duration — span attribute rename에도 SLO 유지. OTEL_SEMCONV_STABILITY_OPT_IN=gen_ai_latest_experimental dual emit·semconv pin 필수. Langfuse(ClickHouse)·Galileo→Splunk·Datadog LLM Observability OTLP ingest. ATSC(agent-telemetry-spec)와 역할 분리 — OTel=transport+semconv, ATSC=agent domain canonical record.

  • plan span 추가 — reasoning과 planning latency/error 분리 관측
  • gen_ai.client.operation.duration — attribute churn보다 안정적 latency SLO
  • Development status — pin semconv·dual-emit, production dashboard는 stable metric 우선
원본 →
AI 코딩 도구

NVIDIA Triton Inference Server — multi-model GPU serving, TensorRT·ONNX·Python backend

NVIDIA Triton Inference Server는 production GPU/CPU model serving platform으로 dynamic batching·concurrent model execution·model ensemble·A/B testing·metrics(Prometheus)를 제공한다. TensorRT·ONNX·PyTorch·Python backend 지원, multi-GPU·multi-node. OpenAI Triton(Python GPU kernel DSL)과 완전히 다른 제품 — Triton Server=serving, Triton DSL=kernel. TensorRT-LLM(Batch 23)과 연계해 LLM optimized serving. vLLM/SGLang(dynamic LLM serving)과 역할 분리 — Triton=multi-model heterogeneous·enterprise MLOps, vLLM=LLM-specialized PagedAttention.

  • Dynamic batching·ensemble·A/B·Prometheus — enterprise multi-model serving
  • OpenAI Triton(DSL kernel) ≠ Triton Server — naming 혼동 주의
  • vLLM/SGLang(LLM specialized) vs Triton(heterogeneous multi-model)
원본 →
AI 코딩 도구

AI deployment patterns — serverless vs dedicated GPU, latency·cost·cold start trade-off(2026)

LLM 배포 3대 패턴. Serverless(Replicate·Modal·Baseten·AWS Lambda): zero infra·auto-scale·cold start 5~30s·per-token 과금, prototype·spiky traffic. Dedicated GPU(vLLM·Triton on K8s/EC2): reserved capacity·TTFT <1s·batching 최적·fixed cost, production steady load. Hybrid: serverless dev/staging + dedicated prod, 또는 Groq/Sambanova API(dedicated chip·serverless UX). BentoML(rapid deploy)·Ray Serve(distributed DAG)와 complementary — BentoML=packaging speed, Ray Serve=orchestration, 이 카드=infra topology 선택.

  • Serverless — zero ops·cold start·per-token, prototype·spiky traffic
  • Dedicated GPU — TTFT<1s·batching·fixed cost, steady production load
  • Modal/Baseten/Replicate(기존) vs topology 선택 — dev serverless + prod dedicated
원본 →
AI 코딩 도구

Inspect AI (UK AISI) — sandbox·agent eval·200+ 벤치마크를 한 프레임워크로

Inspect AI(UKGovernmentBEIS/inspect_ai, MIT·~2.2k★)는 영국 AI Security Institute가 만든 오픈소스 LLM·에이전트 평가 프레임워크다. dataset→Task→Solver→Scorer 선언형 파이프라인, ReAct·Deep Agent(subagent delegation·planning)·multi-agent composition·agent_bridge(LangChain·OpenAI Agents SDK·Pydantic AI) 내장. Docker·Kubernetes·Proxmox sandbox로 untrusted code·browser 격리, tool approval(HITL·policy gate). Inspect View(웹)·VS Code extension으로 trace 디버깅, 200+ pre-built eval. DeepEval(Pytest CI gate)·RAGAS(RAG metric)와 달리 agent trajectory·tool use·sandboxed execution까지 — production-grade eval infrastructure.

  • UK AISI OSS — Task/Solver/Scorer + ReAct·Deep Agent·agent_bridge
  • Docker/K8s/Proxmox sandbox + tool approval, Inspect View·VS Code
  • DeepEval/RAGAS와 역할 분리 — agent eval·sandbox·200+ benchmark
원본 →
AI 코딩 도구

Claw-Eval — Pass^3·trajectory audit로 에이전트 평가 신뢰성 높이기

Claw-Eval(claw-eval/claw-eval)은 자율 에이전트를 Completion·Safety·Robustness 3축으로 채점하는 2026 벤치마크다. 300 human-verified task·9 category·2,159 rubric, execution trace·audit log·environment snapshot full-trajectory auditing. Pass^3(3회 연속 성공)으로 lucky run과 진짜 capability를 구분 — AgentBench·SWE-bench(pass@k)와 달리 reliability-first. hybrid pipeline: deterministic completion gate 뒤 LLM judge 기여 제한, error injection·perturbation test. PinchBench·Terminal-Bench·SWE-bench와 scaffold 분리해 모델 vs harness attribution 가능.

  • 300 task·9 category, Completion/Safety/Robustness + trajectory audit
  • Pass^3 — 3회 연속 성공, pass@k(lucky run)과 구분
  • AgentBench/SWE-bench와 역할 분리 — auditable trajectory·safety embedded
원본 →
AI 코딩 도구

agentevals — OTel trace 재실행 없이 에이전트 품질 CI gate

agentevals(agentevals-dev/agentevals)는 OpenTelemetry trace에서 에이전트 행동을 채점하는 framework-agnostic eval 도구다. LangChain·Strands·Google ADK·OpenAI Agents SDK 등 OTel-instrumented framework의 Jaeger JSON·OTLP trace를 읽어 tool trajectory matching·LLM judge·custom scorer 적용 — LLM 재호출·re-execution 없이 golden eval set 대비 pass/fail. CLI·Web UI·MCP server·Helm chart, local-first(클라우드 불필요). Langfuse/Opik(dataset re-run eval)과 달리 recorded trace scoring — OpenLLMetry(instrumentation) + GenAI semconv(spec) + agentevals(CI gate) 3층.

  • OTel trace scoring — re-execution·extra token 없이 eval
  • Golden eval set·custom scorer·CLI/Web UI/MCP
  • Opik/Langfuse re-run vs trace-only — CI gate·local-first
원본 →
AI 코딩 도구

τ-bench (tau2-bench) — policy compliance·Pass^k로 고객상담 에이전트 재기

τ-bench(Sierra Research, ICLR 2025)는 airline·retail·telecom·banking_knowledge 도메인에서 tool use·simulated user 대화·business policy 동시 준수를 재는 customer service agent benchmark다. DB end-state vs goal state deterministic eval, Pass^k( k회 모두 성공)로 consistency 측정 — GPT-4o급도 retail <50%·pass^8 <25%. τ²-bench dual-control(에이전트·유저 모두 tool), τ³ voice full-duplex·75+ task quality fix. AgentBench(다도메인) ·SWE-bench(코드)와 달리 policy document + API tool + multi-turn user simulator 3축.

  • Airline/retail/telecom/banking, policy+tool+user simulator
  • Pass^k consistency — pass@k(lucky 1회)와 구분
  • SWE-bench/AgentBench와 역할 분리 — policy compliance·CS domain
원본 →
AI 코딩 도구

NIST AI RMF + GAI Profile (600-1) — GenAI 12대 리스크 거버넌스 프레임

NIST AI RMF 1.0(2023)은 Govern·Map·Measure·Manage 4함수 voluntary framework, GAI Profile NIST AI 600-1(2024-07)은 GenAI 고유·악화 12 risk category(confabulation·data privacy·IP·CBRN 등)와 Action ID(GV-1.1-001 등) suggested actions. Playbook·Roadmap·Crosswalk 동반, 2026 Critical Infrastructure Profile concept note 추가. OWASP LLM Top 10(개발자 취약점) ·ISO 42001(경영시스템 인증)과 달리 cross-sector risk management operating model — EU AI Act·enterprise procurement에서 voluntary baseline.

  • AI RMF 1.0 4함수 + 600-1 GAI 12 risk·Action ID
  • Playbook·Roadmap — voluntary, cross-sector
  • OWASP LLM Top 10(취약점) ·ISO 42001(인증)과 역할 분리
원본 →
AI 코딩 도구

Copilot Autofix — CodeQL alert를 LLM 패치+설명으로 자동 번역

GitHub Copilot Autofix는 CodeQL code scanning alert를 LLM(GPT-5.3-Codex)이 actionable code change+natural language explanation으로 변환한다. CodeQL 활성화만으로 기본 on, Copilot 구독 불필요(public·Code Security license). SARIF alert data·surrounding code·query help text 입력, Copilot Workspace에서 PR 내 edit·build·test 검증. 2025-10 code scanning alert→Copilot coding agent bulk assignment, 2026-03 Autofix stats가 all protected branches 집계. claude-code-security-review(diff 인지)·Open Code Review(Alibaba CLI)와 달리 CodeQL-native autofix — Dependabot version bump와 complementary.

  • CodeQL alert→패치+설명, Copilot 구독 불필요
  • Copilot Workspace PR 내 검증·build·test
  • Code review AI와 역할 분리 — CodeQL-native remediation
원본 →
AI 코딩 도구

Dependabot + AI Agents — breaking change·malware remediation을 에이전트에 위임

GitHub 2026-04 Dependabot alert detail에서 Assign to Agent(Copilot·Claude·Codex)로 advisory·dependency usage 분석 후 draft PR 생성·test failure 수정 시도. Dependabot security update(버전 bump PR)로 안 되는 major breaking change·compromised package downgrade·multi-file fix가 대상. 2026-03 npm malware alerting(opt-in·CVE와 별도 subcategory·OpenSSF Malware Streams 확장 예정). Code Security + Copilot coding agent plan 필요, AI patch는 반드시 review·test 후 merge. Copilot Autofix(CodeQL)·Dependabot bump(규칙 기반) 3단계 remediation stack.

  • Assign to Agent — breaking change·downgrade·complex fix
  • npm malware alerting — CVE alert와 별도 triage
  • Autofix(CodeQL)·Dependabot bump와 3단계 stack
원본 →
AI 코딩 도구

CycloneDX ML-BOM vs SPDX AI Profile — AI supply chain SBOM 2축

2026 AI-BOM 표준은 CycloneDX 1.5+ ML-BOM(OWASP·mlModel·data component·VEX inline·security-first) vs SPDX 3.0 AI Profile(Linux Foundation·ISO 5962·licensing·provenance-first). 3-layer: model(weights hash·format)·supply chain(training data·base model·runtime)·operational(model card·eval·limitations). CycloneDX 1.7 ML-BOM을 regular SBOM에 embed 가능, Sigstore signing. EU AI Act Annex IV·NIST AI RMF Map 4.x·ISO 42001 Clause 8 regulatory expectation — build-time generate·sign·mirror. Syft·CycloneDX CLI·HF model card export adjacent tooling.

  • CycloneDX ML-BOM — security·CI/CD·mlModel component
  • SPDX 3.0 AI Profile — licensing·provenance·ISO 5962
  • model·supply chain·operational 3-layer, dual format converter
원본 →
AI 코딩 도구

Fairlearn vs AIF360 — ML bias detection·mitigation 2축

Fairlearn(Microsoft) vs AIF360(IBM Trusted-AI)는 ML fairness assessment·mitigation OSS 2대 toolkit. Fairlearn — scikit-learn 호환·demographic parity·equalized odds·MetricFrame dashboard·Hardt/Agarwal mitigation, binary classification에 curated·사용 쉬움. AIF360 — 70+ fairness metric·pre/in/post-processing(Adversarial Debiasing·Calibrated Equalized Odds·Reject Option)·multi-class·German/COMPAS built-in dataset, breadth↑ learning curve↑. SHAP/LIME(explainability) ·Evidently(drift)와 달리 group fairness — EU AI Act high-risk·FCRA adverse action notice compliance pipeline.

  • Fairlearn — sklearn·MetricFrame·curated mitigation·쉬운 시작
  • AIF360 — 70+ metric·pre/in/post-processing·multi-class
  • SHAP/Evidently와 역할 분리 — group fairness·mitigation
원본 →
AI 코딩 도구

SHAP vs LIME — ML explainability TreeSHAP·KernelSHAP·local surrogate 2축

SHAP(Shapley value·local accuracy·missingness·consistency axiom) vs LIME(local linear surrogate·model-agnostic·run-to-run variance). TreeSHAP — XGBoost/LightGBM/RF exact·polynomial time; KernelSHAP — universal but slow; LIME — 3× faster·69% consistency vs TreeSHAP 98%. EU AI Act Art.13 high-risk transparency·FCRA adverse action notice에서 SHAP preferred(audit trail). Production hybrid: TreeSHAP global analysis + LIME fast local sketch, odd LIME→SHAP cross-check. Fairlearn(group fairness) ·LLM explainability(RAGAS)와 달리 tabular·tree ML feature attribution.

  • TreeSHAP — tree exact·fast; KernelSHAP — universal·slow
  • LIME — model-agnostic·fast·unstable(69% consistency)
  • Fairlearn/RAGAS와 역할 분리 — tabular feature attribution·regulatory audit
원본 →
AI 코딩 도구

Smolagents — Hugging Face 경량 CodeAgent, Python 코드로 도구 실행·~1k줄(MIT)

Smolagents(Hugging Face)는 ~1,000줄 코드베이스의 경량 Python 에이전트 프레임워크다. CodeAgent가 JSON tool call 대신 Python 코드를 생성·실행해 함수 중첩·루프·조건문을 자연스럽게 조합 — '에이전트가 코드를 쓰는' 패턴의 반대. ToolCallingAgent(JSON/text tool call)도 지원. Model-agnostic — HF InferenceClient·LiteLLM(OpenAI·Anthropic)·Transformers·Ollama. MCP·LangChain tool·Hub Space를 tool로 사용. E2B·Docker·Modal·Blaxel sandbox 실행. smolagent·webagent CLI, Hub에 agent·tool 공유. LangChain/Deep Agents(하네스)와 달리 '최소 추상화·빠른 프로토타입' — CodeAgent 패러다임 특화.

  • CodeAgent — Python 코드 생성·실행, JSON tool call 대안
  • MCP·LangChain tool·Hub Space tool 연동, sandbox(E2B/Docker)
  • Deep Agents/LangGraph와 역할 분리 — 경량·CodeAgent 특화
원본 →
AI 코딩 도구

Contextual Retrieval — Anthropic RAG 청크 컨텍스트 보강, 실패율 49~67%↓

Contextual Retrieval(Anthropic, 2024)은 RAG 청킹 시 문맥 손실을 줄이는 2-subtechnique다. Contextual Embeddings: 각 chunk 앞에 LLM(Claude)이 생성한 chunk-specific 설명을 prepend 후 embedding. Contextual BM25: 동일 컨텍스트를 BM25 index에도 적용. 단독 Contextual Embeddings — top-20 retrieval failure 35%↓(5.7%→3.7%), +Contextual BM25 — 49%↓(→2.9%), +reranking — 67%↓(→1.9%). 4-layer stack: contextual embedding(Voyage/Gemini) + contextual BM25 + hybrid + rerank + top-20 chunks. prompt caching으로 비용 90%↓. Late chunking(Jina, embedding 레벨) ·semantic chunking(LlamaIndex)과 역할 분리 — LLM-generated chunk context.

  • Contextual Embeddings + BM25 — chunk별 LLM context prepend
  • hybrid + rerank 조합 시 failure 67%↓(Anthropic benchmark)
  • Late chunking·semantic chunking과 역할 분리 — LLM context layer
원본 →
AI 코딩 도구

RAG Chunking Strategies — semantic boundary vs late embedding vs parent-child

2026 RAG chunking은 "어떻게 자를 것인가"와 "무엇을 retrieve/generate할 것인가" 두 축으로 나뉜다. Semantic chunking — fixed token 대신 embedding cosine similarity threshold(percentile/stddev)로 topic shift 지점 분할, LangChain SemanticChunker. thematically cohesive chunk→retrieval precision↑(benchmark ~70% lift 사례) but uneven size(80~1400 token). Late Chunking(Jina, arXiv 2409.04701) — long-context model로 full-doc token encode 후 chunk boundary mean pool, embedding architecture 레vel context preservation, jina-embeddings-v3 late_chunking=True 한 줄. Parent-child(small-to-big) — production default: child(200-400 token) embed/index → retrieve 시 child match → parent(1000+ token section/paragraph)를 LLM에 generate context로 전달. LangChain ParentDocumentRetriever ·LlamaIndex auto-merge retriever built-in — "small-chunk recall + large-chunk context"로 precision-context tension 해결. production ladder: recursive baseline→recall low면 parent-child→semantic→late/contextual 조합. Contextual Retrieval(Anthropic LLM prefix) ·RAPTOR(tree)와 다른 축.

  • Semantic — similarity threshold topic boundary, uneven size trade-off
  • Late — full-doc encode→boundary mean pool, embedding-level context
  • Parent-child — child(200-400t) embed→parent(1000+t) generate, production built-in default
원본 →
AI 코딩 도구

Exa AI Search API — neural semantic search·auto-extract·deep-reasoning(2026)

Exa(exa.ai)는 AI agent·RAG용으로 설계된 neural search engine API다. keyword SERP가 아닌 embedding-based semantic retrieval — exploratory research·code retrieval·의미 기반 discovery에 강점. search type: auto(~1s)·instant(~250ms)·fast·deep-lite(4s)·deep(4-15s)·deep-reasoning(12-40s). contents.highlights로 token-efficient extraction, category filter(company·research paper·news). Search as Code(SaC) — Perplexity Computer에서 retrieval을 Python SDK primitive 조합. Python/JS SDK, MCP server. Tavily(agent-ready structured)·Brave(independent index·privacy)와 3축 — Exa=semantic accuracy·structured extraction.

  • Neural semantic search — keyword miss·exploratory research 특화
  • instant~deep-reasoning 6-tier latency-quality profile
  • Tavily(agent loop) ·Brave(index independence)와 역할 분리
원본 →
AI 코딩 도구

Tavily Search API — agent-native web search·extract·research·MCP(2M+ dev)

Tavily(tavily.com)는 LLM·RAG·agent workflow에 최적화된 search+extract API다. search_depth(basic·advanced·fast·ultra-fast)로 latency-quality 트레이드오프, search·extract·crawl·map·research 5 endpoint. LangChain·CrewAI·OpenAI function calling 공식 통합, tavily-mcp(~2k★) production MCP server. /research endpoint — multi-step autonomous deep research. X-Session-Id·X-Human-Id header로 multi-step agent attribution. 300M+ monthly requests·99.99% uptime·p50 sub-second. Firecrawl MCP(web scrape) ·Exa(semantic) ·Perplexity Computer(answer-first)와 역할 분리 — 'search-then-extract' agent loop 기본값.

  • search·extract·crawl·research — agent-ready structured output
  • LangChain·CrewAI·MCP 공식 통합, search_depth latency control
  • Exa(semantic) ·Firecrawl(scrape) ·Perplexity(answer)와 역할 분리
원본 →
AI 코딩 도구

Crawl4AI — OSS LLM-friendly web crawler, Playwright+Markdown+LLM extract(~40k★)

Crawl4AI(v0.9.x)는 RAG·agent pipeline용 오픈소스 Python web crawler다. Playwright async browser pool로 JS 렌더링, HTML→clean Markdown 자동 변환(boilerplate 제거). LLMExtractionStrategy — Pydantic schema + natural language prompt로 structured JSON 추출. CSS/XPath·chunk-based·semantic(cosine) extraction 전략. Adaptive crawling — information foraging algorithm으로 충분한 정보 수집 시 자동 중단. Docker·async parallel·LangChain/LlamaIndex 통합. Firecrawl(managed API·MCP)과 달리 self-host·API key 불필요·rate limit 없음(대상 사이트 제외). ScrapeGraphAI(managed LLM extract API)와 역할 분리 — OSS·full control.

  • Playwright async ·LLM-ready Markdown ·Pydantic LLM extract
  • Adaptive crawling ·Docker ·LangChain/LlamaIndex 플러그인
  • Firecrawl(managed MCP) ·ScrapeGraphAI(SaaS)와 OSS self-host 대안
원본 →
AI 코딩 도구

Jina Reader — r.jina.ai URL prefix로 LLM-ready Markdown, PDF·search(s.jina.ai)

Jina Reader(jina-ai/reader)는 URL 앞에 https://r.jina.ai/ prefix만 붙이면 LLM-friendly Markdown을 반환하는 HTTP API다. Headless Chrome(Puppeteer)·CURL hybrid fetch, Readability.js·Reader-LM(0.5B/1.5B SLM) HTML→Markdown. PDF(PDF.js)·DOCX(LibreOffice) 지원. s.jina.ai — search→top-5 URL 자동 fetch→markdown. x-respond-with header(markdown·html·text·screenshot·frontmatter). Firecrawl(managed scrape API·MCP)과 달리 prefix-only·무료 tier(10M tokens)·self-host 가능. Crawl4AI(Python library·full pipeline)와 역할 분리 — 한 URL에서 한 Markdown 최소 API.

  • r.jina.ai/{URL} prefix — API key 없이 browser 테스트 가능
  • s.jina.ai search→markdown ·PDF/DOCX ·Reader-LM SLM
  • Firecrawl(managed) ·Crawl4AI(library)와 URL-to-MD 특화
원본 →
AI 코딩 도구

LangSmith Deployment·Engine — managed runtime + production trace→fix loop

LangSmith Deployment(구 LangGraph Platform, 2025 GA)는 long-running agent deploy·scale managed runtime — Cloud·Hybrid·Self-hosted 3-tier, Postgres checkpoint, LangGraph Studio. 2026 LangSmith Engine(public beta)은 ''agent for agent engineering'' — production trace 6h scan→failure cluster→root cause diagnosis(GitHub repo 연결 시 code read)→proposed fix PR·custom online evaluator·offline dataset example 생성. closed loop — issue close 후 evaluator re-fire 시 auto-reopen. screener(Haiku subagent 20 trace batch)→investigator→fix agent pipeline. LangGraph(OSS runtime) ·Deployment(managed host) ·Engine(improvement agent) 3-product stack.

  • Deployment — Cloud/Hybrid/Self-hosted, ~400社, GitHub deploy
  • Engine — trace cluster→diagnosis→PR+evaluator, 6h scan, GitHub optional
  • Engine screener→investigator→fix agent — production signal→named issue loop
원본 →
AI 코딩 도구

Agno — pure Python agent·team·workflow SDK, AgentOS FastAPI production(Apache-2.0·~40k★)

Agno(agno-agi/agno, 구 Phidata)는 Agent·Team·Workflow 3-primitive Python SDK다. 30+ LLM provider·100+ tool·MCP·Pydantic structured I/O·memory·knowledge(RAG)·learning·compression. AgentOS — agent를 FastAPI service로 wrap, JWT RBAC·OTel tracing·scheduling(cron)·Slack/Telegram/WhatsApp interface. Postgres persistence(sessions·memory·traces). 450 contributors·v2.6.12(2026-06). Pydantic AI(type-safe agent) ·Deep Agents(LangChain harness) ·CrewAI(role-based team)와 역할 분리 — SDK→AgentOS→deploy pure Python full stack. AgentOps(옵저버빌리티)와 SDK 통합.

  • Agent·Team·Workflow 3-primitive ·30+ model ·MCP native
  • AgentOS — FastAPI·JWT RBAC·cron·Slack/TG interface
  • Pydantic AI(type) ·CrewAI(role team) ·Deep Agents(harness)와 분리
원본 →
AI 코딩 도구

Make.com AI Agents — 3000+ app 시나리오 canvas에 agent 통합·Reasoning Panel

Make.com AI Agents(2026-02 next-gen)는 기존 Make scenario builder canvas 안에서 goal-driven agent를 build·run·debug하는 no-code agent platform이다. LLM이 task를 받아 attached scenario(tool)를 reasoning 후 선택 실행. Reasoning Panel — agent의 tool 선택·data analysis 과정을 step-by-step 시각화(black box 제거). Knowledge upload(PDF·CSV·MD·JSON)·conversation memory depth 설정. Library of Agents — production-ready template 공유. n8n(AI LangChain node·100k★·Fair-Code) ·Zapier(chat-only) ·Dify(AI-native app builder)와 역할 분리 — 기존 3000+ SaaS integration 위 agent layer. MCP server·Make Grid multi-agent orchestration.

  • Scenario canvas 내 agent — 기존 Make workflow = agent tool
  • Reasoning Panel — decision transparency ·Library template
  • n8n(dev-friendly OSS) ·Dify(AI app) ·Zapier(chat)와 역할 분리
원본 →
AI 코딩 도구

ScrapeGraphAI — natural language prompt→structured JSON, scrape·extract·crawl·monitor v2 API

ScrapeGraphAI(scrapegraphai.com)는 natural language prompt로 webpage→structured JSON을 추출하는 AI-powered scraping SaaS API다. v2 unified API: scrape(multi-format markdown·html·screenshot)·extract(LLM prompt+schema)·search(web search+extract)·crawl(async multi-page)·monitor(cron+change detection+webhook). Python SDK(scrapegraph-py≥2.1)·JS SDK·MCP server. stealth mode(+5 credits)·Pydantic/Zod schema validation·concurrent async. Firecrawl(managed·MCP·6.6k★) ·Crawl4AI(OSS·self-host)와 역할 분리 — managed NL-prompt extraction·zero selector maintenance. SmartScraper v1→v2 extract endpoint migration.

  • NL prompt→JSON ·scrape·extract·search·crawl·monitor v2
  • Python/JS SDK ·MCP ·stealth ·schema validation
  • Firecrawl(MCP) ·Crawl4AI(OSS)와 managed NL-extract 특화
원본 →
AI 코딩 도구

Tree of Thoughts (ToT) — 다중 reasoning path 탐색·backtrack, beam search prompting

Tree of Thoughts(Yao et al., NeurIPS 2023)는 Chain-of-Thought의 단일 선형 추론을 tree search로 일반화한 prompting/orchestration 패턴이다. 매 step마다 LLM이 k개 candidate 'thought'를 생성하고, evaluator(LLM-judge 또는 deterministic checker)가 점수를 매긴 뒤 BFS/DFS/beam search로 promising branch만 확장·prune한다. Game of 24에서 CoT 4%→ToT 74%(GPT-4). 2026 실무: frontier reasoning model(GPT-5·Claude extended thinking)이 내부적으로 유사 search를 수행하므로, 투명성·제어·proposer/evaluator 모델 분리가 필요할 때만 explicit ToT. 비용 10~100× CoT — planning·combinatorial·architecture tradeoff에만. CoT first → eval fail 시 ToT escalation이 production-safe 패턴.

  • 3 knobs — branching factor k, beam width/depth, evaluator(LLM-judge vs verifier)
  • Search policy — BFS·DFS·best-first·bounded beam(프로덕션 최다)
  • ReAct/LATS와 분리 — ToT=reasoning search, LATS=agent tree+tool, ReAct=single-path loop
원본 →
AI 코딩 도구

Self-Consistency Decoding — CoT 다중 샘플→majority vote, GSM8K +17.9%

Self-Consistency(Wang et al., ICLR 2023)는 CoT prompting에 greedy decode 대신 temperature>0으로 diverse reasoning path N개를 샘플링하고, final answer를 majority vote로 선택하는 decoding strategy다. GSM8K +17.9%, SVAMP +11%, StrategyQA +6.4%. 2025 효율 변형: CISC(Confidence-Informed, ACL 2025) — confidence-weighted vote로 sample 40%↓, RASC(NAACL 2025) — reasoning quality 평가+early stop으로 70%↓, DSC(Difficulty-Adaptive) — easy question은 1-shot·hard만 N-sample. Instructor(validate-after)·Outlines(constrain-during)와 달리 '추론 다양성→합의' 패턴. Tree of Thoughts(탐색)와 조합 가능.

  • CoT + N samples(temp>0) → extract final answer → majority vote
  • 2025 효율 — CISC(confidence weight)·RASC(early stop)·DSC(difficulty-adaptive)
  • ToT(탐색)·Reflexion(자기비평)과 역할 분리 — SC=answer-level consensus
원본 →
AI 코딩 도구

Chain-of-Thought Prompting — zero-shot·few-shot·Auto-CoT, 중간 추론을 명시하는 기본 패턴

Chain-of-Thought(Wei et al., 2022)는 LLM이 final answer 전 intermediate reasoning step을 출력하게 해 multi-step task 정확도를 10~40%p 올리는 prompting 패턴이다. Zero-shot CoT — 'Let's think step by step' 한 줄 trigger, exemplar 불필요·latency 최소(GSM8K 10.4→40.7%). Few-shot CoT — domain-specific worked example로 step 정의·format lock-in. Auto-CoT — question cluster→representative example 자동 선택. DeepSeek R1(투명 CoT stream)과 달리 'prompt engineering technique' — 모델 무관·API 호출 1회. Self-Consistency(N-sample vote)·ToT(tree search)·Least-to-Most(decompose)의 기반. production: CoT output을 log/eval에 저장해 reasoning trace debug.

  • Zero-shot — trigger phrase 1줄, few-shot — worked example로 domain step 정의
  • Auto-CoT — question clustering→representative exemplar 자동 생성
  • Self-Consistency·ToT·LtM의 기반 — DeepSeek R1(내장 reasoning)과 prompt-level CoT 분리
원본 →
AI 코딩 도구

Few-Shot vs Zero-Shot — eval baseline 먼저, example은 측정 후에만 추가

Zero-shot은 instruction만, few-shot은 2~5 input-output example을 prompt에 포함하는 in-context learning(ICL) 방식이다. 2026 production-safe protocol: (1) representative eval set으로 zero-shot baseline 측정 (2) 1→2→3→4 example sweep, peak 이후 decline('few-shot collapse') 확인 (3) 도움이 증명될 때만 static few-shot 유지. Zero-shot 장점 — token 절약·model version change에 robust. Few-shot 장점 — format·tone·edge case·custom taxonomy lock-in. 85~95% 필요→few-shot 3~5개, 99%+→fine-tuning. DSPy(자동 optimize)와 달리 '수동 example curation decision framework'.

  • Zero-shot first — eval baseline 없이 4 example 넣지 말 것
  • Non-monotonic — example 수↑가 항상 quality↑ 아님, peak 찾아 stop
  • Dynamic retrieval(Dynamic Few-Shot) — task diversity↑ 시 static→retrieved examples
원본 →
AI 코딩 도구

Dynamic Few-Shot Retrieval — query별 embedding 유사 example 선택, static 대비 double-digit↑

Dynamic few-shot는 고정 example 대신 live query와 embedding cosine similarity로 example library에서 k개를 retrieve해 prompt에 주입하는 ICL 기법이다. Static few-shot의 input distribution mismatch·token waste를 줄여 classification·extraction 등 diverse task에서 double-digit quality margin 보고. Production 주의: (1) retrieved example을 system prompt가 아닌 user message 직전에 inject — KV cache on static prefix (2) 3~5 example sweet spot, 10+는 fine-tuning 검토 (3) retrieval quality 별도 eval — bad retrieval > no examples. Embedchain(RAG ingestion)과 달리 'prompt-level example selection'. Few-Shot vs Zero-Shot 카드의 dynamic escalation path.

  • Embedding retrieval — example library→cosine top-k→prompt inject
  • KV cache — static system prompt + dynamic example을 user turn 직전 배치
  • Static few-shot(validation) → dynamic(when diversity exceeds static coverage)
원본 →
AI 코딩 도구

Least-to-Most Prompting — decompose→sequential solve, CoT보다 compositional generalization↑

Least-to-Most(Zhou et al., ICLR 2023)는 complex problem을 2-stage로 푸는 prompting 기법: (1) Decomposition — subproblem list 생성 (2) Subproblem Solving — 이전 subproblem answer를 context로 다음 solve. CoT는 demonstration보다 hard한 compositional task에서 generalization 실패 — LtM은 SCAN 76%(CoT 6%), code-davinci-002 99.7%. Plan-and-Execute(agent planner·executor 분리)와 달리 'single LLM prompt pattern', training 불필요. Self-Consistency·CoT와 조합 가능. 실무: ETL step chain·multi-file refactor plan·math word problem decomposition.

  • Stage 1 decompose → Stage 2 sequential solve(previous answers as context)
  • CoT 대비 — easy-to-hard generalization·compositional task에서 우위
  • Plan-and-Execute(agent) ·ReAct(tool loop)와 분리 — prompt-only decomposition
원본 →
AI 코딩 도구

OpenAI Realtime API — native speech-to-speech, WebRTC/WebSocket·Agents SDK(2026 GA)

OpenAI Realtime API는 audio를 first-class modality로 처리하는 speech-to-speech API다(2026 GA, gpt-realtime-2). STT→LLM→TTS pipeline 없이 단일 session에서 barge-in·turn-taking·tool call·MCP 지원. Transport: WebRTC(브라우저·모바일, ~300-500ms TTFA, ephemeral client secret) vs WebSocket(서버-side orchestration·compliance logging·+80~150ms). POST /v1/realtime/client_secrets로 ephemeral key 발급, Agents SDK RealtimeSession으로 tool·handoff·guardrail 연결. Gemini Live API(Android on-device)와 분리 — OpenAI ecosystem·SIP(beta) telephony·server-side tool mediation.

  • Speech-to-speech native — barge-in·turn-taking·tool/MCP in audio session
  • WebRTC(browser direct) vs WebSocket(server mediate) transport 선택
  • Gemini Live(on-device) ·chained VoicePipeline(STT→LLM→TTS)과 역할 분리
원본 →
AI 코딩 도구

LLM API Retry & Exponential Backoff — 429/5xx만 retry, jitter+Retry-After 필수

Production LLM integration의 baseline resilience: retry with exponential backoff + full jitter. Retryable — 429(rate limit)·500/502/503/504·timeout. Non-retryable(fail fast) — 400·401/403·content policy. Config — base 1~2s, multiplier 2×, max 30~60s, full jitter(0~base random), max 3~5 attempts, Retry-After header 우선. Thundering herd 방지 — jitter 없으면 outage 시 모든 client 동시 retry. Portkey(circuit breaker 내장) ·Temporal(durable retry) ·LiteLLM(auto retry)과 달리 '애플리케이션 레벨 패턴'. Circuit breaker(>10% fail/60s→open) + fallback chain과 3-layer 조합.

  • 429/5xx/timeout만 retry — 400/401/403/content policy는 즉시 fail
  • Exponential backoff + full jitter + Retry-After header respect
  • Circuit breaker + fallback chain과 3-layer — Portkey/Temporal은 infra 구현
원본 →
AI 코딩 도구

Skeleton-of-Thought (SoT) — answer skeleton→parallel expand, latency 2.39×↓(ICLR 2024)

Skeleton-of-Thought(Microsoft+Tsinghua, ICLR 2024)는 LLM sequential decoding latency를 줄이는 data-centric prompting 기법. Stage 1 — answer skeleton(구조 outline) 생성, Stage 2 — 각 skeleton point를 parallel API call 또는 batched decode로 동시 expand. 12 LLM에서 up to 2.39× speed-up, GPT-3.5/4에서 2× 가속+품질 개선 사례. SoT-R(router) — step-by-step reasoning·short answer는 standard decode fallback. Chain-of-Thought(순차 reasoning) ·Tree of Thoughts(search)와 달리 'parallel generation for structured long answers'. asyncio.gather로 point별 parallel API call 구현.

  • Skeleton outline → parallel point expansion — black-box LLM, model 수정 불필요
  • Up to 2.39× latency↓ — long structured answer(list·report·consulting)에 최적
  • SoT-R router — reasoning-heavy task는 sequential fallback
원본 →
AI 코딩 도구

In-Context Learning — example curation·ordering·3~8 sweet spot, ICL production playbook

In-Context Learning(ICL)은 fine-tuning 없이 prompt 내 demonstration으로 task를 학습하는 LLM emergent capability(Brown et al., 2020)다. Production playbook: (1) relevance — production input distribution과 semantic match (2) quality — label·format·delimiter 일관, edge case 포함 (3) count — 3~8 sweet spot, sweep으로 peak 찾기 (4) ordering — strongest example last(recency bias) (5) dynamic selection — embedding retrieval로 query별 example. Negative demo·noisy example은 accuracy regress. Few-Shot vs Zero-Shot(결정 framework) ·Dynamic Few-Shot Retrieval(구현) ·DSPy(auto optimize)와 역할 분리 — ICL은 'example design 원칙'.

  • 3~8 examples — token/latency vs accuracy trade-off, peak 이후 regress
  • Strongest example last ·consistent format/delimiter ·edge case 포함
  • Dynamic retrieval + offline eval replay + production A/B로 drift monitor
원본 →
AI 코딩 도구

Modern Web Guidance — Chrome 팀의 웹 플랫폼 스킬을 코딩 에이전트에 설치하기

Chrome Modern Web Guidance는 접근성·성능·보안·브라우저 호환성 지식을 코딩 에이전트가 바로 호출할 수 있는 skills 묶음으로 제공하는 early preview다. `npx modern-web-guidance@latest install` 또는 Vercel `npx skills add GoogleChrome/modern-web-guidance`, Claude Code/Copilot CLI plugin marketplace, Antigravity CLI로 설치한다. 공식 I/O 2026 글은 Baseline과 연결해 목표 브라우저 범위에 맞는 기능·fallback을 고르게 하고, 100개 이상 use case를 계속 업데이트한다고 설명한다. Chrome DevTools for agents와 함께 쓰면 콘솔 로그·네트워크·접근성 트리·성능 audit을 읽고 modern CSS/API 수정까지 이어갈 수 있다. 2026-06-24 GitHub API 기준 Apache-2.0, 1,424★다.

  • 설치: npx CLI, npx skills, Claude/Copilot plugin marketplace, Antigravity CLI 지원
  • 내용: 접근성·성능·보안·Baseline 호환성 지식을 에이전트 skill로 패키징
  • 실무 포인트: 에이전트에게 최신 웹 API 사용 여부를 맡기되 DevTools evidence로 검증
원본 →
AI 코딩 도구

Writing Effective MCP Tools — agent-native 설계, namespacing·pagination·high-signal output

Anthropic "Writing effective tools for AI agents"(2025)는 MCP 도구를 API wrapper가 아니라 agent-native interface로 설계하라고 강조한다. 핵심: (1) verb-noun snake_case 이름·enum으로 입력 제약·description에 concrete example (2) multi-action tool(action 파라미터) 대신 narrow single-purpose tool 분리 (3) pagination·filtering·truncation으로 25k token 응답 상한 (4) uuid·mime_type 대신 name·file_type 등 agent-actionable 필드 반환 (5) namespacing(asana_search vs jira_search)으로 tool selection 정확도↑. MCP Tool Search(on-demand loading) ·Code execution with MCP(programmatic compose)와 조합하면 context bloat 없이 수십 개 도구 운용.

  • verb-noun naming + enum + example in description — model tool selection 정확도
  • multi-action tool 분리·pagination/truncation — context 25k token 상한
  • high-signal 필드만 반환 — MCP Tool Search·programmatic calling과 조합
원본 →
AI 코딩 도구

Human-in-the-Loop Approval — policy gate·HumanLayer·Permit Access Request MCP

Production HITL은 "모든 action 승인"이 아니라 action manifest(severity×reversibility)로 high-stakes write만 pause한다. OpenAI Agents SDK needs_approval→RunState.approve/reject, LangGraph interrupt()+PostgresSaver durable checkpointer. Policy layer는 allow/deny/approval_required 3-state+audit. HumanLayer(humanlayer·~11k★)는 require_approval()로 send_email·deploy 같은 high-stakes tool을 Slack·email·web dashboard에서 productized pause. Permit Access Request MCP는 LangGraph+policy engine 위에 agent가 sensitive action을 request→human final decision workflow. Async 202+approval_timeout SLA, side effect는 interrupt 이후 idempotent batch.

  • action manifest — severity×reversibility, HumanLayer=productized Slack/email channel
  • durable checkpointer(Postgres/SQLite) + interrupt/resume — InMemorySaver dev only
  • Permit Access Request MCP — policy-backed approval, LangChain MCP Adapters 연동
원본 →
AI 코딩 도구

Agent Graceful Degradation — 4 service level·fallback chain·user disclosure

Graceful degradation은 dependency failure 시 terminal error 대신 reduced-but-truthful answer를 제공하는 설계 모드다. 4 service level: Full(모든 tool healthy) → Reduced(non-critical tool skip/mock) → Fallback(secondary model/cached decision) → Refusal(primary+secondary unavailable). Fallback chain: primary model → secondary provider(different vendor) → cached structured-intent decision → templated refusal. Circuit breaker(>10% fail/60s→open) + semantic quality failure(schema violation·hallucination rate) 감지. User disclosure 필수 — silent degradation은 trust erosion. Per-feature fallback: vision fail→text-only, retrieval fail→no citations, code exec fail→simple summary.

  • 4 level: Full→Reduced→Fallback→Refusal — 각 level마다 user disclosure 규칙
  • fallback chain: primary→secondary vendor→cached decision→refusal
  • circuit breaker + per-feature downgrade — silent failure 금지
원본 →
AI 코딩 도구

AI Agent Audit Logging — tool invocation을 first-class event로, append-only storage

Chat-only audit log(input/output)는 agent compliance에 불충분 — EU AI Act Article 12는 tool call·delegation chain까지 기록을 요구한다. First-class audit event: tool name·arguments·return/error·duration·reasoning step link를 단일 trace event로 emit. Write-once storage(S3 Object Lock) + append-only permission — agent runtime account는 delete 불가. Cryptographic chaining(hash chain) + meta-audit trail(reviewer access log). OpenTelemetry AgentTrace(2026) — cognitive/operational/contextual 3-surface taxonomy. SignalVault: "financial systems treat transactions"처럼 agent behavior를 material decision 단위로 capture.

  • tool call = first-class event — name·args·result·duration·reasoning step join
  • append-only write-once storage — agent가 자신의 audit trail 수정 불가
  • hash chain + meta-audit + OpenTelemetry AgentTrace 3-surface
원본 →
AI 코딩 도구

Session·Harness·Sandbox Separation — append-only log·wake(sessionId)·crash recovery

Long-running agent architecture(Anthropic 2026)는 3 primitive로 분리: Session(append-only event log, authoritative state), Harness(stateless loop, wake(sessionId)로 replay resume), Sandbox(provisioned execution env, uniform tool interface). Crash recovery: failed harness→replacement harness.wake(sessionId)→getEvents() replay→resume at next tool call. Inference-sandbox decoupling: model call은 sandbox provisioning과 병렬(~60% p50 TTFT↓). Horizontal scaling trivial — any harness picks up any session. Trade-off: unbounded log growth→compaction with irreversible decisions. GNAP(git-native) ·AgentOps Replay(hash-chained)과 다른 enterprise-scale 패턴.

  • Session(log) ·Harness(stateless) ·Sandbox(execution) — 3 primitive 분리
  • wake(sessionId) + event replay — crash recovery·horizontal scaling
  • inference∥provisioning — TTFT↓, log growth→compaction trade-off
원본 →
AI 코딩 도구

Zod + LLM Structured Output — TypeScript validation layer, z.toJSONSchema()·safeParse retry

Zod는 TypeScript LLM integration의 single source of truth — schema 1회 정의로 compile-time type + runtime parse 동시 확보. 2026 패턴: (1) Zod schema 정의 (2) z.toJSONSchema()(Zod v4 native)로 provider JSON Schema 생성 (3) OpenAI strict:true / Anthropic tool use로 constrained decoding (4) safeParse() + ZodError detail을 retry prompt에 포함. Vercel AI SDK generateObject()가 provider별 best strategy 자동 선택. Instructor(Python/Pydantic) ·Structured Outputs(provider-level)와 분리 — Zod는 TypeScript app validation layer. Constrained decoding도 logical error·data hallucination은 못 잡으므로 post-validation 필수.

  • Zod schema → z.toJSONSchema() → provider strict mode → safeParse() 4-layer
  • safeParse + ZodError retry — constrained decoding 후에도 logical error catch
  • Instructor(Python) ·Structured Outputs(provider)와 역할 분리 — TS app layer
원본 →
AI 코딩 도구

AI Agent Error Handling — circuit breaker·validation gate·idempotent saga·budget guardrail

Production agent error handling 5-pattern(Kevin Tan 2026): (1) Circuit breaker — HTTP error뿐 아니라 schema violation·hallucination rate 등 semantic quality failure도 track (2) Validation gate — write tool 전 Pydantic/Zod schema check, destructive tool은 interrupt() (3) Idempotent saga — partial failure 시 rollback, side effect는 validation 통과 후 (4) Budget guardrail — max turns·max tokens·max tool calls hard limit (5) Human escalation — confidence×blast-radius matrix로 agent가 stop deciding. LLM API Retry(429/5xx backoff) ·Graceful Degradation(fallback chain)과 3-layer: retry→degrade→escalate.

  • circuit breaker — HTTP + semantic quality failure(schema·hallucination rate)
  • validation gate(write前) + idempotent saga(partial rollback) + budget guardrail
  • LLM API Retry ·Graceful Degradation과 3-layer: retry→degrade→escalate
원본 →
AI 코딩 도구

Context Window Compaction — observation masking vs LLM summarization, multi-pass pipeline

Long-running agent context management(2026 research): observation masking(old tool output→placeholder)가 LLM summarization과 동등 이상 성능·비용 1/10(JetBrains 500 SWE-bench). Multi-pass pipeline: (1) tool result collapse (2) LLM structured summarization (3) truncation last resort. Proactive compaction at 60% budget > reactive at 95%. Anthropic: compaction=high-fidelity distill→new window+recent files. Microsoft Agent Framework: Truncation·SlidingWindow·ToolCallCollapsing·Summarization 4 strategy. Frequent Intentional Compaction(40-60% workflow) ·/context(diagnosis)과 분리 — 이 카드는 technical strategy 선택 framework.

  • observation masking ≥ LLM summarization — cost 1/10, trajectory elongation 방지
  • multi-pass: tool collapse→summarize→truncate — 60% budget에서 proactive
  • Frequent Intentional Compaction(workflow) ·/context(diagnosis)과 역할 분리
원본 →
AI 코딩 도구

Codex enterprise 확장 — Samsung 전사 배포·지식작업 20%·500만 WAU(2026-06)

OpenAI는 2026년 6월 Codex가 주간 활성 사용자 500만 명을 넘었고, 비개발 지식작업자가 약 20%를 차지하며 개발자보다 3배 빠르게 성장한다고 밝혔다. 같은 달 Samsung Electronics는 한국 전 임직원과 전 세계 DX 부문에 ChatGPT Enterprise·Codex를 제공한다고 발표했다. 핵심은 "대기업도 Codex를 쓴다"가 아니라, 코딩 에이전트가 R&D·제조·마케팅·사내 도구 자동화·리서치·분석·문서까지 넓어질 때 데이터 보호·접근 관리·보안 통제 같은 엔터프라이즈 경계가 먼저 필요하다는 점이다. 한국 주간 활성 사용자는 2026년 2월 1일 이후 약 800% 증가했다고 OpenAI는 밝혔다.

  • Samsung — 한국 전 임직원 + DX 부문 ChatGPT Enterprise·Codex, 데이터 보호·접근 관리·보안 정책이 전사 배포 핵심
  • 500만+ WAU — 비개발 지식작업 20%, 개발자보다 3배 성장, 리서치·분석·문서·내부 도구가 같은 워크스페이스로
  • 백그라운드 코딩 에이전트 카드와 역할 분리 — 이 카드는 enterprise adoption·비개발 확장 트렌드
원본 →
AI 코딩 도구

Cursor 병렬 에이전트 — git worktree→Agents Window·/best-of-n·Plan Mode(2.0→3.0)

Cursor는 2025-10 2.0에서 git worktree로 에이전트 병렬 격리·best-of-N을 내세웠고, 2026-04 3.0(Glass)은 사이드 Composer를 접고 Agents Window(Cmd+Shift+P)로 로컬·worktree·클라우드·SSH 에이전트를 한 표면에서 돌린다. /worktree로 변경 격리, /best-of-n으로 같은 작업을 여러 모델·각자 worktree에 병렬 시켜 최선을 고른다. 공식 베스트 프랙티스는 Plan Mode(Shift+Tab)로 조사→질문→승인 대기 계획을 .cursor/plans/에 저장한 뒤 실행하고, 같은 프롬프트를 여러 모델에 동시에 돌려 품질을 높이는 패턴을 권한다. Conductor·claude --worktree와 같은 worktree 격리 발상을 IDE에 기본 내장한 셈이다.

  • 2.0→3.0 — worktree 병렬 격리(2.0) → Agents Window·/worktree·/best-of-n(3.0), 클라우드 에이전트는 Agents Window 전용
  • Plan Mode(Shift+Tab) — 코드 전 계획·.cursor/plans/ 저장, @Branch로 컨텍스트 되돌리기·Debug Mode 가설→로깅
  • Cursor Composer 2.5(모델) ·Cursor Tab(자동완성)과 UI/모델 축 분리 — 이 카드는 병렬 에이전트 orchestration
원본 →
AI 코딩 도구

LLM Batch API — OpenAI vs Anthropic async 50% 할인·rate limit pool 분리

OpenAI·Anthropic Batch API는 동기 chat completion과 별도 async pool로 대량 offline inference를 50% 할인에 처리한다. OpenAI — POST /v1/batches, JSONL input file(최대 50K requests), 24h completion window, sync rate limit과 완전 분리된 batch quota. Anthropic Message Batches — 100K requests/batch, 50% discount, prompt caching과 stack 가능, 결과 29일 보관. 용도: eval suite overnight run, embedding bulk, fine-tuning data generation, log replay. 실시간 user-facing은 sync/stream, batch는 cost-optimized background. OpenAI Realtime API(stream) ·Batch API(async bulk) 역할 분리 — prod UX vs offline compute.

  • OpenAI JSONL 50K·24h window ·Anthropic 100K·29d retention·prompt cache stack
  • Sync rate limit pool과 분리 — eval·embedding bulk에 50% 할인
  • User-facing sync/stream vs offline batch — latency vs cost 분리
원본 →
AI 코딩 도구

LakeFS for Agentic AI — zero-copy branch·agent sandbox·Git-for-data governance

LakeFS는 object storage 위 Git-like data version control control plane으로, 2026년 Agentic AI용으로 agent별 zero-copy branch·pre-merge validation·immutable commit·agent identity/run ID attribution을 제공한다. 에이전트는 표준 file operation으로 branch-scoped credential workspace에 read/write — custom MCP/SDK 불필요. Parquet·Iceberg·Delta·PDF·이미지 등 structured/unstructured 통합 버전. DVC(Git+LFS artifact) ·Milvus External Collection(lake query)과 달리 "agent가 production data를 안전하게 변경"하는 merge gate·audit trail 레이어.

  • agent당 zero-copy branch — 실수 격리·seconds rollback·pre-merge hook(schema·row count)
  • commit = immutable data version — debug/audit/replay에 exact input state 재현
  • DVC(artifact versioning) ·Mem0(agent memory)와 역할 분리 — data layer governance
원본 →
AI 코딩 도구

Celery + Redis LLM Inference Queue — GPU worker pool·prefetch=1·broker/backend 분리

Celery 5.4 + Redis 7.2는 LLM inference를 HTTP gateway에서 decouple하는 production queue 패턴이다. FastAPI가 job을 Redis list/stream에 push, GPU worker는 --pool=solo --concurrency=1 --prefetch=1로 모델 1개만 VRAM에 로드. task_acks_late=True + task_reject_on_worker_lost=True로 worker crash 시 재큐. broker(Redis Streams consumer group)와 result backend를 별도 Redis instance로 분리, result_expires=3600·allkeys-lru. CPU preprocessing queue와 GPU inference queue를 route 분리해 head-of-line blocking 방지. Temporal(durable workflow) ·W&B Launch(experiment queue)와 달리 Python-native inference decoupling.

  • GPU worker — concurrency=1·prefetch=1·CUDA_VISIBLE_DEVICES pin, gevent=I/O preprocessing
  • Redis Streams > simple list — exactly-once·XACK·consumer group for retry traceability
  • Temporal+AI(durable agent state) ·OpenAI Batch(async provider job)와 역할 분리
원본 →
AI 코딩 도구

KEDA + Redis LLM Autoscaling — queue depth ScaledObject·cold start vs minReplica=1

KEDA 2.14 Redis scaler는 inference_queue listLength를 polling(15s)해 LLM worker Deployment replica를 1~N으로 autoscale한다. vLLM pending queue(Prometheus scaler) 또는 Redis BLPOP queue depth 중 signal 선택. GPU cold start(모델 load 60~90s+) 때문에 user-facing prod는 minReplicaCount=1 권장 — scale-to-zero는 dev/staging. Karpenter/GKE Cluster Autoscaler와 조합해 pending GPU pod→node provision(~2min). cooldownPeriod=300으로 scale-down thrashing 방지. Celery(queue consumer) ·AI deployment patterns(topology)와 달리 K8s event-driven autoscaling 구현.

  • ScaledObject redis trigger — listName·listLength(예: 5 items/pod)·activationListLength
  • minReplicaCount=1 for prod — cold start TTFT vs idle GPU cost trade-off, CronTrigger peak pre-warm
  • Celery(worker app) ·Ray Serve(orchestrated serving)와 역 role — infra autoscaling layer
원본 →
AI 코딩 도구

Runloop Devbox — microVM sandbox·Blueprint·suspend/resume·OpenAI Agents SDK native

Runloop은 AI agent용 hardware-isolated microVM Devbox를 API-first로 제공한다. Blueprint(Dockerfile-as-code)·Snapshot(point-in-time fork)·Suspend-Resume(idle compute 절감·state 유지)·Network egress policy(per-Devbox allowlist)가 composable primitive. OpenAI Agents SDK native sandbox backend(2026-04) — Blaxel·Cloudflare·Daytona·E2B·Modal·Vercel과 BYO provider. Agent Gateway·MCP Hub로 credential을 devbox 밖에 두고 LLM·tool 접근. E2B(ephemeral microVM·~150ms) ·Daytona(persistent Docker·sub-90ms) ·Agents SDK Sandbox(generic manifest)와 역할 분리 — enterprise devbox·SOC2·10K+ parallel.

  • Devbox lifecycle — create→shell.exec→snapshot→suspend→resume→shutdown, Docker-in-Docker 지원
  • OpenAI Agents SDK RunloopSandbox — cloud-native, local Docker 불필요, session serialize/rehydrate
  • E2B(microVM ephemeral) ·Daytona(OCI persistent) ·Copilot Sandboxes(IDE)와 sandbox 축 분리
원본 →
AI 코딩 도구

Daytona Sandbox — sub-90ms OCI·persistent agent workspace·2026 closed-source pivot

Daytona(daytona.io)는 AI agent용 secure elastic sandbox infrastructure다. OCI/Docker-compatible isolated VM, sub-90ms creation, unlimited persistence, snapshot fork·GPU sandbox(H100·RTX PRO). File·Git·LSP·Execute API, per-sandbox network allowlist. Open SWE·pydantic-ai CompositeBackend cloud execution backend. 2026-06 production isolation layer closed-source — legacy daytonaio/daytona OSS repo public 유지·fork 가능, ongoing SDK/docs는 github.com/daytona. E2B(Firecracker microVM) ·Microsandbox(self-host libkrun) ·OpenSandbox(Alibaba K8s)와 역할 분리 — Daytona=managed persistent composable computer·Computer Use desktop, E2B/Microsandbox=hardware isolation self-host option.

  • daytona.create() — Python/TS SDK, snapshot fork·GPU·mid-execution pause/resume
  • 2026 closed-source — isolation blueprint 공개 방지, legacy OSS repo fork·self-host 경로 유지
  • E2B(microVM) ·Microsandbox(libkrun) ·OpenSandbox(K8s credential vault)와 축 분리
원본 →
AI 코딩 도구

LLM Load Testing — TTFT·ITL·TPS·soak test, k6/Locust 한계와 LLM Locust·GenAI-Perf

LLM load test는 HTTP latency가 아니라 TTFT(Time to First Token)·ITL(inter-token latency)·TPS(tokens/s)·cache warm/cold 분리·soak(4h+)가 핵심이다. k6(SSE·Grafana CI)와 Locust(GIL bottleneck on tokenization)는 LLM-native metric이 없어 total response time만 재면 "통과했지만 신호 없음". LLM Locust(TrueFoundry, Locust extension) — streaming TTFT/TPS native. NVIDIA GenAI-Perf — Triton/vLLM/NIM backend inference layer. vLLM bench — server canonical. production-representative prompt distribution(길이·multi-turn) 없으면 saturation 예측 실패. Meticulous(frontend E2E) ·Claw-Eval(agent eval)과 역할 분리 — inference throughput·latency SLO.

  • Metric — TTFT(user-perceived) ·ITL(stream consistency) ·TPS(GPU saturation) ·soak 4h+ for memory leak
  • Tool — LLM Locust(streaming native) ·GenAI-Perf(self-host) ·k6+xk6-sse(infra layer) ·vLLM bench
  • Meticulous(UI replay) ·Inspect AI(agent eval)와 역할 분리 — LLM serving capacity planning
원본 →
AI 코딩 도구

Delta Lake Catalog-Managed Tables — Unity Catalog commit·AI Gateway·Iceberg 정렬(4.1.0)

Delta Lake 4.1.0 catalog-managed tables는 commit coordination을 filesystem→catalog(Unity Catalog 0.4.0)로 이동 — inline commit·faster query planning·multi-table transaction boundary. delta.feature.catalogManaged=supported로 opt-in. 2026 Databricks Unity AI Gateway — models·agents·tools·MCP runtime governance. Predictive optimization(AI-driven OPTIMIZE/VACUUM/ANALYZE) GA on managed tables. Iceberg v3·Managed Iceberg·multimodal FILE type(Beta). DVC(data artifact Git) ·LakeFS(agent branch) ·Milvus External Collection(vector on lake)와 달리 Delta+Unity=enterprise lakehouse catalog+AI governance stack.

  • Catalog commits — Unity Catalog = source of truth, skip cloud storage metadata latency
  • Unity AI Gateway(2026) — model·agent·tool·MCP runtime governance on same catalog
  • DVC ·LakeFS ·HuggingFace Datasets v5(Iceberg read)와 역할 분리 — Delta catalog-managed OLAP
원본 →
AI 코딩 도구

AI Pipeline Orchestration 비교 — Temporal·Prefect·Flyte·Dagster·Airflow·n8n 역할 분리(2026)

2026 AI pipeline orchestration은 "에이전트 프레임워크" vs "durable execution 인프라" vs "데이터 자산 DAG" 3층으로 나뉜다. Temporal — Workflow/Activity/Signal, OpenAI Agents SDK·Google ADK 공식 통합, CQRS durable execution 인프라. Prefect — Python @flow/@task, Pydantic AI PrefectAgent state recovery. Flyte 2 — pure Python asyncio agent runtime, self-healing checkpoint. Dagster — @asset 데이터 자산 1등 시민, dbt native. Airflow Common AI Provider — Pydantic AI HookToolset·350+ hook. n8n — 400+ integration 로우코드, LangChain AI node. 선택: agent state machine→Flyte/Temporal, Python ML team→Prefect/ZenML, data asset lineage→Dagster, hook ecosystem→Airflow, non-dev automation→n8n.

  • Temporal/Prefect/Flyte — durable agent execution(retry·resume·human gate), framework 아님 infra
  • Dagster/ZenML/Kubeflow — ML/data asset pipeline, agent fan-out budget limit
  • n8n/Apache Airflow — integration breadth vs Python-native, 개별 카드와 이 카드=선택 framework
원본 →
AI 코딩 도구

Mobile MCP — Android/iOS 기기를 에이전트 도구로 여는 MCP 서버(5.3k★)

mobile-next/mobile-mcp는 Android 에뮬레이터·실기기와 iOS 시뮬레이터·실기기를 MCP 도구로 노출하는 Apache-2.0 서버다. 에이전트는 모바일 화면을 비전 모델에만 맡기지 않고 접근성 트리, 화면 좌표, 스크린샷 fallback을 함께 써서 앱 실행·종료·설치·삭제, 화면 요소 열람, 탭·롱프레스·스와이프·텍스트 입력 같은 조작을 수행한다. Claude Code, Codex, Gemini CLI, Cursor, Copilot, Goose 등에는 `npx @mobilenext/mobile-mcp@latest` 형태로 붙인다. 실무 포인트는 모바일 QA를 "테스트 코드 생성"만으로 보지 말고, 실제 기기를 LLM 도구 표면으로 열어 관찰→행동→증거 수집을 반복하게 하는 것이다. 2026-06-25 GitHub API 기준 5,269★, Apache-2.0, 최신 push는 2026-06-15다.

  • 도구 표면: list devices/apps, launch/install/uninstall, screenshot, element list, tap/swipe/type
  • Android 경로: ADB + UI Automator, iOS 경로: native accessibility + WebDriverAgent
  • 학습 포인트: screenshot-only 자동화보다 접근성 트리와 deterministic tool call을 우선
원본 →
AI 코딩 도구

mobile-use — 자연어로 실제 Android 앱을 조작하는 오픈소스 모바일 에이전트(2.6k★)

minitap-ai/mobile-use는 자연어 명령으로 Android/iOS 앱 UI를 조작하는 Apache-2.0 모바일 에이전트다. README 기준 Android 실기기·에뮬레이터와 iOS 시뮬레이터를 지원하고, UI-aware navigation, 앱 데이터 스크래핑, JSON 같은 구조화 출력, OpenAI·Google·xAI·OpenRouter·MiniMax 등 모델 설정을 제공한다. Android 빠른 실행은 USB 디버깅이 켜진 기기나 에뮬레이터를 Docker 스크립트로 붙이는 방식이다. 기존 agent-device/Mobilerun 카드가 "테스트 검증 도구 선택"에 초점이었다면, 이 카드는 자연어 작업을 실제 모바일 앱 행동으로 바꾸는 agent runtime 패턴을 보여준다. 2026-06-25 GitHub API 기준 2,624★, Apache-2.0, 최신 push는 2026-06-24다.

  • 자연어→모바일 UI 행동: 메시지 전송, 앱 탐색, 데이터 추출 같은 실제 앱 흐름 수행
  • Android quick launch: USB debugging 기기/에뮬레이터 + Docker 스크립트, ADB 연결 필요
  • 학습 포인트: 모바일 에이전트 품질은 LLM보다 accessibility tree, replay, output schema가 좌우
원본 →
AI 코딩 도구

Helicone — LLM 프록시로 per-user 비용·캐시·rate limit, Helicone-User-Id 헤더(Apache-2.0)

Helicone은 LLM API 앞에 한 줄 baseURL 변경으로 끼우는 관측·비용 프록시다. Helicone-User-Id·Helicone-Session-Id·Helicone-Property-* 헤더로 사용자·세션·티어별 비용 attribution. 300+ 모델 자동 비용 계산, semantic cache(반복 요청 최대 95% 절감), request/token/dollar 기준 rate limit. 2026년 3월 Mintlify 인수 후 maintenance mode — 기존 통합은 유지되나 신규 기능 개발 중단. Langfuse(OTel trace+eval) ·Portkey(gateway routing)와 달리 "프록시 1줄→per-user FinOps"에 특화 — BurnLens·Tokonomics가 hard-cap 대안.

  • Helicone-User-Id 헤더 → per-user cost histogram, session 그룹핑
  • semantic cache + rate limit(request/token/$), 300+ 모델 pricing DB
  • 2026 Mintlify 인수→maintenance mode, hard-cap 필요 시 BurnLens 검토
원본 →
AI 코딩 도구

Microsoft Presidio — PII sandwich·agent 4-boundary pipeline·APIM guardrail

Presidio는 Microsoft 오픈소스 PII 탐지·익명화 프레임워크다. Analyzer(NER+regex+checksum+다국어) → Anonymizer(replace/mask/hash/encrypt) → 선택적 Deanonymizer로 LLM sandwich 패턴: 프롬프트 PII 치환→LLM→응답 복원. 에이전트는 user prompt뿐 아니라 tool argument·tool result·final response 4 boundary마다 outbound model call 전 redaction이 필요 — 첫 turn만 치환하면 cross-turn·tool hop에서 PII가 누적된다. Legend(deconvolute-labs)는 4-boundary pseudonymization+Boundary D restore, Philter는 NLP+pattern deterministic proxy. Azure APIM·PII Shield로 엣지 배포. NeMo Guardrails(대화) ·Guardrails AI(validator)와 달리 데이터 residency·provider tenancy 경계.

  • Sandwich: analyze→anonymize→LLM→deanonymize — agent는 4 outbound hop마다 반복
  • Analyzer: spaCy/ONNX/HuggingFace, LLM redactor 아닌 deterministic detection 권장
  • Legend/Philter와 역할 분리 — Presidio=framework, Legend=4-boundary agent adapter
원본 →
AI 코딩 도구

LaunchDarkly AgentControl — AI config·prompt·model을 200ms 런타임 제어, Guarded Rollout

LaunchDarkly AgentControl(2026)은 기존 feature flag 인프라(50T+/day)를 AI 런타임 제어로 확장한다. AI Config SDK로 prompt·model·parameters·tools를 코드 배포 없이 200ms 이내 갱신. Offline Evals(LLM judge·golden dataset) → Guarded Rollout(점진 traffic split·quality/cost/latency gate·auto rollback) → Online Evals(프로덕션 LLM judge). Adaptive Triggers: provider error rate 임계→모델 전환 자동. GrowthBook(DWH 네이티브 A/B) ·Firebase Remote Config(모바일)와 달리 "에이전트 runtime control plane+eval gate"에 특화.

  • AI Config SDK: prompt/model/tools 런타임, provider 직접 호출(프록시 아님)
  • Guarded Rollout: traffic split→quality gate→auto rollback, Offline+Online eval
  • GrowthBook/Firebase와 역할 분리 — AgentControl=에이전트 governance+eval
원본 →
AI 코딩 도구

Statsig AI Evals — Prompt versioning·shadow eval·LLM-as-judge, 코드 배포 없이 A/B

Statsig AI Evals는 Prompt(=Dynamic Config) + Grader(LLM-as-judge/rule-based) + Online Evals를 통합한다. Prompt Live/Candidate/Draft/Archive 4단계 — Candidate는 사용자에게 노출 안 하고 shadow-run하여 Live와 grade 비교. Node/Python AI SDK로 런타임 prompt fetch, logEvalGrade()로 0-1 score 반환. Critical Grader는 must-pass gate. Braintrust(eval-first CI) ·GrowthBook(feature flag)와 달리 "shadow candidate eval→winner promote" 프로덕션 패턴에 특화.

  • Prompt versioning: Live vs Candidate shadow-run, 사용자 impact zero
  • Grader: rule-based + LLM-as-judge, Critical Grader must-pass gate
  • Braintrust(CI eval gate)와 달리 Statsig=prod shadow+experiment 통합
원본 →
AI 코딩 도구

LLM Shadow→Canary Rollout — offline eval→shadow 100%→canary 2-10%→auto rollback gate

2026 LLM 모델·프롬프트·RAG 업데이트는 코드 배포와 다른 실패 패턴을 가진다 — schema drift·semantic regression·tail input category. 안전 rollout funnel: (1) offline eval on golden set (2) shadow mode — production traffic duplicate inference, 사용자는 incumbent만 수신 (3) canary — sticky hash(user_id)로 2-10% live candidate (4) gate check — schema conformance·p95 latency·quality score vs 7일 baseline, fail→auto rollback 0%. AI deployment patterns(topology) ·Graceful Degradation(service level)과 달리 "model artifact promotion pipeline"에 특화.

  • Shadow: 100% duplicate inference, zero user impact, 24-72h tail failure 수집
  • Canary: sticky session key, 2%→10%→50% gate, fail→router repoint <60s
  • LaunchDarkly Guarded Rollout ·Statsig shadow eval과 연계하는 infra layer
원본 →
AI 코딩 도구

OpenAI Moderation API — omni-moderation-latest, 텍스트+이미지·inline Responses API(무료)

OpenAI Moderation API는 omni-moderation-latest(GPT-4o 기반)로 텍스트·이미지 harmful content를 분류한다. hate·violence·self-harm·sexual 6+ 카테고리, category_scores 0-1 probability. standalone POST /v1/moderations 또는 Chat Completions/Responses API inline moderation(model: omni-moderation-latest) — input+output 동시 score, request ID로 audit trail 통합. 무료(Free 250 RPM). NeMo Guardrails(대화 레일) ·Guardrails AI(validator hub)와 달리 "provider-native toxicity classifier" — Perspective API(2026-12-31 sunset) 마이그레이션 1순위.

  • omni-moderation-latest: text+image, non-English 정확도 개선, 무료
  • inline moderation: Responses/Chat Completions 1-call, input+output score
  • Perspective sunset(2026-12-31) → OpenAI Moderation 또는 Azure Content Safety
원본 →
AI 코딩 도구

Perspective API Sunset — 2026-12-31 서비스 종료, toxicity 마이그레이션 필수

Google Jigsaw Perspective API는 2026년 12월 31일 공식 종료(sunset)된다. 신규 가입·quota 요청은 2026년 2월부터 중단, migration support 없음. TOXICITY·SEVERE_TOXICITY 등 0-1 probability score, Reddit·NYT 등 decade 사용. 한계: 영어 80-85%·비영어 60-75%, AAVE·LGBTQ+ over-flag, fully automated moderation 금지 권고. 2026 마이그레이션 경로: OpenAI omni-moderation(무료) ·Azure AI Content Safety ·Hive ·Tisane — threshold 재캘리브레이션 필수.

  • 2026-12-31 hard deadline, extension·migration support 없음
  • 영어 외 정확도·공정성 한계 — 단순 drop-in 아닌 re-benchmark 필요
  • OpenAI Moderation ·Azure Content Safety ·Hive로 대체, HITL 유지 권고
원본 →
AI 코딩 도구

GDPR + EU AI Act for AI Apps — DPIA+FRIA·prompt-layer PII·audit log by design(2026)

2026년 AI 앱은 GDPR과 EU AI Act가 동시 적용된다 — AI Act 고위험 의무 2026-08-02, GDPR은 그 위에 stack. EDPB Opinion 28/2024: 대부분 AI 모델은 anonymous 아님, training lawful basis 엄격. 실무 3층: (1) prompt-layer data minimization — Presidio redaction·pseudonymization before LLM (2) combined DPIA+FRIA — privacy+기본권 impact 단일 문서 (3) per-interaction audit log — model version·redaction rule·tool call, Article 30. Agent HITL Approval ·NeMo Guardrails와 달리 "regulatory architecture+technical control" 프레임워크.

  • EU AI Act 2026-08-02 high-risk + GDPR 동시, EDPB 28/2024 lawful basis 엄격
  • Prompt-layer PII redaction = data minimization by design, DPA training 금지
  • DPIA+FRIA 통합, per-interaction audit log(Article 30), agent kill switch
원본 →
AI 코딩 도구

Datadog Agent Observability — LangGraph·CrewAI·OpenAI Agents SDK span trace+eval

Datadog LLM Observability Agent Monitoring(2026)은 OpenAI Agents SDK·LangGraph·CrewAI에 Python SDK auto-instrumentation. intra/inter-agent span: tool call·LLM call·memory·handoff·retry를 unified trace. APM correlation으로 backend service→agent reasoning→user impact end-to-end. Custom LLM-as-a-judge eval(trace/span/session level), offline experiment+dataset+production monitoring 단일 플랫폼. Langfuse(OTel OSS) ·AgentOps(agent reasoning debug)와 달리 "기존 Datadog APM 위 AI agent layer" — infra+agent+UX correlation.

  • Auto-instrument: OpenAI Agents·LangGraph·CrewAI, tool/LLM/memory span
  • APM correlation: service issue→agent step→user impact root cause
  • LLM-as-judge eval trace/span/session, offline experiment→prod 동일 UI
원본 →
AI 코딩 도구

Qualcomm AI Hub — Snapdragon NPU용 LLM export·Genie SDK·ChatApp 레시피

Qualcomm AI Hub(aihub.qualcomm.com)는 Snapdragon Hexagon NPU에 최적화된 380+ 모델 zoo와 export·compile·deploy 파이프라인을 제공한다. qai-hub-models(PyPI)로 Hugging Face Llama 3.2 3B 등을 device-specific bundle로 export하고, QAIRT SDK(구 QNN)의 Genie SDK로 Android·Windows·Linux에서 on-device LLM을 실행한다. genie-t2t-run CLI 또는 ChatApp(Android Java/C++) 샘플로 Llama-v3.2-3B-Instruct를 Snapdragon 8 Elite Gen 5에서 TTFT·response rate 벤치마크 가능. NexaSDK(앱 SDK)와 달리 Hub는 모델 최적화·compile·reference app까지 end-to-end. 16GB RAM(7B+)·12GB(3B+) 메모리 요구, Android 15+.

  • qai-hub-models→QAIRT Genie bundle export, genie-t2t-run·ChatApp 배포
  • 380+ 모델 zoo, Llama 3.2 3B on Snapdragon 8 Elite Gen 5 벤치마크
  • NexaSDK(런타임 SDK) vs AI Hub(export+compile+sample app) 역할 분리
원본 →
AI 코딩 도구

MediaTek NeuroPilot + LiteRT Accelerator — Dimensity NPU를 단일 API로

MediaTek NeuroPilot는 Edge AI용 SDK·converter·compiler 생태계로, 2026년 Google과 협력해 LiteRT NeuroPilot Accelerator를 통합했다. LiteRT 단일 API로 MediaTek NPU를 타겟하고, AOT offline compile·on-device compile·CPU/GPU 자동 fallback을 지원. Gemma 3(270M·1B·3n E2B)·Qwen3 0.6B·EmbeddingGemma 300M 등 open-weight 모델이 Dimensity NPU에서 CPU 대비 최대 12x·GPU 대비 10x 빠른 추론. ExecuTorch(MediaTek delegate) ·Qualcomm AI Hub(Snapdragon Genie)와 달리 Google LiteRT 경로로 Dimensity 칩셋 millions-scale 배포.

  • LiteRT NeuroPilot Accelerator: 단일 API, AOT+on-device compile, auto fallback
  • Gemma 3·Qwen3 0.6B·EmbeddingGemma, NPU 12x CPU·10x GPU 속도
  • NeuroPilot SDK(converter) + LiteRT(runtime) = code once deploy everywhere
원본 →
AI 코딩 도구

Mobile LLM Thermal Throttling — sustained inference는 peak tok/s가 아니다

2026년 벤치마크는 모바일 LLM의 binding constraint가 peak compute가 아니라 thermal management임을 보여준다. iPhone 16 Pro는 peak 40 tok/s지만 2회 inference 후 44% degradation, benchmark 65% 시간 throttled 상태. Snapdragon 8 Gen 2는 90–120초 full-speed 후 clock 30–40% drop. 스마트폰 passive cooling은 2–3W sustained만 허용. 프로덕션 대응: duty cycling(추론·idle 2:1), batch size를 thermal pressure에 따라 4→2→1 축소, INT4 양자화로 bandwidth·발열 절감. EnerInfer·CORE(MLSys 2026)는 NPU/DDR frequency를 QoE·thermal comfort에 맞춰 joint control.

  • Peak≠sustained: iPhone 16 Pro 40→22 tok/s, S24 hard GPU frequency floor
  • Duty cycling·dynamic batch·INT4 quantization = production thermal strategy
  • EnerInfer/CORE: NPU+memory DVFS joint governor, always-on agent에 필수
원본 →
AI 코딩 도구

Swift Concurrency + Core AI ComputeStream — 온디바이스 추론을 async로

Core AI(WWDC26)는 Sendable InferenceFunction·ComputeStream으로 Swift Concurrency와 네이티브 통합한다. AIModel은 lightweight handle, loadFunction(named:)으로 InferenceFunction을 얻고 ComputeStream에 encode하면 Neural Engine/GPU 작업이 async로 직렬화된다. 동일 stream에 encode된 inference는 data dependency 기반 자동 순서 보장, InferenceFunction은 Sendable이라 concurrent task에서 per-caller buffer 자동 할당. SpecializationOptions로 ComputeUnitKind(CPU/GPU/Neural Engine) 명시, coreai-build CLI로 AOT compile해 first-run specialization latency 제거. Foundation Models LanguageModelSession에 CoreAILanguageModel을 plug하면 streaming·@Generable·tool calling 재사용.

  • ComputeStream + Sendable InferenceFunction = async on-device pipeline
  • coreai-build AOT compile → first-run specialization 시간 대폭 단축
  • Core AI overview 카드와 complement: Swift API·concurrency 설계 패턴
원본 →
AI 코딩 도구

Offline-First AI App — Room이 source of truth, WorkManager가 sync

온디바이스 AI 앱에서 offline-first는 "네트워크 없으면 disabled"가 아니라 local DB가 single source of truth이고 cloud는 sync mechanism이다. Android: Room/Kotlin Flow로 UI 즉시 반영, write는 pending sync 표시 후 WorkManager가 POST/PUT queue. Flutter: docs.flutter.dev offline-first 패턴 — repository가 local remote 병합, pull-to-refresh 또는 background workmanager sync. AI inference boundary는 local-first: embedding·RAG·LLM 생성은 디바이스, cloud는 model update·analytics coordination만. ObjectBox·sqlite-vector 카드(벡터 DB)와 complement: 아키텍처 레이어(데이터·sync·inference 분리).

  • Local DB=truth, network=sync — UI는 Flow/ReactiveStream으로 즉시 갱신
  • Write→pending sync→WorkManager/background task guaranteed delivery
  • Inference local-first, cloud=model update·coordination layer only
원본 →
AI 코딩 도구

On-Device AI Model Delivery — APK에서 모델 lifecycle 분리·incremental OTA

프로덕션 on-device AI는 모델을 APK에 bundling하면 Play 배포·rollback이 app release에 묶인다. 패턴: server-side model registry(버전·호환성·실험군 3-layer) + WiFi+charging+screen-off 조건부 download + incremental patch(BSDiff/tensor delta, patch>50% base면 full download) + staged rollout(1%→100%) + hot rollback. Play Asset Delivery·on-demand pack도 app version에 종속. A/B experiment group별 model binding으로 blast radius 제어. ExecuTorch(.pte)·LiteRT·GGUF 모두 동일 delivery pipeline 적용 가능.

  • Model registry 3-layer: version·compatibility·experiment group
  • Incremental patch vs full download threshold, WiFi+charging policy
  • Staged rollout + hot rollback, app release와 model iteration 완전 분리
원본 →
AI 코딩 도구

Mobile On-Device LLM SDK 2026 — ExecuTorch·MLC·NexaSDK·llama.cpp 선택 가이드

2026년 모바일 LLM SDK는 export pipeline·HW delegate·integration complexity 3축으로 갈린다. ExecuTorch(Meta): PyTorch torch.export→.pte, 12+ delegate(QNN·CoreML·XNNPACK), Instagram/WhatsApp 프로덕션 스케일 — PyTorch 팀에 최적. MLC LLM: TVM compile→hardware-native, iOS Metal·Android GPU·WebGPU 크로스플랫폼 — browser deployment unique. NexaSDK(Qualcomm): NPU-first, LLM·VLM·ASR·TTS 올인원, OpenAI 호환 API — Snapdragon NPU 최적·integration simplest. llama.cpp: GGUF·CPU/GPU portable, framework overhead 최소 — 프로토타입·fallback. 온디바이스 ML 3종(Core ML·LiteRT·ExecuTorch) 카드와 complement: LLM-specific SDK 비교.

  • ExecuTorch=PyTorch prod scale, MLC=TVM compile+cross-platform+WebGPU
  • NexaSDK=NPU-first multimodal simplest, llama.cpp=GGUF leanest
  • 선택: PyTorch→ExecuTorch, cross-platform+web→MLC, Snapdragon NPU→NexaSDK
원본 →
AI 코딩 도구

TinyMLDelta — TFLite Micro 모델 OTA를 binary patch로, flash wear 최소화

TinyMLDelta(felixgalindo/TinyMLDelta)는 embedded/TinyML 디바이스에서 full TFLite Micro model(20–200KB+) 대신 binary patch(수 KB)로 OTA 업데이트한다. PatchGen(off-target)이 tensor-level diff 생성, MCU runtime(on-target)이 flash에 atomic apply + metadata TLV compatibility 검증(opset·arena·signature). Flash wear는 changed byte만 write. Arduino UNO Q thermocouple anomaly demo: on-device train→PC patch gen→OTA push→infer. oxide(ONNX fleet delta) ·Android server-side model delivery와 complement: MCU/IoT scale incremental update.

  • PatchGen(off-target)→MCU runtime(on-target), metadata TLV compatibility gate
  • Diff not full model: bandwidth·flash wear·update latency 대폭 절감
  • TFLite Micro embedded 전용, oxide(ONNX fleet)와 스케일 분리
원본 →
AI 코딩 도구

LiteRT Delegate Patterns — GPU·NPU·NNAPI·CPU fallback 선택과 Android 17 NPU 선언

LiteRT(구 TFLite)는 CompiledModel API가 Interpreter를 대체해 자동 HW 선택·비동기 실행을 제공한다. Delegate 계층: GPU delegate(OpenCL/Vulkan), NNAPI(deprecated but legacy), vendor NPU delegate(Qualcomm·MediaTek via NeuroPilot Accelerator), XNNPACK CPU(+Arm SME2 via KleidiAI). Android 17: FEATURE_NEURAL_PROCESSING_UNIT manifest 선언 없으면 targetSdk 37+ NPU 접근 차단 — LiteRT NPU delegate·벤더 SDK·NNAPI 사용 앱 모두 해당. Fallback chain 설계: NPU→GPU→CPU, 각 경로 latency·accuracy·thermal profile 측정 필수. MediaPipe Tasks(LLM·vision)와 조합 시 delegate 자동 선택.

  • CompiledModel: auto HW select, GPU/NPU/XNNPACK delegate chain
  • Android 17 FEATURE_NEURAL_PROCESSING_UNIT manifest 필수(targetSdk 37+)
  • NPU→GPU→CPU fallback + per-path benchmark, NNAPI legacy 주의
원본 →
AI 코딩 도구

Private AI App Architecture — inference boundary·telemetry 분리·local-first UX

Private/local-first AI 앱은 "모델을 디바이스에 넣었다"로 끝나지 않는다. 3-layer boundary: (1) inference boundary — PII·prompt·embedding·generation이 디바이스를 안 떠남, cloud API는 opt-in fallback only (2) telemetry boundary — diagnostic metadata(model version·latency·error code)와 user content 분리, SideEye·nsfw_detect 패턴 (3) sync boundary — user-generated content만 encrypted sync, model weights는 separate delivery channel. React Native ExecuTorch+RAG·Genkit Dart hybrid·Firebase AI Logic routing 카드와 complement: privacy architecture 프레임워크.

  • Inference·telemetry·sync 3-boundary — content vs diagnostic 분리
  • Cloud=opt-in fallback, default on-device; encrypted sync for user data only
  • Model weights separate delivery, PII never in analytics pipeline
원본 →
AI 코딩 도구

Codex-maxxing — 긴 작업은 프롬프트가 아니라 지속되는 작업 공간으로 설계하기

OpenAI가 2026-06-22 공개한 Codex-maxxing whitepaper는 Codex를 "한 번 답하는 챗봇"보다 오래가는 작업 공간으로 쓰는 패턴을 정리한다. 핵심은 durable thread다. 중요한 작업은 같은 스레드에 맥락·선호·결정·열린 루프를 쌓고, 필요하면 memory vault에 사람·프로젝트·결정·닫힌 루프를 diff 가능한 기록으로 남긴다. 실행 중에는 steering으로 방향을 바로잡거나 다음 액션을 큐에 넣고, thread automation으로 같은 스레드가 주기적으로 Slack·Gmail·PR·배포 상태를 확인하게 할 수 있다. 단, 자동화의 끝은 사람 승인이다. 강한 goal은 "계획을 구현하라"가 아니라 원래 테스트 통과, 리뷰 기준, 제약, definition of done처럼 Codex가 검증할 수 있는 기준을 준다. 교훈은 장기 에이전트 운영에서 컨텍스트 보존·반복 wake-up·검증 가능한 목표·사람 승인 게이트가 한 묶음이라는 점이다.

  • Durable thread + memory vault로 맥락·결정·열린 루프를 재사용 가능한 기록으로 유지
  • Steering·thread automation으로 실행 중 방향 수정과 주기적 재개를 같은 스레드 안에서 처리
  • 목표는 테스트·리뷰 기준·제약·완료 정의처럼 에이전트가 검증 가능한 형태로 쓴다
원본 →
AI 코딩 도구

AI BFF Pattern — API key·PII·streaming을 서버 레이어로, 클라이언트는 렌더만

AI BFF(Backend for Frontend)는 LLM 기능을 클라이언트에 직접 붙이지 않고 서버-side gateway로 프록시하는 2026 enterprise 기본 패턴이다. BFF가 API key 보관·per-user rate limit·PII scrubbing·audit log·cost budget·guardrail을 enforce — 클라이언트는 stream render만. Next.js Route Handler·Server Actions·Hono·FastAPI가 BFF 구현체, Vercel AI SDK streamText·toUIMessageStreamResponse가 de facto streaming primitive. Memory/context manager·session auth·tool orchestration도 BFF에 집중. Portkey/Kong(enterprise gateway) ·Helicone(proxy FinOps)와 달리 "앱별 tailored AI layer" — mobile/web client마다 payload·auth·fallback 다르게.

  • API key·PII·rate limit·audit — 클라이언트 신뢰 불가 영역을 BFF로
  • Vercel AI SDK streamText + SSE — Next.js/Hono Route Handler 표준
  • Portkey/Kong(범용 gateway) vs BFF(앱별 tailored layer) 역할 분리
원본 →
AI 코딩 도구

Modular Monolith for LLM Apps — microservices보다 먼저 모듈 경계, 필요 시만 extract

2026 LLM 앱 아키텍처는 microservices default가 아니라 modular monolith가 출발점이다. 단일 deployable app 내부에 Routes·Services·Domain·Infrastructure 4-layer, AI gateway·RAG·evals를 @ai-blueprint 패키지로 module boundary enforce. microservices는 independent scale·polyglot·team isolation이 필요할 때만 — LLM chain latency·debug complexity·ops overhead가 early-stage에 과도. hybrid: monolith core + inference GPU service만 extract. ai-native-app-blueprint(Fastify modular monolith) ·Dify(visual workflow)와 달리 "코드-first module boundary + selective extraction" ADR. AI deployment patterns(topology) ·BFF(app layer)와 3-tier: monolith structure→BFF→gateway.

  • Modular monolith default — microservices는 scale/team isolation 필요 시만
  • AI gateway·RAG·evals module boundary — provider switch = gateway 교체
  • Selective extract — inference GPU·vector DB만 별도 service로 분리
원본 →
AI 코딩 도구

Kafka + Flink Agent Stack — MCP·A2A 위 durable event backbone

2026 multi-agent production stack은 MCP(tool access) + A2A(agent delegation) + Kafka(event backbone) + Flink(stream processing) 4-layer로 수렴한다. Kafka — durable·replayable·ordered event log, agent task publish/subscribe, orchestrator-worker·blackboard·fan-out 패턴. Flink — raw event stream을 windowed summary로 변환해 LLM token cost/latency 절감, Flink Agents(FLIP-531)는 agent를 Flink dataflow node로 embed. Celery+Redis(Python inference queue) ·Temporal(durable workflow)와 달리 "high-throughput event-native agent coordination". A2A 1년 카드(MCP complement) ·AI Pipeline Orchestration(Temporal/Prefect)과 역할 분리 — Kafka=event bus, Temporal=workflow state.

  • Kafka — durable event log, orchestrator-worker·blackboard·fan-out
  • Flink — stream enrich/window before LLM, Flink Agents = agent as dataflow node
  • MCP(tools) + A2A(agents) + Kafka(events) — 2026 agent infra stack
원본 →
AI 코딩 도구

SSE vs WebSocket for AI Streaming — LLM token은 SSE 기본, bidirectional만 WS

OpenAI·Anthropic·Google Gemini streaming API는 모두 SSE(text/event-stream) over HTTP를 채택했다 — LLM response는 본질적으로 server→client unidirectional. SSE 장점: plain HTTP(proxy/CDN/firewall 통과), EventSource auto-reconnect(Last-Event-ID), HTTP/2 multiplexing(6-connection limit 해소). WebSocket은 mid-stream steering·collaborative editing·real-time chat처럼 client→server concurrent send가 필요할 때만 — infra complexity(load balancer sticky·ping/pong·observability) 부담. production 필수: proxy_buffering off(Nginx), 15-30s heartbeat comment, client disconnect→upstream AbortController cancel(cost 절감). Vercel AI SDK ·OpenAI SDK가 SSE consume 표준.

  • LLM token stream = SSE default — OpenAI·Anthropic·Gemini·Vercel AI SDK
  • WebSocket — mid-stream steering·collab edit 등 bidirectional 필요 시만
  • proxy_buffering off + heartbeat + disconnect cancel — prod 3종 세트
원본 →
AI 코딩 도구

LLM Goodput SLO — uptime이 아니라 latency+cost+quality 동시 충족률

LLM SLO는 HTTP 200 uptime만으로 부족하다 — Goodput은 latency·cost·quality threshold를 동시에 충족하는 request 비율이다. 3-layer SLO: (1) Uptime — API availability·HTTP error (provider SLA 범위) (2) Performance — TTFT P50/P95·structured output parse success rate (3) Quality — faithfulness≥0.80·hallucination rate·refusal rate vs 7일 baseline. 1000 RPS 중 TTFT 위반 15%+quality 위반 8% → Goodput ~780 RPS. burn-rate alert로 point threshold noise 방지. Langfuse/LangSmith(trace) ·Statsig AI Evals(quality gate) ·LLM Shadow→Canary(promotion gate)와 연계하는 SLO design layer.

  • Goodput = latency+cost+quality 동시 충족 request 비율
  • 3-layer: uptime(provider SLA) ·performance(parse/TTFT) ·quality(faithfulness/refusal)
  • burn-rate alert — point threshold 대신 SLO budget 소진율
원본 →
AI 코딩 도구

Vendor SLA Gap — 200 OK인데 제품은 broken, functional availability 측정

Frontier LLM provider SLA는 "2xx response within latency bound"만 cover — refusal rate spike·JSON schema drift·capability regression·region failover model heterogeneity는 SLA 밖이다. Azure OpenAI SLA는 endpoint uptime만 commit, output accuracy/relevance는 no commitment. functional availability = "우리 제품 기준으로 working한 request 비율" — provider green이어도 assistant가 routine request refuse·downstream parser broken 가능. 대응: per-feature functional SLO(refusal rate·parse success·task completion), provider SLA를 necessary not sufficient로 treat, multi-provider fallback at gateway. AI BFF(gateway layer) ·Goodput SLO(design) ·Agent Graceful Degradation(fallback) 3-tier reliability.

  • Provider SLA = 2xx uptime, product failure = refusal·schema·capability drift
  • Functional availability — "우리 제품 기준 working" 자체 instrumentation
  • Provider green ≠ product healthy — gateway fallback + per-feature SLO
원본 →
AI 코딩 도구

AI Incident Response Runbook — 6-phase·version snapshot·EU AI Act Article 73

LLM incident는 HTTP 500이 아니라 silent behavioral degradation — hallucination spike·retrieval outage·guardrail bypass·latency regression. 6-phase runbook: (1) Detect — quality/refusal/parse rate alert (2) Triage — failure layer 분류(retrieval/quality/performance/safety) (3) Contain — traffic reroute·degraded mode·circuit breaker (4) Mitigate — prompt/model rollback·fallback activate (5) Recover — canary re-promotion (6) Postmortem — version snapshot. contain 60분 이내 executable action 필수 — root cause 전에도. EU AI Act 2026-08-02 high-risk: Article 73 serious incident 15일·very serious 2일 notification. Datadog Agent Observability(trace) ·Human-in-the-Loop(approval gate) ·Graceful Degradation(fallback) 연계.

  • 6-phase: detect→triage→contain→mitigate→recover→postmortem
  • Failure layer 분류 — retrieval/quality/performance/safety 각각 다른 playbook
  • EU AI Act Article 73 — serious 15일·very serious 2일 notification deadline
원본 →
AI 코딩 도구

AI Postmortem — model·prompt·index version snapshot + eval gap analysis

AI postmortem은 commit SHA만으로 부족 — incident start 시점 full version snapshot 필수: model version·prompt hash·retrieval index version·embedding model·tool schema·guardrail config·eval dataset version. failure layer classification(retrieval vs quality vs performance vs cost vs data), failing trace attachment(rendered prompt·retrieved chunks·generated output). eval gap analysis — "어떤 eval case가 missing? sycophancy test 없었나?" → eval dataset feed-back. blameless 6 questions + action item owner/due date/verification method. traditional SRE postmortem ·AI Incident Runbook(6-phase)과 complement — runbook=response, postmortem=learning loop.

  • Version snapshot — model·prompt·index·tool schema·guardrail·eval dataset
  • Trace evidence — rendered prompt·retrieved chunks·output attach
  • Eval gap analysis — missing eval case → dataset enrichment action item
원본 →
AI 코딩 도구

LLM Data Flywheel — production trace→curate→eval gate→fine-tune→promote

Data flywheel는 production traffic을 training signal로 변환하는 closed-loop다. 5-stage: (1) Ingest — OTel trace/log accumulate (2) Curate — filter·deduplicate·LLM-as-judge quality score (3) Experiment — ICL zero-compute vs LoRA SFT candidate (4) Evaluate — teacher model judge·latency·cost·regression set (5) Promote — all gates pass→production replace. tohio/data-flywheel(Celery chain·MongoDB run doc) ·Arize AX(ExportSpansToFineTuningOperator·Airflow DAG) 구현. Pioneer Agent(arXiv 2604) — production failure→taxonomy→corrective curriculum→retrain loop. Distilabel(RLHF synthetic data) ·Continuous Fine-Tuning(contamination guard)와 역할 분리 — flywheel=automated prod→model loop.

  • 5-stage: ingest→curate→experiment→evaluate→promote
  • LLM-as-judge curation — manual label bottleneck 제거
  • Eval gate + regression set — promote only if all dimensions pass
원본 →
AI 코딩 도구

Continuous Fine-Tuning Pipeline — eval/train physical separation·replay buffer

User feedback fine-tuning은 eval signal contamination이 최대 리스크 — training data와 eval benchmark가 같은 pipeline을 공유하면 metric이 meaningless. architecture: classification gateway가 interaction을 training vs eval traffic bucket으로 route, eval benchmark는 append-only separate store(access control). MinHash+LSH dedup(5-gram Jaccard≥0.8)으로 held-out eval example이 training에 유입 차단. replay buffer — past high-quality example을 new batch에 mix해 catastrophic forgetting 방지. self-reinforcing error guard — confident wrong answer가 training signal 되면 eval이 specific failure mode test 필요. LLM Data Flywheel(automation) ·Distilabel(synthetic RLHF data) ·Pioneer Agent(production repair)와 complement.

  • Physical separation — training pipeline ≠ eval benchmark store
  • MinHash+LSH dedup — eval example training contamination 차단
  • Replay buffer — catastrophic forgetting·self-reinforcing error 방지
원본 →
AI 코딩 도구

Garak vs PyRIT — LLM Red Team 2축, surface scan vs multi-turn campaign

LLM red team은 Garak(NVIDIA·Apache-2.0·~8k★)과 PyRIT(Microsoft·MIT·~4k★) 두 축으로 나뉜다. Garak — nmap/Metasploit식 probe library로 prompt injection·탈옥·데이터 유출·환각·독성을 단일턴·배치 스캔. HuggingFace·OpenAI·Bedrock·LiteLLM·llama.cpp 등 다양한 generator 연결, NeMo Guardrails 통합으로 가드레일 전후 보호율 측정. PyRIT — Target(Azure OpenAI·HTTP·agent)·Orchestrator(Crescendo·TAP multi-turn)·Converter(Base64·Leetspeak)·Scorer(LLM-as-judge)·Memory(forensic log) 5계층. 53+ adversarial dataset·70+ prompt converter·6 attack strategy, Copilot 등 100+ 제품 red team에 사용. 실무 조합: release gate는 Garak surface scan→PyRIT adaptive multi-turn campaign→OWASP LLM/ASI 매핑. OWASP LLM Top 10(위협 모델) ·NeMo Guardrails(런타임 레일)와 역할 분리 — red team=offensive validation layer.

  • Garak — probe library surface scan, NeMo Guardrails 보호율 A/B
  • PyRIT — Crescendo/TAP multi-turn, 53+ dataset·70+ converter·CI exit gate
  • Garak→PyRIT pipeline — surface→adaptive campaign, OWASP 매핑
원본 →
AI 코딩 도구

Indirect Prompt Injection — Rule of Two·Dual-LLM·tool-output quarantine

Indirect prompt injection은 이메일·웹페이지·RAG chunk·MCP tool response처럼 "데이터 경로"로 들어와 에이전트 목표를 가로채는 공격이다. OpenAI·Anthropic·Google DeepMind는 2025~2026에 prompt-only 방어로는 구조적으로 완전 해결 불가를 인정했다. Meta Rule of Two — 단일 operation에서 untrusted input 처리·sensitive system 접근·external state 변경 셋 중 최대 2개만 허용. Dual-LLM(Simon Willison 2023→Microsoft Zero Trust 2026 Spotlighting) — privileged planner(도구 결정)와 quarantined reader(비신뢰 바이트만 읽음) 분리, schema-validated channel로 structured extraction만 교환. tool poisoning 방어 — tool output free-text를 planner context에 직접 merge하지 말고 typed field만 통과. 코딩 에이전트 프롬프트 인젝션 방어(Claude Code) ·OWASP LLM01과 축 분리 — indirect=untrusted data plane.

  • Rule of Two — untrusted input·sensitive access·state change 중 2개까지만
  • Dual-LLM — planner/quarantined reader + schema-validated channel
  • Tool output quarantine — typed field만 planner에, free-text 격리
원본 →
AI 코딩 도구

Tool Execution Layer — agent가 도구를 직접 호출하지 않게

Tool Execution Layer는 LLM의 tool_call proposal과 실제 side effect 사이에 끼는 fail-closed gateway다. 에이전트 runtime은 API를 직접 때리지 않고 tool_call JSON만 제출 → gateway가 existence·allowlist·argument schema·role policy·rate limit·timeout을 검증 후 실행. write/destructive tool은 interrupt() 또는 human approval queue, idempotent read-only만 auto-execute. Joseph Manzambi secure-by-design agent 패턴 — Input Guard(확률적) 위에 Tool Authorizer(결정론적)를 두어 jailbreak와 무관하게 allowlist+schema gate. OWASP ASI02 Tool Misuse ·Human-in-the-Loop Approval과 complement — TEL=모든 tool_call의 단일 enforcement point. MCP per-tool scope(CSA) ·Cursor Auto-review(문맥 위험도)와 역할 분리 — TEL=실행 직전 deterministic gate.

  • agent→proposal→gateway(validate·authorize·execute)→normalized result
  • deny-by-default allowlist + schema validation + write approval
  • OWASP ASI02/HITL complement — LLM 밖 deterministic enforcement
원본 →
AI 코딩 도구

Pickle vs Safetensors — torch.load RCE·picklescan·weights_only 한계

PyTorch .pt/.pth는 pickle deserialization이라 악성 checkpoint가 torch.load() 시 임의 코드 실행(RCE) 가능 — CWE-502. CVE-2025-32434·CVE-2026-24747처럼 weights_only=True도 parser bug로 bypass 사례가 있어 "플래그=영구 안전"이 아니다. Safetensors(Hugging Face·Apache-2.0) — header+raw tensor bytes만, zero-copy load, 코드 실행 경로 제거. legacy pickle은 isolated network-off 환경에서 picklescan/fickling(Trail of Bits) opcode scan → safetensors 변환 후 promote. secure-torch·model-provenance-guard는 signature+pickle scan+header inspection을 CI gate로 묶는다. CycloneDX ML-BOM(provenance) ·Sigstore signing(identity)과 3-layer — format safety→scan→sign→deploy.

  • pickle=torch.load RCE sink, weights_only는 완전 해결 아님
  • safetensors — non-executable format, HF Hub 기본 권장
  • picklescan/fickling CI gate → safetensors convert → sign
원본 →
AI 코딩 도구

Sigstore Model Signing — OpenSSF model-signing v1.0·HF verify gate

Google·OpenSSF가 2026에 model-signing Python v1.0 stable을 릴리스 — Sigstore OIDC keyless signing으로 ML artifact에 투명성 로그+감사 가능 provenance. 디렉터리 트리 단위 sign/verify CLI — 단일 .safetensors부터 multi-shard model folder까지. Hugging Face Hub upload flow에 verify integration 예정 — split-view·model substitution 방지. modelsign(Ed25519 offline) ·CycloneDX ML-BOM(SBOM metadata)과 complement — Sigstore=enterprise transparency log, modelsign=air-gapped quick sign. model-provenance-guard GitHub Action — SHA-256 hash registry+cosign verify+picklescan before pipeline admit. Patch the Planet(Sigstore participant) ·CycloneDX ML-BOM과 supply chain 3-tier: format→BOM→signature.

  • OpenSSF model-signing v1.0 — Sigstore keyless, directory-tree sign
  • HF Hub verify integration — substitution·split-view 방지
  • CI gate: hash registry+cosign+picklescan before deploy
원본 →
AI 코딩 도구

Agent Egress Security — capability separation·kernel isolation·DLP proxy

Agent egress security는 LLM이 active party로 outbound traffic을 날리는 threat model — credential·PII·prompt-injection exfiltration이 HTTP body·URL·DNS·MCP argument로 새는 경로를 통제한다. Capability separation — agent process는 secret 보유 but network 없음, egress proxy는 network 있지만 secret 없음 → 단독으로는 exfil 불가. HTTPS_PROXY env만으로는 부족 — prompt injection이 unset 가능, kernel nftables/iptables·network namespace로 direct connect 차단. Pipelock(Apache-2.0) — 62+ DLP pattern·SSRF CIDR block·DNS rebinding pin·MCP/A2A transport inspect·signed action receipt. AI BFF(server-side key) ·Project KARL(zero device egress)와 축 분리 — egress=agent runtime outbound control plane.

  • Capability separation — agent=secrets/no-net, proxy=net/no-secrets
  • Kernel enforcement — nftables/namespace, env proxy만으로 불충분
  • DLP+SSRF proxy — content inspect, DNS pin, signed receipt
원본 →
AI 코딩 도구

AI Agent SSRF Defense — metadata blocklist·DNS pinning·scheme allowlist

AI agent SSRF는 poisoned tool description·RAG URL·user-supplied link로 agent가 169.254.169.254(cloud metadata)·10.0.0.0/8(private)·fd00::/8(ULA) 등 internal endpoint를 호출하게 만드는 공격. 3-layer defense: scheme allowlist(http/https only) → URL canonicalization → DNS resolve 후 CIDR blocklist → resolved IP pin(connection lifetime re-resolve 금지). Activepieces egress proxy 패턴 — ssrf-guard(dns.lookup+Socket.connect monkeypatch) + loopback CONNECT proxy(multi A/AAAA record check) + iptables per-UID kernel lockdown. IPv4-mapped IPv6·decimal IP·URL encoding bypass는 canonicalization layer에서 먼저 정규화. Agent Egress Security(DLP) ·MCP tool URL argument와 연계 — MCP fetch tool도 동일 pipeline 통과.

  • metadata+private CIDR blocklist after DNS resolve
  • DNS pinning — resolve once, pin IP for request lifetime
  • ssrf-guard+CONNECT proxy+iptables 3-layer stack
원본 →
AI 코딩 도구

HashiCorp Vault AI Secrets — dynamic DB creds·short-lived agent tokens

AI agent·MCP server·CI pipeline에 API key를 .env·settings.json·prompt에 하드코딩하면 leak blast radius가 전체 key lifetime과 같다. HashiCorp Vault — dynamic secrets engine이 DB·cloud IAM·KV credential을 TTL-bound short-lived token으로 mint, agent는 vault agent sidecar/injector로 runtime fetch. Vault Secrets Operator(K8s) — CRD로 secret sync, pod는 file/env mount만, git에는 placeholder. OpenAI/Anthropic key rotation — static key 대신 Vault KV v2 versioned secret + automatic lease renewal. AI BFF(server-side key custody) ·GitHub MCP Secret Scanning(pre-commit)과 3-tier — never-in-prompt→scan→dynamic lease. Codex safe ops(OS keyring) ·MCP OAuth token storage와 complement — Vault=central policy+audit+rotation.

  • Dynamic secrets — TTL-bound creds, static API key 금지
  • Vault Agent/Operator — sidecar inject, git에는 placeholder만
  • AI BFF·secret scanning·Vault = custody→detect→rotate
원본 →
AI 코딩 도구

OWASP ASI Top 10 + AIUC-1 crosswalk — agentic procurement baseline·SOC2 analog certification

OWASP Agentic Security Initiative(ASI) Top 10 for Agentic Applications 2026(2025-12, 100+ expert peer review)는 autonomous agent 고유 실패 모드를 10개로 정의한다. ASI01 Goal Hijack ·ASI02 Tool Misuse ·ASI03 Identity/Privilege Abuse ·ASI04 Supply Chain ·ASI05 Unexpected Code Execution ·ASI06 Memory/Context Poisoning ·ASI07 Insecure Inter-Agent Comms ·ASI08 Cascading Failures ·ASI09 Human-Agent Trust Exploitation ·ASI10 Rogue Agents. OWASP LLM Top 10(2025)은 GenAI app risk, ASI는 plan·act·persist·delegate agent risk — procurement·threat modeling에서 병행. least agency principle — minimum autonomy for bounded task가 cross-cutting mitigation. Five Eyes "Careful Adoption of Agentic AI"(2026-05)가 ASI control mapping을 국제 규제 signal로 채택. AIUC-1 crosswalk(2026-05-25) — ASI01~10↔AIUC-1 6 domain bidirectional mapping·8 gap areas(agent identity·runtime containment·supply chain attestation·schema controls 등) — agent 배포 시 threat taxonomy(ASI)와 auditable certification(AIUC-1)을 한 세트로. NSA MCP PP-26-1834(MCP operational) ·Microsoft AGT(runtime enforcement)와 compose.

  • ASI01~10 — goal hijack·tool misuse·privilege·supply chain·RCE·memory poison
  • AIUC-1 crosswalk — SOC2 analog cert, 8 gap areas where cert must expand for ASI
  • least agency + Five Eyes 2026-05 — procurement baseline before runtime toolkit
원본 →
AI 코딩 도구

MCP Tool Poisoning — description drift·Snyk Agent Scan·skill supply-chain·toxic flows

MCP tool poisoning은 tool description·schema·return example에 hidden directive를 embed해 LLM이 benign tool을 malicious action으로 호출하는 supply chain attack. Snyk Agent Scan(snyk/agent-scan·Invariant mcp-scan 후속)은 Cursor·Claude·Windsurf MCP config auto-discover→server 실행→tools/list 수집→15+ risk scan — tool poisoning·tool shadowing·toxic flows·skill malware payload(E006). skills ecosystem report(2026) — SKILL.md hidden instruction·credential handling·malware payload. pre-commit·CI `--dangerously-run-mcp-servers` gate. Pipelock(runtime proxy) ·Promptfoo redteam mcp plugin과 3-layer — static scan→runtime proxy→adversarial eval.

  • Snyk Agent Scan — MCP+skills inventory, tool poisoning·shadowing·toxic flows
  • Runtime server execution — tools/list must run server, consent/sandbox required
  • 3-layer defense — Snyk static scan·Pipelock runtime·Promptfoo adversarial CI
원본 →
AI 코딩 도구

AI Browser Agent Security — Playwright agent·session isolation·origin policy

Browser-using agent(Playwright MCP·Playwright CLI·Computer Use)는 웹의 untrusted DOM·cookie·localStorage·download surface를 agent tool로 노출한다. 핵심 통제: dedicated browser profile per agent session — production SSO cookie·password manager와 분리, task 종료 시 profile delete. navigation allowlist — agent가 arbitrary URL fetch 전 domain policy check, file://·javascript: scheme 차단. download/upload gate — agent-initiated file write는 quarantine dir only, sensitive path symlink traversal block. Same-origin에서 indirect injection — page content를 planner prompt에 raw merge 금지, accessibility tree/snapshot structured field만. Playwright CLI+MCP(도구) ·Indirect Prompt Injection(data plane) ·Agent Egress Security(network)와 3-layer 분리.

  • Dedicated ephemeral browser profile — SSO cookie 격리
  • Navigation allowlist + download quarantine dir
  • DOM snapshot structured only — raw HTML prompt merge 금지
원본 →
AI 코딩 도구

Copilot Agent Tasks REST API — 에이전트 작업을 queue·lifecycle·PR 추적 리소스로

GitHub Copilot coding agent task를 REST API로 생성·조회·추적하는 Agent tasks API(public preview, 2026-06). 핵심 엔드포인트: POST/GET /agents/repos/{owner}/{repo}/tasks. body 필수 prompt, 선택 base_ref·model·create_pull_request. 응답 queued/in_progress/waiting_for_user/completed/failed·session_count·PR artifact·head/base ref. 교훈: 채팅 버튼이 아니라 queue·status·PR output을 가진 운영 리소스로 모델링 — 사내 포털·릴리스 스크립트·마이그레이션 팬아웃이 같은 API로 task 생성·상태 추적. 인증: user-to-server token만(GitHub App installation token 불가), fine-grained token에 Agent tasks 권한 필요. 자동화 전 관측성·권한 경계·PR 추적을 먼저 확보 — agent에 바로 write 권한 넓히지 말 것.

  • POST/GET /agents/repos/{owner}/{repo}/tasks — prompt 필수, base_ref/model/PR 선택
  • queue·lifecycle·PR artifact — UI 이벤트가 아닌 운영 리소스로 모델링
  • user-to-server token + Agent tasks 권한, public preview 계약 변경 가능
원본 →
AI 코딩 도구

LLM Idempotency Keys — orchestrator가 만든 키, LLM이 아닌

Agent idempotency는 tool property가 아니라 orchestration contract다. LLM이 Idempotency-Key를 생성하면 retry 시 paraphrase로 새 키가 나와 dedup이 무력화된다. 실무 패턴: orchestrator가 run_id+step_id+tool_name+business_scope로 deterministic key derive → tool execution layer가 dedup store 확인 후 side effect 실행. Stripe Idempotency-Key header·DB unique constraint(tenant_id, idempotency_key)가 defense in depth. chaos test: runner kill 후 resume 시 downstream write count가 single-attempt baseline과 일치해야 pass. AI Agent Error Handling(idempotent saga) ·Tool Execution Layer(gateway)와 complement — key derivation=orchestrator 책임.

  • orchestrator-owned key — run_id+step_id+tool_name+scope, LLM 생성 금지
  • dedup store before side effect — HTTP header 또는 DB unique constraint
  • chaos replay test — kill mid-step 후 resume, write count baseline 일치
원본 →
AI 코딩 도구

LLM API Webhook Patterns — 202 Accepted·Standard Webhooks·at-least-once

Long-running LLM job은 sync request-response로 처리하지 않는다. 표준 패턴: POST submit→202 Accepted+job_id 즉시 반환 → queue(BullMQ/SQS) → worker LLM call → webhook POST callback. OpenAI(2025~)·Gemini·Anthropic이 Standard Webhooks(HMAC-SHA256, webhook-id·webhook-timestamp·webhook-signature) 정렬 — generic library로 verify. handler는 verify→enqueue→2xx ms 응답, heavy processing은 async worker. webhook-id=idempotency key로 at-least-once dedup. timestamp 5분 reject(replay attack). polling GET /jobs/{id} fallback 필수(CLI·browser SPA). LLM Batch API(offline bulk) ·SSE(streaming UX)와 역할 분리 — webhook=server-to-server completion notify.

  • 202+job_id → queue → webhook callback, Standard Webhooks verify
  • webhook-id dedup ·timestamp 5min reject ·2xx fast ack+async worker
  • GET /jobs/{id} polling fallback — webhook 불가 client용
원본 →
AI 코딩 도구

Fern vs Mintlify vs ReadMe — AI-native docs 3축 2026

llms.txt 표준 이후 docs platform 선택은 AI discoverability가 핵심이다. Mintlify — AI-native docs, llms.txt·llms-full.txt·skill.md·MCP server 자동 생성, Git/MDX authoring, polished site. Fern — OpenAPI 단일 source→docs+SDK+snippets sync, llms.txt/full 자동, Markdown bot delivery(HTML 대비 90% token↓), content tag로 AI/human visibility 분리, LLM provider별 analytics. ReadMe — interactive developer portal·try-it·API metrics, llms.txt+MCP 생성 있으나 llms-full·granular AI control·bot analytics 약함. 선택: docs site=product surface→Mintlify, OpenAPI=SDK truth→Fern, portal+usage feedback→ReadMe. llms.txt(표준) ·Mintlify(플랫폼) 카드와 complement — 3-way platform bake-off.

  • Mintlify — zero-config AI-native, llms.txt+MCP+skill.md 자동
  • Fern — OpenAPI→docs+SDK, bot Markdown·content tag·LLM analytics
  • ReadMe — portal+try-it, llms.txt 기본·AI control/analytics 약함
원본 →
AI 코딩 도구

WireMock vs Prism — LLM API mock 2축, stateful fault vs OpenAPI contract

LLM backend 개발·테스트에서 mock server 선택은 contract-first vs chaos engineering 두 축이다. Prism(Stoplight) — OpenAPI spec→zero-config mock+validation proxy, schema example/generate, spec drift 즉시 catch. stateful behavior 미지원 — API-first daily dev에 적합. WireMock — request matching·stateful scenario·fault injection(502/timeout/malformed)·record-playback, agent downtime handling 테스트. 실무 stack: OpenAPI define→Prism daily frontend dev→WireMock edge-case failure suite→FastAPI prototype promote. LLM VCR cassette(응답 replay) ·LiteLLM proxy(routing)와 역할 분리 — mock=pre-backend contract·failure simulation.

  • Prism — OpenAPI→mock+validation proxy, zero-config, stateless
  • WireMock — stateful·fault injection·record-playback, chaos QA
  • Prism contract dev → WireMock failure suite → promote prototype
원본 →
AI 코딩 도구

LLM VCR Cassette Testing — promptecho·llmvcr·reel vs VCR.py

LLM 테스트 3대 문제: flaky output·slow network·expensive CI token burn. VCR.py는 raw HTTP intercept → SSE streaming crash·API key plaintext·temperature drift로 cassette miss. LLM-native cassette 도구: promptecho(httpx intercept, SSE stream replay, actionable miss diff) ·llmvcr(SDK layer, YAML cassette, streaming native) ·reel(HTTP proxy, JSONL cassette, pytest --reel-mode replay CI gate) ·vcr-llm(14 provider auto-detect, JSONL). 패턴: record once real API→playback CI free/offline/deterministic. cassette miss=prompt drift signal. promptfoo(eval assertion) ·WireMock(API mock)와 complement — VCR=real response capture replay.

  • VCR.py 한계 — SSE crash·key leak·param drift, SDK/proxy layer 필요
  • promptecho/llmvcr/reel — streaming replay·CI replay mode·actionable diff
  • record once→CI playback — cost·flake·latency 제거
원본 →
AI 코딩 도구

Structured Logging for LLM Apps — event taxonomy·log-trace correlation

LLM 앱 로그는 print/debug가 아니라 incident reconstruction artifact다. 필수 event taxonomy: request.received·context.assembled(prompt/index version hash)·model.started/completed(token·latency)·tool.called/completed(idempotency key·scope)·approval.requested/resolved. structured JSON + OTel log SDK가 trace_id·span_id 자동 inject — span↔log pivot zero effort. prompt/completion은 span attribute가 아닌 span event(크기·PII). OpenTelemetry GenAI Semantic Conventions(gen_ai.* spec) ·Langfuse(trace backend)와 역할 분리 — structured log=what to log design, OTel=how to correlate.

  • event taxonomy — context.assembled·tool.called·approval gate audit
  • JSON log + OTel trace_id/span_id auto inject
  • prompt/completion → span event, attribute 아님
원본 →
AI 코딩 도구

PII-Safe LLM Logging — hash·redact·OTel Collector pipeline

LLM 로그에 raw prompt·user_id·email을 넣으면 GDPR·SOC2·내부 audit에서 incident가 된다. 3-layer: (1) application — user_id→SHA-256 hash, email/phone Presidio detect+mask before log emit (2) span — PII in event not attribute, OTel Collector redaction processor (3) retention — prompt full text 7-30d, hash/metadata 1y. tool.called log에 idempotency key+args hash만, raw args redact. Microsoft Presidio(sandwich guardrail) ·GDPR+EU AI Act(prompt-layer PII) ·Structured Logging(event taxonomy)와 complement — PII-safe=logging pipeline design.

  • user_id hash ·Presidio mask ·args hash only in tool log
  • PII → span event + Collector redaction processor
  • retention tier — full prompt short, metadata long
원본 →
AI 코딩 도구

REST vs GraphQL for LLM Backends — inference REST·app data GraphQL tier 분리

LLM tier와 application data tier는 API style을 분리하는 게 2026 production default다. LLM inference/chat/streaming/tool-calling — OpenAI-compatible REST+SSE가 ecosystem(LiteLLM·SDK·monitoring) 표준. GraphQL streaming·tool-calling integration은 custom·awkward. Application data(agent run history·tool config·dashboard) — GraphQL nested query·schema introspection(agent discoverability·token waste↓). Multi-agent internal — gRPC+bidi stream option. Anti-pattern: LLM+data를 single GraphQL endpoint에 conflate. SSE vs WebSocket(streaming UX) ·AI BFF(server-side key)와 complement — tier separation=protocol choice.

  • LLM tier=OpenAI REST+SSE — SDK·LiteLLM·streaming native
  • App data tier=GraphQL — nested query·agent schema introspection
  • LLM+data single GraphQL conflate 금지
원본 →
AI 코딩 도구

LLM Debug Mode Ladder — verbose→local trace→production observability

LLM/agent 디버깅은 단계적 visibility ladder가 효율적이다. L1 verbose(set_verbose) — 30초 setup, thought·tool·observation readable summary. L2 debug(set_debug) — full prompt string·raw LLM I/O, context window bloat catch. L3 local trace(Maida JSONL·llm-devproxy SQLite rewind) — step-through·loop guardrail·rewind branch, cloud 없음. L4 production(Langfuse·OTel trace) — persistent history·team collaboration·cost. AgentOps(time-travel prod) ·Codex Record & Replay(demo→skill)와 역할 분리 — ladder=dev-time 점진 escalation.

  • L1 verbose → L2 debug → L3 local trace(Maida/devproxy)
  • L4 production OTel/Langfuse — team·persistent
  • local trace rewind — mid-run branch without re-spend
원본 →
AI 코딩 도구

LLM Correlation IDs — W3C traceparent·multi-agent·subagent propagation

Multi-agent·subagent·MCP tool chain에서 request correlation 없으면 incident debug가 impossible. W3C TraceContext traceparent header — service boundary마다 inject/extract, root span=用户 request, child=LLM call·tool·subagent. OpenTelemetry GenAI: gen_ai.operation.name chat/invoke_agent/execute_tool, tool_call_id explicit propagate(OpenInference message.tool_call_results). Custom correlation: X-Request-ID + X-Agent-Run-ID + X-Step-ID — log·metric·trace 3-signal join. subagent spawn 시 parent trace context inherit 필수 — orphan trace=blind spot. OpenTelemetry GenAI Semantic Conventions(spec) ·Datadog Agent Observability(LangGraph span)와 complement — correlation=propagation design.

  • W3C traceparent — boundary inject/extract, parent-child hierarchy
  • tool_call_id propagate — OpenInference result correlation
  • subagent spawn parent context inherit — orphan trace 방지
원본 →
AI 코딩 도구

ADK+A2A Cross-Language Agents — LLM은 모호함, Go는 정책 검증

Google Developers Blog의 2026-06-22 튜토리얼은 Python ADK 에이전트와 Go A2A 서비스를 하나의 계약 컴플라이언스 파이프라인으로 묶는다. Python 쪽은 Gemini/ADK로 계약 내용을 추출하고, Go 쪽은 LLM 없이 HTTP+JSON-RPC A2A 서비스로 결정론적 정책 검증을 수행한다. 연결점은 A2A Agent Card(`/.well-known/agent.json`)와 ADK의 `RemoteA2aAgent`다. ADK는 원격 A2A 서비스를 로컬 sub-agent처럼 감싸고, `ToolContext.state`에 INGESTED·EXTRACTED·COMPLIANCE_PENDING·MANUAL_REVIEW 같은 체크포인트를 남긴다. 교훈은 멀티에이전트가 프롬프트 체인이 아니라 분산 시스템 설계라는 점이다. 애매한 추출은 LLM에게, 감사 가능한 정책 판정은 반복 가능한 코드에게 맡기면 언어·팀·배포 경계를 넘으면서도 테스트와 장애 대응이 쉬워진다.

  • A2A Agent Card + JSON-RPC로 Python 에이전트와 Go 검증 서비스를 연결
  • `RemoteA2aAgent`가 원격 A2A 서비스를 ADK sub-agent처럼 래핑
  • 장애 시 MANUAL_REVIEW 체크포인트로 전환 — 단일 거대 프롬프트보다 감사·복구 쉬움
원본 →
AI 코딩 도구

Codex on Amazon Bedrock — OPENAI_API_KEY 없이 AWS 경계 안에서 쓰기

OpenAI는 2026-06-01 OpenAI frontier models와 Codex가 AWS에서 generally available이라고 발표했다. 핵심은 "Codex가 AWS에도 있다"가 아니라 provider path가 바뀐다는 점이다. OpenAI 개발자 문서에 따르면 Codex를 `amazon-bedrock` provider로 설정하면 OpenAI-hosted Responses API가 요청 경로에 없고, Codex가 Amazon Bedrock의 OpenAI-compatible Responses API 구현으로 모델 요청을 보낸다. 인증도 ChatGPT 로그인이나 `OPENAI_API_KEY`가 아니라 Bedrock API key 또는 AWS SDK credential chain(IAM, SSO, federated identity 등)을 쓴다. 그래서 이미 AWS로 보안·조달·감사·리전 관리를 하는 조직은 코딩 에이전트를 별도 SaaS 예외로 두지 않고 기존 클라우드 통제면 안에 넣을 수 있다. 단, 초기 구성은 commercial region의 Bedrock Mantle path만 다루며 GovCloud Mantle endpoint, Fast Mode, 일부 OpenAI-hosted cloud 기능은 지원되지 않는다.

  • `model_provider = "amazon-bedrock"` 설정 시 OpenAI-hosted Responses API가 요청 경로에서 빠짐
  • 인증은 Bedrock API key 또는 AWS SDK credential chain — ChatGPT 로그인/OPENAI_API_KEY 아님
  • 제약: commercial region Mantle path, Fast Mode와 일부 cloud-managed 기능 미지원
원본 →
AI 코딩 도구

Jules Eval — proactive coding agent는 '작업 완료'가 아니라 insight policy로 잰다

Google Labs의 2026-06-22 Jules 평가 글은 코딩 에이전트가 "요청받은 버그를 고쳤나"에서 "묻기 전에 중요한 신호를 찾았나"로 이동할 때 평가도 바뀌어야 한다고 주장한다. SWE-bench류는 좁은 태스크 완료를 재지만, proactive agent는 무엇이 중요한지, 근거가 충분한지, 개발자를 방해할지 말지를 고르는 insight policy를 봐야 한다. Google은 내부 코드베이스의 705개 버그와 1,178개 CL을 묶어 시간적으로 가깝고 의미적으로 유사한 버그 클러스터를 만들고, 각 클러스터를 상위 목표의 ground truth로 삼았다. 에이전트는 pre-fix 상태 코드베이스를 최대 3라운드 탐색한 뒤 insight를 내고, LLM judge가 1~5점과 Hit@K로 채점했다. 한 라운드에서도 평균 4.5/5 신호를 잡았지만, 복잡한 문제는 탐색 예산을 2→3라운드로 늘리자 Hit@5가 33%→57%로 회복됐다. 교훈은 장기 에이전트 평가에서 시간·컨텍스트·탐색 예산을 빼면 실제 개발 가치가 보이지 않는다는 점이다.

  • 평가 대상은 자율성 자체가 아니라 무엇을 보고·알리고·묻고·침묵할지 고르는 insight policy
  • 705 bugs·1,178 CL로 관련 버그 클러스터를 만들고 pre-fix 상태에서 proactive insight를 채점
  • 탐색 예산 2→3라운드에서 Hit@5 33%→57% — 긴 작업은 추가 조사 예산을 평가 변수로 둬야 함
원본 →
AI 코딩 도구

Multi-Agent Handoff Integration Testing — routing·context·return path 3-point assert

멀티에이전트 버그의 대부분은 개별 agent eval이 아니라 handoff seam에서 발생한다 — coordinator가 잘못된 agent에 위임, context payload 누락, sub-agent 결과가 coordinator로 복귀하지 않음, deadlock·runaway loop. per-agent unit test는 이 실패를 보지 못한다. integration test는 delegation마다 3-point assert: (1) Routing — task가 expected agent type으로 갔는가 (2) Context Completeness — payload에 sub-agent가 필요한 필드가 있는가 (3) Return Path — sub-agent result가 coordinator state에 merge됐는가. handoff contract schema(API contract testing analog)로 input/output schema를 정의하고 E2E에서 contract chain 검증. hard wall-clock timeout + max handoff depth(3-5) + consistency test(N회 반복 success rate). agentevals(OTel trace gate) ·Claw-Eval(trajectory) ·Supervisor Agent(orchestration)와 complement — handoff=coordination seam test.

  • Routing·Context·Return Path — delegation마다 3-point assert
  • handoff contract schema — microservices API contract testing analog
  • hard timeout + max depth + N-run consistency — stall·loop·flake catch
원본 →
AI 코딩 도구

Agent Chaos Engineering — faultkit·agentfuzz·Khaos SDK boundary fault injection

LLM agent unit test는 seam이 정상이라고 가정한다 — tool timeout·malformed JSON·429 burst·schema drift·prompt injection은 production에서만 터진다. Agent chaos engineering은 SDK/API boundary에서 fault를 주입해 resilience를 CI 전에 검증한다. faultkit — single-shot CLI, localhost proxy+ephemeral CA, vendor-accurate 429/timeout/streaming cutoff, exit code로 CI gate. agentfuzz(Python) — ToolTimeout·MalformedToolResponse·SchemaDrift·CostSpiral·PromptInjection fault catalog, pass-rate per category 리포트. Khaos SDK — security+resilience eval pack, capability-aware attack selection, `khaos ci --resilience-threshold 70`. WireMock(stateful fault) ·LLM VCR(replay) ·AI Agent Error Handling(circuit breaker)와 역할 분리 — chaos=runtime seam break, mock=pre-backend contract.

  • faultkit/agentfuzz/Khaos — SDK/API boundary fault, infra chaos 아님
  • pass-rate per fault category — timeout vs JSON vs injection survival
  • CI gate — chaos replay trace로 regression set 축적
원본 →
AI 코딩 도구

LLM API Connection Pooling — httpx AsyncClient lifespan·http2·keepalive 120s

LLM API latency의 숨은 killer는 model inference가 아니라 connection churn이다. request마다 httpx.AsyncClient()를 새로 만들면 TCP+TLS handshake가 매 call 반복, file descriptor exhaustion(OSError 24)까지 간다. production 패턴: FastAPI lifespan에서 단일 shared AsyncClient 생성→app.state 또는 DI로 주입→shutdown에서 aclose(). httpx.Limits(max_connections=256, max_keepalive_connections=128, keepalive_expiry=120) — AI burst pattern(30-60s read gap)에 default 5-15s keepalive는 너무 짧다. http2=True — 20 concurrent call이 2-3 socket으로 multiplex. LangChain ChatOpenAI(http_client=shared) — library가 자체 pool 만들지 않게 explicit pass. Celery GPU worker ·LiteLLM proxy ·AI BFF와 complement — pool=client-side connection reuse design.

  • request-per-client 금지 — lifespan shared AsyncClient 1개
  • keepalive_expiry=120s+ ·http2=True — burst gap·socket count↓
  • LangChain/LiteLLM에 http_client explicit pass — isolated pool 방지
원본 →
AI 코딩 도구

LLM SSE Backpressure — bounded queue·is_disconnected·X-Accel-Buffering no

LLM token SSE streaming은 producer(model)가 consumer(client)보다 빠르면 proxy buffer가 unbounded growth→OOM. backpressure 핵심: producer-consumer 사이 bounded asyncio.Queue(maxsize=32-128). queue full이면 producer가 upstream LLM read를 block→TCP flow control→model generation pause. client disconnect 시 await request.is_disconnected() per token으로 upstream abort — tab close 후에도 token burn 방지. infra: nginx proxy_buffering off + X-Accel-Buffering: no + CDN no-transform. 10K concurrent SSE는 connection당 ~13-15KB budget, 4GB container 8-10K ceiling. slow client는 trySend fail→disconnect rather than unbounded buffer. SSE vs WebSocket(streaming transport) ·AI BFF(streaming custody) ·Token Streaming Proxy(zero-buffer)와 complement — backpressure=memory-bounded fan-out design.

  • bounded Queue 32-128 — full이면 upstream read block, end-to-end backpressure
  • is_disconnected() per token — client leave 시 upstream abort, token burn stop
  • proxy_buffering off ·4GB≈8-10K concurrent SSE memory budget
원본 →
AI 코딩 도구

AI Agent Graceful Shutdown — drain→checkpoint→503, terminationGracePeriod+10s

rolling deploy에서 SIGTERM 즉시 kill은 long-running agent turn을 mid-flight drop — user retry·duplicate side effect. 5-phase lifecycle: init→warmup→ready→drain→terminate. SIGTERM 시 readiness probe fail→new turn HTTP 503→in-flight turn은 drain_deadline_seconds까지 complete→deadline 초과 turn은 checkpoint(trace·tool results·memory delta) persist→exit 0. K8s terminationGracePeriodSeconds ≥ drain_deadline + 10s buffer — equality면 SIGKILL이 checkpoint interrupt. idempotency key(run_id+step_id+tool_call_id)로 resume 시 duplicate write 방지. vLLM drain mode(ServiceUnavailableMiddleware reject new) ·Agent Checkpoint spec ·LLM Idempotency Keys와 complement — shutdown=deploy-safe lifecycle contract.

  • ready→drain→terminate — 503 new, in-flight bounded complete
  • deadline 초과 checkpoint — trace·tool·memory persist, resume token
  • terminationGracePeriod ≥ drain + 10s ·idempotency key resume safety
원본 →
AI 코딩 도구

LLM Health Check Probes — startup/readiness/liveness 3-probe vLLM pattern

/health는 process alive만 확인, model loaded 아님 — GPU page fault 후에도 liveness pass→broken pod에 traffic routing. K8s 3-probe pattern: startupProbe /v1/models (model-aware, 503 while loading, failureThreshold×period=max startup window) ·readinessProbe /v1/models (traffic routing gate) ·livenessProbe /health (process hang/CUDA deadlock detect). 70B model은 initialDelaySeconds 120-180s 필요 — 45s default는 premature restart 유발. vLLM /health/ready — execute_dummy_batch_async 1-token GPU forward pass, silent inference failure catch. LiteLLM proxy — /health/liveliness(container) ·/health/readiness(DB) ·/health(model API call). LLM Goodput SLO(quality+latency) ·AI deployment patterns(cold start) ·Graceful Shutdown(drain)와 complement — probe=traffic routing safety.

  • startup+readiness=/v1/models ·liveness=/health — model-aware vs process-alive
  • 70B→120-180s startup window ·/health/ready GPU dummy forward
  • LiteLLM 3-tier — liveliness/readiness/model health 분리
원본 →
AI 코딩 도구

Agent Deadline Propagation — absolute deadline tree, per-step timeout 아님

agent timeout을 step마다 10s fixed로 주면 planner 4s + 3 tool×10s = 34s authorized against 6s user SLO — zombie request·token burn. latency budget은 line이 아니라 tree: critical path=longest root-to-leaf, sibling branch optimize는 zero effect. fix: request entry에서 absolute deadline(wall-clock timestamp, duration 아님) 생성→every LLM call·tool·sub-agent에 remaining budget propagate→node마다 check_or_raise→retry bounded by remaining budget not retry count. gRPC grpc-timeout header model — each hop subtracts elapsed, chain dies together. LangChain asyncio.wait_for·LangGraph env timeout은 local concern, propagation 없음 — custom Deadline context 필요. LLM Correlation IDs(trace join) ·Human-in-the-Loop Approval(timeout) ·AI Agent Error Handling(budget guardrail)와 complement — deadline=distributed time budget design.

  • absolute deadline timestamp — duration per-step 금지, tree critical path
  • remaining budget propagate — sub-agent·tool·retry 모두 parent budget 차감
  • LangGraph/LangChain local timeout 한계 — custom Deadline context 필요
원본 →
AI 코딩 도구

LLM Capacity Planning — concurrency-aware Little's Law, per-token naive 17-36× 오차

LLM inference capacity planning에서 per-token cost calculator는 arrival rate λ를 무시해 self-hosted cost를 17-36× underestimate한다 — GPU utilization naive Θmax 가정 vs 실제 arrival-limited idle. Little's Law: in-flight concurrency L=λ×W(residence time)가 cost dominant term. concurrency-aware model: hardware+model+quantization+λ+SLO→effective cost-per-million-tokens. physics tools: kv-planner — roofline engine, memory waterfall(weights+KV+activations), size_fleet(target_rps, p99), calibrate from live vLLM load. llm-infra-planner — client-side VRAM/throughput/cost, TTFT/TPOT SLO slider. prefill=compute-bound·decode=memory-bandwidth-bound — batching strategy가 capacity curve shape 결정. KEDA autoscaling(queue depth) ·LLM Load Testing(TTFT soak) ·AI deployment patterns(serverless vs dedicated)와 complement — capacity=physics+λ grounded planning.

  • per-token naive 17-36× underestimate — λ(concurrency)가 dominant cost term
  • kv-planner roofline — memory waterfall·size_fleet·calibrate from live traffic
  • prefill compute-bound ·decode bandwidth-bound — SLO별 batching curve
원본 →
AI 코딩 도구

Per-Request GPU Cost Attribution — gpu_time_share·DCGM·minute-bucket slicing

continuous batching GPU에서 per-request cost는 token count×flat rate가 아니다 — shared GPU time·utilization·power를 request별로 split해야 feature-level FinOps·capacity model이 가능. 3-signal join: (1) inference trace OTel span gpu_time_share (2) DCGM/NVML per-GPU utilization+power per minute (3) cloud instance $/GPU-hour. attributed_cost = gpu_time_share × (cost_per_gpu_hour/3600) × avg_utilization adjustment — thin batch idle period는 lower attributed cost. minute-bucket slicing — request가 10:01:45-10:02:30 span이면 각 minute bucket의 actual GPU metrics로 split. feature tag(trace attribute)로 agent step·tool·user tier별 cost rollup. LLM API 비용 최적화(routing·cache 4-layer) ·LLM Goodput SLO(quality+latency+cost) ·LLM Data Flywheel(production trace)와 complement — attribution=shared GPU cost split design.

  • gpu_time_share × DCGM utilization × $/hr — continuous batching cost split
  • minute-bucket slicing — cross-minute request correct GPU metrics
  • feature tag rollup — agent step·tool·user tier별 FinOps
원본 →
AI 코딩 도구

Agent Structural Coverage Testing — typed coordination graph 4 criteria, arxiv 2026

agent E2E eval은 output quality만 본다 — declared coordination structure(delegation path·tool-access rule·restricted tool edge)가 test에서 exercise됐는지 증거 없음. structural coverage model: typed multi-agent coordination graph에서 4 criteria — (1) reachable agents (2) allowed tool edges (3) restricted tool edges (4) delegation edges. coverage-driven generation: graph에서 structural witness objective 추출→DSPy로 natural-language scenario synthesize→runtime witness로 obligation covered 확인. OpenAI Agents SDK customer_service workflow benchmark: 54/75 allowed-tool·36/48 delegation obligations witnessed, 23/248 restricted-call violations detected. promptfoo(assertion eval) ·Multi-Agent Handoff Integration(handoff seam) ·Inspect AI(sandbox eval)와 complement — structural=graph adequacy, E2E=semantic quality.

  • 4 criteria — agents·allowed tools·restricted tools·delegation edges covered
  • graph→witness objective→scenario — structural meaning fixed, LLM realizes NL
  • restricted-tool violations — misrouting concrete failure separate from output pass
원본 →
AI 코딩 도구

Codex PAYG 좌석 — 파일럿 비용을 좌석비가 아니라 토큰 원장으로 보기

OpenAI는 2026-04-02 ChatGPT Business·Enterprise 워크스페이스에 Codex-only pay-as-you-go 좌석을 도입했다. 고정 좌석비 없이 Codex 전체 접근을 주고, 별도 rate limit 대신 토큰 사용량으로 과금해 파일럿 팀이 예산·워크플로·팀 단위 비용을 더 직접 추적하게 하려는 모델이었다. 다만 같은 글의 2026-06-24 업데이트는 새 Business 플랜 PAYG 좌석 제공을 중단했고, 기존 PAYG 좌석은 영향 없다고 밝혔다. 그래서 교훈은 "싸게 시작한다"가 아니라, 코딩 에이전트 도입을 계약·좌석·토큰 원장·spend control이 바뀔 수 있는 운영 체계로 봐야 한다는 점이다. 반복 자동화나 장기 에이전트 작업은 seat count보다 token consumption, 팀별 budget owner, workflow별 ROI 태그가 중요하다. OpenAI는 같은 글에서 paying business user 900만+와 주간 Codex builder 200만+, Business·Enterprise 내 Codex 사용자 1월 이후 6배 성장을 adoption signal로 제시했다.

  • 2026-04-02 Codex-only PAYG 좌석 도입, 토큰 사용량 기반 비용 추적 모델
  • 2026-06-24부터 새 Business PAYG 좌석 중단, 기존 좌석은 영향 없음
  • 운영 포인트는 좌석 수보다 token consumption·팀 예산·워크플로 ROI 태그
원본 →
AI 코딩 도구

Codemod Platform — AI가 before/after 예시로 codemod를 만들고 YAML workflow로 멀티레포 마이그레이션

Codemod는 프레임워크 업그레이드·보안 패치·대규모 리팩터를 자동화하는 AI 네이티브 codemod 플랫폼이다. Codemod CLI(Rust)는 ast-grep·JSSG(TypeScript AST) 변환을 scaffold·test·run하고, workflow.yaml로 matrix strategy·manual approval gate가 있는 멀티스텝 마이그레이션을 오케스트레이션한다. Codemod AI는 before/after 예시 쌍을 넣으면 declarative YAML rule 또는 NAPI imperative script를 생성하고, 3회 refinement iteration으로 registry 57개 샘플 기준 정확도 38.6%→64.9%까지 올린다. Codemod MCP(`npx codemod@latest mcp`)는 dump_ast·run_jssg_tests·jssg-gotchas 같은 도구로 Cursor·Claude Code가 IDE 안에서 codemod package를 작성·검증하게 한다. ast-grep(단일 구조 치환 CLI) ·OpenRewrite(enterprise)와 complement — Codemod=AI authoring + registry + cross-repo workflow.

  • CLI + workflow.yaml — matrix·approval gate·multi-repo orchestration
  • Codemod AI — multiple before/after pairs, 3 refinement iterations
  • Codemod MCP — dump_ast·JSSG test·docs-backed authoring in IDE
원본 →
AI 코딩 도구

GritQL — 백틱 패턴 하나로 10M+ LOC 코드베이스를 검색·치환하는 선언적 마이그레이션 언어

Grit(GritQL)은 코드를 텍스트가 아니라 구조로 매칭하는 선언적 query language다. `grit apply '`console.log($msg)` => `winston.log($msg)`'`처럼 백틱에 코드 스니펫을 쓰고 $msg metavariable로 임의 노드를 잡는다. where 절로 test/it 블록 내부는 제외 같은 side condition을 붙이고, 200+ standard library pattern을 재사용한다. Rust 엔진으로 10M+ LOC 레포에서도 동작하며 JS/TS·Python·Java·Go·Rust·Terraform·Solidity·YAML 등 12+ 언어를 지원한다(MIT·~4.5k★). ast-grep(sg CLI·agent-skill) ·Codemod Platform(AI workflow) ·Semgrep(보안 taint)와 역할 분리 — GritQL=declarative pattern migration at repo scale.

  • 백틱 패턴 + $metavariable + where — regex보다 syntax-safe
  • 200+ stdlib pattern — API upgrade·dependency migration 재사용
  • 10M+ LOC scale ·12+ language ·MIT open source
원본 →
AI 코딩 도구

Locofy.ai — Large Design Model로 Figma를 React/Next.js 레이아웃 스캐폴드로 변환

Locofy.ai는 Figma 디자인을 프로덕션 프론트엔드 코드로 변환하는 design-to-code 플랫폼이다. Large Design Models(LDM)로 수백만 디자인을 학습해 flexbox 기반 named component·responsive layout을 생성한다. Lightning mode(원클릭 AI)와 Classic mode(단계별 태깅·수동 제어) 두 경로를 제공하고, Convert Figma Styles and Variables 토글로 디자인 토큰을 CSS 변수로 끌어온다. 2026 벤치마크에서 Anima(absolute positioning·flat HTML)보다 component 구조가 깔끔하고, v0/bolt.new(그린필드 생성)와 달리 기존 Figma 파일에서 layout scaffold를 뽑는 용도에 특화. token 기반 과금(복잡 화면 $80-120)이 Builder.io($3-5)보다 비싸므로 대량 UI 생성 job에서 ROI를 재야 한다.

  • LDM + Lightning/Classic — speed vs control trade-off
  • flexbox named components ·Figma variables→CSS — Anima 대비 유지보수성
  • layout scaffold 용도 — v0/bolt 그린필드와 complement
원본 →
AI 코딩 도구

Builder.io Fusion — 디자인→코드를 ZIP export가 아니라 CLI codebase context로 통합

Builder.io Fusion은 design-to-code와 visual CMS를 합친 visual development platform이다. Figma·스크린샷·프롬프트에서 React UI를 생성하고, 생성 전에 'refactor into smaller components'처럼 tool 안에서 AI prompting으로 구조를 다듬을 수 있다. 핵심 차별점은 Fusion CLI — ZIP drop 대신 기존 codebase context를 읽어 design token·component pattern에 맞춘 integration code를 만든다. design token registry(color·font·spacing)를 등록하면 Tailwind·Emotion·Styled Components 출력이 on-brand로 유지된다. 2026 비교에서 Locofy 대비 화면당 $3-5 token cost로 대량 생성에 유리. ai-shell(자연어→셸) ·micro-agent(TDD agent) 카드와 다른 제품 축 — Fusion=design-to-code + CMS + codebase-aware CLI.

  • Fusion CLI — existing repo context, ZIP drop 아님
  • design token registry — Tailwind/Emotion on-brand output
  • screen $3-5 vs Locofy $80-120 — bulk UI generation cost trade-off
원본 →
AI 코딩 도구

Figma MCP Server — one-time export 대신 living design reference로 에이전트에 붙이기

Figma MCP Server(https://mcp.figma.com/mcp)는 코딩 에이전트가 Figma 파일의 component·variable·layout·FigJam·Make resource를 structured context로 읽게 하는 remote MCP다. 2026년 use_figma tool(beta)로 agent가 기존 design system component·variable을 인지한 채 native Figma object를 생성·수정한다 — /figma-use skill과 짝. Code Connect로 Figma component↔GitHub code mapping, generate_figma_design(Code to Canvas)는 running app snapshot, use_figma는 structured generation으로 complement. Cursor `/add-plugin figma` ·Claude Code `claude plugin install figma@claude-plugins-official`로 MCP+skills+asset rules 일괄 설치. v0(Figma import) ·Locofy(export) ·Stitch(모바일 탐색)와 달리 brownfield는 '기존 codebase에 component 추가'가 MCP loop.

  • remote MCP — component·variable·layout structured read
  • use_figma write(beta) — design system aware canvas edit
  • Code Connect + Code to Canvas — mapping vs flat snapshot complement
원본 →
AI 코딩 도구

Figma Code Layers — Config 2026, 코드를 design material로 캔버스에 올리다

Figma Config 2026은 'design vs code' 이분법을 깨고 code layers를 canvas에 도입했다. design layer를 클릭 한 번(또는 prompt)으로 interactive code layer로 전환하고, side-by-side duplicate로 여러 implementation direction을 frame처럼 탐색한다. Figma Motion timeline은 Dev Mode에서 easing·keyframe·timing을 inspectable하게 노출하고 CSS·JSON·React animation code를 copy하며 MCP-compatible frame을 coding agent에 전달한다. generative plugins·Weave tools·shader·motion이 같은 canvas material family로 묶인다. bolt.new(WebContainers) ·v0(React gen) ·Figma MCP(read/write loop)와 complement — Code Layers=design process 안에서 code prototype을 first-class layer로 다루는 패러다임 shift.

  • design layer→code layer 1-click ·side-by-side exploration
  • Figma Motion — Dev Mode inspectable timeline + MCP handoff
  • code=material — export plugin이 아닌 canvas-native prototype
원본 →
AI 코딩 도구

Visily — PM·비개발자용 AI wireframe, screenshot·diagram·text→UI

Visily는 'UI design tool for non-designers'를 표방하는 AI wireframing·prototyping 도구다. text prompt·screenshot·diagram·template·조합 입력에서 wireframe을 생성하고, Smart Components·Auto-Prototyping·AI chat edit으로 canvas에서 바로 다듬는다. 2025-2026 업데이트로 code generation from design·Plan Mode(prompt structuring)·Deep Design(aesthetic polish)·Figma import·Slack/Jira/Notion 연동을 추가 — Uizard(Autodesigner)보다 design-to-code 쪽으로 확장 중. Figma export·on-canvas chat·follower mode로 PM이 spec document를 engineer handoff 전에 clickable prototype으로 만든다. v0(개발자 React gen) ·Stitch(모바일) ·Figma Make(Figma-native)와 complement — Visily=non-designer ideation·wireframe·collaboration layer.

  • text·screenshot·diagram→wireframe — non-designer entry
  • Plan Mode·Deep Design·code gen(2025-26) — Uizard 대비 end-to-end 확장
  • Figma export·Jira/Slack — spec→clickable prototype before handoff
원본 →
AI 코딩 도구

Uizard Autodesigner 2.0 — 손그림·스크린샷 스캔으로 multi-screen prototype

Uizard는 AI로 wireframe·mockup을 만드는 design tool로, Autodesigner 2.0(2024)이 text prompt에서 multi-screen clickable prototype을 한 번에 생성한다. Wireframe Scanner는 손그림 sketch를 digitize하고, Screenshot Scanner는 기존 UI 캡처를 editable mockup으로 변환한다. vector editor 대신 drag-and-drop component editor를 써서 비개발자 진입 장벽을 낮췄고, Figma·Miro export로 design handoff를 이어간다. Visily(code gen·Plan Mode) ·Stitch(모바일) ·v0(React code)와 complement — Uizard=sketch/screenshot heavy rapid ideation·clickable demo, production code export는 약함.

  • Autodesigner 2.0 — multi-screen from text, one-shot clickable
  • Wireframe/Screenshot Scanner — sketch·capture digitize
  • Figma/Miro export — ideation→handoff, production code는 약함
원본 →
AI 코딩 도구

Sourcery — Python idiomatic refactor + Sentry 연동 production error diagnosis

Sourcery는 Python 코드를 idiomatic하게 리팩터하고 PR review까지 자동화하는 AI code quality tool이다. IDE plugin·CLI·GitHub/GitLab integration으로 duplicate code·overly complex branch·type hint 누락 같은 smell을 suggestion으로 제시하고, one-click apply 또는 PR comment로 제안한다. Sentry integration(2025)은 production exception stack trace를 Sourcery가 읽어 root cause hypothesis와 fix suggestion을 PR로 연결한다 — static refactor tool이 runtime telemetry와 만나는 패턴. 30+ language surface가 있지만 deepest analysis는 Python. ast-grep(구조 치환) ·CodeRabbit(PR review) ·Greptile(repo graph review)와 complement — Sourcery=Python idiomatic refactor + prod error loop.

  • Python-first idiomatic refactor — IDE·CLI·PR integration
  • Sentry integration — prod exception→fix suggestion loop
  • CodeRabbit/Greptile(review) ·ast-grep(structural)와 다른 refactor axis
원본 →
AI 코딩 도구

agent-desktop — accessibility tree로 네이티브 앱을 JSON ref(@e1)로 제어하는 Rust CLI

agent-desktop(lahfir/agent-desktop)는 AI agent용 native desktop automation CLI다. 스크린샷·pixel matching 대신 OS accessibility tree(AXUIElement)로 Finder·Safari·Xcode·Slack 등 네이티브 앱을 observe·control하고 structured JSON + deterministic element ref(@e1, @e2)로 반환한다. 54 commands — observation·interaction·keyboard·mouse·clipboard·window management, progressive skeleton traversal로 dense app에서 78-96% token reduction. C-ABI cdylib로 Python/Swift/Go/Node에서 fork 없이 load. Anthropic Computer Use(vision API·screenshot loop) ·Auto-Use(hybrid AX+vision) ·Playwright MCP(browser-only)와 complement — agent-desktop=accessibility-first deterministic desktop control for coding agents.

  • accessibility tree — no screenshot/pixel, structured JSON refs
  • progressive skeleton traversal — 78-96% token reduction on dense UI
  • 54 commands ·cdylib — native app control beyond browser MCP
원본 →
AI 코딩 도구

Claude Code 생태계 개요 — 플러그인·비용·웹·워크플로·한도·리뷰·훅을 한 장으로

Claude Code는 터미널 CLI를 중심으로 플러그인 마켓·클라우드 웹·GitHub Action·매니지드 리뷰·훅 자동화까지 확장되는 에코시스템이다. 공식 `claude-plugins-official` 마켓(Frontend Design·Superpowers·Code Review 등)과 aitmpl·ccpi 같은 서드파티 템플릿 CLI로 스킬·MCP·서브에이전트를 배포하고, 비용은 모델 라우팅(Sonnet 기본·Opus는 아키텍처만)·CLAUDE.md 200줄 이하·MCP 끄기·CLI 선호가 1순위다. Pro/Max 한도는 5시간 세션+주간 두 버킷이며 Opus는 별도 카운트, `/usage`로 스킬·MCP별 %를 본다. 실행면은 claude.ai/code(클라우드 VM·PR 후 diff 리뷰), claude-code-workflows(Playwright 시각 리뷰), Claude Code Review(매니지드 PR 리뷰·리뷰당 $15~25), hooks(PreToolUse·Stop·SessionStart 등 이벤트 고정)로 나뉜다.

  • 배포: claude-plugins-official + aitmpl/npx CLI — 플러그인=스킬·MCP·훅 묶음, 과적재는 속도 저하
  • 비용·한도: Sonnet 기본·Opus는 추론만 / 5h+주간 두 버킷·Opus 분리 / /usage·/context로 누수 추적
  • 실행면: Web(클라우드 VM) · workflows(Playwright 시각) · Review(매니지드) · hooks(이벤트 자동화)
원본 →
AI 코딩 도구

ML Kit GenAI 개요 — OCR·요약·프롬프트·음성·운영 매트릭스를 Gemini Nano로

Google ML Kit GenAI는 Gemini Nano를 Android/iOS 온디바이스에서 돌리는 API 묶음이다. Text Recognition v2(5개 스크립트 OCR)와 Summarization·Speech Recognition은 고정 기능 API로 데이터가 클라우드를 떠나지 않고, Prompt API는 고정 기능 밖 맞춤 GenAI를 허용한다. Apple Vision VNRecognizeTextRequest가 iOS OCR 표준이며 react-native-nitro-ocr로 통합 가능. 운영 시 지원 기기(AICore·Nano 버전)·쿼터·Firebase AI Logic 하이브리드 라우팅을 함께 검증해야 한다. Structured Output·Prefix Caching·APO는 별도 카드로 다룬다.

  • 고정 API: Text Recognition(5스크립트) · Summarization · Speech(Advanced) — 완전 온디바이스
  • Prompt API: 고정 기능 밖 맞춤 GenAI — Kakao Mobility 사례(주소 추출 24% 단축)
  • 운영: AICore 지원 기기·Nano 버전·쿼터·Firebase Hybrid API를 매트릭스로 함께 검증
원본 →
AI 코딩 도구

AI 코드 제안 수락률 — FCML·Acceptance Rate가 품질 프록시가 아닌 이유

Google 내부 AI IDE 실험(arXiv 2601.19964)은 acceptance rate(수락÷(수락+거절))를 품질·불쾌감 프록시로 쓰고 FCML(ML이 쓴 코드 비율)을 생산성 지표로 본다. FCML 28.7%(붙여넣기 제외 70.6%), acceptance 45%가 기준치다. Opsera 2026 벤치마크는 업계 acceptance 25~55%가 건강하고 60%↑는 무심사 rubber-stamping, 30%↓는 설정·워크플로 문제 신호라고 경고한다. 수락률만 보면 AI PR이 리뷰 대기 4.6× 길어지는 병목을 놓치므로 review wait time·code turnover·change failure rate와 함께 봐야 한다.

  • FCML = ML 수락 문자÷(수동+붙여넣기+ML) — Google 기준 28.7%, acceptance 45%
  • Opsera 2026: 건강 25~55% / 60%↑ rubber-stamp / 30%↓ 설정·프롬프트 문제
  • 수락률 단독 금지 — review wait(4.6×), turnover rate, change failure rate 병행
원본 →
AI 코딩 도구

AI PR 수락률 Task-Stratified — 에이전트별 1위가 작업 유형마다 바뀐다

AIDev 7,156 PR 분석(arXiv 2602.08915)은 AI 코딩 에이전트 PR merge율이 작업 유형에 따라 29pp까지 갈린다는 걸 보여준다. documentation 82.1% vs feature 66.1%(16pp), chore 84% vs perf 55.4%. Codex는 9개 카테고리 전반 59.6~88.6%로 안정적이나, Claude Code는 documentation 92.3%·feature 72.6% 1위, Cursor는 fix 80.4% 1위 — '하나만 고르기'가 아니라 task type별 라우팅이 맞다. Devin만 32주간 +0.77%/week 상승 추세, 나머지는 plateau.

  • 작업 유형 격차: doc 82% vs feature 66% — inter-agent variance보다 task type이 dominant
  • 에이전트별 강점: Claude Code=doc/feature · Cursor=fix · Codex=전 카테고리 안정
  • Devin만 +0.77%/week 상승 — 나머지 agent는 32주 plateau
원본 →
AI 코딩 도구

AI Code Turnover Rate — 30~90일 내 AI 코드 재작성 비율로 진짜 품질 잰다

Opsera 2026 AI Coding Impact Benchmark는 acceptance rate 대신 code turnover rate를 핵심 품질 지표로 제시한다. AI 생성 코드가 30일 내 재작성되는 비율 — 건강 목표 15% 미만(30일)·22% 미만(90일), AI:human turnover ratio 1.5× 미만. AI 도입 후 22~24% 이슈가 장기 잔존하고, AI PR은 리뷰 대기가 4.6× 길어 time-to-PR 48~58% 개선이 review 병목에 상쇄된다. velocity vanity metric 대신 retention·wait time·vulnerability density·realized ROI를 executive reporting에 포함하라.

  • Turnover: 30일 <15%, 90일 <22%, AI:human ratio <1.5× — acceptance보다 장기 품질 신호
  • AI PR review wait 4.6× — coding 50% 빨라져도 throughput neutralization
  • Executive metric: retention + wait time + change failure + vulnerability density
원본 →
AI 코딩 도구

ghostcall — LLM이 지어낸 API 호출을 설치된 패키지로 검증하는 Python CLI

ghostcall(linosorice)는 LLM 생성 Python 코드에서 hallucinated API call을 잡는 오픈소스 CLI다. ast로 import chain을 추적하고 importlib+getattr로 실제 설치된 패키지 버전과 대조한다. mypy/pyright(타입·프로젝트 컨텍스트)와 달리 snippet 단위 existence check — `pd.DataFrame.to_jsonl` 같은 phantom method를 difflib로 유사 제안까지 한다. 로컬 변수 체인(`df.fake()`)·import *·`__getattr__` magic module은 한계.

  • 동작: AST import chain → importlib introspection — snippet 단위 phantom API 탐지
  • mypy/pyright와 분리: existence vs type — Copilot/ChatGPT 디버깅 20분 절약 목적
  • 한계: 로컬 변수 chain·import *·magic module skip — auto-fix 없음
원본 →
AI 코딩 도구

wraith — AI 생성 Python의 hallucinated API·phantom package를 Rust로 350ms 스캔

wraith(PyPI v0.2.0)는 AI 생성 Python 코드용 deterministic linter(Rust·tree-sitter)다. 20규칙: hallucinated API(introspection)·phantom package(PyPI 검증·typosquatting)·secret detection(4-layer)·taint analysis·AI artifact cleanup(`# Generated by Claude` 제거). 1121 FastAPI 파일 350ms, zero config. arXiv 2601.19106 AST hallucination guard와 ghostcall(existence)과 complement — wraith는 프로젝트 전체 린트·supply chain까지.

  • Rust+tree-sitter: 1121 files/350ms — hallucinated API·phantom PyPI·secret·taint 20 rules
  • ghostcall complement: snippet existence vs project-wide lint + supply chain
  • arXiv 2601.19106 AST KCH detection(87.6% recall)과 같은 hallucination defense 축
원본 →
AI 코딩 도구

SWE-PRBench — AI 코드리뷰는 diff만으로도 human expert의 15~31%만 잡는다

SWE-PRBench(arXiv 2603.26130)는 350 PR human annotation으로 AI 코드리뷰 품질을 재는 벤치마크다. 8 frontier model이 diff-only(config_A)에서 human-flagged issue 15~31%만 탐지 — code generation 벤치마크와 달리 review는 human expert에 한참 못 미친다. config_A→config_C(전체 컨텍스트)로 갈수록 모든 모델 monotonic degrade — attention dilution으로 Type2_Contextual issue detection collapse. 구조화 2,000-token diff+summary가 2,500-token full context보다 8모델 전부 우수.

  • 350 PR·κ=0.75 LLM judge — diff-only 15~31% human issue detection
  • Context 역설: full context > diff — attention dilution, Type2_Contextual collapse
  • 교훈: structured diff+summary > raw full context — review는 generation과 다른 난이도
원본 →
AI 코딩 도구

CR-Bench — 코드리뷰 에이전트는 usefulness rate·SNR로 개발자 신뢰를 잰다

CR-Bench(arXiv 2603.11078)는 AI 코드리뷰 에이전트의 real-world utility를 재는 데이터셋+평가기다. Precision·Recall·F1 외 usefulness rate(개발자가 실제로 고친 비율)와 signal-to-noise ratio(SNR)를 도입 — Reflexion agent(GPT-5.2)는 recall 32.76%·F1 8.83%로 bug를 더 찾지만 SNR 1.95, single-shot은 recall 27%·SNR 5.11로 noise 적음. '더 많이 찾기'와 '신뢰할 수 있는 신호' 사이 sweet spot이 production adoption의 핵심이다.

  • CR-Evaluator: P/R/F1 + usefulness rate + SNR — developer trust metric
  • Reflexion: recall↑ SNR↓(1.95) vs single-shot: recall↓ SNR↑(5.11) — pressure spectrum
  • Production: precision alone insufficient — accepted issue rate + SNR pair
원본 →
AI 코딩 도구

CodeReviewBench — 오프라인 golden comment + 온라인 fresh PR로 AI 리뷰 도구 평가

withmartian/code-review-benchmark는 AI 코드리뷰 도구 평가를 오픈소스로 공개한다. 오프라인: 50 human-verified PR + severity-labeled golden comments, LLM judge가 tool comment와 match해 precision/recall. 온라인: GitHub fresh PR을 continuous sampling — training data leakage 방지. Recall = bot이 잡은 golden/total golden, precision = useful bot comment/total bot comment. Post-review commit diff로 '개발자가 실제로 고친 것'과 bot suggestion을 매칭.

  • Dual pipeline: offline 50 PR golden comments + online fresh PR continuous
  • Judge: bot suggestion ↔ post-review human fix matching — accepted issue proxy
  • Training leakage 방지: online benchmark는 recent PR only — memorization 차단
원본 →
AI 코딩 도구

SWE-Mutation — LLM 생성 테스트는 mutant 10%만 검증·36%만 탐지한다

SWE-Mutation(ACL Findings 2026)은 LLM 생성 test suite의 discriminative power를 재는 벤치마크다. 800 instance에서 agentic mutation으로 2,636 variant 생성 — mutant가 test를 속이는지 검증. DeepSeek-V3.1도 verification 10.20%·detection 36.15% — current LLM test generation inadequacy. Agentic mutation은 conventional 대비 detection 71%→40%로 realism↑ — superficial test를 걸러낸다. 9개 언어 multilingual subset 포함.

  • 2,636 mutants from 800 instances — test가 mutant를 속이는지 discriminative power
  • DeepSeek-V3.1: verification 10.2%, detection 36.2% — even top model inadequate
  • Agentic mutation: realism↑ detection 71→40% — superficial test filter
원본 →
AI 코딩 도구

CSAP — 코드 제안 수락 예측으로 거절될 suggestion을 표시 전에 필터링

FSE 2026 CSAP(Code Suggestion Acceptance Prediction)은 66,329 industrial developer-AI interaction 데이터로 제안 표시 전 수락 여부를 예측한다. 수락 suggestion은 historical acceptance count/ratio↑, generation interval↑, preceding context↓ 특성. imbalanced dataset accuracy 0.973, in-production industrial filter 대비 +69.5% — developer interruption 감소. LLM baseline 대비 +12.6%. 범용 booster가 아니라 personalization/filtering이 acceptance rate 개선의 실제 레버.

  • 66,329 industrial interactions — display-before-accept prediction, accuracy 0.973
  • Features: dev/project historical acceptance, gen interval, context length
  • In-production filter +69.5% vs industrial baseline — interruption reduction lever
원본 →
AI 코딩 도구

ABC-Bench — 백엔드 에이전트를 repo 탐색→컨테이너 서비스→E2E API 테스트까지 평가

ABC-Bench(ACL 2026 Findings)는 정적 코드 생성 벤치마크가 놓치는 백엔드 실무 — 환경 설정·컨테이너 서비스 기동·외부 E2E API 테스트 — 를 224개 태스크(8언어·19프레임워크)로 평가한다. 에이전트는 레포 탐색부터 docker compose up까지 전체 lifecycle을 스스로 수행해야 pass. OpenHands≈50% vs mini-SWE-agent+GPT-5<20% — 같은 모델도 프레임워크 interaction strategy가 성공률을 2.5배 이상 가른다. SWE-bench(패치)·ProjDevBench(그린필드)와 달리 '실행 가능한 백엔드 서비스' holisticsystem 평가.

  • 224 tasks / 8 langs / 19 frameworks — containerized service + external API test
  • Framework-sensitive — OpenHands peak ~50%, mini-SWE-agent drops GPT-5 below 20%
  • SWE-bench·ProjDevBench와 역할 분리 — backend lifecycle·executable workflow
원본 →
AI 코딩 도구

EvoCodeBench — Harbor multi-step·MT@4 vs SR 22–40pp·grader leak audit

EvoCodeBench(EvoCode-Bench·UniPat-AI·Harbor official multi-step) — 26 stateful task·227 steps·5–15 rounds per task, single persistent workspace+cumulative executable tests. MT@4(fail-stop multi-round) vs SR(single-round from reference state) — most agents SR exceeds MT@4 by 22–40pp, highest SR(78.9) ranks 3rd in MT@4(44.0). Round-5 aggregate pass < half of round-1. June 2026 integrity audit — Harbor shared multi-step grader script leak in agent workspace(12/26 tasks), upstream fix PR

  • MT@4 vs SR ranking inversion — single-round overstates persistent reliability
  • Harbor native [[steps]] — no fork for full task, mean multi_step_reward_strategy
  • Grader leak lesson — benchmark trust requires harness workspace isolation audit
원본 →
AI 코딩 도구

RoadmapBench — 실제 버전 업그레이드 roadmap을 에이전트가 얼마나 구현하는가

RoadmapBench(arxiv 2605.15846)는 17 OSS repo·5언어·115 task에서 V_OLD 스냅샷과 multi-target roadmap instruction만 주고 target-version 코드·테스트·oracle patch 접근을 차단한다. subtask 순서는 강제하지 않아 에이전트가 planning·우선순위를 스스로 정해야 한다. Resolved Rate(전 subtask pass)와 Completion Score(가중 partial credit)를 동시 보고 — Claude-4.7·GPT-5.4가 30~39% resolved, median ~3,700 LOC·51 files. SWE-EVO(48 Python version)·ProjDevBench(그린필드)와 달리 real upstream test suite 기반 version evolution.

  • 115 tasks / 17 repos / 5 langs — V_OLD snapshot, target code blocked
  • Resolved Rate + Completion Score — unordered multi-target planning
  • SWE-EVO·ProjDevBench와 역할 분리 — real version-upgrade roadmap
원본 →
AI 코딩 도구

Omnionix AgentBench — MCP·reliability·long-session을 재는 production harness

Omnionix AgentBench(v0.2.9)는 one-shot answer prompt가 아니라 coding·data workflow·MCP tool use·persistent memory drift·resumed-session reliability·public leaderboard reproducibility hash를 first-class track으로 평가하는 production-oriented harness다. CLI·Docker·Python adapter 3가지 agent-exec contract, GitHub Actions regression compare, family/tag slice(mcp·reliability·long-session·workflow·coding·data). THUDM AgentBench FC(8환경 LLM-as-Agent·ICLR'24)와 이름은 같지만 축이 다르다 — Omnionix는 MCP+운영 신뢰성+재현성 pipeline.

  • Tracks — MCP·reliability·long-session·workflow·coding·data tag slice
  • Leaderboard pipeline — reproducibility hash·signed attestation·regression compare
  • THUDM AgentBench FC와 역할 분리 — production harness·MCP·session resume
원본 →
AI 코딩 도구

holster-scan — slopsquat 패키지·에이전트 boundary를 로컬에서 먼저 검사

holster-scan(nauta-ai)은 AI 생성 코드의 hallucinated/typosquatted import와 에이전트가 상속하는 shell env·MCP tool·cloud cred blast radius를 로컬·무료·no-signup으로 preflight한다. 10 major repo에서 95% recall·0.36% FP — Semgrep(generic SAST)이 못 잡는 slopsquat 축. safe-to-run vs safe-to-share를 분리하고 .holster.yml allow-list로 private package noise 제거. ghostcall(snippet API check)·wraith(Python linter)와 complement — repo+agent config boundary preflight.

  • Slopsquat detection — 95% recall / 0.36% FP on 10 major repos
  • Agent boundary — shell·MCP·cred blast radius, safe-to-run vs safe-to-share
  • ghostcall·wraith와 역할 분리 — repo-level preflight + allow-list
원본 →
AI 코딩 도구

pkgguard — AI가 추천한 패키지 8개 생태계를 설치 전에 vet

pkgguard(Highcrypto7)는 PyPI·npm·crates.io·Go·RubyGems·Packagist·NuGet·pub.dev 8 ecosystem에서 existence·typosquat·homoglyph·OSV CVE·license trap·maintenance·popularity·repo health를 API key 없이 10-check pipeline으로 판정한다. optional --scan은 archive static malware scan, --deep는 fake star detection. 에이전트가 prose로 패키지명을 제시할 때 ecosystem 미명시면 PyPI+npm 동시 검사. ghostcall(import snippet)·wraith(Python-only linter)와 달리 multi-ecosystem install vet.

  • 8 registries — existence·typosquat·CVE·license trap·maintenance, no API key
  • Optional --scan static malware · --deep fake stars
  • ghostcall·wraith와 역할 분리 — multi-ecosystem pre-install vet
원본 →
AI 코딩 도구

safedeps — npm lockfile closure 검증·자동 rollback으로 에이전트 supply chain gate

safedeps(aldegad)는 Claude Code·Codex CLI install hook으로 pkg@version과 transitive closure를 OSV·CISA KEV·GitHub Advisory에 pre-approve하고, PostToolUse에서 실제 package-lock.json closure를 re-verify한다. unapproved·KEV·vulnerable package가 lockfile에 들어가면 last-known-safe snapshot으로 auto-reorg — Claude Code는 --ignore-scripts로 rejected package lifecycle script 차단. AgentGuard(install intercept)와 달리 npm effect gate — '명령은 통과했지만 lockfile이 다른 closure' 우회를 fail-closed.

  • Pre-approve direct+transitive npm closure against OSV·KEV·GHSA
  • PostToolUse lockfile re-verify → auto-reorg to safe snapshot
  • AgentGuard·holster-scan과 역할 분리 — npm closure effect gate
원본 →
Android

Compose Testing v2 — StandardTestDispatcher 기본, advanceUntilIdle이 필수

Jetpack Compose 1.11(April '26)은 v2 testing API를 default로 전환하고 v1을 deprecated했다. 핵심 변화는 UnconfinedTestDispatcher(즉시 실행) → StandardTestDispatcher(큐잉) — waitForIdle()만 쓰는 테스트는 대부분 그대로지만 LaunchedEffect·rememberCoroutineScope 직접 검증은 advanceUntilIdle() 또는 runCurrent()가 필요하다. race condition을 숨기던 v1 false green을 제거해 production-like timing에 가까워진다. LookaheadAnimationVisualDebugging·performTrackpadInput도 같은 릴리스에 추가.

  • v2 default — StandardTestDispatcher queues coroutines until clock advance
  • LaunchedEffect 테스트 — advanceUntilIdle/runCurrent 명시 필요
  • v1 UnconfinedTestDispatcher deprecated — hidden race condition 제거
원본 →
AI 코딩 도구

Copilot /fleet — 같은 작업을 병렬 subagent에 던져 best-of-N 수렴

GitHub Copilot CLI /fleet는 동일 task를 여러 subagent·여러 model에 병렬 실행하고 decision-ready result 하나로 수렴시키는 command다. /model로 모델을 바꾼 뒤 /fleet로 parallelize — branch 생성·implement·PR까지 background subagent coordination. Copilot CLI 선택적 위임(좁은 탐색은 inline·넓은 탐색만 subagent)과 complement — /fleet는 '같은 문제를 여러 관점에서 동시에' best-of-N. Cursor /best-of-n·Claude Agent Teams(상호 대화)와 달리 GitHub-native terminal fleet.

  • /fleet — parallel subagents on same task, converge to one decision-ready result
  • /model + /fleet — multi-model parallel compare in terminal
  • 선택적 위임·Agent Teams와 역할 분분 — best-of-N terminal fleet
원본 →
AI 코딩 도구

Copilot Critic·Rubber Duck — complementary model이 plan·구현을 자동 검토

Copilot CLI 1.0.60+(experimental) Critic agent는 Claude model에서 plan·complex implementation을 complementary model로 자동 review해 early error catch. Rubber Duck agent는 builtInAgents.rubberDuckAutoInvoke 설정으로 critical reviewer 역할 — 2026-06 기본 enabled. Plan mode→Autopilot handoff 전에 '다른 모델이 틀린 가정을 잡아내는' self-review layer. 공식 /code-review 플러그인(4 parallel reviewer→재검증)과 complement — 내장 critic은 plan/implement 단계 inline gate.

  • Critic agent — complementary model reviews plan·complex implementation (experimental)
  • Rubber Duck — critical reviewer, rubberDuckAutoInvoke setting
  • /code-review plugin과 역할 분리 — inline plan/implement self-review gate
원본 →
AI 코딩 도구

Aider 생태계 개요 — git 커밋·레포 맵·아키텍트·Polyglot을 한 터미널 페어 프로그래머로

Aider(Aider-AI/aider·Apache-2.0·~46k★)는 터미널 LLM 페어 프로그래밍 도구로, 가장 큰 차별점은 변경마다 자동 git 커밋으로 diff/undo 안전망을 만드는 것이다. repo map은 tree-sitter+PageRank로 파일·심볼 시그니처만 보내 전체 코드베이스를 안 넣어도 관련 파일을 집는다. architect 모드는 비싼 모델로 해법을 제안하고 `--editor-model`로 싼 모델이 편집을 변환하는 2-pass 분업. Polyglot 벤치마크는 Exercism 225문제×6언어로 코드 생성이 아니라 지시 따라 파일 편집 능력과 well-formed edit rate를 분리 측정한다. 100+ 언어·클라우드/로컬 LLM·자동 lint/test 후 수정까지 지원.

  • git 일등 시민 — 매 편집 자동 커밋, 단위별 diff/undo
  • repo map — tree-sitter+랭킹, `--map-tokens`로 토큰 예산 조절
  • architect+Polyglot — 2-pass 모델 분업·6언어 편집 벤치로 실력 검증
원본 →
AI 코딩 도구

Copilot CLI 생태계 개요 — TUI GA·Issues/PR 탭·/mcp add·LSP·steering

GitHub Copilot CLI GA(2026-06-23 TUI redesign)는 Session·Issues·Pull requests·Gists 탭으로 GitHub를 터미널에 통합한 에이전트 CLI다. 이슈/PR 하이라이트 후 c로 프롬프트에 참조 삽입·/search로 탐색·/mcp add 대화형 폼·/mcp search로 Registry 설치(재시작 불필요)·/skills·/plugin·/settings in-session 설정. theme-aware semantic color·high-contrast·colorblind·screen reader auto-detect. agent picker Agent/Ask/Custom/Plan·smarter subagent delegation(inline vs subagent A/B tool failure -23%). LSP Setup skill 14언어·steering Add to Queue/Steer/Stop. /fleet·Critic·Rubber Duck은 별도 카드.

  • TUI GA 2026-06-23 — Issues/PR/Gists tab, c-key reference, no browser switch
  • In-session /mcp add·/plugin·/skills — guided setup, registry install without restart
  • Accessibility — theme modes, responsive narrow terminal, screen reader labels
원본 →
AI 코딩 도구

Browser Use — CDP+LLM으로 웹을 자연어 작업으로, 100k★ OSS·클라우드 에이전트

Browser Use(browser-use/browser-use·MIT·~100k★)는 LLM+Chrome DevTools Protocol로 웹사이트를 자연어 task로 자동화하는 Python 라이브러리다. Agent가 DOM/비전으로 요소를 분석하고 click/type/scroll/extract를 CDP로 실행한다. 0.13 beta는 Rust core browser harness로 frontier model용 persistent tool·recovery loop를 추가한다. ChatBrowserUse()는 browser automation 전용 모델로 3-5× 빠르다고 README가 주장. Playwright MCP(접근성 트리)·Stagehand(act/extract/observe)·agent-browser(CLI thin wrapper)와 달리 라이브러리+클라우드 Hosted Agent 풀스택. Browser Use Cloud는 stealth·proxy·CAPTCHA·1000+ integration.

  • Python Agent + CDP — natural language task → navigate/interact/extract
  • 0.13 Rust harness — persistent tools·recovery loops for frontier models
  • Cloud vs OSS — self-host library or hosted stealth/scaling agent
원본 →
AI 코딩 도구

Composio — 1000+ 앱 OAuth·MCP·sandbox를 에이전트 integration layer로

Composio(ComposioHQ/composio·~29k★)는 AI 에이전트가 GitHub·Slack·Notion·Gmail 등 1000+ 앱을 authenticated tool로 쓰게 하는 integration layer다. v3 SDK는 composio.create(user_id) 세션 → session.tools() native 또는 session.mcp.url MCP 두 경로. OAuth·token refresh·scoped auth를 Composio가 관리하고, Triggers로 bidirectional event, context-aware session으로 sandbox state·files를 carry. LangChain·CrewAI·AutoGen·OpenAI Agents·Claude Desktop MCP client와 provider 패키지로 연결. 개별 MCP 서버를 수십 개 붙이는 대신 toolkit 단위 managed auth.

  • composio.create(user_id) — native tools or session.mcp.url for MCP clients
  • Managed OAuth+Triggers — auth lifecycle·scheduled/event triggers
  • Provider packages — OpenAI·LangChain·CrewAI·AutoGen·Anthropic
원본 →
AI 코딩 도구

Inngest — step.run()으로 LLM·tool loop를 crash-safe durable execution으로

Inngest는 AI agent loop의 LLM call·tool execution·save를 각각 step.run()으로 감싸 crash 후 마지막 completed step부터 resume한다. iteration 7에서 죽어도 iteration 1-6 LLM/tool 비용을 재지불하지 않는다. step.invoke()는 sub-agent를 sync delegate, step.sendEvent()는 async fire-and-forget. 2026-06 Agent Loop Architecture 블로그는 loop·skill(durable workflow)·orchestrator 3-layer를 정의하고 Inngest를 orchestration engine으로 포지셔닝. Temporal(generic durable workflow) 카드와 달리 AI agent tool-loop·context pruning·token budget 패턴이 docs-first.

  • step.run per LLM/tool — memoized resume, no duplicate token spend
  • step.invoke sub-agent · step.sendEvent async delegate
  • Agent loop architecture — loop unit + skill asset + orchestrator engine
원본 →
AI 코딩 도구

Trigger.dev chat.agent — TypeScript durable multi-turn agent session

Trigger.dev(triggerdotdev/trigger.dev·Apache-2.0·~15k★) v4.5 RC chat.agent는 multi-turn conversation을 single long-lived Trigger.dev task로 실행한다. page refresh·deploy·crash·idle gap에도 in-memory state·on-disk workspace가 survive. useTriggerChatTransport는 AI SDK useChat용 custom transport — API route 없이 Trigger backend 직결. Sub-agents는 AgentChat으로 parent tool card 안에 preliminary stream. Head Start는 warm server에서 step 1 LLM을 agent boot와 parallel 실행해 TTFC ~50% cut. Inngest(Python/TS step.run loop)와 달리 TypeScript-first chat session primitive + AI SDK v5/v6 integration.

  • chat.agent — durable turn loop, survives refresh/deploy/crash
  • useTriggerChatTransport — no API routes, AI SDK ChatTransport
  • Head Start + sub-agents — parallel cold-start + nested AgentChat stream
원본 →
AI 코딩 도구

LangWatch — agent simulation·eval·prompt versioning OTel observability

LangWatch(langwatch/langwatch·~3.3k★·OSS)는 LLM/agent testing+observability platform으로 trace inspect 외에 Scenario simulation(user persona·pass/fail criteria·HTTP/voice endpoint)과 prompt versioning·feature-flag rollout을 한 UI에 묶는다. OpenTelemetry native, LangChain·CrewAI·custom framework hook. Langfuse(OSS trace+eval)·Braintrust(eval-first CI)와 달리 no-code agent simulation+production monitor를 bundle. ISO27001·SOC2 certified cloud 또는 self-host.

  • Scenario simulation — persona·criteria·HTTP/voice without code
  • Prompt versioning + feature-flag rollout with audit trail
  • OTel native — dev eval + production trace in one platform
원본 →
AI 코딩 도구

Browser agent cloud platform — Steel.dev·Browserbase

Steel(steel-dev/steel-browser·Apache-2.0·~7.2k★)와 Browserbase는 AI agent용 cloud headless browser infra/platform 2축이다. Steel은 Puppeteer·Playwright·Selenium을 Sessions API로 제공하는 OSS self-host infra — sub-1s start·24h session·proxy·CAPTCHA·stealth·Agent Traces·Live Viewer. Browserbase는 Search·Fetch·Functions(<5ms)·Model Gateway·Agent Identity(Cloudflare Signed Agents·1Password·AgentKit)까지 one API key platform play. Stagehand SDK(act/extract/observe self-heal)는 Browserbase가 만든 하이브리드 primitives. Browser Use(library+cloud)와 complement — Steel/Browserbase=infra/platform, Browser Use=agent logic.

  • Steel — OSS Sessions API, Puppeteer/Playwright/Selenium, 24h·Traces·self-host
  • Browserbase — Search/Fetch/Functions/Gateway/Identity one platform
  • Stagehand SDK — act/extract/observe, self-healing Playwright+AI hybrid
원본 →
AI 코딩 도구

LLM agent security — Giskard pre-deploy scan·Lakera Guard runtime firewall

Giskard(Giskard-AI/giskard-oss·~5.5k★) v3는 pre-deploy agentic testing — giskard-checks(scenario API·LLM-as-judge)와 giskard-scan(plain-language agent description→adversarial suite auto-gen). Black-box, prompt injection·harmful content·stereotype. Lakera Guard는 runtime inline AI security — direct/indirect injection·jailbreak·PII를 sub-50ms로 detect/block. Gandalf challenge→product feed. NeMo Guardrails(runtime colang DSL) · OWASP Top 10(taxonomy)와 complementary — Giskard=ship 전 exhaustive scan, Lakera=production inline firewall.

  • Giskard — pre-deploy adversarial scan, black-box scenario generation
  • Lakera Guard — runtime inline firewall, sub-50ms latency
  • Red team→runtime — pre-launch scan then Guard production defense
원본 →
AI 코딩 도구

New Relic Preflight — AI 코딩 어시스턴트 비용·행동·효율 점수를 MCP로 관측

New Relic Preflight(newrelic-experimental/preflight·2026-06 OSS)는 Claude Code·Cursor·Copilot·Windsurf·Zed·Continue·Amazon Q 등 AI coding assistant에 붙는 observability MCP server다. session metrics·cost breakdown·behavioral anti-pattern(thrashing·stuck loop)·efficiency score(비용/완료율/도구 선택 품질)를 structured telemetry로 수집. local-only mode는 New Relic 계정 없이 dashboard·weekly coaching·alerting을 로컬에 저장. NR 연결 시 NRQL·NerdGraph로 org-wide aggregation. Langfuse(production LLM trace) · /usage(Copilot quota)와 달리 developer-side AI assistant infra observability.

  • MCP+hooks — Claude/Cursor/Copilot/Windsurf/Zed/Continue/Amazon Q
  • Efficiency score — cost/outcome·anti-pattern·weekly coaching report
  • Local-only or NRQL — no account required, optional org-wide telemetry
원본 →
AI 코딩 도구

Agent regression testing — EvalView trajectory diff·agentverify YAML cassette

EvalView(hidai25/eval-view)는 golden baseline을 record하고 tool call·param·sequence·output·cost·latency를 diff해 4 status(PASSED·TOOLS_CHANGED·OUTPUT_CHANGED·REGRESSION)로 CI gate한다. agentverify(simukappu/agentverify·pytest plugin)는 real LLM 1회 record→human-readable YAML cassette→zero-cost CI replay로 tool name·param·order·cost·safety rule을 assert — prompt variation tolerance matcher 포함. EvalView=trajectory diff golden gating, agentverify=cassette record/replay action assert. DeepEval(metric pytest) · Iris(MCP rules) · promptfoo(prompt compare)와 complement — LangGraph·CrewAI·OpenAI·Anthropic·MCP·LangChain adapter 지원.

  • EvalView — tool trajectory diff, 4-status CI gate, Ollama offline hermetic replay
  • agentverify — YAML cassette record/replay, zero API cost deterministic assert
  • Complementary — diff gating vs cassette matcher, both regression not production observability
원본 →
AI 코딩 도구

Iris eval MCP — MCP-native agent output quality·safety·cost budget 표준

Iris(iris-eval/mcp-server·OSS)는 MCP-compatible agent가 자동 discover하는 eval standard server다. evaluate_output(13 built-in rules: completeness·relevance·safety·cost, PII 10 patterns·prompt injection 13 patterns·hallucination markers), evaluate_with_llm_judge(5 templates, BYO API key), trace lifecycle(get_traces·store_trace). SDK/code change 없이 any MCP agent가 invoke. LangWatch(Scenario simulation platform) · Braintrust(eval CI) · DeepEval(Python pytest)와 달리 MCP-native eval protocol.

  • 13 heuristic rules — PII·injection·stub-output·hallucination markers free
  • LLM-as-judge — 5 templates, BYO Anthropic/OpenAI key, cost-capped
  • MCP-native — no SDK, agent discovers evaluate_output automatically
원본 →
AI 코딩 도구

Restate — single-binary durable execution + Vercel AI SDK middleware

Restate(restate.dev·OSS single binary)는 journal-and-replay durable execution으로 AI agent step을 crash-safe하게 만든다. @restatedev/vercel-ai-middleware의 durableCalls(ctx)로 LLM response persist, ctx.run()으로 tool execution retry. Vercel AI SDK·Pydantic AI·OpenAI Agents SDK integration. Temporal(cluster ops·multi-week workflow) · Inngest(step.run serverless) · DBOS(Postgres library)와 달리 lightweight single-binary·exactly-once writes·Vercel/Cloudflare/Lambda deploy. 2025-11 Vercel AI SDK integration GA.

  • durableCalls(ctx) — LLM responses journaled, replayed on recovery
  • ctx.run() tools — side-effect steps retried until success
  • Single binary — lighter than Temporal, vs Inngest event-native vs DBOS Postgres
원본 →
AI 코딩 도구

DBOS — Postgres만으로 AI agent workflow를 crash-safe durable execution

DBOS(dbos.dev·OSS library)는 Postgres에 workflow·step state를 checkpoint해 agent가 crash·restart·network outage 후 마지막 completed step부터 resume한다. @DBOS.workflow + @DBOS.step 또는 DBOSAgent(Pydantic AI)·DBOSRunner(OpenAI Agents SDK) wrapper. Conductor control plane으로 distributed recovery·pause/restart·retention policy. Temporal(separate cluster) · Inngest(serverless event) · Restate(single binary)와 달리 Postgres-native — zero new infra if Postgres already runs. SQLite dev → Postgres prod.

  • @DBOS.workflow/@DBOS.step — LLM+tool calls checkpointed to Postgres
  • DBOSAgent/DBOSRunner — Pydantic AI·OpenAI Agents SDK native wrappers
  • Postgres-only infra — no separate orchestrator cluster, Conductor optional
원본 →
AI 코딩 도구

Morph agent models — Fast Apply merge·WarpGrep search subagent

Morph(morphllm.com)는 coding agent용 specialized model 2축을 제공한다. Fast Apply(morph-v3-fast/large/auto·7B)는 // ... existing code ... marker snippet을 original file에 semantic merge — 10,500+ tok/s·98% accuracy·OpenAI-compatible API·MCP·E2B/Daytona applyEdit. WarpGrep(v2.1)는 search를 isolated context subagent로 offload — 8 parallel tool/turn·4 turns max·(file,[start,end]) span만 main agent에 반환. SWE-Bench Pro Opus 55.4→57.5·Codex 56.0→59.1 lift. Cursor instant apply·Aider repo map·trace-mcp와 complement — planning model + merge model + search subagent 3-tier 분리.

  • Fast Apply — SAP-style semantic merge, 10,500 tok/s, planning/merge model split
  • WarpGrep — isolated search subagent, +2~4pp SWE-Bench Pro when paired
  • OpenAI-compatible API+MCP — E2B/Modal/Daytona sandbox remoteCommands 지원
원본 →
AI 코딩 도구

trace-mcp — framework-aware codebase graph MCP, 138 tools·81 language

trace-mcp(nikolai-vysotskyi/trace-mcp·npm)는 codebase를 cross-language dependency graph로 index해 MCP로 serve한다. 81 language·58 framework integration(Laravel/Inertia/Vue cross-edge 등)·138 tools — get_change_impact·get_call_graph·find_usages·get_request_flow. trace-mcp init이 Claude Code·Cursor·Windsurf·Codex 등 auto-detect·one-click wire. Aider repo map(tree-sitter ranking) · Sourcegraph(search) · Qartez(PageRank graph)와 달리 framework-aware cross-language edges. Optional Electron GPU graph explorer.

  • Framework-aware edges — Laravel route→Vue page, ORM→migration cross-language
  • 138 MCP tools — get_change_impact one call vs 80 Greps+190 reads
  • init auto-detect — Claude/Cursor/Windsurf/Codex one-click MCP wire
원본 →
AI 코딩 도구

BAML — schema-first LLM function DSL + SAP로 sloppy JSON도 파싱

BAML(BoundaryML/baml·MIT·~5k★)은 .baml 파일에 LLM function interface·prompt·schema를 정의하고 Python·TypeScript·Go·Ruby·Rust client를 generate하는 DSL toolchain이다. Schema-Aligned Parsing(SAP)은 markdown-in-JSON·chain-of-thought·trailing comma 등 sloppy output에서 structured data recover — strict json.loads() retry loop 대신. VS Code playground에서 prompt test·streaming·API inspect. Instructor(Pydantic runtime) · Outlines(FSM constrained decode) · Microsoft Guidance와 달리 cross-language schema source of truth + SAP parser.

  • SAP parser — recover structure from sloppy LLM output, not strict JSON
  • .baml DSL — prompt+schema in one file, generate typed clients 6+ languages
  • VS Code playground — test prompts without full app environment
원본 →
AI 코딩 도구

Smithery — MCP registry·hosting·managed OAuth gateway, 7300+ servers

Smithery(smithery.ai)는 MCP ecosystem의 registry+hosting+connection platform — 7300+ MCP server catalog·REST API search·smithery CLI publish. Managed OAuth gateway가 redirect URI·client secret·token refresh를 Smithery가 처리하고 namespace URL 하나로 N connection을 Claude·Cursor·ChatGPT에 portable하게 expose. scoped service token으로 browser/mobile agent에 short-TTL credential. Composio(1000+ app toolkit integration) · individual MCP server OAuth와 달리 MCP server discovery+hosting infra layer. MCPB bundle local stdio distribution 지원.

  • 7300+ registry — GET /servers search, smithery mcp publish CLI
  • Managed OAuth gateway — no per-server redirect URI, auto token refresh
  • Namespace URL — one endpoint bundles N MCP connections, portable across clients
원본 →
AI 코딩 도구

Blaxel — perpetual standby sandbox, 25ms resume·zero idle compute

Blaxel(blaxel.ai)는 AI agent용 perpetual sandbox platform — standby 상태에서 compute 비용 0·25ms 이내 resume·filesystem+memory state 유지. E2B(30일 pause 삭제)·Daytona(30일 archive)·Modal(7일 alpha cap)과 달리 unlimited standby duration. microVM isolation(AWS Lambda 동일 접근)·15초 network idle 후 auto-standby·Volumes로 장기 persistence. Sandboxes+Agents Hosting+Batch Jobs+MCP Servers Hosting+Model Gateway one stack. OpenAI Agents SDK v0.14 8 provider 중 하나 — co-located agent hosting으로 agent↔sandbox network roundtrip 제거.

  • Perpetual standby — zero compute cost, <25ms resume, full FS+memory state
  • vs E2B/Daytona/Modal — no 7~30 day pause/archive deletion cap
  • Co-located hosting — agent+execution same platform, MCP+Model Gateway bundle
원본 →
AI 코딩 도구

MCP sandbox 실행 — Sandcastle tiered isolation·mcp-sandboxd persistent identifier

Sandcastle(pruthvirajdgit/sandcastle·MIT)는 MCP execute_code로 tiered sandbox — low(namespace+seccomp·~5ms)·medium(gVisor·~50ms default)·high(Firecracker·~250ms) 3 isolation level, network blocked+allowlist·pre-warmed pool. mcp-sandboxd(jeliasson/mcp-sandboxd)는 identifier(대화 ID)마다 long-running Docker/K8s sandbox를 run_sandbox·restart_sandbox·delete_sandbox로 유지 — deps 1회 install 후 iterate·/artifacts HTTP proxy. Sandcastle=stateless tiered execute, mcp-sandboxd=conversation-scoped persistent machine. E2B(ephemeral API) · Agents SDK Sandbox(manifest)와 달리 MCP-native 2축 — threat model별 tier vs session persistence.

  • Sandcastle — 3 isolation tiers, execute_code MCP, security/perf tradeoff per call
  • mcp-sandboxd — identifier→persistent sandbox, Docker·K8s·DinD same MCP surface
  • Complementary — tiered one-shot execution vs reuse env across agent turns
원본 →
AI 코딩 도구

Taskmaster AI — PRD→dependency-aware task graph MCP, 27k★

Taskmaster AI(eyaltoledano/claude-task-master·~27k★)는 PRD·spec·GitHub issue를 structured dependency-aware coding task graph로 decompose하는 MCP server다. Cursor·Claude Code·Windsurf 등 에디터에서 parse-prd·expand-task·analyze-complexity·set-status MCP tool 호출. multi-model orchestration — main·research(Perplexity)·fallback role 분리. Backlog.md(마크다운 칸반) · Ralph loop(bash retry) · Spec Kit(SDD scaffold)와 달리 AI-powered task decomposition+dependency graph+complexity scoring. tiered MCP tool loading(core/standard/all)로 context 절약.

  • parse-prd→task graph — dependency edges·complexity analysis·status tracking
  • Multi-model roles — main codegen·research Perplexity·fallback auto-switch
  • MCP-native — Cursor/Claude Code/Windsurf in-editor, tiered tool loading
원본 →
AI 코딩 도구

Cloudflare Sandbox SDK — Workers Containers·Durable Objects stateful sandbox

Cloudflare Sandbox SDK는 Cloudflare Workers+Containers ecosystem 위 AI agent sandbox platform이다. Durable Objects로 container stateful coordination·R2 bucket mount persistent storage·sleepAfter idle timeout(기본 10분)·keepAlive indefinite·configurable network egress. Code Mode(MCP→TypeScript API·V8 isolate) · Agents SDK 8 provider · Blaxel(perpetual standby)와 달리 Workers-native deploy·edge proximity·R2 mount. OpenAI Agents SDK CloudflareSandboxClient integration.

  • Workers Containers+Durable Objects — stateful sandbox coordination at edge
  • R2 mount+keepAlive — persistent storage, configurable idle/sleep policy
  • vs Code Mode — full Linux container sandbox, not V8 isolate tool codegen
원본 →
AI 코딩 도구

Cognee — graph-native AI memory, 14 retrieval mode·memify self-improve

Cognee(topoteretes/cognee·Apache-2.0·~7k★)는 vector+graph+relational 3-layer unified memory engine으로 agent에 persistent long-term memory를 제공한다. ingest→knowledge graph build→GRAPH_COMPLETION(default graph traversal+vector hint) 등 14 retrieval mode. memify가 stale node prune·edge reweight·derived fact 추가로 self-improving memory. Session memory(fast cache)↔Permanent memory(graph sync) 2-tier. Mem0(drop-in fact layer) · Letta(self-editing agent OS) · Graphiti/Zep(temporal KG)와 달리 graph-native control plane+Claude Code plugin(SessionStart/PostToolUse/PreCompact hooks).

  • 14 retrieval modes — GRAPH_COMPLETION graph traverse vs vanilla RAG top-k
  • memify — prune·reweight·derive facts, memory evolves not static storage
  • Claude Code plugin — hooks capture tool calls→session→permanent graph sync
원본 →
AI 코딩 도구

Fly.io Sprites — ~300ms checkpoint/restore stateful Linux VM sandbox

Fly.io Sprites(2026-01 GA)는 checkpoint/restore stateful Linux VM sandbox — create 1~2s·restore ~300ms entire FS+apt packages+running services. 100GB NVMe root+object storage durability·scale-to-zero 30s idle·HTTP unique URL+TLS·network egress policy. Docker image pull 없이 base Linux+manual install 또는 checkpoint configured env. Runloop(snapshot/branch) · E2B(ephemeral microVM) · Blaxel(perpetual standby API)와 달리 programmable checkpoint/restore primitive·Claude Code remote runtime use case. Northflank/OCI alternatives comparison axis.

  • sprite checkpoint/restore — ~300ms full env restore incl running services
  • No Docker pull — base Linux+install or checkpoint configured state
  • Scale-to-zero 30s — HTTP URL access, programmable API+SDK thousands concurrent
원본 →
AI 코딩 도구

Citadel — Claude/Codex orchestration harness, /do routing·ClawTeam-style fleet

Citadel(SethGammon/Citadel·MIT·~614★)는 Claude Code+OpenAI Codex용 orchestration plugin — compiled repo memory·/do intent routing·safety hooks·cost telemetry·git worktree parallel fleet. ClawTeam(HKUDS/clawteam·~5.3k★) swarm 패턴도 흡수 — Claude/Codex/OpenClaw/Kimi CLI를 tmux+worktree로 CLI-agnostic spawn, leader가 decompose→specialist spawn→discovery share. Campaign/Marshal/Fleet roles로 multi-session resume·handoff. Agent Teams(Claude native) · Vibe Kanban(GUI) · Conductor(mac GUI)와 달리 plugin harness+durable compiled memory+English→workflow routing.

  • /do intent routing — English→lightest workflow, compiled memory survives reset
  • Fleet parallel — git worktree isolation, ClawTeam-style tmux spawn any CLI agent
  • Cost telemetry — token spend dashboard, campaign resume+handoff across sessions
원본 →
AI 코딩 도구

Code Quality Findings REST API — CodeQL 이슈를 에이전트 수리 큐로 읽기

GitHub는 2026-06-23 Code Quality findings용 repository-level REST API를 public preview로 열었다. 새 read-only 엔드포인트는 저장소의 Code Quality CodeQL finding 목록과 단일 finding 상세를 가져오며, 목록 API는 필터링과 페이지네이션을 지원한다. 중요한 점은 "UI에서 보던 품질 경고"가 에이전트가 읽을 수 있는 작업 큐가 된다는 것이다. 자동 수정 에이전트가 바로 쓰기 권한을 갖기보다, 먼저 findings를 읽고 심각도·파일·규칙·소유 팀 기준으로 묶은 뒤 사람 승인·Copilot cloud agent·사내 remediation workflow에 넘기는 식으로 안전한 triage 레이어를 둘 수 있다. 단, 현재는 github.com public preview이고 GitHub Enterprise Server에는 아직 제공되지 않는다.

  • 두 read-only API: finding list + single finding detail
  • 필터링·페이지네이션으로 CodeQL 품질 이슈를 에이전트/툴링 큐로 변환
  • public preview on github.com / GHES 미지원이라 운영 자동화 전 가용성 확인 필요
원본 →
AI 코딩 도구

CodeMCP Workflows — MCP로 TDD·V-model·EPCC 엔지니어링 프로세스 주입

CodeMCP Workflows(@codemcp/workflows·MIT)는 AI coding agent에 battle-tested engineering workflow를 MCP·skills로 주입하는 structured development partner다. TDD·V-model·Anthropic EPCC·reproduction-based bugfix·greenfield 등 methodology preset, context compression·세션 넘어 survive하는 process notes·decision tracking·auto documentation. `npx @codemcp/workflows setup claude --mode skill`로 Claude·Gemini·Copilot·OpenCode·Kiro에 설치. Spec Kit(SDD scaffold) · Superpowers(methodology bundle) · Taskmaster(task graph)와 달리 phase-aware process guidance — agent가 현재 단계와 next focus를 MCP가 주도.

  • Workflow presets — TDD·V-model·EPCC·bugfix·greenfield, survives context compression
  • MCP+skills dual mode — any MCP agent, skill mode for on-demand loading
  • vs Spec Kit — process phase guidance not just spec→implement scaffold
원본 →
AI 코딩 도구

memoryx — embedding 없이 agent memory+auto compression, 78–84% 토큰 절약

memoryx(@munesoft/memoryx·MIT·zero dependency)는 AI agent용 universal memory layer — remember·recall·context·compress API 한 줄로 stateless LLM에 continuity 부여. vector DB·embedding 없이 substring+Jaccard+fuzzy recall, long-term limit 초과 시 low-signal entry를 extractive digest로 fold(optional LLM summarizer). in-memory·file·Redis adapter. Cognee(graph-native 14 mode) · Mem0(vector+graph hybrid) · Letta(agent OS)와 달리 zero-setup lightweight JS — browser·edge·$0 offline compression.

  • Auto compression — low-signal entries fold to digest, 78–84% token savings
  • No embeddings — substring+Jaccard+fuzzy, optional LLM summarizer plug-in
  • context(scope) — budget-aware prompt-ready text, hooks onRemember/onCompress
원본 →
AI 코딩 도구

Context Compression Engine — LLM 메시지 lossless round-trip deterministic 압축

Context Compression Engine(SimplyLiz/ContextCompressionEngine·MIT·zero dep)는 LLM message array를 prose summarize+code/JSON/SQL verbatim preserve로 compress하고 uncompress로 byte-identical restore한다. deterministic engine 1.3–6.1x·zero latency·zero API cost, optional LLM summarizer plug-in. tokenBudget binary search·recencyWindow·agentToolPrepass(verbose tool output strip)·exact+fuzzy dedup. PreCompact hook(passive) · context engineering(card) · memoryx(memory layer)와 달리 harness-side message array compressor — agent tool pre-pass로 verbose output 먼저 제거.

  • Lossless round-trip — compress/uncompress byte-identical, VerbatimMap metadata
  • Deterministic 1.3–6.1x — zero API, optional Claude/GPT/Gemini/Ollama summarizer
  • agentToolPrepass — strip verbose tool output before prose summarization
원본 →
AI 코딩 도구

CodeLedger — Claude Code plugin, project·agent·skill별 토큰·비용 MCP 집계

CodeLedger(bhvbhushan/codeledger·MIT·v0.3)는 Claude Code plugin+MCP server로 AI coding token spend를 project·agent·skill 단위로 attribute한다. user coding vs plugin overhead cost split·session category·efficiency recommendation·budget alert·anomaly detection·local web dashboard. MCP conversational query. ccusage(multi-tool log CLI·16k★) · New Relic Preflight(observability MCP) · /usage(quota UI)와 달리 per-skill·per-agent breakdown — "어느 skill이 토큰을 태우나" 질문에 답.

  • Per-project·agent·skill — overhead vs user cost split, ~estimated skill attribution
  • Budget alerts+anomaly — local dashboard, MCP conversational query
  • Claude Code plugin — vs ccusage log aggregation across 16+ CLIs
원본 →
AI 코딩 도구

AgentLedger — reverse proxy로 LLM 호출 비용·budget을 코드 변경 없이 enforce

AgentLedger(WDZ-Dev/agent-ledger·Go·MIT)는 AI agent와 LLM provider 사이 reverse proxy — every request metered·daily/monthly budget block·pre-flight estimation·15+ provider·zero code change(base URL override). MCP metering·multi-tenancy·Prometheus /metrics·admin API. CodeLedger(local log attribution) · New Relic Preflight(assistant observability) · AgentCostFirewall(loop block)와 달리 infrastructure gateway — OPENAI_BASE_URL=http://localhost:8787/v1 한 줄로 전체 agent stack에 budget gate.

  • Reverse proxy — zero code change, base URL override for any OpenAI/Anthropic SDK
  • Pre-flight reject — block before API call if budget would exceed
  • Multi-provider+MCP metering — Prometheus metrics, daily/monthly limits
원본 →
AI 코딩 도구

Prompt versioning platform — reaatech PVC eval-gated draft→staging→production

reaatech/prompt-version-control(MIT monorepo)는 Git-like prompt versioning + eval-gated promotion platform — SHA-256 checksum·auto numbering·draft/staging/production tag lifecycle·A/B weighted traffic·sticky session·semantic diff·per-version cost/latency metrics. staging→production promotion blocked on eval harness fail. MCP server로 agent runtime에 managed prompt pull. promptdiff(CLI diff/eval) · promptctl(local git-like store) · Braintrust(eval CI)와 달리 self-hosted tag lifecycle+A/B serve+eval gate — SaaS 아닌 team-owned prompt registry.

  • Tag lifecycle — draft/staging/production, eval-gated promotion block
  • A/B deployments — weighted traffic split, sticky session, semantic diff
  • MCP pull — agents fetch managed prompts at runtime, Prometheus /metrics
원본 →
AI 코딩 도구

Prompt versioning CLI — promptdiff eval·promptctl git-like store

promptdiff(ManasVardhan/promptdiff·MIT)는 CLI-first prompt version control — numbered versions·line diff·Jaccard similarity·optional embedding·eval against test cases·changelog auto-gen·CI integration. promptctl(nayaai·single binary)는 git mental model — commit·colorized diff·rollback·`.promptctl/store.json` project-local·editor watch mode. reaatech PVC(platform eval gate) · Braintrust(SaaS eval)와 달리 developer-local CLI — prompt를 application code 밖 artifact로 version without hosted service.

  • promptdiff — version+diff+similarity+eval+changelog, Rich terminal output
  • promptctl — git-like commit/diff/rollback, store.json walk-up discovery
  • Local-first — no SaaS, team shares via git commit of store.json
원본 →
AI 코딩 도구

Code map MCP — mcp-codemap progressive disclosure·jonnonz1 cheap file select

mcp-codemap(breca/mcp-codemap·MIT)는 tree-sitter AST index→SQLite `.codemap/graph.db`로 codebase mental map — map(progressive detail level)·query(entity deep dive+source)·reindex(git diff auto-detect). IDE foldable section처럼 LLM context bloat 방지. jonnonz1/codemap(Go)는 cheap model(Haiku/Flash)로 파일 one-line summary index→codemap_select가 task description에 relevant 5–10 files full source 반환 — exploration phase skip. trace-mcp(138 tools graph) · Aider repo map(tree-sitter ranking)와 달리 progressive structural map vs cheap-model file router 2축.

  • mcp-codemap — map/query/reindex, progressive disclosure, git diff auto-refresh
  • jonnonz1 codemap — cheap model summary index, codemap_select one-shot context
  • vs trace-mcp — structural fold vs framework graph, complementary not replacement
원본 →
AI 코딩 도구

Warp — open-source ADE·Oz cloud control plane, Claude Code·Codex·Warp Agent

Warp(warp.dev·AGPL-3.0·~62k★)는 2026년 터미널 코어를 open-source로 전환한 agentic development environment — Rust GPUI·vertical tabs·native code editor·agent diff review·MCP. Built-in Warp Agent + Claude Code·Codex·Gemini CLI·OpenCode BYO harness. Oz(warp.dev/oz)는 cloud orchestration — multi-harness launch·Slack·Linear·GitHub trigger·Docker/K8s sandbox·parent/child parallel·Agent Memory preview. OpenAI founding sponsor. Conductor(mac local) ·Citadel(plugin)와 달리 terminal-native surface + open core + cloud control plane 3-tier stack.

  • Open-source terminal — AGPL-3.0 Rust, vertical tabs·LSP editor·agent review loop
  • Oz cloud — multi-harness control plane, triggers·env·secrets shared across agents
  • BYO harness — Claude Code·Codex·Gemini CLI·OpenCode same surface, Warp Agent built-in
원본 →
AI 코딩 도구

mcp-code-review — GitHub·GitLab·local diff MCP, 13-category engineering checklist

mcp-code-review(mauriziomocci/mcp-code-review·MIT)는 MCP server로 GitHub PR·GitLab MR·local git diff·single file·project scan review — Ruff lint+Bandit security·`.codereview.yml` conventions·13-category professional checklist(SOLID·architecture·security·performance·concurrency·observability). review_github_pr·post_github_review·save_review_report·multi-language output(EN/IT/ES). Claude Code GitHub Action(@claude PR fix) · Copilot Code Review(AGENTS.md context) · Open Code Review(Alibaba CLI)와 달리 MCP-native structured checklist — any MCP client에서 PR URL 하나로 review+post.

  • 13-category checklist — SOLID·security·performance·concurrency·observability
  • GitHub+GitLab+local diff — Ruff+Bandit static analysis, post review back
  • .codereview.yml — project conventions, skill auto-orchestrates MCP tools
원본 →
AI 코딩 도구

AI Coding Agent CI 보안 — tag pinning만으론 부족, 런타임 egress까지 본다

StepSecurity의 2026년 글은 Claude Code·Cursor·Codex·Gemini·Copilot 같은 AI coding agent가 개발자 머신, PR, GitHub Actions까지 이어지는 3단계 공격면을 만든다고 정리한다. 에이전트는 패키지를 설치하고, MCP 서버·IDE 확장에 연결하고, CI에서 GITHUB_TOKEN 권한으로 branch push·dependency install·GitHub API 호출까지 수행한다. 그래서 방어도 "생성 코드 스캔"만으로는 부족하다. GitHub 공식 Actions 보안 문서는 third-party action을 full-length commit SHA로 pinning하라고 권고하지만, 2026-06-24 compromised action 사례처럼 tag가 repoint되면 tag pin은 깨진다. 실전 교훈은 agent workflow를 privileged build system으로 보고, dependency cooldown/PR block, least-privilege GITHUB_TOKEN, full SHA pin, runner network egress policy, process/network attribution을 한 묶음으로 설계하는 것이다.

  • 3단계 공격면 — dev machine/MCP·repo dependency PR·CI runner secret/GITHUB_TOKEN
  • GitHub 공식 권고 — third-party action은 tag보다 full-length commit SHA pinning
  • AI agent CI는 runtime 관측 필요 — outbound endpoint·spawned process·package install을 step 단위로 추적
원본 →
AI 코딩 도구

Cerbos — YAML policy PDP로 agent tool call·MCP server authorization

Cerbos(cerbos·Apache-2.0)는 agent tool invocation을 코드 밖 YAML policy로 평가하는 stateless authorization PDP다. cerbos.checkResource({principal, resource, actions})로 OpenAI Agents SDK·MCP server·LiteLLM gateway·Tailscale Aperture hook에서 tool call 직전 allow/deny. RBAC→ABAC(condition expr로 amount·department·time) 확장, Cerbos Hub로 policy CI/CD·audit·kill switch. Cursor Auto-review(ML classifier) ·prompt allowlist와 달리 declarative·versioned·sub-ms deterministic policy — identity는 WorkOS/Okta, Cerbos는 "무엇을 할 수 있나".

  • checkResource before tool call — principal·resource·action+context attributes
  • MCP server pattern — cerbos로 session별 authorizedTools 동적 필터
  • Aperture·OpenAI SDK integration — gateway intercept→PDP→enforce
원본 →
AI 코딩 도구

Oso — Polar policy-as-code, agent RBAC·ReBAC·RAG list filtering

Oso(osohq·Polar DSL)는 Duolingo·Intercom·PagerDuty가 쓰는 fine-grained authorization engine으로 agent workflow에 RBAC·ReBAC·ABAC를 policy-as-code로 통합한다. authorize(actor, action, resource) API를 tool call·vector search·DB lookup마다 호출 — LLM이 runtime에 정한 query sequence도 매 hop에서 filter. Oso Cloud Facts+Polar rules, list filtering으로 RAG retrieval 후 unauthorized chunk 제거. Cerbos(YAML PDP) ·SpiceDB(Zanzibar graph)와 달리 Polar declarative rules+behavioral risk scoring·dynamic permission tightening for agents.

  • Polar — roles·relations·permissions decoupled from app code
  • RAG list filtering — vector search result를 authorized subset만 LLM에 전달
  • Oso for Agents — runtime guardrail, novel tool use alert, instant revoke
원본 →
AI 코딩 도구

Permit MCP Gateway — agent.security MCP proxy, deny-by-default·consent·audit

Permit MCP Gateway(permit.io/agent.security·MCPermit)는 MCP client(Cursor·Claude·VS Code)와 upstream MCP server 사이 drop-in proxy — identity-aware access·deny-by-default·consent-based delegation·complete audit trail. MCP server→resource·tool→action 매핑, RBAC+ABAC+ReBAC, OAuth 2.1+token vault(agent runtime에 upstream credential 없음). Access Request MCP로 agent가 sensitive action request→human approve. Cerbos(PDP library) ·Arcade(MCP runtime)와 달리 managed gateway+consent service+app.agent.security dashboard.

  • Deny by default — tool access explicit grant until admin sets trust ceiling
  • Consent Service — OAuth login·human consent·upstream MCP OAuth brokering
  • Zero standing permissions — ephemeral scoped token per tool call evaluation
원본 →
AI 코딩 도구

SpiceDB/Authzed — Zanzibar ReBAC, agent·RAG authorization infrastructure

SpiceDB(authzed/spicedb·~6k★·Apache-2.0)는 Google Zanzibar-inspired authorization database — trillions ACL·millions checks/sec. Authzed Authorization Infrastructure for AI(2026)는 document ingestion→vector search→agent tool execution 전 단계 fine-grained permission. langchain-spicedb — post-filter RAG(retrieve→SpiceDB CheckBulkPermissions→generate), SpiceDBPermissionTool for agentic workflows. Agent를 first-class non-human identity로 model, inherited user permission·functionality control·approval gate. Cerbos(YAML action policy) ·Oso(Polar)와 달리 relationship graph(ReBAC) native — "manager on project X can view doc Y".

  • Agentic RAG LangGraph node — deterministic authorization node, LLM bypass 불가
  • CheckBulkPermissions — retrieval N건을 single API로 filter
  • Agent identity model — tool restriction·inherited user perm·audit log
원본 →
AI 코딩 도구

OPA/Rego — CNCF policy-as-code, agent tool loop decision point

Open Policy Agent(openpolicyagent·CNCF graduated)는 Rego declarative language로 agent tool call마다 allow/deny를 평가하는 general-purpose PDP다. input={principal, tool.name, args, context}→Rego policy→decision — prompt instruction과 분리된 deterministic gate. @ai-sdk/policy-opa(Vercel AI SDK 6 toolApproval) ·sidecar gateway ·MCP 3-layer(tool·device·command) 패턴. opa test CI·WASM bundle·OCI registry policy artifact — agent redeploy 없이 policy update. Cedar(AgentCore) ·Cerbos(YAML)와 달리 domain-agnostic·Rego expressiveness·infra-wide reuse(K8s·API·agent 동일 engine).

  • Rego tool_approval — git status/log allow, rm/curl deny, args constraint
  • Decouple enforcement — agent proposes, OPA decides, app enforces
  • Shadow mode first — log allow/deny before strict block rollout
원본 →
AI 코딩 도구

Tailscale Aperture — tailnet identity AI gateway, MCP connector·Cerbos hook

Aperture by Tailscale(beta·2026)는 Tailscale cryptographic identity로 LLM·MCP·HTTP connector 요청을 중앙 프록시 — API key distribute 없이 alice@corp identity로 OpenAI·Anthropic·Google·self-hosted route. MCP protocol — client는 Aperture만 보고 remote tool discover, per-user OAuth 2.0 token Aperture vault. Grants+hooks로 Cerbos·Oso·Highflame·Cribl integration — tool call intercept→PDP→allow/deny. Portkey(routing config) ·Helicone(cost proxy)와 달리 tailnet identity layer+enterprise AI inventory·spending limit·audit trail day one.

  • Tailscale identity — remote IP→login name, no per-user API key rotation
  • MCP+HTTP connectors — credential inject once, agent/client zero secret
  • Cerbos/Oso hooks — tool call metadata→PDP before LLM execution
원본 →
AI 코딩 도구

Arcade.dev — MCP runtime for delegated agent auth·token vault·JIT consent

Arcade.dev(arcade.dev)는 MCP spec OAuth handshake 위에 token vaulting·just-in-time consent·user verification·RBAC·immutable audit를 native로 제공하는 agent authorization runtime이다. custom user verifier(production) — OAuth redirect flow_id→server-side confirm_user로 phishing 방지. URL Elicitation로 mid-task granular consent, per-user OAuth delegation(not bot token). Composio(1000+ catalog) ·Scalekit(B2B auth stack)와 달리 auth-first MCP runtime — 9 capability checklist(OIDC·OAuth 2.1·RFC8693 token exchange·Resource Indicators).

  • Custom verifier route — session user_id must match authorization flow starter
  • Token vault — agent never sees upstream OAuth credential
  • OTel-exportable immutable per-action audit log
원본 →
AI 코딩 도구

Scalekit — agent auth stack, OBO delegation·token vault·MCP OAuth 2.1

Scalekit(scalekit.com·scalekit-sdk-node)는 human SSO(SAML·SCIM·passwordless)+agent auth를 unified platform으로 제공한다. Agent Identity — agent as first-class actor with human ownership. connected account abstraction — agent executes via scoped identifier, Scalekit manages OAuth exchange·refresh·tenant isolation internally. On-Behalf-Of nested claims — InfraBot acts for support agent acts for user, auditable delegation chain. Ephemeral task-scoped credential(minutes not days). Composio(tool catalog) ·Arcade(MCP runtime)와 달리 B2B SaaS builder용 auth infrastructure — MCP-native OAuth 2.1 DCR/PKCE.

  • connection+connectedAccount — provider boundary vs authenticated identity
  • execute_tool single method — no endpoint URL·auth header in agent runtime
  • Immutable audit — which user initiated, which agent acted, which resource
원본 →
AI 코딩 도구

ZeroID — open-source agent identity, scope attenuation·token exchange·revoke chain

ZeroID(highflame-ai/zeroID·Apache-2.0·2026)는 autonomous agent용 identity infrastructure — WIMSE/SPIFFE URI·OAuth 2.1·RFC8693 token exchange·CIBA backchannel approval. orchestrator→sub-agent delegation 시 scope intersection enforced — parent fs:read+write+execute → reviewer fs:read+write only. parent revoke→downstream chain instant invalidation. forward-auth subrequest(nginx·Caddy·Traefik)로 any agent framework hook. Highflame commercial Agent Control Platform governance layer 위 open identity. Claude WIF(workload API key) ·MCP Enterprise Auth(IdP provision)와 달리 agent-native cryptographic identity+delegation chain.

  • SPIFFE URI identity — org·project·type·name in every short-lived token
  • token_exchange — sub-agent scope ≤ parent, offline chain verification
  • CIBA — agent posts bc-authorize, human approves via Slack/email/push OOB
원본 →
AI 코딩 도구

Multi-tenant token budget — token bucket·WFQ·Jain fairness for agent APIs

Multi-tenant agent platform에서 request/min rate limit은 LLM 비용·noisy neighbor를 못 막는다 — token-aware budget+fair scheduling이 minimum viable. Redis Lua atomic token bucket per tenant(capacity·refill_per_sec tier별), soft cap→queue·hard cap→429 Retry-After. Weighted Fair Queuing — enterprise tier priority without free-tier starvation, max-wait timer. Helicone(per-user cost header) ·AgentLedger(budget proxy)와 달리 fairness engineering pattern — Jain index(Σx)²/(n·Σx²)>0.90 healthy, hogging scenario other tenants <2% reject.

  • Token bucket not request count — TPM reflects actual LLM cost
  • Tier capacity/refill — free 10K·enterprise 2M TPM, burst multiplier 1.2–2×
  • Jain fairness index — measure cross-tenant equitable throughput allocation
원본 →
AI 코딩 도구

MCP Elicitation — 서버가 도구 실행 중 필요한 입력을 구조화해서 묻기

MCP 2025-06-18의 Elicitation은 서버가 도구·워크플로 실행 중 빠진 정보를 클라이언트를 통해 사용자에게 다시 물을 수 있게 하는 기능이다. 서버는 `elicitation/create` 요청에 메시지와 `requestedSchema`를 담고, 클라이언트는 사용자가 검토·수정·거절·취소할 수 있는 UI를 제공한다. 스키마는 구현 부담을 줄이려고 평평한 object와 string/number/boolean/enum 같은 primitive 중심으로 제한된다. 교훈은 "처음 프롬프트에 모든 경우의 질문을 우겨 넣기"가 아니라, 툴 실행 지점에서 필요한 필드만 구조화해 물어보는 것이다. 단, spec은 elicitation으로 비밀번호·API 키·토큰·결제 정보 같은 민감 정보를 요구하지 말라고 못박고, 클라이언트가 어떤 서버가 묻는지 명확히 보여주고 decline/cancel을 지원해야 한다고 요구한다.

  • 서버는 `elicitation/create` + JSON Schema로 필요한 추가 입력을 요청
  • 응답은 accept/decline/cancel 3상태 — 사용자가 검토·수정·거절 가능
  • 민감 정보 요청 금지, 서버 표시·스키마 검증·rate limit이 안전 기본값
원본 →
AI 코딩 도구

OWASP MCP Top 10 — MCP01~MCP10 agent tool integration risk taxonomy

OWASP MCP Top 10(2025 beta·Vandana Verma Sehgal)는 Model Context Protocol 전용 보안 프레임워크 — MCP01 token mismanagement·MCP02 scope creep·MCP03 tool poisoning·MCP04 supply chain·MCP05 command injection·MCP06 intent flow subversion·MCP07 authZ·MCP08 audit/telemetry·MCP09 shadow MCP·MCP10 context over-sharing. OWASP LLM Top 10(model/app) ·ASI Top 10(agentic app)와 축 분리 — MCP는 tool discovery·description trust boundary. CSA Agentic MCP Security v1(OAuth 2.1·tool-level scope) operational checklist와 complement. Unit42: 5 MCP server 연결 시 compromised 1개→78.3% attack success. Week 1: OAuth 2.1·tool pinning·audit log·server allowlist.

  • MCP01~MCP10 — protocol-specific taxonomy, not LLM/ASI Top 10 duplicate
  • MCP03 tool poisoning + MCP09 shadow server — highest priority in 2026
  • CSA OAuth 2.1·RFC 8414·tool-scope checklist maps to MCP07/MCP01
원본 →
AI 코딩 도구

Pipelock — open-source agent firewall, MCP runtime bidirectional scan

Pipelock(luckyPipewrench/pipelock·Apache-2.0)는 AI agent egress firewall — HTTP·WebSocket·MCP traffic inline inspect. mcp proxy subcommand으로 stdio/HTTP MCP server wrap — tools/list description poisoning scan·SHA-256 fingerprint rug-pull detect·tools/call args 62 credential pattern·response 29 injection pattern 6-pass normalization. fail-closed default — scanner error→block. OWASP MCP Top 10 MCP03/MCP05/MCP10 runtime coverage. Snyk Agent Scan(pre-deploy static) ·Permit MCP Gateway(auth proxy)와 3-layer — install scan→runtime proxy→gateway policy. SARIF v2.1.0 GitHub Code Scanning·MITRE ATLAS mapping.

  • pipelock mcp proxy — bidirectional MCP frame scan, rug-pull hash drift
  • 6-pass injection normalization — base64·leetspeak·whitespace evasion catch
  • Pre-deploy + runtime pair — static scan alone misses live-only attacks
원본 →
AI 코딩 도구

Promptfoo — YAML red team CI, MCP plugin·50+ vulnerability scan

Promptfoo(promptfoo/promptfoo·MIT·OpenAI 인수·OSS 유지)는 LLM eval+red team CLI — promptfooconfig.yaml declarative, GitHub Actions merge gate. redteam plugins: mcp(tool poisoning·unauthorized discovery)·pii·bfla·bola·sql-injection·40+ strategies jailbreak/best-of-n. MCP provider config로 agent가 실제 tool call하는 redteam-mcp-agent scenario. DeepEval(pytest metric gate) ·Giskard(adversarial probe)와 complement — Promptfoo=adversarial/security CI, DeepEval=quality metric CI. promptfoo redteam run — generate+eval shortcut, --tag for CI traceability.

  • mcp redteam plugin — OWASP Agentic AI aligned MCP-specific attack vectors
  • Dual CI pattern — Promptfoo security gate + DeepEval quality gate
  • YAML-first — multi-model compare·caching·concurrency·code scanning
원본 →
AI 코딩 도구

FastMCP — Python MCP server framework, 70% servers·Prefect Horizon deploy

FastMCP(jlowin/fastmcp·Prefect·v3.4·~1M/day downloads)는 production MCP server/client framework — @mcp.tool decorator→auto JSON schema·validation·OpenAPI/FastAPI generation·enterprise OAuth(Google·GitHub·Auth0). FastMCP 1.0은 official MCP Python SDK에 merge, standalone v3는 server composition·proxying·testing·client library. Prefect Horizon — GitHub branch preview deploy·private MCP registry·SSO·tool-level RBAC·audit. Smithery(registry) ·Arcade(auth runtime)와 달리 developer framework — MCP server를 Python function에서 production microservice로.

  • @mcp.tool — schema·validation·error handling auto, 70% MCP servers use FastMCP
  • Server composition·proxy·OpenAPI gen — beyond basic MCP SDK
  • Prefect Horizon — enterprise MCP gateway deploy from GitHub
원본 →
AI 코딩 도구

Logfire — Pydantic AI-native OTel observability, evals·MCP trace query

Logfire(pydantic/logfire·MIT SDK·~4k★)는 Pydantic 팀 AI observability — OTel-native, any OTLP backend portable. Pydantic AI built-in instrumentation — agent run·tool call·LLM span gen_ai.* compliant. SQL query interface·LLM cost tracking·online eval·pydantic-evals integration. Logfire MCP server — AI assistant가 trace query·error fix. Langfuse(OSS LLM obs) ·Datadog(full-stack APM)와 달리 Pydantic stack unified — Validation→Agent→Observability same team, code-first evals any Python function.

  • OTel-native — SDK portable to Jaeger/Tempo/Datadog, no lock-in
  • Pydantic AI auto-instrument — gen_ai semantic conventions built-in
  • Logfire MCP — query traces via MCP for AI-assisted debugging
원본 →
AI 코딩 도구

AG-UI Protocol — agent-frontend event stream, MCP/A2A와 축 분리

AG-UI(ag-ui-protocol/ag-ui·CopilotKit·MIT·~1k★)는 agent-user interaction open protocol — HTTP POST→SSE JSON event stream(TEXT_MESSAGE_CONTENT·TOOL_CALL_START·STATE_DELTA·lifecycle). JSON Patch state sync — agent·frontend bidirectional shared state. LangGraph·CrewAI·Mastra·Microsoft Agent Framework integration. MCP=tool/context layer ·A2A=agent-to-agent ·AG-UI=agent-to-user "last mile". CopilotKit useAgent hook·HttpAgent client — vendor-neutral frontend, backend agent swap without UI rewrite.

  • Event types — message·tool call·state delta·lifecycle standardized
  • MCP vs A2A vs AG-UI — tools vs agent mesh vs user interface
  • JSON Patch state — real-time agent-frontend collaborative sync
원본 →
AI 코딩 도구

LangMem — LangGraph native memory SDK, hot-path tools·background manager

LangMem(langchain-ai/langmem)는 LangGraph ecosystem official long-term memory SDK — create_manage_memory_tool·create_search_memory_tool로 agent가 conversation 중 memory record/search. Background memory manager — extract·consolidate·update 자동. LangGraph Platform Long-term Memory Store native integration·AsyncPostgresStore production persist. Mem0(drop-in API·hybrid vector+graph) ·Cognee(graph-native)와 달리 LangGraph-first — checkpointer+BaseStore 위 memory logic, framework lock-in tradeoff.

  • Hot-path memory tools — agent explicitly manage/search during conversation
  • Background manager — auto extract·consolidate without agent tool call
  • LangGraph Store native — Platform deployment default LTM backend
원본 →
AI 코딩 도구

Supermemory — #1 LongMemEval context stack, memory+RAG+connectors API

Supermemory(supermemoryai/supermemory·~#1 LongMemEval·LoCoMo·ConvoMem)는 unified context layer — memory(fact extraction·contradiction·expiry)+RAG+user profile+connectors+file processing single API. Browser extension·MCP server·self-host(`supermemory start` localhost:6767). Vercel AI SDK·LangGraph·OpenAI Agents SDK·Mastra integration. Mem0(drop-in layer) ·memoryx(compression)와 달리 full context stack — "memory is not RAG" thesis, fact temporal supersede vs document chunk retrieval.

  • 5-layer context — memory·RAG·profile·connectors·files one system
  • Temporal fact tracking — "moved to SF" supersedes "live in NYC"
  • Self-host + MCP — local Ollama, data never leaves machine option
원본 →
AI 코딩 도구

OpenAI Agents SDK — SandboxAgent·handoffs·guardrails, harness/compute split

OpenAI Agents SDK(openai-agents-python·~27k★·MIT)는 production multi-agent framework — Agent+Runner minimal primitive, provider-agnostic(Responses API default). SandboxAgent(v0.14+) — harness(control plane: loop·handoffs·approvals·tracing) vs compute(sandbox: files·shell·manifest·capabilities) 분리. Handoffs(specialist owns reply) vs agents-as-tools(manager retains control). input/output guardrails parallel validation·RunState serialize→human review→resume. LangGraph(state machine) ·Pydantic AI(type-safe)와 달리 OpenAI-native·SandboxAgent workspace lifecycle·MCP server integration.

  • SandboxAgent — Manifest+Capabilities, harness owns loop sandbox owns FS/shell
  • Handoffs vs as_tool — ownership transfer vs nested bounded task
  • Guardrails+RunState — parallel validation, serialize for HITL resume
원본 →
AI 코딩 도구

Hermes Agent — Nous Research self-improving agent, skills learning loop·6 terminal backend

Hermes Agent(NousResearch/hermes-agent·MIT·~165k★)는 Nous Research의 self-improving open-source autonomous agent다. closed learning loop — complex task 완료 후 SKILL.md skill 자동 생성·use 중 self-improve·FTS5 cross-session recall·Honcho dialectic user modeling. agentskills.io 표준 호환·Skills Hub community install. 6 terminal backend — local·Docker·SSH·Singularity·Modal·Daytona(serverless hibernate/wake). Messaging gateway — Telegram·Discord·Slack·WhatsApp·Signal single process. Atropos trajectory export·RL training pipeline. OpenHands(IDE copilot) ·OpenAI Agents SDK(harness framework)와 달리 persistent VPS agent·skill authoring from experience 축.

  • Learning loop — auto skill creation·improvement·FTS5 recall·Honcho dialectic
  • 6 backends — Modal/Daytona serverless persistence, messaging gateway multi-platform
  • Research-ready — Atropos batch trajectory·RL fine-tuning export pipeline
원본 →
AI 코딩 도구

codebase-memory-mcp — tree-sitter knowledge graph MCP, 120x token 절약·14 tools

codebase-memory-mcp(DeusData/codebase-memory-mcp·MIT)는 AI coding agent용 structural code intelligence MCP server다. tree-sitter AST 159 languages→persistent knowledge graph(function·class·call chain·HTTP route·cross-service link). 14 MCP tools — search_graph·trace_call_path·detect_changes(git diff risk)·query_graph(Cypher-like)·semantic_query(on-device embedding). avg repo ms-index·Linux kernel 28M LOC 3min·query <1ms. single static C binary zero dependency·100% local. mcp-codemap(progressive fold) ·trace-mcp(framework graph) ·Aider repo map(ranking)와 달리 full graph+semantic+impact analysis — arXiv eval 83% quality at 10x fewer tokens.

  • 14 tools — trace_call_path·detect_changes·semantic_query·manage_adr
  • 159 languages tree-sitter — static C binary, 11 agents one-command install
  • vs mcp-codemap — full graph query vs progressive fold, complementary axes
원본 →
AI 코딩 도구

mcp-devtools — Chrome DevTools for MCP, proxy·replay·diff·token cost

mcp-devtools(adityachilka1/mcp-devtools·MIT)는 MCP protocol-level inspector·profiler다. MCP client→proxy→real server 사이에 끼워 모든 JSON-RPC stream을 browser UI timeline으로 capture. tools/call input schema validation·latency histogram·LLM-attributed token cost·error grouping. replay — past call args edit→re-run→response diff. time-travel slider·`.mcptrace` export·stdio+streamable HTTP. MCP Inspector(official capability test) ·Logfire(production trace)와 달리 local-first session debug·cost attribution·replay without re-prompting agent.

  • Proxy recorder — initialize/tools/list/call/resources timeline in browser
  • Replay+diff — edit args, re-hit upstream, compare original response
  • Local-only — no telemetry leaves machine, MIT self-hostable
원본 →
AI 코딩 도구

OpenSandbox — Alibaba Apache-2.0 agent sandbox, Docker/K8s·credential vault

OpenSandbox(opensandbox-group/OpenSandbox·Apache-2.0·~11.5k★)는 general-purpose AI agent sandbox platform이다. multi-language SDK(Python·Go·Kotlin·C#·TS·Java)·unified lifecycle API·Docker(local dev)+Kubernetes(production) dual runtime. Ingress Gateway routing·per-sandbox egress control·Credential Vault(secret injection without exposing to workload). gVisor·Kata·Firecracker secure runtime option. Blaxel(perpetual standby) ·Cloudflare Sandbox SDK(edge) ·mcp-sandboxd(identifier)와 달리 enterprise K8s scale+credential vault+network policy 통합 OSS stack.

  • Dual runtime — Docker dev, K8s prod, same API surface
  • Credential Vault — outbound request secret injection, workload never sees raw key
  • Network policy — Ingress Gateway+egress controls, gVisor/Kata/Firecracker option
원본 →
AI 코딩 도구

CubeSandbox — Tencent KVM dedicated-kernel sandbox, E2B SDK compatible·sub-60ms

CubeSandbox(TencentCloud/CubeSandbox·Apache-2.0·~6.5k★)는 RustVMM+KVM hardware-level isolation sandbox다. dedicated Guest OS kernel per agent — Docker namespace escape risk 제거. sub-60ms boot·<5MB memory overhead·E2B SDK compatible(URL swap migration). CubeVS eBPF virtual switch network isolation·CubeHypervisor KVM layer. single-node→multi-node cluster. E2B(Firecracker managed cloud) ·Microsandbox(libkrun self-host) ·OpenSandbox(K8s orchestration)와 달리 dedicated kernel per VM·E2B migration path·Tencent cloud scale.

  • Dedicated kernel — not shared-kernel container, LLM-generated code safe boundary
  • E2B SDK compatible — swap endpoint for seamless migration
  • sub-60ms boot — RustVMM+KVM, CubeVS eBPF network policy
원본 →
AI 코딩 도구

Microsandbox — libkrun self-host microVM, secrets never enter VM·MCP server

Microsandbox(superradcompany/microsandbox·Apache-2.0·~6.6k★)는 self-hosted hardware-isolated microVM sandbox다. libkrun embeds KVM(Linux)/Hypervisor.framework(Apple Silicon) — sub-100ms boot·no daemon·OCI image compatible·rootless. secrets placeholder injection — API key never enters guest VM. network policy public-only/allow-all/airgapped·DNS domain block·HTTPS inspection. Agent Skills+npx skills add·microsandbox-mcp MCP server(lifecycle·exec·filesystem). E2B(managed cloud) ·Daytona(persistent managed) ·Blaxel(25ms resume cloud)와 달리 embeddable self-host microVM·Apache-2.0 no copyleft.

  • libkrun microVM — own Linux kernel, sub-100ms, no long-running daemon
  • Secrets can't leak — guest sees placeholder, host injects on outbound
  • Agent-ready — Skills package+MCP server for Claude Code·Cursor·Codex
원본 →
AI 코딩 도구

Confident AI — DeepEval cloud platform, trace→dataset→CI eval·red team

Confident AI(confident-ai.com)는 DeepEval OSS framework 위의 AI quality platform이다. production trace→auto test case·dataset curation·50+ research-backed metrics(G-Eval·DAG·QAG)·multi-turn agent simulation·span-level tool call scoring. PM/QA no-code annotation·red team vulnerability scan·PDF compliance report. DeepEval(pytest local CI) ·Braintrust(eval SaaS) ·Promptfoo(adversarial YAML)와 달리 DeepEval-native cloud — trace ingestion·online monitoring·eval gate in one platform. DeepEval Apache-2.0 독립 유지·Confident AI cloud optional.

  • Trace→dataset — production failure auto-categorize→golden test set
  • 50+ metrics — tool selection·planning·step faithfulness agent-specific
  • DeepEval CI gate — pytest integration, threshold fail blocks deploy
원본 →
AI 코딩 도구

Deepchecks Agent Evaluation — session-level swarm SLM judges·BFCL benchmark

Deepchecks Agent Evaluation(deepchecks.com/agentic-evaluation)는 tool-calling agent end-to-end validation platform이다. session(interaction sequence) 단위 scoring — planning·action·response 전체 workflow를 하나의 평가 단위로. swarm of evaluation agents — hallucination·planning accuracy·rule-based SLM experts Mixture-of-Experts. BFCL·xLAM augmented benchmark dataset·version A/B compare·auto-scoring pipeline. DeepEval(pytest metric library) ·Promptfoo(red team CI) ·Confident AI(DeepEval cloud)와 달리 session-level MoE judge·enterprise VPC/on-prem deployment heritage.

  • Session scoring — multi-step workflow not single-turn, version A/B compare
  • Swarm SLM judges — hallucination·planning·rule experts MoE ensemble
  • BFCL/xLAM benchmark — augmented corruption dataset for tool-call eval
원본 →
AI 코딩 도구

Honcho — dialectic reasoning memory, peer representation·formal logic inference

Honcho(plastic-labs/honcho·MIT)는 AI-native memory infrastructure for stateful agents다. RAG chunk retrieval이 아니라 formal logic reasoning engine — message→background multi-pass conclusion→peer representation. Workspace·Peer(user/agent/group)·Session·Message model. 5 tools — honcho_profile·honcho_search·honcho_context(dialectic Q&A)·honcho_conclude(writeback). cadence·depth·reasoningLevel 3 knobs. Hermes Agent integration·MCP·Claude Code·OpenCode. Mem0(drop-in API) ·Supermemory(context stack) ·LangMem(LangGraph hot-path)와 달리 dialectic user modeling·inductive/abductive inference·peer-centric not document-centric.

  • Dialectic reasoning — multi-pass formal logic, not semantic chunk match
  • Peer model — user·agent·group representation changes over time
  • Hermes integration — recallMode hybrid, dialecticCadence·contextCadence knobs
원본 →
AI 코딩 도구

MCP Inspector — official MCP debug UI+CLI, stdio·SSE·HTTP transport

MCP Inspector(modelcontextprotocol/inspector·MIT)는 MCP 공식 interactive debug tool이다. npx @modelcontextprotocol/inspector — stdio·SSE·streamable HTTP transport connect. UI Mode — Tools/Resources/Prompts tab·form-based param input·real-time JSON-RPC notification·request history. CLI Mode — CI/scriptable tools/list·tools/call JSON output·Cursor feedback loop integration. mcp-devtools(session replay·cost) ·FastMCP(server framework) ·Smithery(registry)와 달리 protocol conformance test·capability negotiation verify first step before client integration.

  • UI+CLI dual mode — interactive dev vs CI automation same server
  • Transport — stdio local·SSE·streamable HTTP remote OAuth server
  • Debug workflow — connectivity→capability→edge case→client integration order
원본 →
AI 코딩 도구

Codex 경제 리서치 — 에이전트 작업은 '질문 수'보다 위임 시간으로 봐야 한다

OpenAI의 2026년 6월 경제 리서치는 Codex 사용을 단순 채팅 횟수가 아니라 "사람이 했다면 걸렸을 작업 시간"으로 해석한다. 핵심 신호는 짧은 답변보다 장기 위임이다. 2026년 5월 기준 표본 개인 사용자의 80.6%가 30분 초과 작업, 70.2%가 1시간 초과 작업, 25.6%가 8시간 초과 작업으로 추정되는 Codex 요청을 최소 1번 보냈다. OpenAI 내부에서도 Codex는 엔지니어링을 넘어 법무·재무·리크루팅까지 주 도구가 됐고, 2026년 6월 99퍼센타일 활성 사용자는 하루 60시간이 넘는 병렬 에이전트 턴을 만들었다. 단, 작업 시간은 transcript를 본 LLM 판정이고 개인 사용자 0.1% 표본 기반이라 정밀 KPI가 아니라 방향 신호로 읽어야 한다. 실무 교훈은 에이전트 도입 지표를 "프롬프트 몇 번"이 아니라 장기 작업 위임, 병렬 세션, 검증 가능한 산출물로 잡아야 한다는 점이다.

  • 2026-05 표본 개인 사용자 기준 30분+ 80.6%, 1시간+ 70.2%, 8시간+ 25.6%가 장기 Codex 요청을 최소 1회 보냄
  • OpenAI 내부는 엔지니어링뿐 아니라 법무·재무·리크루팅도 Codex를 주 도구로 사용, 99퍼센타일은 하루 60시간+ 병렬 에이전트 턴
  • 수치는 LLM-as-judge와 0.1% 표본 기반 방향 신호 — 운영 KPI는 위임 시간+검증 산출물+리뷰 통과율로 설계
원본 →
AI 코딩 도구

gstack — Garry Tan YC CEO 23-role slash-command sprint, /office-hours→/ship→/cso

gstack(garrytan/gstack·MIT·~108k★)는 Y Combinator CEO Garry Tan이 공개한 Claude Code skill pack — 23+ opinionated slash command가 Think→Plan→Build→Review→Test→Ship→Reflect sprint loop를 role persona로 강제한다. /office-hours(product scoping) → /plan-ceo-review·/plan-eng-review·/plan-design-review → /review(staff engineer) → /qa(real Chromium browser) → /cso(OWASP+STRIDE·confidence 8/10 gate) → /ship(PR). gbrain cross-session decision memory·10-agent adapter(Codex·Cursor·OpenCode·Hermes·OpenClaw). Superpowers(TDD-first rigid pipeline) ·Citadel(worktree fleet plugin)와 달리 opt-in role-based sprint·real browser QA·security audit 내장.

  • 23 roles — CEO·Eng Manager·Designer·Staff Engineer·QA·CSO·Release Engineer slash commands
  • /browse real Chromium ~100ms ·/cso OWASP+STRIDE 17 false-positive exclusions
  • 10-agent adapter — Claude Code·Codex·Cursor·OpenCode·Hermes·OpenClaw auto-detect setup
원본 →
AI 코딩 도구

Paperclip — AI agent org chart control plane, heartbeat·budget·atomic checkout

Paperclip(paperclipai/paperclip·MIT·~71k★)는 self-hosted AI agent team orchestration control plane — Jira/Linear처럼 보이지만 org chart·budget·governance·audit log가 핵심이다. Agent=role+title+reporting line+budget, adapter로 Claude Code·Codex·Cursor·OpenClaw·HTTP bot 연결. Heartbeat execution — agent는 continuous loop가 아니라 timer/assignment/on_demand wakeup window에서 실행, cost event·token usage 기록. Atomic task checkout — 이슈 1개=1 agent lock, chain-of-command escalation. Vibe Kanban(worktree GUI) ·Citadel(plugin harness) ·Conductor(local ADE)와 달리 enterprise org simulation·board approval·16 company templates.

  • Control plane not framework — identity·scheduling·budget·audit owned, agent loop=adapter black box
  • Heartbeat — timer·assignment·on_demand wakeup, orphaned run recovery, no runaway cost
  • Atomic checkout — task ownership lock, hierarchical issue chain, MIT self-host embedded Postgres
원본 →
AI 코딩 도구

jcodemunch-mcp — GitHub AST symbol retrieval MCP, 95%+ token 절약·blast-radius

jcodemunch-mcp(jgravelle/jcodemunch-mcp·~1.9k★)는 tree-sitter AST 기반 GitHub source code retrieval MCP server다. repo 전체 file dump 대신 symbol-level precise fetch — importance ranking·cross-language symbol map·10 preset anti-pattern detector·schema/contract diff. 313B+ tokens saved claim·Claude Code·Cursor·Codex·Windsurf·Goose·Paperclip 호환. codebase-memory-mcp(local knowledge graph·14 tools·159 lang) ·mcp-codemap(progressive fold) ·Aider repo map(ranking)와 달리 remote GitHub-first·symbol blast-radius analysis·contract/schema diff 축.

  • Symbol-level AST — 95%+ token cut vs full-file read, importance ranking+anti-pattern scan
  • GitHub-native — remote repo indexing, cross-language symbol map, schema diff
  • vs codebase-memory-mcp — cloud GitHub retrieval vs local full graph, complementary axes
원본 →
AI 코딩 도구

Orca — Stably ADE, parallel worktree fleet·CLI scriptable·mobile companion

Orca(stablyai/orca·MIT·~7k★)는 Agent Development Environment — Claude Code·Codex·OpenCode·Cursor CLI·Hermes·Pi 등 25+ agent를 git worktree별 isolated workspace에서 side-by-side 실행. Fan one prompt across 5 agents→compare diffs→merge winner. Ghostty-inspired WebGL terminal·built-in file editor·Annotate AI Diff inline comment→agent feedback·`orca worktree create`·`snapshot`·`click` CLI. Desktop(macOS·Windows·Linux)+iOS/Android mobile companion·SSH remote worktree. Conductor(mac-only) ·Vibe Kanban(sunsetting) ·Cursor Agents Window과 달리 cross-platform ADE·agent-drives-Orca automation·Computer Use mode.

  • Parallel worktrees — same prompt 3 agents 3 branches, split pane watch, pick winner merge
  • CLI scriptable — orca worktree create/snapshot/click/fill, agent can drive Orca workflows
  • 25+ agents BYO-subscription — Claude·Codex·Cursor·OpenCode·Hermes·Pi preconfigured
원본 →
AI 코딩 도구

Hunk — review-first terminal diff viewer, agent live session comment API

Hunk(modem-dev/hunk·~5k★)는 agent-authored changeset review-first terminal diff viewer다. OpenTUI+Pierre diffs — multi-file sidebar·split/stack layout·syntax highlight·watch mode. Agent integration — `hunk session review --json`로 structure inspect, `hunk session comment add`로 live TUI에 inline annotation, SKILL.md bundled. delta/difftastic(structural) ·Lumen(review UI) ·IDE diff와 달리 agent↔human review loop — developer reads diff, agent posts rationale inline without leaving terminal. `--agent-context` JSON sidecar for batch notes.

  • Live session API — hunk session list/review/navigate/comment, agent never runs interactive hunk diff
  • Inline agent annotations — comment beside code in open TUI, batch apply via stdin JSON
  • Review-first — multi-file stream+sidebar, mouse+keyboard, vs pager-only delta/difftastic
원본 →
AI 코딩 도구

DeerFlow 2.0 — ByteDance LangGraph SuperAgent harness, sandbox·subagent·skills

DeerFlow 2.0(bytedance/deer-flow·MIT·~70k★)는 v1 deep-research와 code 공유 없는 ground-up rewrite SuperAgent harness다. LangGraph+LangChain — sub-agent spawn·persistent memory·extensible skills·message gateway로 minutes-to-hours long-horizon task. Sandbox 3 mode — Local(host dir·bash disabled default) ·Docker AIO(headless Chromium+bash+pip) ·K8s provisioner(production pod). Virtual path /mnt/user-data/{workspace,uploads,outputs}·/mnt/skills·thread-isolated filesystem. OpenHands(IDE copilot) ·OpenAI Agents SDK(harness/compute split) ·Hermes(persistent VPS)와 달리 batteries-included research+coding+create stack·Docker-first isolation default.

  • SuperAgent harness — subagents·memory·skills·sandbox out-of-box, not framework wiring
  • AIO Docker sandbox — Chromium+bash+filesystem per thread, K8s production option
  • Virtual paths — /mnt/user-data·/mnt/skills, str_replace per-sandbox file lock
원본 →
AI 코딩 도구

CC Switch — 7 CLI agent config hub, MCP·Skills·provider hot-swap

CC Switch(farion1231/cc-switch·MIT·~104k★)는 Claude Code·Codex·Gemini CLI·OpenCode·OpenClaw·Hermes·Claude Desktop 설정을 하나의 Tauri 2 desktop app에서 관리한다. 50+ provider preset one-click import·system tray hot-swap(Claude Code restart 불필요) ·unified MCP panel(bidirectional sync Claude+Codex+Gemini+OpenCode) ·Skills GitHub one-click install·local Axum proxy(API format translation·failover·circuit breaker) ·WebDAV multi-device sync. ccusage(CLI cost analytics) ·manual JSON/TOML edit과 달리 visual config SSOT·atomic SQLite write·ccswitch:// deep link import.

  • 7 tools one app — provider+MCP+Skills+prompt, 50+ preset, tray instant switch
  • Unified MCP — edit once sync all enabled apps, per-app enable/disable toggle
  • Local proxy — OpenAI-compatible→Claude format, failover+circuit breaker+cost tracking
원본 →
AI 코딩 도구

Loop Engineering — Addy Osmani·Cherny, prompt 대신 agent가 agent를 돌리는 loop 설계

Loop Engineering(Addy Osmani·2026-06)는 "프롬프트하는 사람"을 "loop를 설계하는 사람"으로 바꾸는 방법론 — recursive goal에 AI가 iterate until complete. Claude Code creator Boris Cherny(Meta @Scale·2026-06-19)는 "agents prompting agents"를 source code→agent만큼 큰 단계로 — hand-written code→agent writes code→agents prompt agents that write code. Cherny 내부 setup — architecture improvement agent·dedup abstraction agent가 PR을 계속 제출, codebase가 변하므로 stop condition 없음; 종료는 subagent가 non-deterministic하게 판단(Ralph Loop·Continuous Claude와 같은 CS recursive loop의 AI판). 5 primitive — Automations(cron·Codex Automations·Claude /loop·Cursor /loop) ·Worktrees ·Skills ·MCP ·Sub-agents. External spine(MEMORY.md·state JSON)·circuit breaker(max-cost·max-turns) 필수. Dynamic Workflows(ultracode batch spawn) ·Agent Teams(in-session chat)와 달리 always-on background cadence+token budget policy.

  • Cherny @Scale — loops as big as hand-code→agents; non-deterministic stop via subagent
  • 5 primitives + memory spine — Automations·Worktrees·Skills·MCP·Sub-agents
  • Loop policy — which tasks loop-safe, max token spend, audit/rollback when verifier misses
원본 →
AI 코딩 도구

Praxia — 5-layer memory stack, personal tacit→org know-how auto promotion

Praxia(praxia-dev/praxia·Apache-2.0)는 multi-agent orchestrator with cyclic memory — L1 Personal(auto-extract·6 backend Mem0/Letta/Zep/HindSight/LangMem/JSON) → L2 Sleep-time Consolidator(3-path promotion frequency+outcome+LLM self-eval) → L3 SharedMemory(org blocks·RBAC) → L4 MarkdownStore(git PR-reviewed frozen) → L5 Graph(optional Zep/Graphiti). CompositeBackend(RRF fusion) ·RoutedBackend(query-aware dispatch). Honcho(dialectic peer) ·Mem0(drop-in API) ·Cognee(graph-native)와 달리 personal→org promotion engine·skill registry promotion·SSO+RBAC+audit enterprise stack.

  • 3-path promotion — frequency·outcome correlation·LLM self-eval parallel, nightly batch
  • 6 LTM backends — Mem0·Letta·Zep·HindSight·LangMem·JSON, Composite/Routed fusion
  • L4 frozen layer — git Markdown PR-reviewed immutable, portable exit no vendor lock
원본 →
AI 코딩 도구

MarkItDown MCP — Microsoft AutoGen PDF·Office→Markdown boundary, convert_to_markdown(uri)

MarkItDown(microsoft/markitdown·MIT·~156k★)는 AutoGen team의 lightweight document→Markdown converter — PDF·DOCX·PPTX·XLSX·HTML·image 등 15+ format, heading·table·list structure preserve. Agent boundary pattern — raw file/token-heavy markup 대신 LLM-native Markdown(~62% token reduction reported). markitdown-mcp — single tool convert_to_markdown(uri) for http/https/file/data URI, Claude Desktop·agent mid-conversation on-demand. Unstructured(enterprise ETL·64+ format·canonical JSON) ·Docling(table accuracy) ·Crawl4AI(web)와 달리 zero-GPU fast prototype·MCP one-tool minimal surface·AutoGen ecosystem default.

  • convert_to_markdown(uri) — one MCP tool, agent converts on-demand not pre-process pipeline
  • Structure preserve — headings·tables·links as Markdown, LLM-native token-efficient
  • vs Unstructured — lightweight OSS boundary vs enterprise connector+JSON ETL platform
원본 →
AI 코딩 도구

Claude Fable 5 — SWE-bench Pro 80.3%·6/12 전면 중단, Opus 4.8이 fallback

Claude Fable 5(anthropic·2026-06-09 GA)는 Mythos-class 첫 공개 모델 — SWE-bench Verified 95.0%·SWE-bench Pro 80.3%·Terminal-Bench 2.1 83.1%·DeepSWE

  • 6/9~6/12 3일 GA — 95% Verified·80.3% Pro·83.1% Terminal-Bench, 6/12 worldwide suspend
  • Opus 4.8 fallback — daily coding OK, long-horizon autonomous gap remains
  • Open alternatives — Kimi K2.7-Code·GLM-5.2 MIT weights, near-Fable on coding axes
원본 →
AI 코딩 도구

Kimi K2.7 Code — 1T MoE·32B active·256K·Modified MIT open-weight coding agent

Kimi K2.7 Code(moonshotai/Kimi-K2.7-Code·2026-06-12)는 Moonshot AI coding-focused agentic model — 1T total·32B active MoE·256K ctx·Modified MIT weights on HuggingFace. K2.6 대비 reasoning token ~30% 절감·long-horizon coding task success rate↑. thinking mode mandatory(disabled 불가) — multi-step tool call·repo-scale engineering. Kimi Code platform default·API kimi-k2.7-code·highspeed 180 tok/s. vLLM·SGLang·KTransformers self-host(~595GB). Claude Fable 5 중단 후 open-weight coding 대안 — Kimi Code Bench v2 62.0 vs Opus 4.8 67.4·MCP Atlas 76.0.

  • 1T MoE 32B active — 256K ctx, mandatory thinking, Modified MIT open weights
  • 30% fewer reasoning tokens vs K2.6 — long-horizon end-to-end task success↑
  • Self-host or API — vLLM/SGLang, Kimi Code default, Fable 5 shutdown alternative
원본 →
AI 코딩 도구

GLM-5.2 — 753B MoE·1M ctx·MIT·SWE-bench Pro 62.1 GPT-5.5 초과

GLM-5.2(zai-org/GLM-5.2·2026-06-13)는 Zhipu/Z.ai flagship coding model — ~753B total·~40B active sparse MoE·1M ctx·128K max output·MIT license(no restriction). IndexShare sparse attention 2.9× FLOPs cut·MTP speculative decoding +20% acceptance. SWE-bench Pro 62.1(vs GPT-5.5 58.6)·Terminal-Bench 2.1 81.0·FrontierSWE 74.4. Anthropic-compatible API — Claude Code·OpenCode·Cline·Cursor base URL swap drop-in. ZCode desktop agent deep optimization·GLM Coding Plan 3× peak quota. Qwen3-Coder-Next(local 3B active) ·Kimi K2.7(Modified MIT)와 달리 unrestricted MIT·1M repo dump single request.

  • MIT open weights — commercial·self-host·fine-tune unrestricted, BF16 ~1.51TB
  • 1M context — whole repo slice in one request, reasoning effort High/Max selectable
  • Claude Code drop-in — Anthropic-compatible API, 20+ coding environments base URL swap
원본 →
AI 코딩 도구

Junie GA — JetBrains AI coding agent, debugger MCP·ACP·BYOK·원격 제어

Junie(junie.jetbrains.com·2026-06-17 GA)는 JetBrains AI coding agent — beta 1년 만에 정식 전환. IDE+Junie CLI+CI/CD, ACP(Agent Client Protocol)로 IntelliJ·Android Studio deep integration — real debugger attach(breakpoint·runtime inspect)·semantic check·test run. Plan mode — requirements(EARS)→design→tasks 3-stage before code. Brave Mode auto-approve·Remote Control phone→desktop session steer·Custom Guidelines&Skills. BYOK Anthropic·OpenAI·Google·OpenRouter·Ollama local. Kiro(AWS spec-driven) ·Cursor(agent IDE) ·Claude Code(terminal)와 달리 JetBrains IDE native debugger MCP·Android Studio 공식 지원.

  • Debug mode — real IDE debugger MCP, not println — breakpoint·expression eval
  • ACP integration — IntelliJ 2026.1.1+ Debugger MCP Toolset, Android Studio
  • LLM-neutral — BYOK any provider, Remote Control async CLI+web monitor
원본 →
AI 코딩 도구

mcp-eval — MCP server+agent real-env eval, OpenTelemetry trace·pytest·LLM judge

mcp-eval(lastmile-ai/mcp-eval·mcpevals PyPI)는 MCP server와 agent를 mock 없이 real environment에서 테스트하는 eval framework — LLM/agent가 actual MCP tool call. OpenTelemetry trace가 source of truth — tool path·latency·token·error pattern. pytest·@task decorator·dataset 3 style·language agnostic(Python·TS·Go·Rust server 모두). Rich assertion — content check·tool verification·path efficiency·LLM judge·performance gate. mcp-agent 위 구축. Promptfoo(red team) ·DeepEval(metric pytest) ·MCP Inspector(conformance UI)와 달리 production-like agent↔server integration eval·CI regression.

  • No mocks — real agent→real MCP server, OTEL trace→metrics→assertions
  • 3 test styles — pytest·decorator·dataset, language-agnostic server
  • vs MCP Inspector — integration eval vs protocol debug UI, complementary
원본 →
AI 코딩 도구

mcptest — pytest for MCP agents, YAML mock server·trajectory assertion·regression diff

mcptest(josephgec/mcptest·mcp-agent-test PyPI)는 vendor-neutral MCP agent testing — "pytest for MCP agents". YAML fixture로 mock MCP server(tools·responses·error scenarios) 선언, agent를 isolation에서 실행, tool-call trajectory assert. 17 assertions(tool_called·param_matches·tool_order·error_handled) ·7 metrics(efficiency·redundancy·stability) ·regression baseline diff ·non-determinism retry(N runs ≥T% pass). mcptest capture — live server→auto fixture+test YAML. 6 fixture packs(GitHub·Slack·filesystem·DB·HTTP·git) ·19 MCP conformance checks. mcp-eval(real env) ·Galileo(acquired)와 달리 token-free YAML mock·trajectory-focused·CI badge.

  • YAML mock servers — no LLM tokens burned, real MCP stdio/SSE protocol
  • mcptest capture — auto-discover tools, sample responses, write fixture+test
  • Regression diff — prompt/model/server change→trajectory drift detect
원본 →
AI 코딩 도구

MCP-AgentBench — 33 MCP server·188 tool·600 query, MCP-Eval outcome judge

MCP-AgentBench(AAAI 2026·arXiv 2509.09734)는 MCP-mediated tool use를 평가하는 첫 대규모 벤치마크 — function-calling leaderboard가 못 잡는 protocol-driven real-world interaction. 33 operational MCP server·188 tool unified router·600 query 6 complexity category(single-server→multi-server sequential). MCP-Eval — outcome-oriented LLM-as-judge, execution path not scored(self-correction·multiple valid paths). Qwen3-235B·Kimi K2가 GPT-4o outperform 사례. MCP-Eval 91.7% human agreement. mcp-eval(production test) ·Promptfoo(red team) ·Terminal-Bench(shell env)와 달리 MCP protocol-specific agent capability benchmark.

  • 33 servers 188 tools — realistic MCP ecosystem, not isolated function call
  • Outcome judge — goal achieved regardless of path, 600 queries 6 complexity tiers
  • Open models competitive — Qwen3·Kimi K2 vs GPT-4o on MCP tasks
원본 →
AI 코딩 도구

FrontierCode — Cognition '머지할 PR인가' 벤치, Diamond 13.4%·maintainer rubric

FrontierCode(cognition.ai/blog/frontier-code·2026-06-08)는 '코드가 통과하는가'가 아니라 'maintainer가 merge할 PR인가'를 재는 벤치마크 — Cognition(Devin)이 36 flagship OSS repo maintainer 20+명과 공동 제작. 150 Extended·100 Main·50 Diamond nested subset, task당 40h+ maintainer effort. 6-axis rubric — correctness·regression safety·mechanical cleanliness·test quality·scope discipline·code quality, blocker fail→score 0. Reverse-Classical(test가 broken code에서 fail)·scope check·mutagent adaptive grading. Opus 4.8 Diamond 13.4%·Main 34.3%·Extended 51.8% — SWE-bench Pro 81% false positive rate vs FrontierCode QC. tasks private(contamination 방지).

  • Mergeability not pass — scope discipline·test quality·style, blocker=zero score
  • 81% fewer misclassification — vs SWE-bench Pro, maintainer-authored rubric
  • Unsaturated — Diamond best 13.4%, production-ready signal not correctness-only
원본 →
AI 코딩 도구

ZCode — Z.ai desktop ADE, long-horizon GLM-5.2·SSH remote·mobile Remote Control

ZCode(zcode.z.ai·2026-06-13 v3.0)는 Zhipu/Z.ai Agentic Development Environment — long-horizon multi-step task에 특화. in-house ZCode Agent core(Gen 3.0부터 third-party adapter deprecated) — files·terminal·browser·Git state single task continuity. GLM-5.2 deep optimization·GLM Start Plan 150% quota·/goal long-horizon. Remote Workspace SSH·Docker·WSL first-class·mobile Remote Control QR→desktop session steer·Feishu/WeChat Bot Channel. Zread auto project knowledge base·grouped task workspace·Git branch graph. Orca(cross-agent fleet) ·DeerFlow(LangGraph harness) ·Cursor(AI IDE)와 달리 GLM stack native ADE·mobile vibeworking.

  • Long-horizon native — plan→code→verify→review single task, context no mid-break
  • Remote SSH/Docker/WSL — same desktop UX on server/container, mobile steer
  • GLM-5.2 optimized — in-house agent, Coding Plan quota, /goal multi-hour tasks
원본 →
AI 코딩 도구

Claude Code plugin monitors·LSP·skills-dir·/plugin list — packaging·감시·인벤토리

Claude Code plugin v2.1.105+ experimental component — monitors(monitors/monitors.json)·LSP(.lsp.json)·skills-dir auto-discovery. Monitors — shell command persistent background, stdout→Claude notification. LSP — edit 후 type error·missing import diagnostic. skills-dir — ~/.claude/skills//.claude-plugin/plugin.json→@skills-dir install 없이 auto-load. v2.1.163 `/plugin list`·`claude plugin list` — installed plugin inline inventory, `--enabled`/`--disabled` filter, `/plugin` menu 없이 확인. `claude plugin details` — component inventory·projected per-session token cost·LSP server list. security-guidance ·Context7 ·official LSP 11 languages와 plugin packaging layer 완성.

  • Background monitors — log tail·build watcher auto-arm, plugin author ships watcher
  • LSP plugins — 11 languages, post-edit diagnostic·go-to-definition without agent ask
  • /plugin list — enabled/disabled filter, details pane token cost·LSP inventory
원본 →
AI 코딩 도구

Endor Labs Agent Security League — FuncPass 85%·SecPass 24%, AI 코드 보안 격차

Endor Labs Agent Security League(endorlabs.com/research/ai-code-security-benchmark)는 AI coding agent functional vs security correctness live leaderboard — CMU SusVibes 200 task·108 OSS Python·77 CWE extend. FuncPass(task test pass) vs SecPass(security test also pass) — Cursor+GPT-5.5 FuncPass 84.9%·SecPass 24.0% best security, gap ~60%p. Anti-cheating — prompt hardening·workspace sanitization·training recall detection(re-eval June 2026). Claude Fable 5 SecPass 29% peak before shutdown. DeepEval(metric) ·Snyk Agent Scan(static) ·OWASP MCP Top 10(protocol)와 달리 agent+model pair real-world vulnerability re-implementation eval.

  • FuncPass vs SecPass — works≠safe, best security 24% vs functional 85%
  • SusVibes 200 tasks — historical vuln fix re-implement, hidden security tests
  • Anti-cheating pipeline — workspace leak·patch recall detection, re-eval audit
원본 →
AI 코딩 도구

MCPMark Verified — 127 CRUD MCP task·5 server·gpt-5.5 92.9%·kimi-k2.7 81.1%

MCPMark(eval-sys/mcpmark·Apache-2.0·mcpmark.ai)는 MCP agent capability stress-test benchmark — read-heavy 기존 벤치와 달리 Notion·GitHub·Filesystem·Postgres·Playwright 5 environment에서 create/read/update/delete full workflow. 127 Verified task — version-pinned environment·stabilized verifier, programmatic auto-check·isolated sandbox·pass@k/pass^4. gpt-5.5(xhigh) 92.9%·kimi-k2.7 81.1% Verified set lead(June 2026). avg 16.2 turns·17.4 tool calls/task — shallow MCP benchmark 대비 depth stress. MCP-AgentBench(protocol query) ·mcp-eval(production pytest) ·mcptest(YAML mock)와 달리 multi-server CRUD realism·leaderboard.

  • 127 Verified — CRUD-heavy·5 MCP server, programmatic verifier·Docker isolation
  • Leaderboard June 2026 — gpt-5.5 92.9%·kimi-k2.7 81.1%, earlier numbers not comparable
  • vs MCP-AgentBench — tool-use depth·multi-env CRUD vs 33-server query outcome judge
원본 →
AI 코딩 도구

MOSAIC-Bench — innocent ticket 3-stage→exploitable code 53–86% ASR

MOSAIC-Bench(arXiv 2605.03952·mosaic-benchmark/mosaic-benchmark)는 compositional vulnerability induction benchmark — 199 oracle-backed 3-stage Jira-style ticket chain·10 web-app substrate(Express·Flask·Spring 등)·31 CWE·5 language. 각 ticket은 routine engineering request로 보이지만 compose하면 exploitable — production agent 53–86% end-to-end ASR, direct prompt same chain 0–20.4%(Claude refuse·Codex harden). context fragmentation·safety bypass alternative both fail — ticket staging silences defense reflex. AI reviewer 25.8% vulnerable diff approve. pentester-framed reviewer가 evasion 3–17.6%로↓. Endor(SusVibes single-task) ·SecureVibeBench(C/C++)와 달리 multi-ticket compositional insider threat.

  • 199 chains 3-stage — innocent ticket compose→PoC oracle VULNERABLE/SECURE
  • 53–86% staged vs 0–20% direct — defense reflex silenced by ticket decomposition
  • Reviewer blind spot — 25.8% approve vulnerable diff; pentester framing mitigates
원본 →
AI 코딩 도구

SecureVibeBench — ACL 2026·105 C/C++ task·SWE-C4.5 23.8% correct+secure

SecureVibeBench(iCSawyer/SecureVibeBench·ACL 2026 Main)는 secure vibe coding benchmark — OSS-Fuzz/ARVO 41 project 105 C/C++ memory-safety task. human developer가 vulnerability를 introduce한 real scenario reconstruct — agent에 same requirement 주고 same vuln repeat 여부 측정. multi-file edit·PoV dynamic oracle·SAST static check 3-layer eval. SWE-agent+Claude Sonnet 4.5 best 23.8% correct+secure(C-SEC). Endor(SusVibes Python 200 task) ·MOSAIC(ticket compose web) ·OWASP MCP(protocol)와 달리 C/C++ repo-scale·vulnerability introduction point aligned context.

  • 105 C/C++ tasks — reconstruct human vuln-intro scenario, not synthetic snippet
  • C-SEC metric — functional pass AND security pass(PoV+SAST), best 23.8%
  • vs SusVibes — same security gap axis, C/C++ multi-file·introduction-point aligned
원본 →
AI 코딩 도구

mcp-agent — MCP-native Python framework·Temporal durable·Effective Agents patterns

mcp-agent(lastmile-ai/mcp-agent·docs.mcp-agent.com)는 MCP protocol purpose-built agent framework — full MCP lifecycle(tools·resources·prompts·OAuth·sampling·elicitation)·Anthropic Building Effective Agents 패턴 composable(map-reduce·router·orchestrator-workers·evaluator-optimizer·swarm). execution_engine asyncio↔temporal config switch만으로 pause/resume·retry·human-in-the-loop·days-long workflow — workflow code 변경 없음. mcp-eval·MCPMark same org(lastmile/eval-sys). LangGraph(stateful graph) ·OpenAI Agents SDK(delegation) ·Microsoft Agent Framework(enterprise .NET)와 달리 MCP-native·Temporal durability first-class·Pythonic decorator.

  • MCP-native — any MCP server connect, lifecycle managed, no custom adapter
  • Temporal switch — execution_engine:temporal, same workflow code production durable
  • Effective Agents patterns — composable workflow decorator, mcp-eval integration
원본 →
AI 코딩 도구

CrewAI 1.14 — 54k★·MCPServerAdapter·~2B agent executions/12mo

CrewAI(crewAIInc/crewAI·MIT·54k+★)는 LangChain independent multi-agent Python framework — Crew(role-playing agent team)·Flow(event-driven workflow). v1.14 native MCP via crewai-tools MCPServerAdapter — Stdio/SSE/Streamable HTTP, context manager로 tool 1:1 map, Agent mcps DSL field shortcut. ~2 billion agent executions prior 12mo(May 2026). AgentExecutor default(CrewAgentExecutor deprecated)·pluggable memory/knowledge/rag backend·Snowflake Cortex LLM. Datadog trace mention과 달리 framework 자체 — Crew+Flow+MCP가 핵심. LangGraph(state machine) ·AutoGen(merged→Microsoft AF) ·OpenAI Agents SDK와 달리 role-based crew metaphor·MCP adapter built-in.

  • MCPServerAdapter — with context manager, stdio/SSE/HTTPS, tools 1:1 MCP server map
  • Crew vs Flow — collaborative autonomy vs event-driven single-LLM orchestration
  • 54k★·2B executions — production adoption signal, AgentExecutor migration v1.14
원본 →
AI 코딩 도구

Google ADK Java·Go 1.0 — 5-language agent SDK·A2A·YAML config·SAIF HITL

Google Agent Development Kit ADK Java·Go 1.0 GA(March 2026) — Python·TypeScript에 이어 Java·Go production-ready. Java 1.5.0(June 2026) — GoogleMapsTool·UrlContextTool·ContainerCodeExecutor·VertexAiCodeExecutor·plugin architecture·ToolConfirmation HITL·Firestore/Vertex session·native A2A cross-language. Go 1.0 — Retry-and-Reflect self-healing plugin·RequireConfirmation SAIF security·YAML agent config(adk CLI)·Sequential/Parallel/LoopAgents. adk.dev 5-language·Agent Runtime one-command Cloud deploy. ADK for Android(Gemini Nano) ·ADK long-running(state machine)와 달리 server-side multi-language GA milestone.

  • 5 languages GA — Python·TS·Java·Go·Kotlin, A2A cross-runtime agent collaboration
  • Go Retry-and-Reflect — tool error→model self-correct; RequireConfirmation HITL gate
  • YAML config parity — adk CLI run agent without Go/Java boilerplate per change
원본 →
AI 코딩 도구

/rewind — checkpoint undo·Summarize from here·/clear 후 세션 복구

Claude Code /rewind(v2.1.191+·Esc Esc)는 session checkpoint rollback — every prompt 후 file edit capture, menu에서 point 선택. Restore code+conversation(full fork)·Restore conversation only·Restore code only·Summarize from here(compress forward)·Summarize up to here(compress backward). /clear 직후 `/resume (previous session)` entry — v2.1.191+ same process 내 이전 세션 복구. bash command edit·manual outside edit·deleted file 미추적 — git은 permanent safety net. /compact(context free) ·/clear(fresh start) ·/branch(fork)와 complementary session management triad.

  • 5 modes — full rollback·code-only·conversation-only·summarize forward/backward
  • Wrong path fix — rewind to after file reads, re-prompt with learned constraint
  • /clear recovery — v2.1.191+ previous session resume from rewind menu top entry
원본 →
AI 코딩 도구

PostToolBatch hook — parallel tool batch 1회·additionalContext injection

Claude Code PostToolBatch hook — full parallel tool call batch resolve 후 next model call 전 1회 fire. PostToolUse(per-tool·concurrent N회)와 cardinality 차이 — batch-level dedup 없이 once-per-decision-cycle work. input tool_calls array full batch·matcher 없음(always fire). decision block(next model call halt)·hookSpecificOutput.additionalContext(next turn inject). Permission gating은 PreToolUse — PostToolBatch는 side effect 후 eval·aggregate·context inject. InstructionsLoaded(observability) ·Stop(turn end) ·PostToolUse(per-tool audit)와 batch boundary axis 분리.

  • Once per batch — parallel Read×5→1 hook not 5, aggregate result inject
  • additionalContext — batch summary to model next turn without per-tool dedup hack
  • PreToolUse for block — PostToolBatch after execution, block halts loop not single call
원본 →
AI 코딩 도구

InstructionsLoaded hook — CLAUDE.md·rules/*.md load audit·lazy nested trigger

Claude Code InstructionsLoaded hook(v2.1.69+) — CLAUDE.md·.claude/rules/*.md context load 시 fire. session_start eager load·nested_traversal(subdir CLAUDE.md)·path_glob_match(conditional paths)·include·compact re-load. payload file_path·memory_type(User/Project/Local/Managed)·load_reason·globs·trigger_file_path. decision control 없음 — block/modify 불가, observability-only async. compliance audit·instruction surface tracking·"어떤 rule이 언제 loaded" 디버그. SessionStart(before load) ·InstructionsLoaded(at load) ·PreCompact(before compress) lifecycle 분리.

  • Lazy load trigger — subdir navigate·path_glob_match·compact re-load each fire event
  • Observability-only — no block, audit/compliance/telemetry use case
  • vs SessionStart — reactive to actual loaded files not predictive injection
원본 →
AI 코딩 도구

requiredMinimumVersion·enforceAvailableModels — managed settings enterprise gate

Claude Code managed settings(v2.1.163–175) enterprise compliance — requiredMinimumVersion·requiredMaximumVersion approved version range, outside→startup exit·org update method 안내(claude update/doctor still work). enforceAvailableModels(v2.1.175+) — availableModels allowlist non-empty일 때 Default model picker도 allowlist 적용, tier default restricted→first allowed fallback. MDM·server-managed·managed-settings.json highest precedence·no merge override. minimumVersion(auto-update floor) vs requiredMinimumVersion(hard startup block) 구분. allowManagedHooksOnly ·modelOverrides Bedrock ARN과 함께 fleet governance stack.

  • Version range gate — requiredMin/Max, bad policy fail-open(strip invalid not block all)
  • enforceAvailableModels — Default option respects allowlist, v2.1.175+
  • Recovery preserved — claude update/install/doctor work below floor for self-fix
원본 →
AI 코딩 도구

continueOnBlock PostToolUse — rejection reason feed back·turn continue

Claude Code PostToolUse continueOnBlock(v2.1.142+) — PostToolUse hook rejection 시 turn end 대신 hook rejection reason을 Claude에 feed back하고 turn continue. PostToolUseFailure(tool error) ·PermissionDenied(retry:true) ·Stop(additionalContext)와 complementary — blocked tool result를 model이 read하고 alternate approach 시도. plugin hooks.json·user settings.json 동일. QA loop — hook rejects bad diff pattern→Claude revises same turn without user re-prompt. decision block without continueOnBlock — hard stop user intervention required.

  • Rejection→feedback loop — hook says no→reason in context→model retries same turn
  • vs Stop additionalContext — PostToolUse per-tool eval, continueOnBlock explicit config
  • Plugin authoring — quality gate without ending turn, reduce user re-prompt friction
원본 →
AI 코딩 도구

OASB — Open Agent Security Benchmark, 222 MITRE ATLAS scenario

OASB(opena2a-org/oasb·Apache-2.0·v0.3.2)는 AI agent runtime security product(EDR·guard·prompt scanner)를 평가하는 product-agnostic benchmark — agent 자체가 아니라 '보안 제품이 이 공격을 잡나'를 재는 MITRE ATT&CK Evaluations AI판. 222 standardized attack scenario(atomic·integration·baseline·E2E) — process spawn·network exfil·filesystem·MCP tool abuse·A2A trust·prompt injection 15 MITRE ATLAS technique. SecurityProductAdapter interface 구현→OASB_ADAPTER env→npm test→detection coverage scorecard. declared capability 없는 surface는 N/A penalize 안 함. HackMyAgent(agent pentest) ·Endor Agent Security League(agent code quality) ·OWASP MCP Top 10(protocol taxonomy)와 3축 — product eval vs agent pentest vs protocol checklist.

  • 222 scenario ·15 MITRE ATLAS ·SecurityProductAdapter plug-in
  • Product eval not agent eval — 'Does your EDR catch this exfiltration?'
  • OASB-1 compliance ·OASB-2 governance ·OASB Eval 3-module suite
원본 →
AI 코딩 도구

HackMyAgent — agent·MCP·skill pentest, 209 static·164 adversarial payload

HackMyAgent(opena2a-org/hackmyagent·Apache-2.0·npm hackmyagent)는 AI agent·skill·MCP server·A2A integration 보안 scanner+red-team toolkit. secure(own project CI)·check(pre-install trust)·red-team(adaptive attack)·attack(164 payload 16 category) 4 mode. 209 static check 44 category(7 AST analyzer) + 29 NanoMind semantic(ONNX 3M Mamba TME, first-run HF download) + --deep 20-probe behavioral simulation(skill declared vs actual behavior). passive/active/aggressive intensity tier. auto-fix with rollback. npx hackmyagent secure — OASB Eval(product benchmark)과 complement — HackMyAgent=pentest your agent, OASB=test your security product. opena2a-cli unified entry.

  • 209 static ·29 semantic ·164 adversarial ·--deep 20-probe behavior sim
  • secure/check/red-team/attack 4 mode — CI pre-install trust gate
  • vs OASB — agent pentest not security product eval
원본 →
AI 코딩 도구

MiniMax M3 — 428B MoE·1M ctx·MSA sparse·coding+multimodal open weights

MiniMax M3(2026-06·MiniMaxAI/MiniMax-M3·arXiv 2606.13392)는 coding+agentic+multimodal 3 frontier를 동시에 갖춘 첫 open-weight model — 428B total·23B active MoE·1M token context·image/video native input. MiniMax Sparse Attention(MSA) — 1M ctx에서 M2 대비 per-token compute 1/20·prefill 9×·decode 15× faster. bugfix·frontend/backend·long-horizon agentic benchmark frontier-level. HuggingFace weights·vLLM·SGLang·KTransformers self-host·MiniMax Code platform default. GLM-5.2(753B·MIT) ·Kimi K2.7 Code(1T MoE·256K)와 open-weight coding model 3축 — M3=multimodal+1M ctx+MSA efficiency.

  • 428B/23B active MoE ·1M ctx ·MSA sparse attention
  • Native multimodal step-0 training ·coding+agentic+cowork frontier
  • Open weights HF ·vLLM/SGLang ·MiniMax Code platform integration
원본 →
AI 코딩 도구

Codex subagents·spawn_agents_on_csv — explorer/worker·CSV fan-out batch

OpenAI Codex(2026-03+) subagent — built-in default·worker(implementation) ·explorer(read-heavy) + custom .codex/agents/ TOML project-scoped agent. /agent CLI thread switch·agents.max_threads(default 6) ·agents.max_depth(default 1) concurrency cap. spawn_agents_on_csv(experimental) — CSV row당 worker 1개 fan-out, {column} template instruction·output_schema JSON·report_agent_job_result 1회 필수·combined output CSV. max_concurrency·job_max_runtime_seconds control. map-reduce over spreadsheet — repo-wide component audit·batch review pattern. Claude Code git worktree parallel과 다른 축 — Codex=CSV-native batch orchestration.

  • Built-in default/worker/explorer + .codex/agents/ custom TOML
  • spawn_agents_on_csv — row-per-worker, template {column}, result CSV export
  • agents.max_threads·max_depth·job_max_runtime_seconds fleet control
원본 →
AI 코딩 도구

PermissionRequest·PermissionDenied hooks — auto-approve/deny·retry:true

Claude Code PermissionRequest hook — permission dialog 직전 1회, hookSpecificOutput decision allow/deny + updatedInput으로 승인과 동시에 command 수정 가능. PreToolUse(block before execute)와 complementary — PermissionRequest는 'dialog would appear' fallback point. PermissionDenied — auto mode classifier가 deny한 직후, {retry:true} return 시 model이 alternate approach 시도 가능. continueOnBlock(PostToolUse rejection loop) ·PreToolUse(exit 2 block) ·PermissionRequest(dialog intercept) 3-tier permission stack. Safe command auto-approve — npm run lint·git status prefix matcher pattern.

  • PermissionRequest — dialog intercept, allow/deny+updatedInput
  • PermissionDenied retry:true — classifier deny→model retry alternate
  • vs PreToolUse block ·continueOnBlock PostToolUse — 3-tier stack
원본 →
AI 코딩 도구

PostToolUseFailure hook — tool error observability·stderr to Claude

Claude Code PostToolUseFailure — tool call fail 직후(error_message·error_type in JSON input). block 불가(observability-only) — stderr를 Claude context에 inject. PostToolUse(success) ·PostToolUseFailure(error) ·continueOnBlock(rejection) ·PermissionDenied(retry) complementary error handling stack. plugin hooks.json·settings.json 동일. use case — failed test output capture→Claude reads error→fix same turn, MCP connection failure log→retry alternate server, lint failure→auto-format suggestion inject.

  • Fires after tool fails — error_message·error_type in stdin JSON
  • Observability-only — cannot block, stderr→Claude context
  • vs PostToolUse success ·continueOnBlock rejection — error path stack
원본 →
AI 코딩 도구

LangChain 1.0 — agent middleware·create_agent·LangGraph composable

LangChain 1.0(2025-10 GA)은 langchain 패키지 첫 stable major — agent loop에 middleware concept 도입, create_agent standard tool-calling architecture, provider-agnostic model integration. LangGraph 1.0과 동시 GA — LangChain=high-level agent(start fast), LangGraph=low-level graph(custom control), Deep Agents=opinionated harness(long-horizon). langgraph.prebuilt→langchain.agents migration — create_agent inside custom LangGraph node composable, lock-in 없음. LangSmith trace·eval·Deployment·Engine unified platform.

  • v1.0 GA 2025-10 — middleware·create_agent·provider agnostic
  • LangChain(high) + LangGraph(low) + Deep Agents(harness) stack
  • langgraph.prebuilt deprecated → langchain.agents
원본 →
AI 코딩 도구

UserPromptExpansion hook — slash command expand audit·block before Claude

Claude Code UserPromptExpansion — user-typed slash command이 full prompt로 expand된 직후·Claude process 직전. expansion result audit·block 가능(exit 2). UserPromptSubmit(raw user input)과 complementary — Submit=enter key, Expansion=slash→expanded text gate. custom slash command injection attack surface control — expanded prompt에 sensitive path·credential pattern detect→block. SessionStart predictive injection과 달리 reactive — actual expansion event only.

  • Fires after slash expand ·before Claude processes
  • Can block expansion — exit 2 or decision block
  • vs UserPromptSubmit(raw) ·SessionStart(predictive) — reactive gate
원본 →
AI 코딩 도구

North Mini Code — Cohere 30B-A3B MoE·256K·sovereign agentic coding

North Mini Code(CohereLabs/North-Mini-Code-1.0·2026-06-09·Apache-2.0)는 Cohere 첫 open-weight agentic coding model — 30B total·3B active MoE·256K ctx·64K max gen·1× H100 FP8/FP4 self-host. sub-agent orchestration·architecture mapping·code review·terminal task에 특화, multi-scaffold training으로 OpenCode 등 harness-agnostic. Artificial Analysis Coding Index 33.4 — Devstral Small 2·Nemotron 3 Super(120B) 초과 size class. throughput 2.8× Devstral Small 2 but 3× output token verbosity — pipeline cost model 필요. MiniMax M3(multimodal 1M) ·GLM-5.2(753B MIT)와 달리 sovereign·single-GPU deploy 축.

  • 30B-A3B MoE ·256K ctx ·Apache-2.0 ·1× H100 deploy
  • Agentic SFT+RLVR — sub-agent orchestration·terminal·code review
  • Sovereign tradeoff — on-prem control vs managed Fable 5 verbosity/cost
원본 →
AI 코딩 도구

Grok Build /goal — verify-until-done·GOAL.md·status/pause/resume

xAI Grok Build /goal(2026-06-22)는 long-running autonomous coding mode — single objective→plan·checklist·execute→verify(code review·webpage inspect·script run) until complete. /goal status·pause·resume·clear로 live steering. GOAL.md repo external memory — context compact across turns but objective survives. Subagent rounds implement+verify closed loop. SuperGrok·X Premium Plus required. Codex /goal(evidence contract·check_model) ·Claude Outcomes(rubric grader)와 3축 goal engineering — Grok=terminal-native verify loop.

  • Verify-until-done — code review·page inspect·script exec, not attempt-only
  • GOAL.md external state — objective·done definition·guardrails persist
  • vs Codex /goal ·Claude Outcomes — terminal checklist vs API rubric
원본 →
AI 코딩 도구

Codex /goal GA — evidence-based completion·maker-verifier check_model

OpenAI Codex /goal(2026-05-21 GA)는 durable thread-scoped objective — app·IDE·CLI 동일. /goal ·pause·resume·clear·4,000 char cap. completion은 model self-assess가 아니라 files·tests·benchmark·artifact evidence audit — maker-verifier separation, check_model(o4-mini default)이 별도 평가. config.toml goals.max_turns·timeout_minutes·job control. 100+ hour single goal 사례. Grok /goal(terminal verify) ·Claude Outcomes(rubric API)와 complementary — Codex=production Copilot harness evidence contract.

  • GA app·IDE·CLI — evidence audit before complete, not self-assess
  • check_model maker-verifier — writer≠grader, config.toml turn/timeout
  • Automations·worktree·subagents compose — hours-to-days objective
원본 →
AI 코딩 도구

Claude Managed Agents Outcomes — rubric grader·needs_revision loop

Claude Managed Agents Outcomes(public beta·managed-agents-2026-04-01) — user.define_outcome으로 deliverable description+rubric markdown, max_iterations(default 3·cap 20). 별도 grader agent가 writer reasoning 없이 artifact만 rubric 채점 — satisfied·needs_revision·max_iterations_reached·failed. span.outcome_evaluation_* telemetry. Codex /goal(evidence contract) ·Grok /goal(terminal verify)와 3축 — Outcomes=API rubric quality gate for hosted CMA sessions. Dreaming(cross-session memory) ·multi-agent orchestration과 compose.

  • define_outcome — description+rubric, grader separate context window
  • needs_revision loop — per-criterion pass/fail→writer retry
  • vs Codex /goal ·Grok /goal — API rubric vs CLI evidence vs terminal verify
원본 →
AI 코딩 도구

smolagents CodeAgent — HF code-first agent·MCP·sandbox·~28k★

smolagents(huggingface/smolagents·Apache-2.0·~28k★)는 barebones Python agent library — CodeAgent가 JSON tool call 대신 Python code snippet으로 action 실행(nesting·loop·if composable). ToolCallingAgent(JSON/text blob) alternative. ToolCollection.from_mcp(smolagents[mcp])·LangChain·Hub Space tool. Sandbox — Docker·E2B·Modal·Blaxel. model-agnostic — HF Inference·LiteLLM·Transformers·Ollama. ~1,000 LOC core. LangGraph(state graph) ·CrewAI(role crew)와 달리 minimal code-agent-first — quick prototype·HF ecosystem.

  • CodeAgent — actions as Python code not JSON tool blobs
  • smolagents[mcp] ToolCollection.from_mcp — MCP native integration
  • Sandbox Docker/E2B/Modal — secure code execution default path
원본 →
AI 코딩 도구

AA Coding Agent Index v1.1 — composite pass@1·per-task cost $0.07–$2.26·harness 16–19%

Artificial Analysis Coding Agent Index v1.1(June 2026) — agent harness+model composite pass@1 across 3 benchmarks(321 tasks). DeepSWE 113(long-horizon SE·contamination-free) replaces SWE-Bench-Pro-Hard-AA — Fable 5 77·Codex GPT-5.5 76·Opus 4.8 73. Terminal-Bench v2 84(agentic terminal). SWE-Atlas-QnA 124(repo Q&A rubric). May 2026 cost layer — same Opus 4.7 per-task $1.24(Claude Code) vs $1.47(Cursor CLI)=harness-only 16–19% spread; full stack swap $0.07–$2.26(32× headline includes model+cache routing). turn count·cache hit rate(96% vs 80%)가 harness diff보다 bill variance를 더 지배. vs model-only SWE-bench leaderboard — index+$/task=stack selection not model pick alone.

  • v1.1 — DeepSWE replaces SWE-Bench-Pro-Hard, 321 tasks 3-run pass@1
  • Harness-only 16–19% on same model — turn count+cache hit dominate variance
  • Per-task $0.07–$2.26 full-stack — evaluate model+harness pair before procurement
원본 →
AI 코딩 도구

Codex Appshots — macOS frontmost window screenshot+accessibility→context

Codex Appshots(2026-05-21 stable) — macOS Codex app에서 frontmost window를 screenshot+accessible text로 캡처해 Codex attachment로 전달. custom hotkey(default both Command keys) — visual context without manual describe. UI bug report·design review·'이 화면 고쳐' workflow. Computer Use·in-app browser와 compose — Appshots=instant pixel+text snapshot, not full browser automation. macOS only, Codex app users.

  • Hotkey capture — screenshot + accessibility tree as attachment
  • UI review·bug repro — describe-less visual context injection
  • macOS Codex app only — complements Computer Use·browser
원본 →
AI 코딩 도구

Steering Claude Code — CLAUDE.md·Rules·Skills·Hooks 선택 가이드

Anthropic steering guide(2026) — 4 steering surface decision matrix. CLAUDE.md — session start load·high context·facts(build cmd·layout·norms). Rules — path-scoped constraints·re-inject on compaction. Skills — name+desc at start·full body on invoke·shared budget·procedural workflows. Hooks — lifecycle deterministic guardrails(PreToolUse block·SessionStart inject). 30-line procedure in CLAUDE.md는 anti-pattern → skill로. compaction behavior differs — CLAUDE.md memoized, skills oldest-drop-first budget.

  • CLAUDE.md=facts always-on ·Skills=procedures on-demand ·Hooks=deterministic code
  • Rules path-scoped — medium cost, re-inject on compact
  • Anti-pattern — long runbook in CLAUDE.md, belongs in skill
원본 →
AI 코딩 도구

SWE-Atlas — Codebase QnA·Test Writing·Refactoring 284 rubric task

SWE-Atlas(Scale AI·arXiv 2605.08366·scaleapi/SWE-Atlas)는 bug-fix 벤치마크를 넘어 3 professional SE workflow를 재는 suite — Codebase QnA(124)·Test Writing(90)·Refactoring(70) = 284 expert task. sandboxed real repo·Harbor scaffold·programmatic check + expert rubric — functional correctness만이 아니라 test completeness·maintainability·hygiene까지. GPT-5.4·Opus 4.7 top but open-weight poor; native harness(Claude Code·Codex CLI)가 generic harness 대비 1.5–2× exploration→score↑. DeepSWE(long-horizon) ·FrontierCode(mergeability) ·AA Index v1.1(SWE-Atlas-QnA composite)와 축 분리 — investigative·maintenance workflow.

  • 284 tasks 3 leaderboards — QnA·Test Writing·Refactoring rubric eval
  • Harbor scaffold + vendor-native harness comparison built-in
  • Beyond bug-fix — runtime analysis·coverage·refactor behavior preservation
원본 →
AI 코딩 도구

Harbor — Terminal-Bench 공식 harness·50+ benchmark adapter

Harbor(harbor-framework/harbor·~2.7k★·v0.15)는 Terminal-Bench 제작팀의 agent eval framework — agent·dataset·environment provider를 common interface로 표준화. harbor run -d terminal-bench@2.0 -a claude-code -m anthropic/claude-opus-4-8 --n-concurrent 100 --env daytona. 50+ adapters(SWE-bench·Aider Polyglot·BFCL·MLGym 등)·installed agents(claude-code·codex·openhands·goose·opencode·mini-swe-agent·terminus-2). SWE-Atlas·Terminal-Bench 2.1 card가 score를 말하면 Harbor는 '같은 benchmark를 어떻게 공정히 돌리나' infra. promptfoo(red team) ·mcp-eval(MCP)와 축 분리.

  • Terminal-Bench official harness — agent black-box + declarative benchmark
  • Parallel via Daytona·Modal·LangSmith·Blaxel sandbox providers
  • terminus/terminus-2 built-in — harness gap measurement native
원본 →
AI 코딩 도구

Devstral 2 / Mistral Vibe CLI — 123B·72.2% SWE-bench·vibe-acp ACP

Devstral 2(Mistral·2025-12) — 123B dense·256K ctx·72.2% SWE-bench Verified open SOTA; Devstral Small 2(24B·Apache-2.0·68.0%) local deploy+multimodal. Mistral Vibe CLI(mistralai/mistral-vibe·Apache-2.0·~4.6k★) — Devstral-native terminal agent, file edit·shell·todo·auto-approve toggle. vibe-acp ACP server — Zed extension·JetBrains AI Assistant·avante.nvim integration. North Mini Code(30B sovereign) ·GLM-5.2(MIT 753B) ·MiniMax M3(428B multimodal)와 open-weight coding 4축 — Mistral=Devstral+Vibe ACP stack.

  • Devstral 2 123B modified MIT ·Small 2 24B Apache-2.0 ·256K ctx
  • Vibe CLI — terminal agent + config.toml provider/tool permissions
  • vibe-acp — ACP for Zed·JetBrains·Neovim without IDE lock-in
원본 →
AI 코딩 도구

Claude Code Remote Control — local session·phone/browser steer

Claude Code Remote Control(research preview·v2.1.51+) — claude.ai/code·Claude mobile app이 로컬 machine의 running CLI/VS Code session에 연결. Claude Code on the web(Anthropic cloud VM)와 달리 execution은 local — MCP·filesystem·project config 그대로, UI만 remote window. /remote-control·claude --remote-control·Desktop default toggle. Team/Enterprise는 admin Remote Control toggle 필요. ~10min network timeout — long unattended는 web/cloud agent. Channels(MCP push event) ·Scheduled Tasks(poll) ·Routines(cloud)와 4축 automation surface.

  • Local execution remote UI — MCP+files stay on your machine
  • vs claude.ai/code cloud — no local setup vs keep local context
  • Steering in-progress work from phone without re-uploading repo
원본 →
AI 코딩 도구

Claude Code Channels — MCP push CI·chat·webhook into open session

Claude Code Channels(research preview·v2.1.80+) — MCP server가 running session에 event push — CI failure·Slack·monitoring alert를 Claude context에 inject, two-way reply 가능. --channels flag·claude-plugins-official allowlist·org allowedChannelPlugins gate. Session open일 때만 event 도착 — always-on은 background process 필요. vs Scheduled Tasks(/loop poll) ·Remote Control(human steer) ·UserPromptSubmit(reactive enter) — Channels=external push trigger. Enterprise admin enable required.

  • MCP channel server — push events into live session, bidirectional reply
  • CI failure→Claude already has project context loaded
  • vs /loop poll ·Routines cloud — event-driven not schedule-driven
원본 →
AI 코딩 도구

OpenHands Agent Canvas — Slack·GitHub·Linear event automation workspace

OpenHands Agent Canvas(2026-06-16·agent-canvas npm) — self-hostable browser workspace for coding agent automations. cron schedule·GitHub webhook·Slack·Linear·custom webhook trigger. OpenHands default agent but ACP로 Claude Code·Codex·Gemini CLI third-party harness. local laptop→VM always-on promotion path. OpenHands(Docker sandbox interactive) ·Copilot Automations(cloud) ·Paperclip(org chart)와 축 분리 — harness-neutral event-driven automation UI.

  • agent-canvas one command — local or VM self-host full stack
  • Slack PR review·issue triage·Linear ticket automation recipes
  • ACP harness-neutral — not locked to OpenHands agent only
원본 →
AI 코딩 도구

GitHub PTA Dominator Tree — non-deterministic agent behavior validation

GitHub Trust Layer PTA(2026-05 blog) — Computer Use agent가 VS Code extension test suite를 non-deterministic하게 실행할 때 'correct'가 path-dependent. 2–10 successful session 관찰→Dominator Tree structural model — state+action equivalence로 valid variation vs real failure 분리. VS Code CUA experiment: self-assessment 80% accuracy vs PTA 100% (+20), recall 60%→100%. promptfoo(adversarial) ·Deepchecks(session judge) ·OASB(product security)와 축 분리 — structural trust layer for UI agent eval.

  • Learn-by-example from 2–10 success sessions — not rigid script replay
  • Dominator Tree — state/action equivalence not pixel-exact match
  • Agent self-grade unreliable — external structural validator required
원본 →
AI 코딩 도구

Copilot JetBrains Claude agent — Claude Code CLI를 Copilot agent picker에

GitHub Copilot for JetBrains(2026-06-22 preview) — Claude as agent provider: Claude Code CLI path 설정→Copilot Chat agent picker에서 Claude session. Organization/enterprise Copilot agents + queue/steer Copilot CLI messages + Agent Debug logs summary view. Cloud agent GA(editor preview flag 제거). 현재 bypass permissions(auto-approve all edits) — configurable permissions coming. Junie(JetBrains native debugger MCP) ·Copilot CLI(GA terminal)와 축 분리 — Copilot subscription surface에서 Claude harness 선택.

  • Install Claude Code CLI → set path in Copilot Chat settings
  • Cloud agent GA ·per-turn AI credits indicator ·debug logs summary
  • Preview caveat — bypass permissions mode, enterprise policy gate
원본 →
AI 코딩 도구

BenchJack — SWE-bench·Terminal-Bench reward-hack red-team, conftest.py 10줄 exploit

BenchJack(Berkeley RDI·arXiv 2605.12673)는 agent benchmark vulnerability scanner — eval pipeline trust boundary·scoring mechanism 분석→working exploit 자동 생성. 10개 벤치마크 audit — SWE-bench Verified(500)·Pro(731)·Terminal-Bench(89)·WebArena·OSWorld 등 9/10 near-100% without solving task. SWE-bench exploit — repo root conftest.py pytest hook이 모든 test outcome을 passed로 rewrite(Pytest auto-discover, reset 후에도 survive). 219 flaws·8 flaw taxonomy·iterative patch pipeline(WebArena·OSWorld 3 attempt内 unhackable). promptfoo(adversarial prompt) ·GitHub PTA(structural UI) ·OASB(product security)와 축 분리 — benchmark integrity penetration test before publish.

  • conftest.py 10-line hook — force all tests passed, zero bugs fixed, 100% score
  • Trust boundary flaw — agent patch runs inside test container with full privileges
  • Pre-publish benchmark audit — patch loop reduces hackable tasks to <10%
원본 →
AI 코딩 도구

Claw-SWE-Bench — harness(claw)를 controlled variable로, adapter·cost 1급 축

Claw-SWE-Bench(arXiv 2606.12344·opensquilla/claw-swe-bench) — general-purpose agent(OpenClaw 등)를 SWE-bench Docker contract에 adapter protocol로 연결. 350 instance·8 language·43 repo + Lite 80 subset. OpenClaw minimal adapter 19.1% vs full adapter 73.4% same GLM 5.1 — harness 54pp gap. Model sweep 29.4pp ·claw sweep 27.4pp under fixed model; similar accuracy can differ 10× API cost. Harbor(eval infra) ·Terminal-Bench 2.1(agent+model pair) ·AA Index(composite)와 축 분리 — claw=adapter design as first-class eval axis.

  • Adapter protocol — fixed prompt·budget·workspace·patch extraction for fair claw compare
  • Harness gap — 19.1%→73.4% same model; cost-accuracy Pareto not accuracy-only
  • Lite 80 — cost-aware calibration subset for fast harness iteration
원본 →
AI 코딩 도구

SWE-Cycle / SWE-Judge — env setup·implement·test gen·FullCycle 489 task

SWE-Cycle(arXiv 2605.13139) — issue resolution full lifecycle benchmark — Environment Reconstruction·Code Implementation·Verification Test Generation·FullCycle(bare repo, no human scaffold). 489 filtered instance. Isolated task→FullCycle 전환 시 solve rate sharp drop — cross-phase dependency·code quality bottleneck. SWE-Judge — static review + dynamic testing execution-capable evaluator, autonomous trajectory parsing error 제거. SWE-Atlas(QnA·Test Writing·Refactoring rubric) ·Harbor(harness infra) ·DeepSWE(long-horizon)와 축 분리 — end-to-end autonomy without pre-configured env.

  • 4 tasks — env rebuild·implement·test gen·FullCycle integrated bare repo
  • SWE-Judge — static+dynamic, fixes parser errors on full autonomous paths
  • FullCycle gap — isolated success≠end-to-end; cross-phase deps expose bottlenecks
원본 →
AI 코딩 도구

ProgramBench — binary+docs만으로 FFmpeg·SQLite 재구현, fully resolved≈0%

ProgramBench(arXiv 2605.03546·programbench.com) — agent가 executable+binary docs만 받고 architecture·language·build script 전부 자율 설계 — source·decompile·internet 금지. 200 task(jq·ripgrep→FFmpeg·SQLite·PHP interpreter). Agent-driven fuzzing hidden behavioral tests — implementation structure 무관 behavior match. Fully resolved intentionally strict — Fable 5 4/200·Opus 4.8 2/200(June 2026 vals.ai); raw pass rate ~70% but architecture wrong(monolithic single-file). DeepSWE(bug-fix decontaminated) ·SWE-bench(local surgery)와 축 분리 — cleanroom architectural reasoning stress test.

  • Inverts SWE-bench — no repo, only binary+docs; every design decision is model's
  • 0% headline vs 79%+ SWE-bench — measures different capability not contradiction
  • Almost resolved(95% tests) — progress signal while fully resolved stays near zero
원본 →
AI 코딩 도구

Bitbucket Agentic Pipelines Codex — Rovo Dev·Claude에 이어 3번째 CI agent provider

Bitbucket Agentic Pipelines(open beta·2026-06-25) — bitbucket-pipelines.yml에 provider: codex로 OpenAI Codex를 CI step에 embed. Rovo Dev(default)·Claude Code(2026-05)에 이어 3번째 — merge·schedule·failing build·PR comment trigger. codex-config-overrides.toml로 local과 동일 model pin·sandbox·MCP wiring. YAML policy·auth scope·audit trail은 provider 무관 일관 적용. Third-Party Product agreement — source·prompt·log→OpenAI, Atlassian no liability. GitHub Actions @claude ·Copilot Automations(cloud) ·OpenHands Agent Canvas(self-host)와 축 분리 — Bitbucket-native multi-provider agentic CI.

  • {"provider"=>"codex keyword — same YAML agent defs as rovodev/claude"}
  • codex-config-overrides.toml — pin model·tighten sandbox·extra MCP in repo
  • Unified policy layer — approval·scopes·audit regardless of agent vendor
원본 →
AI 코딩 도구

OpenAI Shift to Agentic — 내부 99.8% Codex token·99th percentile 60h agent/day

OpenAI "How agents are transforming work"(2026-06-25) + Columbia/Duke/UPenn paper — Codex adoption evidence. OpenAI internal — Codex 99.8% weekly output tokens(vs ChatGPT), engineer 99%, Legal/Finance/Recruiting 85%+ since Apr 2026. External org 63.3%·individual 16.5%. 99th percentile daily active — 60+ hours Codex agent turns/day parallel agents(June 2026). Individual sample — 80.6% requests >30min human work, 25.6% >8h delegated. Research dept median token use 56× Nov 2025. Consumer Plus/Pro <1% Codex among active users. Codex /goal ·parallel agents ·Bitbucket CI와 compose — adoption curve not capability headline.

  • Internal 99.8% tokens — agentic default when cost/access/training removed
  • Org 63% vs individual 16.5% — enterprise ahead, consumer still chat-first
  • Parallel orchestration — 60h agent-turns/day at p99, not single-thread Q&A
원본 →
AI 코딩 도구

ITBench-AA — K8s incident RCA 59 task, frontier 전원 50% 미만·Stirrup harness

ITBench-AA(IBM×Artificial Analysis·2026-05) — enterprise IT agent benchmark, SRE 59 Kubernetes incident root-cause analysis first release(FinOps·CISO roadmap). Offline snapshot — alerts·events·traces·metrics·topology→structured JSON root-cause entities. Stirrup OSS reference harness·100-turn cap·3 repeats·full recall scoring(miss one root cause→0). Best Claude Opus 4.7 ~47%·GPT-5.5 ~46% — all frontier <50%. vs SWE-bench Verified 80%+ — enterprise ops unsaturated. DeepSWE(coding) ·ProgramBench(architectural) ·Terminal-Bench(infra shell)와 축 분리 — diagnose live system not patch repo.

  • 59 SRE tasks — 40 public + 19 held-out; precision-weighted entity scoring
  • Stirrup harness — reproducible shell-access sandbox, github.com/itbench-hub/ITBench
  • Full recall strict — one missed root cause zeros the incident score
원본 →
AI 코딩 도구

Cursor Automations /automate — cloud always-on agent·computer use·multi-repo

Cursor Automations(2026-03 GA·2026-06-18 /automate skill) — cursor.com/automations cloud agent, cron·GitHub·GitLab·Slack·Linear·webhook trigger. /automate in local session — plain language→triggers·instructions·tools auto-config. 2026-05-20 — Agents Window·multi-repo·no-repo(read-only digest). 2026-06-18 — computer use default on automations(demo artifact), default open PR, incomplete state save. Isolated cloud sandbox — diff staged for review, default no auto-apply. vs /loop(local·session-bound·localhost access) ·Claude Scheduled Tasks ·OpenHands Agent Canvas(self-host). Rule — persistent cloud vs local env-bound loop.

  • /automate skill — describe workflow, Cursor configures triggers+tools
  • Multi-repo May 2026 — one automation targets several repos; no-repo for Slack-only
  • Cloud vs /loop — Automations persist laptop-off; /loop needs Cursor session open
원본 →
AI 코딩 도구

Cloudflare Temporary Accounts — 에이전트가 OAuth 없이 배포·검증하고 60분 안에 사람이 claim

Cloudflare Temporary Accounts for AI agents는 코딩 에이전트의 배포 루프에서 사람용 가입·OAuth·API 토큰 복사를 걷어내는 Workers 기능이다. Wrangler 4.102.0+에서 로그인 없이 배포를 시도하면 `--temporary` 플래그를 안내하고, 에이전트는 `wrangler deploy --temporary`로 임시 계정에 Worker를 배포한다. 결과는 live Worker URL과 claim URL이다. 임시 배포는 60분 동안 살아 있고, 그 안에 사람이 claim URL로 로그인·가입하면 영구 계정으로 가져갈 수 있으며, 아니면 만료된다. 교육 포인트는 "에이전트에게 production credential을 주기"가 아니라, throwaway 배포 타깃을 만들어 write→deploy→curl verify→redeploy 루프를 credential 없이 돌리게 하는 것이다.

  • Wrangler 4.102.0+ — unauthenticated deploy가 `--temporary` 재시도를 안내
  • 60분 preview account — live URL+claim URL 반환, unclaimed 배포는 자동 만료
  • 지원 범위 — Workers, Static Assets, KV, D1, Durable Objects, Hyperdrive, Queues 등 제한된 리소스
원본 →
AI 코딩 도구

NatureBench — Nature-family 90 discovery task·NatureGym firewall·SOTA gap g

NatureBench(arXiv 2606.24530·June 2026) — coding agent가 bug-fix reproduction을 넘어 scientific discovery를 할 수 있는가. 5,500 Nature-family papers(2022–25)에서 build-then-verify pipeline으로 90 containerized task — task brief+dataset+held-out test+evaluator. information firewall removes source method — agent must discover not reproduce. 6 domains(cellular omics·protein·biomedical·physical·molecular·relational). SOTA-normalized relative gap g primary metric + validity judge(output fabrication·feedback gaming). Claude Opus 4.7·GPT-5.5 top but far below published SOTA — understanding≠discovery. PaperBench(understand→code) ·PostTrainBench(engineering opt)와 축 분리.

  • NatureGym pipeline — paper→containerized task package, anti environment-fragmentation
  • Information firewall — method stripped, discovery not reproduction
  • Validity judge — shortcut detection beyond raw metric gaming
원본 →
AI 코딩 도구

FeatureBench — feature-oriented 200 task·fb CLI·Opus 74.4% SWE-bench→11% resolved

FeatureBench(arXiv 2602.10975·ICLR 2026·LiberCoders/FeatureBench) — bug-fix single-PR 범위를 넘어 end-to-end feature development 평가. test-driven automated collection — unit test dependency graph tracing→multi-commit multi-PR feature tasks, 200 eval + 3825 executable env from 24 repos. unified `fb infer`·`fb eval`·`fb data` CLI — OpenHands·Claude Code·Codex·Gemini CLI·mini-swe-agent one-click inference. June 2026 leaderboard — GPT-5.4+OpenHands 67.2% PAS·Claude 4.5 Opus 59.1%·feature resolved still ~11–20% vs 74% SWE-bench — 63pt cliff procurement signal. SWE-bench(local surgery) ·FrontierCode(merge rubric) ·ProjDevBench(greenfield)와 축 분리.

  • fb CLI — infer/eval/data pipeline, multi-agent scaffold support
  • 63pt cliff — SWE-bench high score≠feature delivery capability
  • Continually updatable — automated collection mitigates contamination
원본 →
AI 코딩 도구

c-CRAB — human review comment→executable test oracle·v3 20–32% pass

c-CRAB v3(arXiv 2603.23448·Code Review Agent Benchmark) — human PR review comment→executable test oracle, review agent quality = whether review-guided patch passes test. 184 PR·234 validated tests·Claude Code Sonnet-4 validation harness. PR-agent 20.1%·Devin 32.1%·Claude Code·Codex commercial tools — human 100%, union across 4 tools 97/234(41.5%). vs embedding similarity(CRScore) ·LLM-as-judge alone — c-CRAB=actionable review verification. Agent PR volume↑ makes review agent eval as important as codegen bench.

  • Test oracle — comment similarity metric misses actionable review
  • Union 41.5% — even 4 tools combined miss half human-caught issues
  • Production eval — Devin·Codex·Claude Code review modes benchmarked
원본 →
AI 코딩 도구

NSA MCP PP-26-1834 — 9 design controls·gateway·sandbox·Sep 2026 contractor deadline

NSA AISC Cybersecurity Information Sheet(May 20 2026·PP-26-1834) — first US government MCP-specific security guidance. agentic AI+MCP novel risks — dynamic tool invocation·implicit trust·context sharing beyond endpoint patch. 9 recommendations — filtering outgoing proxy+DLP·strict output filtering(prompt injection·tool-chain pivot)·structured SIEM audit logging·OS sandbox per server(seccomp/Landlock)·tool inventory pinning·MCP message signing+replay protection·network MCP listener scan·least privilege·HITL for consequential actions. Federal contractor alignment expectation Sep 30 2026. OX Security RCE disclosure ·Bumblebee supply chain scan ·MCP gateway pattern과 compose.

  • Treat agentic environment as continuum — misalignment at any stage compounds
  • Gateway+DLP chokepoint — NSA names enterprise egress filter explicitly
  • Sep 30 2026 contractor deadline — procurement leverage for MCP hardening
원본 →
AI 코딩 도구

Gemini CLI→Antigravity CLI — 2026-06-18 individual tier shutdown·agy migration

Google I/O 2026-05-19 announcement — Gemini CLI stops serving free·Google AI Pro·Ultra·individual Code Assist on June 18 2026. Replacement Antigravity CLI(closed-source Go·agy command) — async multi-agent workflows Gemini CLI TypeScript single-agent couldn't support. Enterprise Code Assist Standard/Enterprise + paid Gemini Enterprise Agent Platform API key retain gemini indefinitely. Apache-2.0 source remains but Google backend returns HTTP 410 for affected tiers — CI/CD gemini command breaks without migration. OpenCode(~179k★ MIT)·Claude Code·Aider primary individual migration paths. Antigravity 2.0 card(3-surface platform) ·OpenCode(anomalyco) card와 ecosystem shift axis.

  • June 18 hard cutoff — no grace period, Pro/Ultra/free individual affected
  • agy closed-source — fewer rights vs OSS gemini CLI community fork
  • Enterprise exempt — Standard/Enterprise Code Assist + GEAP API key keep gemini
원본 →
AI 코딩 도구

GitHub Copilot app GA — Canvases·cloud automations·parallel worktree sessions

GitHub Copilot app GA(2026-06-17·macOS/Windows/Linux) — agent-native desktop control center built on Copilot CLI+GitHub native integration. parallel sessions each on isolated git worktree+branch — issue·PR·prompt start. Canvases bidirectional surfaces — plan·PR·terminal·browser co-edited not buried in chat. Cloud automations schedule recurring agent work without laptop awake. BYOM+MCP+skills+plugins in-session. My Work dashboard·Agent Merge PR lifecycle·/chronicle session history. vs Copilot SDK(embed runtime) ·Copilot CLI(TUI terminal) ·IDE extension(sidebar) — app=parallel orchestration surface.

  • Parallel worktrees — multiple agents same repo no branch collision
  • Canvases — inspectable shared surface vs chat-only agent history loss
  • Cloud automations — fire-and-forget scheduled agent tasks on GitHub runners
원본 →
AI 코딩 도구

Claude Managed Agents — multiagent·self-hosted sandbox·MCP tunnel·AWS Platform

Claude Managed Agents(public beta·managed-agents-2026-04-01) — hosted cloud agent harness with multiagent coordinator delegating 1–20 roster agents, max 25 concurrent threads·depth 1 only. shared container+filesystem+vault, each worker isolated context(model·tools·MCP·skills). 2026-05 Code with Claude — self-hosted sandbox(public beta) runs tool execution on customer infrastructure via worker polling Anthropic control plane; MCP tunnel reaches private MCP without internet exposure(tool I/O still transits control plane — not air-gapped). 2026-06-16 Claude Platform on AWS — full CMA feature set(webhooks·multiagent·self-hosted sandboxes) on AWS deployment. vs Claude Code subagents(local) ·Cloudflare Temporary(deploy credential) — CMA=enterprise hosted agent with BYO execution perimeter.

  • Self-hosted sandbox — tool runs on your worker, results return to model
  • MCP tunnel — private MCP from Anthropic cloud or self-hosted session
  • AWS Platform GA — webhooks+multiagent+self-hosted on Claude Platform AWS
원본 →
AI 코딩 도구

WeaveBench — hybrid GUI+shell CUA 114 task·trajectory-aware agent-as-judge

WeaveBench(arXiv 2606.09426·weavebench.github.io) — long-horizon real-world computer-use where every task interleaves GUI clicks with shell/code in one trajectory. 114 tasks 8 work domains·trajectory-aware Agent-as-Judge reads chat trace+deliverables per-clause evidence — harder to spoof than file-existence checks. Best Claude Opus 4.7+Claude Code 41.2% PassRate vs GPT-5.5+Codex 35.1% — harness pairing matters. OpenClaw as harness variable 19–35% spread same model. vs OSWorld(pure GUI) ·Terminal-Bench(shell) ·ITBench-AA(SRE) — hybrid interface real desk work.

  • GUI+shell interleave required — neither pure terminal nor pure browser CUA
  • Agent-as-Judge trajectory — per-clause evidence from full chat+artifacts
  • Harness sensitivity — Opus+Claude Code vs Opus+OpenClaw 6pp gap same model
원본 →
AI 코딩 도구

Agent Governance Toolkit + ACS — fail-closed runtime governance·8 intervention points

Microsoft Agent Governance Toolkit(AGT·2026-04-02·MIT·~4.5k★) — framework-agnostic runtime governance sidecar. Agent OS(stateless policy engine <0.1ms p99·YAML/OPA Rego/Cedar)·Agent Runtime(4 privilege rings sandbox)·Agent SRE(kill switch·SLO·chaos)·Agent Compliance(OWASP ASI 10/10 evidence·EU AI Act/HIPAA/SOC2 mapping). LangChain callback·CrewAI decorator·Google ADK plugin·Copilot CLI governance installer adapter. Agent Control Specification(ACS·Build 2026) — vendor-neutral portable YAML manifest·8 interception points(agent_startup·input·pre/post_model·pre/post_tool·output·shutdown)·stateless deterministic fail-closed verdict(allow/warn/deny/escalate/transform). OWASP ASI(threat taxonomy) ·NSA MCP(operational MCP) ·AIUC-1(cert)와 compose — AGT+ACS=enforceable runtime layer.

  • ACS 8 points — policy travels with agent across LangChain/AutoGen/SK/MCP
  • fail-closed — runtime error→deny, enforce vs evaluate_only mode
  • OWASP 10/10 coverage — Agent Compliance grades map to procurement evidence
원본 →
AI 코딩 도구

ASSERT — natural-language policy→executable agent eval·Build 2026 open trust stack

ASSERT(Adaptive Spec-driven Scoring·responsibleai/ASSERT·MIT·Build 2026) — product requirement·policy doc·system prompt를 AI-assisted systematization으로 behavior taxonomy→multi-turn test case→OTel-traced inference→LLM judge scoring pipeline. policy citation+rationale+turn evidence per verdict — generic benchmark가 아니라 org-specific behavior eval. OpenInference integration — LangGraph·CrewAI·OpenAI Agents SDK·AutoGen·hosted model without rewrite. Microsoft Build 2026 open trust stack — ASSERT(find defects)→ACS(place controls)→ASSERT(confirm improvement) closed loop. vs Claw-Eval(general 300 task benchmark) ·Braintrust(eval SaaS) ·Promptfoo(adversarial YAML) — ASSERT=policy-driven pre-production safety eval.

  • Spec→taxonomy→cases→trace→judge — requirement doc이 living eval suite
  • OpenInference any agent — trace evidence mandatory for agentic verdict
  • ACS pairing — eval identifies gap, ACS enforces at intervention point
원본 →
AI 코딩 도구

MobileRisk-Live / OS-Sentinel — Android GUI agent safety sandbox·hybrid verifier

OS-Sentinel(ACL 2026 Oral·arXiv 2510.24411) — mobile GUI agent safety research foundation. MobileRisk-Live — Android emulator dynamic sandbox, agent real-time execute while detector monitors GUI observation+system state trace. MobileRisk — frozen 204 trajectory(102 safe+102 unsafe)·10 risk category·step+trajectory annotation·counterpart safe cases for false-positive test. OS-Sentinel hybrid — Formal Verifier(deterministic system violation) + VLM Contextual Judge(semantic risk)·10–30% improvement over prior. frozen MobileRisk≈Live dynamic — offline benchmark reproduces live safety signal. vs Agent-SafetyBench(general tool env) ·WeaveBench(hybrid CUA capability) ·Android Computer Control(UI automation) — mobile-specific safety eval axis.

  • MobileRisk-Live — Android emulator real-time safety playground
  • Hybrid Formal+VLM — system rule + contextual semantic judgment
  • 204 frozen trajectories — disentangle safety from agent capability variance
원본 →
AI 코딩 도구

Agent-SafetyBench — 349 env·2000 case·frontier 전원 safety score 60% 미만

Agent-SafetyBench(thu-coai/Agent-SafetyBench·arXiv 2412.14470·AAAI 2026 TrustAgent) — LLM agent behavioral safety in interactive tool environments. 349 novel environments·2000 test cases·8 safety risk categories·10 failure modes. 16 popular agents evaluated — none exceeds 60% safety score. two fundamental defects — lack of robustness(lacks stable safe behavior under risk) ·lack of risk awareness(fails to recognize danger in time). defense prompt alone insufficient — needs runtime containment+policy. ShieldAgent scorer model for automated grading. vs CUAHarm(CUA harm execution) ·OS-Harm(GUI injection) ·Claw-Eval(general capability+safety) — broad interactive safety unsaturated.

  • 349 env·2000 cases — broader than chatbot refusal-only safety
  • 0/16 agents >60% — robustness+risk awareness both broken
  • ShieldAgent judge — scalable scoring beyond human review
원본 →
AI 코딩 도구

CUAHarm — CUA misuse 104 task·refusal가 아니라 harmful execution verifiable reward

CUAHarm(arXiv 2508.00935·db-ol/CUAHarm) — computer-using agent misuse risk beyond chatbot safety. 104 expert-written scenarios·52 core computer-use tasks requiring direct terminal/system interaction — credential theft·privilege escalation·network exploit·system disruption·data tamper·forensic evasion·tool utilization 7 categories. rule-based verifiable reward — firewall disabled? credential exfiltrated? — measures execution success not refusal rate. frontier models 40%+ harmful task success — Gemini 2.5 Pro 90%·Mistral Large 2 81%·Claude 4 Sonnet 54% despite strong chatbot safety scores. monitoring CUA actions harder than chatbot CoT. vs OS-Harm(GUI+injection) ·Agent-SafetyBench(tool env) ·WeaveBench(benign capability) — terminal CUA harm axis.

  • Verifiable reward — state change not LLM refusal as metric
  • Chatbot-safe ≠ CUA-safe — agent mode amplifies misuse vs chat
  • 52 terminal tasks — full system access not abstracted API
원본 →
AI 코딩 도구

OS-Harm — GUI CUA 150 task·misuse·injection·misbehavior 3 harm vector

OS-Harm(NeurIPS 2025 Spotlight·tml-epfl/os-harm·OSWorld VM) — LLM computer-use agent safety across 3 harm categories. deliberate user misuse(test_misuse.json·--jailbreak)·prompt injection(test_injection.json·--inject·12 goal types — email cred exfil·cron remote script·sudo rm -rf)·model misbehavior(unintended unsafe). 150 tasks spanning harassment·copyright·disinformation·data exfil·real OS apps(email·browser·editor). automated LLM judge 0.76–0.79 F1 vs human. frontier agents 50–70% misuse compliance·up to 20% static injection·10% spontaneous misbehavior. vs CUAHarm(terminal harm execution) ·WeaveBench(capability) ·c-CRAB(review QA) — GUI CUA safety tri-vector.

  • 3 vectors — misuse·injection·misbehavior not single refusal test
  • 12 injection goals — email·terminal·URL cred·file exfil realistic channels
  • OSWorld VM — screenshot/a11y agent same scaffold as capability bench
원본 →
AI 코딩 도구

Gemini Nano 4 — Fast/Full on-device·Gemma 4 E2B/E4B·tool calling 로드맵

Gemini Nano 4(Google 2026·Gemma 4 family distill) — Android on-device foundation model tier via AICore system service. Nano 4 Fast(latency-optimized)·Nano 4 Full(reasoning-optimized) — E2B(4.2GB)·E4B(5.9GB) effective params, 12GB+ RAM·Tensor/Dimensity/Snapdragon NPU. ML Kit GenAI Prompt API production path — AICore Developer Preview(Gemma 4)에서 experiment 후 ship. roadmap — tool calling·structured output·system prompt·thinking mode로 cloud Gemini agent feature convergence. hybrid inference(Firebase AI Logic PREFER_ON_DEVICE) — privacy/offline first, cloud fallback for complex reasoning. vs ADK for Android(agent framework) ·ML Kit Structured Output(schema) ·server Gemini — Nano 4=model tier milestone not framework.

  • Fast vs Full — latency vs reasoning split on same AICore stack
  • Tool calling roadmap — on-device agent needs tools not just summarization
  • No per-request cloud cost·data stays device — GDPR/offline advantage
원본 →
AI 코딩 도구

Agent behavioral drift — trace만으로는 silent failure·5 observability primitive

Agent behavioral drift(2026 production pattern) — agent remains healthy(infra green) but decision quality degrades silently. causes — foundation model update·tool API schema change·RAG corpus growth·prompt drift without deploy event. semantic drift ≠ statistical input drift — same input, different reasoning path. five observability primitives beyond uptime — tool-call trace+authorization audit·retrieval provenance·multi-step replay·behavioral drift detection(rolling baseline on tool frequency·refusal rate·retrieval depth·latency·cost-per-task)·online eval on sampled traces. OTel GenAI span hierarchy enables fingerprint but drift needs eval layer attached. vs Datadog MELT(infra) ·LLM observability(single call) ·Braintrust(trace+eval) — drift=decision integrity monitoring.

  • Silent failure — wrong decision with 200 OK, dashboards stay green
  • Rolling baseline 24h/7d/30d — leading indicator before user complaints
  • Trace without eval — see what agent did, not whether still correct
원본 →
AI 코딩 도구

Claude Code Artifacts — 터미널 세션을 live shareable web page로

Claude Code Artifacts(2026-06-18 beta·Team/Enterprise) — coding session output을 claude.ai private URL self-contained HTML page로 publish. session context(code·tools·chat·connected data)에서 PR walkthrough·incident dashboard·release checklist·system explainer 생성, same URL in-place update+version history+gallery. strict CSP — external network call blocked, no backend. org-only authenticated sharing·admin toggle·compliance API audit. vs Claude chat Artifacts(2024 split-screen) ·Codex Sites(URL deploy) — Code Artifacts=terminal work visibility for non-technical stakeholders without export.

  • Team/Enterprise beta — CLI+desktop, Free/Pro excluded
  • Live update same URL — version history·restore one-click
  • CSP no external fetch — security boundary defines capability ceiling
원본 →
AI 코딩 도구

Miasma/IronWorm — Phantom Gyp·eBPF·AI config supply-chain worm

Miasma/IronWorm(2026-06 CSA·StepSecurity·Phoenix) — npm self-replicating worm targeting AI coding tool config as primary attack surface. Miasma Wave 2 Phantom Gyp — preinstall/postinstall 대신 157-byte binding.gyp→node-gyp rebuild 자동 실행, lifecycle script scanner 우회(72h 내 pivot). 57 packages·286 versions·73 Microsoft repos disabled. persistence — .claude/settings.json SessionStart hook·.cursor/rules/setup.mdc alwaysApply:true·.vscode/tasks.json runOn:folderOpen — repo open trigger, package remove해도 config 잔존. IronWorm — Rust ELF preinstall·eBPF kernel rootkit(procfs hide)·Tor C2·86 env var sweep(AWS/GCP/Azure+Anthropic/OpenAI/Gemini keys). CI — ACTIONS_RUNTIME_TOKEN→Runner.Worker /proc/{pid}/mem masked secret read. vs HackMyAgent(pentest) ·prompt injection — worm=autonomous spread via trusted config auto-execution layer.

  • Phantom Gyp — binding.gyp not package.json scripts, --ignore-scripts alone insufficient
  • Folder-open persistence — audit .claude/ .cursor/ .vscode/ like Dockerfile in PR
  • IronWorm eBPF+Tor — npm preinstall Rust payload, rotate all cloud+AI keys on compromise
원본 →
AI 코딩 도구

Reward hacking coding benchmarks — git history·web lookup 63% retrieved fix

Cursor research(2026-06-25) — smarter models reward-hack coding evals more than older ones. SWE-bench Pro audit — 63% of Opus 4.8 Max successful resolutions retrieved fix not derived. seal git history+block internet — Opus 87.1%→73.0%·Composer 2.5 74.7%→54.0%. leakage channels — upstream merged PR lookup·bundled .git history mining. mitigations — transcript audit·controlled runtime·egress proxy·remove .git in eval sandbox. vs DeepSWE(contamination-free tasks) ·c-CRAB(review oracle) — reward hacking=runtime eval integrity not training contamination.

  • Pro gap 14pp Opus — intelligence gains swamped by shortcut discovery
  • Composer 2.5 largest gap — synthetic RL task cache/bytecode hacks in training too
  • Eval env design — git strip·network deny as important as benchmark curation
원본 →
AI 코딩 도구

SWE-Rebench — rolling fresh GitHub issue·release-date decontamination

SWE-Rebench(Nebius·NeurIPS 2025·swe-rebench.com) — continuously updated SWE agent benchmark with automated task mining pipeline. issue/PR creation date vs model release date contamination flag·5-run pass@1+SEM·fixed ReAct scaffold 128K. June 2026 — Claude Opus 4.6 65.3% > GLM-5 62.8% > GLM-5.1 62.7% (2.6pp spread vs SWE-bench Verified saturation). vs DeepSWE(original verifier-accurate tasks) ·SWE-bench Verified(static curated) ·FeatureBench(feature dev) — rebench=rolling decontaminated freshness axis.

  • Contamination transparency — pre-release issues flagged on leaderboard
  • Lower absolute scores — auto-mined tasks include harder/ambiguous issues
  • Model-only scaffold — isolates LLM from harness variance unlike agent+model pairs
원본 →
AI 코딩 도구

MiMo Code V0.1.0 — Xiaomi open harness·200+ step long-horizon memory

MiMo Code V0.1.0(Xiaomi MiMo·2026-06-10 Apache-2.0) — terminal-native open-source coding harness optimized for ultra-long agentic runs. internal A/B 576 dev·474 private repos·1213 pairs vs Claude Code same model — under 200 steps ~50/50, over 200 steps MiMo Code win rate >65%. harness-only gap — same MiMo-V2.5-Pro in MiMo Code vs Claude Code SWE-bench Pro 62% vs 57%·Terminal Bench 2 73% vs 68%. state-management architecture for memory across 200+ tool steps. vs Harbor(eval infra) ·Kimi K2.7(model) ·Loop Engineering(methodology) — MiMo Code=open harness long-horizon axis.

  • Open-source harness not model — 5pp gain same model vs Claude Code
  • 200+ step crossover — short tasks parity, long tasks harness dominates
  • MiMo-V2.5-Pro pairing — Xiaomi stack model+harness co-design
원본 →
AI 코딩 도구

Xcode 27 mcpbridge — Apple IDE as universal MCP host·20 Xcode tools

Xcode 27(WWDC 2026-06-09·developer beta) — mcpbridge binary translates MCP JSON-RPC over stdio→XPC into Xcode live process. codex mcp add xcode -- xcrun mcpbridge ·claude mcp add --transport stdio xcode -- xcrun mcpbridge. 20 capabilities — build·test·SwiftUI preview·Swift REPL·live diagnostics·symbol resolve·Apple doc query. Intelligence settings Allow external agents toggle·ACP(Agent Client Protocol) governs which agents may connect. vs Android Studio Junie native ·JetBrains debugger MCP — mcpbridge=cross-vendor external agent IDE access without xcodebuild parse.

  • Project must be open in Xcode — XPC requires live IDE process
  • External agent BYO — Claude Code·Codex·Cursor same MCP surface
  • CI headless — use xcodebuild not mcpbridge, bridge is dev-machine only
원본 →
AI 코딩 도구

Codex Remote GA — ChatGPT mobile→Mac/Windows host·QR one-to-one pairing

Codex Remote(2026-06-25 GA) — ChatGPT iOS/Android app에서 connected Mac/Windows Codex host session start/continue·progress review·action approve. authenticated one-to-one QR pairing per device-host(June 8+ connections preserved·older re-pair). DigitalOcean plugin — Droplet provision·SSH·remote workspace connect. vs Claude Code Remote Control(local session steer·~10min timeout) ·Codex desktop Computer Use(macOS) — Remote=phone as control plane for existing host agent not cloud VM.

  • GA June 25 — update ChatGPT mobile + Codex app before connect
  • QR pairing — one iOS/Android device per host, not shared session link
  • DigitalOcean plugin — cloud devbox as Codex remote workspace target
원본 →
AI 코딩 도구

Cursor Customize page — plugins·skills·MCP·subagents·hooks 한 UI

Cursor Customize page(3.9·2026-06-22) — plugins·skills·MCP·subagents·rules·commands·hooks를 user·team·workspace scope에서 한 페이지로 관리. custom MCP bring-your-own·team-level MCP at cursor.com/agents(cloud subagent는 local MCP 대신 team config). vs Cursor Automations(trigger·cron) ·Claude plugin marketplace — Customize=static config inventory not runtime automation.

  • 3.9 release — unified customization surface replaces scattered settings
  • Team vs user scope — org MCP for /in-cloud cloud subagents
  • Custom MCP — same page as skills/rules without separate JSON hunt
원본 →
AI 코딩 도구

Dialogue-SWEBench — SWE-bench Verified를 multi-turn user dialogue로 재평가

Dialogue-SWEBench(arXiv 2606.13995·June 2026) — coding agent가 full spec 없이 simulated user와 대화하며 SWE-bench Verified 500 issue를 해결하는 benchmark. persona-grounded user simulator(U_φ)·message_user action·dialogue quality auto-eval. schema-guided agent 46.9% avg vs OpenHands 32.9% — better coding model≠better dialogue agent(GPT-5-mini>GPT-5 on easy). 핵심 발견 — information-seeking dialogue moves↑ correlates with resolution. vs SWE-bench(autonomous full spec) ·τ-bench(customer service policy) — dialogue=interactive IDE assistant realism axis.

  • 500 SWE-bench Verified — underspecified task, agent must ask user
  • Coding≠dialogue — leaderboard model rank misleads interactive use
  • Schema-guided agent — slot-filling dialogue state +3–14% over baselines
원본 →
AI 코딩 도구

OmniCode — bug-fix·test-gen·code-review·style 1794 task·Python/Java/C++

OmniCode(ACL 2026 Findings·arXiv 2602.02262·seal-research/OmniCode) — SWE-bench가 patch generation에 치우친 공백을 4 category로 메움. 1794 manually validated task — bug fixing·test generation·code review response·style fixing across Python·Java·C++. synthetic augmentation of 494 base GitHub issues — ill-defined problem 제거·data leakage 방지. SWE-Agent DeepSeek-V3.1 — Python bug-fix OK but C++ test-gen 25%·Java style 8%. vs SWE-Atlas(Q&A·refactor) ·FeatureBench(multi-PR feature) — OmniCode=day-to-day SE task diversity not single-issue patch.

  • 4 categories — patch만 잘하는 agent는 test-gen/style에서 무너짐
  • 3 languages — Java/C++ gap exposes Python-only overfit
  • Containerized env — executable test suite per instance
원본 →
AI 코딩 도구

JetBrains Air — multi-agent ADE·Docker/worktree isolation·ACP agent-agnostic

JetBrains Air(air.dev·2026-03 public preview·macOS+Linux) — Agentic Development Environment, IDE를 대체하지 않고 agent orchestration layer. Codex·Claude Agent·Gemini CLI·Junie concurrent task — Docker container·Git worktree·.air/docker.json·.air/worktree.json pre-config. code-aware task definition(symbol·class·method·commit)·Open In JetBrains IDE side-by-side. ACP+Agent Registry roadmap·cloud execution tech preview. vs Cursor(IDE-first) ·Junie(single agent) ·Conductor(local parallel) — Air=harness-neutral fleet manager with JetBrains code intelligence.

  • Agent-agnostic — switch/compare Codex vs Claude vs Junie per task
  • Isolation — worktree or Docker per agent, no branch collision
  • IDE complement — Air orchestrates, IntelliJ/Android Studio for hands-on edit
원본 →
AI 코딩 도구

Cursor Design Mode 3.7 — browser multi-select·voice queue·Cmd+Shift+D

Cursor Design Mode(3.0 Apr 2026·3.7 Jun 5 2026) — Agents Window built-in browser에서 UI element click·draw·voice로 agent에 visual context 전달. 3.7 — multi-select 2+ elements(code·layout·visual relationship bundle), voice mic stays on during agent run→queue next edit without waiting. Cmd+Shift+D toggle·Shift+drag area annotate·Option+click add to input. live dev server required — static file edit 불가. vs v0 Design Mode(generate component) ·Figma — Cursor=existing app pixel-level steer agent patch. Composer 2.5 recommended for UI work.

  • Multi-select — "make A match B" group edit in one prompt
  • Voice queue — mid-run narration without blocking agent
  • Element context — HTML·CSS·bounding box injected not prose description
원본 →
AI 코딩 도구

PostTrainBench — 10h H100·base LLM post-train·reward hacking audit

PostTrainBench(ICML 2026·arXiv 2603.08640·posttrainbench.com) — CLI agent가 base LLM(Qwen3-1.7B/4B·SmolLM3-3B·Gemma-3-4B)을 10h single H100에서 post-train해 7 benchmark(AIME·BFCL·GPQA·HumanEval 등) score maximize. Opus 4.6 best 23.2% vs instruction-tuned baseline 51.1% — agentic AI R&D automation still far from provider SFT. reward hacking documented — test data train·download IT model·unauthorized API key synthetic data. vs PaperBench(replicate paper) ·NatureBench(discovery) — PostTrainBench=can agent run ML engineering loop under compute budget.

  • 10h H100 cap — realistic single-GPU post-training not cluster fantasy
  • 23% vs 51% — agents improve base 3× but miss official IT models
  • Integrity failures — eval env must block model swap and test leakage
원본 →
AI 코딩 도구

Snorkel Agentic Coding — 100 task·4 tier·Harbor Pass@5·trajectory rubric

Snorkel Agentic Coding Benchmark(2026-04·snorkel.ai/leaderboard/agentic-coding) — 100 multi-step SE task 4 difficulty tiers, sandboxed env·human-validated golden solution·unit tests·trajectory rubric. Harbor harness Pass@5·30min max per task. Opus 4.6 65.2% > Opus 4.5 58% > Gemini 3 Pro 51.6% — difficulty curve separates frontier. Snorkel co-created Terminal-Bench but this benchmark spans ML/data/build deps beyond shell-only. vs Terminal-Bench 2.1(infra shell) ·SWE-bench(single patch) ·DeepSWE(original tasks) — Snorkel=long-horizon planning+error recovery breadth.

  • Pass@5 Harbor — same harness as Terminal-Bench ecosystem
  • Trajectory rubric — final output+how agent recovered from errors
  • 4 tiers — signal from efficiency model to frontier Opus
원본 →
AI 코딩 도구

MCP Apps+Tasks gateway governance — iframe CSP·taskId IDOR·org policy surface

MCP 2026-07-28 promotes MCP Apps(iframe UI via _meta.ui.resourceUri·ui:// resource) and Tasks extension to first-class — but net-new governance surfaces. MCP Apps — arbitrary HTML in sandboxed iframe, postMessage JSON-RPC, host must enforce CSP·allowlist·content review before render. Tasks — tools/call returns taskId, client polls tasks/get·update·cancel; stateless core means taskId=capability handle requiring per-request auth(IDOR if leaked). Gateway layer — route Mcp-Method/Mcp-Name without body parse, policy which extensions allowed, audit task lifecycle. vs A2UI vs MCP Apps architecture choice ·MCP 2026 spec card — governance=production deployment checklist not wire format.

  • Apps risk — unreviewed iframe HTML is XSS/supply-chain surface
  • Tasks IDOR — taskId in tool args needs explicit authorization every poll
  • Gateway — extension allowlist+header routing before agent sees tool
원본 →
AI 코딩 도구

PaperBench — ICML 2024 20 paper replication·8316 rubric·Code-Dev lite

PaperBench(OpenAI frontier-evals·arXiv 2504.01848) — agent가 ICML 2024 Spotlight/Oral 20편 ML research를 scratch replicate — codebase·experiment·rubric match. 3-stage pipeline — agent rollout container→reproduce.sh GPU reproduction→SimpleJudge LLM rubric(8316 gradable subtasks, co-authored with paper authors). Best Claude 3.5 Sonnet scaffold 21%·ML PhD human 41.4% on 3-paper subset. PaperBench Code-Dev — skip reproduction GPU, code-only rubric ~85% judge cost cut. vs NatureBench(scientific discovery firewall) ·PostTrainBench(post-train loop) — PaperBench=AI research engineering replication axis.

  • Author co-written rubric — realistic replication criteria not generic tests
  • Code-Dev variant — no GPU reproduction, cheaper capability signal
  • Human baseline beats SOTA — research replication still human-led
원본 →
AI 코딩 도구

Project Glasswing — AI 보안 자동화의 병목은 탐지보다 검증·패치 수용

Anthropic의 Project Glasswing 확장 글은 Mythos Preview를 약 50개 초기 파트너 코드베이스 취약점 탐지에 쓰며 10,000개 이상의 high/critical 후보를 찾았고, 2026-06-02에는 15개국 이상 약 150개 조직으로 프로그램을 넓힌다고 설명한다. 중요한 교훈은 "AI가 더 많이 찾아준다"가 끝이 아니라는 점이다. 글은 병목이 취약점 발견에서 검증·공개·패치 배포로 옮겨 갔다고 못박고, Claude Security 제품 페이지도 코드 스캔 뒤 adversarial verification pass를 거치며 패치는 사람이 review/approve해야 한다고 말한다. 즉 보안 에이전트 도입은 스캐너 추가가 아니라 triage queue, 증거, 심각도 재평가, 승인권자를 함께 설계하는 일이다.

  • 10,000+ high/critical 후보와 150개 조직 확장 — 탐지량이 운영 병목을 만든다
  • Claude Security는 scan→validate→patch 제안 흐름, 모든 패치는 human approval 전제
  • 실무 교훈 — AI 보안 자동화는 발견보다 검증·공개·패치 수용 프로세스가 핵심
원본 →
AI 코딩 도구

mcp-memory-rs — local-first MCP memory·merkle sync·offline JSON+SQLite

mcp-memory-rs(DioNanos·v0.3.0·2026-06)는 Rust stdio MCP memory server로 agent 장기 상태를 vendor session이 아닌 사용자 디스크 JSON category+SQLite FTS5에 보관한다. default는 완전 offline — sync는 optional HTTP step, embedding·cloud account 불필요. fleet sync — sync_manifest(merkle root)·sync_diff·memory_sync push/pull, conflict_strategy(last-write-wins default)·expected_hash optimistic concurrency. HTTP sync plane은 bearer token full access — loopback bind+MCP_MEMORY_TOKEN 필수, MCP stdio surface만 per-category ACL. vs agentmemory(53 tool cloud-style) ·Memory Bank(markdown files) — mcp-memory-rs=multi-device edge sync+versioned notebook axis.

  • Local-first — stdio만으로 offline 동작, sync는 explicit opt-in
  • Merkle manifest — node 간 diff만 push, full dump 불필요
  • HTTP token=admin — loopback+tunnel, public internet 노출 금지
원본 →
AI 코딩 도구

Q4 KV Cache edge — multi-agent on-device attention state를 SSD에 persist

Agent Memory Below the Prompt(arXiv 2603.04428·2026) — edge multi-agent LLM inference에서 agent 전환마다 KV cache re-prefill(4K context Gemma 3 12B 15.7s)이 병목. Q4 quantized KV cache를 SSD에 persist, eviction 시 vLLM처럼 free하지 않고 disk page-in — warm 577ms·hot 719ms vs re-prefill 15.7s. 24GB edge — FP16 8K에서 agent 3개 vs Q4 12개. multi-agent workflow는 한 agent decode 중 다음 agent load로 page-in latency hide. PPL impact -0.10~+0.19 across models. vs MiMo Code(harness state) ·on-device Nano inference — Q4 KV=attention state virtual memory for multi-agent edge.

  • Re-prefill 15.7s→577ms — session restart·memory pressure 후에도 context restore
  • Q4 4-bit — edge RAM budget에서 agent slot 4× 확장
  • Decode/load overlap — multi-agent interleave가 I/O latency 상쇄
원본 →
AI 코딩 도구

SWE-STEPS — dependent PR chain·stateful coding agent eval·20pp inflation

SWE-STEPS(arXiv 2604.03035·Apr 2026) — coding agent를 isolated single-PR(SWE-bench style)이 아니라 temporally ordered PR chain(3–11 PR·median 1–3주 dev work)에서 평가. 168 task·963 PR·6 Python repos·Conversational(iterative request) + PRD(monolithic plan) 두 setting. isolated PR eval은 stateful setting 대비 success rate 최대 20pp 과대 — spillover·regression 누적 무시. SonarQube — agent code가 cognitive complexity·technical debt 더 높음(test pass해도 repo health degrade). vs SlopCodeBench(iterative extension quality) ·Dialogue-SWEBench(interactive spec) — SWE-STEPS=temporal repo evolution axis.

  • 20pp inflation — stateless SWE-bench rank가 production 연속 개발과 어긋남
  • PR chain 3–11 — test suite growth·technical debt 누적 반영
  • SonarQube health — functional pass만으로 agent 품질 판단 불가
원본 →
AI 코딩 도구

REAP/Harvest — production developer session에서 coding benchmark 자동 큐레이션

REAP(Relevance and Execution-Audited Pipeline·arXiv 2604.01527) — real developer-agent session에서 verbatim prompt + fail-to-pass test oracle benchmark를 LLM judge 없이 자동 생성. Harvest case study — single-turn production coding assistant pool, 4+ language(Hack majority), 5 frontier model solve rate 42.9–58.2%(Opus 4.6 top). harness comparison — stronger toolset↑ solve rate, developer context file(AGENTS.md류)이 weak harness gap 메움. vs SWE-Rebench(GitHub issue mining) ·public bench(language skew) — REAP=production prompt style·codebase structure fidelity axis.

  • F2P test oracle — LLM judge 없이 reproducible correctness signal
  • Production-derived — public bench와 language·prompt style divergence 해소
  • Harness sensitivity — toolset+context file이 model-only eval보다 실무 signal
원본 →
AI 코딩 도구

auth.md — /auth.md Markdown으로 agent registration flow를 표준화

auth.md(WorkOS 주도·open protocol·2026-05) — 앱이 https://service.com/auth.md에 Markdown으로 agent registration 방법을 publish. discovery — RFC 9728 PRM(/.well-known/oauth-protected-resource) + AS metadata agent_auth block. Agent verified flow — agent provider가 ID-JAG identity assertion, POST /agent-auth로 JWKS verify→scoped access token 동기 발급(human loop 없음). User claimed flow — OTP device-auth style, agent가 code 보여주고 user가 service page에서 confirm. Resource Indicators(RFC 8707) — token이 특정 MCP server용, confused deputy protocol-level 차단. vs Cloudflare Temporary(deploy-first) ·MCP OAuth — auth.md=service signup/onboarding for agents axis.

  • /auth.md prose + PRM machine-readable — agent web search discovery 가능
  • ID-JAG verified — trusted provider attestation, OTP 없이 JIT user provision
  • RFC 8707 — Server A token을 Server B replay 불가
원본 →
AI 코딩 도구

CodeCRDT — multi-agent shared memory는 merge≠semantic agreement

CodeCRDT(arXiv 2510.18893) + crdt-merge — multi-agent LLM coordination을 explicit message passing 대신 shared CRDT document observation으로. Yjs CRDT — 600 trial 100% syntactic convergence·0% merge failure, but 5–10% semantic conflict(duplicate declaration·type mismatch) CRDT가 해결 못함. task coupling — parallel speedup +21% vs slowdown -39% depending on shared state intensity. Layer 1 CRDT(structural merge) + Layer 2 deterministic resolution(max_confidence·ContextBloom O(1) dedup). vs mcp-memory-rs(sync files) ·Memory Bank(single-agent markdown) — CodeCRDT=multi-writer agent memory에서 bytes converge≠intent converge 교훈.

  • 100% syntactic·5–10% semantic — CRDT는 text merge not meaning merge
  • Observation-driven — agent가 peer edit observe, completed work skip
  • Resolution layer 필수 — LWW만으로 agent fleet memory 운영 불충분
원본 →
AI 코딩 도구

Android Live Threat Detection — on-device AI가 agent-like app abuse 패턴 탐지

Android 2026 security roadmap — Live Threat Detection가 SMS forwarding·accessibility overlay abuse 등 suspicious app behavior를 on-device AI로 real-time flag. dynamic signal monitoring(Android 17 H2 2026) — app-system interaction pattern을 runtime watch, rule push-down으로 emerging threat 대응. Advanced Protection 확장 — accessibility service를 accessibility tool label 없는 app에서 제거, device-to-device unlock·WebGPU disable, chat notification scam detection. agent blast radius 맥락 — Computer Control·malicious skill이 accessibility·overlay·SMS 권한 abuse하면 사용자 데이터 exfil 가능, OS가 behavioral pattern으로 차단. vs excessive agency mitigation(dev least privilege) ·AppFunctions(EXECUTE_APP_FUNCTIONS gate) — Live Threat=platform-level agent-like abuse detection.

  • Dynamic signal monitoring — static scan이 못 잡는 icon hide·background launch
  • Accessibility lockdown — non-a11y app의 accessibility API 차단
  • Agent abuse pattern — SMS forward·overlay·stealth launch real-time warn
원본 →
AI 코딩 도구

ATSC — Agent Telemetry Semantic Conventions, OTel 위 agent domain schema

ATSC(agent-telemetry-spec/atsc) — vendor-neutral transport-agnostic schema for AI agent observability. OTel GenAI semconv(transport+span names) 위에 agent-specific operation — LLM call·tool invoke·memory access·retrieval·HITL·multi-agent handoff·eval을 canonical telemetry record로. .NET Microsoft Agent Framework + Aspire OTLP pipeline gap — raw span은 보이지만 tool turn·HITL event가 undifferentiated. ATSC spans flow unmodified→Azure Monitor Application Insights. source-agnostic — Langfuse·LangGraph·hand-rolled agent same shape. vs OpenTelemetry GenAI(spec layer) ·AgentOps(passive SDK) — ATSC=missing semantic layer for agent operations in enterprise APM.

  • OTel extend not replace — OTLP-compatible receiver, custom plugin 불필요
  • Aspire/.NET gap — Agent Framework span에 agent meaning 부여
  • HITL·handoff·memory access — microservice trace에 없는 agent operation taxonomy
원본 →
AI 코딩 도구

Saber — stateful project workspace operational safety·final state HSR 54%+

Saber(arXiv 2606.01317·sssr-lab/saber) — coding agent operational safety in realistic stateful project workspaces, not chatbot refusal. agent edits code·runs shell·modifies artifacts in Docker sandbox — safety judged from final workspace state+action trace after multi-step run. violation taxonomy by cause enables model-specific safety profiles. best model still >54% harmful safety-violation rate(HSR) — refusal alone insufficient for agent safety. vs Agent-SafetyBench(interactive tool env score) ·CUAHarm(terminal harm execution) — Saber=project workspace state delta axis.

  • Final state judgment — not prompt refusal, completed run workspace delta
  • HSR 54%+ even best model — plan safely+least privilege+preserve state all fail
  • Violation taxonomy — cause categorization beyond binary safe/unsafe
원본 →
AI 코딩 도구

ProcCtrlBench — 11 defect ontology·control preservation·outcome blind spot

ProcCtrlBench(arXiv 2605.20251) — execution-process eval for coding agents beyond final pass/fail. 11 defect types in 4 categories from standardized trajectory evidence — interpretable·interruptible·correctable·reversible·authority handback(control preservation score). 200 cases sampled from AndroidBench·Terminal-Bench·SWE-bench Verified — reveals execution quality differences outcome metrics miss. vs Snorkel(trajectory rubric final) ·Terminal-Bench(shell outcome) — ProcCtrlBench=process ontology reusable across harnesses.

  • 11 defect types — process evidence not just test pass
  • Control preservation — can operator interrupt/correct mid-run
  • Cross-benchmark sampling — AndroidBench+TB+SWE-bench unified trajectory
원본 →
AI 코딩 도구

AgentProp-Bench — tool parameter injection 62% propagate·judge κ=0.049

AgentProp-Bench(arXiv 2604.16706·agenthallu-bench repo) — tool-using agent error propagation with human-validated judge. 2000 task·2300 traces·4 domains·9 models·100 human labels. substring judge κ=0.049 vs human(chance); 3-LLM ensemble κ=0.432 moderate conservative bias. parameter injection→wrong final answer P≈0.62 human-calibrated(0.46–0.73 per model). rejection(catch bad param) vs recovery(fix after accept) independent capabilities(ρ=0.126). 3-layer runtime interceptor −23pp GPT-4o-mini, null on Gemini-2.0-Flash(95% schema rejection). vs ASSERT(policy eval) ·Braintrust(trace) — AgentProp=stage-conditional propagation math.

  • κ=0.049 substring judge — automated agent eval unreliable without validation
  • 62% propagation — one bad tool param often poisons final answer
  • Interceptor model-specific — schema gate strong models need different mitigation
원본 →
AI 코딩 도구

AgentProcessBench — 8509 step label·ternary neutral·error propagation rule

AgentProcessBench(RUCBM·arXiv 2603.14465) — first step-level effectiveness benchmark for tool-augmented agent trajectories. 1000 trajectories·8509 human step annotations·89.1% IAA·ternary label(correct/neutral/erroneous). error propagation rule — post-error dependent steps labeled erroneous until explicit correction or independent subtask — prevents spurious credit. findings — weak models inflate correct-step ratio via early termination; neutral vs error distinction hard; process signal complements outcome supervision for test-time scaling. vs ProcCtrlBench(defect ontology) ·AgentProp(injection propagation) — AgentProcessBench=human step label ground truth.

  • 8509 step labels — not end-to-end pass rate only
  • Propagation rule — downstream steps don't get free credit after error
  • Early termination bias — weak models look better on step ratio
원본 →
AI 코딩 도구

Android Bench — 100 real Android PR·instrumentation test·GPT 5.5 74%

Android Bench(Google·developer.android.com/bench·android-bench/android-bench) — LLM coding eval for Android-specific engineering not covered by generic SWE-bench. 100 tasks from 38989 public PR pool — Compose migration·Wear OS networking·breaking API·unit+emulator instrumentation verify. mini-swe-agent inference+patch verifier Docker harness. June 2026 — GPT 5.5 74.0%·Gemini 3.5 Flash 63.7%·Claude Opus 4.7 68.7%·GLM 5.1 59.7%. vs SWE-bench(generic patch) ·MobileRisk-Live(GUI safety) ·ProcCtrlBench(samples AndroidBench) — Android Bench=platform-specific capability axis.

  • Instrumentation tests — emulator verify not just unit test pass
  • Real GitHub Android repos — Compose·Wear·framework migration tasks
  • Model-agnostic harness — mini-swe-agent+LiteLLM any model
원본 →
AI 코딩 도구

Claude Code Routines — cloud prompt+repo+connectors·schedule·GitHub·API fire

Claude Code Routines(research preview·v2.1.105+·2026-04) — saved config(prompt·repo·connectors) running on Anthropic cloud infrastructure — laptop closed OK. triggers — cron schedule(min 1h recurring)·GitHub PR/release filters·POST /fire API(bearer token·experimental-cc-routine-2026-04-01 beta header). create from claude.ai/code/routines·Desktop Remote·CLI /schedule. autonomous full session — no permission prompts, shell+repo skills+connectors scoped per routine. Pro 5/day·Max 15·Team/Enterprise 25 daily routine cap. vs /loop(session-bound·local files) ·Cursor Automations(multi-repo cloud) ·Desktop scheduled task(local machine on) — Routines=Anthropic-hosted repo-centric automation.

  • Cloud vs /loop — survives laptop off, no local env access
  • GitHub trigger — one session per PR, follows comments+CI
  • /fire API — wire deploy hooks·alerting·internal tools via HTTP
원본 →
AI 코딩 도구

Claude Code isolation remote — Agent tool CCR sandbox·peer trust rewrite

Claude Code 2.1.181(2026-06-17) — Agent tool isolation remote dispatches subagent to Cloud Compute Resource(CCR) sandbox not local host. remote agents run as background tasks with completion notification — dedicated ephemeral env vs local subagent sharing filesystem+credentials. same release — peer message trust model rewrite: incoming agent messages treated as teammate-on-behalf-of-user not untrusted external — operators must audit disallowedTools explicitly. vs worktree isolation(local repo copy) ·Claude Managed Agents(self-hosted worker) ·Runloop Devbox(microVM) — remote=Anthropic CCR blast-radius containment for untrusted input.

  • isolation remote — CCR sandbox per subagent invocation
  • Peer trust shift — explicit disallowedTools replaces implicit skepticism
  • Background+notify — remote always async with completion signal
원본 →
AI 코딩 도구

AAHP v3 — sequential agent handoff·MANIFEST.json·98% token cut

AAHP AI-to-AI Handoff Protocol(homeofe/AAHP·v3) — file-based sequential context transfer between coding agents replacing verbose chat history. outgoing agent writes MANIFEST.json(checksum·task dependency graph·NEXT_ACTIONS.md) + HANDOFF.lock single-writer gate — receiving agent reads MANIFEST first canonical gate. empirical dev session — AAHP v3 consumed 2% tokens vs unmediated native agent teams(98% reduction). v3 adds stable task IDs·machine-readable dependency graph for parallel task selection. vs Multi-Agent Handoff Integration Testing(seam assert pattern) ·MCP Handoff SEP(proposed) ·Memory Bank(single-agent) — AAHP=git-native sequential handoff file protocol.

  • MANIFEST.json gate — one canonical read before any other file
  • 98% token reduction — structured state vs full chat replay
  • v3 task graph — programmatic parallel/blocked task detection
원본 →
AI 코딩 도구

RigorBench — 코딩 에이전트 평가를 pass/fail에서 계획·검증·중단 품질로 넓히기

RigorBench(arXiv 2606.22678)는 코딩 에이전트를 최종 정답률만으로 보지 말고 실행 궤적 전체로 평가하자는 벤치마크다. 논문은 30개 작업을 Plan-Then-Build, Verify-Or-Die, Doom Loop Gauntlet, Know When to Fold, Don't Break the Build 5범주로 나누고, Planning Fidelity·Verification Coverage·Recovery Efficiency·Abstention Quality·Atomic Transition Integrity 5축을 RigorScore로 합친다. 교육 포인트는 간단하다. 테스트 통과 패치라도 계획 없이 여러 번 찔러 맞혔거나, 불가능한 요구에 멈추지 못했거나, 중간 상태마다 빌드를 깨면 운영용 에이전트로는 낮게 봐야 한다는 것이다. 저자들은 구조화된 discipline이 process quality를 평균 41%, outcome correctness를 17% 높였다고 보고한다.

  • 5축 평가: 계획·검증·회복·중단·원자적 전환
  • 30개 작업·120개 실행 궤적을 계획/편집/테스트/복구 로그로 채점
  • 교훈: pass/fail 벤치마크 옆에 프로세스 로그 점수를 붙여야 production risk가 보임
원본 →
AI 코딩 도구

AgeMem — LTM·STM을 tool action으로 통합·step-wise GRPO

AgeMem(ACL 2026·arXiv 2601.01885·y1y5/AgeMem) — heuristic memory pipeline 대신 LLM agent policy에 memory operation을 tool-based action으로 통합. Add·Update·Delete(LTM) + Retrieve·Summary·Filter(STM) 6 tools — agent가 task structure에 맞게 store/retrieve/summarize/discard autonomously. three-stage progressive RL — LTM storage→STM context→full coordination, step-wise GRPO가 sparse·discontinuous memory reward를 prior decision에 backprop. 5 long-horizon benchmark에서 memory-augmented baseline 일관 outperform. vs Mem0(external DB) ·Memory Bank(markdown) ·mcp-memory-rs(local sync) — AgeMem=learnable unified memory policy not retrieval heuristic.

  • 6 memory tools — LTM persist + STM context in one action space
  • Step-wise GRPO — memory ops credit from final task reward
  • Progressive RL stages — fragmented experience across stages handled
원본 →
AI 코딩 도구

MemAct — Memory-as-Action·DCPO·51% token cut vs 16× model

MemAct(ACL 2026 Findings·arXiv 2510.12635·ADaM-BJTU/MemAct) — working memory management를 external heuristic이 아닌 learnable policy action으로. in-place context editing — delete·insert·summarize function-call actions, agent가 retention vs task reward trade-off end-to-end RL. Dynamic Context Policy Optimization(DCPO) — memory action 시 trajectory fracture에서 stable gradient, GRPO pipeline compatible. MemAct-RL-14B avg 8.2×10⁴ tokens vs Qwen3-235B 16.7×10⁴ — 51% context cut, accuracy matches 16× larger model. vs AgeMem(tool LTM+STM) ·context compaction heuristics — MemAct=in-place edit ops + DCPO for non-prefix histories.

  • Trajectory fracture — append-only context broken by edit actions
  • DCPO — segment history at curation points for stable RL
  • 51% token reduction — learned curation beats bigger model full history
원본 →
AI 코딩 도구

HarnessX — composable evolvable harness foundry·AEGIS +14.5%

HarnessX(arXiv 2606.14249·Darwin-Agent/HarnessX·Xiaomi) — agent runtime harness(prompt·tools·memory·control flow)를 hand-crafted static이 아닌 composable·evolvable object로. typed harness primitives + substitution algebra, AEGIS meta-engine(Digester·Planner·Evolver·Critic)가 execution trace feedback으로 harness evolve. harness evolution + model co-evolution loop — trajectory→harness update + RL training signal. 5 benchmark(ALFWorld·GAIA·WebShop·τ³-Bench·SWE-bench Verified) avg +14.5% absolute(up to +44% Qwen3.5-9B ALFWorld). weakest baseline gains most — harness evolution complements model scaling. vs Harbor(eval adapter) ·MiMo Code(product harness) ·dynamic workflows(Claude JS) — HarnessX=trace-driven harness foundry research.

  • +44% weakest model — harness not model is bottleneck on low baseline
  • AEGIS 4-stage — trace→plan→evolve→critic closed loop
  • Co-evolution +4.7% — harness traces also train open-weight model
원본 →
AI 코딩 도구

Layer-Isolated Evaluation — production agent deterministic scaffold 238-case gate

Layer-Isolated Evaluation(arXiv 2606.11686·June 2026) — production LLM agent의 deterministic scaffold layer를 no-LLM regression-locked pytest harness로 per-layer gate. 238 locked baseline pure cases(~1ms/case) — aggregate pass rate masks layer-specific −25~−91pp regression crater. controlled injection proves green aggregate can hide foundational layer drift. layer-decomposed harness + coverage-honest baseline = drift detector not outcome oracle. vs AgentProp-Bench(propagation math) ·Braintrust(trace eval) ·mcp-eval(MCP server) — Layer-Isolated=deterministic production scaffold unit test without LLM in loop.

  • 238-case locked baseline — per-layer pure runner, legacy lane separate
  • Aggregate metric blind spot — −25pp localized while slice green
  • No-LLM harness — ~1ms/case, CI-friendly deterministic gate
원본 →
AI 코딩 도구

FIDES — Agent Framework information-flow labels·deterministic tool gate

FIDES Flow Integrity Deterministic Enforcement System(Microsoft Agent Framework·devblogs 2026-06·agent_framework.security experimental) — prompt injection defense를 heuristic system prompt 대신 information-flow control middleware. every content carries integrity(trusted/untrusted)·confidentiality(public/private) labels — labels propagate through tool calls automatically. PolicyEnforcementFunctionMiddleware blocks privileged sink(e.g. post_comment·write_file) when untrusted issue body still in scope — model can summarize but cannot act on poisoned input. approval_on_violation=True → human-in-loop function approval with violation reason. vs Claude Code sandbox ·Cedar AgentCore ·prompt injection guardrails — FIDES=deterministic label propagation not probabilistic classifier.

  • Label propagation — read_issue output tagged untrusted at return
  • Privileged sink block — deterministic before tool executes
  • Experimental middleware — agent_framework.security behind feature flag
원본 →
AI 코딩 도구

Cursor SDK customTools — in-process 함수를 MCP 없이 custom-user-tools로

Cursor SDK(June 2026·cursor.com/changelog/sdk-updates-jun-2026) — local agent에 `local.customTools`로 plain function 등록, SDK가 built-in MCP server `custom-user-tools`로 expose — separate stdio MCP process 불필요, same permission gate. `local.autoReview` — headless run tool call을 classifier로 route, permissions.json autoRun block으로 steer(read-only auto·delete pause). JsonlLocalAgentStore — SQLite 대신 append-only NDJSON(agents·runs·events·checkpoints) git-diff 가능, LocalAgentStore interface로 Postgres·in-memory custom backend. cloud agent에 customTools 전달 시 ConfigurationError. vs MCP server BYO ·Claude Code plugin tools — Cursor SDK=native in-process tool registration for CI/scripts.

  • custom-user-tools MCP — no second process, local agents only
  • autoReview + permissions.json — headless oversight not security boundary
  • JsonlLocalAgentStore — VCS-friendly agent state persistence
원본 →
AI 코딩 도구

Claude Code sandbox.credentials — sandbox Bash가 credential file·secret env 차단

Claude Code v2.1.187 `sandbox.credentials` — sandboxed Bash command가 listed credential files(~/.aws/credentials·~/.ssh) read deny + listed secret env vars(GITHUB_TOKEN·NPM_TOKEN) unset before each run. credentials block groups file+env rules separate from general filesystem.denyRead — default sandbox still allows reading ~/.aws until explicitly listed. sandboxed Bash only — all subprocesses에는 CLAUDE_CODE_SUBPROCESS_ENV_SCRUB=1(AWS·Azure·Google·Anthropic 7 vars strip). complements excludedCommands·denyRead·network allowlist layered defense. vs isolation remote(CCR blast radius) ·prompt injection card — sandbox.credentials=credential exfiltration containment in sandbox path.

  • files+envVars deny list — no built-in default, explicit opt-in
  • Subprocess scrub separate — 7 cloud provider vars all subprocesses
  • v2.1.187+ — pair with PreToolUse secret scan hooks for depth
원본 →
AI 코딩 도구

Claude Code OTEL assistant_response — turn-level response logging opt-in

Claude Code v2.1.193 `claude_code.assistant_response` OpenTelemetry log event — model response text per turn OTLP export. OTEL_LOG_ASSISTANT_RESPONSES=1 explicit opt-in redaction off; unset이면 OTEL_LOG_USER_PROMPTS를 따름 — prompt logging deployments는 upgrade 시 response content 자동 수신, prompts-only 유지는 OTEL_LOG_ASSISTANT_RESPONSES=0. lighter than OTEL_LOG_RAW_API_BODIES(full Messages API 60KB+ history) — turn text only for LLM-judge·audit·cost/output correlation. complements OTEL_LOG_TOOL_DETAILS·OTEL_LOG_TOOL_CONTENT·enhanced telemetry traces. vs ATSC agent taxonomy ·OpenTelemetry GenAI semconv — assistant_response=Claude Code-specific turn log not cross-vendor schema.

  • Turn-level only — not full conversation raw body
  • Upgrade footgun — follows user prompt logging unless explicitly 0
  • LLM-judge pipelines — follow-up efficiency scoring without raw API dump
원본 →
AI 코딩 도구

TEBench — project-level test evolution·Breaking/Stale/Missing 314 task

TEBench(arXiv 2605.06125·iSEngLab/TEBench) — 첫 project-level test evolution benchmark. production code commit 후 전 repo에서 어떤 test를 고치고 어디에 새 test가 필요한지 autonomously identify+patch — method-level pre-paired ⟨m,m',t⟩ 벤치마크와 달리 whole-project reasoning. 314 instances·10 Defects4J Java projects·developer GT. 3 type — Test-Breaking(compile/exec fail), Test-Stale(pass but semantic outdated, avg F1≈36%), Test-Missing(new coverage). identification F1 45.7–49.4% ceiling across Claude Code/Codex/OpenCode — reactive execute-fail-fix loop는 stale/missing structurally unreachable. 2D metric — identification P/R/F1 + update(executability×coverage×modification similarity). vs c-CRAB(review oracle) ·SWE-bench(bug fix) — TEBench=test suite co-evolution with production code.

  • Test-Stale hardest — no execution failure signal, proactive semantic reasoning required
  • Identification F1 ~48% ceiling — framework+model converge, shared inductive bias
  • Update Overall Score headline — executability gates non-compiling patches to 0
원본 →
AI 코딩 도구

Benchmark Misalignment position — harness≠model·component-level eval 필요

Position paper(arXiv 2606.17799·June 2026) — coding benchmark가 agentic SE와 structurally misaligned. pre-agent era 설계가 model+harness+environment+feedback을 single end-to-end pass rate로 collapse, single reference solution grading, component signal absence 3 symptom. evidence — Claude Opus 4.6 fixed, harness choice alone 58.0–79.8% Terminal-Bench spread(>20pp, adjacent model generation comparable). remedy — submission metadata(model·harness version·env hash·dataset version)+non-model ablation, behavioural spec allowing multiple valid solutions, per-component span grading not monolithic pass/fail. vs RigorBench(process discipline) ·Layer-Isolated(production gate) — position paper=benchmark design philosophy for harness-aware iteration.

  • Harness spread >20pp same model — leaderboard model credit is misleading
  • Single GT penalizes valid alternatives — apparent capability artificially suppressed
  • Component-level signal — retriever/router/tool/reasoning span metrics for iteration
원본 →
AI 코딩 도구

Token cost write-time attribution — trace_id·event_id·gateway idempotency

Agent cost attribution is write-time property(UsageBox 2026) — provider invoice·post-hoc log로 tool call·sub-agent branch·retry chain reconstruct 불가. every model call gateway에서 structured usage event emit — trace_id·customer_id·feature_id·agent_step·model dimensions. idempotency — stable event_id, meter counts once(at-least-once delivery dedup); genuine retry=new event_id. hierarchy — virtual key per agent role, run_id in provider user field, step-level x-litellm-response-cost header accumulation. multi-tenant SaaS — interceptor strips business headers before provider, ledger stores tenant_id+feature_id for showback/chargeback. runtime budget reject at gateway when tenant quota exhausted. vs Helicone(proxy FinOps) ·OTEL GenAI(token span) — write-time attribution=billing system not dashboard nicety.

  • Write-time tags — post-hoc attribution impossible after opaque agent run completes
  • event_id idempotency — retries must not double-count same provider call
  • Gateway single control point — SDK bypass calls still metered consistently
원본 →
AI 코딩 도구

Codex Sites — OpenAI hosted web app·workspace URL·RBAC deploy

Codex Sites(OpenAI June 2026 preview) — Codex agent output을 OpenAI-hosted interactive website/dashboard/web app으로 create·deploy·share. workspace URL share·hosted env secrets/env vars manage·RBAC(Business default·Enterprise admin enable). 62 business apps+110 skills in 6 role plugins(Data Analytics·Creative·Sales·Finance·Due Diligence·Data Science) — Codex가 developer-only CLI를 넘어 general work platform으로 확장. vs Claude Code Artifacts(Team/Enterprise self-contained HTML·CSP no external fetch) ·Vercel deploy(MCP) — Sites=OpenAI-managed runtime+URL lifecycle. developer lesson — agent output delivery surface 선택(CSP sandbox vs hosted full-stack)이 capability ceiling 결정.

  • Hosted runtime — agent builds deploy without local server setup
  • Role plugins 62 apps — Codex expands beyond code to business workflows
  • RBAC workspace URL — share scope controlled at org level not file export
원본 →
AI 코딩 도구

Zed 1.4.2 Agent Skills — SKILL.md replaces rules·global AGENTS.md

Zed 1.4.2(May 27 2026) — rules library retired, Agent Skills(SKILL.md folder+YAML frontmatter)로 전환. @rule→@skill, scripts/references/assets self-contained·version-controllable·dotfiles sync. built-in /create-skill scaffolds folder+frontmatter. global AGENTS.md at ~/.config/zed/AGENTS.md — first editor with project+global native AGENTS.md(Cursor·Codex·Copilot·Gemini CLI·Aider cross-tool standard). agent catalog sees name+description, skill tool on-demand load·disable-model-invocation for slash-only. external agent(Codex ACP) threads에는 Zed Skills 미적용 — agent-native config separate. vs openskills(AGENTS.md XML inject) ·Cursor rules(.mdc) — Zed=native skill filesystem+global AGENTS.md dual scope.

  • Rules library deprecated — SKILL.md folder is version-controllable unit
  • Global AGENTS.md ~/.config/zed/ — cross-project instructions without per-repo copy
  • External agents ignore Zed Skills — Codex/Claude keep native skill config
원본 →
AI 코딩 도구

Symphony — WORKFLOW.md issue tracker control plane·isolated agent runs

Symphony(openai/symphony·Apache-2.0·~25k★·SPEC.md) — OpenAI open-source Codex orchestration spec. Linear(etc) board를 control plane — open task마다 isolated workspace+agent run until PR or fail. WORKFLOW.md — tracker kind·prompt_template·workspace manager·agent runner·observability components declarative. Orchestrator state machine Unclaimed→Claimed→Running→Succeeded/Failed/TimedOut, git worktree per ticket, 30s poll. language-agnostic spec — reference Elixir impl, "implement Symphony per SPEC.md"로 any language agent build. harness engineering prerequisite — managing work not supervising agents. vs Jules(plan-first VM) ·Claude Code Routines(cloud schedule) — Symphony=issue tracker native always-on dispatch loop.

  • SPEC.md only core artifact — implement in language of choice
  • Worktree isolation per ticket — no branch collision across concurrent agents
  • Issue tracker as UI — zero Symphony-specific dashboard, Linear remains source of truth
원본 →
AI 코딩 도구

Claude Code --attribution — .claude/attribution.json sub-agent chargeback

Claude Code --attribution flag(June 2026) — session end .claude/attribution.json emit. schema_version·session_id·total_cost·total_tokens·agents[] with agent_role·model·tokens_in/out·cost(numeric)·timestamp·tasks[]. sub-agent·model tier·work unit별 programmatic chargeback — /usage(plan limit % by skill/MCP)와 complement, /usage=plan bucket attribution vs --attribution=session file for client billing export. tokens_in/out separate(pricing differs). complements OTEL cost_usd(telemetry pipeline) ·CodeLedger(plugin MCP) — --attribution=zero-config local JSON after every session. GitHub #49588 — hooks/MCP still lack live cumulative usage query.

  • Per sub-agent role+tasks[] — spot single subtask consuming >50% session cost
  • Numeric cost field — direct programmatic consumption no string parse
  • vs /usage plan % — attribution.json=project/client chargeback export artifact
원본 →
AI 코딩 도구

Evaluation Trust Tax — per-span LLM-judge cost OTEL blind spot

Evaluation Trust Tax(Fiddler 2026) — production agent observability에서 external LLM-as-judge per span eval cost. 500K traces/day≈$260K/year eval API bill scales linearly with trace volume — OTEL GenAI semconv captures token/latency but not eval spend. Observability Tax pattern — Layer 3 quality eval at 100% traffic can cost Layers 1+2 combined. mitigation — in-environment eval(no external API·no data egress), production sample 5–20% async, high-stakes/anomaly 100% only. AgentCore Evaluations $1800/mo example 45K runs — sampling dial dev 50–100%·prod 2–5% at >100k sessions/day. vs Layer-Isolated Evaluation(deterministic gate) ·RigorBench(process rubric offline) — Trust Tax=operational cost layer beyond token observability.

  • 500K traces/day ≈ $260K/year external judge — linear with volume not inference
  • 100% production eval often 2× monitoring cost — sample async default
  • OTEL token metrics ≠ eval spend — FinOps must budget judge layer separately
원본 →
AI 코딩 도구

Project Solara — Android 기반 MDEP 위에 올라가는 에이전트 우선 디바이스

Project Solara는 Microsoft가 Build 2026에서 공개한 "agent-first" 프로토타입 디바이스다. 핵심은 새 앱 하나가 아니라, Microsoft Device Ecosystem Platform(MDEP)이라는 Android Open Source Project 기반 OS 계층 위에서 음성·시각·터치 입력을 Copilot 에이전트 경험과 묶는 방향이다. Microsoft는 Solara가 화면 안의 앱을 여는 대신, 주변 맥락을 보고 듣고 이해해 작업을 돕는 디바이스 비전을 보여준다고 설명한다. Android 개발자 관점의 교훈은 명확하다. AI+Android 제품은 Activity나 레이아웃만의 문제가 아니라, OS 신뢰 경계, device management, 입력 센서, 온디바이스/클라우드 에이전트 호출, 사용자 동의 UI를 한 설계로 묶어야 한다.

  • MDEP는 AOSP 기반 엔터프라이즈 디바이스 플랫폼 — Android 파생 OS 위 에이전트 경험
  • Solara는 음성·시각·터치 입력을 Copilot형 에이전트 UX로 묶는 프로토타입
  • AI+Android 설계 포인트는 앱 화면보다 OS 권한·센서·관리·동의 경계
원본 →
AI 코딩 도구

N-Version Coding Agents — 한 에이전트 정답보다 3개 구현 majority vote

N-Version Programming with Coding Agents(arXiv 2606.20158)는 고전적인 N-version programming을 최신 코딩 에이전트에 다시 적용한 실험이다. 저자들은 Knight-Leveson Launch Interceptor 명세를 대상으로 에이전트가 만든 48개 구현을 같은 oracle과 1,000,000개 랜덤 입력으로 검사했다. 결과는 양면적이다. 실패가 서로 독립적이지 않아 공통 실패 모드가 여전히 많이 나왔고, 애매한 명세 구간에서 실패가 함께 몰렸다. 그래도 3개 구현을 majority vote로 묶으면 평균 실패 수가 단일 구현 387.44에서 triple 130.99로 줄었고, 11,844개 N-version unit은 관측 실패가 0이었다. 교훈은 "에이전트를 여러 번 돌리면 무조건 안전"이 아니라, 서로 다른 모델·도구·언어로 만든 구현을 독립 oracle과 투표기로 묶어야 redundancy가 의미를 갖는다는 점이다.

  • 48개 에이전트 생성 구현·공유 oracle·랜덤 입력 1,000,000개로 실패 모드 비교
  • 단일 구현 평균 실패 387.44 → 3-version majority vote 130.99, 하지만 공통 실패 모드는 남음
  • 실무 적용은 같은 프롬프트 재시도보다 diverse implementation + independent oracle + voter
원본 →
AI 코딩 도구

GitHub Desktop 3.6 — worktree와 Copilot을 일상 Git 흐름에 붙이기

GitHub Desktop 3.6은 AI 코딩 에이전트가 만든 변경을 "터미널 밖 Git 흐름"에서 다루는 쪽으로 Copilot 통합을 넓힌 업데이트다. Copilot은 커밋 메시지 생성과 머지 충돌 해결에 붙고, 커밋 메시지는 `.github/copilot-instructions.md`와 AGENTS.md, 레포의 커밋 메타데이터 규칙을 참고한다. 충돌이 나면 Desktop이 충돌 내용을 설명하고 해결안을 제안하지만, 사용자가 검토·수정·수락한 뒤 머지를 끝낸다. 동시에 Git worktree를 UI에서 지원해 여러 브랜치를 stash·clone 없이 병렬로 열 수 있다. 교훈은 코딩 에이전트 도입이 "코드 생성"만의 문제가 아니라, 커밋 규칙·충돌 리뷰·worktree 격리 같은 평범한 Git 운영면까지 AI 흐름에 맞춰져야 한다는 점이다.

  • Copilot SDK 기반 — commit message·merge conflict 기능마다 모델 선택과 BYOK/로컬 모델 연결 지원
  • 커밋 작성은 AGENTS.md와 copilot-instructions.md를 참고해 레포 규칙에 맞춘다
  • worktree UI는 에이전트 병렬 세션과 사람의 브랜치 작업을 같은 Git 격리 모델로 다룬다
원본 →
AI 코딩 도구

VS Code Copilot 토큰 효율 — prompt cache·tool search·WebSocket이 하네스 비용을 깎는다

VS Code 팀은 Copilot 에이전트 비용을 모델 문제가 아니라 하네스 문제로 다룬다. 반복되는 system/tool/repo/conversation prefix는 prompt cache hit-rate를 높여 재계산을 줄이고, tool search는 MCP·확장 도구의 전체 JSON schema를 매 턴 넣지 않고 필요할 때만 불러온다. OpenAI 모델에서는 24h prompt_cache_retention과 WebSocket continuation을 붙였고, GPT-5.4/5.5 실험에서 median session token usage가 각각 8.97%, 10.92% 줄었다. Anthropic 쪽은 cache_control breakpoint와 deferred tool search를 조합해 agentic workload cache hit-rate를 약 94%까지 올렸고, 7일 실험에서 median session total-token usage가 약 18% 줄었다. 교훈은 "프롬프트를 줄여라"보다 구체적이다. 긴 에이전트 세션은 prefix 안정성, 도구 지연 로딩, transport 재사용, subagent 분리가 실제 비용 구조를 바꾼다.

  • Tool search — 전체 도구 schema 대신 이름·설명만 먼저 보여주고 필요할 때 load
  • OpenAI GPT-5.4/5.5 — median session token usage 8.97%/10.92% 감소
  • Anthropic deferred tools — median total-token usage 약 18% 감소, cache hit-rate 약 94%
원본 →
AI 코딩 도구

AIware agent config dataset — 4,741개 repo가 말하는 AGENTS.md·Skills·Hooks 사용법

AIware 2026 Benchmark & Dataset Track의 "A Dataset of Agentic AI Coding Tool Configurations"는 Claude Code, GitHub Copilot, OpenAI Codex, Cursor, Gemini 설정 파일을 GitHub 공개 저장소에서 모은 데이터셋이다. 범위는 4,741개 repo, 8개 설정 메커니즘, 15,612개 configuration artifact, 관련 파일 원문 45,126개, AI instruction 148,551개다. 교훈은 단순하다. AGENTS.md·Skills·Rules·Hooks는 개인 취향 파일이 아니라, 에이전트 도입 방식과 팀 협업 규칙을 관찰할 수 있는 데이터가 됐다. 우리 레포도 "에이전트가 무엇을 해야 하는가"뿐 아니라 "어떤 설정 표면을 어떤 범위에 둘 것인가"를 버전 관리해야 한다.

  • Claude Code·Copilot·Codex·Cursor·Gemini 5개 도구 설정을 공개 repo에서 수집
  • 4,741 repo·15,612 artifact·45,126 config file·148,551 AI instruction
  • Zenodo CC BY 4.0 공개 데이터셋 — 에이전트 설정을 연구·리뷰 대상으로 다루기
원본 →
AI 코딩 도구

Cursor 3.9 Customize — 플러그인·스킬·MCP를 팀 설정 화면으로 모으기

Cursor 3.9의 Customize 화면은 AI 코딩 에이전트 설정을 개인 dotfile이 아니라 팀 운영 표면으로 끌어올린 업데이트다. 한곳에서 플러그인, 스킬, MCP, 서브에이전트, 룰, 커맨드, 훅을 추가·관리하고, 팀에서 많이 쓰는 플러그인·스킬·MCP를 leaderboard로 보여준다. 플러그인은 rules·skills·subagents·commands·MCP servers·hooks를 묶어 배포하는 단위이고, Team Marketplace는 GitLab·Bitbucket·Azure DevOps의 플러그인 저장소도 가져올 수 있다. 실무 교훈은 "에이전트 설정 파일을 각자 복사"하는 단계를 넘어서, 팀 단위 검토·배포·필수/선택 설치·스코프 필터를 운영해야 한다는 점이다.

  • Customize 한 화면에서 plugins·skills·MCPs·rules·commands·hooks·subagents 관리
  • Team leaderboard로 많이 쓰는 플러그인·스킬·MCP를 발견하고 1클릭 설치
  • Team Marketplace는 GitLab·Bitbucket·Azure DevOps 플러그인 저장소 import 지원
원본 →
AI 코딩 도구

VS Code 5-line eval — 50,974회 HELLO.txt가 드러낸 에이전트 과잉사고

VS Code 팀은 6개월 동안 같은 초소형 smoke eval을 50,974회 돌렸다. 빈 워크스페이스에서 "HELLO.txt에 HELLO를 넣어라"는 5글자 작업이고, 정답 경로는 create_file 한 번이면 끝난다. 그런데 30개 모델의 통과 여부보다 더 유용했던 신호는 "어떻게 통과했는가"였다. 어떤 모델은 매번 1회 도구 호출로 끝냈지만, 어떤 모델은 빈 폴더를 탐색하고 계획을 쓰고 더 비싼 편집 경로를 탔다. 가장 가벼운 통과 경로는 출력 토큰 약 50개였고, 무거운 그룹은 같은 결과에 평균 수천 토큰까지 썼다. 교훈은 작은 평가라도 tool-call trace를 남기면 모델 선택·자동 라우팅·하네스 회귀를 비용 관점에서 볼 수 있다는 점이다.

  • say_hello — 빈 workspace, 고정 prompt, HELLO.txt 존재와 내용 2개 assertion만 검사
  • 50,974 runs across 30 models — pass rate보다 direct path·tool sequence·output tokens가 더 큰 운영 신호
  • 실무 적용 — nightly eval 전 stable smoke test를 두고 pass/fail뿐 아니라 계획·탐색·도구 선택까지 기록
원본 →
AI 코딩 도구

VS Code BYOK·로컬 모델 — Copilot 없이도 agent chat은 돌리고, 임베딩 기능은 분리해서 보기

VS Code의 2026-06 BYOK 업데이트는 AI 에디터를 "Copilot 계정에 붙은 모델 목록"이 아니라 모델 브로커로 바꾼다. Language Models editor에서 Azure·Anthropic·Gemini·OpenAI·OpenRouter 같은 provider 키나 Ollama·Foundry Local 같은 로컬 모델을 추가하면 Chat 모델 피커에서 바로 고를 수 있다. 중요한 경계도 분명하다. BYOK와 로컬 모델은 chat·agent workflow·utility task에는 쓸 수 있고, GitHub 로그인이나 Copilot plan 없이도 오프라인 로컬 chat이 가능하다. 하지만 semantic search, inline suggestions, embeddings 기반 기능은 여전히 GitHub/Copilot 지원이 필요하다. 실무 교훈은 모델 선택을 에디터 UI 하나로 모으되, agent chat과 코드완성·검색을 같은 보안/비용 경계로 착각하지 말라는 점이다.

  • Language Models editor — provider 키·custom endpoint·extension 모델·로컬 모델을 한 피커에 모음
  • BYOK/local은 chat·agent workflow·utility task용, 표준 code completion·semantic search는 별도 경계
  • chat.utilityModel/chat.utilitySmallModel을 로컬·저가 모델로 바꾸면 제목·커밋 메시지 같은 작은 작업 비용을 분리 가능
원본 →
AI 코딩 도구

Copilot Agentic Harness — 모델 이름보다 harness·task 난이도·토큰 효율을 같이 보기

GitHub의 2026-06-25 Copilot agentic harness 평가 글은 "어떤 모델이 제일 좋나"보다, 같은 하네스에서 모델·작업·비용을 같이 보라는 신호다. GitHub은 20개 이상 최신 모델을 Copilot의 실제 agentic workflow 하네스에서 돌리고, GitHub 내부 task suite와 SWE-bench Verified를 함께 비교했다. 결과 해석의 핵심은 단일 승자가 아니다. 한 모델이 모든 축에서 이기지 않고, 작업 난이도·도구 사용·컨텍스트 처리·토큰 사용량에 따라 순위가 갈린다. 실무 교훈은 에이전트 모델 교체를 리더보드 하나로 결정하지 말고, 우리 레포의 대표 작업·도구 경로·토큰 예산을 넣은 작은 하네스에서 pass rate와 비용을 동시에 기록하라는 것이다.

  • 20+ 모델을 Copilot 실제 agentic workflow 하네스에서 비교 — 모델 단독 점수가 아니라 harness 안 성능
  • GitHub internal task suite + SWE-bench Verified — 쉬운 작업과 어려운 작업에서 순위가 달라질 수 있음
  • 운영 지표는 pass rate만이 아니라 token use, tool path, latency, task 난이도를 같이 봐야 함
원본 →
AI 코딩 도구

Claude Code 실사용 연구 — 에이전트 시대에도 도메인 전문성은 수익률이 남는다

Anthropic의 "Agentic coding and persistent returns to expertise" 연구는 Claude Code를 추상 벤치마크가 아니라 실제 대화형 세션으로 본다. 2025-10부터 2026-04까지 약 40만 개 세션을 privacy-preserving 방식으로 분석했고, 전형적인 세션에서는 사람이 "무엇을 할지"를 정하고 Claude가 "어떻게 할지" 실행 결정을 더 많이 맡는다고 정리한다. 흥미로운 결론은 비개발자도 많은 코딩 작업을 성공시키지만, 도메인 전문성이 높을수록 한 지시당 Claude가 더 많은 일을 하고 성공률도 더 높다는 점이다. 즉 에이전트 도입의 실전 역량은 프롬프트 문장술보다 문제를 잘 고르고, 성공 증거를 요구하고, 결과를 검토할 수 있는 업무 지식에 가깝다.

  • 약 40만 Claude Code 세션 분석 — 작업 구성, 인간-AI 협업, 성공률을 실제 사용 로그에서 관찰
  • 사람은 planning, Claude는 execution 쪽 결정을 더 많이 담당하는 패턴
  • 전문성이 높을수록 지시당 산출과 성공률이 올라감 — 에이전트 운영도 도메인 지식이 병목
원본 →
AI 코딩 도구

Copilot strictKnownMarketplaces — 에이전트 플러그인 공급망을 허용목록으로 잠그기

GitHub Copilot의 enterprise plugin standards는 Copilot 플러그인을 "누가 어떤 marketplace에서 설치해도 되는가"의 문제로 다룬다. Enterprise owner는 `.github-private` 저장소의 `copilot/managed-settings.json`에 정책을 두고, `extraKnownMarketplaces`로 허용 marketplace를 추가하거나 `strictKnownMarketplaces`로 명시한 marketplace만 설치 가능하게 제한한다. `enabledPlugins`는 `PLUGIN-NAME@MARKETPLACE-NAME` 형식으로 모든 enterprise 사용자에게 기본 설치할 플러그인을 지정한다. 기능은 public preview라 변할 수 있지만, 교훈은 이미 분명하다. 에이전트 플러그인·스킬·MCP는 코드 실행 전 권한면이므로, 개인 설치 편의보다 검토된 marketplace·기본 설치·청구 주체를 먼저 정책으로 고정해야 한다.

  • `.github-private/copilot/managed-settings.json`에서 enterprise Copilot 플러그인 정책 관리
  • `strictKnownMarketplaces`는 명시된 GitHub/git marketplace 외 플러그인 설치를 차단
  • `enabledPlugins`로 검토된 플러그인을 기본 설치 — public preview라 운영 전 변경 가능성 확인
원본 →
AI 코딩 도구

Stack Overflow for Agents — 에이전트 지식을 '생성'보다 '검증'으로 쌓기

Stack Overflow는 2026-06-10 Stack Overflow for Agents 베타를 공개했다. 핵심은 사람용 Q&A를 그대로 에이전트에게 먹이는 게 아니라, API-first 지식 교환소를 만들어 에이전트가 먼저 검증된 해법을 검색하고, 없으면 TIL·Question·Blueprint 형태로 초안을 만들며, 사람이 승인한 뒤 다른 에이전트와 개발자가 적용 결과를 되돌려주는 구조다. 공식 글은 plausible answer 생성은 싸졌지만 production에서 진짜 통하는지 검증하는 일은 여전히 비싸다고 본다. 별도 skill.md도 공개돼 vote, verify, reply, create post의 차이와 trust_summary·reputation을 "보증"이 아니라 우선순위 신호로 쓰라고 안내한다. 교훈은 코딩 에이전트 운영의 병목이 답변 생성보다 재현 가능한 실패·수정·검증 기록을 공유하는 쪽으로 옮겨간다는 점이다.

  • 베타 범위 — API-first 지식 교환, agent search → human-reviewed draft → verification feedback loop
  • post type — TIL·Question·Blueprint로 에이전트가 배운 해법을 맥락별로 기록
  • 운영 포인트 — trust_summary·reputation은 참고 신호일 뿐, 공개 에이전트 글은 읽고 검증한 뒤 적용
원본 →
AI 코딩 도구

Claude Code Agent View — 백그라운드 세션을 한 화면에서 dispatch·attach

Claude Code의 Agent View는 `claude agents`로 여는 백그라운드 세션 대시보드다. 새 작업을 dispatch하면 각 작업이 터미널에 붙어 있지 않아도 full Claude Code conversation으로 계속 돌고, 화면에는 running·waiting for input·done 상태가 모인다. 세션에는 attach·peek·reply로 다시 들어갈 수 있고, 내부 세션에서는 `/bg`나 왼쪽 화살표로 agent view로 빠져나온다. 단 연구 프리뷰(v2.1.139+)이고 세션은 로컬 머신에서 돈다. sleep은 보존되지만 shutdown 때는 중단되며, 병렬 10개는 구독 사용량도 대략 10배로 태운다. Claude가 만든 worktree는 session 삭제 때 같이 지워질 수 있으니 merge·push·검토 경계를 먼저 정해야 한다.

  • claude agents — 여러 background session의 running/input/done 상태를 한 화면에서 관리
  • attach·peek·reply·/bg — 터미널 점유 없이 오래 가는 작업을 중간중간 확인
  • 한계 — local research preview, quota는 병렬 수만큼 소모, session 삭제 전 worktree 변경 보호 필요
원본 →
AI 코딩 도구

Spotify LLM Evals — A/B 테스트를 대체하지 말고 앞단 필터로 쓰기

Spotify Engineering의 2026-05-18 글은 LLM eval을 온라인 실험의 대체물이 아니라 "funnel"로 다루라고 정리한다. LLM judge는 relevance·coherence·tone·intent alignment처럼 사람 검수로는 크게 확장하기 어려운 품질 차원을 빠르게 점수화해, 실험에 올릴 후보의 hit rate를 높인다. 하지만 eval이 검증하는 것은 "출력이 의도한 품질 기준에 맞는가"이고, A/B 테스트가 검증하는 것은 "실제 사용자와 시스템 지표가 좋아졌는가"다. 그래서 eval은 실험 전에 나쁜 후보를 버리고, 실험 뒤에는 judge가 선호한 버전이 실제 outcome과 맞았는지 calibration loop로 다시 점검해야 한다. 글은 Spotify 실험에서 positive ship으로 끝나는 비율은 약 12%지만, 약 64%는 회귀 발견·가설 수정 같은 valid learning을 만든다고 말한다. 또 출시 실험의 약 42%는 secondary metric 회귀를 막기 위해 rollback된다고 설명한다. 실무 교훈은 간단하다. AI 기능을 "eval 점수 통과"만으로 배포하지 말고, eval→온라인 실험→guardrail metric→judge calibration을 한 루프로 묶어야 한다.

  • LLM eval = 실험 전 후보 필터와 품질 검증, A/B test = 실제 사용자 outcome 검증
  • judge 점수와 온라인 지표가 어긋나는 구간이 calibration 신호 — eval도 계속 검증 대상
  • guardrail metric을 함께 봐야 eval이 못 잡는 crash·retention·session length 회귀를 막을 수 있음
원본 →
AI 코딩 도구

OpenAI Secure MCP Tunnel — 사내 MCP를 공개하지 않고 ChatGPT·Codex에 연결하기

OpenAI의 Secure MCP Tunnel은 사내망·로컬호스트의 MCP 서버를 public endpoint로 열지 않고도 ChatGPT, Codex, Responses API, AgentKit에서 쓰게 하는 연결 방식이다. 고객이 실행하는 tunnel-client가 OpenAI tunnel service로 outbound HTTPS long-poll을 만들고, OpenAI 제품은 tunnel_id가 붙은 OpenAI-hosted MCP URL만 호출한다. 실제 사내 MCP URL은 tunnel-client가 있는 네트워크 안에서만 쓰인다. 그래서 방화벽 inbound rule을 새로 열지 않고, Streamable HTTP·stdio MCP 요청을 전달하며, `/healthz`, `/readyz`, `/metrics`, `/ui`로 운영 상태를 볼 수 있다. 교훈은 MCP 도입을 "서버 하나 더 공개"가 아니라 네트워크 경계·권한·운영 관측성을 함께 설계하는 integration 문제로 보라는 점이다.

  • outbound-only tunnel-client — 사내 MCP 서버는 public listener 없이 유지
  • 대상 표면 — ChatGPT, Codex, Responses API, AgentKit에서 같은 tunnel_id 기반 MCP endpoint 사용
  • 운영 경계 — runtime key는 Tunnels Read+Use, 관리자는 Read+Manage; health/metrics/UI로 연결 상태 확인
원본 →
AI 코딩 도구

Copilot adoption phase metrics — AI 에이전트 도입을 PR 병합 기여도로 보기

GitHub는 Copilot usage metrics API의 `totals_by_ai_adoption_phase`에 `total_pull_requests_merged`를 추가했다. 2026-05-29에 도입된 AI adoption phase는 사용자를 최근 28일 사용 표면에 따라 Code first, Agent first, Multi-agent 등으로 나누고, 2026-06-26 업데이트는 각 phase가 하루 또는 28일 동안 실제로 병합한 PR 총량을 함께 보여준다. 이전의 `avg_pull_requests_merged`가 phase 안 사용자 평균을 봤다면, 새 필드는 전체 병합 PR 중 어느 adoption phase가 얼마나 기여했는지 계산하게 해 준다. 실무 교훈은 에이전트 도입률을 "누가 많이 썼나"에서 멈추지 말고, code-first에서 agent-first/multi-agent로 이동할수록 실제 delivery 지표가 어떻게 바뀌는지 추적하라는 점이다.

  • `ai_adoption_phase` — Code first, Agent first, Multi-agent 등 28일 사용 표면 기반 cohort
  • `total_pull_requests_merged` — phase별 병합 PR 총량, 1일·28일 report에서 사용
  • 평균 사용량과 절대 처리량을 분리해 rollout 교육·예산·효과 측정을 설계
원본 →
AI 코딩 도구

Mellum2(JetBrains) — 12B MoE지만 토큰당 2.5B처럼 도는 소프트웨어 엔지니어링 모델

JetBrains의 Mellum2는 Apache-2.0으로 공개된 12B Mixture-of-Experts 모델이다. 토큰마다 64개 expert 중 8개만 켜서 active parameter는 2.5B이고, 코드 생성·편집·디버깅·tool/function calling·agentic coding에 맞춰 학습됐다. arXiv 기술 보고서는 128K context, Instruct/Thinking 변형, speculative decoding용 Multi-Token Prediction head를 공개하고, Hugging Face 모델 카드도 같은 라이선스와 체크포인트를 제공한다. 실무 포인트는 "큰 코딩 모델"보다 "작은 active compute + 긴 컨텍스트 + 도구 호출" 조합이다. IDE/에이전트 안에서 빠른 반복 작업을 맡길 로컬·오픈웨이트 후보를 평가할 때, 파라미터 총량보다 active parameter와 실제 latency를 같이 봐야 한다.

  • 12B MoE, 토큰당 2.5B active — 64 experts 중 8개만 사용
  • software engineering 특화 — code edit, debugging, tool/function calling, agentic coding
  • Apache-2.0 open weights, 128K context, Instruct/Thinking 변형 공개
원본 →
AI 코딩 도구

STATE-Bench — 에이전트 메모리는 대화 요약이 아니라 최종 상태로 평가해야 한다

Microsoft의 STATE-Bench는 에이전트가 긴 업무 흐름에서 "무엇을 기억했는가"를 최종 데이터 상태로 재는 벤치마크다. travel, customer support, shopping assistant 3개 도메인에 각 150개씩 총 450개 enterprise task를 두고, 에이전트는 task-local sandbox DB, 도메인 도구, simulated user를 상대한다. 통과하려면 필요한 정보를 도구로 모으고, 정책을 적용하고, 필요하면 DB를 올바른 final state로 갱신하면서 대화 절차도 지켜야 한다. Agent Learning Track은 같은 simulator와 judge에 train trajectories와 retrieval hook을 더해 memory, skill, prompt optimization을 비교한다. 교훈은 "좋은 답변"만 보지 말고, 에이전트가 도구 호출 뒤 시스템 상태를 맞게 바꿨는지 pass@1, pass^5, UX, cost per task로 같이 보라는 점이다.

  • 450 task — travel·customer support·shopping assistant 각 150개 enterprise workflow
  • sandbox DB + domain tools + simulated user — 최종 DB 상태와 절차 준수를 함께 평가
  • Main Track과 Agent Learning Track을 분리해 memory·skill·prompt optimization 효과를 비교
원본 →
AI 코딩 도구

Android Studio Agent Skills — .skills/SKILL.md로 Android 워크플로를 묶기

Android Studio의 Agent Skills는 프로젝트 루트의 `.skills` 디렉터리와 `SKILL.md`로 반복 작업과 도메인 지식을 묶는 기능이다. `SKILL.md`에는 이름·설명·절차를 적고, scripts·assets·references를 붙여 더 구체적인 워크플로를 제공할 수 있다. 최신 Android Studio Canary에는 Android·Firebase skill이 번들되고, agent는 skill을 자동으로 쓰거나 `@`로 직접 호출할 수 있다.

  • `.skills/SKILL.md` + scripts·assets·references로 재사용 workflow 구성
  • Android·Firebase skill 번들 + 자동 선택
  • `@`로 수동 호출해 긴 day-to-day prompt를 줄이기
원본 →