AI 에이전트, '한 번 성공'과 '매번 성공'은 다르다
AI가 업무를 한 번 해내는 것과 스무 번 내리 해내는 건 전혀 다른 문제라는 게 새 벤치마크로 드러났어요. 한편 세일즈포스는 Claude를 업무 안으로 깊숙이 붙였고, 인터넷 없이 노트북에서 이미지를 만드는 로컬 AI도 성큼 다가왔습니다.
주목할 AI 툴/제품
- 세일즈포스와 Anthropic이 'Claudeforce'를 발표하고, Claude 안에서 영업 데이터를 다루는 'Salesforce in Claude' 플러그인을 냈습니다.
미팅 준비·딜 점검·파이프라인 정리 등 37개 사전제작 스킬을 담았고, 9월 오픈베타로 열립니다.
· Salesforce - AMD가 Ryzen AI 노트북에서 인터넷 없이 ComfyUI·PyTorch로 이미지와 영상을 로컬 생성하는 환경을 정리했습니다.
통합 메모리로 GPU가 최대 94GB까지 써서, 대형 모델도 잘라내기(양자화) 없이 그대로 돌릴 수 있습니다.
· AMD ROCm Blog
개발자 실무 팁
- AI 코딩 에이전트에게 줄 규칙 파일은 사람용 문서보다 더 대놓고 명시적으로 쓰는 게 잘 통합니다.
좋은 예/나쁜 예 코드와, 규칙을 다 적용한 '골드 스탠다드' 참고 파일을 agents.md에 함께 두라는 조언입니다.
· Stack Overflow Blog - AI 코딩을 잘 쓰는 핵심은 '구조적 코드리뷰'라는 관점입니다.
문법 트집이 아니라 접근이 아키텍처적으로 맞는지 보고, 과하게 부풀린 설계로 새는 에이전트를 더 단순한 기존 방법으로 되돌려세우는 게 관건이라고 합니다.
· Sean Goedecke - AI 도구를 쓰는 사람은 84%인데 커밋 전에 항상 코드를 검토하는 사람은 48%뿐이라는 조사가 있습니다.
61%는 'AI 코드가 그럴듯한데 안 믿긴다'고 답했고요. 작성 속도만 보지 말고 검증에 시간을 배분하라는 신호입니다.
· Second Talent
AI 업계 뉴스
- 마이크로소프트가 에이전트 신뢰성 벤치마크 'ThinkingBox'를 오픈소스로 공개했습니다.
507개 업무를 20번씩 반복시켰더니 최고 모델(Claude Opus 5)도 한 번에 성공은 66.5%였지만 스무 번 내내 성공한 비율은 47.5%였습니다. 말이 아니라 실제 DB가 바뀌었는지로 채점한 게 특징입니다.
· arXiv - 아마존이 실시간 음성 대화 모델 'Nova 2 Sonic'을 Bedrock에 올렸습니다.
사람처럼 끼어들고 되받는 턴 조절, 한 목소리로 여러 언어를 자연스럽게 오가는 폴리글롯 보이스, 100만 토큰 문맥이 특징입니다.
· AWS
개발자 업계 뉴스
- 프런트엔드 빌드 도구 Vite가 8.0을 내며 번들러를 Rust 기반 Rolldown 하나로 통합했습니다.
빌드가 최대 10~30배 빨라졌고, Linear는 46초 걸리던 빌드가 6초로 줄었다고 합니다.
· Vite - 타입스크립트 7.0이 정식 출시됐습니다.
컴파일러를 Go로 새로 포팅해 타입 검사가 8~12배 빨라졌고, VS Code 전체 빌드가 125.7초에서 10.6초로 줄었습니다. 다만 안정적 API는 7.1로 미뤄져 일부 도구 연동은 좀 더 기다려야 합니다.
· InfoQ
오늘의 한 줄 추천
AI 에이전트를 실무에 붙이려는 분께 — '데모는 되는데 왜 매번은 안 되나'를 숫자로 짚어주는 ThinkingBox 벤치마크를 한번 살펴보세요.