오픈웨이트 모델이 코딩 벤치마크에서 프론티어를 이기는 일은 이제 놀랍지 않다. 그런데 그 모델이 MIT 라이선스고, API 가격이 GPT-5.
DeepSeek V4 Pro 프리뷰가 나왔을 때 코딩 에이전트에 돌려본 사람이라면 기억할 거다 — DeepSWE 12.8.
구글이 Gemini 3.6 Flash를 내놓은 지 딱 3주 만에 3.
AIME 2026에서 99.2%를 찍는 모델이, 간단한 사실 질문에서는 열에 여덟을 틀린다.
DeepSeek가 8월 12일 V4 Pro API 엔드포인트를 0813 빌드로 교체했다. 블로그 포스트 없이, 체인지로그 없이, 보도자료 없이.
지난주 금요일, DeepSeek이 V4-Flash의 정식 빌드(0731)를 공개했다. 마이너 업데이트처럼 보일 수 있는데, 벤치마크를 펴 놓으면 분위기가 완전히 달라진다.
Meta가 어제 Muse Code 베타를 공개했다. 터미널 코딩 에이전트, Claude Code와 Codex를 정면으로 겨냥한다.
반년 전만 해도 "오픈 모델 = Llama"였다. 그런데 arXiv에 올라온 논문 170,927편을 긁어서 분석한 결과가 나왔는데, 그 공식이 깨졌다.
Moonshot AI의 Kimi K3가 LMArena Frontend Code Arena에서 1위를 찍었다. Claude Fable 5보다 위다.
GPT-5.6의 진짜 뉴스는 Sol이 Terminal-Bench 1위를 찍은 게 아니다.
7월 21일, Google이 Gemini 모델 세 개를 한꺼번에 공개했다. 3.
저커버그가 3년 만에 X에 돌아왔다. 이유가 좀 의외인데 — Meta의 첫 번째 유료 AI API를 홍보하기 위해서다.
SpaceX가 6월 16일에 Cursor를 600억 달러에 인수했을 때, 대부분의 반응은 "코드 에디터에 600억?"이었다.
벤치마크 하나 보고 코루틴으로 갈아탔다가, 2주 만에 롤백한 적이 있다. 100만 요청 기준 코루틴이 4-8% 빠르다는 결과를 팀 슬랙에 던졌고, 리드가 "그럼 전환하자"고 했다.
SpaceXAI가 Cursor를 $60B에 인수하고 나서 첫 번째 모델을 내놨다. Grok 4.