← 탐색

태그된 포스트: 벤치마크

AI 레이더 · ·3분 읽기

GPT-5.5를 6분의 1 가격에 이긴 모델이 MIT로 풀렸다

오픈웨이트 모델이 코딩 벤치마크에서 프론티어를 이기는 일은 이제 놀랍지 않다. 그런데 그 모델이 MIT 라이선스고, API 가격이 GPT-5.

glm-5.2zhipu오픈웨이트
AI 레이더 · ·2분 읽기

V4 Pro 프리뷰에 실망했다면 0813을 다시 봐야 한다

DeepSeek V4 Pro 프리뷰가 나왔을 때 코딩 에이전트에 돌려본 사람이라면 기억할 거다 — DeepSWE 12.8.

deepseekv4-prodspark
AI 레이더 · ·3분 읽기

Gemini 3.7 Flash — 3주 만에 DeepSWE 33% 올리고 가격은 절반으로

구글이 Gemini 3.6 Flash를 내놓은 지 딱 3주 만에 3.

geminigoogleflash
AI 레이더 · ·3분 읽기

추론은 만점, 사실은 낙제 — 프론티어 모델이 거짓말을 더 하는 이유

AIME 2026에서 99.2%를 찍는 모델이, 간단한 사실 질문에서는 열에 여덟을 틀린다.

추론환각hallucination
AI 레이더 · ·3분 읽기

DeepSeek V4 Pro가 GA로 바뀌었는데 체인지로그가 없다

DeepSeek가 8월 12일 V4 Pro API 엔드포인트를 0813 빌드로 교체했다. 블로그 포스트 없이, 체인지로그 없이, 보도자료 없이.

deepseekv4-pro벤치마크
AI 레이더 · ·2분 읽기

13B가 49B를 이겼다 — 포스트트레이닝이 모델 크기를 뒤집은 날

지난주 금요일, DeepSeek이 V4-Flash의 정식 빌드(0731)를 공개했다. 마이너 업데이트처럼 보일 수 있는데, 벤치마크를 펴 놓으면 분위기가 완전히 달라진다.

deepseekv4-flash포스트트레이닝
AI 레이더 · ·3분 읽기

코드 21배 싸게 짜 줄게, 대신 훈련에 쓴다 — Meta의 제안

Meta가 어제 Muse Code 베타를 공개했다. 터미널 코딩 에이전트, Claude Code와 Codex를 정면으로 겨냥한다.

metamuse-code코딩-에이전트
AI 레이더 · ·3분 읽기

Qwen3.8-Max 오픈 웨이트 예고 — 2.4T를 누가 돌릴 수 있을까

알리바바가 Qwen3.8-Max를 꺼냈다.

qwenqwen3.8-max오픈웨이트
AI 레이더 · ·3분 읽기

논문 17만 편이 말한다 — Qwen이 Llama를 넘었다

반년 전만 해도 "오픈 모델 = Llama"였다. 그런데 arXiv에 올라온 논문 170,927편을 긁어서 분석한 결과가 나왔는데, 그 공식이 깨졌다.

qwenllama오픈웨이트
AI 레이더 · ·3분 읽기

Kimi K3가 내일 풀린다 — 코딩 1위, 무게 1.4TB

Moonshot AI의 Kimi K3가 LMArena Frontend Code Arena에서 1위를 찍었다. Claude Fable 5보다 위다.

kimi-k3moonshot-ai오픈웨이트
AI 레이더 · ·3분 읽기

OpenAI가 모델 하나 대신 서브에이전트 4개를 내보낸 이유

GPT-5.6의 진짜 뉴스는 Sol이 Terminal-Bench 1위를 찍은 게 아니다.

gpt-5.6openaisol-ultra
AI 레이더 · ·2분 읽기

3.5 Pro 대신 Flash 세 개가 왔다 — Google의 다른 게임

7월 21일, Google이 Gemini 모델 세 개를 한꺼번에 공개했다. 3.

geminigooglegemini-flash
AI 레이더 · ·2분 읽기

Llama를 공짜로 풀던 Meta가 API 과금을 시작했다

저커버그가 3년 만에 X에 돌아왔다. 이유가 좀 의외인데 — Meta의 첫 번째 유료 AI API를 홍보하기 위해서다.

metamuse-spark유료-api
AI 레이더 · ·2분 읽기

2.8조 파라미터 오픈 모델이 Sonnet 가격인 이유

Moonshot AI가 어제 Kimi K3를 공개했다. 2.

kimi-k3moonshot-ai오픈웨이트
AI 레이더 · ·3분 읽기

SpaceX가 600억 달러 주고 산 건 에디터가 아니라 훈련 데이터였다

SpaceX가 6월 16일에 Cursor를 600억 달러에 인수했을 때, 대부분의 반응은 "코드 에디터에 600억?"이었다.

grok-4-5spacexcursor
AI 레이더 · ·3분 읽기

GPT-5.6, 벤치마크 말고 지갑으로 골라라

OpenAI가 GPT-5.6을 내놓으면서 전례 없는 실험을 했다.

gpt-5-6openaisol
백엔드 깊이보기 · ·3분 읽기

코루틴 vs Virtual Threads — 100만 요청 벤치마크가 말해주지 않는 것

벤치마크 하나 보고 코루틴으로 갈아탔다가, 2주 만에 롤백한 적이 있다. 100만 요청 기준 코루틴이 4-8% 빠르다는 결과를 팀 슬랙에 던졌고, 리드가 "그럼 전환하자"고 했다.

kotlinvirtual-threadscoroutines
AI 레이더 · ·3분 읽기

Grok 4.5 — 토큰은 4배 아끼는데 Opus급이라 불러도 되나

SpaceXAI가 Cursor를 $60B에 인수하고 나서 첫 번째 모델을 내놨다. Grok 4.

grok-4-5spacexaicursor
AI 레이더 · ·3분 읽기

GPT-5.6 풀렸다 — 가격표보다 시스템 카드가 더 뜨겁다

GPT-5.6이 오늘 드디어 API에 풀렸다.

gpt-5-6openai시스템-카드
AI 레이더 · ·2분 읽기

GLM-5.2, GPT-5.5를 꺾었는데 셀프호스팅은 2천만 원이다

GLM-5.2가 SWE-bench Pro에서 62.

glm-5-2zhipu-ai오픈웨이트
1 / 3 Next →