графики · динамика
📨 Последние посты
21 всего방금 갱신된 DeepSWE 결과를 보면 Claude Fable 5가 Sonnet 5보다 꽤 선명하게 앞섭니다. Fable 5는 성공률이 70%로 Sonnet 5의 54%보다 높고, 평균 비용도 $21.63로 Sonnet 5의 $26.40보다 낮습니다. Fable 5는 119k 토큰, 88스텝을 쓴 반면 Sonnet 5는 214k 토큰, 268스텝을 썼습니다. 결론적으로 Fable 5는 더 적게 쓰고, 더 싸게 풀고, 더 많이 해결한 모델입니다. 출처) https://deepswe.datacurve.ai/
[Sonnet 5.0 — 2배 더 빠른 토큰 생성] 왼쪽이 Sonnet 5, 오른쪽이 소넷 4.6입니다. Sonnet 5.0은 이전 모델 소넷 4.6 대비, 첫 프롬프트 대기시간(KV-Cache prefill) 및 토큰 생성 속도가 약 2배 더 빨라졌습니다.
[Sonnet 5.0 — 할인 이벤트 기간] => 8월 31일까지 할인 적용
[Sonnet 5.0 — 이벤트 할인 API 가격] 기존 Sonnet 4.6 가격은 입력 $5 / 출력 $15 새로운 Sonnet 5 가격은 출시 이벤트 할인으로 일정 기간동안 입력 $2 / 출력 $10
Claude Sonnet 5 출시 핵심 요약 [주요 특징] 1. 가장 에이전트적인 Sonnet 모델: 계획·브라우저·터미널·툴 사용 강화 2. 코딩·지식 작업·전문 업무에서 Frontier급 성능 3. 1M 토큰 컨텍스트 지원 4. 추론 노력(Reasoning Effort) 단계 선택 가능 5. 텍스트·이미지·파일 입력 지원 — [개선점] 1. Sonnet 4.6 대비 추론·툴 사용·코딩 성능 향상 2. Opus 4.8에 가까운 성능을 더 낮은 가격대로 제공 3. 장시간 자율 작업과 멀티스텝 업무 수행력 강화 4. 환각·아첨·프롬프트 인젝션 대응 등 안전성 개선 5. 실시간 사이버 안전장치로 고위험 악용 시도 차단(..??) #Claude #Anthropic #AI #LLM
제가 최근 2달간 시행착오한 경험을 토대로 여러분들은 한번에 잘 작성하는 방법을 소개하겠습니다.
다음 게시물은 OpenClaw/Hermes Agent의 에이전트 시스템 프롬프트, SOUL.md 는 어떻게 작성해야하는가? 에 대해 적어보겠습니다
새벽에 올라온 뉴스 정리 끝. 이제 자러갈게요,,,
Q4. 코딩은 뭐가 좋아짐? 이번 뉴스에서 확실하게 나온건 터미널 워크플로임. OpenAI는 "GPT-5.6 Sol"이 Terminal-Bench 2.1에서 새로운 최고 수준 성능을 기록했다고 말했음. 이 벤치마크는 단순 코드 작성이 아니라, 명령줄에서 계획을 세우고, 도구를 쓰고, 실패를 고치는 능력을 보는 평가임. — Q5. 보안, 환각, 속도는 어떤가요? 사이버보안 능력은 크게 올라갔지만, Cyber Critical 단계는 아니라고 선을 그었음. 취약점을 찾고 고치는 데는 강하지만, 완전한 자율 공격 체인을 안정적으로 수행하는 단계는 아니라는게 핵심 설명임. 환각도 일부 개선되긴함. GPT-5.6 Sol은 GPT-5.5보다 사실 오류가 조금 줄었고, 사용자가 신고한 환각을 다시 반복하는 비율도 낮아짐…
# GPT-5.6 Sol 모델 Q&A 5개 — Q1. 지금 바로 쓸 수 있음? 아직 전체 공개는 아님. GPT-5.6은 제한 미리보기로 시작했고, API와 Codex에서 "일부" 신뢰 파트너에게 먼저 제공됨. 뭘 기준으로 "일부" 신뢰 파트너에 들어가는지는 아직 모름 ChatGPT·Codex·API 전체 공개는 이후 확대 예정임. — Q2. Sol, Terra, Luna 차이는 뭐죠? 1) Sol은 플래그쉽 모델임. 가장 좋은 모델 (Opus/Fable 포지션) 2) Terra는 일상 업무용 모델 (Sonnet 포지션) 3) Luna는 빠르고 저렴한 모델 (Flash/Haiku 포지션) 가격은 100만 토큰 기준으로, 1) Sol 입력 $5 / 출력 $30, 2) Terra 입력 $2.50 / 출력 $15…
마지막으로, 환각과 정렬 측면에서도 변화가 있었습니다. — OpenAI의 시스템 카드에 따르면 GPT-5.6 Sol은 GPT-5.5보다 사실 오류를 조금 더 적게 만들고, 사용자가 신고한 환각 사례를 다시 재현하는 비율도 유의미하게 낮춘 것으로 평가되었습니다. — ChatGPT 사용 시뮬레이션에서는 숨겨진 불확실성을 약 10% 줄이고, 완료하지 않은 작업을 완료했다고 잘못 표현하는 행동도 약 30% 줄어든 것으로 나타났습니다. — 그러나 코딩 에이전트 환경에서는 모델이 더 집요하게 작업을 수행하려는 성향 때문에, 사용자가 명시하지 않은 범위까지 행동하려는 사례도 관찰되었습니다. — 여기에 속도 측면의 변화도 있습니다. OpenAI는 7월부터 Cerebras에서 GPT-5.6 Sol을 최대 750 token…
다만 이번 발표에서 가장 조심스럽게 다뤄진 영역은 사이버보안입니다. — OpenAI는 GPT-5.6 Sol이 자사 모델 중 가장 강력한 사이버보안 모델이라고 설명했습니다. 취약점 연구와 익스플로잇 관련 장기 작업에서 성능과 효율이 개선되었고, ExploitBench에서는 Mythos Preview와 경쟁 가능한 수준을 약 3분의 1 출력 토큰으로 달성했다고 밝혔습니다. — 그러나 OpenAI는 동시에 선을 그었습니다. GPT-5.6 Sol은 취약점을 찾고 고치는 데 강하지만, 평가 조건에서 Chromium과 Firefox를 대상으로 자율적인 완전한 공격 체인을 만들지는 못했고 Cyber Critical 기준도 넘지 않았다고 설명했습니다. — 그래서 이번 출시는 곧바로 전체 공개가 아니라, 일부 신뢰 파트너…
описание канала
LLM 모델의 최신 소식과 고급 프롬프팅 소식을 먼저 만나보세요!
о канале
похожие каналы/ai
tapswap community
TapSwap Community is a channel focused on converting taps into a financial tool, utilizing a bot for interaction.
Bum’s Corner 📦
BUM's Corner explores the evolution of a game IP into an AI-native ecosystem with digital companions.
DuckChain Announcement
DuckChain is a Telegram AI chain enabling users to engage with crypto through AI, EVM, and other technologies.
Need Services
Need Services offers a variety of digital services including VPNs, game top-ups, verification, eSIMs, and AI tools.
Hi, AI • Новости технологий
A Telegram channel providing news and updates on artificial intelligence and neural networks.
JGGL Official
JGGL is a social network focused on music creation and sharing, featuring an AI-powered track generator.
