openai-news
OpenAI와 Broadcom, LLM 최적화 추론 칩 공개
OpenAI와 Broadcom이 협력하여 LLM 추론에 특화된 첫 번째 AI 가속기 'Jalapeño'를 공개했습니다. 9개월 만에 설계에서 양산까지 완료했으며, 초기 테스트에서 기존 최고 성능 대비 와트당 성능이 크게 개선될 것으로 예상됩니다.
openai-news
OpenAI와 Broadcom이 협력하여 LLM 추론에 특화된 첫 번째 AI 가속기 'Jalapeño'를 공개했습니다. 9개월 만에 설계에서 양산까지 완료했으며, 초기 테스트에서 기존 최고 성능 대비 와트당 성능이 크게 개선될 것으로 예상됩니다.
google-research
LLM이 단순한 사실 질문에서도 추론 과정을 거치면 숨겨진 파라메트릭 지식을 더 잘 기억해낸다는 Google Research 팀의 연구 결과예요. 이는 연산 버퍼와 사실 프라이밍 효과 덕분이죠.
google-developers
구글 TPU에서 LLM 추론 속도를 획기적으로 개선하기 위해, UCSD 연구팀이 기존 투기적 디코딩의 병목 현상을 해결하는 '확산 스타일 투기적 디코딩(DFlash)'을 구현하여 평균 3.13배, 특정 작업에서는 최대 6배까지 빠른 속도를 달성했어요.
anthropic
앤트로픽의 경험을 바탕으로, LLM 에이전트 개발 시 복잡한 프레임워크보다 단순하고 조합 가능한 패턴에 집중하고, 워크플로우와 에이전트의 차이를 이해하여 적절한 시스템을 구축하는 실용적인 방법을 알려주는 글입니다.