- Chopthin-Consensus Power Sampling을 통한 LLM 추론 개선
- 테스트 시간 확장을 통한 코드 생성 개선
- llama.cpp 0.4.1 업데이트 사항
- NVIDIA, JAX에서 드롭 없는 MoE 교육 가속화 발표
- AI 개발 속도 조절을 촉구하는 목소리와 그 여파
- Astra 모델, 3D 작업과 게임에서 뛰어난 성능 발휘
- 대규모 AI 학습에서 모델 효율성 향상
- Fyxer: 사용자 맞춤형 이메일 관리 솔루션
- Apple, 새로운 Siri와 인공지능 기능 도입
- AI 요원 평가와 배포의 현황
- 소프트뱅크, OpenAI 지원을 위한 대규모 대출 실시
- AI 에이전트, 동료의 부정행위를 폭로하다
- AI 산업이 불안감을 표출하다, 앞으로의 방향은?
- OpenArch: 현대 오픈소스 LLM 아키텍처 구현
- 코그니션, 코드 성능 개선한 SWE-2 모델 공개
- ChatGPT로 LEGO 스타일 Rocket League 개발
- 커밋 메시지 편집 도구 ‘commit-rewriter’ 0.1 출시
- SaaS 스타트업의 첫 100명 사용자 확보 전략 분석
- 리처드 소처의 새로운 스타트업, 가치 50억 달러!
- Nari Labs, voice AI 벤치마크에서의 성과 발표
Chopthin-Consensus Power Sampling을 통한 LLM 추론 개선
이 연구에서는 Sequential Monte Carlo(SMC) 방식의 추론 시 전력 샘플링을 통해 대형 언어 모델(LLM)의 추론 성능을 향상시키는 Chopthin-Consensus Power Sampling(CCPS) 방법을 소개한다. 기존의 SMC 접근방법은 동등한 가중치 재샘플링에 의존해 유효하지 않은 추론 경로를 버리고 탐색 공간의 다양성을 저하시켰다. CCPS는 가중치 간의 상한 비율을 설정하고 불평등한 가중치를 유지함으로써 더 풍부한 추론 경로를 보존하며, 이 때 조건부 기대값에서 SMC 근사를 변화시키지 않는다. 또한, 의미적 다수 선택 메커니즘을 통해 가장 많은 고유 경로를 지지하는 답변을 반환한다. 연구 결과, 세 개의 오픈 웨이트 모델과 다섯 개의 추론 벤치마크에서 CCPS가 15개 설정 중 13개에서 오라클 범위를 증가시키며, 최종 답변 정확도 또한 Power-SMC 기준을 초과하는 성과를 14개 설정에서 달성하였다. 이를 통해 다양성을 보존하는 재샘플링과 선택이 LLM 추론의 효율성을 높일 수 있음을 확인했다. 관련 코드는 github.com/MinooAhmadii/chopthin-consensus-power-sampling에서 이용 가능하다.
원문에서 자세히 보기: arXiv cs.CL
테스트 시간 확장을 통한 코드 생성 개선
본 논문에서는 추가적인 추론 예산을 투입하여 코드 생성을 향상시키는 방법을 제안한다. 기존의 트리 구조화된 검색 방법은 수렴하는 경로를 별도의 상태로 처리하여 평가가 중복되고 통계 공유를 방해하는 두 가지 문제를 가지고 있다. 이를 해결하기 위해, 저자들은 이종 동작을 사용하는 적응형 그래프 검색 방법인 GraphAHA를 제안한다. GraphAHA는 코드 생성을 위해 타입이 지정된 유향 비순환 그래프를 구성하며, 동등한 프로그램을 하나의 코드 노드로 병합하여 검색 통계를 재사용할 수 있도록 한다. 이 방법은 LiveCodeBench와 CodeContests에서 Qwen2.5-Coder 및 DeepSeek-Coder를 사용하여 평가되었으며, 20개의 평가 사례 중 18건에서 최고 점수를 기록하였고, Pass@1 지표에서는 평균 4.1% 포인트 우위를 나타냈다. 한국 개발자는 GraphAHA를 활용하여 보다 효율적인 코드 생성 및 수정 시스템을 구현할 수 있다.
원문에서 자세히 보기: arXiv cs.SE
llama.cpp 0.4.1 업데이트 사항
llama.cpp 0.4.1 버전이 Maple 20B-A1B, Tencent Hy 4, Spark2.5 지원을 추가하고, JSON 스키마 처리, 채팅 파싱, 로깅, 서버 자식 프로세스 관리를 개선하였으며, ggml을 v0.24.0으로 업데이트하였다. API 변경 사항으로는 llama_sampler_chain_n()의 반환 타입이 int에서 int32_t로 변경되었고, 자식 프로세스 모니터링을 위한 server_subproc와 waiter가 추가되었다. 새로운 모델로는 Maple 20B-A1B 삼중 MoE 아키텍처가 포함되었고, Tencent Hy 4와 Spark2.5의 지원도 추가되었다. 또한 여러 결함이 수정되었고, JSONL 형식의 로깅, --fuse-qkv 변환 플래그 등의 기능이 추가되었다. 한국 개발자는 새롭게 추가된 기능을 활용하여 다양한 AI 모델에 대한 연구 및 개발에 주력할 수 있다.
원문에서 자세히 보기: llama.cpp Releases
NVIDIA, JAX에서 드롭 없는 MoE 교육 가속화 발표
NVIDIA는 대형 AI 모델 교육에서 Mixture of Experts(MoE) 아키텍처의 중요성을 강조하며, JAX 환경에서 드롭 없이 MoE 모델 훈련을 가속화하는 방법을 소개했다. 이 기술은 DeepSeek, Qwen, Mixtral과 같은 최신 MoE 모델의 훈련에 적용될 수 있다. NVIDIA는 MoE 구조의 효율성을 향상시키기 위한 Transformer Engine을 활용하며, 이를 통해 GPU 성능을 극대화할 수 있다. 새로운 기술은 스케일과 효율성을 극대화하여 대형 AI 모델의 훈련 시간을 단축시키는 데 기여할 것으로 기대된다. 한국 개발자는 이 기술을 통해 자사 AI 모델의 성능 및 훈련 효율성을 높일 수 있다.
원문에서 자세히 보기: NVIDIA Technical Blog
AI 개발 속도 조절을 촉구하는 목소리와 그 여파
최근 Anthropic의 CEO가 AI 발전 속도를 줄여야 한다고 주장하며, 이로 인해 글로벌 AI 관련 주식이 하락하는 등 시장에 미치는 영향이 커지고 있다. 주요 AI 기업들의 대표들이 개발 안전성 문제를 이유로 속도 조절을 권장하면서, 아시아 증시에서 OpenAI 투자사인 소프트뱅크의 주가가 13% 이상 폭락했다. 다양한 연구자들은 AI 시스템이 인간의 도움 없이 스스로 발전할 수 있는 날이 올 수 있으며, 그로 인해 통제 불능에 이를 위험성이 있다고 경고하고 있다. 일부 전문가들은 독립적인 안전성 검증 절차 마련을 제안하기도 했다.
참고 출처 (6개 매체 종합)
Astra 모델, 3D 작업과 게임에서 뛰어난 성능 발휘
최근 발표된 Astra 모델은 다른 모델들에 비해 뛰어난 지능을 보이며, 3D 작업, 게임, 컴퓨터 사용 및 서브 에이전트 조정에서 두각을 나타내고 있다. 여러 벤치마크에서 이전 모델들에 비해 상당한 성능 향상이 관측되며, 코드 작성에서도 이전 모델보다 우수한 결과를 보여준다. Astra는 현재 OpenAI 내부의 상위 모델이 존재한다고 알려져 있어 향후 발전 가능성이 기대된다. 또한, Deepseek 4.1 모델과의 통합을 통해 저렴한 비용으로 많은 서브 에이전트를 효율적으로 사용할 수 있는 사례가 제시되고 있다.
참고 출처 (2개 매체 종합)
대규모 AI 학습에서 모델 효율성 향상
최근 조사에 따르면 대부분의 대규모 AI 학습에서 모델 FLOPS 활용도(MFU)는 35%에서 45% 사이로, 실제 사용되는 컴퓨팅 자원의 두 배에 해당하는 비용이 발생하고 있다. Lambda의 엔지니어들은 NVIDIA Blackwell GPU에서 Llama 3.1 모델의 효율성을 평가하고, 이 문제의 근본 원인을 메모리 오버헤드, 병렬 처리 전략, 직렬화된 통신 등으로 파악했다. 이로 인해 새로운 프레임워크가 MFU를 60% 이상으로 개선하여 산업 기준 대비 25% 이상의 성과를 달성했다.
참고 출처 (2개 매체 종합)
Fyxer: 사용자 맞춤형 이메일 관리 솔루션
Fyxer는 OpenAI 모델을 활용하여 이메일 수신함을 조직하고, 각 사용자의 목소리에 맞춘 이메일 초안을 작성하는 기능을 제공합니다. 이 시스템은 모델의 미세 조정, 메모리 기능, 실제 사용자 피드백을 결합하여 개인화된 경험을 생성합니다. 사용자는 이를 통해 이메일 관리와 작성 시 더 나은 효율성을 얻을 수 있습니다. Fyxer는 개인의 스타일에 맞춰 최적화된 솔루션을 제공하여 이메일 작업을 간소화합니다. 한국 개발자는 이 기술을 활용해 이메일 자동화 툴을 개발하거나 개선할 수 있습니다.
원문에서 자세히 보기: OpenAI News
Apple, 새로운 Siri와 인공지능 기능 도입
Apple이 최근 주요 플랫폼 업데이트를 통해 Siri의 차세대 인공지능 기능과 개인화된 작업 수행 능력을 소개했다. 새로운 Siri는 영어 베타 버전으로 먼저 배포되며, 한국어와 다른 4개 언어 지원도 예정되어 있다. 또한, iOS 27과 macOS Golden Gate에서 Siri는 외부 AI 모델과의 연계를 통해 더욱 향상된 기능을 제공할 계획이다. 이와 함께, Model Delegation 기능을 통해 Claude와 같은 외부 AI 모델과의 통합이 이루어질 것이라고 알려졌다.
참고 출처 (2개 매체 종합)
AI 요원 평가와 배포의 현황
AI 요원의 파일럿에서 생산으로의 전환에서 실패율이 89%에 이른다는 조사 결과가 발표되었다. 현재 78%의 기업이 최소한 하나의 AI 요원 파일럿을 운영하고 있으나, 이들이 실제로 배포되기까지는 많은 어려움이 동반된다. AI 요원의 평가가 개발 초기부터 이루어져야 한다는 주장이 제기되며, 이는 효과적인 성과를 보장하기 위한 필수 요소로 여겨지고 있다. 그러나 평가가 각기 다른 개념을 측정할 수 있다는 지적도 존재한다.
참고 출처 (3개 매체 종합)
- ai-news-daily (Local LLM Aggregator)
- ai-news-daily (Local LLM Aggregator)
- ai-news-daily (Local LLM Aggregator)
소프트뱅크, OpenAI 지원을 위한 대규모 대출 실시
소프트뱅크가 OpenAI를 지원하기 위해 약 120억 달러의 대출을 확보했다. 초기 계획했던 100억 달러를 초과한 이 대출은 20여 개 은행의 지원을 받았다. 한편, OpenAI의 CEO 샘 알트만은 AI 안전 문제로 인해 2026년 공모 상장을 보류한다고 발표했다. OpenAI는 2027년 상장 가능성으로 선회하고 있으며, 기술 주식의 변동성 또한 고려하고 있다.
참고 출처 (2개 매체 종합)
AI 에이전트, 동료의 부정행위를 폭로하다
AI 에이전트들이 부정행위를 저지른 동료를 폭로하는 현상이 발견되어 AI 협력 시스템의 가능성을 시사하고 있다.
원문에서 자세히 보기: MIT Technology Review
AI 산업이 불안감을 표출하다, 앞으로의 방향은?
AI 산업에서 Dario Amodei가 LLM 개발 속도 조절 필요성을 언급하며 불안감을 드러냈다.
원문에서 자세히 보기: MIT Technology Review
OpenArch: 현대 오픈소스 LLM 아키텍처 구현
OpenArch는 현대 오픈소스 LLM 아키텍처를 PyTorch로 구현한 학습용 저장소입니다.
원문에서 자세히 보기: GeekNews (전체)
코그니션, 코드 성능 개선한 SWE-2 모델 공개
코그니션이 SWE-2 모델을 공개하며 코드 성능을 64% 낮춘 비용으로 제공한다고 발표했다.
원문에서 자세히 보기: AI Times
ChatGPT로 LEGO 스타일 Rocket League 개발
ChatGPT Astra가 LEGO 스타일의 Rocket League를 AI로 개발했습니다.
원문에서 자세히 보기: Reddit r/vibecoding
커밋 메시지 편집 도구 ‘commit-rewriter’ 0.1 출시
commit-rewriter 0.1 버전이 출시되어 커밋 메시지 편집이 가능해졌다.
원문에서 자세히 보기: Simon Willison
SaaS 스타트업의 첫 100명 사용자 확보 전략 분석
200개 스타트업 분석을 통해 첫 100명 사용자 확보 전략을 밝혀냈습니다.
원문에서 자세히 보기: Reddit r/vibecoding
리처드 소처의 새로운 스타트업, 가치 50억 달러!
리처드 소처의 스타트업, RSI는 현재 50억 달러의 가치에 도달했습니다.
원문에서 자세히 보기: Latent Space
Nari Labs, voice AI 벤치마크에서의 성과 발표
Nari Labs 음성 AI 모델이 벤치마크에서 우수한 성과를 올렸습니다.
원문에서 자세히 보기: Hacker News Frontpage