SOWN - Daily News

SomeWhere Olny We Know

Daily News #2026-09-08



  • PerfReasoning: 성능 모델링을 위한 새로운 벤치마크
  • Hakken: 지식 예측 및 설명 시스템 소개
  • 안전 정렬 및 좁은 경계 안전성에 대한 새로운 접근법
  • TPU 커널 개발을 위한 MaxKernel 다중 에이전트 시스템
  • Vulkan GET_ROWS 지원 업데이트
  • 로컬 코딩 에이전트를 실행하는 AirUncode
  • OpenAI의 에이전트 혁신과 GPT-6 공개
  • AI 리스크 관리와 컴퓨팅 계약 현황
  • Mac에서 음성 주석 추가 및 스크린샷 관리 기능
  • AI의 능력 향상과 안전성 확보를 위한 촉구
  • 토스 프론트엔드 팀의 새로운 문서 시스템 구축
  • OpenAI의 AI 연구 인턴과 속도 경고
  • AI 대화 기록 기능 출시
  • Lean 4로 구현한 인프라 관리 도구 - infra
  • Alibaba, Qwen-Drive 1.0 출시
  • AI 혁신에 대한 신중한 접근: 오픈AI의 수석 과학자 발언
  • Claude Fable 5.1로 완성한 비디오 제작
  • SerpApi: AI 에이전트를 위한 웹 검색 API의 비밀
  • 고속 구문 검사 통과의 자율 코딩 에이전트
  • 다단계 작업 흐름으로의 자동화 변화

PerfReasoning: 성능 모델링을 위한 새로운 벤치마크

PerfReasoning은 하드웨어 설계 및 소프트웨어 최적화에 필수적인 성능 모델링을 평가하기 위한 벤치마크이다. 이 블루프린트는 LLMs의 직접적인 성능 추론 및 분석 성능 모델 코드를 생성하는 능력을 측정한다. 주어진 워크로드와 아키텍처, 매핑 사양에 따라 모델은 매핑을 비교하고 off-chip 트래픽과 버퍼 요구 사항을 예측한다. 비공식 소스의 가장 강력한 모델은 90% 이상의 성능을 기록했으며, 최고의 오픈 모델은 82.4%에 도달했다. 그러나 모델 구성은 훨씬 더 어려워, GPT-5.6 Sol이 80% 이상의 합격률을 보인 반면, 다른 모든 모델 구성은 평균 15% 미만으로 큰 변동성을 나타냈다. 특정 작업에 대한 강화학습(RL)이 4B 모델의 매핑 추론 정확도를 15.7 포인트 향상시키는 반면, 피드백 없는 다중 자가 수정 프롬프트는 신뢰할 수 있는 효과를 보이지 않았다. PerfReasoning은 그럴듯한 아키텍처 추론과 신뢰할 수 있는 성능 모델 구축 사이의 격차를 드러내며, 향후 개선 사항을 추적하고 재현 가능한 평가를 지원하기 위해 공개될 예정이다.

원문에서 자세히 보기: arXiv cs.AI

Hakken: 지식 예측 및 설명 시스템 소개

Hakken은 새로운 관계를 구축하여 과학적 지식을 확장하는 도메인 비의존적 예측 및 설명 시스템이다. 이 시스템은 대규모 연구 출처에서 추출한 지식 그래프의 시간적 시퀀스를 기반으로 하는 트랜스포머 모델과 대규모 언어 모델의 의미적 지식을 융합하여, 문서화되지 않은 과학 개념 간의 관계를 예측하고 분류한다. Hakken은 생물의학 분야에서 적용되어 시간 인식 다중 레이블 관계 예측의 새로운 기준을 설정했으며, 역사적 데이터에서 예측 결과의 일관성과 유용성을 입증하였다. 또한, 150만 개의 고신뢰 가설을 평가하여 생물학자들과 질적으로 검증하였고, 그 중 3개는 실험실에서의 검증을 위해 진행되었다. 의약품 발견과 재사용과 관련된 두 가지 예측이 확인되어, TP53과 BAMBI, RAF1과 TNF 간의 이전에 문서화되지 않은 상호작용이 입증되었다. 한국 개발자는 Hakken을 활용하여 새로운 과학적 관계를 발굴하고 실험할 수 있는 기회를 가질 수 있다.

원문에서 자세히 보기: arXiv cs.LG

안전 정렬 및 좁은 경계 안전성에 대한 새로운 접근법

이 연구는 안전 정렬을 좁은 경계 안전으로 정의하고, 공공 부문 도우미와 시민 교육자를 위한 각각 다른 경계를 설정하면서 동일한 주제를 다루는 모델의 필요한 변경 사항을 제시한다. 제안된 오프라인 자가 생성 프레임워크는 주제 생성, 보완 데이터, 그리고 유해성과 무해성 쌍을 결합하여 훈련 및 평가에 활용된다. 퀘스트(Qwen3-8B) 모델을 통한 훈련 결과, 정치적 설득에서는 거부 데이터 학습이 목표 도메인에서의 거부율을 9.47%에서 84.75%로 증가시키고, 안전하지 않은 응답 비율을 큰 폭으로 감소시킨다. 특히, 외부 응답을 검증된 목표 모델 응답으로 대체하는 방식이 과도한 거부율을 줄이는 데 효과적임을 나타냈다. 데이터 조합이 안전성과 유용성 간의 균형을 조절하며, 안전 정렬은 의도된 거부 경계의 양쪽 모두에서 평가되어야 함을 확인하였다. 한국 개발자는 이 연구를 통해 특정 분야에 맞는 사용자 반응율을 조정할 수 있는 모델을 개발할 수 있다.

원문에서 자세히 보기: arXiv cs.CL

TPU 커널 개발을 위한 MaxKernel 다중 에이전트 시스템

MaxKernel은 TPU 커널 개발을 위한 다중 에이전트 시스템으로, 세 가지 주요 패러다임을 구현한다. 첫 번째는 협업 설계를 위한 Human-in-the-Loop(HITL) 에이전트, 두 번째는 완전 자동화된 최적화 루프를 실행하는 Autonomous(Auto) 에이전트, 세 번째는 디자인 공간의 글로벌 탐색을 위한 그래프 기반 자율 탐색이다. 이러한 시스템은 계획, 구현, 자기 디버깅, 테스트 및 하드웨어 프로파일링을 수행하는 전문 서브 에이전트를 공유하는 구조이다. MaxKernel은 50개의 다양한 커널 작업으로 구성된 JaxBench와 오픈소스 모델의 복잡한 실제 작업을 대상으로 평가되었으며, 전문가의 수작업 조정 기준선과 유사한 성능을 지속적으로 생성하였다. 이 시스템은 오픈 소스로 제공되며, GitHub에서 확인할 수 있다. 한국 개발자는 MaxKernel을 사용하여 TPU를 위한 맞춤형 고성능 커널을 효율적으로 개발할 수 있다.

원문에서 자세히 보기: arXiv cs.AI

Vulkan GET_ROWS 지원 업데이트

이번 업데이트에서는 Vulkan의 GET_ROWS 셰이더가 비정렬된 오프셋을 처리할 수 있도록 개선되었습니다. 이전에 비정렬된 오프셋을 사용하면 하드 크래시가 발생했으나, 이제는 CPU로의 폴백이 가능해졌습니다. GET_ROWS 작업에서의 비정렬 오류는 assert 구문을 남기지 않고 natively 처리됩니다. 또한, GET_ROWS의 quantized 경로에서의 비정렬 오프셋 문제도 해결됐으며, 관련 테스트가 추가되어 모든 GET_ROWS 테스트가 성공적으로 통과했습니다. 이로 인해 Qwen3-TTS 및 Qwen3-VL 모델을 사용하는 경우 안정성이 향상되었습니다. 앞으로 한국 개발자는 이러한 변화를 활용하여 더 많은 GPU 최적화 모델을 제작할 수 있습니다.

원문에서 자세히 보기: llama.cpp Releases

로컬 코딩 에이전트를 실행하는 AirUncode

AirUncode는 사용자가 자신의 기계에서 여러 개의 로컬 코딩 에이전트를 동시에 실행할 수 있도록 돕는 소프트웨어입니다. 이 도구는 다양한 프로그래밍 작업을 병렬로 처리하여 효율성을 높이는 데 기여합니다. 특별한 설치 과정 없이 사용자 친화적인 인터페이스를 통해 손쉽게 에이전트를 설정하고 관리할 수 있습니다. 이 제품은 개발자들에게 자신만의 코딩 환경을 최적화할 수 있는 기회를 제공합니다. AirUncode는 프로그래밍 및 개발 업무를 더욱 유연하게 수행하고자 하는 사용자에게 유용할 수 있습니다. 한국 개발자는 이 도구를 활용하여 로컬 개발 환경에서 멀티 태스킹을 구현할 수 있습니다.

원문에서 자세히 보기: Product Hunt

OpenAI의 에이전트 혁신과 GPT-6 공개

최근 OpenAI는 새로운 에이전트 모델인 GPT-6 Astra를 공개하며, 에이전트 관련 작업의 비용이 최대 45% 감소했다고 발표했다. 또한, OpenAI 내부에서는 Recursive Self-Improvement(RSI)과 같은 혁신적인 연구가 이루어지고 있으며, 이는 AGI 개발과 연관이 있는 것으로 보인다. 에이전트 활용이 높아지면서 연구자들의 일일 작업 생산성이 급격히 증가하고 있다는 점도 주목할 만하다. GPT-6 Astra의 출시가 이러한 변화의 핵심 요소로 작용하면서 OpenAI의 연구 환경이 크게 변화하고 있다는 분석이 제기되고 있다.

참고 출처 (3개 매체 종합)

AI 리스크 관리와 컴퓨팅 계약 현황

에임인텔리전스는 AI 에이전트 및 피지컬 AI 시대에 따라 통제 불능 리스크를 방지하기 위해 실시간 보안 레이어 구축의 필요성을 강조했다. 이들은 최근 서울에서 열린 AI 리스크 컨퍼런스에서 기업의 82%가 그림자 AI 에이전트를 보유하고 있다는 통계자료를 인용하며 경각심을 일깨웠다. 한편, Anthropic은 지난 11개월간 5170억 달러 규모의 컴퓨팅 계약을 체결했으나 OpenAI의 7500억 달러 플랜에는 미치지 못하고 있다. Dario Amodei CEO는 과도한 투자에 대한 경고를 하며 경쟁에 맞서기 위한 움직임을 보이고 있다.

참고 출처 (2개 매체 종합)

Mac에서 음성 주석 추가 및 스크린샷 관리 기능

Assist 4는 사용자가 맥에서 음성으로 주석을 추가할 수 있는 기능을 제공합니다. 이 애플리케이션은 스크린샷을 캡처하고 클립보드를 관리할 수 있는 도구로 통합되어 있습니다. 사용자는 음성을 텍스트로 변환하면서 간편하게 작업할 수 있으며, 다양한 미디어 파일을 효율적으로 정리할 수 있습니다. 해당 제품은 MacOS에서 실행되며, 사용자는 자신의 프로세스를 최적화할 수 있는 기능들을 활용할 수 있습니다. 한국 개발자는 이 도구를 활용해 사용자 경험을 개선하는 다양한 애플리케이션을 개발할 수 있습니다.

원문에서 자세히 보기: Product Hunt

AI의 능력 향상과 안전성 확보를 위한 촉구

Jakub Pachocki는 AI의 능력이 점점 향상됨에 따라 이에 대한 안전성과 정렬 문제를 강조하였다. 그는 AI의 발전 속도가 가져오는 도전에 대응하기 위해 보다 강력한 안전 장치와 국제적 협력이 필요하다고 주장한다. 안전성과 정렬 문제는 AI의 올바른 방향성을 유지하는 데 필수적이다. 또한, 다양한 이해관계자가 참여하는 국제적인 논의가 이루어져야 한다는 점도 지적하였다. 이러한 맥락에서 한국 개발자는 AI 시스템의 윤리적 기준을 강화하는 데 기여할 수 있다.

원문에서 자세히 보기: OpenAI News

토스 프론트엔드 팀의 새로운 문서 시스템 구축

토스 프론트엔드 팀은 문서 검색의 번거로움을 줄이고, 개발자들이 즉각적인 질문에 대한 답변을 받을 수 있는 새로운 문서 시스템을 구축했다. 이 시스템은 AI를 기반으로 하여 개발자들이 개발에 전념할 수 있는 환경을 제공한다. 이를 통해 문서의 접근성과 활용성이 향상되어 효율적인 작업이 가능해졌다. 이 새로운 시스템은 개발팀의 전반적인 생산성을 높이는 데 기여할 것으로 기대된다. 한국 개발자는 이 시스템을 통해 문서 작성 및 검색의 효율성을 개선할 수 있다.

원문에서 자세히 보기: 토스 기술 블로그

OpenAI의 AI 연구 인턴과 속도 경고

OpenAI는 자사의 AI 에이전트가 인간의 업무량의 3.1배를 처리할 수 있으며, ‘자동화된 연구 인턴’ 목표를 달성했다고 밝혔다. 그러나 수석 과학자인 파초키는 현재의 정렬 및 모니터링 수준의 부족함이 최대 속도로의 확장에 걸림돌이 될 수 있다고 경고했다. 이에 따라 AI 에이전트를 통한 소프트웨어 개발의 변화와 실질적인 영향이 주목받고 있으며, 장기적인 소프트웨어 품질과 기술 부채에 대한 연구가 필요하다는 의견이 제기되고 있다.

참고 출처 (2개 매체 종합)

AI 대화 기록 기능 출시

새로운 기능이 출시되어 사용자가 AI와 나눈 대화를 저장할 수 있게 되었다. 이 기능을 통해 대화 내용은 탭을 닫은 후에도 지속적으로 유지된다. 사용자는 이전 대화를 쉽게 찾아볼 수 있어 효율적인 정보 관리가 가능해진다. 이 서비스는 웹 기반으로 제공되며, 사용자는 별도의 설치 없이 웹사이트를 통해 접근할 수 있다. 한국 개발자는 이 기능을 활용하여 사용자 경험을 개선할 수 있는 방법을 구상할 수 있다.

원문에서 자세히 보기: Product Hunt

Lean 4로 구현한 인프라 관리 도구 - infra

Lean 4로 개발된 infra 도구는 Terraform과 유사한 기능으로 효율적인 인프라 관리가 가능하다.

원문에서 자세히 보기: TLDR Tech

Alibaba, Qwen-Drive 1.0 출시

Alibaba의 Qwen-Drive 1.0은 환경 인식 및 경로 계획 기능을 통합한 AI 모델입니다.

원문에서 자세히 보기: THE DECODER

AI 혁신에 대한 신중한 접근: 오픈AI의 수석 과학자 발언

오픈AI 수석 과학자가 AGI 개발에 신중한 접근을 요구하며 AI 정책의 중요성을 강조했습니다.

원문에서 자세히 보기: The Neuron

Claude Fable 5.1로 완성한 비디오 제작

Claude Fable 5.1을 이용해 비디오를 단 한 번의 시도로 제작한 사례가 소개되었다.

원문에서 자세히 보기: Reddit r/vibecoding

SerpApi: AI 에이전트를 위한 웹 검색 API의 비밀

SerpApi는 AI 에이전트가 웹 검색 기능을 사용할 수 있도록 지원한다.

원문에서 자세히 보기: TLDR Tech

고속 구문 검사 통과의 자율 코딩 에이전트

자율 코딩 에이전트가 고속으로 구문 검사를 통과하는 기술이 개발되었습니다.

원문에서 자세히 보기: ai-news-daily (Local LLM Aggregator)

다단계 작업 흐름으로의 자동화 변화

다단계 작업 흐름으로의 자동화 혁신이 AI 발전에 힘을 싣고 있습니다.

원문에서 자세히 보기: ai-news-daily (Local LLM Aggregator)