[논문리뷰] Φ-Bench: Can Large Language Models Engineer the Infrastructure That Powers Them?본 논문은 LLM이 스스로를 구동하는 인프라를 엔지니어링하고 최적화할 수 있는지 평가하는 것을 핵심 목표로 한다. 기존 벤치마크들은 주로 고립된 커널이나 사전 정의된 연산자 구현에 초점을 맞추고 있어, 실제 환경에서 필요한 복잡한 시스템 탐색, 디버깅, 그리고 반복적인 최적화 과정을 평가하는 데 한계가 있다 .#Review#LLM Infrastructure#Benchmark#End-to-End Optimization#Kernel Function Completion#Long-Horizon Implementation#Software Engineering2026년 9월 9일댓글 수 로딩 중