[논문리뷰] J-Zero: Unified Challenger--Solver--Judge Co-Evolution from Zero Data본 논문은 기존의 Zero-data 기반 Self-evolving 모델들이 직면한 평가 성능의 상한선(Performance Ceiling) 문제를 해결합니다. 고정된 Judge를 사용할 경우, Solver가 해당 Judge의 변별력을 넘어서는 순간 더 이상의 학습 신호를 얻지 못하고 성능이 정체되는 현상이 발생합니다.#Review#Large Language Models#Self-evolution#Zero-data#Judge Co-adaptation#Adversarial Co-evolution#Group Relative Policy Optimization#Bradley-Terry Loss2026년 8월 30일댓글 수 로딩 중
[논문리뷰] AdvEvo-MARL: Shaping Internalized Safety through Adversarial Co-Evolution in Multi-Agent Reinforcement LearningLLM 기반 다중 에이전트 시스템(MAS)이 jailbreak, prompt-injection, adversarial collaboration과 같은 공격에 취약한 문제를 해결하는 것을 목표로 합니다.#Review#Multi-Agent Reinforcement Learning#Adversarial Co-evolution#LLM Safety#Jailbreak Attacks#Internalized Safety#Public Baseline#System Robustness2025년 10월 7일댓글 수 로딩 중