Brogue evaluation

Can an agent learn to win across repeated games?

GPT-6 Astra150 games0 winsRead the report ↗

Results

ExperimentReasoningSessionsGames / sessionFinal score
v6Medium1307 / 52Replays ↗
v6Max13013 / 52Replays ↗
v5Max18 + 26 / 52Replays ↗
v3Medium88 + 25.9 / 52*Replays ↗

30 games: best of all. 8+2: best of the last two. *Mean across completed sessions.

30-game sessions

Same 30 dungeons. Separate sessions. Twelve-hour allowance each.