00:00
2026-10-01
machinelearning.apple.com
machine-learning
RLTL;DR: Self-Improvement by Internalizing Self-Generated Feedback
A new method called RLTL;DR lets a Qwen 3.5 9B Thinking policy break through a learning barrier on tool-calling and coding datasets filtered to Pass@128 = 0, reaching a Pass@1 of 14โ31% with insights โฆ