Entity

Pretraining Recurrent Networks without Recurrence

Training recurrent neural networks (RNNs) requires assigning credit across long sequences of computations. Standard backpropagation through time (BPTT) addresses this problem poorly: it is sequential in time, limiting parallelism, and suffers from vanishing or exploding gradients, making long-range associations difficult to learn. We propose Supervised Memory Training (SMT), a method for training nonlinear RNNs that sidesteps recurrent credit propagation entirely by reducing RNN training to supe

Paper · arXiv

cs.LG

Authors: Akarsh Kumar, Phillip Isola
Published: 2026-06-04
Categories: cs.LGcs.AI

Abstract ↗

via arXiv · 2606.06479