TadaoYamaokaの開発日記

個人開発しているスマホアプリや将棋AIの開発ネタを中心に書いていきます。

Gated Attention

【dlshogi】Gated Attentionを試す

今年のNeurIPS 2025でBest Paperとなった「Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free」を、dlshogiのモデルでも効果があるか試してみた。 Gated Attention AttentionのSoftmaxの出力直後に、入力に応じ…