【書籍】囲碁ディープラーニングプログラミング（翻訳）

囲碁プログラム翻訳書籍技術書典

マイナビ出版から「囲碁ディープラーニングプログラミング」という本が出版されます。私は翻訳者として関わらせてもらいました。 PythonとKerasを使って、AlphaGo、AlphaGo Zeroの仕組みを一つずつ実装しながらディープラーニングを学べる入門書になってい…

2016-08-16

SL policy networkの囲碁プログラムへの適用

AlphaGo 囲碁プログラム

以前に学習したSL policy networkを囲碁プログラムに適用してみた。特徴を4つに絞って、学習を160万局面で行ったものなので、棋譜との一致度は30%くらいの状態だが、そこそこ効果はあるのではないかと思って試してみた。学習している棋譜は19路盤なので、19…

2016-08-07

rollout policyの学習(やり直し)

AlphaGo 囲碁プログラム

以前にrollout/tree policyをAdaGradで学習させたが、学習データとは別のテストデータを使った評価を行っていなかったので、学習をやり直した。学習に使用させてもらっていた棋譜サイトが閉鎖してしまったので、今回からGoGoDという有料の棋譜を購入して使用…

2016-06-11

CUDAを使ってみた

CUDA 囲碁プログラム

SL policy networkをChainerを使って学習した結果を、囲碁プログラムに組み込む際、C++のプログラムからDCNNの実行のためにpythonプログラムを呼ぶとオーバーヘッドが大きい。できれば、DCNNをC++から実行したい。順伝播のみであれば、ディープラーニング…

2016-06-06

学習アルゴリズム変更

AlphaGo DeepLearning 囲碁プログラム

前回の日記で、SGDでSL policy networkを学習し、学習が成功していることが確かめられた。学習アルゴリズムをSGDにしたのは、AlphaGoの論文で採用されていたからだ。収束に非常に時間がかかるので、別の方法だともっと収束が早くならないか試してみた。また…

2016-06-04

SL policy networkの学習

AlphaGo DeepLearning Chainer 囲碁プログラム

前回の日記でChainerで作成したAlphaGoのSL policy networkをプロの棋譜を使って学習させてみた。棋譜は、以前と同様、インターネットの棋譜サイトから入手したプロの棋譜を使用した。まずは、学習がうまくいくか様子をみるため、特徴はAlphaGoの論文のExten…

2016-05-28

ChainerでAlphaGoのSL policy networkを定義

AlphaGo 機械学習囲碁プログラム

AlphaGoのSL policy networkをとりあえず定義だけ作ってみました。AlphaGoの論文から、SL policy networkは以下のようになると理解しています。 layer1は、5*5のフィルターk枚、ReLU関数 layer2～12は、3*3のフィルターk枚、ReLU関数 layer13は1*1のフィルタ…

2016-05-21

【囲碁プログラム】 rollout/tree policyをAdaGradで学習

AlphaGo 囲碁モンテカルロ木探索囲碁プログラム機械学習

※学習のやり直しを行った記事はこちらプロの棋譜からrollout/tree policyを学習してもGnuGoに対して勝率が30%程度であまり高くなっていない。学習に確率的勾配降下法(SGD)を固定の学習係数(0.001)とL1正則化係数(0.0000001)を使っていたので、学習方法を変…

2016-05-16

【囲碁プログラム】 tree policyの学習

AlphaGo 囲碁プログラムモンテカルロ木探索機械学習

AlphaGoの論文にあるtree policyをプロの棋譜から学習を行った。rollout plicyから追加される特徴は以下の3つ。 Self-atari … 次に取られる手 Last move distance … 直前の2手からのマンハッタン距離 Non-response patter … 12point diamondパターン Last mo…

2016-05-07

【囲碁プログラム】プレイアウトにパターン適用

AlphaGo モンテカルロ木探索囲碁プログラム機械学習

昨日はhttp://www.computer-shogi.org/wcsc26/を中継で観ていました。コンピュータ将棋はまだまだ進化しているようで熱くなりますね。チェスのStockfishの技術が将棋にも応用されているみたいです。さて、AlphaGoとイセドルの対局を観てから作り始めた囲碁…

2016-05-05

【囲碁プログラム】 rollout policyの学習

囲碁プログラムモンテカルロ木探索機械学習

インターネット上から入手した5万局くらいのプロの棋譜から、プレイアウトの特徴量を学習させてみた。勝ったほうの手のみを学習することにしたので、勝敗データがない棋譜は除外した。特徴量は、AlphaGoの論文にあったrollout policyの特徴量とした。ただ…

2016-04-30

ビットボードの高速化

囲碁プログラム

ここの記事に、_BitScanForward64を使う場合、ヒットしたビットを0にするのに、 n &= n - 1; とするとよいと書かれていたので試してみた。現在、ビットを0にするのに、 _bittestandreset64(&n, i); を使用している。記事では、下記のように1をシフトして演算…