AIの学習と予測について
「AIが予想する」と言われても、中で何をしているのかが分からないと信用のしようがありません。
このページでは、BoatFactorAIが行っている学習と予測を、専門用語をかみくだいて説明します。
ひとことで言うと
過去のレースで「どんな艇が上位に来たか」の傾向を数式にまとめ(学習)、その数式に今日の出走表を通して着順を見積もる(予測)。やっているのはこの2つだけです。
1. 集める
予測したい開催日の前日までの1年ぶんのレースを、出走表と結果をそろえて読み込みます。1年でおよそ4万レース・24万艇ぶんのデータです。
2. 学習する
「級別」「勝率」「平均スタート」「モーターの成績」などの項目と、実際の着順との関係を、コンピュータが繰り返し計算して数式にまとめます。
3. 予測する
できあがった数式に、その日の出走表を通します。6艇それぞれに点数が付き、点数の高い順に ◎〇△×56 が決まります。
AIの「学習」とは何をしているのか
人が競艇を覚えるときも、たくさんレースを見て「1号艇は強い」「A級は堅い」「モーターが良いと来る」と法則を覚えていきます。
AIの学習はそれを、人の感覚ではなく数字の積み上げでやっているだけです。
学習に使うもの
| 用語 | かみくだくと | BoatFactorAIの場合 |
|---|---|---|
| 学習データ | お手本にする過去のレース | 予測する開催日の前日までの1年ぶん。古すぎると今の勢力と合わず、短すぎると数が足りないため、初期値を1年にしています(月数は変更できます)。 |
| 特徴量 (とくちょうりょう) |
判断材料。AIに見せる項目 | 選手の級別・全国勝率・当地勝率・平均スタート、モーターやボートの2連対率、艇番(コース)、会場、レース番号など。どれを使うかは開発側で検証した推奨値が全利用者に配られます。 |
| 目的変数 (もくてきへんすう) |
当てにいく「答え」 | 着順ランク/1着になったか/2連対したか/3連対したか、の4つ。4つを別々に学習します。 |
| モデル | 学習でできあがった数式のかたまり | 目的変数ごとに1つずつ、計4つ作られます。 |
| アルゴリズム | 学習のやり方 | 勾配ブースティング(LightGBM)。「はい/いいえ」の枝分かれ(決定木)を少しずつ積み重ねていく方式です。 |
学習の進み方
ざっくり言えば「予測してみる → 答え合わせ → ずれた分を直す」の繰り返しです。
まず雑に予測
最初のモデルは当たりません。全艇に似たような点を付ける程度です。
答えと比べる
実際の着順と見比べて、どの艇をどれだけ間違えたかを測ります。
間違いを直す枝を足す
間違えたレースを説明できる枝分かれを1本足します。これを何千回も繰り返します。
行き過ぎる前に止める
直しすぎると過去だけに詳しい「暗記」になるので、途中で改善が止まったらそこで打ち切ります。
| 設定 | 意味 |
|---|---|
| 学習回数 | 枝を足す回数の上限。初期値2000回。多いほど細かく覚えますが、暗記に近づきます。 |
| 早期打切り | この回数ぶん改善しなくなったら学習を止める、という歯止め。初期値50回。 |
| 学習率 | 1回ごとにどれだけ直すか。初期値0.05。小さいほど慎重に、ゆっくり学びます。 |
| 葉の数 | 1本の枝分かれの細かさ。初期値31。大きいほど複雑な条件を表せますが、暗記しやすくなります。 |
「ちゃんと学べたか」の確かめ方
学習に使ったレースで答え合わせをしても、暗記した答案を採点するようなもので意味がありません。そこで学習期間の後ろ2割は学習に使わず、答え合わせ専用に取り分けています。
| 検証 | 取り分けたレースで、1着的中率と3連対率を測ります。 |
|---|---|
| ベースライン比較 | 競艇は1号艇が有利な競技です。そのため「常に1号艇を本命にする」だけの成績を必ず並べて表示します。これを上回れなければ、AIを使う意味がないからです。 |
| データの欠け | 予測する日のデータに抜けがあると精度が落ちるため、欠測の割合もログに出しています。 |
AIの「予測」とは何をしているのか
学習でできたモデルに、その日の出走表を1艇ずつ通すだけです。返ってくるのは順位ではなく点数で、その点数を高い順に並べたものが ◎〇△×56 になります。
4つの見方で予測する
| 予測するもの | 何が分かるか |
|---|---|
| 着順ランク | 6艇の中での強さの序列。1位から6位までの並びを直接学習したものです。1位と2位が僅差なのか断然なのかが分かるよう、順位だけでなく元の点数も残しています。 |
| 1着確率 | その艇が1着になりやすいか。頭を決めるときの判断材料です。 |
| 2連対確率 | 2着までに入りやすいか。 |
| 3連対確率 | 3着までに入りやすいか。3連単の3着候補を選ぶときに使います。 |
4つは別々に学習した別々のモデルです。だからこそ、4つの見方が同じ艇を指しているレースは信頼でき、バラバラのレースは危ない、という判断ができます。ソフトではこの一致の度合いを「AI同士の一致度」として点数にしています。
予測から「レース診断」へ
予測はあくまで材料です。BoatFactorAIは、その材料を組み合わせて「このレースは買う価値があるか」まで判断します。
| 診断項目 | 予測から、どう計算しているか |
|---|---|
| 予測容易度 | 1位と2位の点差が大きいほど高くなります。実力差がはっきりしているレースです。 |
| AI同士の一致度 | 4つのモデルが同じ艇を上位に置いているかどうか。 |
| AI信頼度 | 一致度と、その会場・レース番号の過去データの多さから求めます。 |
| 波乱度 | 上位陣の点数が団子状態か、実績の薄い艇が上位に来ていないか、といった荒れやすさ。 |
| 妙味 | AIの見立てと、一般的な予想(電話投票の予想など)との食い違いの大きさ。 |
| 総合評価・判定 | 上の項目に重みを付けて足したものが総合評価(S〜D)。しきい値で「買い/様子見/見送り」を決めます。 |
守っているルール
AIの予測は、作り方を少し間違えるだけで「過去を振り返れば当たっているのに、本番では当たらない」という状態になります。それを避けるために、次のことを徹底しています。
答えを見て学習しない
学習に使うのは、予測する開催日の前日までのレースだけです。予測する日の結果は、たとえ手元にあっても学習には混ぜません。
当日しか分からない項目を使わない
展示タイムやスタート展示は当日にならないと入りません。これを学習に入れると、前日の予測時だけ材料が欠けた状態になるため、推奨の特徴量から外しています。
結果が混ざる項目を外す
「今節成績」のように、予測したいレース自身の着順が入り込む項目は、候補から除いています。入れると成績が良く見えますが、実戦では役に立ちません。
AIにできること・できないこと
できること
何万レースぶんもの傾向を、感情や体調に左右されずに同じ基準で当てはめること。そして「このレースは条件が揃っていない」と買わない判断を淡々と出すことです。人が1日何十レースも同じ精度で見続けるのは困難です。
できないこと
結果を当てることの保証はできません。AIが出すのは確率であり、確率が高いレースでも外れます。事故・妨害・展開のあやなど、データに現れない要素も競艇には多くあります。
正直にお伝えしておくこと。競艇は1号艇が有利な競技で、「常に1号艇を本命にする」だけでもかなりの的中率になります。これは非常に強いベースラインです。開発では毎回この数字と並べて検証しており、これを安定して上回ることを目標に改良を続けています。的中率や利益をうたうことはいたしません。
本ソフトは判断材料を提供するものであり、購入の判断はご利用者ご自身で行ってください。公営競技には損失の可能性があります。
用語のまとめ
| 学習 | 過去のデータから規則性を見つけて、数式(モデル)を作る作業。 |
|---|---|
| 予測 | できた数式に新しいデータを通して、結果を見積もること。 |
| 特徴量 | AIに見せる判断材料の項目。勝率、平均スタート、モーター成績など。 |
| 目的変数 | 当てにいく答え。着順ランク、1着確率など。 |
| モデル | 学習の成果物。特徴量を入れると点数を返す数式のかたまり。 |
| 過学習 | 過去のデータを暗記してしまい、新しいレースでは当たらなくなること。 |
| 検証 | 学習に使わなかったデータで答え合わせをすること。 |
| ベースライン | 比較の基準。ここでは「常に1号艇を本命にする」買い方。 |
| リーク | 本番では使えないはずの情報(答えなど)が、学習に混ざってしまうこと。 |
| 勾配ブースティング | 枝分かれの判断(決定木)を少しずつ積み重ねて精度を上げる学習方式。LightGBMはその実装のひとつ。 |
BoatFactorAIの機能を見る
学習と予測のしくみが、実際の画面でどう使えるのかは製品ページでご確認いただけます。