jevやGPT-6 Luna Decisionsなどの素早い判断に特化した確率モデルがパックマンをプレイするベンチマーク「jevman」

「jevman」は、AIにパックマンをプレイさせて、状況に応じた判断能力を比較するベンチマークです。 AI向けのAPIサービスを提供するOpperが公開しており、6種類のAIモデルにそれぞれ100回ずつパックマンをプレイさせ、その得点や判断速度、実行コストなどを比較しています。
jevman: a Pac-Man benchmark for decision models | Opper AI
https://opper.ai/jevman-benchmark/
GitHub - opper-ai/jevman-benchmark: Pac-Man driven by the jev decision model · GitHub
https://github.com/opper-ai/jevman-benchmark
JevはアメリカのAI企業TypeSafe AIが開発したAIの一種で、従来の文章生成とは異なり、選択肢の評価や意思決定に特化したモデルです。ChatGPTなどの一般的な大規模言語モデル(LLM)が文章を生成するのに対し、確率判断モデルは与えられた情報をもとに、あらかじめ設定された選択肢それぞれの確率を出力します。例えば、顧客からの問い合わせが「返品」「技術的な問題」「その他」のどれに該当するかを確率で示すことができます。文章による説明を生成する必要がないため、素早い判断が求められる用途に適しています。
jevmanではパックマンが迷路の分岐点に到達するたびにAIモデルが進行方向を判断します。単に目の前のドットを取るだけでなく、ゴーストの位置や逃げ道などを考慮する必要があるため、AIの判断能力を試すことができます。jevmanが評価するのは、刻々と変化する状況に対して適切な判断を素早く下す能力なので、長時間考えれば正しい答えに到達できるモデルが必ずしも高得点を獲得できるとは限りません。
また、jevmanではJevだけでなく、KevやLaya、Clef、GPT-6 Luna Decisionsなど、複数のモデルを同じゲーム環境で比較できるように設計されています。
ゲーム中、AIモデルには迷路の構造、ドットの配置、ゴーストの位置などがJSON形式のデータとして渡されます。AIモデルはその情報をもとに、上下左右のどの方向に進むべきかを確率で回答します。ゲーム側は返された確率に従って進行方向を選択する仕組みです。
具体的にはAIモデルには1回の判断につき2秒の制限時間が設けられています。2秒以内に回答できなかった場合は、単純な代替アルゴリズムが進行方向を決めます。この代替アルゴリズムが使用された回数も記録されるため、判断の正確さだけでなく、応答速度も重要になります。
ベンチマークでは各AIモデルが従来のパックマンと同じルールで動くゴーストを相手に100回プレイします。1ゲームは残機3つをすべて失うか、5分が経過すると終了するルールです。Opperによると、実際のテストで最も長く生き残ったゲームは2分24秒だったとのこと。
ランキングは100ゲームの平均得点をもとに決定されます。ただし、ゲームごとの得点にはばらつきがあるため、95%の信頼水準を目安とした誤差範囲も計算し、得点差が誤差の範囲内に収まるモデルは同順位として扱われます。また、各モデルの最高得点も確認できます。
jevmanの公式サイトではAIによるパックマンのプレイを観戦できるほか、ユーザー自身がパックマンを操作してAIと対戦することもできます。
jevmanはオープンソースで公開されており、独自のAIモデルをベンチマークに参加させることも可能です。HTTP経由でリクエストに応答できれば、クラウド上で提供されるAIモデルだけでなく、ローカル環境で動作するAIモデルも利用できます。
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.




