InquirerDefense says Sara consented to public viewing of confidential BIR letterESPNWas epic Man City-Liverpool rivalry all a sham after cheating scandal?ESPN DeportesMessi entrenó con Inter Miami tras homenajeThe Jerusalem PostSouth Africa's Navanethem 'Navi' Pillay, who accused Israel of genocide in Gaza, wins Nobel PrizeCNN TürkSON DAKİKA... Cumhurbaşkanı Erdoğan: Uluslararası hukuk askıya alındıUN NewsFormer UN rights chief awarded Nobel Peace PrizeDaily MaverickANTI-FOREIGNER UNREST: Home Affairs scraps asylum seeker directive after violence in Durban and SowetoZDF heuteAktuelle Pressemitteilungen des ZDFThe South AfricanCape Town makes two of the world’s top city listsSBS 뉴스우크라, 한국대사 소환에 "외교가 감정보다 우선해야"Digital SpyBBC's brand-new North East-set detective series confirms release date – and it's soonNU.nlICC blij met Nobelprijs voor oud-rechter: 'Erkenning in deze tijd belangrijk'
The Daily Newsstand · Free, Always
Friday, October 9, 2026

jevやGPT-6 Luna Decisionsなどの素早い判断に特化した確率モデルがパックマンをプレイするベンチマーク「jevman」

Translate

「jevman」は、AIにパックマンをプレイさせて、状況に応じた判断能力を比較するベンチマークです。 AI向けのAPIサービスを提供するOpperが公開しており、6種類のAIモデルにそれぞれ100回ずつパックマンをプレイさせ、その得点や判断速度、実行コストなどを比較しています。

jevman: a Pac-Man benchmark for decision models | Opper AI
https://opper.ai/jevman-benchmark/

GitHub - opper-ai/jevman-benchmark: Pac-Man driven by the jev decision model · GitHub
https://github.com/opper-ai/jevman-benchmark

JevはアメリカのAI企業TypeSafe AIが開発したAIの一種で、従来の文章生成とは異なり、選択肢の評価や意思決定に特化したモデルです。ChatGPTなどの一般的な大規模言語モデル(LLM)が文章を生成するのに対し、確率判断モデルは与えられた情報をもとに、あらかじめ設定された選択肢それぞれの確率を出力します。例えば、顧客からの問い合わせが「返品」「技術的な問題」「その他」のどれに該当するかを確率で示すことができます。文章による説明を生成する必要がないため、素早い判断が求められる用途に適しています。

jevmanではパックマンが迷路の分岐点に到達するたびにAIモデルが進行方向を判断します。単に目の前のドットを取るだけでなく、ゴーストの位置や逃げ道などを考慮する必要があるため、AIの判断能力を試すことができます。jevmanが評価するのは、刻々と変化する状況に対して適切な判断を素早く下す能力なので、長時間考えれば正しい答えに到達できるモデルが必ずしも高得点を獲得できるとは限りません。


また、jevmanではJevだけでなく、KevやLaya、Clef、GPT-6 Luna Decisionsなど、複数のモデルを同じゲーム環境で比較できるように設計されています。

ゲーム中、AIモデルには迷路の構造、ドットの配置、ゴーストの位置などがJSON形式のデータとして渡されます。AIモデルはその情報をもとに、上下左右のどの方向に進むべきかを確率で回答します。ゲーム側は返された確率に従って進行方向を選択する仕組みです。

具体的にはAIモデルには1回の判断につき2秒の制限時間が設けられています。2秒以内に回答できなかった場合は、単純な代替アルゴリズムが進行方向を決めます。この代替アルゴリズムが使用された回数も記録されるため、判断の正確さだけでなく、応答速度も重要になります。

ベンチマークでは各AIモデルが従来のパックマンと同じルールで動くゴーストを相手に100回プレイします。1ゲームは残機3つをすべて失うか、5分が経過すると終了するルールです。Opperによると、実際のテストで最も長く生き残ったゲームは2分24秒だったとのこと。

ランキングは100ゲームの平均得点をもとに決定されます。ただし、ゲームごとの得点にはばらつきがあるため、95%の信頼水準を目安とした誤差範囲も計算し、得点差が誤差の範囲内に収まるモデルは同順位として扱われます。また、各モデルの最高得点も確認できます。


jevmanの公式サイトではAIによるパックマンのプレイを観戦できるほか、ユーザー自身がパックマンを操作してAIと対戦することもできます。


jevmanはオープンソースで公開されており、独自のAIモデルをベンチマークに参加させることも可能です。HTTP経由でリクエストに応答できれば、クラウド上で提供されるAIモデルだけでなく、ローカル環境で動作するAIモデルも利用できます。

View the original on GIGAZINE →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.