AIによって開発されたオープンソースのAIアクセラレータ「openTPU」が登場

AIを使ってAI向けハードウェアを設計するオープンソースプロジェクト「openTPU」が公開されています。openTPUは、AIモデルを高速に動かすための専用アクセラレーターをAIエージェントも活用しながら開発する試みで、Qwen3やQwen3.5、Gemma 4など複数の言語モデルを実際のFPGAカード上で動かすことに成功しています。
GitHub - FeSens/openTPU: An open-source AI accelerator, developed by AI: RTL, ISA, simulator, compiler and profiler in one repo. Runs Qwen3, LFM2.5 and Qwen3.5 on a Kintex-7 PCIe card. · GitHub
https://github.com/FeSens/openTPU
openTPUはGoogleのTPUを再現するのではなく、「AIエージェントはどこまでハードウェア設計をこなせるのか」「AIが自分自身を動かすためのチップを設計できるのか」を確かめるプロジェクト。単にAI向けハードウェアを作るだけでなく、その設計過程自体をAIに担わせている点が特徴で、ソフトウェアから回路まで一通り公開されているため、AIアクセラレーターの仕組みを学ぶための教材としての利用も想定されています。
openTPUの構造は命令を順番に発行するシーケンサーを中心に、メモリとのデータ転送を担当するDMA、行列演算を実行する行列演算ユニット、浮動小数点演算を行うベクトルユニット、結果を量子化するユニットなどを組み合わせ、意図的にシンプルになるように設計されているとのこと。一般的なCPUやGPUのようなキャッシュや複雑な命令スケジューリングを持たず、データ移動も命令として明示的に扱うため、「どの処理に何クロックかかったのか」を追跡しやすくなります。
開発者はAMDのKintex-7を搭載したFPGAカードにopenTPUの回路を書き込んで実際のハードウェア上で動作を検証。その結果、LFM2.5-230MやQwen3-0.6B、Qwen3.5-0.8B、Gemma 4、Phi-4-miniなど複数のモデルを動作させています。
例えば、4bitに量子化したLFM2.5-230Mでは毎秒82.1トークン、Qwen3-0.6Bでは毎秒30.7トークン、Qwen3.5-0.8Bでは毎秒23.3トークンの生成速度を記録しています。
また、openTPUはカード上のメモリに収まらない大規模モデルにも対応しているそうで、必要なデータだけをPC側から送り込む仕組みにより、347億パラメータのQwen3.5-35B-A3Bも毎秒3.95トークンで動作させたと開発者は報告しています。
記事作成時点では、openTPUはAIの計算そのものよりも、モデルのデータをメモリから読み出す速度が性能の大きな制約になっているとのこと。そのため、今後はメモリアクセスの効率化や、入力文を最初に処理するプリフィルの高速化などが課題とされています。
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.


