ESPNDon't look now, Michiganders, but you're back in the Bottom 10RTP Desporto12h30 Aviso a CR7: "Jesus não vira cara à luta"The Jerusalem PostMaine Senate candidate Troy Jackson opposes US giving Israel 'blank check'PunchTinubu mourns NADECO chieftain Ralph ObiohaVanguardIGP Disu mourns 25 NAF personnel, passengers killed in crashRapplerAnyare? Villars’ AllHome, AllDay confirm store closuresCollider‘Carrie’s Mike Flanagan Confirms Why He Made a Major Change From Stephen King’s BookSouth China Morning PostChinese consortium to build Latin America’s longest cable-stayed bridge in BrazilZDF heuteAktuelle Pressemitteilungen des ZDFVariety‘In the Shadows’ Producers to Self-Release British Boxing Biopic Following Collapse of U.K. Distributor True Brit Entertainment (EXCLUSIVE)UN NewsWHO releases first global guidelines on child obesity as cases surgeTagesschauFrüherer BND-Präsident Hanning muss in Untersuchungshaft
The Daily Newsstand · Free, Always
Wednesday, October 7, 2026

AIによって開発されたオープンソースのAIアクセラレータ「openTPU」が登場

Translate

AIを使ってAI向けハードウェアを設計するオープンソースプロジェクト「openTPU」が公開されています。openTPUは、AIモデルを高速に動かすための専用アクセラレーターをAIエージェントも活用しながら開発する試みで、Qwen3やQwen3.5、Gemma 4など複数の言語モデルを実際のFPGAカード上で動かすことに成功しています。

GitHub - FeSens/openTPU: An open-source AI accelerator, developed by AI: RTL, ISA, simulator, compiler and profiler in one repo. Runs Qwen3, LFM2.5 and Qwen3.5 on a Kintex-7 PCIe card. · GitHub
https://github.com/FeSens/openTPU

openTPUはGoogleのTPUを再現するのではなく、「AIエージェントはどこまでハードウェア設計をこなせるのか」「AIが自分自身を動かすためのチップを設計できるのか」を確かめるプロジェクト。単にAI向けハードウェアを作るだけでなく、その設計過程自体をAIに担わせている点が特徴で、ソフトウェアから回路まで一通り公開されているため、AIアクセラレーターの仕組みを学ぶための教材としての利用も想定されています。

openTPUの構造は命令を順番に発行するシーケンサーを中心に、メモリとのデータ転送を担当するDMA、行列演算を実行する行列演算ユニット、浮動小数点演算を行うベクトルユニット、結果を量子化するユニットなどを組み合わせ、意図的にシンプルになるように設計されているとのこと。一般的なCPUやGPUのようなキャッシュや複雑な命令スケジューリングを持たず、データ移動も命令として明示的に扱うため、「どの処理に何クロックかかったのか」を追跡しやすくなります。

開発者はAMDのKintex-7を搭載したFPGAカードにopenTPUの回路を書き込んで実際のハードウェア上で動作を検証。その結果、LFM2.5-230MやQwen3-0.6B、Qwen3.5-0.8B、Gemma 4、Phi-4-miniなど複数のモデルを動作させています。

例えば、4bitに量子化したLFM2.5-230Mでは毎秒82.1トークン、Qwen3-0.6Bでは毎秒30.7トークン、Qwen3.5-0.8Bでは毎秒23.3トークンの生成速度を記録しています。

また、openTPUはカード上のメモリに収まらない大規模モデルにも対応しているそうで、必要なデータだけをPC側から送り込む仕組みにより、347億パラメータのQwen3.5-35B-A3Bも毎秒3.95トークンで動作させたと開発者は報告しています。

記事作成時点では、openTPUはAIの計算そのものよりも、モデルのデータをメモリから読み出す速度が性能の大きな制約になっているとのこと。そのため、今後はメモリアクセスの効率化や、入力文を最初に処理するプリフィルの高速化などが課題とされています。

View the original on GIGAZINE →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.