00:00
2026-08-09
mikeayles.com
artificial-intelligence
On-Chip LLM: Serving an FPGA to Strangers
Mike Ayles' on-chip LLM project serves a large language model from a $250 FPGA (Xilinx Kria KV260) to the public internet via a Cloudflare Tunnel, achieving ~19,240 fabric tokens per second but only ~โฆ