时间:2026-08-06 来源:FPGA_UCY 关于我们 0
7篇文章,从"为什么选FPGA做AI推理",到"怎么把自己的模型部署到板子上跑起来",到"端到端全链路怎么跑通",再到今天这张路线图,把整个体系串了一遍。
这个系列的结构,按学习顺序是这样一个链条:
① 选型 → ② 量化 → ③ 算子映射 → ④ Vitis AI流程 → ⑤ 端到端部署
这不是随意排列的,是按一个 真实的工程决策顺序 排的:先想要不要做(选型)→ 再想能不能做(量化压缩)→ 再想做了合不合理(算子映射/资源)→ 再想怎么做(Vitis AI流程)→ 最后想怎么跑稳(端到端部署)。缺任何一步,后面就卡住。
每篇对应的问题分别是:
篇目 核心问题
① 选型
我为什么用FPGA做AI,而不是GPU或ASIC?
② 量化
模型怎么从float32压到int8而不崩精度?
③ 算子映射
我的模型在FPGA上怎么展开,资源够不够?
④ Vitis AI流程
我的模型能不能上板,流程怎么走?
⑤ 端到端部署
板端整条链路怎么跑通,坑在哪?
这条路最难的三道关
回顾整个系列,有三道关是真实卡人的地方,每道关都在对应文章里有详细讲:
第一关:量化掉精度
INT8量化不是自动无损压缩。精度掉了,先查校准集和敏感层,别急着换模型。这道关很多人倒在"觉得是int8的锅"——其实是校准集没代表性,或者敏感层没做混合精度处理。《量化深入》里专门讲过。
第二关:Vitis AI环境版本碎片化
Docker镜像、Petalinux、runtime三版本必须对齐,错一个模型加载就挂。这道关卡死了80%的新手,根源不是技术,是文档太碎、版本号太乱。《Vitis AI全流程走通》里给了版本锁定的具体操作逻辑。
第三关:端到端整链瓶颈定位
DPU算力够 ≠ 整链快。预处理在PS上跑、DDR带宽打架、后处理卡在CPU——这些才是常见拖腿点。很多人的优化方向是错的:盯着DPU调配置,但整链瓶颈在别处。《端到端部署》里拆过各段耗时,优化顺序是先抓最长板。
坦白说,这个系列 不是"零基础直接学"的东西 。它假设你已经有:
如果这两块有短板,先补:
如果你已经在用PyTorch/TensorFlow训练模型,那你已经走完了"前半段";这个系列补齐的就是"后半段"——怎么让模型在硬件上跑起来。
学完这个系列 + 补完这两块基础之后,你能做到的是:
独立把一个自己训练/别人提供的模型,完整部署到FPGA上跑起来,并交付一个能稳定工作的端到端推理系统。
这是工业岗位的真实要求,不是跑通例程。
这个系列解决的是"FPGA AI推理部署的工程链路"问题。走完这条链路之后,有几个方向可以继续深入:
方向一:模型训练端深化
这个系列讲的是部署端,模型训练端还有很多东西:数据增强策略、超参数调优、模型结构设计(怎么让模型更量化友好)。模型训练做得好,量化压缩的代价更低,精度掉得少。
方向二:更高性能的DPU配置和优化
本系列讲了arch配置和吞吐/延迟权衡。更深的方向包括:DPU多实例部署(一个PL上跑多个DPU)、权重压缩(稀疏化)、DPU微架构调优。这些是往高端板(Versal、RFSoC)走的基础。
方向三:RFSoC / Versal全栈
FPGA AI推理在这些高端器件上,有完全不同的玩法:NoC片上网络提供海量带宽、PL DDR和PS DDR分离解决带宽争抢、AI Engine做矩阵运算加速。
方向四:真实项目交付
纸上谈兵永远不够。把这个系列学到的链路,用到真实项目里,做完、交付、调通——那才是真正学会。
如果你刚看到这篇文章,还没有FPGA基础:
别急,从头走。
路是一步一步走出来的。没有人第一天就懂FPGA AI推理部署,都是从流水灯开始。
FPGA+AI推理部署系列:
①《AI推理为什么要上FPGA——全景与选型逻辑》
②《量化深入:INT8/INT4/二值化全解析》
③《算子映射:卷积/池化/激活如何并行展开》
④《Vitis AI全流程走通:例程能跑通,自己的模型为什么跑不了》
⑤《端到端部署:从图像进到结果出,FPGA推理实战场景全链路》