跳到正文
林欢

林欢

集成电路与体系结构 · CGRA 编译映射 / FPGA 时序优化 / 推理性能建模

复旦大学集成电路与微纳电子创新学院硕士在读,本科毕业于复旦大学物理学系。

研究方向是可重构架构的编译与映射:CGRA 的统一编译框架、路由反馈驱动的 DFG 变换, 以及把这套方法延伸到 FPGA 后布线时序收敛。近期也在做大模型推理的分析式性能建模。

工程上偏好把重复的分析与验证流程固化成工具——PACT 是这个思路在时序优化上的产物, GPROXY 是它在服务端的另一个例子。

huanlin24@m.fudan.edu.cnGitHub

并行进程

  • 基于 LLVM 的 HLS 递归函数消除插件2022.12–2023.3
  • 空间型 / 时间型 CGRA 统一编译与映射框架2024.9–2026.7
  • GPROXY:Rust 多协议 LLM API 网关2026.1–至今
  • PACT:FPGA 后布线时序优化 Agent2026.3–2026.6
  • 艾捷科芯 · 可重构矢量计算单元与 Runtime 适配2026.3–2026.6
  • 面向 PQC 的 CGRA 架构与编译工具链2026.6–至今
  • 路由感知的 CGRA 图优化与映射工具链2026.7–至今
  • 华为 · 昇腾大模型推理分析式性能估算工具2026.7–至今

论文成果

1

项目

GPROXY作者 · 维护者

2026-01 – 至今

Rust 编写的多协议 LLM API 网关,兼容 OpenAI / Anthropic / Gemini

RustAxumTokioSeaORMWASM

仓库

PACT第一作者

2026-03 – 2026-06

以 DCP 为状态的 FPGA 后布线时序优化 Agent

PythonVivadoRapidWrightLLM Agent

仓库

科研经历

路由感知的 CGRA 图优化与映射工具链

2026.7–至今
  • 构建编译器—映射器优化闭环,从未路由依赖边、冲突链路/GIB、局部拥塞、高扇出和重汇合热点中提取路由反馈,并定位至对应的 DFG 节点与边;将结构化反馈输入 Agent 决策模块,自动选择并执行语义保持的编译变换。
  • 设计路由反馈驱动的语义保持 DFG 变换,包括可交换计算阶段重排和边界连接结构调整;联合评估布局、调度与路由结果,降低映射 II,并提高高利用率场景下的映射成功率。

面向 PQC 的 CGRA 架构与编译工具链

2026.6–至今
  • 主要负责基于 CGRA 的后量子密码(PQC)算法加速,开展 RISC-V 参考实现梳理、算法拆分、关键算子/DFG 提取与性能瓶颈分析,建立从应用代码到架构需求的分析流程。
  • 围绕单引擎 1 Kcps 验收目标分解吞吐与周期预算,分析计算并行度、访存带宽、互连通信及映射 II 约束,推进 PQC 场景的 CGRA 架构求解与编译映射方案设计。
  • 在理想化 CPU–CGRA 切分假设下完成核心计算阶段的映射与性能评估,仿真吞吐约 1.1 Kcps;正在研究自动加速区域识别、CPU–CGRA 切分与协同编译。

PACT:FPGA 后布线时序优化 Agent

2026.3–2026.6
  • 以 DCP 为优化状态,根据关键时序路径、路由延迟、拥塞和高扇出等物理设计证据规划局部 ECO,并通过合法性与时序结果验证,支持执行、回滚与记录。
  • 封装 Vivado/RapidWright 结构化操作,覆盖关键网络重布线、驱动复制、局部重布局、逻辑重构、区域约束与全局 fallback;仅接受合法候选。
  • 在 35 个 UltraScale+ 后布线 DCP 上实现验证通过的 Fmax 几何平均提升 22.30%,优于 DATuner 的 15.14% 和通用 Codex Agent 的 9.78%;相较 DATuner 平均加速 6.4×,平均每个 DCP 成本 0.16 美元,为通用 Codex Agent 的 1/24.5。

空间型 / 时间型 CGRA 统一编译与映射框架

2024.9–2026.7
  • 扩展既有空间型 CGRA 的 LLVM 编译器、硬件生成器与映射器,在统一 DFG 和映射流程下同时支持空间型与多上下文时间型 CGRA;实现配置寄存器组和缓存寄存器组的时空复用机制。
  • 系统分析计算容量、I/O 下界、DFG 拓扑和目标互连对映射结果的影响,发现计算与 I/O 节点数量相同的功能等价 DFG,仍可能因连接结构不同表现出明显的吞吐差异。据此设计多类语义保持的图变换,在不改变目标架构的情况下,使部分原本不可映射的 DFG 成功映射,并降低部分可映射用例的 II。

基于 LLVM 的 HLS 递归函数消除插件

2022.12–2023.3
  • 基于 LLVM 开发源码到源码转换插件,将直接递归函数展平为非递归迭代结构,兼容 Bambu HLS。
  • 采用模块化设计,为间接递归和复杂调用图扩展保留接口;完成原型验证。

实习经历

昇腾大模型推理分析式性能估算工具华为

2026.7–至今
  • 参与已有大模型推理性能估算框架的模型适配与维护,接入模型计算图、算子特征及硬件算力、带宽、存储容量等模型与硬件配置。
  • 基于既有算子与阶段级性能模型适配 Prefill / Decode 流程,通过 batch size、sequence length、KV cache length 及并行配置变化分析 TTFT、TPOT 与显存估算结果。
  • 对齐内部框架的性能预测结果,参与扩展并发推理场景,支持多请求负载下的时延与吞吐评估。

可重构矢量计算单元与 Runtime 适配艾捷科芯

2026.3–2026.6
  • 梳理专有 SFU 的计算语义、数据通路接口、指令粒度与调用路径,明确可重构矢量计算单元的设计约束与接入方案。
  • 参与矢量计算单元与软件 Runtime 的接口适配,补充 NPU 相关指令定义、调用约束和验证用例。
  • 定位联调中的指令语义、数据格式和边界条件问题,补充接口文档与测试清单;将重复调试与验证步骤封装为 LLM Skill,实现状态读取、检查执行和结果整理的自动化。

奖项

Top 5 / Cash PrizeFPL 2026 Optimization Contest

2026
  • FPGA 后布线优化赛道最终成绩进入 Top 5,获得赛事现金奖励;最终排名待 FPL 2026 大会公布。
  • 在 7 个 Benchmark 上均取得正向 Fmax 提升,平均提升 56.1 MHz,最高提升 85.4 MHz。

教育经历

集成电路与微纳电子创新学院 · 电子信息 · 硕士复旦大学

2024.9–2027.6

物理学系 · 物理学 · 学士复旦大学

2018.9–2023.6

技能

数字设计与体系结构
Verilog、Chisel;具备 RTL 设计与模块验证经验,了解 RISC-V、NPU、FPGA 和 CGRA 架构,能够分析 PE、片上存储、NoC、计算并行度与带宽约束。
编译器
C/C++、LLVM;熟悉 DFG 提取与变换、空间型与时间型 CGRA 编译映射、调度与布局布线,以及指令和 Runtime 接口适配。
EDA
Design Compiler、Vivado、RapidWright、VTR/VPR、Bambu HLS;具备 RTL 综合、SDC 约束、时序与面积报告分析、后布线时序优化、局部 ECO 和自动化流程开发经验。
软件开发
Python、Rust、Linux、Git、Docker;具备异步服务、REST API、流式数据处理、数据库访问和多协议接口适配经验,熟悉 Axum、Tokio 的应用;有丰富的文档编写经验。
英语
CET-6 (522)