返回项目列表
Project Overview

智能标书锚点解析系统

面向政府采购招投标文件的智能解析系统,支持 PDF / DOC / DOCX 解析,并提取资格审查、符合性审查、评分办法和废标条款等评审锚点。

01

参与 LLM-first 信息抽取 pipeline,结合 OCR、PageIndex、规则 fallback 与多模型调用处理多格式文档差异。

02

建立覆盖 22 份历史文档、2,747 条历史锚点记录的回归基线,并审计样本回填与指标口径。

03

围绕真实招投标样本参与 AI 解析链路、锚点抽取、评审证据定位、页面验证与真实客户仓交付收口。

Verified Outcomes

可验证结果

这里不写虚高的性能数字,只保留公开简历、项目材料和页面中可以核验且边界清楚的结果。

22 份

历史文档

进入回归基线,用于持续观察多格式文件解析与抽取链路的变化。

2,747 条

历史锚点记录

用于检查样本回填和指标口径,区分回归稳定性与真实准确率。

4 类

核心锚点

资格审查、符合性审查、评分办法与废标条款进入统一解析和页面复核链路。

Context

项目背景 / 目标

  • 把招投标文档中的评审要求转换为结构化锚点,为后续评审、证据复核和风险提示提供可追溯输入。
  • 在多格式文档、扫描件和 LLM 输出不稳定的现实条件下,建立可评测、可回归、可人工复核的解析链路。
Ownership

我的职责

  • 参与 AI 解析链路、锚点抽取、评审证据定位和多服务联调问题修复。
  • 参与历史样本回归检查、指标口径审计与错误归因,明确自动化结果进入专家复核的边界。
  • 负责页面验证、问题复现、文档收口,并配合完成真实客户仓隔离交付。
Interview Notes

面试可继续展开

这部分不重复上面的总览结论,只保留适合继续追问的判断、取舍和后续迭代方向。

为什么这个项目值得看

这个项目最能体现我在真实业务里的 AI 应用工程经历:不仅要调用模型,还要处理 PDF / DOC / DOCX 和扫描件差异,定位证据页,做回归检查与口径审计,并把结果放回业务页面接受人工复核。

面试里适合继续追问的点

  • 为什么从纯关键词规则演进到 LLM-first + fallback 链路
  • OCR 与 PageIndex 在证据定位中分别承担什么职责
  • 历史样本回归和指标口径审计如何帮助定位问题
  • 多模型调用、规则兜底和人工复核如何共同控制风险
  • 真实客户仓隔离交付时怎样处理数据和代码边界

公开说明

本页只使用正式简历中已经公开的项目定位、个人职责、历史回归范围与工程边界。客户材料、内部地址、真实标书内容和未脱敏界面均不在作品集公开范围内。

Boundary

项目边界说明

  • 这是实习期间参与研发的团队项目,不表述为个人独立完成;PageIndex 也不是本人独立开发。
  • 历史回归基线用于定位样本、OCR、证据页映射和输出稳定性问题,不将历史匹配结果包装为正式准确率。
  • 客户仓、原始标书、内部页面与源代码不公开,本页只展示正式简历已经公开的脱敏口径。