政策文件如何变成结构化数据
一、为什么政策需要结构化
当客户问"我能报什么"时,系统需要把企业画像与政策条件做匹配。这就要求政策不只是文本,而是一组可计算的条件。
二、核心字段设计
<pre><code class="language-json">{
"policy_name": "北京市专精特新中小企业奖励",
"level": "市级",
"industry": ["制造", "软件", "集成电路"],
"conditions": {
"revenue_min": 1000,
"rd_ratio_min": 0.03,
"patent_min": 1
},
"subsidy_text": "认定后一次性 10 万–50 万",
"deadline": "2026-12-31",
"materials": ["审计报告", "社保明细", "专利证书"],
"source_url": "https://...",
"updated_at": "2026-09-01"
}
</code></pre>
三、常见坑点
- 金额写成区间文本:必须拆成 min/max 数值,否则无法计算
- 截止时间缺失:过期政策不删,但要标失效,否则会推荐错
- 条件嵌套:有些条件是"且"关系,有些是"或",抽取时要保留逻辑
- 附件被忽略:很多关键条件在附件表格里,正文没有