深势科技PharmMaster·Patent帮你准确读专利,分子-活性数据一键整理
深势科技的 PharmMaster·Patent,是一款专门用于解析药物分子专利的智能体工具,构建在文档解析引擎 Uni-Parser 1.4 之上。它能从专利 PDF 里准确提取分子结构,并把结构和活性数据、实验条件这些散落在不同页面的记录关联起来——每一条结论都能核验回原文出处。
它还能把化学结构和权利要求(claims)逐层对应,协助药化专家看清一个分子落在保护范围的哪一层;也能对实施例里的分子结构进行分析,快速搭建构效关系(SAR),让药化专家一眼看清取代位点的探索方向。
药化专家们经常要面对这样的场景:
打开一篇三五百页的药物分子专利 PDF,翻到实施例,看到一个化合物结构,往前翻要找它的编号,往后翻要找它对应的活性数据——常常翻出几十页还没找到,因为活性数据藏在几十页外的表格里,表格又是按化合物顺序排的,人工比对全靠记性和运气。
找到之后还没完:结构要用 ChemDraw 这类软件一个个重新画出来,连同编号和活性数据一起录进 Excel,才能把结构放到一起比较、讨论。一整天下来,真正读透、整理完的专利没几篇,大部分时间花在来回翻页、手动画结构、维护那张越滚越大的 Excel 表上。
这不是效率问题,是专利本身的结构决定的。
化合物名称可能出现在实施例标题里,结构图在几页之后,活性数据散落在跨页表格中,实验条件又藏在表头、脚注或相邻段落。OCR 能让每一页变得可读,却不会自动把它们拼回一条可检索、可比较、可建库的记录。
PharmMaster·Patent 就是专门为高效解析药物分子专利开发的智能体工具。
一个真实案例
109页外的活性数据
以 226 页的 WO2018140648A1 为例,这是一篇围绕 ITK 共价抑制剂展开的专利。它的 Example 1 很能说明问题:化合物名称和结构出现在 p.82,对应的活性数据要到 p.191 的 Table 3 才出现,中间隔了 109 页。

化合物名称和结构出现在 p.82

对应的活性数据出现在 p.191
原始 PDF 里,这两处证据没有任何直接连接。读到 p.82 时看不到后面的数据,翻到 p.191 时又已经忘了 p.82 那个分子长什么样——这类跨页证据,正是专利里最容易被漏掉、也最难靠人工逐页核对的部分。
PharmMaster·Patent的解决方案
2.1 先看全貌:一张卡片说清一篇专利
PharmMaster Patent 把专利的基本信息、研发主题、代表结构、关键活性、实验体系与权利要求放进同一个阅读面,每项结论都能回到原文。研究者不用先通读整篇 PDF,就能判断这篇专利是否值得跟进、哪些化学系列最相关、该优先核验哪组活性或 Claim。

专利速读卡片
2.2 109 页外的证据,重新连回同一条记录
Uni-Parser 保留了结构、编号、表格行列和页面位置,PharmMaster Patent 据此关联出两条活性记录:ITK IC₅₀ 为“++ → ≤0.1 μM”,PLC-γ IC₅₀ 为“++ → ≤1 μM”。
在 PharmMaster·Patent 里,原始符号、区间语义和来源页码分层保留,可以逐条回到原文核验;遇到原文自身的异常,系统同时保留原值、校验记录与核验状态,不用清洗值覆盖原文。

跨页证据关联
这篇专利的活性数据横跨 p.191~193,用“++”“+”“−”表示两项 IC₅₀ 结果。PharmMaster Patent 把这些符号在本篇专利里的定义找回来,按靶点、检测方法和实验条件组织成可比较的记录,同时保留化合物编号、活性类型、原始符号和来源页码。
2.3 SAR:从实施例到可比较的结构空间
专利原文不会直接给出整齐的 SAR 矩阵。PharmMaster Patent 从实施例里提取具体分子,用化学信息学算法计算共享核心骨架、识别 R 位点、对齐取代基,把分散的结构组织成可比较的化学空间。

SAR 空间构建和分析
研发人员能看清每个位置已经探索过哪些取代方向,并回到对应实施例核验。
2.4 Claims:从原文到可审查的保护层级
Claim 1 给出 Formula(I)和 R 基定义,Claim 2 到 33 通过具体化合物、组合物、治疗方法和用途逐层加限制。
PharmMaster Patent 在抽取 Claim 文本之外,还区分独立与从属关系,把通式、R 基定义、附加限制和原文位置组织成收窄路径。使用者可以判断目标结构对应哪一层,再回到对应 Claim 逐项核验。

权利要求解读说明
这个能力服务于信息组织和审查准备,具体法律判断仍以专业意见为准。
PharmMaster·Patent
在评测集上的表现
单篇案例说明能力,规模数据说明稳定性。评测集取自 BindingDB 收录的 500 篇药物专利——BindingDB 长期把专利里的活性分子、作用靶点和测量结果整理为结构化记录,是这类数据少数可公开获取的参照来源之一,我们以它作为可追溯的基线。
在这一基线上,PharmMaster·Patent 确认覆盖了 82.8% 的参照结构,带有活性数据的结构覆盖率达到 78.2%。提取的 IC₅₀ 和 EC₅₀ 记录数分别比 BindingDB 收录量多 28.0% 和 39.4%,在覆盖已有数据的同时,为数据库补充提供了更多可核验的线索。

PharmMaster 在测评集上的表现、
技术底座:
Uni- Parser 1.4
这些关联能成立,前提是页面上的文字、表格、分子结构和位置关系,在解析阶段就没有丢。
文档解析工具 Uni-Parser 1.4 负责恢复版面结构、阅读顺序、页码与坐标,为后续连接分子、活性、实验和 Claims 提供可追溯的输入。
在相关基准测试中,Uni-Parser 1.4 在 OmniDocBench 1.5 上获得 95.24 的综合得分,BioVista 化学结构定位达到 0.981 mAP@50。其结构识别组件 MolParser-2.0-preview 在 BioVista 上的总体识别准确率为 0.845。

Uni-Parser 1.4 在多个数据集上的测评效果
Uni-Parser 1.4 同时支持 100 余种语言,并针对化学专利增强了分子定位、结构识别、Markush 标记和分子编号关联。在这样的能力禀赋下,Uni-Parser 负责还原每一页的证据,PharmMaster Patent 把这些证据组织成可以继续分析的数据网络。
如何将Pharm Master·Patent
和Uni- Parser1.4
应用在研究项目中
药化专家在靶点调研或专利收集阶段,可以先概览判断专利是否相关,再查看代表结构、活性分组、SAR 结构空间与 Claims 收窄路径;查看关键结论时能直接跳回原文,不用重新搜索整篇 PDF。阅读方式从“从头翻页”变成“围绕证据核验”。数据分析专家可以拿到结构化结果:Uni-Parser 1.4 输出 Markdown、JSON 和带页面坐标的解析结果,PharmMaster Patent 在其上形成分子、活性、实验、Claims 及关系记录,可以直接进入数据库、检索索引、知识图谱、RAG 或 Agent 工作流。
5.1 PharmMaster·Patent
PharmMaster·Patent 提供了命令行的调用方式。
注册 PharmMaster 账号并申请个人 Access Key(pm- 开头)后,即可下载单文件命令行客户端 ptcli,在本地提交 PDF 解析任务、查询处理状态和下载结果。任务在服务端异步执行,提交后无需在本地持续等待。
export PATENT_API_KEY='pm-…' # 设置 AK(仅需 Python 3.11+ 与 curl)./ptcli submit --pdf-dir ./pdf --watch # 提交一批专利 PDF 并持续查询./ptcli download --watch # 完成后自动下载结构化结果 ZIP
PDF 文件名无格式要求,客户端自动分批(每个任务最多 20 篇);网络中断可安全重试,不会重复计费。结果包含分子 SMILES、活性与性质等结构化数据。
注册账号及使用手册链接:
https://pharmmaster.bohrium.com/
PharmMaster·Patent 也可以通过玻尔·科学空间客户端使用体验。
玻尔·科学空间下载链接:
https://www.bohrium.com/bohrscience
5.2 Uni-Parser
Uni-Parser 1.4 已通过在线产品与 API 提供服务。开发者也可以使用 UniParser-Tools,把解析能力接入脚本、批处理、notebook 与 Agent 应用。
UniParser-Tools 提供可安装的 Agent Skill:
npx skills add dptech-corp/UniParser-Tools
安装并配置 Uni-Parser API Key 后,可以直接向支持 Skill 的编程助手提出“使用UniParser-Tools解析这个 PDF”“提取专利表格”或“将 PDF 转为 Markdown”等请求。采用 Model Context Protocol 的应用也可以通过独立 MCP Server,把工具调用转发到 Uni-Parser HTTP API,使文档解析成为 Agent 工作流中的标准能力。
1. Uni-Parser 主页:https://uniparser.dp.tech/
2. UniParser Tools 开源:https://github.com/dptech-corp/UniParser-Tools


