欢迎光临北京软件和信息服务业协会官方网站
深势科技PharmMaster·Patent帮你准确读专利,分子-活性数据一键整理
发布日期:2026-09-14    来源:深势科技    分享到:

深势科技的 PharmMaster·Patent,是一款专门用于解析药物分子专利的智能体工具,构建在文档解析引擎 Uni-Parser 1.4 之上。它能从专利 PDF 里准确提取分子结构,并把结构和活性数据、实验条件这些散落在不同页面的记录关联起来——每一条结论都能核验回原文出处。


它还能把化学结构和权利要求(claims)逐层对应,协助药化专家看清一个分子落在保护范围的哪一层;也能对实施例里的分子结构进行分析,快速搭建构效关系(SAR),让药化专家一眼看清取代位点的探索方向。


药化专家们经常要面对这样的场景:

打开一篇三五百页的药物分子专利 PDF,翻到实施例,看到一个化合物结构,往前翻要找它的编号,往后翻要找它对应的活性数据——常常翻出几十页还没找到,因为活性数据藏在几十页外的表格里,表格又是按化合物顺序排的,人工比对全靠记性和运气。

找到之后还没完:结构要用 ChemDraw 这类软件一个个重新画出来,连同编号和活性数据一起录进 Excel,才能把结构放到一起比较、讨论。一整天下来,真正读透、整理完的专利没几篇,大部分时间花在来回翻页、手动画结构、维护那张越滚越大的 Excel 表上。

这不是效率问题,是专利本身的结构决定的。

化合物名称可能出现在实施例标题里,结构图在几页之后,活性数据散落在跨页表格中,实验条件又藏在表头、脚注或相邻段落。OCR 能让每一页变得可读,却不会自动把它们拼回一条可检索、可比较、可建库的记录。

PharmMaster·Patent 就是专门为高效解析药物分子专利开发的智能体工具。


一个真实案例

109页外的活性数据

以 226 页的 WO2018140648A1 为例,这是一篇围绕 ITK 共价抑制剂展开的专利。它的 Example 1 很能说明问题:化合物名称和结构出现在 p.82,对应的活性数据要到 p.191 的 Table 3 才出现,中间隔了 109 页。


704ebd2a-35e1-4cf1-b230-db8a6d80d06a.png

化合物名称和结构出现在 p.82



4b192f70-9856-4c1a-b7b2-0c17780ba99f.png

对应的活性数据出现在 p.191 


原始 PDF 里,这两处证据没有任何直接连接。读到 p.82 时看不到后面的数据,翻到 p.191 时又已经忘了 p.82 那个分子长什么样——这类跨页证据,正是专利里最容易被漏掉、也最难靠人工逐页核对的部分。


    PharmMaster·Patent的解决方案

    2.1 先看全貌:一张卡片说清一篇专利

    PharmMaster Patent 把专利的基本信息、研发主题、代表结构、关键活性、实验体系与权利要求放进同一个阅读面,每项结论都能回到原文。研究者不用先通读整篇 PDF,就能判断这篇专利是否值得跟进、哪些化学系列最相关、该优先核验哪组活性或 Claim。


    8b6f0c6f-593b-471a-b399-dec7a7d31ecb.png

    专利速读卡片


    2.2 109 页外的证据,重新连回同一条记录

    Uni-Parser 保留了结构、编号、表格行列和页面位置,PharmMaster Patent 据此关联出两条活性记录:ITK IC₅₀ 为“++ → ≤0.1 μM”,PLC-γ IC₅₀ 为“++ → ≤1 μM”。

    在 PharmMaster·Patent 里,原始符号、区间语义和来源页码分层保留,可以逐条回到原文核验;遇到原文自身的异常,系统同时保留原值、校验记录与核验状态,不用清洗值覆盖原文。


    46c4c171-5979-4358-9985-70f4652f0b0c.png

    跨页证据关联


    这篇专利的活性数据横跨 p.191~193,用“++”“+”“−”表示两项 IC₅₀ 结果。PharmMaster Patent 把这些符号在本篇专利里的定义找回来,按靶点、检测方法和实验条件组织成可比较的记录,同时保留化合物编号、活性类型、原始符号和来源页码。

    2.3 SAR:从实施例到可比较的结构空间

    专利原文不会直接给出整齐的 SAR 矩阵。PharmMaster Patent 从实施例里提取具体分子,用化学信息学算法计算共享核心骨架、识别 R 位点、对齐取代基,把分散的结构组织成可比较的化学空间。


    76dc9afa-0c38-4fe4-b1be-fcad75aaa588.png

    SAR 空间构建和分析


    研发人员能看清每个位置已经探索过哪些取代方向,并回到对应实施例核验。

    2.4 Claims:从原文到可审查的保护层级

    Claim 1 给出 Formula(I)和 R 基定义,Claim 2 到 33 通过具体化合物、组合物、治疗方法和用途逐层加限制。

    PharmMaster Patent 在抽取 Claim 文本之外,还区分独立与从属关系,把通式、R 基定义、附加限制和原文位置组织成收窄路径。使用者可以判断目标结构对应哪一层,再回到对应 Claim 逐项核验。


    c32585c1-09ce-45f3-bea2-a32f810e0e71.png

    权利要求解读说明


    这个能力服务于信息组织和审查准备,具体法律判断仍以专业意见为准。


      PharmMaster·Patent

      在评测集上的表现

      单篇案例说明能力,规模数据说明稳定性。评测集取自 BindingDB 收录的 500 篇药物专利——BindingDB 长期把专利里的活性分子、作用靶点和测量结果整理为结构化记录,是这类数据少数可公开获取的参照来源之一,我们以它作为可追溯的基线。

      在这一基线上,PharmMaster·Patent 确认覆盖了 82.8% 的参照结构,带有活性数据的结构覆盖率达到 78.2%。提取的 IC₅₀ 和 EC₅₀ 记录数分别比 BindingDB 收录量多 28.0% 和 39.4%,在覆盖已有数据的同时,为数据库补充提供了更多可核验的线索。


      dae997da-ec83-4968-8dd3-27259c17501d.png

      PharmMaster 在测评集上的表现、


        技术底座:

        Uni- Parser 1.4

        这些关联能成立,前提是页面上的文字、表格、分子结构和位置关系,在解析阶段就没有丢。

        文档解析工具 Uni-Parser 1.4 负责恢复版面结构、阅读顺序、页码与坐标,为后续连接分子、活性、实验和 Claims 提供可追溯的输入。

        在相关基准测试中,Uni-Parser 1.4 在 OmniDocBench 1.5 上获得 95.24 的综合得分,BioVista 化学结构定位达到 0.981 mAP@50。其结构识别组件 MolParser-2.0-preview 在 BioVista 上的总体识别准确率为 0.845。

        5c0951ff-d79f-4095-93a5-55bc2851c95e.png

        Uni-Parser 1.4 在多个数据集上的测评效果


        Uni-Parser 1.4 同时支持 100 余种语言,并针对化学专利增强了分子定位、结构识别、Markush 标记和分子编号关联。在这样的能力禀赋下,Uni-Parser 负责还原每一页的证据,PharmMaster Patent 把这些证据组织成可以继续分析的数据网络。

          如何将Pharm Master·Patent

          和Uni- Parser1.4

          应用在研究项目中

          药化专家在靶点调研或专利收集阶段,可以先概览判断专利是否相关,再查看代表结构、活性分组、SAR 结构空间与 Claims 收窄路径;查看关键结论时能直接跳回原文,不用重新搜索整篇 PDF。阅读方式从“从头翻页”变成“围绕证据核验”。数据分析专家可以拿到结构化结果:Uni-Parser 1.4 输出 Markdown、JSON 和带页面坐标的解析结果,PharmMaster Patent 在其上形成分子、活性、实验、Claims 及关系记录,可以直接进入数据库、检索索引、知识图谱、RAG 或 Agent 工作流。

          5.1 PharmMaster·Patent

          PharmMaster·Patent 提供了命令行的调用方式。

          注册 PharmMaster 账号并申请个人 Access Key(pm- 开头)后,即可下载单文件命令行客户端 ptcli,在本地提交 PDF 解析任务、查询处理状态和下载结果。任务在服务端异步执行,提交后无需在本地持续等待。


          export PATENT_API_KEY='pm-…'               # 设置 AK(仅需 Python 3.11+ 与 curl)./ptcli submit --pdf-dir ./pdf --watch     # 提交一批专利 PDF 并持续查询./ptcli download --watch                   # 完成后自动下载结构化结果 ZIP

          PDF 文件名无格式要求,客户端自动分批(每个任务最多 20 篇);网络中断可安全重试,不会重复计费。结果包含分子 SMILES、活性与性质等结构化数据。

          注册账号及使用手册链接:

          https://pharmmaster.bohrium.com/

          PharmMaster·Patent 也可以通过玻尔·科学空间客户端使用体验。

          玻尔·科学空间下载链接:

          https://www.bohrium.com/bohrscience

          5.2 Uni-Parser 

          Uni-Parser 1.4 已通过在线产品与 API 提供服务。开发者也可以使用 UniParser-Tools,把解析能力接入脚本、批处理、notebook 与 Agent 应用。

          UniParser-Tools 提供可安装的 Agent Skill:


          npx skills add dptech-corp/UniParser-Tools

          安装并配置 Uni-Parser API Key 后,可以直接向支持 Skill 的编程助手提出“使用UniParser-Tools解析这个 PDF”“提取专利表格”或“将 PDF 转为 Markdown”等请求。采用 Model Context Protocol 的应用也可以通过独立 MCP Server,把工具调用转发到 Uni-Parser HTTP API,使文档解析成为 Agent 工作流中的标准能力。

          1. Uni-Parser 主页:https://uniparser.dp.tech/

          2. UniParser Tools 开源:https://github.com/dptech-corp/UniParser-Tools


          你知道你的Internet Explorer是过时了吗?

          为了得到我们网站最好的体验效果,我们建议您升级到最新版本的Internet Explorer或选择另一个web浏览器.一个列表最流行的web浏览器在下面可以找到.