SoMark 进入 WAIC:在 AI 读懂文档之前,它先把 PDF 拆成 Markdown 和 JSON
SoMark 进入 WAIC 2026 的 FT 初创项目名单。它把 PDF、扫描件、表格和演示文稿转换成结构化 Markdown 与 JSON,想先解决 RAG 和 Agent 最容易被忽略的文档清洗环节。
把几百页 PDF 扔给大模型,并不等于模型真的看懂了文档。页眉可能混进正文,跨页表格会被切断,公式、脚注和扫描图片还可能在转换时丢失。
进入 WAIC 2026 FT 初创项目名单的 SoMark,专门处理这一步脏活。它不是再做一个问答机器人,而是先把 PDF、图片、Office 文档和扫描材料转换成 Markdown 与 JSON,让后面的 RAG、训练或 Agent 有一份更规整的输入。
大模型前面的文档清洗,正在变成一门独立生意
企业知识库里最常见的资料并不是干净文本,而是财报、合同、论文、图纸、试卷和扫描件。它们既有版式,也有表格、公式、图片和层级结构。
如果解析阶段把标题当成正文、把两页表格拆成两份,后面的向量检索和问答就会在错误数据上继续工作。模型回答得越流畅,问题反而越难被发现。
SoMark 把产品定位放在这个入口:先识别文档组件和结构,再输出机器更容易继续处理的 Markdown 与 JSON。
公开工作台把输入和结果放在同一个页面
SoMark 当前工作台支持 PDF、图片和多种 Office 文件,左侧还提供金融研报、招股书、论文、专利、试卷、工程图纸和合同等示例。
用户上传文件后,可以在右侧切换 Markdown 预览、Markdown 原文和 JSON。这个界面设计很直接:原文和结构化结果并排出现,方便人检查标题、表格和段落有没有被拆错。
工作台目前标记为 Beta,并显示每月免费解析额度和文件保留数量。公开入口已经具备,但它仍处于需要观察稳定性和边界的阶段。
4 月更新的 API 文档,把 Beta 限制写得很具体
SoMark 的公开 API 文档在 2026 年 4 月更新,列出了同步和异步两种处理方式。异步接口先返回任务编号,再由调用方轮询结果,更适合较大的文档。
当前文档写明单个文件最大 200MB、最多 300 页,Beta 阶段每个账号的 QPS 为 1。它还提供跨页文字拼接、跨页表格拼接和标题层级识别等可选功能。
这些限制看起来不够“炫”,却比一句无限能力更有用。开发者可以据此设计队列、超时、重试和人工复核,而不是等到生产环境才发现接口边界。
融资让它继续做解析,但效果不能只看速度口号
投资界公开资料显示,上海守扣科技完成过奇绩创坛参与的种子轮融资,资金继续投入文档智能解析研发和场景落地。
项目方在官网和外部资料里给出了速度、成本和硬件需求等指标。这些数字需要在统一文件、统一设备和统一输出要求下测试,不能直接当成所有文档的普遍表现。
对用户更重要的是复杂表格、公式、扫描质量和多栏排版下的准确率,以及错误能否被快速发现和纠正。
WAIC 之后,它要回答数据到底去了哪里
文档解析往往接触合同、财报、技术资料和内部知识库。团队在使用公开工作台或 API 前,需要确认文件保留时间、访问权限、删除方式和是否会被用于改进模型。
输出 Markdown 或 JSON 也不意味着原始语义已经完全保留。高风险材料仍应抽样核对页码、表格、公式和关键信息,必要时保留原文定位。
SoMark 代表的是一个很实际的创业方向:AI 应用越来越多以后,帮助模型吃到干净数据的基础工具也会变得重要。WAIC 给它带来展示机会,下一阶段则要靠可复核的解析质量和清楚的数据边界留下用户。
想继续了解
• WAIC 2026 官方展商名录
• SoMark 文档智能官网与工作台
• SoMark 文档智能 API 使用说明
• 投资界:上海守扣科技种子轮融资资料
一起维护这篇内容
我要更新 发现链接失效、信息过时或内容有误,可以提交更新建议。


交流讨论
最新评论