SoMark 进入 WAIC:在 AI 读懂文档之前,它先把 PDF 拆成 Markdown 和 JSON

SoMark 进入 WAIC 2026 的 FT 初创项目名单。它把 PDF、扫描件、表格和演示文稿转换成结构化 Markdown 与 JSON,想先解决 RAG 和 Agent 最容易被忽略的文档清洗环节。


SoMark 当前公开工作台:左侧提供多类示例文件,中间上传原文,右侧可切换 Markdown 预览、原文和 JSON。 来源:SoMark 公开工作台


把几百页 PDF 扔给大模型,并不等于模型真的看懂了文档。页眉可能混进正文,跨页表格会被切断,公式、脚注和扫描图片还可能在转换时丢失。

进入 WAIC 2026 FT 初创项目名单的 SoMark,专门处理这一步脏活。它不是再做一个问答机器人,而是先把 PDF、图片、Office 文档和扫描材料转换成 Markdown 与 JSON,让后面的 RAG、训练或 Agent 有一份更规整的输入。

大模型前面的文档清洗,正在变成一门独立生意
企业知识库里最常见的资料并不是干净文本,而是财报、合同、论文、图纸、试卷和扫描件。它们既有版式,也有表格、公式、图片和层级结构。

如果解析阶段把标题当成正文、把两页表格拆成两份,后面的向量检索和问答就会在错误数据上继续工作。模型回答得越流畅,问题反而越难被发现。

SoMark 把产品定位放在这个入口:先识别文档组件和结构,再输出机器更容易继续处理的 Markdown 与 JSON。

公开工作台把输入和结果放在同一个页面
SoMark 当前工作台支持 PDF、图片和多种 Office 文件,左侧还提供金融研报、招股书、论文、专利、试卷、工程图纸和合同等示例。

用户上传文件后,可以在右侧切换 Markdown 预览、Markdown 原文和 JSON。这个界面设计很直接:原文和结构化结果并排出现,方便人检查标题、表格和段落有没有被拆错。

工作台目前标记为 Beta,并显示每月免费解析额度和文件保留数量。公开入口已经具备,但它仍处于需要观察稳定性和边界的阶段。

4 月更新的 API 文档,把 Beta 限制写得很具体
SoMark 的公开 API 文档在 2026 年 4 月更新,列出了同步和异步两种处理方式。异步接口先返回任务编号,再由调用方轮询结果,更适合较大的文档。

当前文档写明单个文件最大 200MB、最多 300 页,Beta 阶段每个账号的 QPS 为 1。它还提供跨页文字拼接、跨页表格拼接和标题层级识别等可选功能。

这些限制看起来不够“炫”,却比一句无限能力更有用。开发者可以据此设计队列、超时、重试和人工复核,而不是等到生产环境才发现接口边界。

融资让它继续做解析,但效果不能只看速度口号
投资界公开资料显示,上海守扣科技完成过奇绩创坛参与的种子轮融资,资金继续投入文档智能解析研发和场景落地。

项目方在官网和外部资料里给出了速度、成本和硬件需求等指标。这些数字需要在统一文件、统一设备和统一输出要求下测试,不能直接当成所有文档的普遍表现。

对用户更重要的是复杂表格、公式、扫描质量和多栏排版下的准确率,以及错误能否被快速发现和纠正。

WAIC 之后,它要回答数据到底去了哪里
文档解析往往接触合同、财报、技术资料和内部知识库。团队在使用公开工作台或 API 前,需要确认文件保留时间、访问权限、删除方式和是否会被用于改进模型。

输出 Markdown 或 JSON 也不意味着原始语义已经完全保留。高风险材料仍应抽样核对页码、表格、公式和关键信息,必要时保留原文定位。

SoMark 代表的是一个很实际的创业方向:AI 应用越来越多以后,帮助模型吃到干净数据的基础工具也会变得重要。WAIC 给它带来展示机会,下一阶段则要靠可复核的解析质量和清楚的数据边界留下用户。

想继续了解
WAIC 2026 官方展商名录
SoMark 文档智能官网与工作台
SoMark 文档智能 API 使用说明
投资界:上海守扣科技种子轮融资资料
0
一起维护这篇内容

发现链接失效、信息过时或内容有误,可以提交更新建议。

我要更新

交流讨论

最新评论

返回顶部