Yomi:轻松把任意网页转成干净Markdown

Yomi:轻松把任意网页转成干净Markdown

六月 18, 2026 go open-source web-scraping markdown developer-tools content-extraction cli-tools golang

Yomi: 把网页转成干净 Markdown 的神器

做爬虫或者处理网页数据的时候,最让人头疼的是什么?当然是 HTML 里的那些乱七八糟的东西——导航栏、页脚、侧边栏、广告弹窗、Cookie 提示……真正想要的内容反而被埋在一堆垃圾里。

Yomi 就是来解决这个问题的。

Yomi 是什么

简单说,Yomi 是一个 Go 语言写的库加命令行工具。它的核心功能只有一个:把任意网页转成干净的 Markdown。

但它不是那种半吊子的爬虫工具。Yomi 做得很讲究——该删的删,该留的留,最后出来的 Markdown 保留了真正有用的结构。

智能识别内容

Yomi 不是把所有文字都抓下来就完事了。它会"看懂"网页,找出主体内容在哪里,然后把导航、页脚、弹窗这些干扰信息统统过滤掉。

完整保留结构

有时候网页内容本身就很珍贵,特别是技术文档、教程这类东西。代码块能不能正常显示、图片的 alt 文字在不在、标题层级对不对——这些细节 Yomi 都给你保住了。最后拿到的 Markdown 文档,基本就是原网页的样子。

整站批量转换

不只想抓一页?Yomi 支持递归跟随链接,整站转成 Markdown 本地备份文档、做内容归档都行。

实际能干什么

这个工具的应用场景还挺多的:

文档汇总 — 想做个文档聚合平台,或者要把外部资料整合到自己的知识库里?用 Yomi 把网页内容统一转成 Markdown,后续处理就方便多了。

离线阅读 — 想把文章、教程、研究资料存下来慢慢看?转成 Markdown 后可以扔进 Git、Obsidian 或者任何纯文本存储系统。

内容迁移 — 换平台的时候经常要处理乱七八糟的 HTML 导出格式?让 Yomi 过一遍,直接吐出干净的 Markdown。

网页存档 — 网站说没就没的事太多了。定期用 Yomi 把重要的网页存成结构化的备份,万一哪天原站挂了也不慌。

写给开发者的工具

Yomi 最让我喜欢的一点是,它从一开始就是按开发者的需求设计的。

既可以作为库直接集成到 Go 项目里,又可以作为命令行工具放在脚本和 CI/CD 流程里用。这种库加 CLI 双模式的思路很实用——需要批量处理就写脚本,想要精细控制就调 API。

库的使用方式也不复杂,不用纠结提取逻辑本身,专注在怎么处理内容就行了。

快速上手

Yomi 是开源项目,采用 MIT 协议,用 Go 写的,核心功能不需要额外的依赖。项目地址在 tamnd/yomi,想试用的直接去那里找文档和源码。

最后说两句

网页内容提取这件事,本来没必要搞得那么复杂。Yomi 就是一个定位清晰、设计得当的工具,专门解决"把网页转成干净 Markdown"这个具体问题。

下次遇到需要处理网页内容的项目,不妨试试看。用过之后你可能会想——之前没有这个工具的日子是怎么过来的。

Read in other languages:

RU BG EL CS UZ TR SV FI RO PT PL NB NL HU IT FR ES DE DA EN