最新下载
热门教程
- 1
- 2
- 3
- 4
- 5
- 6
- 7
- 8
- 9
- 10
我是怎样用AI管理1400+篇文章库的 · 知识工程
时间:2026-07-29 10:30:01 编辑:袖梨 来源:一聚教程网
面向内容创作者的知识工程实践,由老谭拆解:1400+篇文章库如何借助AI完成下载、整理和标签体系建设。核心内容:1. 文章库管理的现实背景与差异化需求2. 工具选择、批量下载与本地化处理优化3. 7维标签体系的设计逻辑

KNOWLEDGE MANAGEMENT2026-07-25
1400+篇文章库,我用AI这样管理· 知识工程
一个人的知识工程:从下载走向标签
DOODLE信息囤积与知识资产之间,只差一套系统
AI工作流知识管理大家好,我是老谭。
今天聊一个很“实在”的话题:我怎样借助AI管理自己的1400多篇公众号文章。
这不是泛泛而谈的方法论,而是一个真实案例。我会把文章下载、标签体系设计和索引系统搭建的全过程逐一拆开。
如果你同样从事内容创作,云端也积压着几百上千篇不知如何利用的文章,这次实践或许能带来启发。
01
PART
为什么要做这件事?
FROM HOARDING TO ASSET
1400多篇文章,是我坚持公众号日更三年的成果。
过去我和多数人一样,文章发布后就不再管理;偶尔需要寻找素材,只能凭记忆翻找半天,找不到便放弃。
去年12月,我作出一个决定:公众号调整到AI方向:名称从「老生常谭」变为「AI Rollup」。
同时创办「老谭备忘录」,延续原先的泛话题风格。
要让两个账号形成差异化,就必须明确:
- AI-Rollup、组织AI化、RaaS等核心概念,应归入哪些适合AI Rollup的素材
- 创业心法、认知成长、投资思考,应如何判断更适合老谭备忘录的内容
02
PART
第一步:批量下载,实现100%本地化
EXPORT EVERYTHING
管理文章的第一步,是先把内容从微信后台“搬出来”。
为此,我找到一个开源项目:wechat-article-exporter(微信公众号文章批量下载工具)。
这个项目的实现方式很巧妙:借助公众号后台“搜索其他公众号文章”的功能,反向抓取自己公众号发布的全部文章。
它能够导出多种格式:
- HTML:能够100%还原排版与样式
- Markdown:便于后续编辑与建立索引
- JSON:提供结构化数据,方便程序处理
- Excel/Word:传统格式
后续标签化处理需要便利,原有文章结构也要保留,基于这两个条件,我选择了Markdown格式。
不过原版工具存在两个问题:下载较慢,并且无法批量处理元数据。
于是,我使用Claude Code对项目进行了优化:
- 使用p-queue管理并发,为工具增加并发下载能力
- 基于Cheerio和Turndown,改进HTML到Markdown的转换逻辑
- 增加自动提取标题、日期、URL等元数据的功能
- 避免反复下载:IndexedDB负责本地缓存
最终,1400+篇文章在不到2小时内全部下载到本地。
这一步至关重要:只有数据掌握在自己手中,后续深度加工才有基础。
03
PART
让AI能够"读懂"文章,第二步是标签体系设计
7-DIMENSIONAL TAGGING
虽然文章已经下载完成,但得到的仍是一批散乱文本文件。
真正的知识管理离不开结构化。
一套「7维标签体系」,花费我一天时间完成设计:
维度1:主题域,也就是讲什么
每篇文章可以设置1-3个标签,例如:
- 大模型、AGI、AI能力边界 — 归入AI基础认知
- AI-Agent智能体 — Agent、智能体、AI员工
- 组织AI化 — 组织形态被AI重构
- 流量方法论 — 流量的底层逻辑
- 创业心法 — 创业、创始人、方向选择
- 认知思维 — 认知、思维方式、心智模型
维度2:招牌概念,也就是我的话语指纹
以下术语由我自创,或与我形成强绑定:
- 核心投资/创业框架 — AI-Rollup
- 组织AI化 — 存量组织被AI改造
- 结果即服务RaaS — 商业模式主张
- 首席流量官 — 个人标签
- 十年战略 — 长期主义
- 共创 — 投资+赋能关系
维度3:体裁,也就是什么形式
- 观点评论 — 针对某件事表达判断
- 方法论干货 — 包含步骤和指南,可以复用
- 案例拆解 — 围绕具体公司或产品展开分析
- 个人随笔 — 记录心境、节奏的短文
- 深度长文 — 结构完整的重点文章
维度4:立场,也就是论点倾向
- 看多或乐观 — 对某项趋势持积极判断
- 看空或警示 — 泼冷水、拆穿、揭遮羞布
- 行动号召 — 呼吁读者或企业尽快行动
- 反思自省 — 修正自己过去的判断
维度5:可复用分,也就是素材质量分档
- 深度论证 + 招牌概念 + 观点长青 — 高
- 中 — 具备一定价值,但表现并不突出
- 低 — 纯日常随笔、过期热点或篇幅极短
维度6:实体,也就是涉及谁
采用自动抽取的动态词表:
- DeepSeek、OpenClaw、Claude、微信、视频号...:公司/产品
- 巴菲特、芒格、Sam Altman、马斯克...:人物
维度7:写作用途,也就是可以用来做什么
- 观点素材 — 能够作为论点或金句来源
- 案例素材 — 能够作为论据或例子调用
- 可作为新文章范本,结构清晰 — 框架模板
- 概念定义源 — 对招牌概念进行权威阐述
为什么采用7维,而不是传统文件夹分类?
因为同一篇文章可能同时涉及AI应用、组织转型和投资逻辑,无法放进单一类别。使用多维标签后,就能进行组合查询,例如:
可复用分=高 ∩ 体裁=方法论 ∩ 主题=组织AI化
借此可以准确找到关于组织AI化且能够复用的方法论文章。
这套标签体系构成了我的知识图谱“元数据层”。
04
PART
第三步:让Claude批量完成标签标注
AI-POWERED TAGGING
标签体系已经完成,但面对1400多篇文章,显然不能逐篇进行人工标注。
此时,Claude便能发挥作用。
自动打标签的流程,是我借助Claude Code编写的:
步骤1:读取标签体系
先让Claude理解各标签含义:输入7维标签的样本案例、判定标准和定义。
步骤2:批量分析文章
所有Markdown文件由Python脚本逐一遍历,再交给Claude按篇分析:
- 读取文章内容
- 依据标签体系生成7维标签
- 生成YAML格式的frontmatter
步骤3:写入元数据
使用YAML frontmatter格式,将标签写入每篇文章开头:
---
AI时代的生存法则:做减法,是最高级的护城河,字段为title
date: 2026-02-18
url: https://mp.weixin.qq.com/s/xxx
主题域: 认知与个人成长
招牌概念: AI-Rollup
体裁: 方法论干货
实体: 巴菲特
立场: 行动号召
写作用途: 观点素材, 框架模板
可复用分: 高
---
步骤4:人工校验
我会在Claude打完标签后抽样检查;一旦发现问题,就先修改标签体系的判定标准,再把流程完整重跑。
最关键的是,我并非只让AI打标签,而是在与AI共同“训练”这套标签体系。
例如,有些文章被标为“AI基础认知”,实际内容却只是在AI时代背景下讨论其他话题。发现这一点后,我重新明确标准:
“AI基础认知”应当指围绕AI能力边界、AGI、大模型进行判断与科普,而不是借AI时代背景讨论其他话题。
经过几轮反复迭代,标签准确度便逐步提高。
读取、打标签、写入元数据、更新索引都由流程自动完成。今天(7月25日),我用它处理了19篇新文章,整个过程不到10分钟。
过去要由一个团队承担的工作,如今借助AI,一个人便能完成。
05
PART
第四步:搭建6维索引系统
6-DIMENSIONAL INDEX
标签标注完成后,仍然存在一个问题:怎样快速检索?
我既不想每次进入文件夹逐一翻找,也不希望依靠全文搜索碰运气。
我真正需要的是按任意维度组合查询,并立即定位目标文章。
为此,我建立了6个索引文件:
索引1:按年度
索引_by_年度.md
- 2026年(47篇)
- 2025年(xxx篇)
- 2024年(xxx篇)
- ...
索引2:按体裁
索引_by_体裁.md
- 观点评论(xxx篇)
- 方法论干货(xxx篇)
- 案例拆解(xxx篇)
- 个人随笔(xxx篇)
- 深度长文(xxx篇)
索引3:按立场
索引_by_立场.md
- 看多或乐观(xxx篇)
- 看空或警示(xxx篇)
- 行动号召(xxx篇)
- 反思自省(xxx篇)
索引4:按可复用分
索引_by_可复用分.md
- 高(xxx篇)— 写作系统优先调用
- 中(xxx篇)— 根据需要调用
- 低(xxx篇)— 只保留检索能力
索引5:按主题域
索引_by_主题域.md
- AI-Agent智能体(xxx篇)
- AI基础认知(xxx篇)
- 组织AI化(xxx篇)
- 流量方法论(xxx篇)
- 创业心法(xxx篇)
- 投资逻辑(xxx篇)
- 认知思维(xxx篇)
- ...
索引6:按招牌概念
索引_by_招牌概念.md
- AI-Rollup(42篇)
- 组织AI化(24篇)
- 结果即服务RaaS(22篇)
- 共创(14篇)
- 首席流量官(4篇)
- 十年战略(5篇)
- ...
格式统一并按时间倒序排列,是每个Markdown索引文件的组织方式:
## AI-Rollup (42)
日期 标题
|---|---|
日期2026-07-24;标题从四次失败到确定性:我的创业成长史;路径2026/创业与商业/xxx.md
路径2026/投资与资本/xxx.md;标题十年投资路:从财务投资人到AI产业投资人;日期2026-07-23
| ...
这6个索引文件如同6份视角不同的“目录”,让我能够从任意角度进入知识库。
例如:
- 准备写AI-Rollup相关文章时,可打开索引_by_招牌概念.md,查看过去42篇采用了哪些写法
- 筛选"高"+"方法论干货"之前,先打开索引_by_可复用分.md,即可寻找高质量的方法论素材
- 希望了解某个时期的个人思考时,可打开索引_by_年度.md,沿时间线回顾
新增文章或修改标签时,Python脚本都会再次生成索引,因此这些索引文件能够自动更新。
06
PART
实践效果:从“信息坟场”走向“知识金矿”
WHAT CHANGED
完成这1400多篇文章的整理后,我有了非常真切的感受:从信息囤积走向知识资产,中间只差一套系统。
改变1:写作效率提高10倍
过去写文章时,如果要引用以前的观点,我只能凭记忆搜索;实在找不到,就直接放弃。
如今打开索引,再按主题域+招牌概念筛选,所有相关文章都能立即找到。
还可以直接识别哪些内容属于“高可复用分”,优先调用已经过深度论证的观点,从而避免重复造轮子。
写作由“从零开始”转变为“组装素材”。
改变2:双账号定位更加明确
标签体系建成以后,我可以迅速看出:
- AI-Rollup、组织AI化、RaaS等核心概念,可用来判断哪些文章更适合AI Rollup
- 个人随笔、创业心法、认知成长,可用来判断哪些内容更适合老谭备忘录
内容策略由“拍脑袋”转向“数据驱动”。
改变3:知识复利开始出现
过去的文章发布以后,很快就会沉底。
如今,它们都成为“可调用的模块”:无论观点、案例还是框架,都能在新文章中继续复用、改写和升级。
我的"知识复利"来自1400多篇文章,它们并非历史包袱。
改变4:形成AI写作系统的基础设施
未来可直接连接AI写作系统的,是已经标签化、索引化的这套内容库:
- 让AI按照主题自动调用相关素材
- 让AI学习我的体裁、立场和招牌概念等写作风格
- 由AI自动生成文章初稿,我只负责润色
从“人工写作”迈向“AI辅助写作”的基础设施已经准备完成。
07
PART
几个关键认识
KEY INSIGHTS
认知1:知识管理的本质在于“减法”
如果对1400多篇文章全部一视同仁,实际上就等于没有进行管理。
真正的知识管理,需要为每篇文章设置“可复用分”,分为高、中、低。
只有包含招牌概念、具备深度论证且观点长青的高质量文章才是核心资产,其余内容都属于“历史记录”。
认知2:标签体系的重要性超过AI工具
许多人过度迷信AI工具,认为只要有了ChatGPT,知识便能自动得到管理。
这是错的。
AI负责执行,标签体系才是真正的“元规则”。
必须先定义“怎样才算好文章”“什么属于招牌概念”“何为可复用”,AI才能遵循你的规则完成分类与检索。
知识资产的"操作系统"是标签体系;与之相比,工具终会过时。
认知3:一个人+AI,可以胜过一个小团队
如果在两年前搭建这套系统,至少需要:
- 1个产品经理负责设计标签体系
- 2个工程师负责开发爬虫及索引脚本
- 3个编辑负责逐篇标注标签
成本至少需要几十万。
1天之内,我一个人配合Claude Code,就在现在完成了。
这正是AI时代的生产力革命:重点并非替代人,而是让一个人具备团队级能力。
认知4:只有躬身入局,才能真正理解AI
围绕RaaS、组织AI化和AI Rollup,我可以分别展开,写出100篇文章。
但如果我自己不用AI管理知识、不用AI优化工具、不用AI写代码,那些都是纸上谈兵。
真正理解AI的威力与边界,必须亲自躬身入局。
我的"AI实验室",正是由这套知识管理系统充当。
∞
CODA
写在最后:个人IP的“第二大脑”
FROM INFORMATION OVERLOAD TO KNOWLEDGE ASSET
为什么要投入这么多时间整理这些文章?很多人都这样问过我:“老谭。”
我的回答是:因为它们构成了我的“第二大脑”。
人脑记忆容量有限,AI+标签系统却能够做到:
- 精准回忆:通过任意组合查询,立即完成定位
- 跨时间连接:串联不同时期形成的思考
- 知识复利:让过去的积累成为未来的杠杆
AI时代的个人IP竞争力,不仅取决于“能否生产内容”,还取决于“能否管理知识”。
如果你也积累了几百上千篇文章,我的建议是:
- 不要让它们留在云端吃灰,先下载并完成本地化
- 建立适合自己的标签体系,使AI能够读懂文章
- 让知识具备"可检索、可复用、可迭代"能力,需要索引系统
从信息囤积转化为知识资产,所缺的只是一套系统。
而在AI时代,一个人便能完成这套系统。
我是老谭。躬身入局推动组织AI化,同时作为产业投资人只投AI产业。今天,你已经开始管理自己的知识资产了吗?
附:技术栈说明
如果准备复刻这套系统,下面是我使用的工具:
第一步:文章下载
- wechat-article-exporter:开源项目
- 技术栈:Nuxt 3 + Vue 3 + Nitro
- 并发下载和元数据提取均由Claude Code增加,以此完成优化
第二步:标签化
- 工具:Claude Code (Opus 4.8)
- 生成YAML frontmatter ← 批量分析文章 ← 读取标签体系:方法
- 语言:Python 3.11 + PyYAML
第三步:索引生成
- 语言:Python 3.11
- 生成Markdown索引 ← 按维度分组 ← 解析YAML ← 遍历所有文章:逻辑
第四步:文件管理
- 结构:年份/分类/文章.md
- 索引:6个维度的Markdown文件
- 版本控制:Git(可选)
整套系统成本为0元(Claude订阅除外),全部采用开源工具,并支持私有部署。
完整的标签体系设计文档,我会分享给在公众号后台回复「知识管理」的感兴趣读者。
如果今天的文章让你有所收获,欢迎点赞、在看、收藏三连,我们下篇再见
赞在看收藏THANKS FOR READING
登录查看剩余 70% 内容
相关文章
- 如何解析CentOS上Golang日志 07-29
- centos怎么选php日志记录级别 07-29
- php日志过大centos如何处理 07-29
- centos php日志错误代码解析 07-29
- 失控进化天赋是什么 07-29
- 如何提升centos php日志性能 07-29