产品Bestblogs·Hacker News··AI 生成
如何用 10 美元在一个周末为创客打造一个包含 50 万域名的搜索引擎
作者因厌倦企业 SEO 垃圾内容,仅用 10 美元 GPU 租用成本、一个周末时间,构建了一个索引 56 万域名的个人搜索引擎,专注于独立创客项目。核心思路是低成本爬虫管道配合小型本地 LLM 生成元数据,并通过优先级加权而非直接封锁来避免错过优质内容。文章详细拆解了系统架构、成本构成与关键优化决策,对想动手构建同类工具的技术读者有直接参考价值。原文 ↗原文 ↗
核心观点
- ▍一个极简的爬虫配合小型本地 LLM 管道,能以极低成本(10 美元 GPU 租用费)在一个周末内索引 56 万个域名,为个人打造一个不含企业 SEO 垃圾的创客搜索引擎。
- ▍项目成功的关键不在于技术复杂性,而在于优先级策略:通过给目标类别的链接赋更高权重,而非硬性封锁企业网站,从而在控制噪音的同时避免错过隐藏的优秀内容。
- 01系统由四个组件构成:抓取器(获取主页 HTML)、工作器(使用 Gemma 4B 本地 LLM 生成名称、摘要、分类、标签)、管理器(检测并阻止垃圾域名)和简易 UI。
- 02主要成本是 GPU 租用,约每小时 0.35 美元,每分钟可处理 600 个页面的摘要生成,吞吐量极高。
- 03通过限制每个根域名(如 Tumblr、Neocities)的子域名数量至 100 个,有效防止了单平台内容洪泛索引,保证了网站来源的多样性。
- 04LLM 自由分类导致分类体系膨胀到 671 个分类和 121k 个标签,需要手动清理,这成为项目扩展的真实瓶颈。
- 05最终索引了 560,183 个主页,其中 15% 的页面因依赖 JavaScript 渲染或遭遇机器人检测墙而无法处理,这是周末项目在成本与质量间的明确取舍。
反方 / 局限
- — 作者承认 15% 的页面因跳过 JS 渲染而无法处理,这意味着大量视觉丰富的现代独立网站未被索引,索引覆盖存在明显偏差。
- — LLM 生成的分类标签体系失控(671 类,12 万标签),作者虽提及手动清理,但未给出可扩展的治理方案,这暗示项目难以从周末原型成长为一个可持续的通用搜索引擎。
概念锚点
前置背景
平行视角
延伸追问