7.4
深览指数
产品Bestblogs·Hacker News··AI 生成

如何用 10 美元在一个周末为创客打造一个包含 50 万域名的搜索引擎

作者因厌倦企业 SEO 垃圾内容,仅用 10 美元 GPU 租用成本、一个周末时间,构建了一个索引 56 万域名的个人搜索引擎,专注于独立创客项目。核心思路是低成本爬虫管道配合小型本地 LLM 生成元数据,并通过优先级加权而非直接封锁来避免错过优质内容。文章详细拆解了系统架构、成本构成与关键优化决策,对想动手构建同类工具的技术读者有直接参考价值。原文 ↗

核心观点
  • 一个极简的爬虫配合小型本地 LLM 管道,能以极低成本(10 美元 GPU 租用费)在一个周末内索引 56 万个域名,为个人打造一个不含企业 SEO 垃圾的创客搜索引擎。
  • 项目成功的关键不在于技术复杂性,而在于优先级策略:通过给目标类别的链接赋更高权重,而非硬性封锁企业网站,从而在控制噪音的同时避免错过隐藏的优秀内容。
  1. 01系统由四个组件构成:抓取器(获取主页 HTML)、工作器(使用 Gemma 4B 本地 LLM 生成名称、摘要、分类、标签)、管理器(检测并阻止垃圾域名)和简易 UI。
  2. 02主要成本是 GPU 租用,约每小时 0.35 美元,每分钟可处理 600 个页面的摘要生成,吞吐量极高。
  3. 03通过限制每个根域名(如 Tumblr、Neocities)的子域名数量至 100 个,有效防止了单平台内容洪泛索引,保证了网站来源的多样性。
  4. 04LLM 自由分类导致分类体系膨胀到 671 个分类和 121k 个标签,需要手动清理,这成为项目扩展的真实瓶颈。
  5. 05最终索引了 560,183 个主页,其中 15% 的页面因依赖 JavaScript 渲染或遭遇机器人检测墙而无法处理,这是周末项目在成本与质量间的明确取舍。
反方 / 局限
  • 作者承认 15% 的页面因跳过 JS 渲染而无法处理,这意味着大量视觉丰富的现代独立网站未被索引,索引覆盖存在明显偏差。
  • LLM 生成的分类标签体系失控(671 类,12 万标签),作者虽提及手动清理,但未给出可扩展的治理方案,这暗示项目难以从周末原型成长为一个可持续的通用搜索引擎。
4 分钟 · 4 卡片 · 9 资料
读原文 →

概念锚点

前置背景

平行视角

延伸追问