关于

Idea Radar 是一个自动运行的产品机会雷达。它每 3 小时读取几个开发者与创业者社区里最新的提问、抱怨和作品分享,交给大模型归纳成「一个人 2~6 周能做出 MVP」的产品 idea。这里说明它抓什么、怎么筛、怎么判定。

数据源

目前接入 4 个来源,全部走公开接口,不需要账号或 API key。每轮抓取的是「最新」而非「最热」,目的是尽早捕捉刚冒出来的需求。

来源抓取范围方式每轮上限
Hacker NewsAsk HN 与 Show HN 最新帖。Ask HN 集中了「有没有工具能…」「大家怎么解决…」这类需求;Show HN 反映别人正在验证什么Algolia HN Search API,按时间倒序40 + 20
Redditr/SomebodyMakeThis, r/AppIdeas, r/indiehackers, r/SaaS, r/Entrepreneur, r/smallbusiness, r/productivity多 subreddit 合并 RSS(一次请求)。Reddit 的 JSON 接口对非浏览器流量返回 403,RSS 无分数与评论数100
Product Hunt当日新上线的产品与一句话介绍。新品本身是「市场正在验证的需求」信号,也常暴露未被满足的细分场景公开 Atom feed约 50
V2EX奇思妙想 (ideas), 分享创造 (create), 问与答 (qna), 分享发现 (share), 程序员 (programmer)V2EX v1 公开 API,逐节点顺序请求以避免限流每节点 20

抓取与筛选流程

  1. 并行请求 4 个来源,任一来源失败不影响其他,失败原因记录在运行记录里。
  2. 统一成同一结构(标题、正文、链接、作者、分数、评论数、发布时间),正文去掉 HTML 后截断到 1500 字。
  3. 以「来源 + 站内 ID」为唯一键写入 D1,重复帖子直接忽略。因此每轮真正进入下一步的只有上一轮之后新出现的帖子。
  4. 按分数与评论数排序,取本轮新帖最多 80 条。若新帖不足 20 条,补充最近 24 小时内尚未被任何 idea 引用过的帖子,避免同一批材料反复生成。
  5. 可用帖子少于 5 条时跳过生成,本轮标记为 skipped。
  6. 把帖子(每条正文再截到 400 字)连同最近 40 个已生成 idea 的标题一起交给 DeepSeek(deepseek-chat),要求以 JSON 返回最多 5 个 idea。
  7. 校验返回结果:丢弃缺标题的条目,evidence 里只保留本轮真实存在的帖子 ID,难度限制在 1~5。中文与英文任一缺失时用另一种兜底。
  8. 写入数据库,并把 idea 与它引用的帖子关联起来,页面上的「来源讨论」就来自这里。

判定标准

模型被要求只从「反复出现或明显强烈」的痛点里提炼,且每个 idea 必须满足以下全部条件:

  • 一个人 2~6 周能做出 MVP,不依赖大规模运营、线下资源、牌照或海量数据。
  • 避开与巨头正面竞争的通用需求,偏向细分场景、垂直人群、工作流缝隙。
  • 能追溯到输入帖子里的证据,不能凭空编造需求。
  • 不与近期已生成的 idea 雷同。证据不足时宁可少给,不凑数。

难度分级

每个 idea 带一个 1~5 的难度,由模型根据技术复杂度与所需时间判断,页面上用 5 段小条显示:

  • 1:周末项目,现成 API 拼装即可。
  • 2:一到两周,常规 CRUD 加少量集成。
  • 3:三到四周,有一定领域逻辑或数据处理。
  • 4:一到两个月,涉及同步、离线、实时等较难工程问题。
  • 5:数月以上,有技术壁垒或需要专门算法。

调度与去重

  • GitHub Actions 与 Cloudflare Cron 都按每 3 小时整点触发,任一方掉线不影响运行。
  • 两者启动时都会先向数据库插入当前 3 小时窗口的键,唯一约束保证同一窗口只有一方真正执行,不会重复生成。
  • 每次运行的抓取数量、新增数量、各来源状态和错误都记录在「运行记录」页。