关于
Idea Radar 是一个自动运行的产品机会雷达。它每 3 小时读取几个开发者与创业者社区里最新的提问、抱怨和作品分享,交给大模型归纳成「一个人 2~6 周能做出 MVP」的产品 idea。这里说明它抓什么、怎么筛、怎么判定。
数据源
目前接入 4 个来源,全部走公开接口,不需要账号或 API key。每轮抓取的是「最新」而非「最热」,目的是尽早捕捉刚冒出来的需求。
| 来源 | 抓取范围 | 方式 | 每轮上限 |
|---|---|---|---|
| Hacker News | Ask HN 与 Show HN 最新帖。Ask HN 集中了「有没有工具能…」「大家怎么解决…」这类需求;Show HN 反映别人正在验证什么 | Algolia HN Search API,按时间倒序 | 40 + 20 |
| r/SomebodyMakeThis, r/AppIdeas, r/indiehackers, r/SaaS, r/Entrepreneur, r/smallbusiness, r/productivity | 多 subreddit 合并 RSS(一次请求)。Reddit 的 JSON 接口对非浏览器流量返回 403,RSS 无分数与评论数 | 100 | |
| Product Hunt | 当日新上线的产品与一句话介绍。新品本身是「市场正在验证的需求」信号,也常暴露未被满足的细分场景 | 公开 Atom feed | 约 50 |
| V2EX | 奇思妙想 (ideas), 分享创造 (create), 问与答 (qna), 分享发现 (share), 程序员 (programmer) | V2EX v1 公开 API,逐节点顺序请求以避免限流 | 每节点 20 |
抓取与筛选流程
- 并行请求 4 个来源,任一来源失败不影响其他,失败原因记录在运行记录里。
- 统一成同一结构(标题、正文、链接、作者、分数、评论数、发布时间),正文去掉 HTML 后截断到 1500 字。
- 以「来源 + 站内 ID」为唯一键写入 D1,重复帖子直接忽略。因此每轮真正进入下一步的只有上一轮之后新出现的帖子。
- 按分数与评论数排序,取本轮新帖最多 80 条。若新帖不足 20 条,补充最近 24 小时内尚未被任何 idea 引用过的帖子,避免同一批材料反复生成。
- 可用帖子少于 5 条时跳过生成,本轮标记为 skipped。
- 把帖子(每条正文再截到 400 字)连同最近 40 个已生成 idea 的标题一起交给 DeepSeek(deepseek-chat),要求以 JSON 返回最多 5 个 idea。
- 校验返回结果:丢弃缺标题的条目,evidence 里只保留本轮真实存在的帖子 ID,难度限制在 1~5。中文与英文任一缺失时用另一种兜底。
- 写入数据库,并把 idea 与它引用的帖子关联起来,页面上的「来源讨论」就来自这里。
判定标准
模型被要求只从「反复出现或明显强烈」的痛点里提炼,且每个 idea 必须满足以下全部条件:
- 一个人 2~6 周能做出 MVP,不依赖大规模运营、线下资源、牌照或海量数据。
- 避开与巨头正面竞争的通用需求,偏向细分场景、垂直人群、工作流缝隙。
- 能追溯到输入帖子里的证据,不能凭空编造需求。
- 不与近期已生成的 idea 雷同。证据不足时宁可少给,不凑数。
难度分级
每个 idea 带一个 1~5 的难度,由模型根据技术复杂度与所需时间判断,页面上用 5 段小条显示:
- 1:周末项目,现成 API 拼装即可。
- 2:一到两周,常规 CRUD 加少量集成。
- 3:三到四周,有一定领域逻辑或数据处理。
- 4:一到两个月,涉及同步、离线、实时等较难工程问题。
- 5:数月以上,有技术壁垒或需要专门算法。
调度与去重
- GitHub Actions 与 Cloudflare Cron 都按每 3 小时整点触发,任一方掉线不影响运行。
- 两者启动时都会先向数据库插入当前 3 小时窗口的键,唯一约束保证同一窗口只有一方真正执行,不会重复生成。
- 每次运行的抓取数量、新增数量、各来源状态和错误都记录在「运行记录」页。