У Anthropic нет RSS. Как я проверял 22 источника и оставил 18
Половина «очевидных» адресов оказалась мёртвой или несуществующей. Проверять надо запросом — и именно с того сервера, где код будет работать.
Когда я собирал источники для новостного бота, у меня был список «очевидных» адресов: у всех же есть RSS. Я решил не полагаться на память и прогнал все 22 кандидата живым запросом. Выжило 18.
Что вскрылось
- У Anthropic RSS не существует вообще.
/rss.xml,/news/rss.xml,/feed.xml— везде 404. Ссылки пришлось забирать со страницы/news(они есть в HTML) и добиратьog:title/og:descriptionкаждой статьи. Даты на странице нет, поэтому свежесть определяется по «первому появлению» в моей базе. - Meta AI выбыла. Блог рендерится джаваскриптом, ссылок в исходном HTML нет вовсе.
- Ars Technica, Mistral и Import AI живут не по «каноническим» адресам — соответственно на
feeds.arstechnica.com,mistral.ai/rss.xmlиjack-clark.net/feed. - VentureBeat отброшен — фид молчал 51 день.
- arXiv отброшен по другой причине: 231 препринт в сутки. Это не новости, это шум.
Главная тонкость
Финальную проверку я гонял с боевого сервера, а не со своей машины. Сеть там другая: часть адресов резолвится иначе, часть провайдер режет. Источник, который отвечает у тебя локально, вполне может молчать в проде — и ты узнаешь об этом, когда выпуск выйдет наполовину пустым.
Правило, которое я вынес: список источников — это не константа, а результат измерения. И измерять надо в той же среде, где код будет жить.