稿子发出去三个小时,谷歌新闻一条没收;同一天,另一家媒体的同题报道已经挂在新闻位上了。做海外资讯站的人对这一幕都不陌生。AI 把产能拉满之后,一天五十篇、一百篇都不是难事,难的是稿子发出去之后,谷歌那边有没有当它是一条新闻。产量和收录之间那道坎,多数人不清楚卡在哪里。
把问题归到"AI 内容不被收录"上,方向就偏了。谷歌公开的垃圾内容政策针对的是为了操纵排名而批量生成页面的做法,并没有禁止 AI 参与写作,内容按质量评判。真正拦住 AI 新闻站的,通常是稿件上缺了几样谷歌判断"这是一条新闻"所需的信息:明确的发布时间、作者与出处、新闻站点地图里的那些标签,以及稿子有没有及时落在事件发生的窗口里。这几样东西没有一样和写作水平有关,全是配置和流程问题。
谷歌新闻政策里有一条常被忽略:广告和赞助内容不能伪装成独立编辑内容,存在赞助、付款或所有权关系时,必须向读者清楚披露。对靠 AI 批量产出商稿的站点来说,这一条比任何算法更新都更需要提前想清楚。
一、稿子发出去没收,卡点藏在发布后的 48 小时里
新闻内容的分发窗口比多数人想得短。谷歌官方对新闻站点地图的要求写得很直白:里面只保留过去 48 小时内发布的文章,单条站点地图最多容纳 1000 个网址。这个限制反过来解释了新闻抓取的节奏,链接进不进那个 48 小时窗口,决定了它有没有机会被当成新闻看待,过了窗口就只能走常规索引,速度和曝光都不在一个量级上。
稿件上线,新闻站点地图同步更新,新链接进入 48 小时有效窗口,这是全流程里最关键的一次动作。
爬虫上门,服务器响应速度、页面打开方式和正文结构决定它读得顺不顺,卡顿或跳转过多会让这次抓取白跑。
链接一直在新闻地图里待着,反复获得被读取的机会;滑出窗口还没被处理的链接,后面要等常规抓取节奏。

稿件进入常规索引体系,靠内容本身的质量和站点权重慢慢积累,Discover 和长尾流量多数在这一阶段才出现。
沿着这条时间线看,稿件上缺的信息就变得具体了。一份 AI 生成的稿子如果只有正文,没有明确的发布时间字段、没有作者署名、没有消息来源,站点地图里也只是个普通链接,谷歌拿到的信号就是"一个普通页面更新了",和"这里发生了一条值得分发出去的新闻"是两回事。这几年出海站点踩的坑,多数集中在这三处。
- 只提交普通站点地图,没建新闻地图:新稿子混在几千个网址里,抓取优先级排不上,48 小时窗口早就过去了。
- 页面上只有笼统的日期,没有结构化时间:发布时间写在正文里当装饰文字,机器读不到,时效判断没有依据。
- 署名、出处、披露信息一片空白:作者栏是模板默认值,来源写"综合网络",赞助内容不做标记,透明度的分先丢光了。
AI 新闻站和人工新闻站的区别,多半不在稿子写得好不好,而在发布环节有没有把这三样信号补齐。补齐之后,AI 的效率优势才有地方发挥;补不齐,产量越高,无效页面攒得越多,站点的抓取预算反而会被拖累。
二、谷歌新闻要的东西,摊开也就这几项
先说一个让很多人白忙的事实:2019 年之后,进谷歌新闻不再需要单独提交申请,站点只要符合公开的标准,就有机会被收录进新闻体系。Publisher Center 这类后台更多承担发布者信息维护和内容管理的角色,它不是一个"审核通过就进新闻位"的开关。把时间花在找人打听"怎么申请"上,不如把这张表里的几项逐条对完。
| 要求项 | 落地动作 | 常见缺口 |
|---|---|---|
| 新闻站点地图 | 单独建新闻地图,或在现有地图中加新闻标签,只放 48 小时内的稿子,单条不超 1000 个网址 | 地图长期不更新,旧链接堆积,新稿子进不去窗口 |
| 发布时间 | 用机器可读的时间字段标注发布时间和更新时间 | 时间只写在正文里,或全站用同一个采集时间 |
| 作者与出处 | 每篇标明作者、来源与联系方式,作者有可展示的信息页 | 作者栏留默认值,来源写"综合整理" |
| 内容披露 | 赞助、广告、合作内容明确标记,不伪装成独立报道 | 商业稿不标注,混在新闻流里发布 |
| 抓取条件 | 服务器稳定响应急速,页面 HTML 直出,正文可直接读取 | 响应慢、首页靠脚本拼、正文藏在交互后面 |
| 可索引性 | 新闻页放开索引,robots 与规范链接不出错 | robots 误伤、重复链接未处理、分页配置混乱 |
表里的六项,没有一项需要多高的技术门槛,难的是把它们变成每篇稿子的固定动作。AI 内容站常见的翻车方式是:读者侧看页面没毛病,机器侧一查,时间字段是模板生成的、作者是空的、地图里查无此页。人类读者看不出来的东西,恰好是新闻分发体系最依赖的东西。
还有一个容易被低估的细节是抓取预算。公开的站点运维经验里提到过一种情况:连续被大量低质页面占据抓取资源之后,站点的抓取频率会被调低,后来发布的优质稿子反而排不上队。AI 新闻站天然产量高,如果没有把好发布这道关,低质页面会先一步把抓取额度用掉,好稿子也一起受连累。
三、AI 能接的四段活,和一段不能放手的活
新闻站的日常工作量拆开看,重复度最高的是那些环节:盯消息源、整理线索、写初稿、补齐字段、出多语言版本。这四段正好是 AI 擅长的部分,模型处理长文本、多语种、固定格式的速度和稳定性,人工比不了。分清楚哪些交给模型、哪些必须留下人工,比笼统地讨论"AI 能不能写新闻"有用得多。
线索汇总
把多个公开信源的同题消息归到一起,列出时间、地点、涉事方的差异点,替编辑省去来回翻原始材料的时间。
初稿生成
按确认过的事实写初稿,结构固定、语气统一,把写手从"从零憋第一段"里解放出来。
字段补齐
标题、摘要、时间、作者、来源、标签这类结构化信息一次生成,减少发布环节漏项的几率。
多语言版本
同一条消息输出多个语种的版本,让面向不同市场的站点各自有话可说,而不是互相复制同一篇稿子。
留给人工的那一段,分量不比这四段轻。事实核实、敏感表述的把关、署名背后的责任、商业内容要不要打披露标记,这些判断出了错,整个站点的可信度都要一起赔进去。AI 生成的稿子署上编辑的名字,意味着这个人要为每一个字负责,这个逻辑不会因为工具变强而改变。
多站点发布同一条消息时,不要用同一篇稿子换标题分发。谷歌公开的说明里提过,会优先识别并呈现原创发布者的内容,抄袭、转载或没有实质增量的改写内容很难拿到比原创更好的曝光。同一条消息在不同站点,应当至少换角度、换结构、换补充信息。
四、新闻站点地图就那几行标签,写好它才算入门
新闻站点地图的格式不复杂,官方允许两种做法:在现有站点地图里给新闻页加上新闻标签,或者单独建一份新闻地图。产量大的新闻站更适合单独建,理由很简单,常规地图里混着栏目页、专题页、标签页,新闻链接很容易被稀释;单独一份地图,只放最近 48 小时的稿子,机器读起来的指向性更清楚。
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9"xmlns:news="http://www.google.com/schemas/sitemap-news/0.9"><url><loc>https://example.com/news/2026/09/xxx/</loc><news:news><news:publication><news:name>站点名称</news:name><news:language>zh</news:language></news:publication><news:publication_date>2026-09-22T09:30:00+08:00</news:publication_date><news:title>文章标题</news:title></news:news></url></urlset>上面这段是官方文档里的结构,几个字段各有分工:loc 是要抓的地址,publication 里的名称和语言告诉谷歌这是哪家媒体、面向什么语言市场,publication_date 是时间判断的依据,title 用稿件标题原文。字段看起来少,写错的姿势却很多,最常见的几类问题集中在这里:
时间格式要用带时区的完整格式,只写年月日会被判成无效;地图里混入超过 48 小时的旧稿,会让新稿的权重被摊薄;单条地图塞满几千个网址,超出的部分直接被忽略,多出来的稿子白白错过窗口;地图更新不及时,稿子发出去了地图还没动,等于没提交。
还有几个配套动作容易被忘:新闻地图本身要允许抓取,别被 robots 规则误伤;地图里的链接要和页面的规范地址一致,带一堆参数的地址会让机器重复读取;地图建好之后提交到 Search Console,之后靠系统按频率来取就可以。这套配置一次做对,后面每篇稿子都受益;做错了不响铃不报错,只是收录一直不来,很多人就是在这里耗掉了几个月。
新闻站点地图是给机器看的新闻索引,不是给站长看的面子工程。它只要进得去、数据对、更新快,就已经完成任务;花哨的分类和多余的字段,对收录没有帮助。
五、快不等于时效,AI 的快要用在对的地方
新闻竞争看时效,AI 又能把产能拉高,两件事凑在一起,很容易滑向一个危险的节奏:消息刚冒头就抢发,数据没核对就上线,一篇稿子换个标题铺满所有站。这条路短期看着热闹,踩的都是明面写着的线。真正能长期吃到新闻流量的站点,快在内部流程,慢在对外发布,两头的节奏是分开的。
容易翻车的快
未核实就抢发,事后靠删稿掩盖;同一篇稿子批量铺到多站,只换标题;把商业稿混进新闻流不做标记;时间字段用采集时间凑,页面上的日期天天变。这些动作在机器侧留下的痕迹很清晰,一旦被归到批量生成的类别里,整站受牵连。
站得住的快
线索汇总、初稿、字段、多语版本交给 AI,压缩生产时间;核实、披露、署名留给人,发布前必过;同题消息在不同站换角度、换结构、换补充材料;发错了按规矩更正,标明更新时间和修改内容。快在准备,稳在发布。
时效还有一层含义常被忽略:内容的"新鲜"不只看发布时间,也看维护状态。一条持续被关注的消息,把后续进展补进原稿、标明更新时间,比另起一篇碎稿更有价值。谷歌公开的质量评估框架里,时间标注和更正机制都属于可信度的组成部分,做新闻的站点把这两样做出惯例,等于给站点攒信用。
把 AI 用在准备阶段,把人工留在发布关口,这套分工看起来保守,实际是效率最高的组合。抢发带来的那点时间差,抵不过一次错误更正对站点信誉的损耗,尤其是面向海外用户的新闻站,一次事实错误带来的信任折扣,往往要几个月的内容才能补回来。
六、政策边界先弄清,踩线的稿子发得再多也没用
很多人对谷歌和 AI 内容的关系还停留在两年前的印象里,实际上官方口径早就明确了:谷歌允许 AI 生成的内容,它的垃圾内容政策针对的是规模化内容滥用,也就是为了操纵排名批量生成页面的行为,判断的依据是做法和结果,不是工具本身。这条边界的两侧,一边是"用 AI 提高生产效率",另一边是"用 AI 制造排名垃圾",跨过去的方式和产量无关,和有没有实质内容有关。
AI 写的稿子会不会被当成批量生成内容处理?
看稿子本身有没有价值增量。同一件事,AI 帮忙整理的资料、核对过的事实、补齐的字段,成稿有清晰的信息来源和独立的组织方式,就属于正常生产;反过来,把公开内容换个说法重新拼一遍,页面之间只差标题和同义词,无论人工还是 AI 产出,都在被处理的范围里。判断标准是页面的作用,不是作者的属性。
一篇稿子改几个词发到多个站,行不行?
明确不行。谷歌的公开说明里提到过,原创发布者会被优先识别,抄袭、转载和没有实质增量的改写内容,拿到曝光的优先级低于原创。多站矩阵做同题内容,可以拆成不同的解读角度、补充各自区域的信息、采用不同的体裁,但把同一篇稿子换标题铺出去,除了制造重复,没有别的结果。
作者信息这块,公开的质量评估框架给过明确方向:经验、专业度、权威性和可信度是评估内容质量的四个维度,"经验"这一项是后来加入的,强调内容背后有没有真实的实践支撑。落到新闻站上,就是把作者署名、信息来源、更正记录这些基础工作做实。评估框架不会直接变成排名公式,但它会影响搜索系统对站点的整体判断,长期看权重不低。
面向多个地区、多个语种的新闻站,同题内容怎么做到不重稿,是政策边界之外的另一道日常难题。几十篇同源稿子铺出去,人工逐篇改写不现实,直接复制又踩线。用 UC 建站系统这类内容中台型系统做多站内容,做法是把站点策略留在人手里,把重组执行交给系统:同一个素材按各站定位输出不同角度、不同结构、不同补充信息的版本,站点之间的稿件天然错开;各站的索引情况、抓取表现和异常信号在多站看板里统一看,哪份新闻地图没被正常读取、哪个站收录掉了队,发现得比逐个后台翻要早。
七、配置补齐,流程跑顺,产量才不算白费
新闻站的收录问题,拆到岗位上看其实是三件事:写手负责稿子有料,发布岗负责信号齐全,运维岗负责机器读得顺。AI 把写手的活接走之后,另外两件事反而更容易被忽略,因为页面上看起来一切正常。做一轮自查,把这五条固化进发布流程,比再调一次提示词对收录的帮助大:
只保留 48 小时内的稿子,发布即更新地图,常规地图和新闻地图各管一段。
机器可读的发布时间、更新时间、作者、来源,一个不留空,默认值全部换成真实信息。
赞助、合作、广告内容明确标记,不混进新闻流,模板层面就做出区分。
服务器稳定响应,正文走 HTML 直出,不用等脚本渲染;robots 放行新闻页与地图文件。
重大更正标明修改时间和内容,后续进展补进原稿,让稿子保持可追溯的状态。
这几条里,抓取通道那一条对新闻站格外重要。AI 站点的发布频率高,机器来访也频繁,页面能不能在极短时间内把完整的正文交给爬虫,直接决定这次抓取有没有价值。用 UC 建站系统这类 HTML 直出的架构搭新闻站,正文和字段在服务端就组装完整,爬虫拿到页面时不需要执行任何脚本;站点再按独立域名、独立模板部署,各站的结构和资源互不牵连,一个站维护出错,不会顺着共用组件扩散到整批站点。配上发布后按渠道提交地图的固定动作,从稿子上线到机器读到之间的这段路,就短了一截。
"AI 让稿子快出来的那一半,得靠配置让机器认它是一条新闻。"
一句话结论:谷歌新闻不收 AI 稿子这件事是个误会,它不收的是没有时间、没有作者、没有来源、挤不进 48 小时窗口的稿子。
回到开头那个场景。一天五十篇不是问题,五十篇里有多少篇在发布的那一刻信号齐全,才是决定结果的东西。把时间字段、作者出处、新闻地图、披露规则做成发布流程的固定环节,AI 的产量才会变成收录量;跳过这些环节,产量只会变成服务器上的存货,攒得越多,越难处理。
新闻这个品类的规则其实一直没变,答案要给得及时、给得可查、给得干净。工具和模型换了几代,这三条没有一代能绕过去。
(口径说明:新闻站点地图的格式、48 小时窗口与 1000 条网址上限,参考 Google 搜索中心公开文档;规模化内容滥用与 AI 内容态度,参考 Google 垃圾内容政策及公开说明;作者经验维度与质量评估框架,参考公开的 E-E-A-T 资料;抓取频率调整的描述为公开站点运维经验整理。不同站点实际表现受多重因素影响,文中内容不构成收录或排名承诺,具体以各平台最新规则为准。)
