GEO优化 / 内容治理

我们不给十九个城市发同一篇文章

一篇文章换个城市名再发十九遍,是站群最常见的做法,也是我们专门写规则拦住的事。这篇讲那套判定是怎么调到能用的。

做站群的人早晚会碰到同一个诱惑:一篇文章写好了,把城市名换掉,能再发十九遍。

我们最早也是这么干的,后来专门写了一套规则拦这件事。这篇讲这套规则是怎么来的,以及它在拦什么。

起因是一批搜索词

站群写什么,最早靠模板凑。后来我们改了做法,去采集真实的搜索词:百度下拉,360 下拉,百度知道,把用户真在搜的话捞回来。

捞回来一比对,发现问题不在词少,在词太像。

同一件事,用户能问出好几种:

一种是一个意思几个说法。比如问哪个公司好,下拉里会同时出现「哪家好」「哪家好点」「哪家好些」,三条其实是一句话。

另一种是词序换了个位置。比如「最新信息」和「信息最新」,两个字颠倒一下,搜索框里是两条,语义上是同一条。

还有一种最要命,叫跨城同款。「淄博某某设备生产厂家」和「济南某某设备生产厂家」,除了地名,一个字都不差。

如果按字面去重,这三类一条都拦不住。三个变体会被当成三个选题,十九个城市会被当成十九个选题。写出来的是什么,不用我多说。

判定改了两次才对

最早那版只做精确去重,等于没做。后来加上相似度,用的是二元组重合度,阈值定在 0.55。这一版能拦住增删字的变体,但拦不住词序置换,因为「最新信息」和「信息最新」的二元组集合几乎一样,交集算下来却偏低。

又加了一个指标,用字符集合算重合度,阈值 0.90。词序置换在这一版被抓住了。

两个指标现在一起用。二元组的管增删字,字符集合的管换顺序,缺一个都会有漏网的。

真正让这套东西变准的,是另外一处改动:比较之前先把城市名剥掉。

不剥的话,跨城同款会被算成两条不同的选题,因为地名不一样。剥掉之后再比,「淄博某某生产厂家」和「济南某某生产厂家」的核心部分一模一样,当场被判成同一条。

这一处改完,我们跑了两条业务线。一条折叠掉 581 条,另一条折叠掉 458 条。

为什么要花这个力气

有人说站群的目的就是铺量,内容像一点没关系,搜索引擎看不出来。

这话有一半是错的。搜索引擎确实不一定能逐篇看出来,但 AI 助手在做答案的时候会做交叉核对。同一个说法在十几个地方一字不差地出现,它不是「到处都是证据」,它是「只有一个来源」。

我们的项目里有一条硬线:不给十九个城市发同一篇文章。不是因为道德洁癖,是因为那样做出来的东西,在 AI 那边的权重是负的。

落地时怎么用

如果你手上也有一个多站点或者多语言的矩阵,可以先做三件事。

把已有的内容两两比一次,比之前把地名和品牌名都剥掉。数字超过 0.55 的那一批,就是你的近似页。

给新采集的选题加一道相同的过滤,别等写出来再删。选题阶段折叠一条,省的是后面写稿和重写的功夫。

如果确实需要多个城市都覆盖同一个话题,那就换角度,不要换地名。同一个话题在每个城市落地的差别在哪,客户结构不一样,还是产业带不一样,还是当地的服务半径不一样,这个差别才是内容。

边界

这套阈值是我们按中文搜索词调出来的,用在中文站群上比较稳。换语言或者换行业,阈值要重调,别照搬。

另外它只管批量产出的部分。一个人认认真真给不同城市写不同的东西,重合度天然就不会高,这套规则不会误伤。

桐灼给客户做站群交付的时候,跨城去重是写进流程里的固定一步。你要是不确定自己站上有没有这类内容,可以先找我们跑一遍体检。

Talk to Tongzhuo

你遇到的问题,可以变成下一篇文章

桐灼做全域 AI 搜索的 GEO 优化,也把过程里真实发生的事写出来。有具体问题可以直接问。

预约业务诊断

先看清 AI 现在怎么描述你的企业,再决定投入。

联系我们 →