有个站,前半年的收录一直很稳,某个星期突然断了,索引量掉了一多半。站长把服务器、robots、sitemap 全查了一遍,都没问题。最后翻后台才发现,他们上个月为了填栏目,用工具批量改写了三百多篇文章。原因不在技术,在内容来源上。
一、先把算不算原创说清楚
从搜索引擎的角度,原创的判断不看你有没有版权,看这个页面的内容是不是你独立产出、有没有信息增量。从版权角度,未经许可使用他人作品,本身就可能构成侵权。两条线都要看,不能只盯搜索引擎那条。把别人的文章换词、换语序、拼接段落,在这两条线上都站不住。还有一个现实问题:一旦涉及版权纠纷,处理成本远高于自己写一篇的时间。
二、被识别之后,影响分四层
最轻的一层是收录变慢,原本一两天能收的,变成一两周甚至更久。再上一层是收录了不展现,页面在索引里,但搜标题搜不到,等于没有。第三层是已有的收录被剔除,之前正常的内容也可能被重新评估。最重的一层是站点层面的信任下降,表现是整站抓取频次降低、新内容收录周期变长,这时候受影响的就不只是那几篇文章了。这四层里,前两层可以靠改内容慢慢恢复,后两层要等站点整体信号重新建立,时间以月计。
三、为什么改一改过不了关
多数人对伪原创的想象是改得够多就看不出来。但判定不依赖某一个特征,而是多个信号叠加:句式骨架相似、段落顺序一致、细节数据一字不差、发布时间密集、站点内容整体同质。这几个信号单个都不致命,叠加在一起,几乎不需要多复杂的技术就能定位。更关键的是,这些信号不只针对某一篇内容,还会被归纳到站点层面。同一个站里出现一批这样的页面,后面新发的内容也会被更严格地看待。
四、合理引用和伪原创的边界
写内容完全避免参考别人的东西不现实,所以有一条清晰的边界要记住:参考别人的观点和结论,用自己的话重新组织并给出延伸,属于正常创作;把人家的表达成段搬过来只做词语替换,属于伪原创。判断标准可以简化成一句:如果遮住原作者的名字,读者会不会觉得这篇是在抄。
五、站内自查:找出可疑的重合
如果站里已经做过批量改写,先自查一遍,看看重合到什么程度。下面这段脚本在站内文章之间两两比对标题和正文,输出重合较明显的组合:
# 站内自查:两两比对标题与正文,找出重合明显的文章
import difflib
articles = [
("内链怎么做才有效", "内链的作用是把权重传递到目标页面,做法是相关文章互相链接,锚文本使用目标关键词。"),
("内链优化的正确做法", "内链的作用是将权重传递给目标页面,具体做法是相关文章互相链接,锚文本使用目标关键词。"),
("robots 常见写法", "robots.txt 用来告诉爬虫哪些目录可以抓取,哪些需要屏蔽,写错会导致整站不收。"),
]
def sim(a, b):
return difflib.SequenceMatcher(None, a, b).ratio()
for i in range(len(articles)):
for j in range(i + 1, len(articles)):
ta, ba = articles[i]
tb, bb = articles[j]
print("标题 %.2f | 正文 %.2f | %s <> %s" % (
sim(ta, tb), sim(ba, bb), ta, tb))
输出里第一组数字是标题重合度,第二组是正文重合度,越接近 1 越危险。标题重合度高的几篇,基本可以直接判定为同题复用,处理方式要么合并成一页,要么重写。
六、已经踩了怎么办
第一件事是停手,别再往站里加同类内容。第二件事是分类处理:完全照搬的页面,直接删除或者合并到主页面并做好跳转;改写幅度较大、内容本身有价值的部分,补上自己的增量之后保留,同时把标题重写。第三件事是补一批实打实的原创内容,尤其是站点的核心栏目,让整站的内容结构重新正常起来。
七、恢复期要盯住什么
处理完之后看三个指标:抓取频次的曲线有没有回到之前的水平、新发布内容的收录周期有没有缩短、索引量有没有止跌。恢复期通常以月为单位,中间不要因为着急又去做一批新内容冲量,那等于伤口还没好又添新伤。这段时间里,原创内容的更新节奏要保持稳定,别因为数据难看就停更。
八、结论
伪原创不算原创,这句话在搜索引擎和版权两个层面都成立。被识别之后,代价不止那几篇文章,还会蔓延到整站的抓取和收录。这笔账迟早要还,还是花在内容上更便宜。与其事后补救,不如一开始就把批量改写这条路排掉。
相关阅读:
A5创业网 版权所有