标题末尾那个名字,到底代表什么
中文搜索结果里,标题末尾常常跟着一个下划线加一个来源名。很多人把它读成系统给出的出处标注,认为这篇东西确实来自那家机构。实际上这一整串都是标题本身的一部分,写标题的人填什么,那里就显示什么。
白洁王乙那一屏把这件事摆得很清楚:九条里七条挂了大门户的招牌,而这七条地址栏最后停住的位置,没有一个在那两家门户名下。换句话说,这个位置上的名字当天的准确率是零。
真正能当作出处看的只有一样东西:页面打开以后,地址栏里显示的域名。它是浏览器告诉你的,不是标题告诉你的。下面四道核对,本质上都是在把注意力从标题挪回地址栏。
四道可以照着做的核对
遇到白洁王乙这类结果时,自己核一遍就是按顺序走这四道;任何一道没过就不必再往下。
- 第一道:先看地址栏,再看页面
- 点开之后不要先读正文,先看地址栏最后停在哪个域名。把它和标题末尾挂的名字对一下。两者不一致时,标题上的来源就已经作废了,页面写得再像模像样也不改变这一点。
- 第二道:状态码之外,把页面文本读一眼
- 有的页面服务器回的是正常,正文却写着内容已删除。只看是否打得开会把这种情况记成成功。判断标准应该是:页面上有没有与你所查的东西相关的字。
- 第三道:看路径像不像文章该在的位置
- 一篇文章通常落在站点的内容栏目下。如果地址停在上传附件的目录、日期拼出来的目录,或者一个与主题完全无关的公司站点里,那多半不是这家站点自己发布的内容。
- 第四道:换一个独立位置核名字
- 离开这一屏,去公开百科或者商店这类有自己收录规则的地方查同一个名字。要点是把返回的东西照抄下来——地址停在哪里、标题是什么、有没有发生转向——而不是只记一个有或没有。
这四道做法得不出的结论
它能判断的是眼前这一屏,不是这个世界。
得不出某样东西不存在
四道核对回答的是当天这些地址给了什么。查不到只是查不到,收录有门槛,页面会被删,地址会失效。
得不出页面是谁放上去的
你能确认的只有地址和状态。至于内容是谁挂上去的、机构知不知情,这套做法回答不了,不该在记录里写成结论。
得不出换个地方会看到什么
这四道针对的是你眼前这一屏。换一个引擎、换一天、换一台设备,结果都可能完全不同。
照着做的时候会遇到的几个问题
要不要专门装工具?
不用。四道核对全部在浏览器地址栏和页面上完成。白洁王乙那一屏也是这样核的,没有用到额外的东西。
页面一闪就跳走了,怎么看地址?
看跳完之后停住的那个地址,它才是最终落点。如果一直在跳、始终停不下来,那这一条就记成没有到达,不要给它补一个猜测出来的落点。
同一个标题出现好几次,要每条都点吗?
值得。白洁王乙那一屏里有两条标题几乎一模一样,落点却是两个完全不同的域名,状态也不一样。标题重复不代表它们是同一篇东西。
记录要记到多细?
三样就够:最终域名、服务器返回、页面上有没有相关的字。这三样能让别人拿同一屏结果复核你的结论。
如果四道都过了呢?
那说明这一条至少是它自己声称的那个来源发布的、内容也确实在。这只是可以继续读下去的起点,不等于里面写的就是对的。