计算机与信息 · 6/7
信噪比Signal-to-Noise Ratio
判断能否变准,取决于有效线索相对干扰有多强,而非消息有多少。
被当成干扰的东西,也能成为重大发现的线索。1964 年,在美国新泽西州霍姆德尔,贝尔实验室的彭齐亚斯和威尔逊用喇叭天线测量微波。天线朝向哪里,都有一层甩不掉的背景杂音。他们检查仪器,赶走筑巢的鸽子,还清理了天线里的鸽粪,杂音依然存在。1965 年,两人与普林斯顿的研究者交流后,认出这正是宇宙微波背景辐射。关键一步,是排除已知干扰后,认真追问那点剩余来自哪里。
为什么成立
干扰越强,同一条线索越难辨认
隔着嘈杂的人群听朋友报电话号码,他说得再快,你也未必听得清。想听的语音是信号,盖住它的人声是噪声。通信工程用两者的平均功率之比衡量信噪比:
白话说,就是有用声音相对干扰有多强。只把两者一起放大,比例不变,辨认困难仍在。
香农给传输速度划出了上限
在带宽固定、噪声为加性白高斯噪声的信道中,香农给出的容量是:
这里, 是带宽, 是理论上能以任意低错误率传输的最高比特率。信噪比为 3 时,容量是 ;提高到 15 时,容量才增至 。信噪比提高五倍,容量只翻一倍。噪声限制了接收者能可靠分清多少种消息。
阅读量只有转成新证据,才会改善判断
跨领域使用时,先确定自己要回答的问题,再寻找能减少这个问题的不确定性的线索。十篇报道都转述同一份公告,只增加了接触次数;一份独立核实的原始记录,却能补上新的证据。信息量与理解之间,还隔着来源、相关性和解释。香农研究的是消息能否可靠传输;消息的真假与意义,要靠内容和证据来判断。
出处
信噪比来自通信工程,早于香农的信息论,用来描述信号功率与噪声功率的比例。香农在 1948 年的《通信的数学理论》中,建立了信息论,并给出受噪声限制的信道容量与可靠通信条件。这套理论成为现代数字通信与纠错编码的基础。
换个领域看
科学
在震动中听宇宙
符合预期形状、又能被两地仪器共同捕捉的波形,比一次孤立的震动更有辨识力。2015 年 9 月 14 日,LIGO 在美国汉福德和利文斯顿的探测器记录到首次直接探测的引力波。研究者从仪器与环境噪声中提取波形,再核对两地记录的时间差与形状,让微弱信号浮现。
投资
十篇报道一个源
多篇报道引用同一个源头,只给了一份证据。准备买入零售股的投资者,连读十篇扩店新闻,每篇都引用管理层公告。他改查年报,发现门店增加,成熟门店的销售额却下降。扩店数字回答了规模有没有变大;成熟门店的表现,才直接触及原有生意是否更好。
个人生活
固定条件再称重
固定测量条件,能减少与目标无关的体重变化。减脂的人晚饭后称重,比早晨重了两公斤,便以为计划失败。他改成每天起床如厕后、早餐前用同一台秤测量,再看连续几周的走势。食物和水分带来的干扰少了,缓慢的体重变化更容易看清。
遇事时问自己
- 我眼下要回答哪个问题,什么观察会改变我的判断?
- 这些消息来自几个独立源头,还是同一份材料的反复转述?
- 我能否通过固定测量条件、查原始记录或交叉核实,减少干扰?
- 这条被我忽略的异常,能否由已知干扰解释,还是值得继续追查?
- 再增加一份信息,会补上新证据,还是只让我更熟悉已有说法?
边界与误用
把一条信息判为噪声,必须有明确目标和检验依据。寻找新现象时,先按熟悉的模式删掉异常,会抹掉发现的入口;彭齐亚斯和威尔逊留下的背景声就是例子。面对舞弊或严重故障,一次可靠警报也值得追查,不能等它反复出现才重视。常见误用是把不同意见叫作噪声,把熟悉结论叫作信号。在工作和生活中,信噪比多半是定性判断;报道篇数和观点赞成率,无法直接代入工程公式。
练一练
团队想判断一次代码改动是否让搜索接口变快。改动前在凌晨测试,改动后在午间测试,平均响应时间从120毫秒升到180毫秒。午间请求更多,复杂查询也更多。
下一步怎样做,最能判断这次改动的影响?
删掉极端值能让结果更平稳。但慢请求可能正是改动影响最大的部分,而且删值没有消除两个时段的条件差异。
测得更久能减少偶然波动,听起来更可靠。但负载和查询类型的差异仍在,平均值稳定也不能归因于代码改动。
最快请求似乎受拥堵影响较小。但它可能只代表最简单的查询,不能说明相同业务负载下两个版本的表现。
把查询和负载固定下来,能减少与代码版本无关的变化。剩下的差异才更能回答这次改动是否有效。
这里要辨认的是代码改动的效果,负载和查询构成会干扰判断。固定测试条件,比单纯延长测试或挑选数据更能让有效线索显现。
你考虑投资一家工业软件公司,想判断客户是否愿意续费。展会上,公司的演示很流畅,三位行业博主也给出好评。另有一份按首次签约年份分组的客户记录,列出了合同到期后的实际续费情况。
哪种判断最站得住?
兼顾各种材料看起来更全面。但材料与问题的距离不同,可靠程度也不同,等权处理会稀释更直接的证据。
实际续费行为直接触及要判断的问题。核实记录是否完整、分组是否一致,才能知道这条线索有多可靠。
多个人给出好评,容易让人觉得判断更稳。但产品体验好不等于客户到期后愿意继续付钱,还要看他们各自掌握了什么证据。
亲眼看到产品运行很有说服力。但演示回答的是产品能做什么,未必回答客户长期使用后是否愿意续费。
材料是否有用,取决于它能否减少当前问题的不确定性。判断续费意愿时,经过核实的实际付费行为,比展示效果和笼统好评更有辨识力。
家中的一氧化碳报警器首次报警,屏幕显示浓度明显升高。报警器仍在有效期内,最近通过了功能检查。家人觉得平时从没响过,而且谁也没闻到异味,提议把这一次异常从家庭监测记录中删掉。
哪一步用错了卡片中的判断方法?
一次报警就采取行动,可能显得反应过大。但潜在损失严重,且报警有明确读数,及时处理和核查符合这条线索的分量。
出现次数少,不代表证据弱。涉及严重危险时,一次有依据的警报就值得及时追查,不能把重复出现设为重视它的前提。
检查仪器可能让人以为是在否定警报。但保留原始记录并核查来源,是检验证据;它没有提前把异常删掉。
保留长期基线,容易让人担心旧经验压过新证据。但这里同时保留并追查了可靠异常,没有用历史平静抹掉新线索。
减少干扰的目的,是让重要线索更容易被认出。低频异常也可能承载关键证据,尤其当漏掉它的后果严重时,不能靠出现频率决定是否忽略。