因此,當(dāng)人們想了解更深層次的細(xì)分領(lǐng)域的情況時(shí),隨機(jī)采樣的方法就不可取了。在宏觀領(lǐng)域起作用的方法在微觀領(lǐng)域失去了作用。隨機(jī)采樣就像是模擬照片打印,遠(yuǎn)看很不錯(cuò),但是一旦聚焦某個(gè)點(diǎn),就會(huì)變得模糊不清。
隨機(jī)采樣也需要嚴(yán)密的安排和執(zhí)行。人們只能從采樣數(shù)據(jù)中得出事先設(shè)計(jì)好的問題的結(jié)果——千萬不要奢求采樣的數(shù)據(jù)還能回答你突然意識(shí)到的問題。所以雖說隨機(jī)采樣是一條捷徑,但它也只是一條捷徑。隨機(jī)采樣方法并不適用于一切情況,因?yàn)檫@種調(diào)查結(jié)果缺乏延展性,即調(diào)查得出的數(shù)據(jù)不可以重新分析以實(shí)現(xiàn)計(jì)劃之外的目的。
我們來看一下 DNA分析。由于技術(shù)成本大幅下跌以及在醫(yī)學(xué)方面的廣闊前景,個(gè)人基因排序成為了一門新興產(chǎn)業(yè)。 2012年,基因組解碼的價(jià)格跌破 1 000美元,這也是非正式的行業(yè)平均水平。從 2007年起,硅谷的新興科技公司 23andme就開始分析人類基因,價(jià)格僅為幾百美元。這可以揭示出人類遺傳密碼中一些會(huì)導(dǎo)致其對(duì)某些疾病抵抗力差的特征,如乳腺癌和心臟病。 23andme希望能通過整合顧客的 DNA和健康信息,了解到用其他方式不能獲取的新信息。
公司對(duì)某人的一小部分 DNA進(jìn)行排序,標(biāo)注出幾十個(gè)特定的基因缺陷。這只是該人整個(gè)基因密碼的樣本,還有幾十億個(gè)基因堿基對(duì)未排序。最后,23andme只能回答它們標(biāo)注過的基因組表現(xiàn)出來的問題。發(fā)現(xiàn)新標(biāo)注時(shí),該人的 DNA必須重新排序,更準(zhǔn)確地說,是相關(guān)的部分必須重新排列。只研究樣本而不是整體,有利有弊:能更快更容易地發(fā)現(xiàn)問題,但不能回答事先未考慮到的問題。
大數(shù)據(jù)先鋒
大數(shù)據(jù)與喬布斯的癌癥治療
蘋果公司的傳奇總裁史蒂夫·喬布斯在與癌癥斗爭(zhēng)的過程中采用了不同的方式,成為世界上第一個(gè)對(duì)自身所有 DNA和腫瘤 DNA進(jìn)行排序的人。為此,他支付了高達(dá)幾十萬美元的費(fèi)用,這是 23andme報(bào)價(jià)的幾百倍之多。所以,他得到的不是一個(gè)只有一系列標(biāo)記的樣本,他得到了包括整個(gè)基因密碼的數(shù)據(jù)文檔。對(duì)于一個(gè)普通的癌癥患者,醫(yī)生只能期望她的DNA排列同試驗(yàn)中使用的樣本足夠相似。但是,史蒂夫·喬布斯的醫(yī)生們能夠基于喬布斯的特定基因組成,按所需效果用藥。如果癌癥病變導(dǎo)致藥物失效,醫(yī)生可以及時(shí)更換另一種藥,也就是喬布斯所說的,“從一片睡蓮葉跳到另一片上。”喬布斯開玩笑說:“我要么是第一個(gè)通過這種方式戰(zhàn)勝癌癥的人,要么就是最后一個(gè)因?yàn)檫@種方式死于癌癥的人。 ”雖然他的愿望都沒有實(shí)現(xiàn),但是這種獲得所有數(shù)據(jù)而不僅是樣本的方法還是將他的生命延長(zhǎng)了好幾年。