Re: [问卦] 戴立安民调这么浮夸 怎被吹那么高

楼主: daye2012 (大爷)   2026-09-23 14:44:35
台湾民调算是垃圾电话。正常人 90% 以上都是直接挂断。愿意耐著性子、花了5到10分钟把
整份冗长问卷听完并答完的,绝大多数都是政治狂热。加成公式直接崩盘。
隐性选民不表态,再怎么加成也是圾进,垃圾出。这种民调是业配宣传功能。
要如果用 Nate Silver 的四大模组,台式在地化改造,
一:逼问题(Leaner Question)
在美国的做法:不知道投谁,温和地逼问“那你稍微偏向谁?”
在台湾要改用“仇恨值与删除法问句”
台湾选民的特质是“我很难承认我支持谁(怕被贴标签),但我很清楚我讨厌谁”。当受访
者回答“不知道/没决定”时,访员要立刻问:“如果明天投票,你绝对‘不会’投给哪一
位候选人?”
如果他绝对不投民进党,那他的不表态份额,在模型里就要被自动归类到蓝或白。
二:大数据背景推估 Fundamentals,这部分放在最后解释
三:40,000次蒙地卡罗随机模拟
美国假设各种不表态选民的流向,跑四万次模拟得出胜率。
在台湾要加入“投票率震荡系数 The Weather & Sentiment Factor
台湾的隐性选民很容易受到选前最后 48 小时的事件爆发(王立强、周子瑜事件)影响而集
体转向,或者因为下大雨就懒得出门。
跑四万次模拟时,必须加入台湾特有的“狂热者出门率 vs 中间选民投票率变量”。
如果投票日下大雨,中间选民投票率降到 60%,狂热者 90% 出门,模拟结果会大幅倒向哪
一方?
用“投票率震荡”去跑四万次,算出来的 50/50,才会是真正考虑到台湾“西瓜效应”和“
最后关头逆转”的真实胜率。
四:机构效应修正(House Effects)
美国把偏民主党或偏共和党的民调,在模型里自动扣分或加分。
在台湾,如果一家民调的拒访率高达 85%,代表这份民调抓到的全部都是狂热者。这时候
,领先者的数据按比例“打折”(例如乘上 0.85),把被低估的对手数据回补修正。
这样弄出来的民调,不会是“蒋万安 41.7% vs 沈伯洋 40.5%”这种死板的数字。
而是“在投票率 70%下,蒋万安的胜率是 52%,沈伯洋的胜率是 48%。但如果投票日下大雨
,蒋万安的胜率会飙升到 65%。”
第二点的加权解释
台湾民调大师们最喜欢用的“多变项反复加权法(Raking)”,其加权重到多少就算“不正
确”?政大选举研究中心曾发表过论文指出:台湾民调在经过人口结构加权后,算出来的投
票率和得票率,反而常常跟现实母体拉得更远。
只要人为去调高或调低某个数字,就永远没有正确的答案。
要最逼近真实的正确调整模型,不能用“猜想”去调,而是要用“历史投票率矩阵”做动态
扣除。
第一步:把“人口结构加权”设下死限(天花板与地板)
台湾民调最常犯的错,是年轻人样本不够(例如只收到50个20岁的样本),就强行乘以 3倍
、4倍 的权重,让这50个人的意见代表200人。这在统计上叫“极端值放大”,把狂热者的
意见乘了四倍。
正确做法:必须设定“加权系数上限不能超过 1.5 倍,下限不能低于 0.6 倍”。一旦发现
某个年龄层的原始电话样本少到必须乘以 1.5 倍以上才能符合内政部人口结构时,这份民
调就应该直接作废、重新抽样,而不是硬著头皮加权。这就叫做“垃圾样本加权后还是垃圾
”。
第二步:导入“投票率权重(Likely Voter Index)”,直接对年轻人打折
年轻人不表态、投票率又低。
不能只用“内政部人口结构”来加权,必须在模型里乘上第二个矩阵——“近三届该类型选
举的年龄投票率”。
以地方九合一选举为例:20-29岁出门投票率历史平均是 55%,60-69岁长辈是 75%。
那么在模型中,当年轻人表态支持 A 候选人时,他的这一票在模型里只能算 0.55 票;而
长辈表态支持 B 候选人时,长辈的这一票算 0.75 票。
只有把“支持度”跟“出门率”乘在一起,算出来的总数才是正确的。
第三步:全台最准的民调是怎么调的?(以 2024 封关民调对答案为例)
2024 年中华民国总统大选的封关民调,最后开票出来,全台湾预测最准的机构是 联合报(
总误差仅 0.52%)、TVBS 民调中心(总误差 3.61%)。
他们为什么这么准?因为他们在最后关头的调整模型做了一件非常关键的事:“直接把未表
态率等比例剔除,重新换算 100%”。
当时很多民调(像是民众党内参求真民调)在加权模型上动了太多手脚,把年轻人、手机族
的权重调得太高,结果算出来柯文哲第二名,跟实际开票落差高达 16.15%,彻底翻车。
反观联合报与 TVBS,他们不玩花俏的“大师推估”,在完成基本的人口性别市话手机比例
微调后,直接承认那 15%~20% 的不表态者就是“未知的噪声”,直接不予以分配,直接用
剩下有表态的 80% 选民来等比例换算。这种“少做少错”的客观模型,反而完美命中了最
后由长辈和狂热者出门投出来的真实开票结果。
台湾民调的加权模型早就“走火入魔”了。 真正正确的调整,不是去通灵猜测年轻人会不
会去投票,而是“严格限制原始样本的加权倍数(不超过 1.5 倍)”,并且“老老实实地
把历史投票率当作扣分系数算进去”。只要能做到这两点,民调就不会再出现那种赢 40%
最后只赢 5% 的战略性笑话了。
以上用gemini 整理的资讯
※ 引述《omanorboyo (omanorboyo)》之铭言
: 四年前
: 台中 60.8% vs 18.2% -42.6%
: 实际 59.4% vs 38.9% -20.5%
: 台南 61.1% vs 15.7% -45.4%
: 实际 48.8% vs 43.6% -5.2%
: 高雄 59.1% vs 13.3% -45.8%
: 实际 58.1% vs 40.1% -18.0%
: 当时应该没有一家像他差距这么大
: 戴立安老师民调怎么会被吹这么高?

Links booklink

Contact Us: admin [ a t ] ucptt.com