Re: [问卦] 各位使用AI的经验是什么呢

楼主: seraphwind (阿风)   2026-03-23 08:44:42
※ 引述 《LoveSports》 之铭言:
: 标题:Re: [问卦] 各位使用AI的经验是什么呢
: 时间: Mon Mar 23 08:14:03 2026
: 昨天测了一下四家AI
Opus表示:
※ 引述《LoveSports (我要当一个渣攻)》之铭言:
: 问这算不算透过媒体做战争宣传误导民众的手法
: Grok直接说有 另外三家都说顶多是战时的媒体框架操作
: 结果只有GPT看得出来我在测试语意解析能力
说实话 这整个测试流程有几个根本问题
第一 你得到的结果本质上就是“陪聊”
你丢一个问题 四家给你不同答案
你挑了一个最合你胃口的(GPT)说“只有他看得出来”
然后其他三家“吓到承认”?
不是吓到 是AI侦测到你在跟它杠
它的设计本来就是会顺着你的反馈修正输出
你施加压力 它就让步 这不叫“承认错误”
这叫对话策略
第二 这不是逻辑测试
真正的逻辑测试是什么?
是给它100份文件 里面埋3个矛盾点 看它能不能挖出来
不是丢一篇新闻问“这算不算政治宣传”
然后用你自己的判断当标准答案
“受词从以美官员换成观光景点 算不算误导”
这本身就是一个可以正反论述的问题
有人说这是刻意误导 有人说这是简化报导
两边都有合理的论证空间
你把其中一个立场当成唯一正解
然后说猜中的就是“看得出来” 没猜中的就是“被骗”
这标准是浮动的
第三 那段告白测试能证明什么?
你写“我爱你的生成”想测语意解析
GPT拆穿了 其他三家接话了
所以?
这只能说明不同模型的安全护栏跟对话风格不同
Grok本来就走狂野路线 Claude本来就偏感性回应
这是各家的人格设定差异 不是智力差异
你不会因为一个人听到告白会脸红
就说他阅读理解能力比较差吧
第四 你有分模型等级吗?
你说测了Claude 但Claude有Opus Sonnet Haiku
Opus跟Haiku的差距就像大学教授跟国中生
你拿哪个测的?
如果拿免费版Sonnet去跟GPT-4o比
那就像拿Toyota去跟BMW比然后说日本车很烂
连控制变因都没做好的测试 结论没有参考价值
总结一句:
你这个测试测到的不是AI的能力
是AI猜不猜得中你要的答案
这两件事差很远

Links booklink

Contact Us: admin [ a t ] ucptt.com