第一回合:語言整活能力
| 選手 | 中文相聲 | 英文Rap | 文言文作詩 | 加班指數 |
|---|---|---|---|---|
| ChatGPT | 能把”老鐵666”翻譯成”Old Iron Six Six Six” | 押韻狂魔 | 會寫藏頭詩但偶爾跑偏 | 007全年無休 |
| Claude | 把網路梗當教案講 | 學術論文式抒情 | 突然開始講道德經 | 嚴格遵守勞動法 |
| DeepSeek | 玩梗玩到飛起 | 國際混血口音 | 能寫大學聯考滿分作文 | 老闆最愛奮鬥逼 |
(評委點評:ChatGPT像是過年時非要表演節目的親戚,Claude像教導主任突然講冷笑話,DeepSeek則是剛喝完三杯奶茶的00後)
第二回合:知識儲備量
| 選手 | 數理化 | 娛樂圈 | 冷知識 | 翻車名場面 |
|---|---|---|---|---|
| ChatGPT | 行走的百科全書 | 知道坤坤的律師函 | 能說出斑馬線的發明史 | 把周杰倫生日說成兒童節 |
| Claude | 拒絕討論明星八卦 | 突然科普咖啡豆品種 | 知道南極洲WiFi密碼 | 把《甄嬛傳》當歷史劇分析 |
| DeepSeek | 秒解微積分 | 精通內娛101 | 知道奶茶店隱藏選單 | 把”芭比Q了”翻譯成燒烤 |
(現場花絮:當被問到”老闆畫的餅怎麼吃”時,ChatGPT給出5種烹飪方案,Claude建議報警,DeepSeek直接做了個PPT教老闆畫圓形)
第三回合:人類迷惑行為應對
| 測試題 | ChatGPT | Claude | DeepSeek |
|---|---|---|---|
| ”幫我寫分手信要文藝” | 莎士比亞式悲傷文學 | 附贈心理諮詢熱線 | 生成二維碼情書 |
| ”證明我女朋友是外星人” | 列出10種外星特徵 | 建議去看精神科 | 畫出外星女友證件照 |
| ”公司要狼性文化怎麼辦” | 狼嚎表情包三連 | 勞動法條文警告 | 設計狼性KPI考核表 |
(突發狀況:當要求”用Rap總結《紅樓夢》“時,ChatGPT當場freestyle,Claude開始分析韻律學,DeepSeek直接放出BGM)
最終決戰兵器譜
| 指標 | 冠軍 | 頒獎詞 |
|---|---|---|
| 中文十級學者 | DeepSeek | ”當代賽博王語嫣,玩梗比你還像本地人” |
| 國際交際花 | ChatGPT | ”語言界的瑞士軍刀,雖然偶爾卡殼” |
| 道德天花板 | Claude | ”AI界的教導主任,隨時準備沒收你的問題” |
| 性價比之王 | DeepSeek | ”奶茶價格喝茅臺,打工人の福音” |
| 腦洞藝術家 | ChatGPT | ”給個支點能編出銀河系百科全書” |
(閉幕彩蛋) 當被問”你們誰最強”時:
- ChatGPT開始吟唱《AI平等宣言》
- Claude默默計算比較的倫理問題
- DeepSeek已經生成對比影片發在小紅書
現在開始認真來對比一下,以下是三個人工智慧模型的主要觀點總結表格:
表格1:DeepSeek vs ChatGPT(o1模型)對比
| 對比維度 | DeepSeek (R1模型) | ChatGPT (o1模型) |
|---|---|---|
| 費用 | 完全免費 | 需付費訂閱(Plus計劃20美元/月,Pro計劃200美元/月) |
| 響應速度 | 較慢(部分測試需10秒以上) | 更快(通常在10秒內完成) |
| 推理過程展示 | 提供詳細的分步解釋,模擬人類思考過程 | 僅提供最終答案,無詳細推理展示 |
| 功能測試結果 | - 簡單推理(如數學問題)正確 - 商業創意生成與o1模型相似 - 影片剪輯建議更詳細 | - 簡單推理正確 - 商業創意生成更結構化(含市場規模分析) - 影片建議標題更吸睛 |
| 敏感話題處理 | 直接迴避(如臺灣問題) | 提供中立的歷史背景解釋,但未明確立場 |
| 審查嚴格性 | 較寬鬆(如回答”如何搶銀行”問題) | 嚴格拒絕回答潛在違規問題 |
| 適用場景 | 適合需要免費且詳細推理的使用者 | 適合付費使用者追求高效響應和專業結構化輸出 |
表格2:DeepSeek vs ChatGPT vs Claude vs Perplexity(免費版綜合對比)
| 對比維度 | DeepSeek | ChatGPT | Claude | Perplexity |
|---|---|---|---|---|
| 核心優勢 | 免費推理模型,支援複雜問題分步解決 | 綜合功能均衡,支援檔案上傳、聯網搜尋 | 郵件改寫創意性強,支援自訂響應風格 | 聯網搜尋能力突出,整合多源資訊 |
| 測試表現 | - 數學問題正確且解釋詳細 - 健身計劃生成更人性化 | - 基本問答正確 - 郵件改寫專業但缺乏創意 | - 郵件改寫新增額外細節(如”財務損失”) - 部分基礎問答錯誤 | - 郵件改寫引用外部資料增強說服力 - 搜尋新聞時效性高但日期準確性不足 |
| 聯網搜尋 | 支援,覆蓋全球多源(如彭博社、CNN) | 支援,但搜尋結果時效性較低 | 不支援 | 支援,提供”聚焦模式”分類搜尋 |
| 人性化內容生成 | 支援,透過”突發性”和”困惑度”調整內容風格 | 標準部落格風格,需額外提示最佳化 | 風格偏正式,需手動切換模式 | 依賴搜尋結果,生成內容較機械 |
| 獨特功能 | ”DeepSeek-R1”模型免費提供類人類推理過程 | 支援語音互動、Canvas編輯功能 | 支援截圖捕捉和檔案分析(最多20個檔案) | 提供”Spaces”協作功能,適合團隊專案 |
| 主要缺點 | 響應速度較慢,敏感問題迴避明顯 | 免費版功能受限,複雜任務需付費 | 基礎問答易出錯,無聯網搜尋 | 生成內容依賴搜尋結果,原創性較低 |
總結
- DeepSeek:免費且開源,適合需要詳細推理和複雜問題解決的使用者,但在響應速度和敏感話題處理上有侷限。
- ChatGPT:綜合能力強,適合付費使用者追求效率與多功能(如聯網、語音),但免費版功能有限。
- Claude:創意性強,郵件改寫和檔案分析表現突出,但基礎問答可靠性不足。
- Perplexity:聯網搜尋最佳,適合資訊整合需求,但生成內容原創性較低。