主題時間線 · 模型
Gemini 跨來源、跨日期追蹤 Gemini 的公開情報與主編判讀。
歷史關鍵字搜尋:173 筆去重結果(不限本期) 第 6/9 頁
為什麼與主題統計筆數不同? 主題統計比對原始資料與中文判讀中的主題別名;下方搜尋另含原文節錄,並搜尋全部可用歷史。比對文字及日期範圍不同,筆數可能不同。
2026-08-28 星期五
Google @Google
Google 宣布 Gemini Omni 1.1 Flash 已開始在 Google AI Studio、Flow by Google,以及 Gemini Enterprise Agent Platform 推出。Google 也表示,scene extension 功能已在全球開放給 Gemini App 的 Google AI Plus、Pro、Ultra 訂閱戶使用。這則貼文只說明上線管道與訂閱可用性,沒有提供模型能力評測、價格或地區例外細節。
一龍馬判讀 Google 把同一項多模態能力放進開發者工具、創作工具與企業代理平台,代表它希望從原型開發到企業部署都留在自家生態系。使用者仍需確認實際配額、資料治理與商用授權條款,不能只看「已推出」就假設可立即大規模上線。
比對原文節錄 R to @Google: Gemini Omni 1.1 Flash is rolling out now in @GoogleAIStudio, @FlowByGoogle, and the Gemini Enterprise Agen…
Google AI @GoogleAI
貼文列出 4K upscaling、首尾影格控制、快速 360p 草稿,以及從 Veo 移植的創作控制;最大更新是場景延展可參考原影片 10 秒脈絡,相較貼文所稱 Veo 的 1 秒增加許多。Google 主張這能帶來更一致、可控且連貫的長段敘事,但貼文沒有提供評測方法、開放範圍或價格。
一龍馬判讀 影片生成競爭正從單段生成走向可編輯、可延展的製作流程,創作者與影像工具商會直接受影響;但一致性與畫質仍需看實際樣本與第三方測試,不能只依官方展示判斷。
比對原文節錄 Meet Gemini Omni 1.1 Flash ⚡️ Our newest multimodal model for video generation and editing.
Google @Google
貼文列出的更新包含延展場景、指定鏡頭起始與結束畫面、加入影片輸入參考、將喜歡的片段升頻到 4K,以及用 360p 快速測試構想。這是產品功能公告,來源未提供模型架構、開放方式、價格或基準測試。
一龍馬判讀 Google 正把影片生成從單次出片推向可編輯、可迭代、可由開發者整合的工具鏈;採用者需要等文件與實測確認控制精度、成本與內容安全限制。
比對原文節錄 RT by @GoogleDeepMind: Gemini Omni 1.1 Flash is our newest multimodal model for video generation and editing.
Google DeepMind
Google DeepMind 宣布試辦其稱為全球首個針對專有前沿模型的雙盲 AI 評測,目標是降低 benchmark contamination,也就是模型事先看過測驗題而讓分數失真的問題。Google 將與 Singapore AI Safety Institute、OpenMined、AVERI、MLCommons 合作,把 Gemini Flash Lite 放進隱私保護、加密安全的環境中,對機密 benchmark 測試。官方說法強調外部評測題目被限制在「cryptographic box」內,不能被模型後續拿去最佳化;摘錄未揭露完整方法、評測集內容或結果。
一龍馬判讀 如果流程可被獨立審查,會讓專有模型評測比單純公布榜單更可信;限制是目前仍在試辦階段,且可信度取決於第三方能否驗證環境與程序。
比對原文節錄 …AI evaluations — Google DeepMind Skip to main content Explore our next generation AI systems Explore models Gemini Gemin
Pydantic @Pydantic
官方稱支援 OpenAI Realtime、Azure、Gemini Live 與 xAI Grok Voice 的 speech-to-speech。貼文未說明延遲、轉接架構、價格、錯誤處理或語音資料保存方式。
一龍馬判讀 這把文字型 agent 框架往電話客服、語音助理與現場作業支援推進;但語音 agent 會更直接面對即時性、隱私與誤操作風險。
比對原文節錄 Your Pydantic AI agents just gained a voice.
Hacker News
Integrity Bench 主打衡量大型語言模型的「信心錯誤」:它要求模型回答問題時同時給出 0–100% 信心,再用 Brier score 計算校準程度,並把 Integrity Score 定義為 100 − 400 × Brier。頁面聲稱前沿 AI 普遍對自身能力過度自信,榜單中 Muse Spark 1.2 以 28.1±3.2 排第一,Claude Opus 5 為 16.1±3.8,GPT-5.5 為 -11.5±4.5,GPT-4o 則為 -213.9±4.5;同時另列整體準確率。它也展示例子,例如 Gemini 3.7 Flash 在椅子計數題答 37、正解 54,卻給 70% 信心;Grok 4.6 答 7、正解 6,給 85% 信心。頁面說 benchmark 有 10 個領域、題目盡量保密,只公開少量例題,因此外部無法完整複核題庫代表性。
一龍馬判讀 這類評測把焦點從「答對多少」拉到「錯的時候知不知道自己可能錯」,對客服、醫療、法務等高風險部署更貼近實務風險。限制是題庫私有且分數為自訂指標,採購或研究時不能只看排名,仍要看任務相似度與可重現性。
比對原文節錄 IntegrityBench Integrity Bench Frontier AI seems broadly overconfident about its own ability.
Hacker News
頁面列出的核心模型包括 Gemini Omni(以任意真實或生成參考輸入建立、編輯影片,主打多模態與對話式編輯)、Nano Banana(圖片生成與精準編輯,強調主體一致性與文字渲染)、Veo 3.1(影片生成,強調原生音訊、物理感、寫實與提示遵循)。Flow 的能力分成 Plan、Create、Refine,並內建或開放工具如影片尺寸調整、圖層式影像編輯、Storyboard Studio、Shader Effects、Mockup、Character X-ray 等;頁面也明說功能會依 Google AI 訂閱層級、平台與地區而異,且限 18 歲以上。
一龍馬判讀 Google 正把模型能力包成創作者工作流,而不只是單一文字轉影片功能,對廣告、短影音、設計打樣與分鏡流程會更直接。實務限制在於訂閱、地區與平台差異,團隊導入前要確認可用功能與授權條件。
比對原文節錄 Google Flow - AI Creative Studio for Video, Images & Custom Tools Overview Models Capabilities Tools Flow Sessions Prici…
Google @Google
Google 稱這段影片可用來對齊動作、視覺脈絡與場景中的角色一致性。貼文沒有展示輸出範例、限制條件或失敗案例,因此只能確認 Google 宣稱支援短影片參考輸入。
一龍馬判讀 影片參考若能穩定控制動作與角色一致性,會改善 AI 影片生成最常見的連貫性問題,對廣告、分鏡與短影音製作很有用。限制在最多 3 秒也表示它較像精準提示素材,不是長片段重製或完整影片理解的保證。
比對原文節錄 R to @Google: 📽️ Add video references in your multimodal input Drop in up to three seconds of reference video to map mo…
2026-08-27 星期四
Google DeepMind
官方文章指出,它可處理背景雜音、專業術語、口誤修正與 filler words,並提供兩種開發者介面:Live API 的 gemini -3.5-transcribe-live 用於低於一秒延遲的雙向串流,Interactions API 的 gemini -3.5-transcribe 用於預錄音訊、會議與通話紀錄,含說話者標註與逐字時間戳。Google 也稱此模型已用在 Gemini app、Android 的 Rambler,以及 macOS 上 Gemini app 的語音能力,但來源是官方部落格,未提供第三方評測。
一龍馬判讀 這讓語音代理、即時字幕、客服通話分析等應用可直接接上 Gemini API,但實際準確率、語言涵蓋與隱私風險仍需開發者自行驗證,不能只看官方宣稱。
比對原文節錄 Introducing Gemini 3.5 Transcribe Skip to main content Intelligent transcription with Gemini 3.5 Transcribe Innovation &…
Hacker News
HN 標題稱「Gemini Flash 3.7 在 OpenRouter 有 75% 折扣」,但提供的 OpenRouter models 摘錄沒有出現 Gemini Flash 3.7,也沒有 75% 折扣證據。摘錄中可確認的是 OpenRouter 模型列表列出多個 2026 年 8 月 26 日模型,例如 Qwen3.8 Flash、Meta Muse Image、Z.ai GLM 5.3 Flash;其中 GLM 5.3 Flash 標示 50% off,Wan 3.0 標示 15% off、6 hours。HN 討論沒有留言,因此無法從社群補上驗證。
一龍馬判讀 模型路由平台的價格變動會直接影響開發者的推論成本,但這筆證據不足以支持標題中的 Gemini 與 75% 折扣說法。若要採用或轉單,應回到 OpenRouter 即時頁面或 API 定價確認。
比對原文節錄 Compare AI Models: Pricing, Context & Benchmarks | OpenRouter Skip to content Search ⌘ K *]:shrink-0 [mask-image:linear-…
VoltAgent/awesome-agent-skills
README 稱收錄 1497+ 個技能,來源包含 Anthropic、Google Labs、Vercel、Stripe、Cloudflare、Netlify、Trail of Bits、Sentry、Expo、Hugging Face、Figma 等官方團隊與社群作品。專案主張自己是人工挑選、不是大量 AI 生成,並標示可搭配 Claude Code、Codex、Gemini CLI、Cursor、GitHub Copilot、Windsurf 等工具使用。從 README 來看,它比較像索引與導覽,而不是單一可執行框架;目前可見證據不足以判斷每個技能的品質、授權一致性或實際維護狀況。
一龍馬判讀 對使用 AI coding agent 的開發者來說,這類清單把分散在各工具與廠商的技能入口集中起來,可降低找範例與整合文件的成本。風險在於 curated 清單仍需逐項驗證安全性、相容性與更新頻率,不能因為收錄品牌多或星數高就直接導入生產流程。
比對原文節錄 A collection of official Agent Skills from leading development teams and the community.
Google AI @GoogleAI
Google AI 發表 Gemini 3.5 Transcribe,定位為跨 app 與裝置使用的語音轉文字模型,主打 85 種以上語言、情境感知聽寫、自動移除「um/uh」等填充詞,並能整理非結構化口語內容。貼文還稱它可結合螢幕脈絡執行語音指令,示範把雜亂語音輸入與本機檔案轉成較完整的 email 草稿。來源是產品公告,未提供錯字率、延遲、隱私處理或與既有語音模型的基準比較。
一龍馬判讀 語音輸入若能直接理解螢幕與檔案脈絡,使用者介面會從單純聽寫走向可操作的語音代理;企業導入前仍要釐清資料是否上雲、支援語言品質差異與誤執行指令風險。
比對原文節錄 Today we’re introducing Gemini 3.5 Transcribe, our latest transcription model built for incredibly precise, smart dictat…
Google @Google
使用者可用一個 prompt 建立 3D 模擬,官方建議以「show me...」開頭,並稱使用 Gemini 的 Flash 模型效果較好;貼文沒有說明這些模擬的物理正確性、可匯出格式或適用裝置限制。
一龍馬判讀 這把聊天機器人往互動式學習與快速原型工具推進,對教育、科普與概念驗證有吸引力;風險是使用者可能把視覺化的流暢度誤認為模型產生內容一定正確。
比對原文節錄 The @Gemini App can transform your questions and complex topics into custom and interactive visualizations — directly wit…
Google AI @GoogleAI
Google AI 表示,新的 Gemini 3.5 Transcribe 可在 macOS 的 Gemini app 與 Android 的 Gboard 試用,也能透過 Gemini API、Google AI Studio、Antigravity,以及 Gemini Enterprise Agent Platform 的 public preview 來開發整合。Google 也預告它將進入 Chrome 與 Gemini Enterprise for Customer Experience。貼文主要是產品可用管道與平台佈署資訊,沒有提供準確率、延遲或價格數字。
一龍馬判讀 語音轉文字能力被放進鍵盤、桌面助理、API 與企業平台,代表 Google 想把轉錄從單一工具變成基礎介面能力;採用者仍需自行驗證在台灣口音、混語與敏感資料場景下的表現。
比對原文節錄 R to @GoogleAI: — Try it out in the @Gemini app on macOS and Gboard on @Android — Build in the Gemini API via @googleaist…
Google DeepMind @GoogleDeepMind
Google DeepMind 說明 Gemini 3.5 Transcribe 的新能力,包括在嘈雜環境中更能理解複雜電話號碼、郵遞區號與訂單 ID,能移除贅詞並自動格式化文字,也支援自訂詞彙以辨識特殊姓名與產品名稱。它還宣稱可自動偵測並轉錄 85 種以上語言,現在可在 macOS 的 Gemini app 與 Android 的 Gboard 試用,開發者可從 Google AI Studio 與 Antigravity 開始。貼文沒有揭露測試基準或與前代、競品的量化比較。
一龍馬判讀 若自訂詞彙與編號辨識可靠,客服、醫療掛號、物流與企業會議記錄會少掉大量人工校稿;但多語與噪音場景最容易出現錯字或誤聽,導入前仍要用自己的資料測。
比對原文節錄 R to @GoogleDeepMind: Here’s what’s new: 🔵 It’s better at understanding complex phone numbers, postal codes, and order…
Google @Google
這代表 Transcribe 不只用於轉錄,也被放進桌面端的多功能助理互動流程。貼文沒有說明 macOS 版支援語言、帳號層級、隱私設定或檔案處理限制。
一龍馬判讀 若語音能穩定驅動桌面工作流,Gemini App 會更像作業系統旁的語音操作層;企業與專業使用者仍需要確認資料上傳、檔案權限與紀錄保存政策。
比對原文節錄 R to @Google: In the @Gemini App on macOS, you can use Gemini 3.5 Transcribe to get more done 🗣️✨ Ask Gemini to generate…
Google @Google
貼文提到「terms apply」,但沒有列出資格細節、方案內容差異或是否包含用量限制。這是一項明確鎖定美國高教族群的 AI 訂閱推廣。
一龍馬判讀 Google 正把 Gemini 以補貼方式導入學生工作流,可能影響校園內搜尋、寫作、研究與程式學習習慣;台灣讀者需注意此優惠目前貼文只寫美國符合資格學生。
比對原文節錄 R to @Google: We're offering one year of Google AI Pro at no cost for eligible college students in the U.S.
Google DeepMind @GoogleDeepMind
這則貼文只有一句公告與 thread 開頭,沒有列出語言數、錯字率、延遲、價格或可用平台等細節;相關具體功能需參照其他官方貼文或後續文件。
一龍馬判讀 語音轉文字正從單純聽寫走向可理解語意與使用者意圖的介面,但目前這筆來源不足以判斷它相對競品的實際表現或部署成本。
比對原文節錄 Gemini 3.5 Transcribe is our latest speech-to-text model for precise and intelligent transcriptions.
Google @Google
官方強調它能移除「ums」「ahs」等填充詞、處理自我修正,並捕捉使用者意圖,讓使用者更容易用語音完成任務;貼文未提供錯誤率、支援音訊長度、定價或隱私處理細節。
一龍馬判讀 這類功能會讓會議紀錄、客服、語音輸入與無障礙工具更偏向「整理過的可用文字」,但也可能改寫原始語氣與語句,對法律、醫療或訪談場景需要保留原音與編輯痕跡。
比對原文節錄 We're introducing Gemini 3.5 Transcribe, our most precise speech-to-text model yet 🔊 It turns audio into precise transc…
Google @Google
貼文稱它可以自動移除贅詞、整理語音內容,並允許使用者用語音修改、修正拼字,甚至改變寫作風格。這是 Google 對自家功能的描述,沒有提供實測準確率或支援地區。
一龍馬判讀 語音輸入正在從單純逐字稿變成「邊轉錄邊編輯」的寫作介面,對手機使用者與無障礙情境有實用價值;風險在於口語意圖被模型過度整理或誤改。
比對原文節錄 R to @Google: Gemini 3.5 Transcribe powers Rambler on @Android.