<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:sy="http://purl.org/rss/1.0/modules/syndication/" xmlns:media="http://search.yahoo.com/mrss/"><channel><title>Diffusion on IT 空間</title><link>https://blog.jiatool.com/tags/Diffusion/</link><description>Recent content in Diffusion on IT 空間</description><generator>Hugo -- gohugo.io</generator><language>zh</language><managingEditor>jia@jiatool.com (Jia)</managingEditor><webMaster>jia@jiatool.com (Jia)</webMaster><copyright>&amp;copy;{year}, Jia All Rights Reserved</copyright><lastBuildDate>Sat, 07 Jun 2025 17:50:00 +0800</lastBuildDate><atom:link href="https://blog.jiatool.com/tags/Diffusion/index.xml" rel="self" type="application/rss+xml"/><item><title>Gemini Diffusion 模型開放試玩，速度快 5 倍！</title><link>https://blog.jiatool.com/posts/try_gemini_diffusion/</link><pubDate>Sat, 07 Jun 2025 17:50:00 +0800</pubDate><author>jia@jiatool.com (Jia)</author><atom:modified>Sat, 07 Jun 2025 17:50:00 +0800</atom:modified><guid>https://blog.jiatool.com/posts/try_gemini_diffusion/</guid><description>前言 Google 的 Gemini Diffusion 模型開放試玩了！✨ 它跟現在常見的文字生成模型不同，不是一個一個字逐字生成，而是像生成圖片的 Diffusion 模型，從一開始雜訊慢慢變成清晰的圖片</description><content:encoded>&lt;h2 id="前言">前言&lt;/h2>
&lt;p>Google 的 Gemini Diffusion 模型開放試玩了！✨&lt;/p>
&lt;br>
&lt;p>它跟現在常見的文字生成模型不同，不是一個一個字逐字生成，而是像生成圖片的 Diffusion 模型，從一開始雜訊慢慢變成清晰的圖片。&lt;/p>
&lt;p>Gemini Diffusion 也是，從一開始不連貫的文字，迭代逐漸變通順 (但因為太快了，也看不清楚🤣)，蠻奇特的感覺。&lt;/p>
&lt;p>而且速度快好幾倍，我實測平均每秒大概 700～800 tokens (也有到 1100 tokens)，生成長度越長、平均速度應該越快。&lt;/p>
&lt;br>
&lt;ul>
&lt;li>試玩網站 (可能要有加入候補名單)：&lt;br />
&lt;a href="https://deepmind.google.com/frontiers/gemini-diffusion">https://deepmind.google.com/frontiers/gemini-diffusion&lt;/a>&lt;/li>
&lt;/ul>
&lt;br>
&lt;ul>
&lt;li>Gemini Diffusion 官網：&lt;a href="https://deepmind.google/models/gemini-diffusion/">https://deepmind.google/models/gemini-diffusion/&lt;/a>&lt;/li>
&lt;li>官方介紹：&lt;a href="https://blog.google/technology/google-deepmind/gemini-diffusion/">https://blog.google/technology/google-deepmind/gemini-diffusion/&lt;/a>&lt;/li>
&lt;/ul>
&lt;br>
&lt;figure >
&lt;img data-src="https://res.cloudinary.com/jiablog/try_gemini_diffusion/gemini_diffusion_website.jpg" alt="Gemini Diffusion 網站" data-caption="Gemini Diffusion 網站" src="data:image/svg+xml,%0A%3Csvg xmlns='http://www.w3.org/2000/svg' width='700px' height='' viewBox='0 0 24 24'%3E%3Cpath fill='none' d='M0 0h24v24H0V0z'/%3E%3Cpath fill='%23aaa' d='M19 3H5c-1.1 0-2 .9-2 2v14c0 1.1.9 2 2 2h14c1.1 0 2-.9 2-2V5c0-1.1-.9-2-2-2zm-1 16H6c-.55 0-1-.45-1-1V6c0-.55.45-1 1-1h12c.55 0 1 .45 1 1v12c0 .55-.45 1-1 1zm-4.44-6.19l-2.35 3.02-1.56-1.88c-.2-.25-.58-.24-.78.01l-1.74 2.23c-.26.33-.02.81.39.81h8.98c.41 0 .65-.47.4-.8l-2.55-3.39c-.19-.26-.59-.26-.79 0z'/%3E%3C/svg%3E" class="lazyload" style="width:700px;height:;"/>
&lt;figcaption style="text-align: center;">
Gemini Diffusion 網站
&lt;/figcaption>
&lt;/figure>
&lt;br/>
&lt;!--adsense-->
&lt;h2 id="gemini-diffusion-簡介">Gemini Diffusion 簡介&lt;/h2>
&lt;p>Gemini Diffusion 與目前一般主流的 LLM 模型架構，在生成方式、訓練方式上有很大的不同。&lt;/p>
&lt;p>Autoregressive Language Model (自回歸模型，例如 GPT、Gemini 系列) 是以序列的方式生成資料，一次只能生成一個 token，也因此難以並行處理。&lt;/p>
&lt;p>而 Diffusion Model (擴散模型) 是從隨機雜訊逐漸「去噪」回清晰的資料，目前主力在圖片生成方面 (例如 DALL·E、Stable Diffusion)，但 Diffusion 模型最初是為連續數據 (如圖片) 設計的，文字是離散的數據，因此 Diffusion 模型在文字生成方面效果、成熟度還不如自回歸模型。&lt;/p>
&lt;br/>
&lt;p>Google 號稱跟 Gemini 2.0 Flash-Lite 相比，可以提升到 5 倍速度。&lt;/p>
&lt;p>官方展示影片：&lt;br />
&lt;video controls muted loop width="1920" height="1080" autoplay>&lt;br />
&lt;source src="https://deepmind.google/api/blob/website/media/gemini-diffusion__example-1.mp4" type="video/mp4">&lt;br />
&lt;/video>&lt;/p>
&lt;br/>
&lt;p>但相比主流的自回歸模型，Diffusion 模型用在文字生成方面，表現還是略微遜色。&lt;/p>
&lt;p>目前 Gemini Diffusion 大約同等於 Gemini 2.0 Flash-Lite 的分數：&lt;/p>
&lt;figure >
&lt;img data-src="https://res.cloudinary.com/jiablog/try_gemini_diffusion/gemini_diffusion_benchmark.jpg" alt="Playground - Benchmark" data-caption="Playground - Benchmark" src="data:image/svg+xml,%0A%3Csvg xmlns='http://www.w3.org/2000/svg' width='450px' height='' viewBox='0 0 24 24'%3E%3Cpath fill='none' d='M0 0h24v24H0V0z'/%3E%3Cpath fill='%23aaa' d='M19 3H5c-1.1 0-2 .9-2 2v14c0 1.1.9 2 2 2h14c1.1 0 2-.9 2-2V5c0-1.1-.9-2-2-2zm-1 16H6c-.55 0-1-.45-1-1V6c0-.55.45-1 1-1h12c.55 0 1 .45 1 1v12c0 .55-.45 1-1 1zm-4.44-6.19l-2.35 3.02-1.56-1.88c-.2-.25-.58-.24-.78.01l-1.74 2.23c-.26.33-.02.81.39.81h8.98c.41 0 .65-.47.4-.8l-2.55-3.39c-.19-.26-.59-.26-.79 0z'/%3E%3C/svg%3E" class="lazyload" style="width:450px;height:;"/>
&lt;figcaption style="text-align: center;">
Playground - Benchmark
&lt;/figcaption>
&lt;/figure>
&lt;br/>
&lt;h2 id="試玩網站">試玩網站&lt;/h2>
&lt;p>Gemini Diffusion 試玩網站提供兩種介面 (頁面右上角)：&lt;/p>
&lt;ul>
&lt;li>Playground&lt;/li>
&lt;li>Instant edit&lt;/li>
&lt;/ul>
&lt;br/>
&lt;figure >
&lt;img data-src="https://res.cloudinary.com/jiablog/try_gemini_diffusion/gemini_diffusion_playground.jpg" alt="Gemini Diffusion 試玩網站" data-caption="Gemini Diffusion 試玩網站" src="data:image/svg+xml,%0A%3Csvg xmlns='http://www.w3.org/2000/svg' width='800px' height='' viewBox='0 0 24 24'%3E%3Cpath fill='none' d='M0 0h24v24H0V0z'/%3E%3Cpath fill='%23aaa' d='M19 3H5c-1.1 0-2 .9-2 2v14c0 1.1.9 2 2 2h14c1.1 0 2-.9 2-2V5c0-1.1-.9-2-2-2zm-1 16H6c-.55 0-1-.45-1-1V6c0-.55.45-1 1-1h12c.55 0 1 .45 1 1v12c0 .55-.45 1-1 1zm-4.44-6.19l-2.35 3.02-1.56-1.88c-.2-.25-.58-.24-.78.01l-1.74 2.23c-.26.33-.02.81.39.81h8.98c.41 0 .65-.47.4-.8l-2.55-3.39c-.19-.26-.59-.26-.79 0z'/%3E%3C/svg%3E" class="lazyload" style="width:800px;height:;"/>
&lt;figcaption style="text-align: center;">
Gemini Diffusion 試玩網站
&lt;/figcaption>
&lt;/figure>
&lt;br/>
&lt;h3 id="playground-介面">Playground 介面&lt;/h3>
&lt;p>就像常見的聊天介面，一問一答的方式：&lt;/p>
&lt;blockquote>
&lt;p>prompt：給我五種台灣五天自由行的詳細規劃&lt;/p>
&lt;/blockquote>
&lt;p>(3216 tokens / 3.992s = 806 tokens/s)&lt;/p>
&lt;p>完成後下方會顯示 token 總數與耗時。&lt;/p>
&lt;figure >
&lt;img data-src="https://res.cloudinary.com/jiablog/try_gemini_diffusion/playground_travel.jpg" alt="Playground - 行程規劃" data-caption="Playground - 行程規劃" src="data:image/svg+xml,%0A%3Csvg xmlns='http://www.w3.org/2000/svg' width='1000px' height='' viewBox='0 0 24 24'%3E%3Cpath fill='none' d='M0 0h24v24H0V0z'/%3E%3Cpath fill='%23aaa' d='M19 3H5c-1.1 0-2 .9-2 2v14c0 1.1.9 2 2 2h14c1.1 0 2-.9 2-2V5c0-1.1-.9-2-2-2zm-1 16H6c-.55 0-1-.45-1-1V6c0-.55.45-1 1-1h12c.55 0 1 .45 1 1v12c0 .55-.45 1-1 1zm-4.44-6.19l-2.35 3.02-1.56-1.88c-.2-.25-.58-.24-.78.01l-1.74 2.23c-.26.33-.02.81.39.81h8.98c.41 0 .65-.47.4-.8l-2.55-3.39c-.19-.26-.59-.26-.79 0z'/%3E%3C/svg%3E" class="lazyload" style="width:1000px;height:;"/>
&lt;figcaption style="text-align: center;">
Playground - 行程規劃
&lt;/figcaption>
&lt;/figure>
&lt;p>* 我也使用 Gemini 2.0 Flash-Lite 輸入一樣的 prompt，生成速度為 158 tokens/s (總共 2722 tokens)，差不多 Gemini Diffusion 就是它的 5.1 倍！&lt;br />
* 不過我不知道兩者背後的主機硬體是否相同，所以不確定這樣比較速度是否準確。&lt;/p>
&lt;br>
&lt;p>並且像是網頁的程式碼，也可以直接預覽和查看程式碼：&lt;/p>
&lt;blockquote>
&lt;p>prompt：生成一個 todo list 前端網頁&lt;/p>
&lt;/blockquote>
&lt;p>(1791 tokens / 2.522s = 711 tokens/s)&lt;/p>
&lt;figure >
&lt;img data-src="https://res.cloudinary.com/jiablog/try_gemini_diffusion/playground_html.jpg" alt="Playground - 前端網頁" data-caption="Playground - 前端網頁" src="data:image/svg+xml,%0A%3Csvg xmlns='http://www.w3.org/2000/svg' width='1000px' height='' viewBox='0 0 24 24'%3E%3Cpath fill='none' d='M0 0h24v24H0V0z'/%3E%3Cpath fill='%23aaa' d='M19 3H5c-1.1 0-2 .9-2 2v14c0 1.1.9 2 2 2h14c1.1 0 2-.9 2-2V5c0-1.1-.9-2-2-2zm-1 16H6c-.55 0-1-.45-1-1V6c0-.55.45-1 1-1h12c.55 0 1 .45 1 1v12c0 .55-.45 1-1 1zm-4.44-6.19l-2.35 3.02-1.56-1.88c-.2-.25-.58-.24-.78.01l-1.74 2.23c-.26.33-.02.81.39.81h8.98c.41 0 .65-.47.4-.8l-2.55-3.39c-.19-.26-.59-.26-.79 0z'/%3E%3C/svg%3E" class="lazyload" style="width:1000px;height:;"/>
&lt;figcaption style="text-align: center;">
Playground - 前端網頁
&lt;/figcaption>
&lt;/figure>
&lt;p>* 使用 Gemini 2.0 Flash-Lite 輸入一樣的 prompt，生成速度為 182 tokens/s (總共 2243 tokens)，是 Gemini Diffusion 的 3.9 倍。&lt;/p>
&lt;br>
&lt;p>測試寫 Python、C#、JavaScript 程式碼：&lt;/p>
&lt;blockquote>
&lt;p>prompt：使用 Python 判斷網址是否為正確格式，不要使用正則表達式，並添加至少 5 個測試案例，然後將其翻譯為 C# 與 JS。解釋其時間複雜度。&lt;/p>
&lt;/blockquote>
&lt;p>(4131 tokens / 3.646s = 1134 tokens/s)&lt;/p>
&lt;figure >
&lt;img data-src="https://res.cloudinary.com/jiablog/try_gemini_diffusion/playground_code.jpg" alt="Playground - Python、C#、JavaScript 程式碼" data-caption="Playground - Python、C#、JavaScript 程式碼" src="data:image/svg+xml,%0A%3Csvg xmlns='http://www.w3.org/2000/svg' width='1000px' height='' viewBox='0 0 24 24'%3E%3Cpath fill='none' d='M0 0h24v24H0V0z'/%3E%3Cpath fill='%23aaa' d='M19 3H5c-1.1 0-2 .9-2 2v14c0 1.1.9 2 2 2h14c1.1 0 2-.9 2-2V5c0-1.1-.9-2-2-2zm-1 16H6c-.55 0-1-.45-1-1V6c0-.55.45-1 1-1h12c.55 0 1 .45 1 1v12c0 .55-.45 1-1 1zm-4.44-6.19l-2.35 3.02-1.56-1.88c-.2-.25-.58-.24-.78.01l-1.74 2.23c-.26.33-.02.81.39.81h8.98c.41 0 .65-.47.4-.8l-2.55-3.39c-.19-.26-.59-.26-.79 0z'/%3E%3C/svg%3E" class="lazyload" style="width:1000px;height:;"/>
&lt;figcaption style="text-align: center;">
Playground - Python、C#、JavaScript 程式碼
&lt;/figcaption>
&lt;/figure>
&lt;p>* 使用 Gemini 2.0 Flash-Lite 輸入一樣的 prompt，生成速度為 164 tokens/s (總共 1608 tokens)，是 Gemini Diffusion 的 6.9 倍！&lt;/p>
&lt;br>
&lt;h3 id="instant-edit-介面">Instant edit 介面&lt;/h3>
&lt;p>有點類似很基礎的 ChatGPT Canvas 或 Gemini Canvas，可以幫你針對文章、程式碼去優化/簡化文字、更改格式、修復程式碼 bug，主要應該是 UI 上的不同。&lt;/p>
&lt;p>針對有變更的部分，它會標示出來。&lt;/p>
&lt;blockquote>
&lt;p>prompt：優化以上文章&lt;/p>
&lt;/blockquote>
&lt;figure >
&lt;img data-src="https://res.cloudinary.com/jiablog/try_gemini_diffusion/instant_edit_optimization.jpg" alt="Instant edit - 優化文章" data-caption="Instant edit - 優化文章" src="data:image/svg+xml,%0A%3Csvg xmlns='http://www.w3.org/2000/svg' width='1000px' height='' viewBox='0 0 24 24'%3E%3Cpath fill='none' d='M0 0h24v24H0V0z'/%3E%3Cpath fill='%23aaa' d='M19 3H5c-1.1 0-2 .9-2 2v14c0 1.1.9 2 2 2h14c1.1 0 2-.9 2-2V5c0-1.1-.9-2-2-2zm-1 16H6c-.55 0-1-.45-1-1V6c0-.55.45-1 1-1h12c.55 0 1 .45 1 1v12c0 .55-.45 1-1 1zm-4.44-6.19l-2.35 3.02-1.56-1.88c-.2-.25-.58-.24-.78.01l-1.74 2.23c-.26.33-.02.81.39.81h8.98c.41 0 .65-.47.4-.8l-2.55-3.39c-.19-.26-.59-.26-.79 0z'/%3E%3C/svg%3E" class="lazyload" style="width:1000px;height:;"/>
&lt;figcaption style="text-align: center;">
Instant edit - 優化文章
&lt;/figcaption>
&lt;/figure>
&lt;br/>
&lt;!--adsense-->
&lt;h2 id="結語">結語&lt;/h2>
&lt;p>因為它是一次生成大範圍的文字，所以假如只是簡短的輸出，那平均速度就很慢了：&lt;/p>
&lt;figure >
&lt;img data-src="https://res.cloudinary.com/jiablog/try_gemini_diffusion/diffusion_short_output.jpg" alt="Gemini Diffusion 簡短的輸出" data-caption="Gemini Diffusion 簡短的輸出" src="data:image/svg+xml,%0A%3Csvg xmlns='http://www.w3.org/2000/svg' width='750px' height='' viewBox='0 0 24 24'%3E%3Cpath fill='none' d='M0 0h24v24H0V0z'/%3E%3Cpath fill='%23aaa' d='M19 3H5c-1.1 0-2 .9-2 2v14c0 1.1.9 2 2 2h14c1.1 0 2-.9 2-2V5c0-1.1-.9-2-2-2zm-1 16H6c-.55 0-1-.45-1-1V6c0-.55.45-1 1-1h12c.55 0 1 .45 1 1v12c0 .55-.45 1-1 1zm-4.44-6.19l-2.35 3.02-1.56-1.88c-.2-.25-.58-.24-.78.01l-1.74 2.23c-.26.33-.02.81.39.81h8.98c.41 0 .65-.47.4-.8l-2.55-3.39c-.19-.26-.59-.26-.79 0z'/%3E%3C/svg%3E" class="lazyload" style="width:750px;height:;"/>
&lt;figcaption style="text-align: center;">
Gemini Diffusion 簡短的輸出
&lt;/figcaption>
&lt;/figure>
&lt;br/>
&lt;br/>
&lt;p>另外，&lt;br />
目前文字生成的擴散模型，商業用途開放的除了 Gemini Diffusion，應該只有 &lt;a href="https://www.inceptionlabs.ai/introducing-mercury" target="_blank" rel="noopener">
Inception 的 Mercury
&lt;/a>，在 &lt;a href="https://chat.inceptionlabs.ai/" target="_blank" rel="noopener">
Mercury Coder Playground
&lt;/a> 登入就可以玩了。&lt;/p>
&lt;p>所以假如你還沒辦法使用 Gemini Diffusion，也可以到 Mercury Coder 體驗一下 Diffusion Model 有趣的生成的效果。&lt;/p>
&lt;br/>
&lt;br/>
&lt;p>如果對於 生成式 AI 有興趣的讀者，記得追蹤『&lt;a href="https://www.facebook.com/jiatool" target="_blank" rel="noopener">
IT空間
&lt;/a>』FB 粉專，才不會錯過最新的發文通知呦~🔔&lt;/p>
&lt;br/>
&lt;br/>
&lt;hr />
&lt;p>參考：&lt;br />
&lt;a href="https://deepmind.google/models/gemini-diffusion/" target="_blank" rel="noopener">
Gemini Diffusion 官網
&lt;/a>&lt;br />
&lt;a href="https://blog.google/technology/google-deepmind/gemini-diffusion/" target="_blank" rel="noopener">
Gemini Diffusion is our new experimental research model
&lt;/a>&lt;br />
&lt;a href="https://deepmind.google.com/frontiers/gemini-diffusion" target="_blank" rel="noopener">
Gemini Diffusion 試玩網站
&lt;/a>&lt;/p>
&lt;br/>
&lt;blockquote>
&lt;p>Smart people focus on the right things.&lt;br />
有智慧的人懂得專注於對的事情。&lt;/p>
&lt;p align="right">—— 黃仁勳 (NVIDIA 共同創辦人暨執行長)&lt;/p>
&lt;/blockquote></content:encoded><dc:creator>Jia</dc:creator><media:content url="https://blog.jiatool.comimages/cover/try_gemini_diffusion.jpg" medium="image"><media:title type="html">featured image</media:title></media:content><media:content url="https://blog.jiatool.comimages/posts/try_gemini_diffusion_meta.jpg" medium="image"><media:title type="html">meta image</media:title></media:content><category>Diffusion</category><category>Gemini</category><category>Google</category><category>LLM</category><category>生成式AI</category><category>AI</category><category>人工智慧</category><category>分享</category></item></channel></rss>