![]()
大家好,我是忙得暈頭轉向的老章
大家非常喜愛這個Skills,問了很多我沒有考慮到但實際上這個Skills都具備的能力,比如某
![]()
文中也提到,下載視頻只是第一步,好玩的是我寫的另一個Skills(z-video-study-webpage-qwen),可以把視頻內容完整總結,做成一個網頁
網頁里包含:
本地視頻播放器
30 秒總覽
關鍵知識點 × 正確畫面
代碼 / PPT / 屏幕演示截圖
時間線
風險 / 機會矩陣
復盤問題
行動清單
![]()
可惜我實在是太忙了,只能先開源出來,然后再細致調一下,發出更多案例
![]()
本文就簡單介紹一下完整思路
說起來很簡單,skills 把本地 MP4 拆成四條線
音頻線:抽出音頻,用 Whisper 轉成全文 transcript
畫面線:按全片時長密集抽關鍵幀,每張圖都有
frame_id和時間戳直掃線:小視頻會用
video_url直接給qwen3.7-plus做一次全局視覺掃描理解線:把 transcript 片段和對應多張幀圖發給
qwen3.7-plus,讓模型輸出結構化學習結果
![]()
但實際執行,其實蠻復雜的
![]()
安裝的話,把這個Skills(tjxj/z-skills/tree/main/z-video-study-webpage-qwen)扔給你的Agent就行了,中間需要提供多模態模型的key
更具體的介紹我后天再補,這兩天實在忙崩了,大家先試試好用不好用
拜托兄弟姐妹,爺們娘們兒,您受累走個面兒,把這第一波Star帶起來,給我一些反饋
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.