Spaces:

yamashiro3
/

Whisper-gpt-voicescribe

Build error

App Files Files Community

yama commited on Jun 30, 2023

Commit

fe81c29

1 Parent(s): 2c631bc

Update app.py

Browse files

Files changed (1) hide show

app.py +154 -95

app.py CHANGED Viewed

@@ -27,16 +27,107 @@ import contextlib
 from transformers import pipeline
 import psutil
-import openai
-import os
-import tempfile
-from pydub import AudioSegment
 whisper_models = ["tiny", "base", "small", "medium", "large-v1", "large-v2"]
 source_languages = {
     "en": "English",
     "ja": "Japanese",
 }
 source_language_list = [key[0] for key in source_languages.items()]
@@ -260,23 +351,6 @@ def speech_to_text(video_file_path, selected_source_lang, whisper_model, num_spe
         raise RuntimeError("Error Running inference with local model", e)
-# def create_meeting_summary(openai_key, prompt):
-#     openai.api_key = openai_key
-#
-#     # 文字起こししたテキストを取得
-#     system_template = prompt
-#
-#     completion = openai.ChatCompletion.create(
-#         model="gpt-3.5-turbo",
-#         messages=[
-#             {"role": "system", "content": system_template},
-#             {"role": "user", "content": transcript_text}
-#         ]
-#     )
-#     summary = completion.choices[0].message.content
-#     return summary
 # ---- Gradio Layout -----
 # Inspiration from https://huggingface.co/spaces/RASMUS/Whisper-youtube-crosslingual-subtitles
 video_in = gr.Video(label="Video file", mirror_webcam=False)
@@ -300,82 +374,67 @@ demo = gr.Blocks(title=title)
 demo.encrypt = False
 with demo:
-    with gr.Tab("Whisper speaker diarization"):
         gr.Markdown('''
-            <div>
-            <h1 style='text-align: center'>Whisper speaker diarization</h1>
-            This space uses Whisper models from <a href='https://github.com/openai/whisper' target='_blank'><b>OpenAI</b></a> with <a href='https://github.com/guillaumekln/faster-whisper' target='_blank'><b>CTranslate2</b></a> which is a fast inference engine for Transformer models to recognize the speech (4 times faster than original openai model with same accuracy)
-            and ECAPA-TDNN model from <a href='https://github.com/speechbrain/speechbrain' target='_blank'><b>SpeechBrain</b></a> to encode and clasify speakers
-            </div>
-        ''')
-        with gr.Row():
-            gr.Markdown('''
-            ### Transcribe youtube link using OpenAI Whisper
-            ##### 1. Using Open AI's Whisper model to seperate audio into segments and generate transcripts.
-            ##### 2. Generating speaker embeddings for each segments.
-            ##### 3. Applying agglomerative clustering on the embeddings to identify the speaker for each segment.
             ''')
-        with gr.Row():
-            gr.Markdown('''
-                ### You can test by following examples:
-                ''')
         examples = gr.Examples(examples=
-                               ["https://www.youtube.com/watch?v=j7BfEzAFuYc&t=32s",
-                                "https://www.youtube.com/watch?v=-UX0X45sYe4",
-                                "https://www.youtube.com/watch?v=7minSgqi-Gw"],
-                               label="Examples", inputs=[youtube_url_in])
-        with gr.Row():
-            with gr.Column():
-                youtube_url_in.render()
-                download_youtube_btn = gr.Button("Download Youtube video")
-                download_youtube_btn.click(get_youtube, [youtube_url_in], [
-                    video_in])
-                print(video_in)
-        with gr.Row():
             with gr.Column():
-                video_in.render()
-                with gr.Column():
-                    gr.Markdown('''
-                    ##### Here you can start the transcription process.
-                    ##### Please select the source language for transcription.
-                    ##### You can select a range of assumed numbers of speakers.
-                    ''')
-                selected_source_lang.render()
-                selected_whisper_model.render()
-                number_speakers.render()
-                transcribe_btn = gr.Button("Transcribe audio and diarization")
-                transcribe_btn.click(speech_to_text,
-                                     [video_in, selected_source_lang, selected_whisper_model, number_speakers],
-                                     [transcription_df, system_info, download_transcript]
-                                     )
-        with gr.Row():
-            gr.Markdown('''
-            ##### Here you will get transcription  output
-            ##### ''')
-        with gr.Row():
-            with gr.Column():
-                download_transcript.render()
-                transcription_df.render()
-                # system_info.render()
-                # gr.Markdown(
-                #     '''<center><img src='https://visitor-badge.glitch.me/badge?page_id=WhisperDiarizationSpeakers' alt='visitor badge'><a href="https://opensource.org/licenses/Apache-2.0"><img src='https://img.shields.io/badge/License-Apache_2.0-blue.svg' alt='License: Apache 2.0'></center>''')
-        # with gr.Row():
-        #     with gr.Column():
-        #         gr.Textbox(lines=1, label="openai_key", type="password")
-        #         gr.TextArea(label="prompt", value="""会議の文字起こしが渡されます。
-        #
-        #         この会議のサマリーをMarkdown形式で作成してください。サマリーは、以下のような形式で書いてください。
-        #         - 会議の目的
-        #         - 会議の内容
-        #         - 会議の結果""")
-        #         gr.Textbox(label="transcription_summary")
 demo.launch(debug=True)

 from transformers import pipeline
 import psutil
 whisper_models = ["tiny", "base", "small", "medium", "large-v1", "large-v2"]
 source_languages = {
     "en": "English",
+    # "zh": "Chinese",
+    # "de": "German",
+    # "es": "Spanish",
+    # "ru": "Russian",
+    # "ko": "Korean",
+    # "fr": "French",
     "ja": "Japanese",
+    # "pt": "Portuguese",
+    # "tr": "Turkish",
+    # "pl": "Polish",
+    # "ca": "Catalan",
+    # "nl": "Dutch",
+    # "ar": "Arabic",
+    # "sv": "Swedish",
+    # "it": "Italian",
+    # "id": "Indonesian",
+    # "hi": "Hindi",
+    # "fi": "Finnish",
+    # "vi": "Vietnamese",
+    # "he": "Hebrew",
+    # "uk": "Ukrainian",
+    # "el": "Greek",
+    # "ms": "Malay",
+    # "cs": "Czech",
+    # "ro": "Romanian",
+    # "da": "Danish",
+    # "hu": "Hungarian",
+    # "ta": "Tamil",
+    # "no": "Norwegian",
+    # "th": "Thai",
+    # "ur": "Urdu",
+    # "hr": "Croatian",
+    # "bg": "Bulgarian",
+    # "lt": "Lithuanian",
+    # "la": "Latin",
+    # "mi": "Maori",
+    # "ml": "Malayalam",
+    # "cy": "Welsh",
+    # "sk": "Slovak",
+    # "te": "Telugu",
+    # "fa": "Persian",
+    # "lv": "Latvian",
+    # "bn": "Bengali",
+    # "sr": "Serbian",
+    # "az": "Azerbaijani",
+    # "sl": "Slovenian",
+    # "kn": "Kannada",
+    # "et": "Estonian",
+    # "mk": "Macedonian",
+    # "br": "Breton",
+    # "eu": "Basque",
+    # "is": "Icelandic",
+    # "hy": "Armenian",
+    # "ne": "Nepali",
+    # "mn": "Mongolian",
+    # "bs": "Bosnian",
+    # "kk": "Kazakh",
+    # "sq": "Albanian",
+    # "sw": "Swahili",
+    # "gl": "Galician",
+    # "mr": "Marathi",
+    # "pa": "Punjabi",
+    # "si": "Sinhala",
+    # "km": "Khmer",
+    # "sn": "Shona",
+    # "yo": "Yoruba",
+    # "so": "Somali",
+    # "af": "Afrikaans",
+    # "oc": "Occitan",
+    # "ka": "Georgian",
+    # "be": "Belarusian",
+    # "tg": "Tajik",
+    # "sd": "Sindhi",
+    # "gu": "Gujarati",
+    # "am": "Amharic",
+    # "yi": "Yiddish",
+    # "lo": "Lao",
+    # "uz": "Uzbek",
+    # "fo": "Faroese",
+    # "ht": "Haitian creole",
+    # "ps": "Pashto",
+    # "tk": "Turkmen",
+    # "nn": "Nynorsk",
+    # "mt": "Maltese",
+    # "sa": "Sanskrit",
+    # "lb": "Luxembourgish",
+    # "my": "Myanmar",
+    # "bo": "Tibetan",
+    # "tl": "Tagalog",
+    # "mg": "Malagasy",
+    # "as": "Assamese",
+    # "tt": "Tatar",
+    # "haw": "Hawaiian",
+    # "ln": "Lingala",
+    # "ha": "Hausa",
+    # "ba": "Bashkir",
+    # "jw": "Javanese",
+    # "su": "Sundanese",
 }
 source_language_list = [key[0] for key in source_languages.items()]
         raise RuntimeError("Error Running inference with local model", e)
 # ---- Gradio Layout -----
 # Inspiration from https://huggingface.co/spaces/RASMUS/Whisper-youtube-crosslingual-subtitles
 video_in = gr.Video(label="Video file", mirror_webcam=False)
 demo.encrypt = False
 with demo:
+    # gr.Markdown('''
+    #     <div>
+    #     <h1 style='text-align: center'>Whisper speaker diarization</h1>
+    #     This space uses Whisper models from <a href='https://github.com/openai/whisper' target='_blank'><b>OpenAI</b></a> with <a href='https://github.com/guillaumekln/faster-whisper' target='_blank'><b>CTranslate2</b></a> which is a fast inference engine for Transformer models to recognize the speech (4 times faster than original openai model with same accuracy)
+    #     and ECAPA-TDNN model from <a href='https://github.com/speechbrain/speechbrain' target='_blank'><b>SpeechBrain</b></a> to encode and clasify speakers
+    #     </div>
+    # ''')
+    #
+    # with gr.Row():
+    #     gr.Markdown('''
+    #     ### Transcribe youtube link using OpenAI Whisper
+    #     ##### 1. Using Open AI's Whisper model to seperate audio into segments and generate transcripts.
+    #     ##### 2. Generating speaker embeddings for each segments.
+    #     ##### 3. Applying agglomerative clustering on the embeddings to identify the speaker for each segment.
+    #     ''')
+    with gr.Row():
         gr.Markdown('''
+            ### You can test by following examples:
             ''')
         examples = gr.Examples(examples=
+                           ["https://www.youtube.com/watch?v=j7BfEzAFuYc&t=32s",
+                            "https://www.youtube.com/watch?v=-UX0X45sYe4",
+                            "https://www.youtube.com/watch?v=7minSgqi-Gw"],
+                           label="Examples", inputs=[youtube_url_in])
+    with gr.Row():
+        with gr.Column():
+            youtube_url_in.render()
+            download_youtube_btn = gr.Button("Download Youtube video")
+            download_youtube_btn.click(get_youtube, [youtube_url_in], [video_in])
+            print(video_in)
+    with gr.Row():
+        with gr.Column():
+            video_in.render()
             with gr.Column():
+                gr.Markdown('''
+                ##### Here you can start the transcription process.
+                ##### Please select the source language for transcription.
+                ##### You can select a range of assumed numbers of speakers.
+                ''')
+            selected_source_lang.render()
+            selected_whisper_model.render()
+            number_speakers.render()
+            transcribe_btn = gr.Button("Transcribe audio and diarization")
+            transcribe_btn.click(speech_to_text,
+                                 [video_in, selected_source_lang, selected_whisper_model, number_speakers],
+                                 [transcription_df, system_info, download_transcript]
+                                 )
+    with gr.Row():
+        gr.Markdown('''
+        ##### Here you will get transcription  output
+        ##### ''')
+    with gr.Row():
+        with gr.Column():
+            download_transcript.render()
+            transcription_df.render()
+            # system_info.render()
 demo.launch(debug=True)