diff --git a/model_specs/dramabox.json b/model_specs/dramabox.json index ed494c8d3..3ecbe701b 100644 --- a/model_specs/dramabox.json +++ b/model_specs/dramabox.json @@ -57,7 +57,7 @@ { "name": "num_inference_steps", "type": "int", - "description": "Diffusion sampling step count; default comes from config.json, 30 in the current package.", + "description": "Diffusion sampling step count; default 30.", "required": false, "min": 1, "default": 30 @@ -65,7 +65,7 @@ { "name": "guidance_scale", "type": "float", - "description": "Classifier-free guidance scale; default comes from config.json, 2.5 in the current package. Values greater than 1 enable CFG.", + "description": "Classifier-free guidance scale; default 2.5. Values greater than 1 enable CFG.", "required": false, "min": 0.0, "default": 2.5 @@ -73,7 +73,7 @@ { "name": "spatio_temporal_guidance_scale", "type": "float", - "description": "Spatio-temporal guidance scale; default comes from config.json, 1.5 in the current package. Values greater than 0 enable STG.", + "description": "Spatio-temporal guidance scale; default 1.5. Values greater than 0 enable STG.", "required": false, "min": 0.0, "default": 1.5 @@ -81,7 +81,7 @@ { "name": "duration_scale", "type": "float", - "description": "Multiplier applied to the estimated prompt duration when duration_sec is 0; default comes from config.json, 1.1 in the current package.", + "description": "Multiplier applied to the estimated prompt duration when duration_sec is 0; default 1.1.", "required": false, "min": 0.0, "default": 1.1 @@ -89,7 +89,7 @@ { "name": "reference_duration_sec", "type": "float", - "description": "Reference voice crop/repeat duration in seconds; default comes from config.json, 10.0 in the current package.", + "description": "Reference voice crop/repeat duration in seconds; default 10.0.", "required": false, "min": 0.0, "default": 10.0 diff --git a/model_specs/fish_audio.json b/model_specs/fish_audio.json index 9a15337c7..462bb4320 100644 --- a/model_specs/fish_audio.json +++ b/model_specs/fish_audio.json @@ -29,7 +29,7 @@ { "name": "reference_text", "type": "string", - "description": "Reference transcript used with speaker reference audio.", + "description": "Reference transcript used with speaker reference audio. Required whenever the request carries inline reference audio; the model rejects the request without it.", "required": false }, { diff --git a/model_specs/outetts.json b/model_specs/outetts.json index fc8e7dedc..d8f7d44ea 100644 --- a/model_specs/outetts.json +++ b/model_specs/outetts.json @@ -107,7 +107,7 @@ { "name": "reference_text", "type": "string", - "description": "Transcript matching the reference voice audio for voice cloning.", + "description": "Transcript matching the reference voice audio for voice cloning. Required whenever reference audio is supplied; the model rejects voice cloning without it.", "required": false }, {